根本原因:提示词中没有定义"每个模块应使用哪些评分维度",而是把维度判断完全交给 AI,导致 AI 或使用全局通用维度,或从不同模块的训练目标中混用维度,产生明显的错配。
实际影响:#1290 中其他四维度分数为 75/78/0/80,如果去除不相关的"佣金透明"维度(0分),剩余四维度均值为 (75+78+80)/4 ≈ 61(B级);但因为 0 分维度拉低,最终显示 46分(C级),低估了学员真实水平约 15 分。
{scoring_criteria} 占位符内容改为包含维度名称和权重的完整配置,AI 严格按此配置打分,不自行推断维度。
根本原因:报告提示词要求"基于对话记录中的实际表现"评分,但没有说明如何区分"学员主动触发"和"AI角色主动推进"。当AI先说出Joe的话题、学员只是顺势回答时,报告仍然把"破冰"成功归功于学员。
根本原因:提示词中的 {scoring_criteria} 变量在实际运行中未携带权重数值,AI 默认使用"5维度各占20%"的等权重,但这并不是设计意图。提示词只说"权重总和应为100%",没有给出各模块的具体权重配置。
| 会话 | 维度分数 | 等权均值 | 报告评分 | 差值 |
|---|---|---|---|---|
| #1274 | 45, 20, 50, 0, 30 | 29.0 | 30 | ≈ 0(基本一致) |
| #1293 | 50, 70, 40, 45, 85 | 58.0 | 56 | -2(轻微偏差) |
| #1290 | 75, 78, 0, 0, 80 | 46.6 | 46 | ≈ 0 |
| #1303 | 75, 70, 80, 55, 85 | 73.0 | 73 | = 0 |
验证结论:AI 确实在使用等权重。但如设计意图是"行业钩子权重40%、留线索权重30%、共鸣30%",则最终分数会截然不同。
附加问题:当某个维度"完全未产生相关行为"时得 0 分并被纳入均值计算,大幅拉低总分。如果该维度本就不适用于当前场景(见问题1),则这种惩罚完全不合理。
{scoring_criteria} 变量中明确每个维度的权重数值(如 35%/35%/30%)"excluded_dimensions": [] 说明被排除的维度及原因
根本原因:学员通过语音输入,会话中包含 asr_original_text 字段。当 ASR 识别出现明显错误时,报告提示词没有指导 AI 对此做出区分判断,AI 将 ASR 错误结果直接当作学员的真实表达来评估。
根本原因:提示词没有专门说明当学员一轮都未发言时如何处理,导致 AI 需要自行判断是否生成完整的"全部为空"的报告结构。目前处理方式基本合理(全 0 分 + 全空数组),但仍有细节问题。
根本原因:由于评分维度与场景不匹配(问题1),报告在提出改进建议时也相应产生了场景错误的建议,给学员提供了在当前场景下无法使用甚至有反效果的话术指导。
根本原因:提示词规定"轮次仅计算学员的发言次数,从第1轮开始",但没有说明"全程都没有发生"的情况如何引用轮次,导致出现 round=0 的非法值。
"round": 0, "content": "全程未提及客户从事的医疗设备进口行业……"。round=0 在提示词定义中不存在,属于非法值,可能导致前端显示或数据解析异常。
根本原因:提示词的 JSON 格式中定义了 "thinking" 字段,但检查 12 份实际报告,均不包含此字段。可能是系统在处理 AI 输出时过滤了该字段,或 AI 在实际执行时省略了它。如果是系统过滤,则无问题;如果是 AI 省略,说明提示词的约束力不足。
"thinking": "不超过100字的思路"。