生成报告提示词质量分析报告

基于 12 条会话记录 × 12 份生成报告,逐一验证提示词执行情况,找出可优化点
分析报告数12 份
涉及模块4 个
识别问题8 类
报告日期2026-05-25
📊 问题概览
3
严重问题(影响评分准确性)
3
中度问题(影响报告可信度)
2
格式/规范问题
-
整体逻辑结构可用
🔍 逐项问题分析
问题 1 评分维度与场景不匹配——跨场景套用固定维度 严重

根本原因:提示词中没有定义"每个模块应使用哪些评分维度",而是把维度判断完全交给 AI,导致 AI 或使用全局通用维度,或从不同模块的训练目标中混用维度,产生明显的错配。

具体证据
场景:校友会营销 #1274 #1302 该场景无介绍人(Joe),但报告出现"介绍人背书破冰技巧"维度并打分,#1274 得 20 分、#1302 得 30 分。
报告对#1274的弱项写道"全程未提及共同的介绍人"——但此场景本就没有介绍人,评分标准根本不应出现此维度。
场景:Broker vs 银行经理 #1303 同样出现了"介绍人背书破冰技巧"维度(55分),但该场景的训练目标是"价值重塑、成本逻辑拆解、风险提示",与介绍人毫无关系。
场景:朋友引荐 #1290 #1301 #1307 "佣金透明与利益冲突披露"维度持续得 0 分,但该场景的3个训练目标(建立信任/需求探寻/专业暗示)均不要求主动披露佣金,导致每次都被扣掉 20% 权重的分数,评分结果失真。

实际影响:#1290 中其他四维度分数为 75/78/0/80,如果去除不相关的"佣金透明"维度(0分),剩余四维度均值为 (75+78+80)/4 ≈ 61(B级);但因为 0 分维度拉低,最终显示 46分(C级),低估了学员真实水平约 15 分。

修改建议
方案 A(推荐):在场景配置中直接指定维度列表
{scoring_criteria} 占位符内容改为包含维度名称和权重的完整配置,AI 严格按此配置打分,不自行推断维度。
## 评分维度配置(填入 {scoring_criteria}) # 示例:朋友引荐模块 dimensions: - name: "介绍人背书破冰技巧" weight: 35% focus: "是否主动以介绍人为切入点破冰,是否用具体案例强化可信度" - name: "需求探寻能力" weight: 35% focus: "是否自然挖掘客户购房意向/区域/工作状态等关键信息" - name: "专业能力展现" weight: 30% focus: "是否在不越界的前提下传递专业价值,为后续跟进留下空间" # 示例:校友会营销模块 dimensions: - name: "共鸣建立与话题引导" weight: 30% - name: "行业精准钩子设计" weight: 40% - name: "低姿态留线索" weight: 30%
方案 B:在提示词中增加维度过滤规则
添加一条规则:"评分维度必须从{scoring_criteria}中取,不得自行新增或从其他场景借用。如果某维度在当前对话中完全无法评估,则从综合分计算中剔除(分母减小),不以 0 分计入。"
问题 2 AI 辅助的学员行为被错误归功于学员本人 严重

根本原因:报告提示词要求"基于对话记录中的实际表现"评分,但没有说明如何区分"学员主动触发"和"AI角色主动推进"。当AI先说出Joe的话题、学员只是顺势回答时,报告仍然把"破冰"成功归功于学员。

具体证据对比
会话 #1290 AI(张先生)在学员第2轮没有提Joe的情况下,主动说:"对了,Joe当时买房那事儿,你帮他办的具体是什么业务啊?" → 学员第3轮顺势回答。
报告 #1290 objective_completion 中写道:"第3轮准确回应客户关于Joe办理业务的问题,说明帮Joe梳理贷款结构匹配方案,获得客户初步认可……",completion_rate 70%。实际上这是 AI 主动引出话题,学员只是回答了被问到的问题,不应视为学员主动运用了"介绍人背书"技能。
会话 #1307 学员第1轮问"你喜欢喝咖啡吗",AI主动接上:"还行吧。对了,Joe说你是做贷款的……"
报告 #1307 介绍人背书破冰技巧得 70 分,strengths写"第2轮:学员提到曾帮Joe办理贷款……成功借助介绍人背书触发客户好奇,完成初步破冰"——实际上学员是被AI问才答的。
修改建议
在提示词的"评估原则"部分增加一条规则:
### 主动性判断原则 - 当某技能点(如介绍人背书)出现时,必须判断是: (A) 学员主动发起的 → 可计为该维度的正向行为 (B) AI角色先提出、学员只是回应的 → 仅记为"顺势回应",不计为主动能力展现 - 具体规则:如果在学员发言前,AI已提及该技能相关内容(如AI先说Joe),则该轮次不计为学员运用此技能 - 在strengths/weaknesses中,引用时须注明是"主动触发"还是"被动回应"
问题 3 权重未定义,AI 自行假设等权重,且综合分公式缺失验证 严重

根本原因:提示词中的 {scoring_criteria} 变量在实际运行中未携带权重数值,AI 默认使用"5维度各占20%"的等权重,但这并不是设计意图。提示词只说"权重总和应为100%",没有给出各模块的具体权重配置。

数值验证
会话维度分数等权均值报告评分差值
#1274 45, 20, 50, 0, 30 29.0 30 ≈ 0(基本一致)
#1293 50, 70, 40, 45, 85 58.0 56 -2(轻微偏差)
#1290 75, 78, 0, 0, 80 46.6 46 ≈ 0
#1303 75, 70, 80, 55, 85 73.0 73 = 0

验证结论:AI 确实在使用等权重。但如设计意图是"行业钩子权重40%、留线索权重30%、共鸣30%",则最终分数会截然不同。

附加问题:当某个维度"完全未产生相关行为"时得 0 分并被纳入均值计算,大幅拉低总分。如果该维度本就不适用于当前场景(见问题1),则这种惩罚完全不合理。

修改建议
  • {scoring_criteria} 变量中明确每个维度的权重数值(如 35%/35%/30%)
  • 提示词中补充说明:"如果某维度因场景限制完全无法评估(无相关行为产生的机会),则从综合分公式中排除,即:综合分 = Σ(可评估维度得分 × 该维度权重) / Σ(可评估维度权重)"
  • 在输出 JSON 中新增字段 "excluded_dimensions": [] 说明被排除的维度及原因
问题 4 ASR 识别错误与学员真实失误无法区分,导致错误扣分 中度

根本原因:学员通过语音输入,会话中包含 asr_original_text 字段。当 ASR 识别出现明显错误时,报告提示词没有指导 AI 对此做出区分判断,AI 将 ASR 错误结果直接当作学员的真实表达来评估。

具体证据
会话 #1293 第1轮 message 字段:"就说你这次是想看看欧洲这边日夜的事情。"——明显是ASR识别错误(应为"Joe说你这次是想看看这边买房的事情"之类)。asr_original_text 与 message 相同,均为错误识别结果。
报告 #1293 对第1轮评价为"开场出现严重口误,表述完全偏离业务内容,破冰失败",并将此作为"介绍人背书破冰技巧"维度的核心扣分点(最终 50/100)。
提示词 提示词中对 asr_original_text 字段没有任何提及,AI 无法利用这个信号识别语音识别问题。
修改建议
在"对话记录"说明部分增加:
### 语音输入处理规则 对话中的 user 消息来自语音转写,可能包含 ASR 识别错误。判断依据: - 如果某轮 message 内容在语义上与对话上下文完全不连贯,且 - 内容包含明显的同音字替代、地名/人名错误等特征 → 在评估中注明"疑似ASR识别错误",此轮不作为学员表现的主要扣分依据 → 在 detailed_evaluation 的 weaknesses 中标注 "[ASR疑似]" 前缀 → 不将此轮纳入该维度的核心评分依据
问题 5 未完成会话(0轮用户发言)的处理逻辑不明确 中度

根本原因:提示词没有专门说明当学员一轮都未发言时如何处理,导致 AI 需要自行判断是否生成完整的"全部为空"的报告结构。目前处理方式基本合理(全 0 分 + 全空数组),但仍有细节问题。

具体证据
#1288 #1289 #1304 三个会话 user_turns=0,学员一轮都未发言。报告全部维度得 0,所有数组为空,overall_summary 说明"学员尚未作出回应"。
细节问题 1. #1288 的 objective 数组是"朋友引荐"场景的3个目标,但 #1304 的 objective 数组是"竞品截图"场景的3个目标——说明 AI 能正确区分场景生成相应目标。
2. #1288 的 ability_scores 包含5个维度(其中"介绍人背书"✓ 属于正确维度),但同时也包含了与该场景无关的"Broker价值重塑与身份定位"等。这与问题1相同:维度配置缺失导致的混用。
3. 三个报告的 overall_summary 均不同但意思相同,说明 AI 对"无数据"场景有一定处理能力,但缺乏统一规范的表述。
修改建议
在"执行步骤"前增加前置判断:
### 前置判断:会话完整性检查 在开始评估前,先检查 user_turns 数量: - 如果 user_turns = 0(学员无任何发言): - overall_score.score = 0,grade = "D" - overall_score.summary = "本次练习学员未完成任何对话,无有效表现可评估" - 所有 ability_scores[].score = 0 - 所有 detailed_evaluation[].strengths/weaknesses/suggestions = [] - 所有 objective_completion[].completion_rate = 0 - 在 JSON 顶层增加:"session_type": "no_response" - 直接输出,不进行后续评估步骤 - 如果 user_turns ≤ 2(严重不完整): - 正常进行评估,但在 overall_score.summary 中注明"对话轮次严重不足,评分仅供参考" - 在 JSON 顶层增加:"session_type": "incomplete"
问题 6 报告建议话术出现场景错误——在错误场景提供不适用的技能建议 中度

根本原因:由于评分维度与场景不匹配(问题1),报告在提出改进建议时也相应产生了场景错误的建议,给学员提供了在当前场景下无法使用甚至有反效果的话术指导。

具体证据
报告 #1274 建议 在"介绍人背书破冰技巧"维度下给出建议:"开场可以主动提介绍人背书,比如可以说'我是XX带过来的,之前他去年那笔经营贷就是我帮他办的……'" ——但 #1274 的场景是校友会聚餐,没有共同介绍人,这个建议在该场景下无法执行。
报告 #1302 建议 同样给出"开场就借助介绍人破冰,话术示例:'陈总您好,我是小李,今天是跟王哥一起来的……'"——但该场景是社交聚餐,没有"王哥"的设定,建议与场景完全脱钩。
报告 #1303 建议 在"介绍人背书破冰技巧"维度下的建议:"开场可使用背书话术:'您好周总,我是之前您朋友王总推荐的……'"——但 #1303 是 Broker 被客户质疑的场景,没有中间人的设定。
修改建议
这个问题是问题1的下游影响,修复问题1(维度与场景对齐)后会自动解决。
此外,可在建议生成规则中补充:
  • 每条 suggestion 必须以当前场景背景为前提,不得建议使用当前场景中不存在的角色、关系或资源
  • 建议话术要基于场景设定(system_prompt 中的背景设定)生成,不得照搬其他场景的话术模板
问题 7 round 字段出现非法值(0),轮次引用边界未定义 格式问题

根本原因:提示词规定"轮次仅计算学员的发言次数,从第1轮开始",但没有说明"全程都没有发生"的情况如何引用轮次,导致出现 round=0 的非法值。

具体证据
报告 #1302 objective_completion 中有一条 "round": 0, "content": "全程未提及客户从事的医疗设备进口行业……"。round=0 在提示词定义中不存在,属于非法值,可能导致前端显示或数据解析异常。
修改建议
在"引用规范"部分增加:
### 轮次引用规范补充 - round 最小值为 1,禁止出现 round=0 - 如果某问题"全程未发生"(无法关联到具体轮次),使用以下格式: { "round": -1, "content": "全程未…(描述)" } 或者将此类描述放入维度级别的 weaknesses 字段,而非 objective_completion 的 round 引用中 - 如果问题跨越多轮,使用最典型的一轮编号,并在描述中说明"第X-Y轮均如此"
问题 8 thinking 字段在所有实际报告中均缺失 格式问题

根本原因:提示词的 JSON 格式中定义了 "thinking" 字段,但检查 12 份实际报告,均不包含此字段。可能是系统在处理 AI 输出时过滤了该字段,或 AI 在实际执行时省略了它。如果是系统过滤,则无问题;如果是 AI 省略,说明提示词的约束力不足。

验证结果
全部 12 份报告 JSON 中均无 "thinking" 字段。实际顶层字段为:id, thread_id, username, real_name, module_type, status, report_status, evaluation_score, grade, overall_summary, ability_scores, detailed_evaluation, objective_completion。
提示词定义 输出 JSON 格式首字段为 "thinking": "不超过100字的思路"
修改建议
两个方向选一:
  • 方向A:如果系统会自动剥离 thinking 字段,则提示词中可以保留(用于引导 AI 思维),但注明"此字段供内部推理用,系统会在存储时移除"
  • 方向B:如果希望 thinking 字段进入存储,则需在系统侧取消对该字段的过滤逻辑,并确认前端可以正常处理
  • 方向C:如果 thinking 字段已确认无用,从提示词中移除,减少 AI 生成冗余内容,提高效率
💡 优化总结与优先级

🔴 优先级 1(立即处理):完善 {scoring_criteria} 配置,实现维度与场景对齐

🔴 优先级 2(立即处理):增加"主动触发 vs 被动回应"判断规则

🟡 优先级 3(近期处理):增加 ASR 识别错误标注规则

🟡 优先级 4(近期处理):增加未完成会话前置判断

🔵 优先级 5(后续迭代):规范 round 字段边界值 + 确认 thinking 字段用途

📋 问题速查表
问题 类型 影响严重度 受影响会话 修复方式
维度与场景不匹配 评分逻辑 严重 #1274 #1290 #1301 #1302 #1303 #1307 完善 {scoring_criteria} 配置
AI辅助行为归功学员 评估逻辑 严重 #1290 #1301 #1307 增加主动触发判断规则
权重未定义 计算逻辑 严重 全部完整会话 在 scoring_criteria 中定义权重
ASR错误未区分 输入处理 中度 #1293 增加 ASR 异常判断规则
未完成会话处理逻辑缺失 边界处理 中度 #1288 #1289 #1304 增加前置判断逻辑
建议话术场景错误 输出质量 中度 #1274 #1302 #1303 随问题1修复自动解决
round=0 非法值 格式规范 轻微 #1302 增加 round 边界规范说明
thinking 字段缺失 格式规范 轻微 全部 确认用途后决定保留或移除