质量输出评估¶
质量输出评估用于检查大模型输出是否符合预期。通过配置评估规则,可以对线上模型调用或指定范围的数据执行评估,并查看评分和规则命中结果。
当前支持 Prompt Eval 和 Schema Eval 两种评估类型。
新建评估器¶
进入 Agent 监测 > 评估,点击 新建评估器。
配置以下信息:
- 选择评估类型。使用 Prompt Eval 时,可选择评估器 Skill 模板,也可描述评估目标生成配置;
- 选择评估目标类型;
- 确认评估指令、输入结构及结果类型;
- 使用测试数据试运行;
- 确认结果符合预期后发布评估器。
Prompt Eval¶
Prompt Eval 通过提示词对模型输入或输出进行判断,适用于内容质量、相关性、完整性和安全性等评估场景。
配置时,需要设置:
- 评估提示词;
- 评估结果及评分规则。
建议在提示词中明确评估目标、判断标准和返回格式,以保证评估结果稳定。
描述评估目标¶
选择 Prompt Eval 后,可以在“描述评估目标”中输入自然语言要求,生成评估配置。描述应明确评估对象、判断标准、例外情况及期望的结果类型。例如:
检查 LLM 回复是否礼貌,只评价表达方式,不评价事实准确性。返回是否通过,并说明原因。
生成后,核对目标类型、评估指令、结果类型及推荐输入,按实际需要修改。尤其检查例外条件是否准确,以及所选数据是否包含判断所需的证据。无有效评估维度的描述需要补充后重新生成。
返回上一步可以修改描述。选择平台模板时,如页面提示清空已有描述,请确认后再切换。描述生成适用于 Prompt Eval,Schema Eval 沿用对应的结构校验配置。
自定义评估输入¶
在“评估配置”的“评估输入结构”中,可以编辑传给评估器的输入模板,将说明文字与 Trace 或 Span 上下文字段组合起来。评估指令说明如何判断,输入模板决定使用哪些数据作为判断依据。
模板通过双花括号引用变量,支持字段路径、数组下标及 [*]。例如,评估根节点输入与输出时可使用:
字段路径应使用当前评估视角下可用的变量。模板需要包含有效变量,仅填写不含变量的纯文本不能进入下一步。涉及工具调用的评估,应确认模板包含判断所需的工具名称、参数、返回结果或执行状态。
在试运行结果中展开“实际评估输入”,检查变量替换后的内容是否符合预期。字段未采集时,应先检查数据采集及输入配置,不能仅依据评分判断数据完整。
手工填写的固定内容仅作为本次评估输入,不会修改原始 Trace。修改评估指令或其他关键配置后,需要重新试运行。
Schema Eval¶
Schema Eval 用于检查模型输出是否符合指定的数据结构,适用于要求模型返回 JSON 或其他结构化内容的场景。
配置时,需要设置目标 Schema。执行评估后,系统会检查输出内容的字段、类型和结构是否符合要求。
测试评估器¶
评估器发布前,选择时间范围及真实 Trace 样本执行试运行。使用自定义输入模板时,同时核对实际评估输入、结果及判断原因。
测试结果会展示评估输出、评分或结构校验结果。可以根据结果调整提示词、Schema 或判断规则,再重新测试。
当前配置成功完成试运行后,才可继续进入发布步骤。修改评估指令等关键配置会使旧试运行结果失效,需要重新运行。确认结果符合预期后,点击 发布,使评估器可以用于正式评估任务。
执行评估¶
在线评估¶
在线评估用于持续检查线上产生的模型调用数据。
选择目标应用及评估器,并配置需要评估的数据范围。任务启用后,系统会根据配置对符合条件的数据执行评估。
批量评估¶
批量评估用于评估指定时间范围或查询条件下的历史模型调用数据。
创建批量评估任务时:
- 选择目标应用;
- 设置时间范围及筛选条件;
- 选择需要使用的评估器;
- 确认并启动评估任务。
查看评估结果¶
进入评估结果页面,可以查看:
- 评估器及评估方式;
- 评估状态;
- 评分或规则校验结果;
- 模型输入和输出;
- 评估时间;
- 失败原因。
可以通过应用、评估器、评估状态和时间范围等条件筛选评估结果。
Note
评估结果取决于模型输出、评估提示词及 Schema 配置。建议在正式启用评估任务前,使用具有代表性的测试数据验证评估器效果。
人工标注¶
通过人工标注,可以结合模型输入、输出和调用链,对评估结果进行复核,并将样本加入数据集。
创建标注队列¶
根据 Trace 查询条件创建待标注队列。支持标记失败和 Agent 判断异常等数据。
队列展示待标注、已完成和跳过数量,以及当前处理进度。队列采用共享待标注列表,暂不支持负责人分配、领取和仲裁流程。
提交标注¶
在标注工作台中,查看输入、输出、调用链、工具调用、用户反馈及已有评估结果,然后填写:
| 标注内容 | 填写要求 |
|---|---|
| Pass / Fail | 必填 |
| 评分 | 可选,支持 1–5 分 |
| 问题类型 | 选择 Fail 时必填 |
| 参考答案、备注和标签 | 可选 |
填写完成后,可选择“保存并下一条”继续标注,或选择“保存并加入 Dataset”沉淀样本。
再次标注会保留历史记录。人工标注结果会标识来源,与平台评估结果及外部 Score 区分展示。
数据集¶
数据集由生产 Trace 条件和人工标注条件形成,用于集中管理样本并执行批量评估。
发起批量评估¶
在数据集中选择样本并发起批量评估。任务开始时会固定本次使用的样本范围,后续数据集成员变化不会影响正在运行的任务。
权限说明¶
评估器管理、评估执行、标注队列与数据集管理、人工标注等配置操作,统一使用 Agent 监测 > 应用配置管理 权限。该权限适用于 Agent 和 LLM 两类接入。查看相关 Trace 数据还需具备对应的数据查询权限。数据集、标注及评估结果均遵循当前工作空间和原始 Trace 的访问权限。