质量输出评估¶
质量输出评估用于检查大模型输出是否符合预期。通过配置评估规则,可以对线上模型调用或指定范围的数据执行评估,并查看评分和规则命中结果。
当前支持 Prompt Eval 和 Schema Eval 两种评估类型。
新建评估器¶
进入 Agent 监测 > 评估,点击 新建评估器。
配置以下信息:
- 选择评估器 Skill 模板;
- 选择评估目标类型;
- 配置评估输入及判断规则;
- 使用测试数据试运行;
- 确认结果符合预期后发布评估器。
Prompt Eval¶
Prompt Eval 通过提示词对模型输入或输出进行判断,适用于内容质量、相关性、完整性和安全性等评估场景。
配置时,需要设置:
- 评估提示词;
- 评估结果及评分规则。
建议在提示词中明确评估目标、判断标准和返回格式,以保证评估结果稳定。
Schema Eval¶
Schema Eval 用于检查模型输出是否符合指定的数据结构,适用于要求模型返回 JSON 或其他结构化内容的场景。
配置时,需要设置目标 Schema。执行评估后,系统会检查输出内容的字段、类型和结构是否符合要求。
测试评估器¶
评估器发布前,可以输入测试数据执行试运行。
测试结果会展示评估输出、评分或结构校验结果。可以根据结果调整提示词、Schema 或判断规则,再重新测试。
测试通过后,点击 发布,使评估器可以用于正式评估任务。
执行评估¶
在线评估¶
在线评估用于持续检查线上产生的模型调用数据。
选择目标应用及评估器,并配置需要评估的数据范围。任务启用后,系统会根据配置对符合条件的数据执行评估。
批量评估¶
批量评估用于评估指定时间范围或查询条件下的历史模型调用数据。
创建批量评估任务时:
- 选择目标应用;
- 设置时间范围及筛选条件;
- 选择需要使用的评估器;
- 确认并启动评估任务。
查看评估结果¶
进入评估结果页面,可以查看:
- 评估器及评估方式;
- 评估状态;
- 评分或规则校验结果;
- 模型输入和输出;
- 评估时间;
- 失败原因。
可以通过应用、评估器、评估状态和时间范围等条件筛选评估结果。
Note
评估结果取决于模型输出、评估提示词及 Schema 配置。建议在正式启用评估任务前,使用具有代表性的测试数据验证评估器效果。