跳转至

质量输出评估

质量输出评估用于检查大模型输出是否符合预期。通过配置评估规则,可以对线上模型调用或指定范围的数据执行评估,并查看评分和规则命中结果。

当前支持 Prompt EvalSchema Eval 两种评估类型。

新建评估器

进入 Agent 监测 > 评估,点击 新建评估器

配置以下信息:

  1. 选择评估器 Skill 模板;
  2. 选择评估目标类型;
  3. 配置评估输入及判断规则;
  4. 使用测试数据试运行;
  5. 确认结果符合预期后发布评估器。

Prompt Eval

Prompt Eval 通过提示词对模型输入或输出进行判断,适用于内容质量、相关性、完整性和安全性等评估场景。

配置时,需要设置:

  • 评估提示词;
  • 评估结果及评分规则。

建议在提示词中明确评估目标、判断标准和返回格式,以保证评估结果稳定。

Schema Eval

Schema Eval 用于检查模型输出是否符合指定的数据结构,适用于要求模型返回 JSON 或其他结构化内容的场景。

配置时,需要设置目标 Schema。执行评估后,系统会检查输出内容的字段、类型和结构是否符合要求。

测试评估器

评估器发布前,可以输入测试数据执行试运行。

测试结果会展示评估输出、评分或结构校验结果。可以根据结果调整提示词、Schema 或判断规则,再重新测试。

测试通过后,点击 发布,使评估器可以用于正式评估任务。

执行评估

在线评估

在线评估用于持续检查线上产生的模型调用数据。

选择目标应用及评估器,并配置需要评估的数据范围。任务启用后,系统会根据配置对符合条件的数据执行评估。

批量评估

批量评估用于评估指定时间范围或查询条件下的历史模型调用数据。

创建批量评估任务时:

  1. 选择目标应用;
  2. 设置时间范围及筛选条件;
  3. 选择需要使用的评估器;
  4. 确认并启动评估任务。

查看评估结果

进入评估结果页面,可以查看:

  • 评估器及评估方式;
  • 评估状态;
  • 评分或规则校验结果;
  • 模型输入和输出;
  • 评估时间;
  • 失败原因。

可以通过应用、评估器、评估状态和时间范围等条件筛选评估结果。

Note

评估结果取决于模型输出、评估提示词及 Schema 配置。建议在正式启用评估任务前,使用具有代表性的测试数据验证评估器效果。

文档评价

文档内容是否对您有帮助?