跳转至

AI 智能监控器


AI 智能监控器支持使用自然语言描述监控需求,由 AI 一次生成监控器名称、检测规则和事件内容。生成后,您可以核对并调整配置,再保存为可持续执行的智能监控器。

Prompt 仅用于生成配置。监控器保存后,系统会按已保存的固定规则执行检测,不会在每次检测时重新理解 Prompt;后续算法或规则模板更新,也不会自动替换已保存的规则。

如需将 Prompt 直接作为检测规则,并由 AI 在每次执行时动态查询和分析观测数据,请使用 AI 监控器

工作原理

AI 智能监控器的配置和执行过程如下:

  1. 使用自然语言描述监控对象、数据范围和异常条件;
  2. AI 根据 Prompt 同时生成监控器名称、一个或多个检测规则及事件内容;
  3. 核对生成结果,按需编辑名称和事件内容、调整规则阈值或管理规则状态;
  4. 保存后,系统按当前生效的固定规则持续执行检测;
  5. 规则满足触发条件时生成事件,并按关联的告警策略进行处理。

与 AI 监控器的区别

对比项 AI 智能监控器 AI 监控器
Prompt 的作用 用于生成具体检测规则。 Prompt 本身作为持续生效的检测规则。
执行方式 保存后按固定的查询条件、算法和阈值执行。 每次执行时由 AI 根据 Prompt 查询并分析观测数据。
检测结果 规则满足条件时生成智能监控事件;同一次检测命中的规则会合并形成分析报告。 发现有数据证据支持的问题时生成结构化事件报告。
调整方式 修改规则阈值,或修改 Prompt 后重新生成配置。 直接修改 Prompt,以调整后续分析目标和判断要求。

新建监控器

进入监控 > 智能监控,点击新建监控器,选择AI 智能监控器

1. 描述监控需求

描述监控需求中输入 Prompt,建议包含以下信息:

内容 说明 示例
监控对象 需要监控的环境、服务、主机、应用或集群,并提供对应名称或标签值。 生产环境(env:prod)的订单服务(service:order-service
数据范围 需要关注的指标、日志或其他观测数据。 请求量、错误率和 P95 响应时间
异常条件 需要识别的异常表现和变化方向。 错误率升高、响应时间变慢
判断要求 已知的阈值、持续时间或对比方式。 错误率超过 5%,持续 10 分钟

以下示例中的服务名、环境、集群名称和阈值仅用于说明,请替换为当前工作空间中的实际值。

例如,监控指定服务:

监控生产环境(env:prod)的订单服务(service:order-service)。当最近 10 分钟内请求错误率超过 5%,或 P95 响应时间超过 1 秒时,判定为异常;事件内容需要说明命中的指标、当前值和阈值。

监控指定 Kubernetes 集群:

监控生产环境的 Kubernetes 集群(cluster_name:prod-cluster),范围限定为业务命名空间(namespace:order-prod)。重点关注节点 CPU、内存和磁盘使用率;当任一指标持续 10 分钟超过 85% 时,判定为异常,并在事件内容中说明异常节点、指标值和持续时间。

Prompt 应尽量明确监控对象、范围和异常表现,以减少生成结果与实际需求的偏差。

2. 生成配置

点击生成配置。生成过程中可查看进度,也可点击停止生成

生成成功后,系统会同时回填以下内容:

生成内容 说明 可调整范围
监控器名称 根据 Prompt 提炼监控器名称,最多 256 个字符。 支持编辑,保存时必填。
检测规则 根据监控目标生成一个或多个上限阈值、下限阈值或突变规则。 支持修改阈值,以及删除或恢复规则;其他规则字段只读。
事件内容 规则触发后写入事件并用于告警通知的内容。 支持编辑或清空,并沿用现有事件变量能力。

生成过程中,Prompt、名称、规则、事件内容和保存操作暂时不可修改。若生成失败、超时或主动停止,已有生成结果和用户修改会保留,可调整 Prompt 后重新生成。

3. 核对检测规则

检测规则会展示监控对象、数据范围、检测指标、计算方式、检测窗口、判断方式、阈值、单位和事件等级等信息。突变规则还会展示对比窗口、变化方向和差值方式。

为保证生成规则的结构和语义一致,除阈值外,其他规则字段均为只读。您可以:

  • 调整阈值:修改规则的异常触发边界;输入值需要符合页面展示的范围和精度要求;
  • 删除规则:将当前不需要的规则移入已删除规则,删除后该规则不参与检测;
  • 恢复规则:在已删除规则中恢复规则,恢复后保留原有结构、阈值和顺序。

监控器必须至少保留一条生效规则。当仅剩一条生效规则时,不能继续删除。

4. 配置事件与告警

核对或编辑 AI 生成的事件内容,然后按需配置:

完成配置后保存监控器。系统会保存当前 Prompt、名称、事件内容、全部规则及规则状态,并执行当前生效的规则。

修改与重新生成

打开已保存的 AI 智能监控器,可直接修改以下内容并保存:

  • 监控器名称;
  • 事件内容;
  • 规则阈值;
  • 规则的删除或恢复状态;
  • 告警策略、操作权限等公共配置。

如果修改 Prompt,需要点击重新生成,由 AI 重新生成名称、全部检测规则和事件内容。仅修改 Prompt 不会自动改变现有规则,也不能直接保存。

重新生成时请注意:

  • 如果名称、事件内容、阈值或规则状态已被手动修改,系统会提示本次重新生成将替换这些内容;
  • 重新生成成功后,名称、生效规则、已删除规则和事件内容会整体替换为本次生成结果;
  • 重新生成失败、超时或被停止时,当前有效配置和用户修改会继续保留。

管理与追溯

功能 说明
监控器列表 通过监控器类型区分 AI 智能监控器和其他智能监控器,并沿用现有搜索、筛选、启停及操作菜单。
配置版本 已保存的监控器使用保存时的规则快照,不会因 AI 生成策略或内置规则更新而自动变化。
历史记录 可查看名称、Prompt、事件内容、规则结构、阈值和规则状态的变更。历史记录仅用于查看和追溯,不会改变当前配置。
导入与导出 导出内容包含 Prompt、完整规则、规则状态、版本和公共配置;重新导入后按文件中的规则创建监控器,不会自动调用 AI 重新生成。

计费说明

AI 智能监控器每执行一次检测,会分别产生任务调用和 AI 积分用量:

计量项 计量规则
任务调用 每执行一次检测,计为 100 次任务调用。
AI 积分 按本次 AI 分析实际消耗的 Credits 扣除。

任务调用与 Credits 分别统计。

查看事件

规则满足触发条件后会生成智能监控事件。可在智能监控器列表中点击查看相关事件,进入事件详情查看事件内容、分析报告、关联视图等信息

同一次检测可能有多条规则同时触发。系统会汇总本次检测中命中的规则,并合并生成一份分析报告,而不是为每条规则分别生成报告。报告会按检测维度展示异常总结,并提供命中规则、监控信号、当前值、判定依据、异常原因及趋势等信息,便于集中判断本次异常。

其他智能监控器

主机、日志、应用、用户访问、Kubernetes 和云账单等智能监控器使用固定的内置规则,无需输入 Prompt。新建后可调整规则阈值,并可删除或恢复规则;规则的其他字段为只读。

算法改造前已经创建的存量智能监控器保留原有内容和执行方式,配置页面为只读。即使拥有管理权限,也不能修改其规则或公共配置;需要调整检测逻辑时,请新建监控器。

文档评价

文档内容是否对您有帮助?