モニタリング¶
Guance モニタリングは、ワークスペース内のメトリクス、ログ、トレース、RUM、オブジェクトなどの観測データに対して継続的に検出を実行します。異常を検出すると、システムはイベントを生成し、関連付けられたアラートポリシーに基づいて指定された通知先に通知を送信します。また、ミュートルールで通知のノイズを制御し、SLO でサービス安定性を継続的に測定できます。
モニタリングの仕組み¶
モニタリングのプロセスは、検出、イベント、アラート、運用管理の4つのフェーズで構成されます。
- 検出の実行: モニターは設定された頻度で観測データをクエリして分析し、異常の有無を判断します。
- イベントの生成: 検出条件が満たされると、システムはイベントまたはイベントレポートを生成し、イベントセンターに一元集約します。
- アラートの送信: アラートポリシーは、イベントレベル、通知時間、集約方法などの設定に基づいて、指定された通知先にアラート情報を送信します。
- 継続的な運用管理: ミュート管理を使用して特定のシナリオでのアラート通知を制御し、SLO を通じてサービス目標とエラーバジェットを追跡します。
イベントとアラート通知
イベントは、モニターが異常を検出した後に生成されるデータレコードであり、異常状態と分析結果を保持するために使用されます。アラート通知は、アラートポリシーがイベントと通知ルールに基づいて外部に送信する情報です。ミュートや重複アラートの設定は通知の送信に影響しますが、イベントは引き続きイベントセンターで確認できます。
検出方法の選択¶
異常の判断方法と設定要件に応じて、適切なモニターを選択します。
| 検出方法 | 設定と実行方法 | ユースケース |
|---|---|---|
| ルール検出 | データ範囲、クエリ方法、検出ルールを手動で選択し、しきい値、急変、範囲、外れ値など複数の検出方法を設定できます。 | モニタリング指標、判断条件、しきい値が明確に定まっており、検出ロジックを正確に制御する必要がある場合。 |
| AI インテリジェントモニター | 自然言語の Prompt を使用して1つ以上の具体的な検出ルールを生成します。保存後は、固定されたクエリ条件、アルゴリズム、しきい値に基づいて継続的に実行されます。 | モニタリング目標と異常の兆候は明確だが、AI による具体的なルール生成の支援を希望する場合。 |
| 組み込み型インテリジェントモニタリング | ホスト、ログ、アプリケーション、RUM、Kubernetes、クラウド請求書などのタイプを選択し、システム組み込みルールを読み込んで、必要に応じてしきい値を調整します。 | 一般的なモニタリング対象と典型的な異常シナリオを迅速にカバーする必要がある場合。 |
| AI モニター | 自然言語の Prompt をそのまま継続的に有効な検出ルールとして使用します。検出のたびに AI がデータをクエリして分析し、結論と根拠を含むイベントレポートを生成します。 | ビジネスセマンティクス、複数のシグナル、コンテキストを組み合わせて総合的に判断する必要がある場合。 |
AI インテリジェントモニターと AI モニターの見分け方
AI インテリジェントモニターは Prompt を使用して固定ルールを生成し、保存後はルールに従って実行します。一方、AI モニターは Prompt をそのまま検出ルールとして使用し、検出のたびに AI が Prompt に基づいてデータを分析します。しきい値や固定された判断ロジックを明確にしたい場合は AI インテリジェントモニター、継続的なセマンティクス分析と総合判断が必要な場合は AI モニターを使用できます。
設定と処理の流れ¶
1. モニターを作成する¶
モニタリングに移動し、検出対象に応じてルール検出、インテリジェントモニタリング、または AI モニターを選択します。
- モニターテンプレートを使用して、一般的なテクノロジースタックやビジネスコンポーネントのモニターをすばやく作成します。
- カスタムモニターを作成し、クエリ、検出ルール、トリガー条件を自分で設定します。
- インテリジェントモニターを作成し、AI でルールを生成するか、組み込みルールを読み込みます。
- AI モニターを作成し、Prompt で分析対象、判断の手がかり、期待する結果を記述します。
2. アラートを設定する¶
モニターは異常の発見を担当し、アラートポリシーは通知方法の決定を担当します。モニターを作成または編集するときに、既存のアラートポリシーを関連付けることができます。また、モニタリング > アラートポリシーに移動して一元的に管理することもできます。
アラートポリシーを作成するときに、以下を設定できます。
- 処理対象のイベント範囲とレベル。
- 通知先、通知方法、通知時間。
- 重複アラート、アラートエスカレーション、アラート集約の方法。
3. イベントを表示および処理する¶
モニターが異常を検出した後は、以下の入口から結果を確認できます。
- モニターリストで関連イベントを表示をクリックし、現在のモニターが生成したイベントを確認します。
- イベントセンターに移動し、ワークスペース内のイベントを一元的にフィルタリング、分析、処理します。
- イベント詳細を開き、イベント内容、分析レポート、拡張フィールド、アラート通知、履歴などの情報を確認します。
4. アラートノイズとサービス目標を管理する¶
- ミュート管理: メンテナンスウィンドウや既知の異常が発生している期間に、モニター、アラートポリシー、タグ、またはカスタム条件でアラート通知を抑制します。
- SLO: サービス可用性またはパフォーマンス目標の達成状況を継続的に追跡し、エラーバジェットを使用してサービス安定性を評価します。
機能¶
| 機能 | 説明 |
|---|---|
| モニター | テンプレートまたはカスタムルールを使用してモニターを作成します。 |
| AI モニター | 自然言語の Prompt を使用して観測データを継続的に分析します。 |
| インテリジェントモニタリング | AI でルールを生成するか、システム組み込みルールを選択します。 |
| アラートポリシー | 通知条件、通知先、時間、エスカレーション、集約方法を設定します。 |
| 通知先管理 | メール、SMS、ロボット、Webhook などの通知チャネルを管理します。 |
| ミュート管理 | 指定した条件と時間範囲内でアラート通知を抑制します。 |
| SLO | サービス目標とエラーバジェットを設定および追跡します。 |