コンテンツにスキップ

インシデント詳細ページ


インシデント詳細ページは、単一のインシデントを集中的に確認・処理するための完全なページです。ここでインシデントの詳細を把握し、ステータス操作を行い、関連データを分析し、チームとコラボレーションできます。

ウォールーム

インシデント詳細で Lark グループチャットまたは Tencent Meeting を作成し、関連メンバーを迅速に集めてインシデントを共同処理できます。作成後、現在のページからウォールームを確認、参加、共有できます。Lark ウォールームでは、インシデントステータスと担当者の同期にも対応しており、グループ内カードからインシデントを引き受けたりクローズしたりできます。

IM アプリの接続、ウォールームの作成と管理の詳細な手順については、ウォールームを参照してください。

Webhook の手動送信

インシデント管理権限を持つメンバーは、インシデント詳細ページ上部のWebhook を送信をクリックして、現在のインシデントの最新情報をサードパーティシステムに即時送信できます。この操作は、Open、Working、Resolved、Closed ステータスのインシデントに適用されます。

  1. 送信先で、現在のワークスペース内で有効化されている Webhook を 1 つ選択します。
  2. 送信の説明を入力します。内容は 1〜1000 文字で、改行に対応しています。
  3. 送信をクリックします。

手動送信は、Webhook の自動トリガーイベント設定や集約ウィンドウの影響を受けません。自動トリガーイベントを選択していない有効な Webhook でも手動送信できます。無効化された Webhook は選択できません。毎回 1 つの Webhook のみ選択でき、送信後に自動リトライは行われません。成功・失敗の結果は、その Webhook の送信履歴で確認できます。

注意
  • 閲覧権限のみのメンバーは Webhook を手動送信できません。
  • 同じメンバーは 5 秒以内に同じインシデントと Webhook に対して重複送信できません。
  • 手動送信は、インシデントのコラボレーション記録やアクティビティタイムラインには書き込まれません。

Webhook の設定、リクエストプロトコル、手動送信の Payload の説明については、インシデント Webhook プッシュを参照してください。

上部概要

インシデント詳細ページの上部には、インシデントのコア情報が表示されます。内容は以下のとおりです。

  • インシデントレベル:P0、P1 など。モニターのトリガー時に指定され、変更できません。
  • ステータスと時間:現在のステータス(Open/Working/Resolved/Closed)、初回トリガー時間、インシデントの合計継続時間。
  • タイトル:インシデントの簡単な説明。
  • 担当者:現在の担当者を表示します。ここで担当者(メンバー/チーム)を手動で指定または変更できます。

ステータス遷移

  • ステータスの切り替え:現在の担当者のみがインシデントステータスの変更ドロップダウンを使用できます。ステータス変更はリアルタイムに更新され、操作タイムラインに記録されます。
  • 進行ノード:ページの右側または上部に、ステータス変更の重要なノードがタイムライン形式で表示されます。
  • ロールバック操作:担当者は Working ステータスのインシデントを Open にロールバックできます。ロールバック後、担当者は空になります。

休暇時の処理メカニズム

インシデントを引き受けているが休暇を取得する必要がある場合:

  1. アカウント設定 > ステータス > "休暇中"を選択します。
  2. システムは、このインシデントの通知を送信しなくなります。
  3. 先にインシデントを他のユーザーに引き継ぐか、エスカレーションポリシーで後続の通知先が設定されていることを確認することをお勧めします。

インシデント詳細

詳細ページに入ると、デフォルトで「インシデント詳細」タブが表示されます。

エラー分布図

直近 1 時間のこのインシデントディメンションにおけるエラー分布の棒グラフを表示します。バーをクリックすると、現在のフィルター条件を保持したままログエクスプローラーまたはトレースエクスプローラーに移動して、さらに分析できます。

異常の説明

異常の説明エリアには、インシデントで発生した元の情報が集中的に表示されます。

  • 検出ディメンション:インシデントに関連する検出ディメンション(例:host:192.168.1.1 や service:auth)を表示し、影響を受けた対象を迅速に特定します。
  • ソース:このインシデントをトリガーした特定のモニターまたはインテリジェントモニタリングルールを示し、アラートの発生源を追跡しやすくします。
  • イベント内容:元のアラート内容を表示します。通常は、モニターが異常を検出したときに記録された具体的な情報(ログ原文やメトリクス値など)です。
  • 検出メトリクス:トリガー条件の DQL クエリ文を表示します。この文を直接参照して検出ロジックを把握できます。
  • 説明:ここに手動でテキストを入力して、インシデントの補足説明を追加し、チームの理解を助けることができます。
  • 補足情報:システムまたはユーザーが追加した追加のコンテキスト。関連する変更記録やチケットリンクなどです。

操作記録

「操作記録」では、このインシデントの完全な処理の軌跡を確認できます。システムは、インシデントのトリガー、ステータス変更、レベル調整、担当者の引き継ぎ、エスカレーション通知の実行を含むすべての主要な操作を時間の降順で明確に表示し、最新の進捗をいつでも把握し、完全な処理プロセスを追跡できます。

ボット操作を非表示

ボット操作を非表示はデフォルトでオフになっており、操作記録にはメンバー操作とボット操作の両方が表示されます。オンにすると、ボット操作のみが非表示になり、メンバー操作の順序は変わりません。オフにすると、読み込み済みのボット操作がすぐに復元されます。

同じインシデントで操作記録を再度開くと、現在のスイッチの状態が保持されます。他のインシデントに切り替えると、スイッチはオフに戻ります。

注意

ボット操作を非表示はインシデントセンターにのみ適用されます。インシデントの操作記録にはこのスイッチは表示されません。

コラボレーション記録

現在の詳細ページ下部のコメント機能を使用してチームでコラボレーションできます。テキスト、リンクの追加、または添付ファイルのアップロードに対応しています。

すべてのコラボレーション内容はコラボレーション記録セクションにまとめて集約されます。システムは、インシデントのトリガー、ステータス変更、操作記録、担当者の調整、エスカレーション通知を含む完全な操作ログを自動的に記録し、明確な監査の手がかりを形成して、その後の追跡と振り返りに役立てられます。

ボットメッセージを非表示

ボットメッセージを非表示はデフォルトでオフになっており、コラボレーション記録にはメンバーメッセージ、ボット通知、ボット AI 分析がすべて表示されます。オンにすると、メンバーメッセージのみが表示されます。オフにすると、読み込み済みのボットメッセージがすぐに復元されます。

フィルタリング後も履歴が残っている場合は、さらに読み込むをクリックして表示を続けます。インシデント詳細を再度開くと、このスイッチはオフに戻ります。

注意

2 つの非表示スイッチは、現在のページの記録表示のみを調整し、元の記録を削除または変更することはありません。

インシデントメトリクス

現在の詳細ページ下部のデータで、このインシデントの周期データと累計データを確認できます。2 つのセクションに分かれています。

  • 今回のインシデント周期メトリクス:現在の周期のタイムライン(トリガー / 引き受け / 復旧 / クローズ)と、今回の応答時間(MTTA)、今回の復旧時間(MTTR)、今回の継続時間の 3 つの主要メトリクスを表示します。
  • インシデント統計メトリクス:初回トリガー時間、直近のトリガー時間、総再オープン回数、平均 MTTA、平均 MTTR を表示します。初回トリガー以降の累計で計算されます。

インシデントが再オープン(reopen)された後、今回の周期メトリクスは最新の周期データのみを表示し、統計メトリクスは累計で更新され続けます。

関連イベント

インシデント詳細ページの「関連イベント」タブでは、システムがこのインシデントに関連するすべてのモニタリングイベントを集中的に表示します。これらのイベントは同じ検出ディメンションに基づいて自動的に関連付けられ、デフォルトではインシデント発生前後の直近 2 時間のデータが表示されます。

ここでは以下を確認できます。

  • イベントの発生時刻、ソース、具体的な内容
  • イベントに関連する検出メトリクスと説明情報
  • イベントの分布状況(時間棒グラフで直感的に表示)

任意のイベントまたは分布図の時間範囲をクリックすると、現在のフィルター条件を保持したまま対応する分析ページに移動し、詳細なログ、メトリクストレンド、トレース情報をさらに確認して、インシデントの根本原因の特定や影響範囲の評価に役立てられます。

関連データ分析

インシデントの検出ディメンション(service、host、app_name など)に基づいて、システムが対応する分析ツールを自動的に読み込みます。手動での移動は不要です。

  • 検出ディメンションが service を含む場合:関連する分散型トレーシング、サービスマップ、関連ログ、分析ダッシュボードなどを表示します。
  • 検出ディメンションが host を含む場合:関連するメトリクス、ログ、プロセス、コンテナ、ネットワークなどの組み込みビューを表示します。
  • 検出ディメンションが app_name を含む場合:関連するRUM エラー、分析ダッシュボード(アプリの種類によって異なります)を表示します。
  • その他のディメンション:実際の状況に応じて対応する組み込みビューを表示します。

すべてのデータビューは、デフォルトでインシデント発生前後の直近 2 時間に焦点を当てています。分布図で影響状況をすばやく把握でき、クリックして対応するページに移動し、詳細な分析を行うこともできます。

関連情報

以下のコンテンツにも関連性があります:

フィードバック

このページは役に立ちましたか?