プロセス異常検出¶
本ドキュメントの位置づけ
本書は、検出ルール設定フローの第2ステップです。設定が完了したら、メインドキュメントに戻り第3ステップ:イベント通知を続けてください。
ワークスペース内のプロセスデータを監視し、プロセスデータ内の1つ以上のフィールドタイプに対してアラートトリガー条件を設定できます。プロセス数統計を監視することで、プロセス異常(プロセス消失、プロセス数異常増加など)を迅速に検出し、システムサービスの安定性を確保します。
データ範囲:プロセス(Process)データタイプをサポートします。
特定のプロセスの実行状態を監視する必要があるユースケースに適しています。例:
- 重要なビジネスプロセス(
nginx、mysql、javaなど)が正常に動作しているか監視 - 特定のパターンでプロセス数が異常かどうか監視(ゾンビプロセスが多すぎる場合など)
- スケジュールタスクのプロセスが正常に起動したか監視
検出設定¶
検出頻度¶
検出を実行する時間間隔を設定します。
-
プリセットオプション:1分、5分(デフォルト)、10分、15分、30分、1時間
-
Crontab モード:「Crontab モードに切り替える」をクリックしてカスタム周期を設定できます。秒、分、時、日、月、週などの周期に基づいてスケジュールタスクの実行を設定できます。
検出期間¶
毎回の検出でクエリするデータの時間範囲を設定します(❗️検出期間は検出頻度以上に設定し、データの実際の報告周期と一致させる必要があります。漏検や誤検を防ぐためです)。
| 検出頻度 | 検出期間(ドロップダウンオプション) |
|---|---|
| 30s | 1m/5m/15m/30m/1h/3h |
| 1m | 1m/5m/15m/30m/1h/3h |
| 5m | 5m/15m/30m/1h/3h |
| 15m | 15m/30m/1h/3h/6h |
| 30m | 30m/1h/3h/6h |
| 1h | 1h/3h/6h/12h/24h |
| 6h | 6h/12h/24h |
| 12h | 12h/24h |
| 24h | 24h |
- カスタム形式:検出期間をカスタム入力できます。例:20m(最近20分間)、2h(最近2時間)、1d(最近1日間)。
検出オブジェクト¶
検出するプロセスデータを設定します(❗️カーディナリティの高いフィールドを検出ディメンションとして選択しないでください。設定が適切でない場合、トリガー条件が緩くなり、頻繁なアラートが発生する可能性があります。現在のクエリの最大戻り数は10万レコードです)。
現在のワークスペース内のプロセスデータにおいて、1つ以上のフィールドタイプのキーワードが一定時間内に出現する回数を設定できます。
設定要素¶
| 設定項目 | 説明 |
|---|---|
| 検出タイプ | 固定で「プロセス数統計」。条件に一致するプロセス数をカウントします |
| プロセス | 手動でプロセス名を入力します。ワイルドカードを使用したあいまい一致が可能(例:k8s*、C:\\Windows\\*)。特殊文字のエスケープは不要で、複数の値は「,」で区切ります |
| フィルター条件 | プロセスデータのフィールドをフィルタリングし、検出するデータ範囲を限定します。1つ以上のタグフィルターを追加可能。あいまい一致およびあいまい不一致のフィルター条件をサポート |
| 検出ディメンション | 設定データ内の対応する文字列型(keyword)フィールドを検出ディメンションとして選択できます。現在、最大3つのフィールドを選択可能。複数の検出ディメンションのフィールドを組み合わせて、特定の検出オブジェクトを決定します。システムは、検出オブジェクトに対応する統計指標がトリガー条件のしきい値を満たすかどうかを判断し、条件を満たすとイベントを生成します。*(例:検出ディメンションに hostとhost_ipを選択した場合、検出オブジェクトは{host: host1, host_ip: 127.0.0.1}になります。) |
トリガー条件¶
トリガー条件と重大度を設定します。クエリ結果が複数の値の場合、いずれかの値がトリガー条件を満たすとイベントが生成されます。
致命的、重大、重要、警告の4段階のしきい値と、正常回復条件を設定できます。
| レベル | 設定 | 説明 |
|---|---|---|
| 致命的 | Result >= [値] |
最高レベルのアラート。即時対応が必要 |
| 重大 | Result >= [値] |
高レベルのアラート。優先的に対応が必要 |
| 重要 | Result >= [値] |
中レベルのアラート。注意が必要 |
| 警告 | Result >= [値] |
低レベルのアラート。留意が必要 |
| 正常 | [N] 回の検出でイベント未発生 |
検出ルールが有効になった後、設定したカスタム検出回数内でデータ検出結果が異常(致命的、重大、重要、警告)から正常に回復した場合、回復アラートイベントをトリガーします。 ❗️ 回復アラートイベントはアラートミュートの制限を受けません。回復アラートイベントの検出回数が設定されていない場合、アラートイベントは回復せず、常にイベント > 未復旧イベント一覧に表示され続けます |
詳細については、イベントレベル説明を参照してください。
詳細オプション¶
連続トリガー判定¶
有効にすると、トリガー条件を継続的に満たした場合のみイベントを生成し、瞬間的な変動による誤報を防ぎます(❗️最大設定上限は10回です)。
大量アラート保護¶
システムはデフォルトで有効です。
1回の検出で生成されるアラート数が事前設定されたしきい値を超えた場合、システムは自動的にステータス別集約ポリシーに切り替わります:アラートオブジェクトを個別に処理するのではなく、イベントステータスに基づいて少数のサマリアラートを生成し、プッシュします。
これにより、通知の即時性を確保しつつ、アラートノイズを大幅に削減し、過剰なアラート処理によるタイムアウトリスクを回避できます。
このスイッチが有効な場合、後続のモニターが異常を検出した後に生成されるこのようなイベント詳細には、履歴レコードや関連イベントは表示されません。
データ欠落¶
検出指標が検出期間内でクエリ結果が空の場合の処理ポリシー:
| オプション | 説明 |
|---|---|
| イベントをトリガーしない(デフォルト) | 検出期間の時間範囲と連動し、検出指標の最近数分間のクエリ結果に基づいてイベントを生成するか判断します。データ欠落が許容されるシナリオに適しています |
| クエリ結果を0とみなす | 検出期間の時間範囲と連動し、検出指標の最近数分間のクエリ結果を0とみなして、上記のトリガー条件で設定されたしきい値と再比較し、異常イベントをトリガーするか判断します |
| カスタム値を設定してイベントをトリガー | 検出期間の値をカスタム設定し、以下のイベントタイプをそれぞれトリガーできます:データ欠落イベント、致命的イベント、重大イベント、重要イベント、警告イベント、回復イベント。 ❗️このポリシーを選択する場合、カスタムのデータ欠落時間設定は ≥ 検出期間の間隔 にすることを推奨します。設定時間 ≤ 検出期間の間隔の場合、データ欠落と異常が同時に発生する可能性があり、その場合はデータ欠落の処理結果が優先されます |
トリガー条件、データ欠落、情報生成を同時に設定する場合、以下の優先順位でトリガーを判断します:データ欠落 > トリガー条件 > 情報イベント生成。
つまり、まず欠落があるかどうかを判断し、次にしきい値をトリガーするかどうかを判断し、最後に情報イベントを生成するかどうかを判断します。
情報生成¶
このオプションを有効にすると、情報生成条件を設定する必要があります。検出結果が「致命的」「重大」「重要」「警告」のいずれのしきい値もトリガーせず、かつ情報生成条件を満たした場合にのみ、システムは「情報」イベントを書き込みます。
正常な状態変化や低優先度の情報を記録する必要があるユースケースに適しています。
後続設定¶
上記の検出設定が完了したら、以下の設定を続けてください: