프로세스 이상 탐지¶
현재 문서의 위치
이 문서는 탐지 규칙 구성 프로세스의 두 번째 단계입니다. 구성을 완료한 후에는 메인 문서로 돌아가 세 번째 단계: 이벤트 알림을 계속 진행하세요.
워크스페이스 내의 프로세스 데이터를 모니터링하는 데 사용됩니다. 프로세스 데이터의 하나 이상의 필드 유형에 대한 알림 트리거 조건을 구성할 수 있습니다. 프로세스 수 통계를 모니터링하여 프로세스 이상(예: 프로세스 종료, 비정상적인 프로세스 수 증가 등)을 적시에 감지하고 시스템 서비스 안정성을 보장합니다.
데이터 범위: 프로세스(Process) 데이터 유형을 지원합니다.
특정 프로세스 실행 상태를 모니터링해야 하는 시나리오에 적합합니다. 예:
- 핵심 비즈니스 프로세스(예:
nginx,mysql,java등)가 정상적으로 실행되는지 모니터링 - 특정 패턴에서 프로세스 수가 비정상적인지 모니터링(예: 좀비 프로세스 과다)
- 예약된 작업 프로세스가 정상적으로 시작되는지 모니터링
탐지 구성¶
탐지 빈도¶
탐지 실행 시간 주기를 설정합니다.
-
사전 설정 옵션: 1분, 5분(기본값), 10분, 15분, 30분, 1시간
-
Crontab 모드: "Crontab 모드로 전환"을 클릭하여 사용자 정의 주기를 구성할 수 있습니다. 초, 분, 시, 일, 월, 주 등의 주기를 기반으로 예약된 작업 실행을 구성할 수 있습니다.
탐지 구간¶
각 탐지 시 조회할 데이터 시간 범위를 설정합니다. (❗️탐지 구간은 탐지 빈도보다 크거나 같아야 하며, 데이터 실제 보고 주기와 일치해야 누락 탐지나 오탐지를 방지할 수 있습니다.)
| 탐지 빈도 | 탐지 구간 (드롭다운 선택 가능 항목) |
|---|---|
| 30초 | 1분/5분/15분/30분/1시간/3시간 |
| 1분 | 1분/5분/15분/30분/1시간/3시간 |
| 5분 | 5분/15분/30분/1시간/3시간 |
| 15분 | 15분/30분/1시간/3시간/6시간 |
| 30분 | 30분/1시간/3시간/6시간 |
| 1시간 | 1시간/3시간/6시간/12시간/24시간 |
| 6시간 | 6시간/12시간/24시간 |
| 12시간 | 12시간/24시간 |
| 24시간 | 24시간 |
- 사용자 정의 형식: 탐지 구간을 직접 입력할 수 있습니다. 예:
20m(최근 20분),2h(최근 2시간),1d(최근 1일).
탐지 대상¶
탐지할 프로세스 데이터를 설정합니다. (❗️카디널리티가 높은 필드는 탐지 차원으로 선택하지 않는 것이 좋습니다. 잘못 구성하거나 트리거 조건이 너무 느슨하면 빈번한 알림이 발생할 수 있습니다. 현재 쿼리 최대 반환 레코드 수는 10만 개입니다.)
현재 워크스페이스 내 프로세스 데이터에서 하나 이상의 필드 유형 키워드가 특정 시간 범위 내에 나타난 횟수를 설정할 수 있습니다.
구성 요소¶
| 구성 항목 | 설명 |
|---|---|
| 탐지 유형 | "프로세스 수 통계"로 고정되며, 조건과 일치하는 프로세스 수를 집계합니다. |
| 프로세스 | 프로세스 이름을 직접 입력해야 합니다. 와일드카드를 사용한 퍼지 매칭을 지원합니다(예: k8s*, C:\\Windows\\*). 특수 문자는 이스케이프할 필요가 없으며, 여러 값은 쉼표(,)로 구분합니다. |
| 필터 조건 | 프로세스 데이터의 필드를 필터링하여 탐지 데이터 범위를 제한합니다. 하나 이상의 태그 필터를 추가할 수 있습니다. 퍼지 매칭 및 퍼지 불일치 필터 조건을 지원합니다. |
| 탐지 차원 | 데이터의 문자열 유형(keyword) 필드를 탐지 차원으로 선택할 수 있습니다. 현재 최대 3개의 필드를 지원합니다. 여러 탐지 차원의 필드 조합을 통해 특정 탐지 대상을 식별할 수 있습니다. 시스템은 특정 탐지 대상에 해당하는 통계 지표가 트리거 조건의 임계값을 충족하는지 여부를 판단하고, 조건이 충족되면 이벤트를 생성합니다.(예: 탐지 차원으로 host와 host_ip를 선택하면 탐지 대상은 {host: host1, host_ip: 127.0.0.1}이 될 수 있습니다.) |
트리거 조건¶
트리거 조건 및 심각도를 구성합니다. 쿼리 결과가 여러 값인 경우, 하나의 값이라도 트리거 조건을 충족하면 이벤트가 생성됩니다.
치명적, 심각, 중요, 경고의 4단계 임계값과 정상 복구 조건을 구성할 수 있습니다.
| 등급 | 구성 | 설명 |
|---|---|---|
| 치명적 | Result >= [값] |
최고 등급 알림, 즉시 처리 필요 |
| 심각 | Result >= [값] |
높은 등급 알림, 우선 처리 필요 |
| 중요 | Result >= [값] |
중간 등급 알림, 주의 필요 |
| 경고 | Result >= [값] |
낮은 등급 알림, 확인 필요 |
| 정상 | [N]회 탐지 동안 이벤트 미발생 |
탐지 규칙이 적용된 후, 구성된 사용자 정의 탐지 횟수 내에 데이터 탐지 결과가 비정상(치명적, 심각, 중요, 경고)에서 정상으로 복구되면 복구 알림 이벤트가 트리거됩니다. ❗️ 복구 알림 이벤트는 알림 음소거의 제한을 받지 않습니다. 복구 알림 이벤트 탐지 횟수가 설정되지 않은 경우 알림 이벤트는 복구되지 않으며, 계속해서 이벤트 > 미복구 이벤트 목록에 표시됩니다. |
자세한 내용은 이벤트 등급 설명을 참조하세요.
고급 옵션¶
연속 트리거 판단¶
활성화하면 트리거 조건이 지속적으로 충족될 때만 이벤트가 생성되어 일시적인 변동으로 인한 오탐지를 방지합니다. (❗️최대 구성 상한은 10회입니다.)
대량 알림 보호¶
시스템이 기본적으로 활성화합니다.
단일 탐지에서 생성된 알림 수가 사전 설정된 임계값을 초과하면 시스템이 자동으로 상태 집계 전략으로 전환합니다. 더 이상 알림 대상을 개별적으로 처리하지 않고 이벤트 상태를 기반으로 소수의 요약 알림을 생성하여 푸시합니다.
이를 통해 알림의 적시성을 보장하면서도 알림 노이즈를 크게 줄이고, 과도한 알림 처리로 인한 시간 초과 위험을 방지할 수 있습니다.
이 스위치가 활성화되면, 이후 모니터가 이상을 감지하여 생성한 이러한 이벤트 상세에는 기록 및 관련 이벤트가 표시되지 않습니다.
데이터 단절¶
탐지 구간 내에서 탐지 지표의 쿼리 결과가 비어 있을 때의 처리 전략입니다.
| 옵션 | 설명 |
|---|---|
| 이벤트 트리거 안 함 (기본값) | 탐지 구간의 시간 범위와 연동하여, 탐지 지표의 최근 몇 분 동안의 쿼리 결과를 기반으로 이벤트 생성 여부를 판단합니다. 데이터 누락이 허용되는 시나리오에 적합합니다. |
| 쿼리 결과를 0으로 간주 | 탐지 구간의 시간 범위와 연동하여, 탐지 지표의 최근 몇 분 동안의 쿼리 결과를 0으로 간주하고, 위의 트리거 조건에 구성된 임계값과 다시 비교하여 이상 이벤트 트리거 여부를 판단합니다. |
| 사용자 정의 값 채움 및 이벤트 트리거 | 사용자 정의 탐지 구간 값을 채우고, 다음 이벤트 유형을 각각 트리거할 수 있습니다: 데이터 단절 이벤트, 치명적 이벤트, 심각 이벤트, 중요 이벤트, 경고 이벤트 및 복구 이벤트. ❗️이 전략을 선택할 때는 사용자 정의 데이터 단절 시간을 ≥ 탐지 구간 시간 간격으로 구성하는 것이 좋습니다. 구성 시간이 탐지 구간 시간 간격보다 작거나 같으면 데이터 단절과 이상이 동시에 충족될 수 있으며, 이 경우 데이터 단절 처리 결과가 우선 적용됩니다. |
트리거 조건, 데이터 단절, 정보 생성이 동시에 구성된 경우, 다음 우선순위에 따라 트리거가 판단됩니다: 데이터 단절 > 트리거 조건 > 정보 이벤트 생성.
즉, 먼저 데이터 단절 여부를 확인하고, 그 다음 임계값 트리거 여부를 확인하며, 마지막으로 정보 이벤트 생성 여부를 확인합니다.
정보 생성¶
이 옵션을 활성화하면 정보 생성 조건을 구성해야 합니다. 탐지 결과가 "치명적", "심각", "중요", "경고" 임계값 중 어느 하나도 트리거하지 않고 정보 생성 조건을 충족하는 경우에만 시스템이 "정보" 이벤트를 기록합니다.
정상 상태 변화나 낮은 우선순위 정보를 기록해야 하는 시나리오에 적합합니다.
후속 구성¶
위의 탐지 구성을 완료한 후, 다음을 계속 구성하세요.