탐지 규칙¶
시스템에는 다양한 탐지 규칙이 내장되어 있어 각종 데이터의 모니터링 요구사항을 정확히 매칭하며, 오탐과 누락 알림을 효과적으로 방지합니다.
구성 절차¶
모니터를 생성하려면 다음 순서로 구성을 완료해야 합니다.
- 규칙 유형 선택: 탐지 구성의 데이터 범위와 알고리즘 로직을 결정합니다.
- 탐지 구성: 유형별로 서로 다른 구성 항목이 대응됩니다.
- 이벤트 알림: 이벤트 제목, 내용, 연결 정보 및 데이터 공백 처리를 정의합니다.
- 알림 구성: 알림 정책과 음소거 주기를 설정합니다.
- 연동: 대시보드 연동을 구성합니다.
- 권한: 작업 권한을 설정합니다.
'탐지 구성'은 규칙 유형에 따라 달라지며, 이벤트 알림, 알림 구성, 연동, 권한은 모든 규칙 유형에서 동일한 구성 로직을 사용합니다.
규칙 유형¶
모니터링 목표에 따라 적합한 탐지 로직을 선택할 수 있습니다.
규칙 이름 |
데이터 범위 |
기본 설명 |
|---|---|---|
| 임계값 탐지 | 전체 | 설정된 임계값을 기반으로 메트릭 데이터의 이상을 탐지합니다. |
| 급변 탐지 | 메트릭(M) | 히스토리 데이터를 기반으로 메트릭의 급격한 비정상 양상을 탐지하며, 주로 비즈니스 데이터와 짧은 시간 창 시나리오에 적합합니다. |
| 구간 탐지 | 메트릭(M) | 동적 임계값 범위를 기반으로 메트릭의 이상 데이터 포인트를 탐지하며, 추세가 안정적인 시계열에 적합합니다. |
| 구간 탐지 V2 | 메트릭(M) 트레이스(T) RUM 데이터(R) |
동적 임계값 범위를 기반으로 메트릭의 이상 데이터 포인트를 탐지하며, 추세가 안정적인 시계열에 적합합니다. |
| 이상치 탐지 | 메트릭(M) | 특정 그룹의 탐지 대상에 대한 메트릭/통계 데이터에 이상치 편차가 있는지 탐지합니다. |
| 로그 탐지 | 로그(L) | 로그 데이터를 기반으로 비즈니스 애플리케이션의 이상을 탐지합니다. |
| 프로세스 이상 탐지 | 프로세스 객체(O::host_processes) |
프로세스 데이터를 주기적으로 탐지하여 프로세스 이상 상태를 파악합니다. |
| 인프라 생존 탐지 V2 | 객체(O) | 인프라 객체 데이터를 기반으로 생존 조건을 설정하여 인프라의 안정성을 모니터링합니다. |
| APM 메트릭 탐지 | 트레이스(T) | 애플리케이션 성능 모니터링(APM) 데이터를 기반으로 임계값 규칙을 설정하여 이상 상황을 탐지합니다. |
| RUM 메트릭 탐지 | RUM 데이터(R) | 실제 사용자 모니터링(RUM) 데이터를 기반으로 임계값 규칙을 설정하여 이상 상황을 탐지합니다. |
| 결합 탐지 | 전체 | 여러 모니터의 결과를 표현식을 통해 하나의 모니터로 결합하고, 결합된 결과를 기반으로 알림을 보냅니다. |
| 신서틱 테스트 이상 탐지 | 신서틱 데이터(D::유형) |
신서틱 모니터링 데이터를 기반으로 임계값 규칙을 설정하여 이상 상황을 탐지합니다. |
| 네트워크 데이터 탐지 | 네트워크(N) | 네트워크 데이터를 기반으로 임계값 규칙을 설정하여 네트워크 성능의 안정성을 탐지합니다. |
| 외부 이벤트 탐지 | 기타 | 지정된 URL 주소를 통해 타사 시스템에서 생성된 이상 이벤트 또는 기록을 POST 요청 방식으로 HTTP 서버에 전송하여 이벤트 데이터를 생성합니다. |
| 인프라 변경 탐지 | 객체(O) | 인프라 수명 주기 추적을 기반으로 다양한 변경 동작을 모니터링하고 구성 드리프트, 비인가 작업 등의 이상 상태를 정확히 식별합니다. |
| 프로그래밍 가능 탐지 | 전체 | 스크립트로 탐지 규칙을 작성하며, 규칙이 다양하고 비교적 복잡한 모니터링 시나리오에 적합합니다. |
규칙 유형을 선택하면 '탐지 구성' 모듈의 선택 가능한 매개변수가 변경됩니다. 이벤트 알림 및 이후 구성은 모든 유형에서 동일합니다.
탐지 구성¶
탐지 규칙 유형에 따라 탐지 빈도, 탐지 구간, 탐지 메트릭을 각각 구성할 수 있습니다.
탐지 규칙 유형별로 구성 방식이 크게 다르므로 해당 유형의 상세 구성 문서를 참조하세요.
데이터 대기 윈도우¶
데이터 대기 윈도우는 모든 모니터 유형에 적용됩니다. 예약 실행 시간이 되면 모니터는 먼저 지정된 시간 동안 대기한 후 모니터링 판단을 실행하여 데이터 지연으로 인한 오탐 가능성을 낮춥니다.
- 기본값은 대기 안 함입니다.
- 선택 가능한 대기 시간은 1분, 2분, 3분, 5분, 10분, 15분, 30분입니다.
- 대기 시간은 인접한 두 예약 실행 시간 사이의 간격보다 작아야 합니다. 그렇지 않으면 모니터를 저장할 수 없으며 "데이터 대기 윈도우는 모니터 실행 간격보다 작아야 합니다"라는 안내가 표시됩니다. Crontab 모드에서도 인접한 두 예약 실행 시간을 기준으로 검증합니다.
예를 들어 모니터가 10:00에 실행되도록 예약되어 있고 데이터 대기 윈도우가 5분으로 설정된 경우 작업은 약 10:05에 시작됩니다. 대기는 실행 시간만 뒤로 미루며 쿼리 시간 범위는 변경되지 않습니다. 탐지 구간이 최근 1시간인 경우에도 여전히 09:00 ~ 10:00 데이터를 쿼리합니다.
자세한 실행 로직은 모니터 내부 원리를 참조하세요.
이벤트 알림¶
모니터가 트리거될 때 생성되는 이벤트 제목, 내용, 알림 구성원 및 연동 처리를 정의합니다.
이벤트 제목¶
알림 트리거 조건의 이벤트 이름을 정의합니다. 사전 정의된 템플릿 변수를 사용할 수 있습니다.
주의
최신 버전에서는 이벤트 제목을 입력하면 모니터 이름이 동기화되어 생성됩니다. 이전 모니터에는 모니터 이름과 이벤트 제목이 일치하지 않는 경우가 있을 수 있으므로 최신 상태로 동기화할 것을 권장합니다.
이벤트 내용¶
이벤트 알림 내용을 작성합니다. 트리거 조건이 충족되면 시스템이 해당 내용을 외부로 전송합니다. 일반적으로 다음 정보가 포함됩니다.
- Markdown 형식의 본문
- 연결 링크와 템플릿 변수를 삽입할 수 있습니다.
- 고급 구성을 기반으로 연결된 로그 또는 오류 정보를 추가할 수 있습니다.
- 이벤트 내용을 수신할 대상 알림 구성원
이벤트 내용은 구문 검증 및 템플릿 미리보기를 지원하므로 저장 전에 변수와 조건 분기의 렌더링 결과를 확인할 수 있습니다.
연결 링크¶
+ 링크를 클릭하면 시스템이 현재 탐지 메트릭에 따라 이동 링크를 자동으로 생성합니다. 링크 주소에는 현재 도메인, 워크스페이스 ID, 탐지 시간 범위 ({{df_check_range_start}} ~ {{df_check_range_end}}) 및 동적 필터 조건이 포함됩니다.
| 링크 유형 | 설명 | 구성 요건 |
|---|---|---|
| 사용자 지정 링크 | 임의의 URL 지원, 템플릿 변수 사용 가능 | 전체 링크 주소를 직접 입력해야 합니다. |
| 관련 로그 보기 | 로그 탐색기로 이동 | 자동 생성, 삽입 후 필터 조건 및 시간 범위 조정 가능 |
| 관련 트레이스 보기 | 트레이스 탐색기로 이동 | 자동 생성, 현재 trace_id 또는 서비스명 자동 연결 |
| 관련 Profile 보기 | Profile 탐색기로 이동 | 자동 생성, 서비스명 및 시간 범위 자동 입력 |
| 관련 컨테이너 보기 | 컨테이너 객체 상세로 이동 | 자동 생성, 컨테이너 이름 및 호스트 태그 자동 매칭 |
| 관련 Pod 보기 | Pod 객체 상세로 이동 | 자동 생성, Pod 이름 및 네임스페이스 자동 입력 |
| 관련 프로세스 보기 | 프로세스 객체 상세로 이동 | 자동 생성, 호스트 및 프로세스 이름 자동 매칭 |
| 관련 Session 보기 | RUM 세션 리플레이로 이동 | 자동 생성, Session ID 자동 입력 |
| 관련 View 보기 | RUM View 탐색기로 이동 | 자동 생성, 뷰 경로 자동 입력 |
| 관련 Error 보기 | RUM Error 탐색기로 이동 | 자동 생성, 오류 유형 및 시간 범위 자동 입력 |
| 관련 Resource 보기 | RUM Resource 탐색기로 이동 | 자동 생성, 리소스 경로 자동 입력 |
| 관련 신서틱 모니터링 보기 | 신서틱 테스트 작업 상세로 이동 | 자동 생성, 신서틱 테스트 작업 이름 자동 연결 |
| 관련 대시보드 보기 | 지정된 대시보드로 이동 | 대시보드 ID 및 이름을 직접 입력해야 하며, 뷰 변수 및 시간 범위 조정 지원 |
링크 형식 예시:
로그 탐색기: [查看相关日志](<{{STUDIO_CONSOLE_BASE_URL}}/logIndi/log/all?time={{df_check_range_start}},{{df_check_range_end}}&w={{df_workspace_uuid}}>)
트레이스 탐색기: [查看相关链路](<{{STUDIO_CONSOLE_BASE_URL}}/tracing/link/all?time={{df_check_range_start}},{{df_check_range_end}}&w={{df_workspace_uuid}}>)
템플릿 변수¶
+ 변수를 클릭하여 사전 정의된 템플릿 변수를 삽입합니다. 변수는 이벤트 트리거 시 실제 값으로 동적으로 대체됩니다.
| 변수 | 설명 |
|---|---|
{{df_dimension}} |
탐지 차원 객체 |
{{df_monitor_checker_name}} |
현재 모니터 이름 |
{{df_monitor_name}} |
소속 알림 정책 이름 |
{{Result}} |
탐지 결과 값 |
{{df_status}} |
이벤트 상태(error/warning/ok) |
{{df_event_id}} |
이벤트 고유 식별자 |
지원되는 전체 템플릿 변수를 보려면 클릭하세요.
고급 구성¶
'고급 구성'을 통해 DQL로 이벤트에 연결 데이터 컨텍스트를 포함할 수 있습니다.
1. 연결 로그 추가
클릭하면 다음 템플릿이 자동 생성됩니다.
{% set dql_data = DQL("L::RE(`.*`):(`message`) { `index` = 'default' } LIMIT 1") %}
{{ dql_data.message | limit_lines(10) }}
구성 요점:
-
{index= 'default' }을 실제 인덱스 이름으로 교체해야 합니다. -
RE(``.*``)는 정규식 매칭을 지원합니다(예:RE(``error\|exception``)). -
limit_lines(10)은 출력 줄 수를 제한하여 알림이 너무 길어지지 않도록 합니다.
2. 연결 오류 스택 추가
클릭하면 다음 템플릿이 자동 생성됩니다.
{% set dql_data = DQL("T::re(`.*`):(`error_message`,`error_stack`){ (`source` NOT IN ['service_map', 'tracing_stat', 'service_list_1m', 'service_list_1d', 'service_list_1h', 'profile']) AND (`error_stack` = exists()) } LIMIT 1") %}
{{ dql_data.error_message | limit_lines(10) }}
{{ dql_data.error_stack | limit_lines(10) }}
구성 요점:
-
source NOT IN [...]은 통계 집계 데이터를 제외하고 원본 트레이스만 유지합니다. -
(error_stack= exists())은 스택 정보가 포함된 오류를 반환하도록 보장합니다.
알림 구성원(@)¶
클릭하여 워크스페이스 구성원을 선택합니다.
적용 로직:
- 인시던트 연동을 활성화한 경우에만
@ 구성원구성이 적용되며 지정된 구성원에게 이곳의 이벤트 내용을 전송합니다. - 이 구성은 알림 구성의 알림 대상과 서로 독립적이며 알림 통지 범위에 영향을 주지 않습니다.
알림 내용 사용자 지정¶
기본적으로 시스템은 이벤트 내용을 알림 통지 내용으로 사용합니다. 실제로 외부로 전송할 알림을 사용자 지정해야 하는 경우 여기에서 스위치를 활성화하고 알림 정보를 입력할 수 있습니다.
- 독립 편집기를 펼쳐 외부로 전송할 알림 내용을 별도로 정의할 수 있습니다.
- 기존 이벤트 내용은 플랫폼 내에 유지되어 이벤트 상세 표시에 사용됩니다.
- 독립 편집기에서도 Markdown, 템플릿 변수, 연결 링크 및 고급 구성을 지원합니다.
데이터 공백 이벤트¶
즉, 데이터 공백(데이터 미수신) 시 알림 내용을 사용자 지정하는 기능입니다. 이 유형의 이벤트가 최종적으로 외부로 전송될 때 사용할 제목, 내용 등의 정보를 함께 구성할 수 있습니다.
사용자 지정 구성을 하지 않은 경우 시스템은 공식 기본 템플릿을 사용하여 데이터 공백 알림을 전송합니다.
사용자 지정 데이터 공백 이벤트 내용도 구문 검사와 템플릿 미리보기를 지원하며, 미리보기에는 현재 입력한 데이터 공백 제목과 내용이 사용됩니다.
인시던트 연동¶
연동을 활성화하면 이 모니터에서 이상 이벤트가 발생한 경우 인시던트가 함께 생성됩니다.
구성 항목¶
- 자동 생성된 인시던트에 태그를 추가하여 인시던트 센터에서 분류 및 필터링할 수 있도록 합니다.
-
이벤트 등급과 인시던트 등급의 매핑 관계를 구성하며, 여러 규칙을 추가할 수 있습니다.
- 치명적/심각/중요/경고/데이터 공백 등급 이벤트가 발생하면 새 인시던트 등급 P0/P1/P2/P3/... 이 함께 생성됩니다.
여기에서 생성된 인시던트는 인시던트 센터에서 확인할 수 있습니다(❗️이러한 인시던트에는 태그 필터 조건이 포함됩니다).
연동 메커니즘¶
- 이벤트가 트리거되면 인시던트 센터에 인시던트 레코드가 자동 생성되고, 인시던트 설명이 이벤트 내용으로 자동 동기화됩니다.
- 이벤트 내용의 @ 구성원 목록에 따라 인시던트 생성 알림을 전송합니다.
- 인시던트 센터에서 인시던트 상세를 확인할 수 있으며, 시스템이 해당 인시던트와 관련된 전체 연계 데이터(성능 메트릭, 오류 로그, 호출 트레이스, 인프라 토폴로지 등)를 자동으로 연결하여 표시합니다.
알림 구성¶
모니터가 트리거 조건을 충족하면 지정된 알림 대상에게 알림 메시지를 즉시 전송합니다.
알림 정책¶
생성된 알림 정책을 선택합니다. 다중 선택이 가능합니다. 정책 이름을 클릭하면 상세 정보가 펼쳐지고, 알림 정책 편집을 클릭하면 구성을 수정할 수 있습니다.
| 구성 항목 | 설명 |
|---|---|
| 알림 구성 | 해당 정책에 바인딩된 알림 대상 그룹을 표시합니다(예: 전체 등). |
| 중복 알림 | 동일한 이벤트가 지정된 시간(예: 10분) 내에 중복 알림을 전송하지 않습니다. |
| 알림 집계 | 집계 방식(예: AI 집계) |
| 집계 주기 | 지정된 시간(예: 5분) 내의 신규 이벤트를 하나의 알림으로 집계하여 전송하며, 주기를 초과하면 신규 이벤트는 새 알림으로 집계됩니다. |
연동¶
생성된 대시보드를 선택하여 모니터와 대시보드의 연동 관계를 설정합니다. 이를 통해 빠르게 이동하여 모니터링 데이터를 시각적으로 확인할 수 있습니다.
권한¶
모니터의 작업 권한을 설정하여 각 사용자가 자신의 역할과 권한 수준에 따라 구성에 맞는 작업을 수행하도록 합니다. 현재 워크스페이스의 Owner는 이 작업 권한 구성의 영향을 받지 않습니다.
- 이 구성을 활성화하지 않음: '모니터 구성 관리'의 기본 권한을 따릅니다.
- 이 구성을 활성화하고 사용자 지정 권한 대상을 선택함: 생성자와 권한이 부여된 대상만 이 모니터에 설정된 규칙을 활성화/비활성화, 편집, 삭제할 수 있습니다.
- 이 구성을 활성화했지만 사용자 지정 권한 대상을 선택하지 않음: 생성자만 이 모니터에 대한 활성화/비활성화, 편집, 삭제 권한을 가집니다.
또한 워크스페이스 Owner는 통합 권한 관리 구성을 통해 관리자, 역할 또는 구성원에게 모니터 작업 권한을 일괄 부여할 수 있습니다. 권한이 부여된 대상은 사용자 지정 작업 권한이 활성화된 모든 모니터를 작업할 수 있으며, 각 모니터의 사용자 지정 권한 대상에 일일이 추가할 필요가 없습니다.
탐지 즉시 실행¶
규칙 구성이 완료되면 탐지 즉시 실행을 클릭하여 테스트를 한 번 수동으로 실행하고 현재 규칙 구성의 전체 효과를 검증할 수 있습니다. 테스트 실행은 실제 알림을 생성하지 않습니다.
알림 캐시 보호 메커니즘¶
구성이 완료되면 모니터는 실행 중 다음 보호 정책을 적용합니다. 시스템은 고카디널리티 집계로 인해 과도한 탐지 대상이 생성되어 시스템 부하가 발생하는 것을 방지하기 위해 다음 메커니즘을 사용합니다.
| 단계 | 트리거 조건 | 시스템 동작 |
|---|---|---|
| 임계값 사전 경고 | 탐지 대상 수가 시스템 제한의 80%(80,000건)에 도달 | 시스템 알림을 트리거(최대 하루 1회)하고 쿼리 조건 및 그룹 설정을 확인하도록 안내합니다. |
| 한도 초과 보호 | 탐지 대상 수가 시스템 상한 100,000건에 도달 | 모니터를 자동으로 일시 중지하고 알림을 전송하며, 일시 중지 기간 동안 실행을 중지합니다. |
알림 캐시 상한은 100,000건이며 사전 경고 비율은 80%입니다.
일시 중지 복구 메커니즘¶
알림 캐시 한도 초과로 모니터가 시스템에 의해 일시 중지된 후 다음 작업 중 하나를 수행하면 자동으로 복구됩니다.
-
쿼리 조건을 수정하고 모니터를 다시 저장
-
모니터를 바로 다시 저장
시스템이 알림 캐시 표시를 자동으로 정리하고 모니터의 정상 실행을 복구하므로 추가 작업이 필요하지 않습니다.
더 읽어보기¶
모니터 규칙 생성에 성공한 후 다음이 필요할 수 있습니다.



