콘텐츠로 이동

임계값 감지


현재 문서의 위치

이 문서는 감지 규칙 구성 프로세스의 두 번째 단계입니다. 구성을 완료한 후, 메인 문서로 돌아가 3단계: 이벤트 알림을 계속 진행하세요.

데이터 범위: 모든 데이터 유형 지원 (예: 메트릭 M, 로그 L, 분산 추적 T, RUM 데이터 R, 오브젝트 O 등).

감지 구성

감지 빈도

감지 실행 주기를 설정합니다.

  • 사전 설정 옵션: 1분, 5분, 10분, 15분, 30분, 1시간

  • Crontab 모드: "Crontab 모드로 전환"을 클릭하여 사용자 정의 주기를 구성할 수 있습니다. 초, 분, 시, 일, 월, 주 등을 기준으로 예약 작업 실행을 구성할 수 있습니다.

감지 기간

각 감지 시 조회할 데이터의 시간 범위를 설정합니다 (❗️감지 기간은 감지 빈도보다 크거나 같아야 하며, 데이터 실제 보고 주기와 일치해야 누락 감지나 오탐을 방지할 수 있습니다).

  • 사전 설정 옵션:
감지 빈도 감지 기간 (드롭다운 선택 가능)
30s 1m/5m/15m/30m/1h/3h
1m 1m/5m/15m/30m/1h/3h
5m 5m/15m/30m/1h/3h
15m 15m/30m/1h/3h/6h
30m 30m/1h/3h/6h
1h 1h/3h/6h/12h/24h
6h 6h/12h/24h
12h 12h/24h
24h 24h
  • 사용자 정의 형식: 감지 기간을 직접 입력 (예: 20m (최근 20분), 2h (최근 2시간), 1d (최근 1일)).

감지 메트릭

DQL을 기반으로 감지 데이터 소스 및 집계 방식을 정의합니다.

감지 차원으로 높은 카디널리티(High Cardinality) 필드를 선택하지 마십시오. 잘못 구성하거나 트리거 조건이 너무 느슨하면 빈번한 알림이 발생할 수 있습니다. 현재 쿼리의 최대 반환 레코드 수는 10만 개입니다.

구성 예시: 모니터의 감지 메트릭 구성 시 trace_id를 그룹화 필드로 선택한 경우.

시스템이 다음과 같이 경고합니다.

현재 그룹화 필드 trace_id는 높은 카디널리티 위험 필드입니다. 이러한 필드를 사용하여 집계하면 대량의 그룹이 생성되어 알림 폭발을 일으키기 쉬우며, 이로 인해 모니터가 시스템에 의해 자동으로 일시 중지될 수 있으므로 그룹화 설정을 최적화하십시오.

구성 요소

구성 항목 설명
워크스페이스 기본값은 현재 워크스페이스이며, 다른 권한이 부여된 워크스페이스로 전환 가능합니다.

권한이 부여되면 현재 계정의 다른 워크스페이스에 있는 감지 메트릭을 사용하여 모니터를 생성할 수 있습니다. 규칙 생성이 완료되면 워크스페이스 간 알림 구성이 가능합니다. 다른 워크스페이스를 선택하는 경우, 감지 메트릭의 드롭다운 목록에는 현재 워크스페이스에서 사용이 허가된 데이터 유형만 표시됩니다.
데이터 소스 유형 메트릭, 로그, 분산 추적, RUM 데이터 등
쿼리 방식 단순 쿼리, 표현식 쿼리, PromQL 쿼리, 데이터 소스 쿼리
필터 조건 태그를 통해 감지 대상을 필터링합니다.
집계 방식 avg, sum, max, min, count
함수 지원 fx 버튼을 클릭하여 다음 함수를 선택할 수 있습니다.

  • Label 필터: 태그 값을 기준으로 필터링 또는 그룹화
  • 변환 함수: 데이터 유형 변환 또는 형식 변환
  • 선택 함수: first, last, max, min
  • 비어 있음 채우기: 이전 값 채우기, 선형 채우기, 숫자 값 채우기

    ❗️변환 함수 derivative, difference, non_negative_derivative, non_negative_difference를 선택하는 경우 interval을 추가해야 합니다. 예: [::5m]
  • 클릭하여 쿼리 방식 상세 설명, 함수 사용 추가 설명을 확인할 수 있습니다.

    트리거 조건

    트리거 조건 및 심각도를 구성합니다. 쿼리 결과가 여러 값인 경우, 하나의 값이라도 트리거 조건을 충족하면 이벤트가 생성됩니다.

    치명적, 심각, 중요, 경고의 4단계 임계값과 정상 복구 조건을 지원합니다.

    레벨 구성 설명
    치명적 Result >= [값]일 때 최고 레벨 알림, 즉시 처리 필요
    심각 Result >= [값]일 때 높은 레벨 알림, 우선 처리 필요
    중요 Result >= [값]일 때 중간 레벨 알림, 주의 필요
    경고 Result >= [값]일 때 낮은 레벨 알림, 확인 필요
    정상 [N]회 감지에 이벤트가 발생하지 않음 감지 메트릭이 "치명적", "심각", "중요", "경고" 이상 이벤트를 트리거한 후, 연속 N회 감지가 정상이면 "정상" 이벤트가 생성됩니다. 이상 이벤트의 정상 복구 여부를 판단하는 데 사용되며, 구성하는 것을 권장합니다.

    자세한 내용은 이벤트 레벨 설명을 참조하세요.

    고급 옵션

    연속 트리거 판단

    활성화하면, 트리거 조건이 지속적으로 충족될 때만 이벤트가 생성되어 일시적인 변동으로 인한 오탐을 방지합니다 (❗️최대 구성 상한은 10회입니다).

    대량 알림 보호

    시스템에서 기본적으로 활성화되어 있습니다.

    단일 감지에서 생성된 알림 수가 사전 설정된 임계값을 초과하면 시스템이 자동으로 상태별 요약 전략으로 전환합니다. 알림 대상을 개별적으로 처리하지 않고, 이벤트 상태에 따라 소수의 요약 알림을 생성하여 푸시합니다.

    이를 통해 알림의 적시성을 보장하는 동시에 알림 노이즈를 현저히 줄이고, 과도한 알림 처리로 인한 시간 초과 위험을 방지할 수 있습니다.

    이 스위치가 켜져 있으면, 이후 모니터가 이상을 감지하여 생성된 이벤트 상세에는 히스토리 기록 및 관련 이벤트가 표시되지 않습니다.

    복구 조건

    복구 조건 및 심각도를 구성합니다. 쿼리 결과가 여러 값인 경우, 하나의 값이라도 트리거 조건을 충족하면 복구 이벤트가 생성됩니다.

    각 레벨에 대해 별도의 복구 임계값을 설정하여 단계적 복구를 구현할 수 있습니다. 예: 심각 알림은 값이 70 미만으로 떨어져야 복구되고, 중요 알림은 80 미만에서 복구됩니다.

    복구 알림 로직

    "복구 조건"을 활성화하면 시스템은 Fault ID(장애 ID)를 고유 식별자로 사용하여 알림의 전체 라이프사이클(Issue 생성 등 포함)을 관리합니다.

    등급별 복구 기능이 활성화된 경우:

    • 플랫폼은 각 알림 레벨(예: critical, warning)에 대해 별도로 복구 규칙(즉, 복구 임계값)을 구성합니다.

    • 각 레벨의 알림 상태와 복구 상태는 독립적으로 계산됩니다.

    • 기존 Fault ID 식별자의 알림 라이프사이클에는 영향을 미치지 않습니다.

    따라서 모니터가 처음으로 알림을 트리거할 때(즉, 새로운 알림 라이프사이클을 시작할 때), 시스템은 동시에 두 개의 알림 메시지를 생성합니다. 이들이 동일해 보이는 이유는 다음과 같습니다.

    1. 첫 번째 알림 출처: 전체 감지(check), 전체 장애 라이프사이클의 시작을 나타냄 (원래 규칙 기반);

    2. 두 번째 알림 출처: 등급별 감지(critical/error/warning/…), 활성화된 등급별 복구 기능이 시작되었음을 나타내며, 특정 알림 레벨 및 이후 복구 상태(예: critical_ok)를 보여줍니다.

    위 내용에서 df_monitor_checker_sub 필드는 두 유형의 알림을 구분하는 핵심 기준입니다.

    • check: 전체 감지 결과를 나타냅니다.

    • 기타 값(예: critical, error, warning 등): 등급별 감지 규칙의 결과에 해당합니다.

    따라서 알림이 처음 트리거될 때, 내용은 비슷하지만 출처와 용도가 다른 두 개의 레코드가 나타납니다.

    df_monitor_checker_sub T+0 T+1 T+2 T+3
    check check error warning ok
    critical critical critical_ok
    error error error_ok
    warning warning warning_ok

    데이터 단절

    감지 기간 내 감지 메트릭 쿼리 결과가 비어 있을 때의 처리 전략:

    옵션 설명
    이벤트 트리거 안 함 (기본값) 데이터가 없을 때 알림을 생성하지 않음. 데이터 누락이 허용되는 시나리오에 적합
    쿼리 결과를 0으로 간주 빈 데이터를 0 값으로 간주하여 임계값 판단
    데이터 단절 이벤트 트리거 데이터가 없을 때 이상으로 간주하여 데이터 단절 이벤트 트리거
    치명적 이벤트 트리거 데이터가 없을 때 치명적 레벨 이벤트 트리거
    심각 이벤트 트리거 데이터가 없을 때 심각 레벨 이벤트 트리거
    중요 이벤트 트리거 데이터가 없을 때 중요 레벨 이벤트 트리거
    경고 이벤트 트리거 데이터가 없을 때 경고 레벨 이벤트 트리거
    복구 이벤트 트리거 데이터가 없을 때 복구 이벤트 트리거

    트리거 조건, 데이터 단절, 정보 생성이 동시에 구성된 경우, 다음 우선순위에 따라 트리거가 판단됩니다: 데이터 단절 > 트리거 조건 > 정보 이벤트 생성.

    즉, 먼저 데이터 단절 여부를 판단하고, 그다음 임계값 트리거 여부를 판단하며, 마지막으로 정보 이벤트 생성 여부를 판단합니다.

    정보 생성

    이 옵션을 활성화하면 정보 생성 조건을 구성해야 합니다. 감지 결과가 "치명적", "심각", "중요", "경고" 임계값 중 어느 것도 트리거하지 않고, 정보 생성 조건을 충족하는 경우에만 시스템이 "정보" 이벤트를 기록합니다.

    정상 상태 변화나 낮은 우선순위 정보를 기록해야 하는 시나리오에 적합합니다.

    후속 구성

    위의 감지 구성을 완료한 후, 다음을 계속 구성하세요.

    1. 이벤트 알림: 이벤트 제목, 내용, 알림 멤버, 데이터 단절 처리 및 관련 장애를 정의합니다.

    2. 알림 구성: 알림 정책을 선택하고, 알림 대상 및 음소거 주기를 설정합니다.

    3. 연결: 대시보드를 연결하여 데이터를 빠르게 확인할 수 있도록 합니다.

    4. 권한: 작업 권한을 설정하여 이 모니터를 편집/삭제할 수 있는 사용자를 제어합니다.

    문서 평가

    이 페이지가 도움이 되었나요?