콘텐츠로 이동

DBSCAN

DBSCAN은 다수의 시계열 데이터를 과거 데이터를 기반으로 탐지하여 이상치(Outlier) 감지 대상을 발견하는 알고리즘입니다.

알고리즘 소개

DBSCAN은 밀도 기반 클러스터링 알고리즘입니다. 밀도가 특정 임계값에 도달하는 영역을 클러스터로 구분하고, 밀도가 낮은 영역은 노이즈로 간주합니다. DBSCAN 알고리즘은 클러스터 개수를 미리 지정할 필요가 없으며, 임의의 형태 클러스터를 발견할 수 있고 노이즈 데이터에 대해 우수한 강건성을 제공합니다.

  • 감지 대상: 다수의 시계열 데이터
  • 사용 사례: 동일 그룹의 시계열에서 이상 시계열을 발견하는 시나리오에 적합
  • 전달 인자: 감지 구간 T, 거리 파라미터
  • 의미: Now- T, Now 구간 내 다수의 시계열 중 어떤 시계열이 비정상인지 탐지
  • 반환 값: 1 ~ n개의 이상 시계열 반환

핵심 파라미터

거리(eps): float, default=0.5

거리 파라미터는 한 샘플이 다른 샘플과 인접하다고 간주되는 두 샘플 간 최대 거리를 나타내며, 클러스터 내 점 간 거리의 상한선이 아닙니다. (float, default=0.5)

range(0~3.0) 사이의 임의 실수 값을 선택적으로 구성할 수 있습니다. 구성하지 않을 경우 기본 거리 파라미터는 0.5입니다. 거리 설정이 클수록 이상점이 적게 감지되고, 거리 값이 너무 작으면 매우 많은 이상치가 감지될 수 있으며, 거리 값이 너무 크면 이상이 전혀 감지되지 않을 수 있으므로 데이터 특성에 따라 적절한 거리 파라미터를 설정해야 합니다.

사용 사례

중심 함수 DBSCAN을 예로 들어, 사용자가 Guance 워크스페이스에 가입 시 DBSCAN 선택을 지원합니다. 고급 함수 - DBSCAN 이상치 감지는 과거 데이터를 기반으로 다수의 시계열을 탐지합니다.

시나리오에서 시계열 차트를 선택하고, 조회 아래의 함수 추가 버튼을 클릭한 후 고급 함수 > DBSCAN을 선택하고 알고리즘 파라미터를 지정하면, 뷰에 다수의 시계열에 대한 이상치 효과가 표시됩니다. 예시는 다음과 같습니다.

DQL 조회 예시 작성법:

DBSCAN(`M::cpu:(usage_idle)`, 0.5)
Warning

조회 시 다음 사항을 유의하세요:

  • 조회 데이터에 시간 분할을 포함해야 합니다. 예: 1h:5m:1m
  • 이 알고리즘 계산에는 최소 5개의 값이 필요하므로 데이터 포인트 수를 충족해야 합니다.
  • 이 알고리즘은 여러 시계열을 처리하므로 데이터 조회 시 group by 필드가 필요합니다.

표시 스타일

  • 구성 후 이상치 표시 효과:

  • 이상치가 없는 경우, 원본 데이터를 그대로 표시:

문서 평가

이 페이지가 도움이 되었나요?