모니터링¶
Guance 모니터링은 워크스페이스 내의 메트릭, 로그, 트레이스, 사용자 액세스, 오브젝트 등 관측 데이터를 기반으로 지속적으로 감지를 수행합니다. 이상이 감지되면 시스템이 이벤트를 생성하고, 연결된 알림 정책에 따라 지정된 대상에게 알림을 전송합니다. 또한 음소거 규칙을 통해 알림 간섭을 제어하고, SLO를 사용해 서비스 안정성을 지속적으로 측정할 수 있습니다.
모니터링 작동 방식¶
모니터링 프로세스는 감지, 이벤트, 알림, 관리의 네 단계로 구성됩니다.
- 감지 실행: 모니터가 설정된 주기로 관측 데이터를 쿼리하고 분석하여 이상 여부를 판단합니다.
- 이벤트 생성: 감지 조건이 충족되면 시스템이 이벤트 또는 이벤트 보고서를 생성하며, 모든 이벤트는 이벤트 센터로 통합 수집됩니다.
- 알림 전송: 알림 정책이 이벤트 등급, 알림 시간, 집계 방식 등의 설정에 따라 알림 정보를 지정된 알림 대상에게 전송합니다.
- 지속적 관리: 음소거 관리를 통해 특정 시나리오의 알림을 제어하고, SLO를 사용해 서비스 목표와 오류 예산을 추적합니다.
이벤트와 알림
이벤트는 모니터가 이상을 감지한 후 생성하는 데이터 기록으로, 이상 상태와 분석 결과를 보존하는 데 사용됩니다. 알림은 알림 정책이 이벤트 및 알림 규칙에 따라 외부로 전송하는 정보입니다. 음소거 또는 반복 알림 설정은 알림 전송에 영향을 주지만, 이벤트는 여전히 이벤트 센터에서 확인할 수 있습니다.
감지 방식 선택¶
이상 판단 방식과 구성 요구 사항에 따라 적절한 모니터를 선택합니다.
| 감지 방식 | 구성 및 실행 방식 | 사용 사례 |
|---|---|---|
| 규칙 감지 | 데이터 범위, 쿼리 방식, 감지 규칙을 직접 선택하고, 임계값, 급변, 구간, 이상치 등 다양한 감지 방식을 구성할 수 있습니다. | 모니터링 메트릭, 판단 조건, 임계값이 명확하게 정의되어 있고 감지 로직을 정밀하게 제어해야 하는 경우에 적합합니다. |
| AI 지능형 모니터 | 자연어 프롬프트로 하나 이상의 구체적인 감지 규칙을 생성하며, 저장 후에는 고정된 쿼리 조건, 알고리즘, 임계값에 따라 지속적으로 실행됩니다. | 모니터링 대상과 이상 증상은 명확하지만, 구체적인 규칙 생성은 AI의 도움을 받고자 하는 경우에 적합합니다. |
| 내장 지능형 모니터링 | 호스트, 로그, 애플리케이션, 사용자 액세스, Kubernetes 또는 클라우드 청구서 등 유형을 선택하고, 시스템 내장 규칙을 불러온 후 필요에 따라 임계값을 조정합니다. | 일반적인 모니터링 대상과 대표적인 이상 시나리오를 빠르게 적용해야 하는 경우에 적합합니다. |
| AI 모니터 | 자연어 프롬프트를 지속적으로 적용되는 감지 규칙으로 직접 사용합니다. 감지가 실행될 때마다 AI가 데이터를 쿼리하고 분석하여 결론과 증거가 포함된 이벤트 보고서를 생성합니다. | 비즈니스 의미, 여러 신호, 컨텍스트를 종합적으로 고려한 판단이 필요한 경우에 적합합니다. |
AI 지능형 모니터와 AI 모니터 구분 방법
AI 지능형 모니터는 프롬프트를 사용해 고정 규칙을 생성하며, 저장 후 규칙에 따라 실행됩니다. 반면 AI 모니터는 프롬프트를 감지 규칙으로 직접 사용하여, 감지가 실행될 때마다 AI가 프롬프트에 따라 데이터를 분석합니다. 임계값과 고정된 판단 로직이 필요한 경우에는 AI 지능형 모니터를, 지속적인 의미 분석과 종합 판단이 필요한 경우에는 AI 모니터를 사용합니다.
구성 및 처리 절차¶
1. 모니터 생성¶
모니터링으로 이동하여 감지 대상에 따라 규칙 감지, 지능형 모니터링 또는 AI 모니터를 선택합니다.
- 모니터 템플릿을 사용해 일반적인 기술 스택과 비즈니스 구성 요소에 대한 모니터를 빠르게 생성합니다.
- 사용자 정의 모니터를 생성하여 쿼리, 감지 규칙, 트리거 조건을 직접 구성합니다.
- 지능형 모니터를 생성하여 AI로 규칙을 생성하거나 내장 규칙을 불러옵니다.
- AI 모니터를 생성하고 프롬프트로 분석 대상, 판단 근거, 기대 결과를 설명합니다.
2. 알림 구성¶
모니터는 이상 탐지를 담당하고, 알림 정책은 알림 전송 방식을 결정합니다. 모니터를 생성하거나 편집할 때 기존 알림 정책을 연결할 수 있으며, 모니터링 > 알림 정책으로 이동하여 통합 관리할 수도 있습니다.
알림 정책 생성 시 다음 항목을 구성할 수 있습니다.
- 처리 대상 이벤트 범위와 등급
- 알림 대상, 알림 방식, 알림 시간
- 반복 알림, 알림 에스컬레이션, 알림 집계 방식
3. 이벤트 확인 및 처리¶
모니터가 이상을 감지한 후 다음 경로를 통해 결과를 확인할 수 있습니다.
- 모니터 목록에서 관련 이벤트 보기를 클릭하여 현재 모니터가 생성한 이벤트를 확인합니다.
- 이벤트 센터로 이동하여 워크스페이스 내 이벤트를 통합적으로 필터링, 분석, 처리합니다.
- 이벤트 상세를 열어 이벤트 내용, 분석 보고서, 확장 필드, 알림, 이력 등의 정보를 확인합니다.
4. 알림 노이즈 및 서비스 목표 관리¶
- 음소거 관리: 유지보수 시간 또는 알려진 이상 기간 동안 모니터, 알림 정책, 태그 또는 사용자 정의 조건에 따라 알림을 억제합니다.
- SLO: 서비스 가용성 또는 성능 목표의 달성 상태를 지속적으로 추적하고, 오류 예산을 사용해 서비스 안정성을 평가합니다.
기능 진입점¶
| 기능 | 역할 |
|---|---|
| 모니터 | 템플릿 또는 사용자 정의 규칙으로 모니터를 생성합니다. |
| AI 모니터 | 자연어 프롬프트로 관측 데이터를 지속적으로 분석합니다. |
| 지능형 모니터링 | AI로 규칙을 생성하거나 시스템 내장 규칙을 선택합니다. |
| 알림 정책 | 알림 조건, 대상, 시간, 에스컬레이션 및 집계 방식을 구성합니다. |
| 알림 대상 관리 | 이메일, SMS, 봇, Webhook 등 알림 채널을 관리합니다. |
| 음소거 관리 | 지정된 조건과 시간 범위 내에서 알림을 억제합니다. |
| SLO | 서비스 목표와 오류 예산을 설정하고 추적합니다. |