콘텐츠로 이동

AI 모니터


AI 모니터는 자연어 Prompt를 지속적으로 적용되는 검사 규칙으로 사용하며, 설정된 주기에 따라 현재 워크스페이스의 관측 데이터를 분석합니다. 설명에 부합하고 데이터 증거가 뒷받침되는 문제를 발견하면 시스템이 AI 모니터 이벤트 보고서를 생성하고, 연결된 알림 정책에 따라 처리합니다.

이 기능은 비즈니스 의미, 메트릭, 로그 및 컨텍스트를 함께 고려하여 판단해야 하는 시나리오에 적합하며, 수동 조사 방식을 주기적인 검사 작업으로 전환하고 이벤트 보고서에 분석 결론과 검사 증거를 제공합니다.

지능형 모니터와의 차이점

AI 모니터와 지능형 모니터는 모두 자연어로 모니터링 요구 사항을 설명할 수 있지만, Prompt의 역할과 실제 실행 방식은 다릅니다.

비교 항목 AI 모니터 AI 지능형 모니터
Prompt의 역할 Prompt 자체가 검사 규칙으로 사용되며, 매 검사마다 지속적으로 적용됩니다. Prompt는 하나 이상의 구체적인 검사 규칙을 생성하는 데 사용됩니다.
실행 방식 실행할 때마다 AI가 Prompt에 따라 관측 데이터를 조회하고 분석합니다. 규칙이 생성·저장된 후에는 시스템이 고정된 규칙으로 검사를 실행하며, 매 검사마다 Prompt를 다시 해석하지 않습니다.
검사 결과 AI가 분석 결론과 데이터 증거가 포함된 이벤트 보고서를 생성합니다. 저장된 규칙에 따라 지능형 모니터링 이벤트 생성 여부를 판단하며, 동일한 검사에서 조건에 부합하는 규칙이 병합되어 분석 보고서가 생성됩니다.
조정 방식 Prompt를 수정하여 이후 분석 목표와 판단 요구 사항을 조정합니다. 규칙 임계값 또는 규칙 상태를 수정하거나, 요구 사항 설명을 수정한 후 구성을 다시 생성합니다.

사용 사례

시나리오 추가할 수 있는 데이터 객체 Prompt 작성 핵심 역할
오류 로그 조사 주문 서비스의 로그 인덱스, 소스 및 관련 필드 시간 범위, 서비스, 오류 현상, 지속 시간 오류량 급증이나 특정 오류 반복 발생 등의 문제를 발견하고, 분석 결론과 조사 권장 사항을 얻습니다.
서비스 품질 점검 서비스 관련 메트릭 및 태그 환경, 서비스, 관심 메트릭, 이상 징후 요청량 감소, 오류율 상승, 응답 지연 등의 변화를 지속적으로 관찰합니다.
배포 후 관찰 배포와 관련된 메트릭 및 로그 배포 범위, 관찰 시간, 주요 리스크 배포 후 지정된 시간 동안 이상 신호를 확인하여 추가 조사가 필요한지 판단을 지원합니다.

모니터 생성

모니터링 > AI 모니터로 이동한 후 AI 모니터 생성을 클릭합니다:

  1. 모니터 이름을 입력하고 검사 주기와 문제 유형을 선택합니다.
  2. 검사 Prompt를 작성합니다.
  3. 필요에 따라 언급할 데이터 객체를 추가합니다.
  4. "고급 설정"에서 단일 검사 크레딧 예산을 설정하여 단일 검사 작업의 크레딧 소모를 제한할 수 있습니다.
  5. 현재 구성을 테스트합니다.
  6. 알림 정책을 선택하고 작업 권한을 구성한 후 저장합니다.

검사 구성

기본 정보

구성 항목 설명
이름 현재 모니터를 식별하는 데 사용되며, 검사 대상과 목표를 반영하는 것을 권장합니다.
검사 주기 AI가 검사를 실행하는 주기로, 최소 1시간입니다.
문제 유형 보안, 안정성, 성능, 비용 중 선택할 수 있으며, 이벤트 분류에 사용되고 실제 검사 대상 문제 범위를 제한하지 않습니다.

검사 Prompt 작성

Prompt는 AI가 문제를 판단하는 주요 기준이며, 최대 20,000자까지 입력할 수 있습니다. 설명이 명확할수록 AI가 검사 목표를 정확히 이해하고 관련 데이터를 선택하여 분석하기 쉽습니다.

Prompt에 다음 내용을 명확히 명시하는 것이 좋습니다:

내용 설명 예시
분석 대상 확인해야 할 서비스, 환경, 비즈니스 또는 로그 소스를 지정하고, 해당 이름이나 태그 값을 제공합니다. 프로덕션 환경(env:prod)의 주문 서비스(service:order-service)
시간 범위 분석해야 할 데이터의 시간 범위. 최근 1시간
판단 단서 관찰이 필요한 이상 징후, 변화 방향 또는 지속 시간. 오류량이 눈에 띄게 증가하고 10분 이상 지속
영향 범위 AI가 중점적으로 분석해야 할 서비스, 리소스, 요청 또는 사용자 범위. 주문 API(resource:/api/v1/orders)
기대 출력 결과에서 얻고자 하는 정보. 주요 오류 유형, 가능한 원인, 조사 권장 사항

아래 예시의 서비스 이름, 환경, API 및 임계값은 설명을 위한 것일 뿐이므로, 현재 워크스페이스의 실제 값으로 교체하세요.

예를 들어 특정 서비스의 오류 로그를 확인하려면 다음과 같이 입력할 수 있습니다:

지난 1시간 동안 프로덕션 환경(env:prod)의 주문 서비스(service:order-service) 오류 로그를 확인하세요. 주문 API(resource:/api/v1/orders)를 중점적으로 분석하고, 오류량이 지난 7일 동일 시간대 평균보다 50% 이상 증가하고 10분 이상 지속되는 경우 주요 오류 유형, 영향 범위, 가능한 원인을 설명하고 우선 조사 권장 사항을 제시하세요.

특정 서비스의 성능 메트릭을 확인하려면 다음과 같이 입력할 수 있습니다:

지난 30분 동안 프로덕션 환경(env:prod)의 결제 서비스(service:payment-service) 요청량, 오류율, P95 응답 시간을 확인하세요. 요청량이 지난 7일 동일 시간대 대비 30% 이상 감소하거나 오류율이 5%를 초과하거나 P95 응답 시간이 10분 연속 1초를 초과하는 경우 이상 시작 시간, 영향받은 API, 가능한 원인을 설명하세요.

데이터 객체 추가

언급할 데이터 객체는 AI에 분석 컨텍스트를 제공하고, AI가 참조할 수 있는 메저먼트 또는 로그 소스를 명확히 하도록 돕습니다. 이 구성은 선택 사항이며, 검색, 다중 선택, 제거를 지원합니다.

데이터 객체 추가를 클릭하고 “데이터 유형 > 메저먼트 또는 소스 > 필드 또는 태그” 순서로 선택합니다:

데이터 유형 선택 방법
메트릭 메저먼트를 선택하고, 필요에 따라 필드 또는 태그를 선택합니다.
로그 로그 인덱스 및 소스를 선택하고, 필요에 따라 필드 또는 태그를 선택합니다.

선택한 객체는 분석 컨텍스트를 한정하는 데 사용되며, 강제적인 조회 조건이 아닙니다. AI는 여전히 Prompt를 고려하여 실제 조회를 결정하므로, 검사 목표와 직접 관련된 데이터 객체만 추가하는 것을 권장합니다.

고급 설정

고급 설정을 펼치면 단일 검사 크레딧 예산을 구성할 수 있으며, 기본값은 300크레딧입니다. 테스트, 수동 트리거 및 정기 실행은 모두 현재 모니터에 저장된 예산을 사용하며, 실제 사용량에 따라 크레딧을 차감합니다.

알림 및 권한

  • 알림 정책: 이벤트 보고서 생성 후의 알림 규칙, 알림 대상 및 알림 채널을 결정합니다.
  • 작업 권한: 현재 모니터를 조작할 수 있는 역할, 팀 또는 구성원을 제어합니다.

테스트 검사

테스트 검사는 Prompt, 데이터 객체 및 기타 구성이 기대하는 분석 결과를 얻을 수 있는지 검증하는 데 사용됩니다:

  1. 생성 또는 편집 페이지에서 테스트 검사를 찾습니다.
  2. Prompt 테스트를 클릭하면 시스템이 현재 구성을 검증하고 저장합니다.
  3. 실행 진행 상황과 검사 결과를 확인합니다.
  4. 필요에 따라 Prompt 또는 데이터 객체를 조정한 후 다시 테스트합니다.

테스트 결과는 다음과 같습니다:

결과 설명
문제 발견 AI 모니터 이벤트 보고서를 생성하고, 선택한 알림 정책에 따라 처리합니다.
문제 미발견 이번 검사 결과를 표시합니다.
실행 실패 실패 정보를 표시하며, 페이지 안내에 따라 구성을 조정한 후 다시 테스트할 수 있습니다.

테스트는 알림을 트리거할 수 있습니다. 실행 전에 알림 정책의 알림 대상과 채널을 확인하여 관계없는 사람에게 영향을 주지 않도록 하세요.

모니터 관리

검색 및 필터링

  • 검색창에 모니터 이름 또는 ID를 입력합니다.
  • 태그, 상태 또는 알림 정책으로 모니터를 필터링합니다.

실행 상태 확인

  • 활성화: 모니터가 구성된 검사 주기에 따라 실행됩니다.
  • 비활성화: 모니터가 주기적 검사를 중지하며, 필요에 따라 다시 활성화할 수 있습니다.
  • 연속 실패: 모니터 이름 옆에 연속 실패 안내가 표시되며, 클릭하면 구성 페이지에서 Prompt, 데이터 객체 및 권한 설정을 확인할 수 있습니다.

개별 모니터 관리

작업 설명
보기 또는 편집 모니터 구성을 확인하며, 작업 권한이 있으면 구성을 수정할 수 있습니다.
수동 검사 트리거 현재 저장된 구성을 사용하여 즉시 검사를 한 번 실행합니다.
관련 이벤트 보기 이 모니터가 생성한 이벤트 보고서를 확인합니다.
복제 현재 모니터 구성을 복사하여 유사한 검사 작업을 빠르게 생성합니다.
작업 감사 모니터의 생성, 편집, 활성화·비활성화 등 작업 기록을 확인합니다.
삭제 현재 모니터를 삭제하며, 기존 이벤트 보고서는 이벤트 센터에 계속 유지됩니다.

가져오기 및 내보내기

  • 가져오기: 목록 설정 메뉴에서 JSON 형식의 모니터 구성을 가져옵니다.
  • 전체 내보내기: 현재 워크스페이스의 모든 모니터 구성을 내보냅니다.
  • 선택 항목 내보내기: 하나 이상의 모니터를 선택한 후 선택한 구성을 내보냅니다.

과금 안내

AI 모니터는 검사를 한 번 실행할 때마다 각각 트리거와 AI 크레딧 사용량이 발생합니다:

측정 항목 측정 규칙
트리거 검사가 한 번 실행될 때마다 트리거 1회로 집계됩니다.
AI 크레딧 이번 검사에서 실제로 소비된 Credits만큼 차감됩니다.

고급 설정의 단일 검사 크레딧 예산은 단일 검사의 크레딧 소모를 제어하는 데 사용되며, 매번 해당 금액이 고정적으로 차감된다는 의미는 아닙니다.

관련 이벤트 보기

AI 모니터는 문제를 발견하면 이벤트 보고서를 생성하고, 자동으로 이벤트 센터에 모아 이벤트 기록 형태로 표시합니다.

조회 경로

  • AI 모니터 목록에서 관련 이벤트 보기를 클릭합니다.
  • 이벤트 센터 > 모든 이벤트로 이동하여 df_source:aiMonitor를 사용해 AI 모니터 이벤트 보고서를 필터링합니다.

이벤트 내용

이벤트 상세를 열면 AI가 생성한 구조화된 분석 결론을 확인할 수 있습니다. 여기에는 문제 요약, 판단 신뢰도 및 뒷받침 증거, 영향 범위, 진단, 권장 작업 등의 정보가 포함되어, 사용자가 문제를 이해하고 영향을 파악한 후 후속 조치를 진행하는 데 도움을 줍니다. 관련 증거는 이번 검사에 사용된 데이터와 연결되어, 분석 결과를 추가로 검증하기 쉽습니다.

문서 평가

이 페이지가 도움이 되었나요?