오류 센터¶
Guance 오류 센터는 팀이 애플리케이션 오류를 체계적으로 추적하고 관리할 수 있도록 지원하는 전체 스택 솔루션입니다. 애플리케이션 성능 모니터링(APM), 실제 사용자 모니터링(RUM), 로그의 오류 정보를 자동으로 집계하여 대량의 분산된 오류를 관리 가능한 작업으로 분류하고, 완전한 분석 및 처리 워크플로를 제공합니다.
| ❌ 전통적인 오류 모니터링의 문제점 | ✅ 오류 센터의 솔루션 |
|---|---|
| 동일한 근본 원인의 오류가 UUID, 타임스탬프 등 변수로 인해 수천 개의 개별 알림으로 분산됨 | 지문 알고리즘을 통해 동일한 논리적 오류를 단일 Issue로 통합 |
| 오류 정보가 고립되어 관련 분산 추적, 로그, 인프라 컨텍스트 부족 | 분산 추적, 사용자 세션, 로그, 메트릭을 자동으로 연결하여 전체 컨텍스트 제공 |
| 오류 처리 상태가 불투명하여 팀 협업 효율성 저하 | 표준화된 오류 수명 주기(Triage → Assigned → Resolved)로 팀 협업 지원 |
핵심 개념¶
오류(Error)¶
APM, RUM, 로그에서 식별된 비정상 이벤트 단위로, 오류 유형, 오류 정보, 오류 스택의 세 가지 요소를 포함합니다.
일반적으로 다음 세 가지 데이터 소스의 오류 정보를 포함합니다:
-
APM: 서버 측 예외와 오류를 캡처하여 서비스 실행 상태를 반영하며, 일반적으로 전체 서비스 호출 스택을 포함합니다.
-
RUM: 사용자 기기에서 발생하는 프론트엔드 애플리케이션의 오류를 수집하여 사용자 경험을 직접 반영하며, SourceMap을 통해 소스 코드의 특정 위치로 매핑할 수 있습니다.
-
로그: 시스템 또는 애플리케이션 자체에서 기록한 오류 정보를 포함합니다.
오류 Issue¶
시스템은 지능형 지문 알고리즘을 통해 동일한 근본 원인의 여러 오류(Error)를 단일 오류 Issue(문제 단위)로 집계합니다. 각 Issue는 고유한 수명 주기 상태를 가지며, "할당 대기(Triage)"에서 "해결됨(Resolved)"까지의 표준 흐름을 따릅니다. 또한 성능 분산 추적, 사용자 세션, 소스 코드 매핑, 로그 메트릭을 포함한 전체 분석 컨텍스트와 연결됩니다.
오류 전달 로직¶
오류 센터는 지능형 집계 메커니즘을 통해 오류 데이터를 통합 관리합니다. 시스템은 고유 식별자(issue_id)를 생성할 수 있는 오류 데이터만 처리하며, 이 식별자는 오류 지문과 서비스 컨텍스트의 조합을 통해 생성되어 동일한 오류의 지속적인 추적을 보장합니다.
오류 집계 메커니즘¶
시스템은 다음 단계를 통해 오류를 지능적으로 집계합니다:
1. 오류 지문 생성
a. 시스템은 각 오류에 대해 고유한 지문 식별자(fingerprint)를 생성합니다:
| 데이터 소스 | 지문 계산 필드 | 설명 |
|---|---|---|
| APM | error_type + error_message + error_stack |
오류 유형, 오류 정보, 오류 스택의 조합 |
| RUM | error_type + error_message + error_stack |
오류 유형, 오류 정보, 오류 스택의 조합 |
로그(error_stack 포함) |
error_type + error_message + error_stack |
오류 유형, 오류 정보, 오류 스택의 조합 |
로그(error_stack 미포함) |
error_type + error_message |
오류 유형, 오류 정보의 조합 |
b. 데이터 무결성 요구 사항:
오류 지문 생성은 데이터 무결성을 전제로 합니다. APM, RUM, 로그 데이터에는 위 경로의 필드가 포함되어야 fingerprint가 생성됩니다. 필드가 누락된 경우 해당 데이터는 건너뜁니다.
c. 표준화 처리:
-
지문 계산 전에 시스템은 표준화 처리를 수행하여 오류 정보(
error_message)에 포함된 변수 내용(예: 타임스탬프, 사용자 ID, UUID 등)을 자동으로 식별하고 필터링하여 동일한 논리적 오류의 지문이 일관되도록 합니다. -
스택 정보(
error_stack)는 최적화되어 주요 비즈니스 호출 라인만 유지하고 프레임워크 내부 호출 및 타사 라이브러리 호출은 필터링합니다. -
시스템은 필드完整性을 엄격히 검증하며, 필수 필드가 누락된 데이터는 제외됩니다.
2. 오류 문제 식별자(Issue ID 생성)
a. 오류 지문을 기반으로 시스템은 오류 발생 컨텍스트를 결합하여 고유한 문제 식별자(issue_id)를 생성합니다. 이는 오류 센터 내에서 해당 문제를 추적하고 관리하는 데 사용됩니다. 구체적인 생성 로직은 다음과 같습니다:
- APM 오류:
service+fingerprint(서비스 이름 + 지문) - RUM 오류:
app_name+fingerprint(애플리케이션 이름 + 지문) - 로그 오류:
service+fingerprint(서비스 이름 + 지문)
b. 수명 주기 시작:
시스템이 특정 오류 조합에 대해 처음으로 새 issue_id를 생성하면 작업 공간에 해당 문제의 첫 발생 시간을 자동으로 기록하고, 전체 수명 주기에 대한 상태 추적 및 집계 분석을 시작합니다.
3. 오류 데이터 저장
| 속성 | 구성 | 설명 |
|---|---|---|
| 저장 위치 | 독립 네임스페이스 | 원본 APM, RUM, 로그 데이터와 분리되어 저장 |
| 보존 기간 | 기본 90일 | 사용자 지정 불가능 |
| 일일 상한 | 10,000개의 새 Issue | 각 워크스페이스의 일일 새 오류 문제 상한 |
| 초과 처리 | 초과분 폐기 | 10,000개를 초과하는 새 오류는 기록되지 않음 |
일반적인 사용 사례¶
사례 1: 백엔드 서비스 예외 집계¶
전자상거래 플랫폼의 주문 서비스가 프로모션 기간에 수만 건의 NullPointerException을 생성하며, 전통적인 방식에서는 서로 다른 주문 ID로 인해 알림이 분산됩니다.
해결 방법:
- APM 오류 규칙 구성하여 order-service 모니터링
- 오류 센터가 자동으로 지문을 추출하여 동일한 코드 위치의 예외를 단일 Issue로 집계
- 개발 팀은 하나의 근본 원인만 처리하면 되며, 수정 후 관련 알림이 모두 사라짐
👆🏻 "알림 폭풍"에서 "정확한 위치 파악"으로, 처리 효율성이 크게 향상됩니다.
사례 2: 프론트엔드 오류 추적¶
사용자가 결제 페이지에서 간헐적으로 흰 화면이 발생한다고 신고했지만 재현이 불가능하며, 전통적인 로그에는 사용자 측 컨텍스트가 부족합니다.
해결 방법:
- RUM 오류 규칙을 구성하여 웹 애플리케이션 오류 수집
- 오류 목록에서 RUM 및 애플리케이션 유형을 필터링하고 상세 페이지로 이동
- "세션 리플레이"를 확인하여 사용자 작업 경로 재구성: 쿠폰 클릭 → 구문 분석 실패 → 흰 화면
- 오류 스택을 확인하고 SourceMap이 자동으로 소스 코드 42번째 줄의 JSON 구문 분석 로직으로 매핑
👆🏻 "재현 불가능"에서 "초 단위 위치 파악"으로, 사용자 경험 문제 수정 주기가 일 단위에서 시간 단위로 단축됩니다.
사례 3: 로그 이상 연관 분석¶
애플리케이션 로그에 "Connection Timeout"이 빈번하게 발생하지만 네트워크 문제인지 다운스트림 서비스 문제인지 확인할 수 없습니다.
해결 방법:
- 로그 오류 규칙 구성하여 error_type:DBError를 포함한 로그 수집
- 오류 상세 페이지에서 "연결된 분산 추적"을 확인하여 분산 추적 오류 세부 정보에서
payment-service호출 시 시간 초과 발생 확인 - "인프라 종속성"을 확인하여 데이터베이스 연결 풀 모니터링에서 연결 소진 확인
- 근본 원인 파악: 다운스트림 결제 서비스 스레드 풀 구성 부족이 원인이며 네트워크 문제가 아님
👆🏻 "표면 현상"에서 "근본 원인 파악"으로, 오판으로 인한无效 최적화를 방지합니다.
시작하기¶
전제 조건¶
시작하기 전에 데이터가 Guance에 연결되었는지 확인하세요:
- APM: 서비스가 연결되어
trace데이터를 보고해야 함 - RUM: 웹 등 애플리케이션에 SDK가 통합되어야 함
- 로그: 로그에 인덱스가 생성되고 오류 필드가 포함되어야 함
구성 시작¶
오류 센터는 구성 기반 방식으로 작동합니다.
- 사용 전에 오류 전달 규칙 생성을 통해 모니터링할 데이터 범위(특정 로그 인덱스, APM 서비스 또는 RUM 애플리케이션)를 명확히 지정해야 합니다.
- 구성 완료 후 시스템은 선택한 데이터 소스에서 발생한 오류에 대해서만 지능형 분석 및 집계를 수행합니다. 오류 목록으로 이동하여 집계된 오류 Issue를 확인하고 상태, 소스 등으로 필터링하여 관리할 수 있습니다.
- 또한 오류 상세 정보를 분석하여 개별 오류를 심층적으로 파악하고, 분산 추적, 로그, 세션과 연결하여 근본 원인 분석을 수행할 수 있습니다.

