SLO¶
Guance SLO는 서비스가 약정된 안정성 목표를 충족하는지 지속적으로 평가하는 데 사용됩니다. 최근 7일 또는 30일을 평가 주기로 선택하고, 모니터 이상 시간 또는 비즈니스 성공 건수를 기준으로 달성률을 계산할 수 있습니다. 목표 미달 시 알림 정책을 통해 관련 담당자에게 알릴 수 있습니다.
개념¶
| 용어 | 설명 |
|---|---|
| SLI(서비스 수준 지표) | 서비스 품질을 측정하는 지표(예: 정상 가동 시간 비율, 요청 성공률). |
| SLO(서비스 수준 목표) | 지정된 평가 주기 내에서 SLI가 달성해야 하는 목표(예: "최근 30일 요청 성공률 99.9%"). |
| SLA(서비스 수준 계약) | 서비스 제공자와 고객이 약정한 서비스 품질 보증. SLO 달성률을 통해 서비스 품질을 지속적으로 관찰할 수 있습니다. |
| 오류 예산 | 목표가 허용하는 실패 한도. 모니터 유형 SLO의 경우 허용 가능한 이상 시간으로 표시됩니다. |
SLI 유형 선택¶
| SLI 유형 | 사용 사례 | 달성률 계산 |
|---|---|---|
| 모니터 | 모니터를 통해 서비스 이상 여부를 판단하고 있으며, 서비스 정상 가동 시간 비율을 측정하려는 경우. | (평가 주기 시간 − 이상 시간) ÷ 평가 주기 시간 × 100%. |
| 메트릭 | 요청 수, 작업 수 등 비즈니스 수량을 수집하고 있으며, 성공 요청 또는 성공 작업의 비율을 측정하려는 경우. | 성공 수 ÷ 총 수 × 100%. |
예를 들어, 동일한 결제 서비스라도 모니터를 선택하면 서비스가 정상 가동된 시간을 평가할 수 있고, 메트릭을 선택하면 통계에 포함된 결제 요청 중 성공 건수를 평가할 수 있습니다. 비즈니스 약정에 따라 통계 기준을 선택하세요.
모니터 유형¶
하나 이상의 모니터를 SLI로 선택합니다. 시스템은 이 모니터들이 생성한 이상 이벤트를 기준으로 이상 커버 시간을 계산하며, 이상 시간은 분 단위로 차감됩니다. 여러 이상 커버 시간대는 병합되며 중복 구간은 한 번만 계산됩니다. 그룹 차원을 구성한 경우 각 차원 조합별로 별도 계산됩니다.
예를 들어, 모니터 A는 10:00~10:05에, 모니터 B는 10:03~10:08에 이상 상태였으며 두 모니터는 동일한 평가 대상에 속합니다. 병합 후 이상 커버 시간은 10:00~10:08이며, 이번 차감 시간은 8분입니다.
선택한 평가 주기 내에서 이상 시간을 누적 차감한 후 계산합니다:
- 달성률 = (주기 총 분 수 − 누적 이상 분 수) ÷ 주기 총 분 수 × 100%.
- 초기 오류 예산 = 주기 총 분 수 × (1 − 목표 ÷ 100).
- 잔여 오류 예산 = 초기 오류 예산 − 누적 이상 분 수.
7일 주기와 목표 99.9%를 예로 들면, 주기 전체는 7 × 24 × 60 = 10,080분이고 초기 오류 예산은 10,080 × 0.1% = 10.08분입니다. 이 7일 동안 위의 8분 이상만 발생했다면 달성률은 약 99.9206%, 잔여 오류 예산은 2.08분입니다.
생성 시 목표 및 최소 목표에 따라 이벤트 임계값을 설정하며, 프로젝트·환경·서비스별로 별도 평가가 필요한 경우 그룹 차원을 구성합니다.
메트릭 유형¶
총계와 성공 수 조회를 각각 구성하여 동일한 비즈니스 범위에서 평가 주기 내 수량을 집계한 후 성공률을 계산합니다. 자세한 구성과 예시는 SLO 생성을 참조하세요.
탐지할 때마다 전체 주기에 대한 통계 결과가 생성되며, 페이지에는 가장 최근의 유효 결과와 데이터 기준 시점이 표시됩니다. 메트릭 유형은 비즈니스 성공 비율을 측정하는 데 사용되며, 장애 시간 및 지속 시간 형태의 오류 예산은 모니터 유형에 사용됩니다.
평가 주기 및 탐지 빈도¶
평가 주기는 각 평가가 커버하는 시간 범위를 결정하며 최근 7일 또는 30일을 지원합니다. 탐지 빈도는 결과 업데이트 간격을 결정하며 5분 또는 10분을 지원합니다.
예를 들어, 평가 주기가 30일이고 탐지 빈도가 5분이면 5분마다 지난 30일간의 서비스 성과를 다시 평가합니다.
