AWS SageMaker¶
AWS SageMaker 메트릭 정보를 수집합니다
설정¶
Func 설치¶
Guance 통합 - 확장 - 관리형 Func 사용을 권장합니다: 모든 사전 조건이 자동으로 설치되므로, 스크립트 설치를 계속 진행하세요
직접 Func를 배포하는 경우 Func 직접 배포를 참고하세요
설치 스크립트¶
안내: 요구 사항을 충족하는 Amazon AK를 미리 준비하세요. (간단하게 하려면, 전역 읽기 전용 권한
ReadOnlyAccess를 직접 부여해도 됩니다)
수동 활성화 스크립트¶
-
Func 콘솔에 로그인한 뒤, 【스크립트 마켓】을 클릭하여 Guance 스크립트 마켓으로 들어가
integration_aws_sagemaker를 검색합니다 -
【설치】를 클릭한 후, 해당 파라미터를 입력합니다: AWS AK ID, AK Secret 및 계정명
-
【배포 시작 스크립트】를 클릭하면 시스템이 자동으로
Startup스크립트 세트를 생성하고, 해당 시작 스크립트를 자동으로 구성합니다 -
활성화 후에는 「관리 / 자동 트리거 설정」에서 해당 자동 트리거 구성을 확인할 수 있습니다. 【실행】을 클릭하면 예약 시간 없이 즉시 한 번 실행됩니다. 잠시 후 실행 작업 기록과 해당 로그를 확인할 수 있습니다
검증¶
- 「관리 / 자동 트리거 설정」에서 해당 작업의 자동 트리거 구성이 존재하는지 확인하고, 작업 기록과 로그를 확인하여 이상이 있는지 점검합니다
- Guance의 「인프라 / 사용자 정의」에서 자산 정보가 있는지 확인합니다
- Guance의 「메트릭」에서 해당 모니터링 데이터가 있는지 확인합니다
메트릭¶
Amazon CloudWatch를 구성하면 기본 메트릭 집합은 다음과 같습니다. 구성 방식으로 더 많은 메트릭을 수집할 수 있습니다:
Amazon CloudWatch AWS SageMaker 메트릭 상세
추론 컴포넌트 메트릭¶
| 메트릭 | 설명 |
|---|---|
| CPUUtilizationNormalized | 각 추론 컴포넌트 복제본이 보고하는 CPU 사용률 정규화 메트릭 값이며, 범위는 0%-100%입니다. NumberOfCpuCoresRequired 파라미터가 설정된 경우 예약된 사용률이 표시되고, 그렇지 않으면 초과 제한 사용률이 표시됩니다 |
| GPUMemoryUtilizationNormalized | 각 추론 컴포넌트 복제본이 보고하는 GPU 메모리 사용률 정규화 메트릭 값입니다 |
| GPUUtilizationNormalized | 각 추론 컴포넌트 복제본이 보고하는 GPU 사용률 정규화 메트릭 값입니다. NumberOfAcceleratorDevicesRequired 파라미터가 설정된 경우 예약된 사용률이 표시되고, 그렇지 않으면 초과 제한 사용률이 표시됩니다 |
| MemoryUtilizationNormalized | 각 추론 컴포넌트 복제본이 보고하는 메모리 사용률 정규화 값입니다. MinMemoryRequiredInMb 파라미터가 설정된 경우 예약된 사용률이 표시되고, 그렇지 않으면 초과 제한 사용률이 표시됩니다 |
추론 컴포넌트 메트릭의 차원¶
| 차원 | 설명 |
|---|---|
| InferenceComponentName | 추론 컴포넌트 메트릭을 필터링합니다 |
멀티 모델 엔드포인트 모델 로드 메트릭¶
| 메트릭 | 설명 |
|---|---|
| ModelLoadingWaitTime | 호출 요청이 대상 모델을 다운로드, 로드하거나 다운로드와 로드를 동시에 수행하여 추론을 실행할 때까지 대기한 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count |
| ModelUnloadingTime | 컨테이너의 UnloadModel API 호출을 통해 모델을 언로드하는 데 걸린 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count |
| ModelDownloadingTime | Amazon S3에서 모델을 다운로드하는 데 걸린 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count |
| ModelLoadingTime | 컨테이너의 LoadModel API 호출을 통해 모델을 로드하는 데 걸린 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count |
| ModelCacheHit | 이미 로드된 모델로 전송된 멀티 모델 엔드포인트의 InvokeEndpoint 요청 수입니다. "Average" 통계는 이미 로드된 모델에 대한 요청 비율을 보여줍니다. 단위: 없음. 유효한 통계: Average, Sum, Sample Count |
멀티 모델 엔드포인트 모델 로드 메트릭의 차원¶
| 차원 | 설명 |
|---|---|
| EndpointName, VariantName | 지정된 엔드포인트와 변형에 대한 ProductionVariant를 대상으로 엔드포인트 호출 메트릭을 필터링합니다 |