콘텐츠로 이동

AWS SageMaker

AWS SageMaker 메트릭 정보를 수집합니다

설정

Func 설치

Guance 통합 - 확장 - 관리형 Func 사용을 권장합니다: 모든 사전 조건이 자동으로 설치되므로, 스크립트 설치를 계속 진행하세요

직접 Func를 배포하는 경우 Func 직접 배포를 참고하세요

설치 스크립트

안내: 요구 사항을 충족하는 Amazon AK를 미리 준비하세요. (간단하게 하려면, 전역 읽기 전용 권한 ReadOnlyAccess를 직접 부여해도 됩니다)

수동 활성화 스크립트

  1. Func 콘솔에 로그인한 뒤, 【스크립트 마켓】을 클릭하여 Guance 스크립트 마켓으로 들어가 integration_aws_sagemaker를 검색합니다

  2. 【설치】를 클릭한 후, 해당 파라미터를 입력합니다: AWS AK ID, AK Secret 및 계정명

  3. 【배포 시작 스크립트】를 클릭하면 시스템이 자동으로 Startup 스크립트 세트를 생성하고, 해당 시작 스크립트를 자동으로 구성합니다

  4. 활성화 후에는 「관리 / 자동 트리거 설정」에서 해당 자동 트리거 구성을 확인할 수 있습니다. 【실행】을 클릭하면 예약 시간 없이 즉시 한 번 실행됩니다. 잠시 후 실행 작업 기록과 해당 로그를 확인할 수 있습니다

검증

  1. 「관리 / 자동 트리거 설정」에서 해당 작업의 자동 트리거 구성이 존재하는지 확인하고, 작업 기록과 로그를 확인하여 이상이 있는지 점검합니다
  2. Guance의 「인프라 / 사용자 정의」에서 자산 정보가 있는지 확인합니다
  3. Guance의 「메트릭」에서 해당 모니터링 데이터가 있는지 확인합니다

메트릭

Amazon CloudWatch를 구성하면 기본 메트릭 집합은 다음과 같습니다. 구성 방식으로 더 많은 메트릭을 수집할 수 있습니다:

Amazon CloudWatch AWS SageMaker 메트릭 상세

추론 컴포넌트 메트릭

메트릭 설명
CPUUtilizationNormalized 각 추론 컴포넌트 복제본이 보고하는 CPU 사용률 정규화 메트릭 값이며, 범위는 0%-100%입니다. NumberOfCpuCoresRequired 파라미터가 설정된 경우 예약된 사용률이 표시되고, 그렇지 않으면 초과 제한 사용률이 표시됩니다
GPUMemoryUtilizationNormalized 각 추론 컴포넌트 복제본이 보고하는 GPU 메모리 사용률 정규화 메트릭 값입니다
GPUUtilizationNormalized 각 추론 컴포넌트 복제본이 보고하는 GPU 사용률 정규화 메트릭 값입니다. NumberOfAcceleratorDevicesRequired 파라미터가 설정된 경우 예약된 사용률이 표시되고, 그렇지 않으면 초과 제한 사용률이 표시됩니다
MemoryUtilizationNormalized 각 추론 컴포넌트 복제본이 보고하는 메모리 사용률 정규화 값입니다. MinMemoryRequiredInMb 파라미터가 설정된 경우 예약된 사용률이 표시되고, 그렇지 않으면 초과 제한 사용률이 표시됩니다
추론 컴포넌트 메트릭의 차원
차원 설명
InferenceComponentName 추론 컴포넌트 메트릭을 필터링합니다

멀티 모델 엔드포인트 모델 로드 메트릭

메트릭 설명
ModelLoadingWaitTime 호출 요청이 대상 모델을 다운로드, 로드하거나 다운로드와 로드를 동시에 수행하여 추론을 실행할 때까지 대기한 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count
ModelUnloadingTime 컨테이너의 UnloadModel API 호출을 통해 모델을 언로드하는 데 걸린 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count
ModelDownloadingTime Amazon S3에서 모델을 다운로드하는 데 걸린 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count
ModelLoadingTime 컨테이너의 LoadModel API 호출을 통해 모델을 로드하는 데 걸린 시간 간격입니다. 단위: 마이크로초. 유효한 통계: Average, Sum, Min, Max, Sample Count
ModelCacheHit 이미 로드된 모델로 전송된 멀티 모델 엔드포인트의 InvokeEndpoint 요청 수입니다. "Average" 통계는 이미 로드된 모델에 대한 요청 비율을 보여줍니다. 단위: 없음. 유효한 통계: Average, Sum, Sample Count
멀티 모델 엔드포인트 모델 로드 메트릭의 차원
차원 설명
EndpointName, VariantName 지정된 엔드포인트와 변형에 대한 ProductionVariant를 대상으로 엔드포인트 호출 메트릭을 필터링합니다

문서 평가

이 페이지가 도움이 되었나요?