AWS SageMaker¶
AWS SageMaker のメトリクス情報を収集
設定¶
Func のインストール¶
Guance の統合 - 拡張 - ホスト版 Func の利用を推奨します。前提条件はすべて自動でインストールされるため、そのままスクリプトのインストールを進めてください。
Func を自前でデプロイする場合はFunc を自前でデプロイを参照してください。
インストールスクリプト¶
ヒント:要件を満たす Amazon AK を事前に準備してください(手早く済ませる場合は、
ReadOnlyAccessのグローバル読み取り専用権限を直接付与してもかまいません)
手動有効化スクリプト¶
-
Func コンソールにログインし、【スクリプトマーケット】をクリックして、Guance スクリプトマーケットに入り、
integration_aws_sagemakerを検索します。 -
【インストール】をクリックした後、対応するパラメータを入力します。AWS AK ID、AK Secret、およびアカウント名。
-
【デプロイして起動スクリプトを開始】をクリックすると、システムが自動的に
Startupスクリプトセットを作成し、対応する起動スクリプトを自動で設定します。 -
有効化後は、「管理 / 自動トリガー設定」で対応する自動トリガー設定を確認できます。【実行】をクリックすると、定期実行を待たずに即時で 1 回実行できます。しばらく待つと、実行タスクの履歴と対応するログを確認できます。
検証¶
- 「管理 / 自動トリガー設定」で、対応するタスクに自動トリガー設定が存在するか確認し、あわせてタスクの履歴とログを確認して異常がないかチェックします
- Guance の「基盤 / カスタム」で資産情報が存在するか確認します
- Guance の「メトリクス」で対応する監視データがあるか確認します
メトリクス¶
Amazon CloudWatch の設定が完了すると、デフォルトのメトリクスセットは以下のとおりです。設定によって、より多くのメトリクスを収集できます。
Amazon CloudWatch AWS SageMaker メトリクスの詳細
推論コンポーネントのメトリクス¶
| 指標 | 説明 |
|---|---|
| CPUUtilizationNormalized | 各推論コンポーネントのレプリカが報告する CPU 使用率の正規化メトリクス値。範囲は 0%〜100% です。NumberOfCpuCoresRequired パラメータを設定している場合は予約済み使用率を表示し、それ以外の場合は上限超過分の使用率を表示します |
| GPUMemoryUtilizationNormalized | 各推論コンポーネントのレプリカが報告する GPU メモリ使用率の正規化メトリクス値 |
| GPUUtilizationNormalized | 各推論コンポーネントのレプリカが報告する GPU 使用率の正規化メトリクス値。NumberOfAcceleratorDevicesRequired パラメータを設定している場合は予約済み使用率を表示し、それ以外の場合は上限超過分の使用率を表示します |
| MemoryUtilizationNormalized | 各推論コンポーネントのレプリカが報告するメモリ使用率の正規化値。MinMemoryRequiredInMb パラメータを設定している場合は予約済み使用率を表示し、それ以外の場合は上限超過分の使用率を表示します |
推論コンポーネントメトリクスのディメンション¶
| ディメンション | 説明 |
|---|---|
| InferenceComponentName | 推論コンポーネントのメトリクスを絞り込む |
マルチモデルエンドポイントのモデル読み込みメトリクス¶
| 指標 | 説明 |
|---|---|
| ModelLoadingWaitTime | 推論を実行するために、呼び出しリクエストが対象モデルのダウンロード、読み込み、またはダウンロードと読み込みの両方を待機する時間間隔。単位:マイクロ秒。有効な統計情報:Average、Sum、Min、Max、Sample Count |
| ModelUnloadingTime | コンテナの UnloadModel API 呼び出しによってモデルをアンロードするのにかかる時間間隔。単位:マイクロ秒。有効な統計情報:Average、Sum、Min、Max、Sample Count |
| ModelDownloadingTime | Amazon S3 からモデルをダウンロードするのにかかる時間間隔。単位:マイクロ秒。有効な統計情報:Average、Sum、Min、Max、Sample Count |
| ModelLoadingTime | コンテナの LoadModel API 呼び出しによってモデルを読み込むのにかかる時間間隔。単位:マイクロ秒。有効な統計情報:Average、Sum、Min、Max、Sample Count |
| ModelCacheHit | すでに読み込まれているモデルに送られたマルチモデルエンドポイントへの InvokeEndpoint リクエスト数。"Average" 統計では、読み込み済みモデルに対するリクエスト比率が示されます。単位:なし。有効な統計情報:Average、Sum、Sample Count |
マルチモデルエンドポイントのモデル読み込みメトリクスのディメンション¶
| ディメンション | 説明 |
|---|---|
| EndpointName, VariantName | 指定されたエンドポイントとバリアントに対する ProductionVariant のエンドポイント呼び出しメトリクスを絞り込む |