コンテンツにスキップ

OpenLIT OTel GPU Collector

OpenLIT OTel GPU Collector は、OpenTelemetry OTLP を介して GPU ハードウェア、GPU プロセス、ホスト、および Linux/NVIDIA CUDA eBPF メトリクスを DataKit に送信します。

設定

前提条件

  • DataKit がインストール済みで、OpenLIT Collector から DataKit への OTLP ネットワーク到達性があること。
  • NVIDIA GPU コンテナを使用する場合、ホストには NVIDIA ドライバ、Docker、NVIDIA Container Toolkit が必要です。AMD では /dev/kfd/dev/dri をマウントし、Intel では /dev/dri をマウントします。
  • プロセス単位の GPU 帰属には、コンテナがホスト PID namespace を使用している必要があります。Linux/NVIDIA CUDA eBPF メトリクスには、BPF/PERFMON 権限とロック可能メモリも必要です。これらの権限がない場合でも、デバイス単位の hw.gpu.* メトリクスは動作しますが、プロセスおよび eBPF ビューは不完全になります。

DataKit OpenTelemetry 受信を有効化

cd /usr/local/datakit/conf.d
sudo cp samples/opentelemetry.conf.sample opentelemetry.conf
sudo vim opentelemetry.conf
[[inputs.opentelemetry]]
  customer_tags_all = true

  [inputs.opentelemetry.grpc]
    addr = "127.0.0.1:4317"
    max_payload = 16777216

Collector と DataKit が別ホストにある場合、または host network を使わない場合は、addr0.0.0.0:4317 に変更し、Collector 側のエンドポイントを DataKit の実際のプライベート IP または DNS の 4317 ポートに向け、ファイアウォールやセキュリティグループで送信元を制限してください。4317 を保護なしで公開しないでください。

DataKit を再起動します。

sudo datakit service -R

OpenLIT OTel GPU Collector の起動

NVIDIA GPU、Collector、DataKit が同一ホスト上にある例です。

docker pull ghcr.io/openlit/otel-gpu-collector:latest

docker run -d \
  --name otel-gpu-collector \
  --restart unless-stopped \
  --network host \
  --gpus all \
  --pid=host \
  --cap-add BPF \
  --cap-add PERFMON \
  --ulimit memlock=-1:-1 \
  -e OTEL_SERVICE_NAME=openlit-otel-gpu-collector \
  -e OTEL_RESOURCE_ATTRIBUTES='deployment.environment=production,team=ml,host.name=gpu-host-01' \
  -e OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317 \
  -e OTEL_EXPORTER_OTLP_PROTOCOL=grpc \
  -e OTEL_METRIC_EXPORT_INTERVAL=15000 \
  -e OTEL_GPU_EBPF_ENABLED=true \
  ghcr.io/openlit/otel-gpu-collector:latest

AMD コンテナでは --gpus all--device /dev/kfd:/dev/kfd --device /dev/dri:/dev/dri に置き換えます。Intel では --device /dev/dri:/dev/dri を使用します。AMD/Intel は CUDA eBPF パスを使用しないため、CUDA 専用ビューが空なのは機能範囲内です。

Kubernetes デプロイ

OpenLIT 公式は、各 GPU ノードで 1 つの Collector を DaemonSet として実行する構成をサポートしています。この統合では、バージョンによって変わる可能性のある完全な YAML は重複掲載しません。直接 OpenLIT Kubernetes DaemonSet 公式設定 を参照し、OTEL_EXPORTER_OTLP_ENDPOINT をクラスタ内から到達可能な DataKit または OpenTelemetry Collector サービスに向けてください。

Kubernetes デプロイでは、hostPID: true、GPU デバイスアクセス、kubelet PodResources のマウント、および eBPF に必要な BPF 権限を確実に保持してください。Node ラベルや providerID から host.type、クラウドベンダー、リージョンを識別したい場合は、公式例に従って ServiceAccount に nodes/get 権限も付与してください。EKS、GKE、AKS、またはセルフホストクラスタでの認証設定の違いは、公式ドキュメントを基準にしてください。

確認

  1. Guance の「メトリクス」で otel_service を検索し、hw.gpu.uphw.gpu.utilizationhw.gpu.memory.usage などが継続して送信されていることを確認します。
  2. プロセスまたは CUDA eBPF のグラフにデータがない場合は、host PID、GPU デバイスマッピング、BPF/PERFMON 権限、memlock、ワークロードが libcudart を読み込んでいるか、ホストのセキュリティポリシーが eBPF uprobe を妨げていないかを順に確認します。

メトリクス

OpenLIT のメトリクスは OTLP を通じて otel_service に書き込まれます。以下の表は、OpenLIT OTel GPU Collector 公式 Metrics Reference にある GPU ハードウェア、ホストシステム、Collector プロセス、GPU ワークロードプロセス、および CUDA eBPF メトリクスを網羅しています。

MetricName MetricDescribe Dimensions Unit
otel_service.gpu.core.limit Gauge;NVML が報告する GPU CUDA コア総数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor {cores}
otel_service.gpu.kernel.block.size_bucket Histogram bucket;CUDA Kernel の各 Block のスレッド数ヒストグラムを le 境界で累積した観測回数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.block.size_count Histogram count;CUDA Kernel の各 Block のスレッド数ヒストグラムの累積観測回数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.block.size_max Histogram max;CUDA Kernel の各 Block のスレッド数ヒストグラムにおける現在の集約周期の最大値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.block.size_min Histogram min;CUDA Kernel の各 Block のスレッド数ヒストグラムにおける現在の集約周期の最小値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.block.size_sum Histogram sum;CUDA Kernel の各 Block のスレッド数ヒストグラムの累計値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.grid.size_bucket Histogram bucket;CUDA Kernel Grid の総スレッド数ヒストグラムを le 境界で累積した観測回数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.grid.size_count Histogram count;CUDA Kernel Grid の総スレッド数ヒストグラムの累積観測回数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.grid.size_max Histogram max;CUDA Kernel Grid の総スレッド数ヒストグラムにおける現在の集約周期の最大値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.grid.size_min Histogram min;CUDA Kernel Grid の総スレッド数ヒストグラムにおける現在の集約周期の最小値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.grid.size_sum Histogram sum;CUDA Kernel Grid の総スレッド数ヒストグラムの累計値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.launch.calls Counter;CUDA Kernel の累積発射回数。rate の結果は 1 秒あたりの発射回数になります。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.shared_memory_bucket Histogram bucket;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムを le 境界で累積した観測回数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.shared_memory_count Histogram count;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムの累積観測回数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.shared_memory_max Histogram max;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムにおける現在の集約周期の最大値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.kernel.shared_memory_min Histogram min;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムにおける現在の集約周期の最小値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.kernel.shared_memory_sum Histogram sum;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムの累計値。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.allocations Counter;cudaMalloc による累積割り当てバイト数。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.copies_bucket{le=10000} Histogram bucket;CUDA 非同期メモリコピーのバイト数ヒストグラムを le 境界で累積した観測回数。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {copy}
otel_service.gpu.memory.copies_count Histogram count;CUDA 非同期メモリコピーのバイト数ヒストグラムの累積観測回数。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {copy}
otel_service.gpu.memory.copies_max Histogram max;CUDA 非同期メモリコピーのバイト数ヒストグラムにおける現在の集約周期の最大値。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.copies_min Histogram min;CUDA 非同期メモリコピーのバイト数ヒストグラムにおける現在の集約周期の最小値。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.copies_sum Histogram sum;CUDA 非同期メモリコピーのバイト数ヒストグラムの累計値。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.sm_active Gauge;GPU デバイス単位の launch-to-sync 時間帯の和集合の割合。元の値の範囲は 0..1 です。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.errors Counter;GPU ECC、PCIe、XID、または RAS の累積エラー数。 error_type, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_type, hw_vendor {error}
otel_service.hw.gpu.allocated Gauge;プロセスのメモリ使用量または GPU 利用率が設定しきい値に達したときに 1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.clock.graphics Gauge;GPU の Graphics/SM クロック周波数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor MHz
otel_service.hw.gpu.clock.memory Gauge;GPU のメモリクロック周波数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor MHz
otel_service.hw.gpu.energy.consumed Counter;GPU が累積消費したエネルギー。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor J
otel_service.hw.gpu.fan_speed Gauge;GPU ファン回転数。送信可否はベンダーとデバイスの能力に依存します。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor {rpm}
otel_service.hw.gpu.idle Gauge;GPU のアイドル割合。利用率が取得できる場合は 1 から利用率を引いた値になります。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.interconnect.throughput Gauge;GPU NVLink または XGMI インターコネクトの受信/送信スループット合計。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_interconnect_type, hw_id, hw_name, hw_vendor, network_io_direction By/s
otel_service.hw.gpu.memory.free UpDownCounter;GPU の空きメモリバイト数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor By
otel_service.hw.gpu.memory.limit UpDownCounter;GPU の総メモリ容量。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor By
otel_service.hw.gpu.memory.usage UpDownCounter;GPU の使用済みメモリバイト数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor By
otel_service.hw.gpu.memory.utilization Gauge;GPU メモリコントローラの利用率。元の値の範囲は 0..1 です。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.pcie.throughput Gauge;GPU の PCIe 受信/送信スループット。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, network_io_direction By/s
otel_service.hw.gpu.power.draw Gauge;GPU の現在消費電力。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor W
otel_service.hw.gpu.power.limit Gauge;GPU の消費電力上限。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor W
otel_service.hw.gpu.temperature Gauge;GPU チップまたはメモリの温度。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, sensor Cel
otel_service.hw.gpu.throttled Gauge;温度または電力によるスロットリングが有効なときに 1。原因は hw_gpu_throttle_reasons タグにあります。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.throttled{hw_gpu_throttle_reasons!=none} Gauge;温度または電力によるスロットリングが有効なときに 1。原因は hw_gpu_throttle_reasons タグにあります。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.up Gauge;GPU デバイスの収集に成功したときに 1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.utilization{hw_gpu_task=decoder} Gauge;GPU の計算、エンコード、またはデコード利用率。元の値の範囲は 0..1 です。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.utilization{hw_gpu_task=encoder} Gauge;GPU の計算、エンコード、またはデコード利用率。元の値の範囲は 0..1 です。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.utilization{hw_gpu_task=general} Gauge;GPU の計算、エンコード、またはデコード利用率。元の値の範囲は 0..1 です。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, team 1(0..1)
otel_service.process.cpu.time Counter;Collector プロセスの累積 CPU 時間。 cpu_mode, host, host_name s
otel_service.process.cpu.utilization Gauge;Collector プロセスの CPU 利用率。元の値の範囲は 0..1 です。 host, host_name 1(0..1)
otel_service.process.gpu.core.usage Gauge;プロセスの Kernel 発射から同期までの期間における、正規化済み平均 CUDA コア使用量。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {cores}
otel_service.process.gpu.memory.usage UpDownCounter;指定 GPU 上でプロセスが使用しているメモリバイト数。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.process.gpu.sm_active Gauge;サンプリング周期内でプロセスが launch-to-sync 時間帯を持つ割合。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind 1(0..1)
otel_service.process.gpu.utilization Gauge;プロセスの GPU 利用率。元の値の範囲は 0..1 です。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind 1(0..1)
otel_service.process.memory.usage UpDownCounter;Collector プロセスの常駐メモリ RSS。 host, host_name By
otel_service.process.memory.virtual UpDownCounter;Collector プロセスの仮想メモリサイズ。 host, host_name By
otel_service.process.runtime.go.goroutines Gauge;Collector プロセスの Go goroutine 数。 host, host_name {goroutine}
otel_service.process.runtime.go.mem.heap_alloc Gauge;Collector プロセスで割り当て済みの Go ヒープメモリ。 host, host_name By
otel_service.process.thread.count UpDownCounter;Collector プロセスの OS スレッド数。 host, host_name {thread}
otel_service.process.unix.file_descriptor.count UpDownCounter;Collector プロセスが開いているファイルディスクリプタ数。 host, host_name {file_descriptor}
otel_service.process.uptime Gauge;GPU 帰属プロセスの稼働時間。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind s
otel_service.system.cpu.logical.count UpDownCounter;ホストの論理 CPU コア数。 host, host_name {cpu}
otel_service.system.cpu.utilization Gauge;各論理 CPU コアの利用率。元の値の範囲は 0..1 です。 cpu_logical_number, host, host_name 1(0..1)
otel_service.system.disk.io Counter;ディスクの累積読み書きバイト数。 disk_io_direction, host, host_name, system_device By
otel_service.system.disk.operations Counter;ディスクの累積読み書き操作数。 disk_io_direction, host, host_name, system_device {operation}
otel_service.system.filesystem.usage UpDownCounter;状態別のファイルシステム空き容量バイト数。 host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_state, system_filesystem_type By
otel_service.system.filesystem.utilization Gauge;ファイルシステム利用率。元の値の範囲は 0..1 です。 host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_type 1(0..1)
otel_service.system.memory.usage UpDownCounter;状態別のホストメモリバイト数。 host, host_name, system_memory_state By
otel_service.system.memory.utilization Gauge;ホストメモリ利用率。元の値の範囲は 0..1 です。 host, host_name 1(0..1)
otel_service.system.network.errors Counter;ネットワークインターフェースの累積送受信エラー数。 host, host_name, network_interface_name, network_io_direction {error}
otel_service.system.network.io Counter;ネットワークインターフェースの累積送受信バイト数。 host, host_name, network_interface_name, network_io_direction By

フィードバック

このページは役に立ちましたか?