OpenLIT OTel GPU Collector
OpenLIT OTel GPU Collector は、OpenTelemetry OTLP を介して GPU ハードウェア、GPU プロセス、ホスト、および Linux/NVIDIA CUDA eBPF メトリクスを DataKit に送信します。
設定¶
前提条件¶
- DataKit がインストール済みで、OpenLIT Collector から DataKit への OTLP ネットワーク到達性があること。
- NVIDIA GPU コンテナを使用する場合、ホストには NVIDIA ドライバ、Docker、NVIDIA Container Toolkit が必要です。AMD では
/dev/kfdと/dev/driをマウントし、Intel では/dev/driをマウントします。 - プロセス単位の GPU 帰属には、コンテナがホスト PID namespace を使用している必要があります。Linux/NVIDIA CUDA eBPF メトリクスには、BPF/PERFMON 権限とロック可能メモリも必要です。これらの権限がない場合でも、デバイス単位の
hw.gpu.*メトリクスは動作しますが、プロセスおよび eBPF ビューは不完全になります。
DataKit OpenTelemetry 受信を有効化¶
cd /usr/local/datakit/conf.d
sudo cp samples/opentelemetry.conf.sample opentelemetry.conf
sudo vim opentelemetry.conf
[[inputs.opentelemetry]]
customer_tags_all = true
[inputs.opentelemetry.grpc]
addr = "127.0.0.1:4317"
max_payload = 16777216
Collector と DataKit が別ホストにある場合、または host network を使わない場合は、addr を 0.0.0.0:4317 に変更し、Collector 側のエンドポイントを DataKit の実際のプライベート IP または DNS の 4317 ポートに向け、ファイアウォールやセキュリティグループで送信元を制限してください。4317 を保護なしで公開しないでください。
DataKit を再起動します。
OpenLIT OTel GPU Collector の起動¶
NVIDIA GPU、Collector、DataKit が同一ホスト上にある例です。
docker pull ghcr.io/openlit/otel-gpu-collector:latest
docker run -d \
--name otel-gpu-collector \
--restart unless-stopped \
--network host \
--gpus all \
--pid=host \
--cap-add BPF \
--cap-add PERFMON \
--ulimit memlock=-1:-1 \
-e OTEL_SERVICE_NAME=openlit-otel-gpu-collector \
-e OTEL_RESOURCE_ATTRIBUTES='deployment.environment=production,team=ml,host.name=gpu-host-01' \
-e OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317 \
-e OTEL_EXPORTER_OTLP_PROTOCOL=grpc \
-e OTEL_METRIC_EXPORT_INTERVAL=15000 \
-e OTEL_GPU_EBPF_ENABLED=true \
ghcr.io/openlit/otel-gpu-collector:latest
AMD コンテナでは --gpus all を --device /dev/kfd:/dev/kfd --device /dev/dri:/dev/dri に置き換えます。Intel では --device /dev/dri:/dev/dri を使用します。AMD/Intel は CUDA eBPF パスを使用しないため、CUDA 専用ビューが空なのは機能範囲内です。
Kubernetes デプロイ¶
OpenLIT 公式は、各 GPU ノードで 1 つの Collector を DaemonSet として実行する構成をサポートしています。この統合では、バージョンによって変わる可能性のある完全な YAML は重複掲載しません。直接 OpenLIT Kubernetes DaemonSet 公式設定 を参照し、OTEL_EXPORTER_OTLP_ENDPOINT をクラスタ内から到達可能な DataKit または OpenTelemetry Collector サービスに向けてください。
Kubernetes デプロイでは、hostPID: true、GPU デバイスアクセス、kubelet PodResources のマウント、および eBPF に必要な BPF 権限を確実に保持してください。Node ラベルや providerID から host.type、クラウドベンダー、リージョンを識別したい場合は、公式例に従って ServiceAccount に nodes/get 権限も付与してください。EKS、GKE、AKS、またはセルフホストクラスタでの認証設定の違いは、公式ドキュメントを基準にしてください。
確認¶
- Guance の「メトリクス」で
otel_serviceを検索し、hw.gpu.up、hw.gpu.utilization、hw.gpu.memory.usageなどが継続して送信されていることを確認します。 - プロセスまたは CUDA eBPF のグラフにデータがない場合は、host PID、GPU デバイスマッピング、BPF/PERFMON 権限、memlock、ワークロードが
libcudartを読み込んでいるか、ホストのセキュリティポリシーが eBPF uprobe を妨げていないかを順に確認します。
メトリクス¶
OpenLIT のメトリクスは OTLP を通じて otel_service に書き込まれます。以下の表は、OpenLIT OTel GPU Collector 公式 Metrics Reference にある GPU ハードウェア、ホストシステム、Collector プロセス、GPU ワークロードプロセス、および CUDA eBPF メトリクスを網羅しています。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
otel_service.gpu.core.limit |
Gauge;NVML が報告する GPU CUDA コア総数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
{cores} |
otel_service.gpu.kernel.block.size_bucket |
Histogram bucket;CUDA Kernel の各 Block のスレッド数ヒストグラムを le 境界で累積した観測回数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.block.size_count |
Histogram count;CUDA Kernel の各 Block のスレッド数ヒストグラムの累積観測回数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.block.size_max |
Histogram max;CUDA Kernel の各 Block のスレッド数ヒストグラムにおける現在の集約周期の最大値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.block.size_min |
Histogram min;CUDA Kernel の各 Block のスレッド数ヒストグラムにおける現在の集約周期の最小値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.block.size_sum |
Histogram sum;CUDA Kernel の各 Block のスレッド数ヒストグラムの累計値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.grid.size_bucket |
Histogram bucket;CUDA Kernel Grid の総スレッド数ヒストグラムを le 境界で累積した観測回数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.grid.size_count |
Histogram count;CUDA Kernel Grid の総スレッド数ヒストグラムの累積観測回数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.grid.size_max |
Histogram max;CUDA Kernel Grid の総スレッド数ヒストグラムにおける現在の集約周期の最大値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.grid.size_min |
Histogram min;CUDA Kernel Grid の総スレッド数ヒストグラムにおける現在の集約周期の最小値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.grid.size_sum |
Histogram sum;CUDA Kernel Grid の総スレッド数ヒストグラムの累計値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.launch.calls |
Counter;CUDA Kernel の累積発射回数。rate の結果は 1 秒あたりの発射回数になります。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.shared_memory_bucket |
Histogram bucket;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムを le 境界で累積した観測回数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.shared_memory_count |
Histogram count;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムの累積観測回数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.shared_memory_max |
Histogram max;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムにおける現在の集約周期の最大値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.kernel.shared_memory_min |
Histogram min;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムにおける現在の集約周期の最小値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.kernel.shared_memory_sum |
Histogram sum;CUDA Kernel の各発射で使用される動的共有メモリヒストグラムの累計値。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.allocations |
Counter;cudaMalloc による累積割り当てバイト数。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.copies_bucket{le=10000} |
Histogram bucket;CUDA 非同期メモリコピーのバイト数ヒストグラムを le 境界で累積した観測回数。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{copy} |
otel_service.gpu.memory.copies_count |
Histogram count;CUDA 非同期メモリコピーのバイト数ヒストグラムの累積観測回数。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{copy} |
otel_service.gpu.memory.copies_max |
Histogram max;CUDA 非同期メモリコピーのバイト数ヒストグラムにおける現在の集約周期の最大値。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.copies_min |
Histogram min;CUDA 非同期メモリコピーのバイト数ヒストグラムにおける現在の集約周期の最小値。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.copies_sum |
Histogram sum;CUDA 非同期メモリコピーのバイト数ヒストグラムの累計値。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.sm_active |
Gauge;GPU デバイス単位の launch-to-sync 時間帯の和集合の割合。元の値の範囲は 0..1 です。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.errors |
Counter;GPU ECC、PCIe、XID、または RAS の累積エラー数。 | error_type, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_type, hw_vendor |
{error} |
otel_service.hw.gpu.allocated |
Gauge;プロセスのメモリ使用量または GPU 利用率が設定しきい値に達したときに 1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.clock.graphics |
Gauge;GPU の Graphics/SM クロック周波数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
MHz |
otel_service.hw.gpu.clock.memory |
Gauge;GPU のメモリクロック周波数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
MHz |
otel_service.hw.gpu.energy.consumed |
Counter;GPU が累積消費したエネルギー。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
J |
otel_service.hw.gpu.fan_speed |
Gauge;GPU ファン回転数。送信可否はベンダーとデバイスの能力に依存します。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
{rpm} |
otel_service.hw.gpu.idle |
Gauge;GPU のアイドル割合。利用率が取得できる場合は 1 から利用率を引いた値になります。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.interconnect.throughput |
Gauge;GPU NVLink または XGMI インターコネクトの受信/送信スループット合計。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_interconnect_type, hw_id, hw_name, hw_vendor, network_io_direction |
By/s |
otel_service.hw.gpu.memory.free |
UpDownCounter;GPU の空きメモリバイト数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
By |
otel_service.hw.gpu.memory.limit |
UpDownCounter;GPU の総メモリ容量。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
By |
otel_service.hw.gpu.memory.usage |
UpDownCounter;GPU の使用済みメモリバイト数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
By |
otel_service.hw.gpu.memory.utilization |
Gauge;GPU メモリコントローラの利用率。元の値の範囲は 0..1 です。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.pcie.throughput |
Gauge;GPU の PCIe 受信/送信スループット。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, network_io_direction |
By/s |
otel_service.hw.gpu.power.draw |
Gauge;GPU の現在消費電力。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
W |
otel_service.hw.gpu.power.limit |
Gauge;GPU の消費電力上限。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
W |
otel_service.hw.gpu.temperature |
Gauge;GPU チップまたはメモリの温度。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, sensor |
Cel |
otel_service.hw.gpu.throttled |
Gauge;温度または電力によるスロットリングが有効なときに 1。原因は hw_gpu_throttle_reasons タグにあります。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.throttled{hw_gpu_throttle_reasons!=none} |
Gauge;温度または電力によるスロットリングが有効なときに 1。原因は hw_gpu_throttle_reasons タグにあります。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.up |
Gauge;GPU デバイスの収集に成功したときに 1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.utilization{hw_gpu_task=decoder} |
Gauge;GPU の計算、エンコード、またはデコード利用率。元の値の範囲は 0..1 です。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.utilization{hw_gpu_task=encoder} |
Gauge;GPU の計算、エンコード、またはデコード利用率。元の値の範囲は 0..1 です。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.utilization{hw_gpu_task=general} |
Gauge;GPU の計算、エンコード、またはデコード利用率。元の値の範囲は 0..1 です。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, team |
1(0..1) |
otel_service.process.cpu.time |
Counter;Collector プロセスの累積 CPU 時間。 | cpu_mode, host, host_name |
s |
otel_service.process.cpu.utilization |
Gauge;Collector プロセスの CPU 利用率。元の値の範囲は 0..1 です。 | host, host_name |
1(0..1) |
otel_service.process.gpu.core.usage |
Gauge;プロセスの Kernel 発射から同期までの期間における、正規化済み平均 CUDA コア使用量。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{cores} |
otel_service.process.gpu.memory.usage |
UpDownCounter;指定 GPU 上でプロセスが使用しているメモリバイト数。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.process.gpu.sm_active |
Gauge;サンプリング周期内でプロセスが launch-to-sync 時間帯を持つ割合。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
1(0..1) |
otel_service.process.gpu.utilization |
Gauge;プロセスの GPU 利用率。元の値の範囲は 0..1 です。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
1(0..1) |
otel_service.process.memory.usage |
UpDownCounter;Collector プロセスの常駐メモリ RSS。 | host, host_name |
By |
otel_service.process.memory.virtual |
UpDownCounter;Collector プロセスの仮想メモリサイズ。 | host, host_name |
By |
otel_service.process.runtime.go.goroutines |
Gauge;Collector プロセスの Go goroutine 数。 | host, host_name |
{goroutine} |
otel_service.process.runtime.go.mem.heap_alloc |
Gauge;Collector プロセスで割り当て済みの Go ヒープメモリ。 | host, host_name |
By |
otel_service.process.thread.count |
UpDownCounter;Collector プロセスの OS スレッド数。 | host, host_name |
{thread} |
otel_service.process.unix.file_descriptor.count |
UpDownCounter;Collector プロセスが開いているファイルディスクリプタ数。 | host, host_name |
{file_descriptor} |
otel_service.process.uptime |
Gauge;GPU 帰属プロセスの稼働時間。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
s |
otel_service.system.cpu.logical.count |
UpDownCounter;ホストの論理 CPU コア数。 | host, host_name |
{cpu} |
otel_service.system.cpu.utilization |
Gauge;各論理 CPU コアの利用率。元の値の範囲は 0..1 です。 | cpu_logical_number, host, host_name |
1(0..1) |
otel_service.system.disk.io |
Counter;ディスクの累積読み書きバイト数。 | disk_io_direction, host, host_name, system_device |
By |
otel_service.system.disk.operations |
Counter;ディスクの累積読み書き操作数。 | disk_io_direction, host, host_name, system_device |
{operation} |
otel_service.system.filesystem.usage |
UpDownCounter;状態別のファイルシステム空き容量バイト数。 | host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_state, system_filesystem_type |
By |
otel_service.system.filesystem.utilization |
Gauge;ファイルシステム利用率。元の値の範囲は 0..1 です。 | host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_type |
1(0..1) |
otel_service.system.memory.usage |
UpDownCounter;状態別のホストメモリバイト数。 | host, host_name, system_memory_state |
By |
otel_service.system.memory.utilization |
Gauge;ホストメモリ利用率。元の値の範囲は 0..1 です。 | host, host_name |
1(0..1) |
otel_service.system.network.errors |
Counter;ネットワークインターフェースの累積送受信エラー数。 | host, host_name, network_interface_name, network_io_direction |
{error} |
otel_service.system.network.io |
Counter;ネットワークインターフェースの累積送受信バイト数。 | host, host_name, network_interface_name, network_io_direction |
By |