跳转至

OpenLIT OTel GPU Collector

OpenLIT OTel GPU Collector 通过 OpenTelemetry OTLP 向 DataKit 上报 GPU 硬件、GPU 进程、主机以及 Linux/NVIDIA CUDA eBPF 指标。

配置

前置条件

  • 已安装 DataKit,且 OpenLIT Collector 到 DataKit 的 OTLP 网络可达。
  • 使用 NVIDIA GPU 容器时,主机需安装 NVIDIA 驱动、Docker 和 NVIDIA Container Toolkit。AMD 需映射 /dev/kfd/dev/dri,Intel 需映射 /dev/dri
  • 进程级 GPU 归因需容器使用主机 PID namespace。Linux/NVIDIA CUDA eBPF 指标还需要 BPF/PERFMON 能力与可锁定内存。没有这些权限时,设备级 hw.gpu.* 指标仍可工作,但进程和 eBPF 视图会不完整。

开启 DataKit OpenTelemetry 接收

cd /usr/local/datakit/conf.d
sudo cp samples/opentelemetry.conf.sample opentelemetry.conf
sudo vim opentelemetry.conf
[[inputs.opentelemetry]]
  customer_tags_all = true

  [inputs.opentelemetry.grpc]
    addr = "127.0.0.1:4317"
    max_payload = 16777216

Collector 与 DataKit 跨主机或不使用 host network 时,把 addr 改为 0.0.0.0:4317,Collector 端点改为 DataKit 实际私网 IP 或 DNS 的 4317 端口,并通过防火墙或安全组限制来源;不要将 4317 无保护暴露到公网。

重启 DataKit:

sudo datakit service -R

启动 OpenLIT OTel GPU Collector

以 NVIDIA GPU、Collector 与 DataKit 同机为例:

docker pull ghcr.io/openlit/otel-gpu-collector:latest

docker run -d \
  --name otel-gpu-collector \
  --restart unless-stopped \
  --network host \
  --gpus all \
  --pid=host \
  --cap-add BPF \
  --cap-add PERFMON \
  --ulimit memlock=-1:-1 \
  -e OTEL_SERVICE_NAME=openlit-otel-gpu-collector \
  -e OTEL_RESOURCE_ATTRIBUTES='deployment.environment=production,team=ml,host.name=gpu-host-01' \
  -e OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317 \
  -e OTEL_EXPORTER_OTLP_PROTOCOL=grpc \
  -e OTEL_METRIC_EXPORT_INTERVAL=15000 \
  -e OTEL_GPU_EBPF_ENABLED=true \
  ghcr.io/openlit/otel-gpu-collector:latest

AMD 容器把 --gpus all 替换为 --device /dev/kfd:/dev/kfd --device /dev/dri:/dev/dri;Intel 使用 --device /dev/dri:/dev/dri。AMD/Intel 不使用 CUDA eBPF 路径,因此 CUDA 专属视图为空属于能力边界。

Kubernetes 部署

OpenLIT 官方支持以 DaemonSet 在每个 GPU 节点运行一个 Collector。本集成不复制可能随版本变化的完整 YAML,请直接参考 OpenLIT Kubernetes DaemonSet 官方配置,并把 OTEL_EXPORTER_OTLP_ENDPOINT 指向集群内可达的 DataKit 或 OpenTelemetry Collector 服务。

Kubernetes 部署需要重点保留 hostPID: true、GPU 设备访问、kubelet PodResources 挂载以及 eBPF 所需的 BPF 权限;若要从 Node 标签或 providerID 识别 host.type、云厂商和区域,还需按官方示例授予 ServiceAccount nodes/get 权限。EKS、GKE、AKS 或自建集群的身份配置差异请以官方文档为准。

验证

  1. 在观测云「指标」中查询 otel_service,并确认 hw.gpu.uphw.gpu.utilizationhw.gpu.memory.usage 等持续上报。
  2. 若进程或 CUDA eBPF 图表无数据,依次核对 host PID、GPU 设备映射、BPF/PERFMON 能力、memlock、工作负载是否已加载 libcudart,以及主机安全策略是否阻止 eBPF uprobe。

指标

OpenLIT 指标通过 OTLP 写入 otel_service。下表覆盖 OpenLIT OTel GPU Collector 官方 Metrics Reference 中的 GPU 硬件、主机系统、Collector 进程、GPU 工作负载进程与 CUDA eBPF 指标。

MetricName MetricDescribe Dimensions Unit
otel_service.gpu.core.limit Gauge;NVML 报告的 GPU CUDA 核心总数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor {cores}
otel_service.gpu.kernel.block.size_bucket Histogram bucket;CUDA Kernel 每个 Block 的线程数直方图按 le 边界累计的观测次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.block.size_count Histogram count;CUDA Kernel 每个 Block 的线程数直方图的累计观测次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.block.size_max Histogram max;CUDA Kernel 每个 Block 的线程数直方图在当前聚合周期的最大值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.block.size_min Histogram min;CUDA Kernel 每个 Block 的线程数直方图在当前聚合周期的最小值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.block.size_sum Histogram sum;CUDA Kernel 每个 Block 的线程数直方图的累计值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.grid.size_bucket Histogram bucket;CUDA Kernel Grid 总线程数直方图按 le 边界累计的观测次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.grid.size_count Histogram count;CUDA Kernel Grid 总线程数直方图的累计观测次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.grid.size_max Histogram max;CUDA Kernel Grid 总线程数直方图在当前聚合周期的最大值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.grid.size_min Histogram min;CUDA Kernel Grid 总线程数直方图在当前聚合周期的最小值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.grid.size_sum Histogram sum;CUDA Kernel Grid 总线程数直方图的累计值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {thread}
otel_service.gpu.kernel.launch.calls Counter;CUDA Kernel 累计发射次数;rate 结果为每秒发射次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.shared_memory_bucket Histogram bucket;CUDA Kernel 每次发射使用的动态共享内存直方图按 le 边界累计的观测次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.shared_memory_count Histogram count;CUDA Kernel 每次发射使用的动态共享内存直方图的累计观测次数。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {call}
otel_service.gpu.kernel.shared_memory_max Histogram max;CUDA Kernel 每次发射使用的动态共享内存直方图在当前聚合周期的最大值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.kernel.shared_memory_min Histogram min;CUDA Kernel 每次发射使用的动态共享内存直方图在当前聚合周期的最小值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.kernel.shared_memory_sum Histogram sum;CUDA Kernel 每次发射使用的动态共享内存直方图的累计值。 container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.allocations Counter;通过 cudaMalloc 累计分配的字节数。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.copies_bucket{le=10000} Histogram bucket;CUDA 异步显存拷贝字节数直方图按 le 边界累计的观测次数。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {copy}
otel_service.gpu.memory.copies_count Histogram count;CUDA 异步显存拷贝字节数直方图的累计观测次数。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {copy}
otel_service.gpu.memory.copies_max Histogram max;CUDA 异步显存拷贝字节数直方图在当前聚合周期的最大值。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.copies_min Histogram min;CUDA 异步显存拷贝字节数直方图在当前聚合周期的最小值。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.memory.copies_sum Histogram sum;CUDA 异步显存拷贝字节数直方图的累计值。 container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.gpu.sm_active Gauge;GPU 设备级 launch-to-sync 时间段并集占比,原始值范围为 0..1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.errors Counter;GPU ECC、PCIe、XID 或 RAS 累计错误数。 error_type, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_type, hw_vendor {error}
otel_service.hw.gpu.allocated Gauge;进程显存占用或 GPU 利用率达到配置阈值时为 1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.clock.graphics Gauge;GPU Graphics/SM 时钟频率。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor MHz
otel_service.hw.gpu.clock.memory Gauge;GPU 显存时钟频率。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor MHz
otel_service.hw.gpu.energy.consumed Counter;GPU 累计消耗的能量。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor J
otel_service.hw.gpu.fan_speed Gauge;GPU 风扇转速;是否上报取决于厂商与设备能力。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor {rpm}
otel_service.hw.gpu.idle Gauge;GPU 空闲比例;可获得利用率时为 1 减去利用率。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.interconnect.throughput Gauge;GPU NVLink 或 XGMI 互连的聚合接收/发送吞吐率。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_interconnect_type, hw_id, hw_name, hw_vendor, network_io_direction By/s
otel_service.hw.gpu.memory.free UpDownCounter;GPU 空闲显存字节数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor By
otel_service.hw.gpu.memory.limit UpDownCounter;GPU 总显存容量。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor By
otel_service.hw.gpu.memory.usage UpDownCounter;GPU 已用显存字节数。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor By
otel_service.hw.gpu.memory.utilization Gauge;GPU 显存控制器利用率,原始值范围为 0..1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.pcie.throughput Gauge;GPU PCIe 接收/发送吞吐率。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, network_io_direction By/s
otel_service.hw.gpu.power.draw Gauge;GPU 当前功耗。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor W
otel_service.hw.gpu.power.limit Gauge;GPU 功耗上限。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor W
otel_service.hw.gpu.temperature Gauge;GPU 芯片或显存温度。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, sensor Cel
otel_service.hw.gpu.throttled Gauge;温度或功率节流活跃时为 1;原因位于 hw_gpu_throttle_reasons 标签。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.throttled{hw_gpu_throttle_reasons!=none} Gauge;温度或功率节流活跃时为 1;原因位于 hw_gpu_throttle_reasons 标签。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.up Gauge;GPU 设备成功采集时为 1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.utilization{hw_gpu_task=decoder} Gauge;GPU 计算、编码或解码利用率,原始值范围为 0..1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.utilization{hw_gpu_task=encoder} Gauge;GPU 计算、编码或解码利用率,原始值范围为 0..1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor 1(0..1)
otel_service.hw.gpu.utilization{hw_gpu_task=general} Gauge;GPU 计算、编码或解码利用率,原始值范围为 0..1。 gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, team 1(0..1)
otel_service.process.cpu.time Counter;Collector 进程累计 CPU 时间。 cpu_mode, host, host_name s
otel_service.process.cpu.utilization Gauge;Collector 进程 CPU 利用率,原始值范围为 0..1。 host, host_name 1(0..1)
otel_service.process.gpu.core.usage Gauge;进程从 Kernel 发射到同步期间归一化的平均 CUDA 核心使用量。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind {cores}
otel_service.process.gpu.memory.usage UpDownCounter;进程在指定 GPU 上占用的显存字节数。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind By
otel_service.process.gpu.sm_active Gauge;进程在采样周期内存在 launch-to-sync 时间段的占比。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind 1(0..1)
otel_service.process.gpu.utilization Gauge;进程 GPU 利用率,原始值范围为 0..1。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind 1(0..1)
otel_service.process.memory.usage UpDownCounter;Collector 进程常驻内存 RSS。 host, host_name By
otel_service.process.memory.virtual UpDownCounter;Collector 进程虚拟内存大小。 host, host_name By
otel_service.process.runtime.go.goroutines Gauge;Collector 进程的 Go goroutine 数量。 host, host_name {goroutine}
otel_service.process.runtime.go.mem.heap_alloc Gauge;Collector 进程已分配的 Go 堆内存。 host, host_name By
otel_service.process.thread.count UpDownCounter;Collector 进程的操作系统线程数。 host, host_name {thread}
otel_service.process.unix.file_descriptor.count UpDownCounter;Collector 进程打开的文件描述符数量。 host, host_name {file_descriptor}
otel_service.process.uptime Gauge;GPU 归因进程的运行时长。 container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind s
otel_service.system.cpu.logical.count UpDownCounter;主机逻辑 CPU 核心数量。 host, host_name {cpu}
otel_service.system.cpu.utilization Gauge;每个逻辑 CPU 核心的利用率,原始值范围为 0..1。 cpu_logical_number, host, host_name 1(0..1)
otel_service.system.disk.io Counter;磁盘累计读写字节数。 disk_io_direction, host, host_name, system_device By
otel_service.system.disk.operations Counter;磁盘累计读写操作数。 disk_io_direction, host, host_name, system_device {operation}
otel_service.system.filesystem.usage UpDownCounter;按状态统计的文件系统空间字节数。 host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_state, system_filesystem_type By
otel_service.system.filesystem.utilization Gauge;文件系统利用率,原始值范围为 0..1。 host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_type 1(0..1)
otel_service.system.memory.usage UpDownCounter;按状态统计的主机内存字节数。 host, host_name, system_memory_state By
otel_service.system.memory.utilization Gauge;主机内存利用率,原始值范围为 0..1。 host, host_name 1(0..1)
otel_service.system.network.errors Counter;网络接口累计接收/发送错误数。 host, host_name, network_interface_name, network_io_direction {error}
otel_service.system.network.io Counter;网络接口累计接收/发送字节数。 host, host_name, network_interface_name, network_io_direction By

文档评价

文档内容是否对您有帮助?