OpenLIT OTel GPU Collector
OpenLIT OTel GPU Collector 通过 OpenTelemetry OTLP 向 DataKit 上报 GPU 硬件、GPU 进程、主机以及 Linux/NVIDIA CUDA eBPF 指标。
配置¶
前置条件¶
- 已安装 DataKit,且 OpenLIT Collector 到 DataKit 的 OTLP 网络可达。
- 使用 NVIDIA GPU 容器时,主机需安装 NVIDIA 驱动、Docker 和 NVIDIA Container Toolkit。AMD 需映射
/dev/kfd与/dev/dri,Intel 需映射/dev/dri。 - 进程级 GPU 归因需容器使用主机 PID namespace。Linux/NVIDIA CUDA eBPF 指标还需要 BPF/PERFMON 能力与可锁定内存。没有这些权限时,设备级
hw.gpu.*指标仍可工作,但进程和 eBPF 视图会不完整。
开启 DataKit OpenTelemetry 接收¶
cd /usr/local/datakit/conf.d
sudo cp samples/opentelemetry.conf.sample opentelemetry.conf
sudo vim opentelemetry.conf
[[inputs.opentelemetry]]
customer_tags_all = true
[inputs.opentelemetry.grpc]
addr = "127.0.0.1:4317"
max_payload = 16777216
Collector 与 DataKit 跨主机或不使用 host network 时,把 addr 改为 0.0.0.0:4317,Collector 端点改为 DataKit 实际私网 IP 或 DNS 的 4317 端口,并通过防火墙或安全组限制来源;不要将 4317 无保护暴露到公网。
重启 DataKit:
启动 OpenLIT OTel GPU Collector¶
以 NVIDIA GPU、Collector 与 DataKit 同机为例:
docker pull ghcr.io/openlit/otel-gpu-collector:latest
docker run -d \
--name otel-gpu-collector \
--restart unless-stopped \
--network host \
--gpus all \
--pid=host \
--cap-add BPF \
--cap-add PERFMON \
--ulimit memlock=-1:-1 \
-e OTEL_SERVICE_NAME=openlit-otel-gpu-collector \
-e OTEL_RESOURCE_ATTRIBUTES='deployment.environment=production,team=ml,host.name=gpu-host-01' \
-e OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317 \
-e OTEL_EXPORTER_OTLP_PROTOCOL=grpc \
-e OTEL_METRIC_EXPORT_INTERVAL=15000 \
-e OTEL_GPU_EBPF_ENABLED=true \
ghcr.io/openlit/otel-gpu-collector:latest
AMD 容器把 --gpus all 替换为 --device /dev/kfd:/dev/kfd --device /dev/dri:/dev/dri;Intel 使用 --device /dev/dri:/dev/dri。AMD/Intel 不使用 CUDA eBPF 路径,因此 CUDA 专属视图为空属于能力边界。
Kubernetes 部署¶
OpenLIT 官方支持以 DaemonSet 在每个 GPU 节点运行一个 Collector。本集成不复制可能随版本变化的完整 YAML,请直接参考 OpenLIT Kubernetes DaemonSet 官方配置,并把 OTEL_EXPORTER_OTLP_ENDPOINT 指向集群内可达的 DataKit 或 OpenTelemetry Collector 服务。
Kubernetes 部署需要重点保留 hostPID: true、GPU 设备访问、kubelet PodResources 挂载以及 eBPF 所需的 BPF 权限;若要从 Node 标签或 providerID 识别 host.type、云厂商和区域,还需按官方示例授予 ServiceAccount nodes/get 权限。EKS、GKE、AKS 或自建集群的身份配置差异请以官方文档为准。
验证¶
- 在观测云「指标」中查询
otel_service,并确认hw.gpu.up、hw.gpu.utilization、hw.gpu.memory.usage等持续上报。 - 若进程或 CUDA eBPF 图表无数据,依次核对 host PID、GPU 设备映射、BPF/PERFMON 能力、memlock、工作负载是否已加载
libcudart,以及主机安全策略是否阻止 eBPF uprobe。
指标¶
OpenLIT 指标通过 OTLP 写入 otel_service。下表覆盖 OpenLIT OTel GPU Collector 官方 Metrics Reference 中的 GPU 硬件、主机系统、Collector 进程、GPU 工作负载进程与 CUDA eBPF 指标。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
otel_service.gpu.core.limit |
Gauge;NVML 报告的 GPU CUDA 核心总数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
{cores} |
otel_service.gpu.kernel.block.size_bucket |
Histogram bucket;CUDA Kernel 每个 Block 的线程数直方图按 le 边界累计的观测次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.block.size_count |
Histogram count;CUDA Kernel 每个 Block 的线程数直方图的累计观测次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.block.size_max |
Histogram max;CUDA Kernel 每个 Block 的线程数直方图在当前聚合周期的最大值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.block.size_min |
Histogram min;CUDA Kernel 每个 Block 的线程数直方图在当前聚合周期的最小值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.block.size_sum |
Histogram sum;CUDA Kernel 每个 Block 的线程数直方图的累计值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.grid.size_bucket |
Histogram bucket;CUDA Kernel Grid 总线程数直方图按 le 边界累计的观测次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.grid.size_count |
Histogram count;CUDA Kernel Grid 总线程数直方图的累计观测次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.grid.size_max |
Histogram max;CUDA Kernel Grid 总线程数直方图在当前聚合周期的最大值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.grid.size_min |
Histogram min;CUDA Kernel Grid 总线程数直方图在当前聚合周期的最小值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.grid.size_sum |
Histogram sum;CUDA Kernel Grid 总线程数直方图的累计值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{thread} |
otel_service.gpu.kernel.launch.calls |
Counter;CUDA Kernel 累计发射次数;rate 结果为每秒发射次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.shared_memory_bucket |
Histogram bucket;CUDA Kernel 每次发射使用的动态共享内存直方图按 le 边界累计的观测次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.shared_memory_count |
Histogram count;CUDA Kernel 每次发射使用的动态共享内存直方图的累计观测次数。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{call} |
otel_service.gpu.kernel.shared_memory_max |
Histogram max;CUDA Kernel 每次发射使用的动态共享内存直方图在当前聚合周期的最大值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.kernel.shared_memory_min |
Histogram min;CUDA Kernel 每次发射使用的动态共享内存直方图在当前聚合周期的最小值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.kernel.shared_memory_sum |
Histogram sum;CUDA Kernel 每次发射使用的动态共享内存直方图的累计值。 | container_id, cuda_kernel_name, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.allocations |
Counter;通过 cudaMalloc 累计分配的字节数。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.copies_bucket{le=10000} |
Histogram bucket;CUDA 异步显存拷贝字节数直方图按 le 边界累计的观测次数。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{copy} |
otel_service.gpu.memory.copies_count |
Histogram count;CUDA 异步显存拷贝字节数直方图的累计观测次数。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, le, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{copy} |
otel_service.gpu.memory.copies_max |
Histogram max;CUDA 异步显存拷贝字节数直方图在当前聚合周期的最大值。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.copies_min |
Histogram min;CUDA 异步显存拷贝字节数直方图在当前聚合周期的最小值。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.memory.copies_sum |
Histogram sum;CUDA 异步显存拷贝字节数直方图的累计值。 | container_id, cuda_memcpy_kind, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.gpu.sm_active |
Gauge;GPU 设备级 launch-to-sync 时间段并集占比,原始值范围为 0..1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.errors |
Counter;GPU ECC、PCIe、XID 或 RAS 累计错误数。 | error_type, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_type, hw_vendor |
{error} |
otel_service.hw.gpu.allocated |
Gauge;进程显存占用或 GPU 利用率达到配置阈值时为 1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.clock.graphics |
Gauge;GPU Graphics/SM 时钟频率。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
MHz |
otel_service.hw.gpu.clock.memory |
Gauge;GPU 显存时钟频率。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
MHz |
otel_service.hw.gpu.energy.consumed |
Counter;GPU 累计消耗的能量。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
J |
otel_service.hw.gpu.fan_speed |
Gauge;GPU 风扇转速;是否上报取决于厂商与设备能力。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
{rpm} |
otel_service.hw.gpu.idle |
Gauge;GPU 空闲比例;可获得利用率时为 1 减去利用率。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.interconnect.throughput |
Gauge;GPU NVLink 或 XGMI 互连的聚合接收/发送吞吐率。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_interconnect_type, hw_id, hw_name, hw_vendor, network_io_direction |
By/s |
otel_service.hw.gpu.memory.free |
UpDownCounter;GPU 空闲显存字节数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
By |
otel_service.hw.gpu.memory.limit |
UpDownCounter;GPU 总显存容量。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
By |
otel_service.hw.gpu.memory.usage |
UpDownCounter;GPU 已用显存字节数。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
By |
otel_service.hw.gpu.memory.utilization |
Gauge;GPU 显存控制器利用率,原始值范围为 0..1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.pcie.throughput |
Gauge;GPU PCIe 接收/发送吞吐率。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, network_io_direction |
By/s |
otel_service.hw.gpu.power.draw |
Gauge;GPU 当前功耗。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
W |
otel_service.hw.gpu.power.limit |
Gauge;GPU 功耗上限。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
W |
otel_service.hw.gpu.temperature |
Gauge;GPU 芯片或显存温度。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, sensor |
Cel |
otel_service.hw.gpu.throttled |
Gauge;温度或功率节流活跃时为 1;原因位于 hw_gpu_throttle_reasons 标签。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.throttled{hw_gpu_throttle_reasons!=none} |
Gauge;温度或功率节流活跃时为 1;原因位于 hw_gpu_throttle_reasons 标签。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_throttle_reasons, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.up |
Gauge;GPU 设备成功采集时为 1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.utilization{hw_gpu_task=decoder} |
Gauge;GPU 计算、编码或解码利用率,原始值范围为 0..1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.utilization{hw_gpu_task=encoder} |
Gauge;GPU 计算、编码或解码利用率,原始值范围为 0..1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor |
1(0..1) |
otel_service.hw.gpu.utilization{hw_gpu_task=general} |
Gauge;GPU 计算、编码或解码利用率,原始值范围为 0..1。 | gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, team |
1(0..1) |
otel_service.process.cpu.time |
Counter;Collector 进程累计 CPU 时间。 | cpu_mode, host, host_name |
s |
otel_service.process.cpu.utilization |
Gauge;Collector 进程 CPU 利用率,原始值范围为 0..1。 | host, host_name |
1(0..1) |
otel_service.process.gpu.core.usage |
Gauge;进程从 Kernel 发射到同步期间归一化的平均 CUDA 核心使用量。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
{cores} |
otel_service.process.gpu.memory.usage |
UpDownCounter;进程在指定 GPU 上占用的显存字节数。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
By |
otel_service.process.gpu.sm_active |
Gauge;进程在采样周期内存在 launch-to-sync 时间段的占比。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
1(0..1) |
otel_service.process.gpu.utilization |
Gauge;进程 GPU 利用率,原始值范围为 0..1。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_gpu_task, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
1(0..1) |
otel_service.process.memory.usage |
UpDownCounter;Collector 进程常驻内存 RSS。 | host, host_name |
By |
otel_service.process.memory.virtual |
UpDownCounter;Collector 进程虚拟内存大小。 | host, host_name |
By |
otel_service.process.runtime.go.goroutines |
Gauge;Collector 进程的 Go goroutine 数量。 | host, host_name |
{goroutine} |
otel_service.process.runtime.go.mem.heap_alloc |
Gauge;Collector 进程已分配的 Go 堆内存。 | host, host_name |
By |
otel_service.process.thread.count |
UpDownCounter;Collector 进程的操作系统线程数。 | host, host_name |
{thread} |
otel_service.process.unix.file_descriptor.count |
UpDownCounter;Collector 进程打开的文件描述符数量。 | host, host_name |
{file_descriptor} |
otel_service.process.uptime |
Gauge;GPU 归因进程的运行时长。 | container_id, gpu_index, gpu_mig_device_id, gpu_mig_enabled, gpu_mig_instance_id, gpu_mig_profile, gpu_parent_uuid, gpu_pci_address, host, host_name, hw_id, hw_name, hw_vendor, k8s_container_name, k8s_namespace_name, k8s_pod_name, k8s_pod_uid, process_command_line, process_executable_name, process_owner, process_owner_userid, process_pid, process_state, process_workload_framework, process_workload_kind |
s |
otel_service.system.cpu.logical.count |
UpDownCounter;主机逻辑 CPU 核心数量。 | host, host_name |
{cpu} |
otel_service.system.cpu.utilization |
Gauge;每个逻辑 CPU 核心的利用率,原始值范围为 0..1。 | cpu_logical_number, host, host_name |
1(0..1) |
otel_service.system.disk.io |
Counter;磁盘累计读写字节数。 | disk_io_direction, host, host_name, system_device |
By |
otel_service.system.disk.operations |
Counter;磁盘累计读写操作数。 | disk_io_direction, host, host_name, system_device |
{operation} |
otel_service.system.filesystem.usage |
UpDownCounter;按状态统计的文件系统空间字节数。 | host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_state, system_filesystem_type |
By |
otel_service.system.filesystem.utilization |
Gauge;文件系统利用率,原始值范围为 0..1。 | host, host_name, system_device, system_filesystem_mountpoint, system_filesystem_type |
1(0..1) |
otel_service.system.memory.usage |
UpDownCounter;按状态统计的主机内存字节数。 | host, host_name, system_memory_state |
By |
otel_service.system.memory.utilization |
Gauge;主机内存利用率,原始值范围为 0..1。 | host, host_name |
1(0..1) |
otel_service.system.network.errors |
Counter;网络接口累计接收/发送错误数。 | host, host_name, network_interface_name, network_io_direction |
{error} |
otel_service.system.network.io |
Counter;网络接口累计接收/发送字节数。 | host, host_name, network_interface_name, network_io_direction |
By |