跳转至

AWS MSK (Prometheus)

Amazon Managed Streaming for Apache Kafka(Amazon MSK)开放监控可以将 Kafka Broker JMX 和 Broker 节点指标以 Prometheus 格式暴露。DataKit 通过 Prometheus 采集器直接抓取这些端点,不使用 AWS AK、Func 或 CloudWatch 云采集脚本。

配置

前置条件

  • 本集成适用于已启用 Amazon MSK 开放监控 的 MSK Provisioned 集群。
  • 存量集群启用开放监控前必须处于 ACTIVE 状态。新建集群可以在创建时启用;存量集群可以在集群属性的 Monitoring 区域编辑启用。
  • DataKit 必须部署在能够解析并访问 MSK Broker 私有 DNS 的网络中,通常是相同 VPC 或已打通网络的 VPC。
  • MSK 安全组需要允许 DataKit 所在安全组或网段访问 TCP 1100111002;VPC 需要启用 DNS。网络要求可参考 AWS MSK Prometheus Collector 前置条件
  • JMX Exporter 使用 11001,Node Exporter 使用 11002。AWS 建议抓取间隔不低于 60 秒,过短的间隔可能增加集群 CPU 使用率。

注意:KRaft 元数据模式和 MSK Express Broker 不能同时启用开放监控与公共访问。开放监控本身不收费,但跨可用区传输数据可能产生费用。

启用开放监控

新建 MSK Provisioned 集群时,在 Monitoring 区域选中「Enable open monitoring with Prometheus」,并启用 JMX Exporter、Node Exporter 或两者。

存量集群按以下步骤启用:

  1. 登录 Amazon MSK 控制台,打开目标集群。
  2. 在 Properties 页签找到 Monitoring,单击 Edit。
  3. 选中「Enable open monitoring with Prometheus」。
  4. 启用 JMX Exporter、Node Exporter 或两者,然后保存修改。

也可以使用 AWS CLI 更新监控配置:

aws kafka update-monitoring \
  --cluster-arn <cluster-arn> \
  --current-version <current-version> \
  --open-monitoring 'Prometheus={JmxExporter={EnabledInBroker=true},NodeExporter={EnabledInBroker=true}}'

更多信息参见 AWS 官方文档:

获取 Prometheus 监控目标

使用 ListNodes 获取集群的 Broker DNS:

aws kafka list-nodes \
  --cluster-arn <cluster-arn>

记录返回结果中 BrokerNodeInfo.Endpoints 的所有 Broker DNS。每个 Broker 需要配置两个目标:

类型 目标 说明
JMX Exporter <broker-dns>:11001 Kafka Broker JMX 指标和 Consumer Lag 指标。
Node Exporter <broker-dns>:11002 Broker 节点 CPU、内存、磁盘和网络指标。

KRaft 集群如需采集 Controller JMX 指标,还需要将 ControllerNodeInfo.Endpoints 返回的 Controller DNS 加入 11001 目标。端点格式和 KRaft 说明参见 AWS Prometheus Host 配置

在 DataKit 主机上验证网络连通性:

curl -sS "http://<broker-dns>:11001/metrics" | head
curl -sS "http://<broker-dns>:11002/metrics" | head

配置 DataKit

进入 DataKit 安装目录下的 conf.d/samples 目录,复制 prom.conf.sample 并命名为 aws_msk_prom.conf

cp prom.conf.sample aws_msk_prom.conf

调整 aws_msk_prom.conf。将所有 Broker DNS 加入对应的 urls;KRaft Controller DNS 只加入 JMX Exporter 配置。

[[inputs.prom]]
  urls = [
    "http://<broker-dns-1>:11001/metrics",
    "http://<broker-dns-2>:11001/metrics",
    # KRaft 可选:
    # "http://<controller-dns-1>:11001/metrics",
  ]
  source = "kafka_jmx"
  interval = "60s"
  metric_name_filter = ["^kafka_"]
  measurement_prefix = ""
  keep_exist_metric_name = false
  honor_timestamps = true
  election = false
  disable_host_tag = true
  disable_instance_tag = true
  disable_info_tag = false

  [[inputs.prom.measurements]]
    prefix = "kafka_controller_"
    name = "kafka_controller"

  [[inputs.prom.measurements]]
    prefix = "kafka_network_"
    name = "kafka_network"

  [[inputs.prom.measurements]]
    prefix = "kafka_log_"
    name = "kafka_log"

  [[inputs.prom.measurements]]
    prefix = "kafka_server_"
    name = "kafka_server"

  [inputs.prom.tags]
    cloud_provider = "aws"
    service = "msk"
    region_id = "<aws-region>"
    cluster_id = "<cluster-arn-or-id>"
    cluster_name = "<msk-cluster-name>"


[[inputs.prom]]
  urls = [
    "http://<broker-dns-1>:11002/metrics",
    "http://<broker-dns-2>:11002/metrics",
  ]
  source = "kafka_node"
  interval = "60s"
  metric_name_filter = ["^node_"]
  measurement_prefix = ""
  keep_exist_metric_name = false
  honor_timestamps = true
  election = false
  disable_host_tag = true
  disable_instance_tag = true
  disable_info_tag = false

  [[inputs.prom.measurements]]
    prefix = "node_"
    name = "kafka_node"

  [inputs.prom.tags]
    cloud_provider = "aws"
    service = "msk"
    region_id = "<aws-region>"
    cluster_id = "<cluster-arn-or-id>"
    cluster_name = "<msk-cluster-name>"


# 可选:采集业务 Producer、Consumer、Kafka Streams、Kafka Connect 等客户端 JMX Exporter 指标。
[[inputs.prom]]
  urls = [
    "http://<producer-client-ip>:7072/metrics",
    "http://<consumer-client-ip>:7073/metrics",
    "http://<streams-client-ip>:7074/metrics",
    "http://<connect-worker-ip>:7075/metrics",
  ]
  source = "kafka_client"
  interval = "60s"
  metric_name_filter = ["^kafka_(producer|consumer|stream|connect)_"]
  measurement_prefix = ""
  keep_exist_metric_name = false
  honor_timestamps = true
  election = false
  disable_host_tag = false
  disable_instance_tag = true
  disable_info_tag = false

  [[inputs.prom.measurements]]
    prefix = "kafka_producer_"
    name = "kafka_producer"

  [[inputs.prom.measurements]]
    prefix = "kafka_consumer_"
    name = "kafka_consumer"

  [[inputs.prom.measurements]]
    prefix = "kafka_connect_"
    name = "kafka_connect"

  [[inputs.prom.measurements]]
    prefix = "kafka_stream_"
    name = "kafka_stream"

  [inputs.prom.tags]
    cloud_provider = "aws"
    service = "msk"
    region_id = "<aws-region>"
    cluster_id = "<cluster-arn-or-id>"
    cluster_name = "<msk-cluster-name>"

11001 暴露 Kafka Broker JMX 和 Consumer Lag 指标,11002 暴露 Broker 节点 CPU 与磁盘等指标,具体范围参见 AWS Prometheus 指标说明。Producer、Consumer、Kafka Streams 和 Kafka Connect 属于客户端进程指标,需要在相应进程中单独挂载 JMX Exporter 后采集。

配置完成后重启 DataKit:

datakit service -R

验证

  1. 在 DataKit 日志中确认 aws_msk_prom.conf 没有连接或解析错误。
  2. 在观测云「指标」中确认存在 kafka_controllerkafka_networkkafka_serverkafka_node 等指标集。
  3. 检查指标标签中 cloud_provider=awscluster_name=<msk-cluster-name> 和 Broker host 是否符合预期。
  4. 如果配置了客户端 JMX Exporter,再确认 kafka_producerkafka_consumerkafka_streamkafka_connect 指标集存在数据。

指标

配置好 Prometheus 采集后,推荐指标范围包含以下 9 个指标集、115 个按 measurement、field 和固定语义标签区分的指标上下文。Amazon MSK 开放监控原生提供 Broker JMX 与 Node Exporter 指标;Producer、Consumer、Kafka Streams 和 Kafka Connect 指标需要在对应客户端进程上单独开启 JMX Exporter。

Controller 指标

kafka_controller 指标集包含 8 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_controller.ControllerEventManager_Count{name=EventQueueTimeMs} Controller 事件队列等待时间指标记录的累计样本数。 cloud_provider, cluster_name, host, name count
kafka_controller.ControllerEventManager_Value{name=EventQueueSize} Controller 事件队列中当前等待处理的事件数量。 cloud_provider, cluster_name, host, name count
kafka_controller.KafkaController_Value{name=ActiveBrokerCount} 当前处于活动状态并参与集群服务的 Broker 数量。 cloud_provider, cluster_name, host, name count
kafka_controller.KafkaController_Value{name=ActiveControllerCount} 集群中当前活动的 Controller 数量,正常情况下通常为 1 cloud_provider, cluster_name, host, name count
kafka_controller.KafkaController_Value{name=FencedBrokerCount} 当前被隔离、不能参与正常集群服务的 Broker 数量。 cloud_provider, cluster_name, host, name count
kafka_controller.KafkaController_Value{name=GlobalPartitionCount} 集群当前分区总数;多个 Broker 暴露相同全局值时取最大值 cloud_provider, cluster_name, host, name count
kafka_controller.KafkaController_Value{name=GlobalTopicCount} 集群当前 Topic 总数;多个 Broker 暴露相同全局值时取最大值 cloud_provider, cluster_name, host, name count
kafka_controller.KafkaController_Value{name=OfflinePartitionsCount} 集群当前没有 Leader、无法正常读写的分区数量 cloud_provider, cluster_name, host, name count

网络请求指标

kafka_network 指标集包含 24 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_network.RequestChannel_Value{name=RequestQueueSize} Broker 请求队列中当前等待处理的条目数量 cloud_provider, cluster_name, host, name count
kafka_network.RequestChannel_Value{name=ResponseQueueSize} Broker 响应队列中当前等待处理的条目数量 cloud_provider, cluster_name, host, name count
kafka_network.RequestMetrics_95thPercentile{name=TotalTimeMs;request=FetchConsumer} FetchConsumer 请求的端到端P95 处理耗时 cloud_provider, cluster_name, host ms
kafka_network.RequestMetrics_95thPercentile{name=TotalTimeMs;request=Produce} Produce 请求的端到端P95 处理耗时 cloud_provider, cluster_name, host ms
kafka_network.RequestMetrics_Max{name=TemporaryMemoryBytes;request=Produce} Broker 处理 Produce 请求时使用的最大临时内存。 cloud_provider, cluster_name, host, name, request B
kafka_network.RequestMetrics_Mean{name=LocalTimeMs;request=FetchConsumer} FetchConsumer 请求的本地处理平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=LocalTimeMs;request=FetchFollower} FetchFollower 请求的本地处理平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=MessageConversionsTimeMs;request=Produce} Produce 请求的消息格式转换平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=RemoteTimeMs;request=FetchConsumer} FetchConsumer 请求的远程处理平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=RemoteTimeMs;request=FetchFollower} FetchFollower 请求的远程处理平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=RemoteTimeMs;request=Produce} Produce 请求的远程处理平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=RequestQueueTimeMs;request=FetchConsumer} FetchConsumer 请求的在请求队列中的平均等待时间 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=RequestQueueTimeMs;request=Produce} Produce 请求的在请求队列中的平均等待时间 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=ResponseQueueTimeMs;request=FetchConsumer} FetchConsumer 请求的在响应队列中的平均等待时间 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=ResponseQueueTimeMs;request=FetchFollower} FetchFollower 请求的在响应队列中的平均等待时间 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=ResponseQueueTimeMs;request=Produce} Produce 请求的在响应队列中的平均等待时间 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=ResponseSendTimeMs;request=FetchConsumer} FetchConsumer 请求的发送响应的平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=ResponseSendTimeMs;request=FetchFollower} FetchFollower 请求的发送响应的平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=ResponseSendTimeMs;request=Produce} Produce 请求的发送响应的平均耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=TotalTimeMs;request=FetchConsumer} FetchConsumer 请求的端到端平均处理耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_Mean{name=TotalTimeMs;request=Produce} Produce 请求的端到端平均处理耗时 cloud_provider, cluster_name, host, name, request ms
kafka_network.RequestMetrics_OneMinuteRate{name=RequestsPerSec} Broker 最近一分钟的请求速率 cloud_provider, cluster_name, host, name, request ops
kafka_network.SocketServer_Value{name=MemoryPoolUsed} Broker 网络层内存池当前已使用的内存大小 cloud_provider, cluster_name, host, name B
kafka_network.SocketServer_Value{name=NetworkProcessorAvgIdlePercent} Broker 网络处理线程处于空闲状态的时间比率 cloud_provider, cluster_name, host, name percent

日志指标

kafka_log 指标集包含 4 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_log.LogFlushStats_OneMinuteRate{name=LogFlushRateAndTimeMs} Broker 每秒执行日志刷盘操作的平均次数 cloud_provider, cluster_name, host, name ops
kafka_log.Log_Value{name=LogEndOffset} 所选 Topic 分区当前日志末端偏移量 cloud_provider, cluster_name, host, name, partition, topic offset
kafka_log.Log_Value{name=LogStartOffset} 所选 Topic 分区当前最早可读取的日志偏移量 cloud_provider, cluster_name, host, name, partition, topic offset
kafka_log.Log_Value{name=Size} 所选 Topic 分区日志占用的磁盘空间 cloud_provider, cluster_name, host, name, topic B

Broker 服务指标

kafka_server 指标集包含 10 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=BytesInPerSec} Broker 或 Topic 每秒接收的生产消息字节数 cloud_provider, cluster_name, host, name, topic B/S
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=BytesOutPerSec} Broker 或 Topic 每秒发送给消费者的字节数 cloud_provider, cluster_name, host, name, topic B/S
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=FetchMessageConversionsPerSec} Broker 每秒执行 Fetch 消息格式转换的次数 cloud_provider, cluster_name, host, name, topic ops
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=MessagesInPerSec} Broker 或 Topic 每秒接收的消息数 cloud_provider, cluster_name, host, name, topic ops
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=TotalFetchRequestsPerSec} Broker 或 Topic 每秒收到的 Fetch 请求数 cloud_provider, cluster_name, host, name, topic ops
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=TotalProduceRequestsPerSec} Broker 或 Topic 每秒收到的 Produce 请求数 cloud_provider, cluster_name, host, name, topic ops
kafka_server.KafkaRequestHandlerPool_FiveMinuteRate{name=RequestHandlerAvgIdlePercent} Broker 请求处理线程最近五分钟的平均空闲比率 cloud_provider, cluster_name, host percent
kafka_server.ReplicaManager_Value{name=UnderMinIsrPartitionCount} 同步副本数低于 min.insync.replicas 的分区数量 cloud_provider, cluster_name count
kafka_server.ReplicaManager_Value{name=UnderReplicatedPartitions} 副本数低于目标副本因子的分区数量 cloud_provider, cluster_name count
kafka_server.socket_server_metrics_response_rate Broker 网络处理线程每秒发送的响应数量。 cloud_provider, cluster_name, host ops

节点资源指标

kafka_node 指标集包含 9 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_node.cpu_seconds_total{mode!=idle} Broker 节点非空闲 CPU 时间增长率除以全部 CPU 时间增长率所得的 CPU 使用率 cloud_provider, cluster_name, host, mode percent
kafka_node.disk_read_bytes_total Broker 节点磁盘每秒读取的字节数 cloud_provider, cluster_name, host B/S
kafka_node.disk_reads_completed_total Broker 节点磁盘每秒完成的读操作数 cloud_provider, cluster_name, host ops
kafka_node.disk_writes_completed_total Broker 节点磁盘每秒完成的写操作数 cloud_provider, cluster_name, host ops
kafka_node.disk_written_bytes_total Broker 节点磁盘每秒写入的字节数 cloud_provider, cluster_name, host B/S
kafka_node.filesystem_avail_bytes Broker 节点文件系统已使用空间占比。 cloud_provider, cluster_name, host percent
kafka_node.filesystem_files Broker 节点文件系统已使用 Inode 占比。 cloud_provider, cluster_name, host percent
kafka_node.filesystem_files_free Broker 节点文件系统已使用 Inode 占比。 cloud_provider, cluster_name, host percent
kafka_node.filesystem_size_bytes Broker 节点文件系统已使用空间占比。 cloud_provider, cluster_name, host percent

Producer 客户端指标

kafka_producer 指标集包含 13 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_producer.metrics_buffer_available_bytes Producer 当前未使用的缓冲区内存大小 client_id, cloud_provider, cluster_name, host B
kafka_producer.metrics_buffer_exhausted Producer 因缓冲区耗尽而丢弃的累计记录发送数 client_id, cloud_provider, cluster_name, host count
kafka_producer.metrics_buffer_exhausted_rate Producer 每秒因缓冲区耗尽而丢弃的记录发送数 client_id, cloud_provider, cluster_name, host ops
kafka_producer.metrics_bufferpool_wait_time_ns Producer 等待缓冲区空间分配的累计时间 client_id, cloud_provider, cluster_name, host ns
kafka_producer.metrics_connection_count 客户端当前活动连接数 client_id, cloud_provider, cluster_name, host count
kafka_producer.metrics_failed_authentication 客户端认证失败的累计连接数 client_id, cloud_provider, cluster_name, host count
kafka_producer.metrics_flush_time_ns Producer 执行 flush 操作的累计耗时 client_id, cloud_provider, cluster_name, host ns
kafka_producer.metrics_io_wait_time_ns Producer I/O 线程等待可读写套接字的累计耗时 client_id, cloud_provider, cluster_name, host ns
kafka_producer.metrics_request_rate 客户端每秒发送的请求数 client_id, cloud_provider, cluster_name, host ops
kafka_producer.metrics_requests_in_flight Producer 已发送但尚未收到响应的请求数 client_id, cloud_provider, cluster_name, host count
kafka_producer.metrics_response_rate 客户端每秒收到的响应数 client_id, cloud_provider, cluster_name, host ops
kafka_producer.metrics_select_rate 客户端 I/O 线程每秒执行 select 的次数 client_id, cloud_provider, cluster_name, host ops
kafka_producer.metrics_txn_commit_time_ns Producer 提交事务所花费的累计时间 client_id, cloud_provider, cluster_name, host ns

Consumer 客户端指标

kafka_consumer 指标集包含 14 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_consumer.coordinator_metrics_rebalance_latency Consumer Group 最近一次再平衡的总耗时 client_id, cloud_provider, cluster_name, host ms
kafka_consumer.coordinator_metrics_rebalance_rate_per_hour Consumer Group 每小时发生再平衡的平均次数 client_id, cloud_provider, cluster_name, host 次/小时
kafka_consumer.metrics_connection_close_rate Consumer 每秒关闭的连接数 client_id, cloud_provider, cluster_name, host ops
kafka_consumer.metrics_connection_count 客户端当前活动连接数 client_id, cloud_provider, cluster_name, host count
kafka_consumer.metrics_failed_authentication 客户端认证失败的累计连接数 client_id, cloud_provider, cluster_name, host count
kafka_consumer.metrics_incoming_byte_rate 客户端每秒从网络套接字读取的字节数 client_id, cloud_provider, cluster_name, host B/S
kafka_consumer.metrics_io_time_ns_avg Consumer 每次 select 调用执行 I/O 的平均耗时 client_id, cloud_provider, cluster_name, host ns
kafka_consumer.metrics_io_wait_time_ns_avg Consumer I/O 线程等待可读写套接字的平均耗时 client_id, cloud_provider, cluster_name, host ns
kafka_consumer.metrics_outgoing_byte_rate 客户端每秒向 Broker 发送的字节数 client_id, cloud_provider, cluster_name, host B/S
kafka_consumer.metrics_request_rate 客户端每秒发送的请求数 client_id, cloud_provider, cluster_name, host ops
kafka_consumer.metrics_request_size_avg Consumer 请求的平均大小 client_id, cloud_provider, cluster_name, host B
kafka_consumer.metrics_response_rate 客户端每秒收到的响应数 client_id, cloud_provider, cluster_name, host ops
kafka_consumer.metrics_select_rate 客户端 I/O 线程每秒执行 select 的次数 client_id, cloud_provider, cluster_name, host ops
kafka_consumer.metrics_time_between_poll_avg Consumer 相邻两次 poll 调用的平均间隔 client_id, cloud_provider, cluster_name, host ms

Kafka Streams 指标

kafka_stream 指标集包含 25 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_stream.stream_state_metrics_all_rate Kafka Streams 状态存储每秒执行的操作数 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id ops
kafka_stream.stream_state_metrics_block_cache_capacity Kafka Streams RocksDB 块缓存容量 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id B
kafka_stream.stream_state_metrics_block_cache_data_hit_ratio Kafka Streams RocksDB 块缓存数据命中比率 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id percent
kafka_stream.stream_state_metrics_block_cache_filter_hit_ratio Kafka Streams RocksDB 块缓存过滤器命中比率 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id percent
kafka_stream.stream_state_metrics_block_cache_index_hit_ratio Kafka Streams RocksDB 块缓存索引命中比率 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id percent
kafka_stream.stream_state_metrics_block_cache_usage Kafka Streams RocksDB 块缓存当前使用量 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id B
kafka_stream.stream_state_metrics_bytes_read_compaction_rate Kafka Streams 状态存储压缩每秒读取的字节数 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id B/S
kafka_stream.stream_state_metrics_bytes_read_rate Kafka Streams 状态存储每秒读取的字节数 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id B/S
kafka_stream.stream_state_metrics_bytes_written_compaction_rate Kafka Streams 状态存储压缩每秒写入的字节数 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id B/S
kafka_stream.stream_state_metrics_bytes_written_rate Kafka Streams 状态存储每秒写入的字节数 cloud_provider, cluster_name, host, rocksdb_state_id, thread_id B/S
kafka_stream.stream_task_metrics_active_process_ratio Kafka Streams 任务线程用于处理记录的时间比率 cloud_provider, cluster_name, host, task_id, thread_id percent
kafka_stream.stream_task_metrics_cache_size_bytes Kafka Streams 任务缓存的总大小 cloud_provider, cluster_name, host, task_id, thread_id B
kafka_stream.stream_task_metrics_enforced_processing_rate Kafka Streams 任务每秒执行强制处理的次数 cloud_provider, cluster_name, host, task_id, thread_id ops
kafka_stream.stream_task_metrics_process_rate Kafka Streams 任务每秒处理的记录数 cloud_provider, cluster_name, host, task_id, thread_id ops
kafka_stream.stream_thread_metrics_blocked_time_ns Kafka Streams 线程因等待而阻塞的累计时间 cloud_provider, cluster_name, host, thread_id ns
kafka_stream.stream_thread_metrics_commit_rate Kafka Streams 线程每秒提交状态的次数 cloud_provider, cluster_name, host, thread_id ops
kafka_stream.stream_thread_metrics_poll_latency_avg Kafka Streams 线程 poll 调用的平均延迟 cloud_provider, cluster_name, host, thread_id ms
kafka_stream.stream_thread_metrics_poll_rate Kafka Streams 线程每秒执行 poll 的次数 cloud_provider, cluster_name, host, thread_id ops
kafka_stream.stream_thread_metrics_task Kafka Streams 线程创建的累计任务数 cloud_provider, cluster_name, host, thread_id count
kafka_stream.stream_thread_metrics_task_closed Kafka Streams 线程关闭的累计任务数 cloud_provider, cluster_name, host, thread_id count
kafka_stream.stream_thread_metrics_thread_start_time Kafka Streams 线程启动时间戳 cloud_provider, cluster_name, host, thread_id ms
kafka_stream.stream_topic_metrics_bytes_consumed Kafka Streams 从 Topic 累计消费的字节数 cloud_provider, cluster_name, host, thread_id, topic B
kafka_stream.stream_topic_metrics_bytes_produced Kafka Streams 向 Topic 累计生产的字节数 cloud_provider, cluster_name, host, thread_id, topic B
kafka_stream.stream_topic_metrics_records_consumed Kafka Streams 源处理器节点累计消费的记录数 cloud_provider, cluster_name, host, processor_node_id, thread_id, topic count
kafka_stream.stream_topic_metrics_records_produced Kafka Streams 接收器处理器节点累计生成的记录数 cloud_provider, cluster_name, host, processor_node_id, thread_id, topic count

Kafka Connect 指标

kafka_connect 指标集包含 8 个推荐指标上下文。

MetricName MetricDescribe Dimensions Unit
kafka_connect.worker_connector_count Kafka Connect Worker 当前运行的 Connector 数量 cloud_provider, cluster_name, host count
kafka_connect.worker_connector_startup_attempts Kafka Connect Worker 尝试启动 Connector 的累计次数 cloud_provider, cluster_name, host count
kafka_connect.worker_connector_startup_failure_percentage Kafka Connect Worker 启动 Connector 失败的比率 cloud_provider, cluster_name, host percent
kafka_connect.worker_rebalance_completed_rebalances Kafka Connect Worker 已完成的再平衡累计次数 cloud_provider, cluster_name, host count
kafka_connect.worker_rebalance_time_since_last_rebalance_ms Kafka Connect Worker 距上次再平衡完成的时间 cloud_provider, cluster_name, host ms
kafka_connect.worker_task_startup_attempts Kafka Connect Worker 尝试启动 Task 的累计次数 cloud_provider, cluster_name, host count
kafka_connect.worker_task_startup_failure Kafka Connect Worker 启动 Task 失败的累计次数 cloud_provider, cluster_name, host count
kafka_connect.worker_task_startup_failure_percentage Kafka Connect Worker 启动 Task 失败的比率 cloud_provider, cluster_name, host percent

文档评价

文档内容是否对您有帮助? ×