AWS MSK (Prometheus)¶
Amazon Managed Streaming for Apache Kafka(Amazon MSK)开放监控可以将 Kafka Broker JMX 和 Broker 节点指标以 Prometheus 格式暴露。DataKit 通过 Prometheus 采集器直接抓取这些端点,不使用 AWS AK、Func 或 CloudWatch 云采集脚本。
配置¶
前置条件¶
- 本集成适用于已启用 Amazon MSK 开放监控 的 MSK Provisioned 集群。
- 存量集群启用开放监控前必须处于
ACTIVE状态。新建集群可以在创建时启用;存量集群可以在集群属性的 Monitoring 区域编辑启用。 - DataKit 必须部署在能够解析并访问 MSK Broker 私有 DNS 的网络中,通常是相同 VPC 或已打通网络的 VPC。
- MSK 安全组需要允许 DataKit 所在安全组或网段访问 TCP
11001和11002;VPC 需要启用 DNS。网络要求可参考 AWS MSK Prometheus Collector 前置条件。 - JMX Exporter 使用
11001,Node Exporter 使用11002。AWS 建议抓取间隔不低于 60 秒,过短的间隔可能增加集群 CPU 使用率。
注意:KRaft 元数据模式和 MSK Express Broker 不能同时启用开放监控与公共访问。开放监控本身不收费,但跨可用区传输数据可能产生费用。
启用开放监控¶
新建 MSK Provisioned 集群时,在 Monitoring 区域选中「Enable open monitoring with Prometheus」,并启用 JMX Exporter、Node Exporter 或两者。
存量集群按以下步骤启用:
- 登录 Amazon MSK 控制台,打开目标集群。
- 在 Properties 页签找到 Monitoring,单击 Edit。
- 选中「Enable open monitoring with Prometheus」。
- 启用 JMX Exporter、Node Exporter 或两者,然后保存修改。
也可以使用 AWS CLI 更新监控配置:
aws kafka update-monitoring \
--cluster-arn <cluster-arn> \
--current-version <current-version> \
--open-monitoring 'Prometheus={JmxExporter={EnabledInBroker=true},NodeExporter={EnabledInBroker=true}}'
更多信息参见 AWS 官方文档:
获取 Prometheus 监控目标¶
使用 ListNodes 获取集群的 Broker DNS:
记录返回结果中 BrokerNodeInfo.Endpoints 的所有 Broker DNS。每个 Broker 需要配置两个目标:
| 类型 | 目标 | 说明 |
|---|---|---|
| JMX Exporter | <broker-dns>:11001 |
Kafka Broker JMX 指标和 Consumer Lag 指标。 |
| Node Exporter | <broker-dns>:11002 |
Broker 节点 CPU、内存、磁盘和网络指标。 |
KRaft 集群如需采集 Controller JMX 指标,还需要将 ControllerNodeInfo.Endpoints 返回的 Controller DNS 加入 11001 目标。端点格式和 KRaft 说明参见 AWS Prometheus Host 配置。
在 DataKit 主机上验证网络连通性:
curl -sS "http://<broker-dns>:11001/metrics" | head
curl -sS "http://<broker-dns>:11002/metrics" | head
配置 DataKit¶
进入 DataKit 安装目录下的 conf.d/samples 目录,复制 prom.conf.sample 并命名为 aws_msk_prom.conf:
调整 aws_msk_prom.conf。将所有 Broker DNS 加入对应的 urls;KRaft Controller DNS 只加入 JMX Exporter 配置。
[[inputs.prom]]
urls = [
"http://<broker-dns-1>:11001/metrics",
"http://<broker-dns-2>:11001/metrics",
# KRaft 可选:
# "http://<controller-dns-1>:11001/metrics",
]
source = "kafka_jmx"
interval = "60s"
metric_name_filter = ["^kafka_"]
measurement_prefix = ""
keep_exist_metric_name = false
honor_timestamps = true
election = false
disable_host_tag = true
disable_instance_tag = true
disable_info_tag = false
[[inputs.prom.measurements]]
prefix = "kafka_controller_"
name = "kafka_controller"
[[inputs.prom.measurements]]
prefix = "kafka_network_"
name = "kafka_network"
[[inputs.prom.measurements]]
prefix = "kafka_log_"
name = "kafka_log"
[[inputs.prom.measurements]]
prefix = "kafka_server_"
name = "kafka_server"
[inputs.prom.tags]
cloud_provider = "aws"
service = "msk"
region_id = "<aws-region>"
cluster_id = "<cluster-arn-or-id>"
cluster_name = "<msk-cluster-name>"
[[inputs.prom]]
urls = [
"http://<broker-dns-1>:11002/metrics",
"http://<broker-dns-2>:11002/metrics",
]
source = "kafka_node"
interval = "60s"
metric_name_filter = ["^node_"]
measurement_prefix = ""
keep_exist_metric_name = false
honor_timestamps = true
election = false
disable_host_tag = true
disable_instance_tag = true
disable_info_tag = false
[[inputs.prom.measurements]]
prefix = "node_"
name = "kafka_node"
[inputs.prom.tags]
cloud_provider = "aws"
service = "msk"
region_id = "<aws-region>"
cluster_id = "<cluster-arn-or-id>"
cluster_name = "<msk-cluster-name>"
# 可选:采集业务 Producer、Consumer、Kafka Streams、Kafka Connect 等客户端 JMX Exporter 指标。
[[inputs.prom]]
urls = [
"http://<producer-client-ip>:7072/metrics",
"http://<consumer-client-ip>:7073/metrics",
"http://<streams-client-ip>:7074/metrics",
"http://<connect-worker-ip>:7075/metrics",
]
source = "kafka_client"
interval = "60s"
metric_name_filter = ["^kafka_(producer|consumer|stream|connect)_"]
measurement_prefix = ""
keep_exist_metric_name = false
honor_timestamps = true
election = false
disable_host_tag = false
disable_instance_tag = true
disable_info_tag = false
[[inputs.prom.measurements]]
prefix = "kafka_producer_"
name = "kafka_producer"
[[inputs.prom.measurements]]
prefix = "kafka_consumer_"
name = "kafka_consumer"
[[inputs.prom.measurements]]
prefix = "kafka_connect_"
name = "kafka_connect"
[[inputs.prom.measurements]]
prefix = "kafka_stream_"
name = "kafka_stream"
[inputs.prom.tags]
cloud_provider = "aws"
service = "msk"
region_id = "<aws-region>"
cluster_id = "<cluster-arn-or-id>"
cluster_name = "<msk-cluster-name>"
11001 暴露 Kafka Broker JMX 和 Consumer Lag 指标,11002 暴露 Broker 节点 CPU 与磁盘等指标,具体范围参见 AWS Prometheus 指标说明。Producer、Consumer、Kafka Streams 和 Kafka Connect 属于客户端进程指标,需要在相应进程中单独挂载 JMX Exporter 后采集。
配置完成后重启 DataKit:
验证¶
- 在 DataKit 日志中确认
aws_msk_prom.conf没有连接或解析错误。 - 在观测云「指标」中确认存在
kafka_controller、kafka_network、kafka_server和kafka_node等指标集。 - 检查指标标签中
cloud_provider=aws、cluster_name=<msk-cluster-name>和 Brokerhost是否符合预期。 - 如果配置了客户端 JMX Exporter,再确认
kafka_producer、kafka_consumer、kafka_stream和kafka_connect指标集存在数据。
指标¶
配置好 Prometheus 采集后,推荐指标范围包含以下 9 个指标集、115 个按 measurement、field 和固定语义标签区分的指标上下文。Amazon MSK 开放监控原生提供 Broker JMX 与 Node Exporter 指标;Producer、Consumer、Kafka Streams 和 Kafka Connect 指标需要在对应客户端进程上单独开启 JMX Exporter。
Controller 指标¶
kafka_controller 指标集包含 8 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_controller.ControllerEventManager_Count{name=EventQueueTimeMs} |
Controller 事件队列等待时间指标记录的累计样本数。 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.ControllerEventManager_Value{name=EventQueueSize} |
Controller 事件队列中当前等待处理的事件数量。 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.KafkaController_Value{name=ActiveBrokerCount} |
当前处于活动状态并参与集群服务的 Broker 数量。 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.KafkaController_Value{name=ActiveControllerCount} |
集群中当前活动的 Controller 数量,正常情况下通常为 1 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.KafkaController_Value{name=FencedBrokerCount} |
当前被隔离、不能参与正常集群服务的 Broker 数量。 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.KafkaController_Value{name=GlobalPartitionCount} |
集群当前分区总数;多个 Broker 暴露相同全局值时取最大值 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.KafkaController_Value{name=GlobalTopicCount} |
集群当前 Topic 总数;多个 Broker 暴露相同全局值时取最大值 | cloud_provider, cluster_name, host, name |
count |
kafka_controller.KafkaController_Value{name=OfflinePartitionsCount} |
集群当前没有 Leader、无法正常读写的分区数量 | cloud_provider, cluster_name, host, name |
count |
网络请求指标¶
kafka_network 指标集包含 24 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_network.RequestChannel_Value{name=RequestQueueSize} |
Broker 请求队列中当前等待处理的条目数量 | cloud_provider, cluster_name, host, name |
count |
kafka_network.RequestChannel_Value{name=ResponseQueueSize} |
Broker 响应队列中当前等待处理的条目数量 | cloud_provider, cluster_name, host, name |
count |
kafka_network.RequestMetrics_95thPercentile{name=TotalTimeMs;request=FetchConsumer} |
FetchConsumer 请求的端到端P95 处理耗时 | cloud_provider, cluster_name, host |
ms |
kafka_network.RequestMetrics_95thPercentile{name=TotalTimeMs;request=Produce} |
Produce 请求的端到端P95 处理耗时 | cloud_provider, cluster_name, host |
ms |
kafka_network.RequestMetrics_Max{name=TemporaryMemoryBytes;request=Produce} |
Broker 处理 Produce 请求时使用的最大临时内存。 | cloud_provider, cluster_name, host, name, request |
B |
kafka_network.RequestMetrics_Mean{name=LocalTimeMs;request=FetchConsumer} |
FetchConsumer 请求的本地处理平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=LocalTimeMs;request=FetchFollower} |
FetchFollower 请求的本地处理平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=MessageConversionsTimeMs;request=Produce} |
Produce 请求的消息格式转换平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=RemoteTimeMs;request=FetchConsumer} |
FetchConsumer 请求的远程处理平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=RemoteTimeMs;request=FetchFollower} |
FetchFollower 请求的远程处理平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=RemoteTimeMs;request=Produce} |
Produce 请求的远程处理平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=RequestQueueTimeMs;request=FetchConsumer} |
FetchConsumer 请求的在请求队列中的平均等待时间 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=RequestQueueTimeMs;request=Produce} |
Produce 请求的在请求队列中的平均等待时间 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=ResponseQueueTimeMs;request=FetchConsumer} |
FetchConsumer 请求的在响应队列中的平均等待时间 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=ResponseQueueTimeMs;request=FetchFollower} |
FetchFollower 请求的在响应队列中的平均等待时间 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=ResponseQueueTimeMs;request=Produce} |
Produce 请求的在响应队列中的平均等待时间 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=ResponseSendTimeMs;request=FetchConsumer} |
FetchConsumer 请求的发送响应的平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=ResponseSendTimeMs;request=FetchFollower} |
FetchFollower 请求的发送响应的平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=ResponseSendTimeMs;request=Produce} |
Produce 请求的发送响应的平均耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=TotalTimeMs;request=FetchConsumer} |
FetchConsumer 请求的端到端平均处理耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_Mean{name=TotalTimeMs;request=Produce} |
Produce 请求的端到端平均处理耗时 | cloud_provider, cluster_name, host, name, request |
ms |
kafka_network.RequestMetrics_OneMinuteRate{name=RequestsPerSec} |
Broker 最近一分钟的请求速率 | cloud_provider, cluster_name, host, name, request |
ops |
kafka_network.SocketServer_Value{name=MemoryPoolUsed} |
Broker 网络层内存池当前已使用的内存大小 | cloud_provider, cluster_name, host, name |
B |
kafka_network.SocketServer_Value{name=NetworkProcessorAvgIdlePercent} |
Broker 网络处理线程处于空闲状态的时间比率 | cloud_provider, cluster_name, host, name |
percent |
日志指标¶
kafka_log 指标集包含 4 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_log.LogFlushStats_OneMinuteRate{name=LogFlushRateAndTimeMs} |
Broker 每秒执行日志刷盘操作的平均次数 | cloud_provider, cluster_name, host, name |
ops |
kafka_log.Log_Value{name=LogEndOffset} |
所选 Topic 分区当前日志末端偏移量 | cloud_provider, cluster_name, host, name, partition, topic |
offset |
kafka_log.Log_Value{name=LogStartOffset} |
所选 Topic 分区当前最早可读取的日志偏移量 | cloud_provider, cluster_name, host, name, partition, topic |
offset |
kafka_log.Log_Value{name=Size} |
所选 Topic 分区日志占用的磁盘空间 | cloud_provider, cluster_name, host, name, topic |
B |
Broker 服务指标¶
kafka_server 指标集包含 10 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=BytesInPerSec} |
Broker 或 Topic 每秒接收的生产消息字节数 | cloud_provider, cluster_name, host, name, topic |
B/S |
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=BytesOutPerSec} |
Broker 或 Topic 每秒发送给消费者的字节数 | cloud_provider, cluster_name, host, name, topic |
B/S |
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=FetchMessageConversionsPerSec} |
Broker 每秒执行 Fetch 消息格式转换的次数 | cloud_provider, cluster_name, host, name, topic |
ops |
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=MessagesInPerSec} |
Broker 或 Topic 每秒接收的消息数 | cloud_provider, cluster_name, host, name, topic |
ops |
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=TotalFetchRequestsPerSec} |
Broker 或 Topic 每秒收到的 Fetch 请求数 | cloud_provider, cluster_name, host, name, topic |
ops |
kafka_server.BrokerTopicMetrics_OneMinuteRate{name=TotalProduceRequestsPerSec} |
Broker 或 Topic 每秒收到的 Produce 请求数 | cloud_provider, cluster_name, host, name, topic |
ops |
kafka_server.KafkaRequestHandlerPool_FiveMinuteRate{name=RequestHandlerAvgIdlePercent} |
Broker 请求处理线程最近五分钟的平均空闲比率 | cloud_provider, cluster_name, host |
percent |
kafka_server.ReplicaManager_Value{name=UnderMinIsrPartitionCount} |
同步副本数低于 min.insync.replicas 的分区数量 | cloud_provider, cluster_name |
count |
kafka_server.ReplicaManager_Value{name=UnderReplicatedPartitions} |
副本数低于目标副本因子的分区数量 | cloud_provider, cluster_name |
count |
kafka_server.socket_server_metrics_response_rate |
Broker 网络处理线程每秒发送的响应数量。 | cloud_provider, cluster_name, host |
ops |
节点资源指标¶
kafka_node 指标集包含 9 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_node.cpu_seconds_total{mode!=idle} |
Broker 节点非空闲 CPU 时间增长率除以全部 CPU 时间增长率所得的 CPU 使用率 | cloud_provider, cluster_name, host, mode |
percent |
kafka_node.disk_read_bytes_total |
Broker 节点磁盘每秒读取的字节数 | cloud_provider, cluster_name, host |
B/S |
kafka_node.disk_reads_completed_total |
Broker 节点磁盘每秒完成的读操作数 | cloud_provider, cluster_name, host |
ops |
kafka_node.disk_writes_completed_total |
Broker 节点磁盘每秒完成的写操作数 | cloud_provider, cluster_name, host |
ops |
kafka_node.disk_written_bytes_total |
Broker 节点磁盘每秒写入的字节数 | cloud_provider, cluster_name, host |
B/S |
kafka_node.filesystem_avail_bytes |
Broker 节点文件系统已使用空间占比。 | cloud_provider, cluster_name, host |
percent |
kafka_node.filesystem_files |
Broker 节点文件系统已使用 Inode 占比。 | cloud_provider, cluster_name, host |
percent |
kafka_node.filesystem_files_free |
Broker 节点文件系统已使用 Inode 占比。 | cloud_provider, cluster_name, host |
percent |
kafka_node.filesystem_size_bytes |
Broker 节点文件系统已使用空间占比。 | cloud_provider, cluster_name, host |
percent |
Producer 客户端指标¶
kafka_producer 指标集包含 13 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_producer.metrics_buffer_available_bytes |
Producer 当前未使用的缓冲区内存大小 | client_id, cloud_provider, cluster_name, host |
B |
kafka_producer.metrics_buffer_exhausted |
Producer 因缓冲区耗尽而丢弃的累计记录发送数 | client_id, cloud_provider, cluster_name, host |
count |
kafka_producer.metrics_buffer_exhausted_rate |
Producer 每秒因缓冲区耗尽而丢弃的记录发送数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_producer.metrics_bufferpool_wait_time_ns |
Producer 等待缓冲区空间分配的累计时间 | client_id, cloud_provider, cluster_name, host |
ns |
kafka_producer.metrics_connection_count |
客户端当前活动连接数 | client_id, cloud_provider, cluster_name, host |
count |
kafka_producer.metrics_failed_authentication |
客户端认证失败的累计连接数 | client_id, cloud_provider, cluster_name, host |
count |
kafka_producer.metrics_flush_time_ns |
Producer 执行 flush 操作的累计耗时 | client_id, cloud_provider, cluster_name, host |
ns |
kafka_producer.metrics_io_wait_time_ns |
Producer I/O 线程等待可读写套接字的累计耗时 | client_id, cloud_provider, cluster_name, host |
ns |
kafka_producer.metrics_request_rate |
客户端每秒发送的请求数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_producer.metrics_requests_in_flight |
Producer 已发送但尚未收到响应的请求数 | client_id, cloud_provider, cluster_name, host |
count |
kafka_producer.metrics_response_rate |
客户端每秒收到的响应数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_producer.metrics_select_rate |
客户端 I/O 线程每秒执行 select 的次数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_producer.metrics_txn_commit_time_ns |
Producer 提交事务所花费的累计时间 | client_id, cloud_provider, cluster_name, host |
ns |
Consumer 客户端指标¶
kafka_consumer 指标集包含 14 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_consumer.coordinator_metrics_rebalance_latency |
Consumer Group 最近一次再平衡的总耗时 | client_id, cloud_provider, cluster_name, host |
ms |
kafka_consumer.coordinator_metrics_rebalance_rate_per_hour |
Consumer Group 每小时发生再平衡的平均次数 | client_id, cloud_provider, cluster_name, host |
次/小时 |
kafka_consumer.metrics_connection_close_rate |
Consumer 每秒关闭的连接数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_consumer.metrics_connection_count |
客户端当前活动连接数 | client_id, cloud_provider, cluster_name, host |
count |
kafka_consumer.metrics_failed_authentication |
客户端认证失败的累计连接数 | client_id, cloud_provider, cluster_name, host |
count |
kafka_consumer.metrics_incoming_byte_rate |
客户端每秒从网络套接字读取的字节数 | client_id, cloud_provider, cluster_name, host |
B/S |
kafka_consumer.metrics_io_time_ns_avg |
Consumer 每次 select 调用执行 I/O 的平均耗时 | client_id, cloud_provider, cluster_name, host |
ns |
kafka_consumer.metrics_io_wait_time_ns_avg |
Consumer I/O 线程等待可读写套接字的平均耗时 | client_id, cloud_provider, cluster_name, host |
ns |
kafka_consumer.metrics_outgoing_byte_rate |
客户端每秒向 Broker 发送的字节数 | client_id, cloud_provider, cluster_name, host |
B/S |
kafka_consumer.metrics_request_rate |
客户端每秒发送的请求数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_consumer.metrics_request_size_avg |
Consumer 请求的平均大小 | client_id, cloud_provider, cluster_name, host |
B |
kafka_consumer.metrics_response_rate |
客户端每秒收到的响应数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_consumer.metrics_select_rate |
客户端 I/O 线程每秒执行 select 的次数 | client_id, cloud_provider, cluster_name, host |
ops |
kafka_consumer.metrics_time_between_poll_avg |
Consumer 相邻两次 poll 调用的平均间隔 | client_id, cloud_provider, cluster_name, host |
ms |
Kafka Streams 指标¶
kafka_stream 指标集包含 25 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_stream.stream_state_metrics_all_rate |
Kafka Streams 状态存储每秒执行的操作数 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
ops |
kafka_stream.stream_state_metrics_block_cache_capacity |
Kafka Streams RocksDB 块缓存容量 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
B |
kafka_stream.stream_state_metrics_block_cache_data_hit_ratio |
Kafka Streams RocksDB 块缓存数据命中比率 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
percent |
kafka_stream.stream_state_metrics_block_cache_filter_hit_ratio |
Kafka Streams RocksDB 块缓存过滤器命中比率 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
percent |
kafka_stream.stream_state_metrics_block_cache_index_hit_ratio |
Kafka Streams RocksDB 块缓存索引命中比率 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
percent |
kafka_stream.stream_state_metrics_block_cache_usage |
Kafka Streams RocksDB 块缓存当前使用量 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
B |
kafka_stream.stream_state_metrics_bytes_read_compaction_rate |
Kafka Streams 状态存储压缩每秒读取的字节数 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
B/S |
kafka_stream.stream_state_metrics_bytes_read_rate |
Kafka Streams 状态存储每秒读取的字节数 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
B/S |
kafka_stream.stream_state_metrics_bytes_written_compaction_rate |
Kafka Streams 状态存储压缩每秒写入的字节数 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
B/S |
kafka_stream.stream_state_metrics_bytes_written_rate |
Kafka Streams 状态存储每秒写入的字节数 | cloud_provider, cluster_name, host, rocksdb_state_id, thread_id |
B/S |
kafka_stream.stream_task_metrics_active_process_ratio |
Kafka Streams 任务线程用于处理记录的时间比率 | cloud_provider, cluster_name, host, task_id, thread_id |
percent |
kafka_stream.stream_task_metrics_cache_size_bytes |
Kafka Streams 任务缓存的总大小 | cloud_provider, cluster_name, host, task_id, thread_id |
B |
kafka_stream.stream_task_metrics_enforced_processing_rate |
Kafka Streams 任务每秒执行强制处理的次数 | cloud_provider, cluster_name, host, task_id, thread_id |
ops |
kafka_stream.stream_task_metrics_process_rate |
Kafka Streams 任务每秒处理的记录数 | cloud_provider, cluster_name, host, task_id, thread_id |
ops |
kafka_stream.stream_thread_metrics_blocked_time_ns |
Kafka Streams 线程因等待而阻塞的累计时间 | cloud_provider, cluster_name, host, thread_id |
ns |
kafka_stream.stream_thread_metrics_commit_rate |
Kafka Streams 线程每秒提交状态的次数 | cloud_provider, cluster_name, host, thread_id |
ops |
kafka_stream.stream_thread_metrics_poll_latency_avg |
Kafka Streams 线程 poll 调用的平均延迟 | cloud_provider, cluster_name, host, thread_id |
ms |
kafka_stream.stream_thread_metrics_poll_rate |
Kafka Streams 线程每秒执行 poll 的次数 | cloud_provider, cluster_name, host, thread_id |
ops |
kafka_stream.stream_thread_metrics_task |
Kafka Streams 线程创建的累计任务数 | cloud_provider, cluster_name, host, thread_id |
count |
kafka_stream.stream_thread_metrics_task_closed |
Kafka Streams 线程关闭的累计任务数 | cloud_provider, cluster_name, host, thread_id |
count |
kafka_stream.stream_thread_metrics_thread_start_time |
Kafka Streams 线程启动时间戳 | cloud_provider, cluster_name, host, thread_id |
ms |
kafka_stream.stream_topic_metrics_bytes_consumed |
Kafka Streams 从 Topic 累计消费的字节数 | cloud_provider, cluster_name, host, thread_id, topic |
B |
kafka_stream.stream_topic_metrics_bytes_produced |
Kafka Streams 向 Topic 累计生产的字节数 | cloud_provider, cluster_name, host, thread_id, topic |
B |
kafka_stream.stream_topic_metrics_records_consumed |
Kafka Streams 源处理器节点累计消费的记录数 | cloud_provider, cluster_name, host, processor_node_id, thread_id, topic |
count |
kafka_stream.stream_topic_metrics_records_produced |
Kafka Streams 接收器处理器节点累计生成的记录数 | cloud_provider, cluster_name, host, processor_node_id, thread_id, topic |
count |
Kafka Connect 指标¶
kafka_connect 指标集包含 8 个推荐指标上下文。
| MetricName | MetricDescribe | Dimensions | Unit |
|---|---|---|---|
kafka_connect.worker_connector_count |
Kafka Connect Worker 当前运行的 Connector 数量 | cloud_provider, cluster_name, host |
count |
kafka_connect.worker_connector_startup_attempts |
Kafka Connect Worker 尝试启动 Connector 的累计次数 | cloud_provider, cluster_name, host |
count |
kafka_connect.worker_connector_startup_failure_percentage |
Kafka Connect Worker 启动 Connector 失败的比率 | cloud_provider, cluster_name, host |
percent |
kafka_connect.worker_rebalance_completed_rebalances |
Kafka Connect Worker 已完成的再平衡累计次数 | cloud_provider, cluster_name, host |
count |
kafka_connect.worker_rebalance_time_since_last_rebalance_ms |
Kafka Connect Worker 距上次再平衡完成的时间 | cloud_provider, cluster_name, host |
ms |
kafka_connect.worker_task_startup_attempts |
Kafka Connect Worker 尝试启动 Task 的累计次数 | cloud_provider, cluster_name, host |
count |
kafka_connect.worker_task_startup_failure |
Kafka Connect Worker 启动 Task 失败的累计次数 | cloud_provider, cluster_name, host |
count |
kafka_connect.worker_task_startup_failure_percentage |
Kafka Connect Worker 启动 Task 失败的比率 | cloud_provider, cluster_name, host |
percent |