Agent モニタリング¶
Agent モニタリングは、Agent / LLM リクエストをアプリケーション全体のトレースに関連付け、各会話の完全なフローを追跡し、生成タスクごとに消費される Token 数を正確に計測します。
Agent モニタリングサービスの実際の利用では、以下が可能です:
- 単一リクエストの完全なトレースを確認:ユーザーの質問が受信され、処理(データベースクエリなど)され、LLM モデルを呼び出して回答が返されるまでの全体のプロセスを明確に確認できます
- パフォーマンスのボトルネックを分析:各ステップ(モデル呼び出しやデータ検索など)の所要時間を正確に測定し、レイテンシーを迅速に検出できます
- 上流・下流のサービスを関連付け:Agent / LLM リクエストを関連するアプリケーションやインフラストラクチャのメトリクスと関連付け、包括的な根本原因分析を行えます
コア機能¶
Agent モニタリングの中核は、入力(Prompt)、出力(Completion)とシステムの動作の間に定量化可能な関連付けを確立することです。コア機能は次の 3 つの側面に現れます:
1. エンドツーエンドのトレーシング
Agent / LLM 呼び出しフレームワークでは、Trace と Span を使用してリクエストの全トレースを正確に追跡し、レイテンシーのボトルネックを特定します。
2. 出力品質の評価
Prompt Eval と Schema Eval を使用して、モデルの出力をオンラインまたはバッチで評価し、スコアとルールの該当結果を確認できます。Prompt Eval は評価目標を記述して設定を生成し、カスタム評価入力で渡すコンテキストを選択できます。手動アノテーションによる出力の再確認にも対応し、サンプルをデータセットに蓄積して、後続のバッチ評価に使用できます。
3. コスト計測
各リクエストの Token 消費量(入力 / 出力の内訳)、モデルタイプ、呼び出しパラメータを自動的に収集して関連付け、複数のビジネスディメンションに基づくコスト配分機能を提供します。
はじめに¶
アプリケーション一覧¶
アプリケーション一覧に移動すると、モニタリングアプリケーションを作成および管理できます。Agent モニタリングアプリケーションは、タイプ別にAgent アプリとAgent フレームワークに分類されます:
- Agent アプリ:Codex、Claude Code、OpenClaw、Hermes、Qoder、WorkBuddy、OpenCode、CodeBuddy、Cursor、DeepSeek Harness、Opm、mimo、pi に対応しています。各タイプの接続方法については、Agent モニタリングアプリを作成を参照してください。
- Agent フレームワーク:AgentScope、Spring AI Alibaba、Deep Agents に対応し、OpenTelemetry による手動接続を行います。
- LLM モニタリングアプリ:Langfuse による接続に対応しています。
ページのガイドに従ってパラメータを設定すると、データ収集を開始できます。
サマリーページでは、「表示項目」から表示する Agent タイプをカスタマイズし、各タイプの表示順序を調整できます。
デスクトップで Codex、Claude Code、WorkBuddy の使用量情報を一元的に確認する場合や、GUI で基本収集と拡張収集を管理する場合は、AgentMeter 使用ガイドを参照してください。Agent ごとにサポートされる使用量メトリクスは、ガイド内の説明に従います。
エクスプローラー¶
データ接続後、エクスプローラーで Session または Trace のディメンションでデータを検索・フィルタリングできます:
- User リスト:
user_idで User の使用状況を集計し、Agent タイプ、インスタンス、Session、リクエスト数、Token またはポイント消費量、直近のアクティブ時間を確認できます。 - Session リスト:Session ID、入力 / 出力 Token、リスクイベント数、アラートレベルを確認し、詳細ページにドリルダウンして Trace のウォーターフォールチャート、モデル / Skill / Tool の呼び出し割合、呼び出し詳細、リスクイベントを確認できます。
- Trace リスト:Trace ID、所属 Session、所要時間、Token、ステータス、危険な操作数、アラートレベルを確認し、ドリルダウンして Span の詳細、危険な操作、ツール呼び出しレコード、Skill 呼び出しレコードを確認できます。
分析ダッシュボード¶
分析ダッシュボードでは、アプリケーションの稼働状況をグラフ形式で概観できます。アプリケーションタイプで絞り込んで表示でき、アプリケーションタイプによって分析ダッシュボードの表示内容が異なります:
-
LLM モニタリングアプリ:リクエスト数、Span 数、リクエストエラー率、Token 総消費量、平均応答時間などの概要メトリクスに加え、リクエストトレンド、Token 消費トレンド、モデル別リクエスト数の割合、モデル別 Token 使用量ランキングなどを表示します。
-
Agent モニタリングアプリ:実行概要、モデルと Token、Tool モジュール、Skill モジュールの 4 つのモジュールで表示します。
- 実行概要:総操作数、Tool・LLM・Skill の呼び出し総数、Token 総量、およびモデル・Tool・Skill の呼び出し分布
- モデルと Token:LLM 呼び出しトレンド、入力 / 出力 Token トレンド、モデル別 Token トレンド、LLM 呼び出し所要時間のパーセンタイル、および最初の Token までの平均到達時間(TTFT)
- Tool モジュール:アクティブな Tool 数、最大所要時間、呼び出しトレンド、平均所要時間、および異常トップ 10
- Skill モジュール:アクティブな Skill 数、最大所要時間、呼び出しトレンド、平均所要時間、および異常トップ 10