18. 運用ダッシュボード¶
本章の読者は運用管理者を想定しており、参照のみのロールで到達できます。画面を開き、表示される数字の意味を本章で確かめながら読み進めてください。
項目
18.1. 何が見える画面か¶
この画面は、エージェントの実行を集計して「壊れていないか・遅くなっていないか」(品質・性能)を確認するためのものです。異常の兆候(エラー率の上昇、特定エージェントの遅延、ガードレールの発動など)に気づいたら、トレース一覧・詳細へ条件を引き継いだまま掘り下げる起点です。費用を横断的に分析する画面は「経営ダッシュボード」であり、本画面の「エージェント別ランキング」に出てくる「1実行あたりコスト」は異常検知の補助情報という位置づけです。
サイトマップから「Copilot」→「Accel Agent」→「ワークスペース」を開き、画面左のサイドナビゲーションの「運用ダッシュボード」から移動します。
期間、実行種別、プロセス種別、対象エージェント、使用モデルで絞り込めます。期間の既定は直近 7 日間で、1 時間・6 時間・24 時間・7 日・30 日・90 日・カスタム(開始・終了を指定)から選べます。
使用モデルの絞り込みは、その実行で実際に使われた全モデル(LLM 呼び出しのモデル名)が対象です。トレースが持つ主モデル(代表の 1 モデル)だけでは判定しないため、1 回の実行の中で一部だけ別モデルへルーティングした場合も、この絞り込みに含まれます。
図:運用ダッシュボードの画面上部。絞り込み、4 つの KPI、エラー率・応答時間・実行回数の推移グラフが並ぶ。
18.2. KPI の 4 枚¶
画面上部には、実行回数、エラー率、平均応答時間、ガードレール ブロックという 4 つの KPI が並びます。分母となる実行数が 0 件のとき、エラー率は「0%」ではなく「-(ハイフン)」と表示されます(母数が無い以上、率を定義できないためです)。
18.3. 推移グラフ¶
エラー率、応答時間、実行回数の 3 種類について、推移グラフが表示されます。系列の数が多い場合の扱いは指標によって異なります。実行回数は合算できるため、上位以外を「その他」にまとめて棒の高さ(総実行回数)を保ちます。一方、エラー率と応答時間は合算できない値のため、上位以外の系列は「その他」に束ねずに非表示とし、省略した件数を注記で示します。
応答時間推移は、対象エージェントの絞り込み方で見え方が変わります。「すべて」のときはエージェントごとの p90 を色分けした折れ線になり、特定のエージェント(または直接実行)に絞ったときは、その母集団の平均と分位点(p50・p90・p95・p99)の 5 本に切り替わります。
応答時間のグラフに出てくる値の意味は、次のとおりです。
| 値 | 意味 |
|---|---|
| 平均 | すべての実行の応答時間を足して、実行数で割った値。極端に遅い実行が少しあるだけで大きく引き上げられる |
| p50(中央値) | 応答時間を短い順に並べたとき、ちょうど真ん中にある値。半数の実行はこれより速く終わる。利用者が普段感じる速さに近い |
| p90・p95・p99 | それぞれ、実行の 90%・95%・99% がその時間以内に終わる値。残りの 10%・5%・1% は、これより遅い。遅い側の実行がどれだけ遅いかを表す |
これらの値は、組み合わせて見ることで、遅さの原因の見当をつけられます。
- 平均が p50 より大きく離れている: 一部の極端に遅い実行が、平均を引き上げています。トレース一覧を「実行時間」の長い順に並べ替えて、遅い実行を個別に確認します(「トレース一覧・詳細の読み方」)。
- p50 は安定していて、p95・p99 だけが上がっている: 大半の実行は普段どおりで、一部の実行だけが遅くなっています。特定の入力でツールの呼び出し回数が増えている、外部サービスの応答が遅いなど、条件が限られた原因を疑います。
- p50 を含めて全体が上がっている: すべての実行が遅くなっています。AIモデルの変更や、AIサービス側の応答の遅れなど、全体に影響する原因を疑います。
- 「すべて」を選んだときのエージェントごとの p90: エージェント同士の比較に使います。他より p90 が高いエージェントから確認します。
実行数が少ない期間では、p95・p99 は数件の実行だけで決まるため、値が大きくぶれます。例えば実行が 100 件未満なら、p99 はほぼ最も遅い 1 件の値です。上位の分位点は、ある程度の実行数がある期間で見るようにします。
いずれの推移グラフも、対象期間内に実行が無かった区間は「0%」「0 秒」ではなく、線を途切れさせて空欄で表します。実行が無かったことと、実行はあったが問題が無かったこと(0 の実績)を区別するためです。
18.4. 内訳と一覧¶
内訳と一覧は、知りたいことに応じて次のように使い分けます。
| 知りたいこと | 見るところ |
|---|---|
失敗がどの種類に偏っているか
どの処理で起きているか
|
「エラー種別内訳」 |
1 回あたりの時間が長い処理はどれか
呼び出し回数が多く、合計では時間を使っている処理が無いか
|
「スパン種別別 平均所要時間」 |
特定のツールだけ失敗していないか
どのツールがよく使われているか
|
「ツール別利用状況」 |
回答の根拠になる文書が見つかっているか
空振りした検索は何を問い合わせていたか
|
「ナレッジ検索ゼロヒット」 |
いま起きている失敗の中身を 1 件ずつ見たい
新しいバージョンを公開してから失敗が増えていないか
|
「直近エラー一覧」 |
どのエージェントを優先して調べるか
エージェントごとの状態を並べて比べたい
|
「エージェント別ランキング」 |
図:「スパン種別別 平均所要時間」「ツール別利用状況」「ナレッジ検索ゼロヒット」(ゼロヒットの割合と、検索クエリ・発生時刻の一覧)が並ぶ。
18.4.1. エラー種別内訳¶
エラーで終わった実行を、エラーが起きた処理(エラー種別)ごとに集計します。
- 表示内容: LLMエラー・ツールエラー・ナレッジエラー・構造化出力エラー・コンテキスト圧縮エラー・その他の件数と、エラー総件数に対する構成比。ガードレールによるブロックは障害ではなく防御動作のため、区切りの下に、検査位置ごとに分けて表示されます。
- 読み方: 件数の多い種別が、失敗の多い処理です。例えば、LLMエラーが多ければ AIサービスや AIモデルの設定を、ツールエラーが多ければツールの接続先を確認します。
- 操作: 行を展開すると、エージェント別の内訳が表示されます(件数が多いときは「内訳を表示(N件)」から残りを表示できます)。各種別の「トレース一覧」から、その種別で終わった実行を一覧で確認できます。
18.4.2. スパン種別別 平均所要時間¶
応答時間の内訳として、どの処理に時間がかかっているかを表示します。
- 表示内容: 処理の種類(モデル呼び出し、ツール呼び出し、ナレッジ検索、ガードレール、構造化出力、コンテキスト圧縮、検索クエリ書き換え)ごとの、1 回あたりの平均所要時間と呼び出し回数。
- 読み方: 1 回あたりの時間が長い処理と、呼び出し回数が多い処理の両方を見ます。1 回は短くても何度も呼ばれる処理は、全体への影響が大きくなります。例えば、モデル呼び出しが長ければ AIモデルの応答やプロンプトの長さを、ツール呼び出しが長ければ接続先のシステムの応答を疑います。
- 注意: 値は 1 回の呼び出しにかかった時間です。1 回の実行あたりの内訳ではないため、合計しても平均応答時間にはなりません。また、実行全体やイテレーションのように、ほかの処理を内側に含むものは、時間を重ねて数えないよう集計から除いています。
- 操作: 行を展開すると、エージェント別の内訳が表示されます(件数が多いときは「内訳を表示(N件)」から残りを表示できます)。
18.4.3. ツール別利用状況¶
ツールごとの呼び出し回数とエラー率を表示します。
- 表示内容: 「ツール」「種別」「呼び出し回数」「エラー率」の表。集計はツール呼び出し 1 回ごとで、実行(トレース)単位ではありません。
- 読み方: エラー率の高いツールが無いかを確認します。ツールが失敗しても、エラーの内容が LLM に返されて処理が続くことがあるため、実行全体は正常に終わっていることがよくあります。こうした失敗は「直近エラー一覧」には現れないため、ここで確認します。
18.4.4. ナレッジ検索ゼロヒット¶
ナレッジ検索のうち、参照できる文書が 1 件も見つからなかった割合を表示します。
- 表示内容: 「N件 / 正常完了した検索 M件」の形の件数と、ゼロヒットになった検索クエリ・発生時刻の一覧。検索自体が失敗したものは分母から除き、除いた件数を別に表示します。
- 読み方: 一覧の検索クエリを見て、何を探して見つからなかったのかを確認します。ナレッジベースに必要な文書が無い、または検索の条件が合っていない可能性があります。行をクリックすると、そのトレースの詳細に移動します。
- 注意: ゼロヒットは正常な応答として扱われるため、エラー率にもエラー種別内訳にも現れません。この表示でしか気づけない劣化です。
18.4.5. 直近エラー一覧¶
エラーで終わった実行を、新しい順に 1 件ずつ表示します。
- 表示内容: 現在の絞り込みに該当する実行を、開始時刻の新しい順に最大 20 件。列は「開始時刻」「プロセス名」「バージョン」「エラー種別」「実行時間」です。
- 読み方: 個々の失敗の中身を確かめる入口として使います。「バージョン」の列から、新しいバージョンを公開してから失敗が増えていないかも確認できます。
- 注意: ガードレールによるブロックも、実行が中断された事象として含みます。KPI の「エラー率」はブロックを含まないため、件数の考え方が異なります。
- 操作: 行をクリックすると、そのトレースの詳細に移動します。20 件を超える場合は「全N件中 直近20件」と表示され、「すべて表示」から、現在の期間・実行種別・プロセス種別・対象エージェントの条件を引き継いだトレース一覧で全件を確認できます。
18.4.6. エージェント別ランキング¶
エージェントごとの状態を並べて比べます。
- 表示内容: 「エラー率」「平均応答時間」「p95応答時間」「ガードレール ブロック」「1実行あたりコスト」「1実行あたりトークン」「実行数」の列。
- 読み方: 既定ではエラー率の高い順に並ぶため、上から順に調べます。列見出しをクリックすると、その列で並べ替えられます。
図:「エージェント別ランキング」と「直近エラー一覧」。行をクリックすると、その条件を引き継いだままトレース詳細へ遷移する。
18.5. トレースへの掘り下げ¶
p90・p95・p99 を超えた外れ値や、特定のエラー種別、「直近エラー一覧」からは、その条件を引き継いだままトレースへ遷移できます。応答時間の外れ値は、いったん概要一覧のダイアログが開き、そこから個別のトレース詳細、またはダイアログ下部のボタンで条件付きのトレース一覧へ進みます。いずれの遷移も別タブで開き、ダッシュボード側の絞り込み状態は失われません。しきい値を設定してアラートを通知する仕組みは用意されていません。
18.6. 読み違えやすい点¶
- エラー率は、KPI とランキングではガードレールによるブロックを除外して計算されますが、推移グラフと直近エラーの一覧では、ガードレールによるブロックを含めて計算されます。
- 実行種別は、本番とテストの 2 択で、既定は本番です。テスト実行しか行っていない場合、画面には 0 件と表示されます。
- 単価が未設定のモデルによる実行 1 件のコストは、0 ではなく「-(ハイフン)」と表示されます。一方、「エージェント別ランキング」の「1実行あたりコスト」は複数実行の平均であり、単価未設定の呼び出しを含む行でも分母(実行数)を減らさずに算出します。そのため値は実態より小さく出ますが、値自体は隠さず表示したうえで警告を添えます。
- 直接実行(エージェント定義を経由しない実行)は、呼び出し元を区別せず 1 つのグループへ集約されます。個々の呼び出し元ごとの内訳は見られません。
- エラー種別内訳からトレース一覧へ掘り下げると、検査位置(入力/ツール入力/ツール出力/出力)の区別は引き継がれません。「ガードレール ブロック」で絞り込んだ場合、どの検査位置で止まったかはトレース詳細側で確認します。
- 「経営ダッシュボード」の失敗コストには、ガードレール ブロックで中断した実行も含まれます。ブロックされるまでに LLM を呼び出していれば、その分のトークンは消費されるためです。本章の KPI とランキングのエラー率はガードレール ブロックを除外するため、運用ダッシュボードでエラー率が 0% のエージェントでも、経営ダッシュボードでは失敗コストが計上されることがあります。
- 金額は USD で表示されます。画面右上の「1 USD =」の欄にレートを入力すると、表示だけを別の通貨に換算できます(「コストの見方」)。