AIエージェントは同じ課題を5回やって全部成功するか──IBM Researchが「Pass^k」で測ると、平均77.4%のエージェントの全回成功は53.0%。温度0でも起きる24.4ポイントの「一貫性ギャップ」を、自分の記録から作ったガイドラインで半減
IBM Researchは2026年9月15日、AIエージェントの「一貫性」を測る指標と、それを改善する手法をHugging FaceのブログとarXivの技術報告で公開した。AppWorldベンチマークでGPT-4.1のReActエージェントを5回走らせると、平均の成功率(Mean@5)は77.4%だが、5回すべて成功した課題(Pass^5)は53.0%で、差は24.4ポイント。温度0でも、確率分布が平坦な判断点は実行環境のわずかな数値のゆれで結果が変わる。1本の記録の各判断点を5通り再サンプリングして「ぶれやすい判断」を特定し、そこから作った指針を推論時に渡すと、Pass^5は53.0%→69.0%、Mean@5は77.4%→81.0%で、差は12.0ポイントに縮んだ。別の似た課題でも+13.0ポイント。gpt-oss-120bでは10.1%→16.1%。

目次
2026年9月17日・日本時間時点の情報です。 IBM Researchの12人のチームが9月15日、AIエージェントの「同じ課題をもう一度やらせても成功するか」を測る指標と、改善の手法を公開した。リハーサルでは動いたのに本番のデモで別の道筋を取って失敗する──その現象を、ベンチマークの平均点が隠している、という話である。エージェントを仕事に使っている人(Claude CodeやCodexで同じ依頼を繰り返す人を含む)に関係するので、指標の定義、原因の説明、結果の数字、実務向けの助言の順に整理する。
3行まとめ
- 平均は信頼性を隠す。 AppWorld(test_normal・168課題)でGPT-4.1のReActエージェントを5回走らせると、平均成功率Mean@5は77.4%。しかし5回とも成功した課題の割合Pass^5は53.0%。差の24.4ポイントが「一貫性ギャップ」で、難しい課題では30ポイントに広がる。
- 温度0でも起きる。 判断はトークンの確率分布から出る。分布が鋭ければ何度でも同じ選択になるが、平坦(僅差の候補が並ぶ)だと、GPUの浮動小数点の非結合性やリクエストのバッチ処理といった実行環境側のわずかなゆれで順位が入れ替わる。実験は温度0.0で行われ、通常のサンプリングのばらつきではない。
- 記録1本から直せる。 「Consistency Analyzer」は記録済みの1本の軌跡の各判断点を、同じ文脈で5通り再サンプリングしてぶれやすさを採点する(正解データ不要・環境の再実行不要・1判断点につき追加1コール)。そこから作った指針を推論時に渡すと、Pass^5は53.0%→69.0%、Mean@5は77.4%→81.0%、ギャップは12.0ポイントに。似た別課題でも+13.0ポイント、gpt-oss-120bでは10.1%→16.1%。
指標の定義──Pass@kではなくPass^k
ブログの付録にある定義をそのまま写す。
| 指標 | 意味 |
|---|---|
| Mean@k | 課題をk回走らせた平均の成功率。多くのベンチマークが「正確さ」と呼ぶ数字 |
| Pass^k | k回すべて成功した課題の割合。常にMean@k以下。「同じ質問を2回したときに利用者が経験するもの」 |
| Pass@k | k回のうち少なくとも1回成功。楽観的な側で、コード生成の論文でよく使われる |
| 一貫性ギャップ | Mean@k − Pass^k(ポイント) |
ブログは「Pass^kはPass@kではない」と注意している。同じ文字で問いが逆で、Pass^k ≤ Mean@k ≤ Pass@k が常に成り立つ。リーダーボードに載るのはMean@k(kは3か、1のことも)で、「もう一度やっても大丈夫か」には答えない。
なぜ温度0でもぶれるのか
原文の要点を引く。
On a hosted endpoint the probabilities shift slightly from run to run, so the same prompt to the same model at temperature zero can still resolve a near-tie one way today and the other way tomorrow.
(ホスト型のエンドポイントでは確率が実行ごとにわずかに動くので、同じモデルに同じプロンプトを温度0で送っても、僅差の候補が今日はこちら、明日はあちらに決まることがある)
どのAPIを呼ぶか、どの引数を渡すか、やり直すか──エージェントの各判断は次トークンの確率分布から出る。分布が鋭い(1つの候補に質量が集中)なら実行環境のゆれでは覆らないが、平坦(複数の候補が僅差)なら覆る。1本の軌跡は数十の判断を連ねるので、1判断あたりの小さな反転確率が積み上がって、「どこかの実行が違う道を行く」確率が大きくなる。貪欲デコードや固定シードは「分布からトークンをどう選ぶか」を決めるだけで、分布そのものには触れない、というのがブログの説明である。
手法──診断してから指針を書く
- 診断(Consistency Analyzer)。 記録済みの軌跡1本について、各判断点を記録済みの文脈に対して再生し、k=5通りの補完を1回のコールで取って、出力がどれだけ変わるかを採点する。ツールの再実行も環境との再対話も、課題の再実行もしない。ロジットや内部状態は不要で、手元の記録だけで動く「ブラックボックス」の診断。判断点ごとの一貫性スコアをスコアカードに書く
- 生成(consistency guidelines)。 採点で危ういと出た判断点ごとに、既存のALTK-Evolveの形式で指針を作り、推論時に文脈へ入れる。ブログに載った実例(AppWorldの「SimpleNoteのメモにあるバケットリストのうち、済みの活動はいくつか」という課題からGPT-4.1が生成):
[Guideline 1] When counting checkbox-style markers in note content, use a line-anchored regex match rather than a plain substring count — note titles often repeat the marker symbol in a legend line.
(メモ内のチェックボックス風の印を数えるときは、単純な部分文字列の数え上げではなく行頭に固定した正規表現で照合すること。メモのタイトルは凡例の行で印の記号を繰り返すことが多い)
ポイントは「失敗ではなく不安定を狙う」こと。今回はたまたま正しく通ったが次は外しうる判断点を拾う。2分のデモ動画では、5並列の実行が数え方の迷いで3対2に割れ、指針を入れた後は5本とも一致したという。
結果
| 指標(AppWorld test_normal・168課題・GPT-4.1 ReAct) | 指針なし | 指針あり |
|---|---|---|
| Pass^5 | 53.0% | 69.0% |
| Mean@5 | 77.4% | 81.0% |
| 一貫性ギャップ | 24.4pt | 12.0pt |
難易度別ではMedium +22.9pt(相対+44%)、Hard +14.3pt(相対+45%)、Easy +12.2pt。Mean@5はどの難易度でも下がっていない(平均を犠牲にPass^5を上げるのは「不安定を移し替えただけ」なので、下げないことを必須条件にしたとある)。同じシナリオの別の課題に適用しても+13.0pt(同一課題より3pt低いだけ)。弱いモデルgpt-oss-120bでは同一課題で10.1%→16.1%(+6.0pt)、似た課題では+8.7ptと、同一課題の伸びを上回った。
エージェントを出す人への4つの助言
ブログの「If You're Shipping an Agent」を写す。
- Mean@kの隣にPass^kを報告する。 平均は「信頼できるエージェント」と「運の良いエージェント」を区別できない。k=3でも知らなかったギャップが出る
- 難しい層ほどギャップは広がる。 最も難しい層で、平均1つの数字が最も誤解を生む
- まず大きいモデルに手を伸ばさない。 一貫性は能力と直交する。強いモデルはMean@kを上げるが、ギャップを縮めるとは限らない
- 診断に採点器も再実行も要らない。 判断点ごとに追加1コール(既定で5通り)で足りる。本番のトラフィックで課題を最初から再実行できなくても使える
筆者の観測──「同じ入力で違う指摘」は当サイトでも起きている
当サイトは1,100本超の記事の全数検品にAIを使っているが、同じ記事に同じ検品指示を出しても、回によって指摘の中身が変わる。その中で「これは誤検出だ」と反証して止めた指摘が、9月10日からの検品で18件あった(当サイト内部の作業記録による。公開している記事ではない)。指摘が「出たり出なかったりする」ことと「間違った指摘が出る」ことは別の問題で、前者がこの研究の言う一貫性ギャップに当たる。検品に使うなら、同じ記事を複数回通して「毎回出る指摘」と「たまに出る指摘」を分けるのが、Pass^kの考え方の当サイトなりの使い方になる。これは筆者の運用上の観察で、数値は測っていない。
GPT-4.1とAppWorldの範囲でしか言えないこと
- 実験はAppWorldのtest_normal(168課題)とGPT-4.1、gpt-oss-120bの範囲で、ClaudeやGemini、GPT-6 Astraでの数字はブログに無い
- 「実行環境側のゆれ」の説明はブログの記述で、当サイトが温度0で再現実験をしたわけではない
- 技術報告(arXiv 2609.08832「Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course」)の本文は本記事では読んでいない。数字はすべてブログの記載による
IBMのブログ・技術報告・コードの所在
- 数字・引用・実例はIBM Researchのブログ「Your Agent Aced the Task. Will It Do It Again?」(Hugging Face・2026年9月15日・Evelyn Duesterwald氏ら12名)。当サイトが9月17日に取得
- 技術報告はarXiv 2609.08832、コードはGitHubのAgentToolkit/altk-evolve(本記事の時点でタイトルとURLのみ確認)
- 本記事は続報があれば更新する。他のモデル・他のベンチマークでの数字、技術報告の詳細を追記する
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。