AI時短ラボ
検証· 約6分

Google Research「ToolGrad」──ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る

Google Researchは2026年9月10日、ACL 2026で発表した「ToolGrad」を解説した。LLMにツール使用を教えるデータは、従来「仮の質問を作ってから深さ優先探索のエージェントに解かせる」順序で作られ、失敗が多くコストが高かった。ToolGradは逆に、動作確認済みのAPI連鎖を先に組み、それに合う質問と回答を1回のLLM呼び出しで後付けする。プロンプト最適化のTextGradにならい、実行報告から最良のAPI呼び出しを選ぶ工程を「テキストの勾配」として使う。生成した500件(ToolGrad-500)でGemma 3の1B・4B・12Bを微調整すると、ツール集合が異なるBFCLで12B版が83.1。データを作った教師のGemini 2.5 Flash-Liteを生徒が上回った。

Google Research「ToolGrad」──ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Google Researchのブログ(9月10日)を読んだ。エージェントの「ツール呼び出し」を学ばせる訓練データをどう作るかという裏方の話で、日本語ではほぼ扱われていない。エージェントを組む側の全体像はAIエージェントの作り方に。

3行まとめ

  1. 何が新しいか。 LLMにツール使用を教えるデータは、従来「APIの候補から仮の質問を作る→深さ優先探索(DFS)のエージェントに解かせる→うまくいった軌跡だけ残す」順序で作られてきた(ToolBench・ToolACE)。探索の失敗が多く、成功例を蒸留する構造そのものが非効率だった。**ToolGradは順序を逆にする。動作確認済みのAPI連鎖を先に組み、それに合う質問と回答を1回のLLM呼び出しで後付けする。**明示的な解答のほうが質問より曖昧さがないので、注釈が簡単になる、という理屈。
  2. 「テキストの勾配」。 プロンプト最適化のTextGradは、LLMの批評文を数値勾配の代わりに使う。ToolGradはこれをデータ生成に転用し、4つの部品を回す。API Proposer(候補APIを数個に絞る)→API Executors(並列に実行して報告書を作る)→API Selector(報告書を読み、最良の1呼び出しを選んで連鎖に足す=勾配に相当)→LLM Updater(新しいAPI集合に合わせて合成質問と回答を書き直す)。ToolBenchの実在API 1万6千超を使った比較で、より長い連鎖を、より高い合格率で、より低いコストで生成できた(図の説明には合格率99.8%とある)。
  3. 小さいモデルが上位に並んだ。 生成した500件(ToolGrad-500)でGemma 3の1B・4B・12Bを微調整し、ToolBenchとはツール集合が違う**BFCL(Berkeley Function Calling Leaderboard)**で評価。12B版が83.1で、発表時点のGemini 2.5 Pro(83.2)・Claude 4.5 Opus(82.8)に並び、GPT-5(74.4)を上回る。データはGemini 2.5 Flash-Liteで作ったので、生徒が教師を追い越したことになる。ツール特化のToolACE・Hammer-2.1-7Bにも差をつけた。

「解答から先に作る」逆順の狙い

  • 「質問→解答」ではなく「解答→質問」の順に作るのは、正解が確実に存在するデータだけを残す発想で、エージェントの記憶蒸留のような「軌跡から学ぶ」系統とは出発点が違う
  • 同じ週にGoogle Researchが出したRetrieve-for-Trainも「重い探索を一度だけ回し、軽いモデルに焼き込む」型で、両方とも「推論時に考えさせない」方向に寄っている
  • 数字はGoogle自身の測定で、比較対象のモデル名にも発表時点の版(Gemini 2.5 Pro・Claude 4.5 Opus・GPT-5)が使われている。現行世代との比較ではない
  • 筆頭のZhongyi Zhou氏はGoogleの客員研究員として研究した、と謝辞にある。共著者にはKohei Uehara・Tatsuya Haradaの各氏の名前がある

確認はブログのみ、論文とコードは未読

この記事の下調べで、筆者は9月18日にGoogle Researchのブログを取得し、4つの部品の名称・BFCLの数字・教師モデルの名前がその原文にあることを確認した。論文本文(ACL 2026)とコードは開いていない。筆者はToolGradのデータもモデルも動かしていない。

重み公開の有無・コスト・BFCLの版は不明

  • ToolGrad-500やモデルの重みが公開されているか
  • 生成1件あたりのコスト(金額)
  • BFCLのどの版・どの部分集合の数字か

出典はGoogle Researchのブログ

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒にの記事画像
検証09.26読了6分

Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に

出典 ─ Google Research Blog(Pengcheng Jiang・Judith Yue Li・2026年9月15日・9月18日取得)
「Agent Memory Distillation」とは何か──学習不要で、4Bの小型モデルにGPT-5-miniの「成功パターン」を渡すの記事画像
研究09.06読了11分

「Agent Memory Distillation」とは何か──学習不要で、4Bの小型モデルにGPT-5-miniの「成功パターン」を渡す

出典 ─ Agent Memory Distillat
Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身の記事画像
モデル09.02読了14分

Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身

出典 ─ Google Blog
AIエージェントの作り方【2026年9月版】──ノーコード(Dify・Lindy)、SDK(Claude Agent SDK・OpenAI Agents SDK・Google ADK・LangGraph)、任せる型(OpenAI Agents API・Claude Managed Agents)の3段階と、最初の1本を動かすまでのコード、暴走と課金を止める4つの安全装置の記事画像
活用09.23読了18分

AIエージェントの作り方【2026年9月版】──ノーコード(Dify・Lindy)、SDK(Claude Agent SDK・OpenAI Agents SDK・Google ADK・LangGraph)、任せる型(OpenAI Agents API・Claude Managed Agents)の3段階と、最初の1本を動かすまでのコード、暴走と課金を止める4つの安全装置

出典 ─ OpenAI公式ドキュメント(Agents API/Agents SDK/Responses APIの比較・2026年9月18日取得)
DSPyのReActV2──「1本の巨大な文字列」だったツール履歴を、構造化されたメッセージに分解するの記事画像
検証09.03読了13分

DSPyのReActV2──「1本の巨大な文字列」だったツール履歴を、構造化されたメッセージに分解する

出典 ─ stanfordnlp/dspy 3.3.0
プロンプトではなく「プログラムの構造」自体を最適化する──DSPyの実験的機能`dspy.Flex`の記事画像
検証09.02読了14分

プロンプトではなく「プログラムの構造」自体を最適化する──DSPyの実験的機能`dspy.Flex`

出典 ─ stanfordnlp/dspy 3.3.0
Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖の記事画像
モデル09.24読了13分

Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖

出典 ─ Anthropic公式発表「Claude O
Qwen Intelligenceとは──Alibabaが「AIスマホを作るメーカー向け」に出したエージェント3点セット。スマホ操作は1,000回38元、画像は1枚0.08元から。重みは非公開、リンク先で見えた数字のズレの記事画像
プロダクト09.23読了14分

Qwen Intelligenceとは──Alibabaが「AIスマホを作るメーカー向け」に出したエージェント3点セット。スマホ操作は1,000回38元、画像は1枚0.08元から。重みは非公開、リンク先で見えた数字のズレ

出典 ─ Qwen公式X(@Alibaba_Qwen)