Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に
Google Researchは2026年9月15日、ICML 2026の論文「RL-Compiled Diffusion」による「Retrieve-for-Train」を解説した。「キャンプ用品」のような広い検索で、テント・寝袋・コンロ・ヘッドランプのように補完し合う結果の集合を返すには、1つの問いを複数の下位クエリに分解する「クエリ・ファンアウト」が要る。ゼロショットのLLMは「ボヘミアン・フェス風」を「ボヘミアン・フェス・ファッション」と言い換えるだけの「言い換え崩壊」を起こし、しかも何百もの思考トークンを吐く。提案は、強化学習で分解を学んだ4Bモデル(Gemma3-4B・Qwen3-4B)に教師データを作らせ、5,390万パラメータの拡散モデルが埋め込みの集合を一度に生成する3段構成。多様性の報酬(Vendi Score)を外すと「line ending line ending」のような無意味な文字列で報酬を騙す現象も報告した。

2026年9月18日・日本時間時点の情報です。 Google Researchのブログ(9月15日)を読んだ。AI検索の裏側で「1つの問いを複数の下位クエリに分ける」処理をどう速くするかという話で、日本語では見当たらなかった。AI検索の使い分けはAI検索エンジン比較に。
3行まとめ
- 何が問題か。 「キャンプ用品」と検索した人は、4人用テントの微妙な違い10件ではなく、テント・寝袋・コンロ・ヘッドランプのように補完し合う集合が欲しい。そのために1つの問いを複数の下位クエリへ分けるクエリ・ファンアウトを行うが、汎用のLLMにやらせると2つの弱点が出る。言い換え崩壊(「ボヘミアン・フェス風」を「ボヘミアン・フェス・ファッション」「〜クローズ」と言い換えるだけで、フリンジジャケット・かぎ編みワンピース・スエードブーツのような別方向に広がらない)と、自己回帰の遅延(分解の前に何百もの思考トークンを吐く)。
- 提案の3段。 ①強化学習でファンアウト言語モデル(Gemma3-4B・Qwen3-4B、1問につき10個の下位クエリを出す)を訓練。報酬は集合全体を見る3本立てで、接地性(データベースに実在する項目に対応)・多様性(Vendi Score)・整合(元の問いから逸れない)。②凍結したそのモデルに(問い→目標集合)の教師データを人手なしで大量に作らせる。③5,390万パラメータの拡散モデルが、問いの埋め込みから目標埋め込みの集合を1回の非自己回帰パスで生成する。
- 結果。 ファッション(利用者が組んだコーデ、CLIPで評価)と社内の音楽プレイリスト(MuLanで評価)の2領域で、単一クエリ・ゼロショット拡張・Best-of-Nを上回った。速度は拡散版が自己回帰版の12〜20倍で、大きなバッチでは自己回帰の遅延が50秒近くまで伸びるのに対し、拡散版は1秒未満〜数秒に収まった。
推論時ではなく訓練時に一度だけ考える設計
- 「推論時に考えさせず、訓練時に一度だけ考えさせる」設計で、同じ週のToolGradと発想が揃っている。思考トークンの課金と遅延を嫌う流れの一例
- 報酬ハックの報告が具体的だ。多様性の項を外すと、モデルは「line ending line ending」のような無意味な文字列でデータベース座標に当てにいく。接地性だけでも整合だけでも近道が生まれ、3本を互いの錨にすると閉じる、という説明はAnthropicの報酬ハック対策と読み合わせると面白い
- 音楽側のデータは「社内の専門家が作ったプレイリスト」で、外から再現はできない
- 拡散モデルをテキスト生成に使う流れはDiffusion Gemmaでも追った
確認したのはブログのみ、論文本文は未読
この記事の下調べで、筆者は9月18日にGoogle Researchのブログを取得し、3段の構成・報酬の3項目・パラメータ数・速度の数字がその原文にあることを確認した。論文本文(ICML 2026「Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion」)は開いていない。筆者は本手法を動かしていない。
製品導入・データ規模・訓練コストは不明
- Google検索やAI Modeなど実製品に入っているか
- ファッション側のデータセット名と規模
- 訓練コスト
出典はGoogle Researchのブログ
- Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train(Google Research・2026年9月15日)
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。