AI時短ラボ
検証· 約6分

Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に

Google Researchは2026年9月15日、ICML 2026の論文「RL-Compiled Diffusion」による「Retrieve-for-Train」を解説した。「キャンプ用品」のような広い検索で、テント・寝袋・コンロ・ヘッドランプのように補完し合う結果の集合を返すには、1つの問いを複数の下位クエリに分解する「クエリ・ファンアウト」が要る。ゼロショットのLLMは「ボヘミアン・フェス風」を「ボヘミアン・フェス・ファッション」と言い換えるだけの「言い換え崩壊」を起こし、しかも何百もの思考トークンを吐く。提案は、強化学習で分解を学んだ4Bモデル(Gemma3-4B・Qwen3-4B)に教師データを作らせ、5,390万パラメータの拡散モデルが埋め込みの集合を一度に生成する3段構成。多様性の報酬(Vendi Score)を外すと「line ending line ending」のような無意味な文字列で報酬を騙す現象も報告した。

Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Google Researchのブログ(9月15日)を読んだ。AI検索の裏側で「1つの問いを複数の下位クエリに分ける」処理をどう速くするかという話で、日本語では見当たらなかった。AI検索の使い分けはAI検索エンジン比較に。

3行まとめ

  1. 何が問題か。 「キャンプ用品」と検索した人は、4人用テントの微妙な違い10件ではなく、テント・寝袋・コンロ・ヘッドランプのように補完し合う集合が欲しい。そのために1つの問いを複数の下位クエリへ分けるクエリ・ファンアウトを行うが、汎用のLLMにやらせると2つの弱点が出る。言い換え崩壊(「ボヘミアン・フェス風」を「ボヘミアン・フェス・ファッション」「〜クローズ」と言い換えるだけで、フリンジジャケット・かぎ編みワンピース・スエードブーツのような別方向に広がらない)と、自己回帰の遅延(分解の前に何百もの思考トークンを吐く)。
  2. 提案の3段。 ①強化学習でファンアウト言語モデル(Gemma3-4B・Qwen3-4B、1問につき10個の下位クエリを出す)を訓練。報酬は集合全体を見る3本立てで、接地性(データベースに実在する項目に対応)・多様性(Vendi Score)・整合(元の問いから逸れない)。②凍結したそのモデルに(問い→目標集合)の教師データを人手なしで大量に作らせる。③5,390万パラメータの拡散モデルが、問いの埋め込みから目標埋め込みの集合を1回の非自己回帰パスで生成する。
  3. 結果。 ファッション(利用者が組んだコーデ、CLIPで評価)と社内の音楽プレイリスト(MuLanで評価)の2領域で、単一クエリ・ゼロショット拡張・Best-of-Nを上回った。速度は拡散版が自己回帰版の12〜20倍で、大きなバッチでは自己回帰の遅延が50秒近くまで伸びるのに対し、拡散版は1秒未満〜数秒に収まった。

推論時ではなく訓練時に一度だけ考える設計

  • 「推論時に考えさせず、訓練時に一度だけ考えさせる」設計で、同じ週のToolGradと発想が揃っている。思考トークンの課金と遅延を嫌う流れの一例
  • 報酬ハックの報告が具体的だ。多様性の項を外すと、モデルは「line ending line ending」のような無意味な文字列でデータベース座標に当てにいく。接地性だけでも整合だけでも近道が生まれ、3本を互いの錨にすると閉じる、という説明はAnthropicの報酬ハック対策と読み合わせると面白い
  • 音楽側のデータは「社内の専門家が作ったプレイリスト」で、外から再現はできない
  • 拡散モデルをテキスト生成に使う流れはDiffusion Gemmaでも追った

確認したのはブログのみ、論文本文は未読

この記事の下調べで、筆者は9月18日にGoogle Researchのブログを取得し、3段の構成・報酬の3項目・パラメータ数・速度の数字がその原文にあることを確認した。論文本文(ICML 2026「Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion」)は開いていない。筆者は本手法を動かしていない。

製品導入・データ規模・訓練コストは不明

  • Google検索やAI Modeなど実製品に入っているか
  • ファッション側のデータセット名と規模
  • 訓練コスト

出典はGoogle Researchのブログ

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Google Research「ToolGrad」──ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回るの記事画像
検証09.26読了6分

Google Research「ToolGrad」──ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る

出典 ─ Google Research Blog(Zhongyi Zhou・Ruofei Du・2026年9月10日・9月18日取得)
AI検索エンジン比較──Perplexity・SearchGPT・Gemini・Arc Search【2026年】の記事画像
プロダクト07.13読了9分

AI検索エンジン比較──Perplexity・SearchGPT・Gemini・Arc Search【2026年】

出典 ─ AIMLAPI
Google、ローカル動作の拡散型テキスト生成モデル「Diffusion Gemma」を公開の記事画像
モデル07.06読了19分

Google、ローカル動作の拡散型テキスト生成モデル「Diffusion Gemma」を公開

出典 ─ DiffusionGemma - Googl
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像
研究09.22読了10分

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

出典 ─ Anthropic(2026年8月31日・9月18日取得)
AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読むの記事画像
研究09.07読了14分

AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読む

出典 ─ Google Research Blog
長く話すほどAIは劣化する──「Context Rot」をChromaの技術レポートで読むの記事画像
研究09.01読了19分

長く話すほどAIは劣化する──「Context Rot」をChromaの技術レポートで読む

出典 ─ Context Rot: How Incre
モデルもプロンプトも変えていないのに答えが変わる──RAGの『Accuracy-Blind Answer Churn』を監査するの記事画像
研究08.27読了7分

モデルもプロンプトも変えていないのに答えが変わる──RAGの『Accuracy-Blind Answer Churn』を監査する

出典 ─ Same Agent, Different
AIは二度、資金を断たれてきた──76年の歴史を、繰り返された「冬」から読むの記事画像
研究08.27読了14分

AIは二度、資金を断たれてきた──76年の歴史を、繰り返された「冬」から読む

出典 ─ "Dartmouth workshop"