Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash
Google DevelopersのWei Wei氏は2026年9月11日、LLMのポストトレーニング(SFTとGRPO)に自律的な研究ループを当てる「autofinetune」を公開した。今年のautoresearchにならい、人間はprogram.md(探索範囲・境界条件・評価基準)とrun.py(自己完結の微調整スクリプト)を用意し、エージェントがrun.pyを書き換えて学習を回し、指標を測り、改善は残し退行は戻し、results.tsvに記録する。事例1はCloud TPU v5e-1でfunctiongemma-270m-itをmobile-actionsデータでSFT、1回数分・20回を数時間で回した(許可:LoRAランク・対象層・学習率・オプティマイザ・バッチ・シード。禁止:データ・エポック数・構造)。事例2はTPU v6e-1でGemma 3 1BをGSM8KでGRPO、1回数時間・40回を2〜3日で回し、LoRA構成・ロールアウト温度・KLペナルティ・システムプロンプトを変えて合計報酬を約10%改善。

2026年9月18日・日本時間時点の情報です。 Google Developersのブログ(9月11日)を読んだ。「エージェントに研究をさせる」型は当サイトでCodexのautoresearchによるGPUカーネル探索とOpenAIの研究加速を追ってきたが、Googleが**微調整(ポストトレーニング)**に同じ型を当てた例は扱っていなかった。
3行まとめ
- 何をするか。 従来のポストトレーニングは「仮説を立てる(例:LoRAの対象に
attn_vec_einsumを足すと精度は上がるか)→スクリプトとハイパーパラメータを編集→アクセラレータで実行→損失曲線と評価を見る→失敗は手で戻し成功は表に記録」の手作業の繰り返しだった。autofinetuneは今年のautoresearch(事前学習の自律探索)にならい、人間がprogram.md(ループ・境界条件・評価基準・制約)とrun.py(自己完結の微調整スクリプト)を書けば、エージェントがrun.pyを改変→学習→指標を測定→改善のコミットは残し退行は戻す→results.tsvに記録を回す。土台はTunix(Googleの学習ライブラリ)・Gemma・Cloud TPUで、Antigravity CLIとGemini 3.7 Flashが束ねる。- 事例1(SFT)。 Cloud TPU v5e-1で
google/functiongemma-270m-itをgoogle/mobile-actionsデータセットで教師あり微調整。1回数分、20回の自動実験を数時間で回し、関数呼び出しの生成精度を上げた。program.mdで許可したのはLoRAのランク/alpha・対象の射影層・学習率・ウォームアップと減衰・オプティマイザ(AdamW/Muon・勾配クリップ)・バッチサイズ・シード、禁止はデータセット・エポック数・モデル構造の変更。- 事例2(GRPO)。 Tunix公式のGRPO例(Gemma 3 1BをGSM8Kで数学推論、数値精度と形式精度を上げる)を自律化。TPU v6e-1、1回数時間、40回を2〜3日。外側の最適化を単純にするため評価指標は
numerical_accuracy + format_accuracyの1本にし、エージェントがLoRA構成・ロールアウト温度・KLペナルティ・システムプロンプトを変えて合計報酬を約10%改善。強化学習はハイパーパラメータに敏感で不安定で長いので、SFTより難しい題材として選んだと書く。
「改善だけ残す」ループが見落とす劣化
- 人間の仕事は「探索していい範囲」と「評価指標」を紙に書くことに寄る。事例2で指標を「2つの精度の単純な和」に落としたのは、エージェントが最適化しやすいように目的関数を単純化した、という判断で、報酬設計の癖がそのまま結果に出る型だ
- 「改善だけコミットする」ループは、退行を自動で戻す分、指標に出ない劣化(多様性の低下や特定の形式への過適合)を見落とす。記事は最終モデルの外部評価に触れていない
- TPUを持たない人向けの話ではないが、program.mdとrun.pyの型自体はGPUやローカル(LM Studio等)でも真似できる
- コードとサンプル実行(
sample_runs/SFT_results.tsv・RL_results.tsv)、program.mdのテンプレートはautofinetuneのGitHubにある、と本文にある
確認はブログのみ、GitHubとTSVは未読
この記事の下調べで、筆者は9月18日にGoogle Developersのブログを取得し、2つの事例のハードウェア・回数・所要時間・許可/禁止の範囲・約10%がその原文にあることを確認した。GitHubのリポジトリと結果のTSVは開いていない。筆者はTunixもTPUも使っていない。
事例1の数値・TPU費用・役割分担は不明
- 事例1の精度の具体的な数値(「上がった」とだけ。表は画像)
- TPUの費用
- Antigravity CLIとGemini 3.7 Flashの役割分担の詳細
情報源はautofinetuneの公式解説
- Autonomous LLM post-training with Tunix on TPUs(Google Developers・2026年9月11日)
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。