AI時短ラボ
検証· 約7分

Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash

Google DevelopersのWei Wei氏は2026年9月11日、LLMのポストトレーニング(SFTとGRPO)に自律的な研究ループを当てる「autofinetune」を公開した。今年のautoresearchにならい、人間はprogram.md(探索範囲・境界条件・評価基準)とrun.py(自己完結の微調整スクリプト)を用意し、エージェントがrun.pyを書き換えて学習を回し、指標を測り、改善は残し退行は戻し、results.tsvに記録する。事例1はCloud TPU v5e-1でfunctiongemma-270m-itをmobile-actionsデータでSFT、1回数分・20回を数時間で回した(許可:LoRAランク・対象層・学習率・オプティマイザ・バッチ・シード。禁止:データ・エポック数・構造)。事例2はTPU v6e-1でGemma 3 1BをGSM8KでGRPO、1回数時間・40回を2〜3日で回し、LoRA構成・ロールアウト温度・KLペナルティ・システムプロンプトを変えて合計報酬を約10%改善。

Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Google Developersのブログ(9月11日)を読んだ。「エージェントに研究をさせる」型は当サイトでCodexのautoresearchによるGPUカーネル探索とOpenAIの研究加速を追ってきたが、Googleが**微調整(ポストトレーニング)**に同じ型を当てた例は扱っていなかった。

3行まとめ

  1. 何をするか。 従来のポストトレーニングは「仮説を立てる(例:LoRAの対象にattn_vec_einsumを足すと精度は上がるか)→スクリプトとハイパーパラメータを編集→アクセラレータで実行→損失曲線と評価を見る→失敗は手で戻し成功は表に記録」の手作業の繰り返しだった。autofinetuneは今年のautoresearch(事前学習の自律探索)にならい、人間がprogram.md(ループ・境界条件・評価基準・制約)とrun.py(自己完結の微調整スクリプト)を書けば、エージェントがrun.pyを改変→学習→指標を測定→改善のコミットは残し退行は戻す→results.tsvに記録を回す。土台はTunix(Googleの学習ライブラリ)・Gemma・Cloud TPUで、Antigravity CLIとGemini 3.7 Flashが束ねる。
  2. 事例1(SFT)。 Cloud TPU v5e-1でgoogle/functiongemma-270m-itをgoogle/mobile-actionsデータセットで教師あり微調整。1回数分、20回の自動実験を数時間で回し、関数呼び出しの生成精度を上げた。program.mdで許可したのはLoRAのランク/alpha・対象の射影層・学習率・ウォームアップと減衰・オプティマイザ(AdamW/Muon・勾配クリップ)・バッチサイズ・シード、禁止はデータセット・エポック数・モデル構造の変更。
  3. 事例2(GRPO)。 Tunix公式のGRPO例(Gemma 3 1BをGSM8Kで数学推論、数値精度と形式精度を上げる)を自律化。TPU v6e-1、1回数時間、40回を2〜3日。外側の最適化を単純にするため評価指標はnumerical_accuracy + format_accuracyの1本にし、エージェントがLoRA構成・ロールアウト温度・KLペナルティ・システムプロンプトを変えて合計報酬を約10%改善。強化学習はハイパーパラメータに敏感で不安定で長いので、SFTより難しい題材として選んだと書く。

「改善だけ残す」ループが見落とす劣化

  • 人間の仕事は「探索していい範囲」と「評価指標」を紙に書くことに寄る。事例2で指標を「2つの精度の単純な和」に落としたのは、エージェントが最適化しやすいように目的関数を単純化した、という判断で、報酬設計の癖がそのまま結果に出る型だ
  • 「改善だけコミットする」ループは、退行を自動で戻す分、指標に出ない劣化(多様性の低下や特定の形式への過適合)を見落とす。記事は最終モデルの外部評価に触れていない
  • TPUを持たない人向けの話ではないが、program.mdとrun.pyの型自体はGPUやローカル(LM Studio等)でも真似できる
  • コードとサンプル実行(sample_runs/SFT_results.tsv・RL_results.tsv)、program.mdのテンプレートはautofinetuneのGitHubにある、と本文にある

確認はブログのみ、GitHubとTSVは未読

この記事の下調べで、筆者は9月18日にGoogle Developersのブログを取得し、2つの事例のハードウェア・回数・所要時間・許可/禁止の範囲・約10%がその原文にあることを確認した。GitHubのリポジトリと結果のTSVは開いていない。筆者はTunixもTPUも使っていない。

事例1の数値・TPU費用・役割分担は不明

  • 事例1の精度の具体的な数値(「上がった」とだけ。表は画像)
  • TPUの費用
  • Antigravity CLIとGemini 3.7 Flashの役割分担の詳細

情報源はautofinetuneの公式解説

関連記事

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

CodexにGPUカーネル最適化を『自動でリサーチさせながら』回したら232倍速くなった話の記事画像
活用09.01読了19分

CodexにGPUカーネル最適化を『自動でリサーチさせながら』回したら232倍速くなった話

出典 ─ sankalp's blog「Auto-re
OpenAI「自動研究インターンに到達」解説動画のサムネイル
研究09.17読了18分

OpenAI、「自動研究インターンに到達」と宣言──研究者1人にエージェント3.1労働日、中央値の研究者が1日600ドル、成功の過半数には人の介入。社内実測の全数字と、同じ日に主席科学者が書いた「減速」

出典 ─ Research acceleration:
Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身の記事画像
モデル09.02読了14分

Gemmaの累計ダウンロードが10億超──Google公式発表と「Awesome Gemma」の中身

出典 ─ Google Blog
LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)の記事画像
活用09.25読了11分

LM Studioの使い方と料金【2026年9月版】──無料でローカルLLMを動かす手順(Mac M1〜M4・Windows・Linux、16GB推奨、4bit以上の量子化)、OpenAI互換API・MCP・文書チャット、新アプリ「Bionic」とBionic+ $20/Pro $100のクラウド(Kimi K3・GLM 5.3・DeepSeek V4 Flash、ZDR)

出典 ─ LM Studio Docs(Welcome
Google Labs「Julesで測るべきもの」──コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%の記事画像
検証09.27読了7分

Google Labs「Julesで測るべきもの」──コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%

出典 ─ Google Developers Blog(Nghi Bui・Georgios Evangelopoulos・Zack Elliott・2026年6月22日・9月18日取得)
Google DeepMind「クライアントSDKの生成はオープンであるべき」──2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守の記事画像
検証09.27読了6分

Google DeepMind「クライアントSDKの生成はオープンであるべき」──2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守

出典 ─ Google Developers Blog(Amir Hardon・Philipp Schmid・2026年9月17日・9月18日取得)
Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読むの記事画像
検証09.25読了6分

Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む

出典 ─ Google for Developers(Guillaume Laforge・2026年9月9日・9月18日取得)
XiaomiがMiMo-V2.6を公開──1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置きの記事画像
モデル09.21読了22分

XiaomiがMiMo-V2.6を公開──1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置き

出典 ─ Xiaomi MiMo 公式ブログ: Int