AI時短ラボ
検索
研究

Sakana AI(サカナAI)、AIが自分のチームの成果で自分を鍛える「MASS(マス)」を論文とコード付きで公開27Bモデル2サイクルで、研究系4ベンチの出力トークンあたりスコアが1.2〜1.6倍

執筆:約11分で読めます

Sakana AIは2026年10月12日付のブログで、1つのモデルが仮想サブエージェントのチームで課題を解き、自分で選んだ最良の実行を学習に戻す手法「MASS」を論文とコードごと公開した。Qwen3.6-27Bで2サイクル回した結果、研究系4ベンチマークの出力トークンあたりスコアがベースの1.2〜1.6倍になったと同社は書く。

Sakana AI(サカナAI)、AIが自分のチームの成果で自分を鍛える「MASS(マス)」を論文とコード付きで公開──27Bモデル2サイクルで、研究系4ベンチの出力トークンあたりスコアが1.2〜1.6倍
目次

Sakana AI(サカナAI)は、1つのモデルが仮想サブエージェントのチームで課題を解き、自分の判断で選んだ最良の実行を学習に戻す手法「MASS(マス、Multi-Agent Self-Supervision)」を、論文・コード付きで公開しました。同社のブログ記事の日付は2026年10月12日です。同社によると、Qwen(クウェン)3.6-27Bを2サイクル訓練した結果、研究系ベンチマーク4つで「出力トークンあたりのスコア」がベースモデルの1.2〜1.6倍になりました。

3行まとめ

  1. Sakana AIが2026年10月12日付で、再帰的自己改善の手法MASSを論文(arXiv:2610.12176)とGitHubコードとともに公開。
  2. Qwen3.6-27Bで2サイクル後、MLR-Bench・DSBench・ScienceAgentBench・AstaBenchの出力トークンあたりスコアがベースの1.2〜1.6倍(同社発表)。
  3. 一方でTerminal-Bench 2.0は0.96倍、SWE-bench Verifiedは0.94倍。同社は「転移は一様でない」と書き、自己評価ループの安全面の懸念も明記している。

本記事の内容は、日本時間10月12日6時台に公式ページで確認したものです。

MASSは何をする手法なのか

Sakana AIの説明では、前提にあるのは「AIが人間の専門家でも評価しきれない課題に取り組むとき、モデル自身が最良の最適化役・評価役になりうる」という問題意識です。そこで、改善される対象のモデル(optimizee)が、自分自身の最適化役と評価役も兼ねる「同質な再帰的自己改善」を扱います。

MASSでは、同じ1つのモデルが3つの役を担います。

役 同社の説明
実行役(agent) 課題を解き、結果・図・研究レポートを含む作業フォルダを作る
ワークフロー最適化役 評価役のフィードバックをもとに、分担・結果の受け渡し・相互チェックのやり方を改訂する
評価役 2つの作業フォルダを比べ、どちらが課題に合うかを理由つきで判定する

流れは2つのループです。内側のループではモデルの重みを固定したまま、チームの進め方(ワークフロー)を探索します。ワークフローは「役割・指示・成果物の約束(contract)・呼び出し順(hop)」の4要素で書かれた計画書で、課題のプロンプトに足されます。外側のループでは、最良とされたワークフローを課題ごとに18回実行し、現在のモデルが作業結果を順位づけ、上位の軌跡(最大16本、うち15本を訓練・1本を検証)をLoRAで微調整します。訓練用の例ではワークフロー本文を取り除くため、課題文だけから進め方を組み立てることを学ぶ、と同社は説明しています。

数字はどう出ているのか

同社が示した実験は、Qwen3.6-27Bを出発点に、coding-agent環境のqwen-codeで2ラウンド回したものです。合成の研究課題は金融・ロボティクス・薬学の12件で、9件を訓練用、3件を訓練に使わない評価用にしています(実際に訓練データを出したのは8件)。

合成課題(外部審査員による勝率)

評価対象 1ラウンド目 vs ベース 2ラウンド目 vs ベース 2ラウンド目 vs 1ラウンド目
訓練課題 65.6% 82.5% 68.1%
評価用課題 53.9% 69.9% 60.8%

審査員にはGPT-5.5とClaude Opus 4.8が使われ、その判定はMASSの学習には渡していない、と同社は書いています。

公開ベンチマーク(同社ブログの記述)

  • MLR-Bench・DSBench・ScienceAgentBench・AstaBench:2ラウンド後、出力トークンあたりスコアがベースの1.2〜1.6倍
  • MLR-Benchのスコア:1.58から2.40。論文を最後まで出せた回数は60回中31回から50回
  • ScienceAgentBenchの成功率:約29%から32%
  • Terminal-Bench 2.0:0.96倍、SWE-bench Verified:0.94倍

「1.2〜1.6倍」は素点の倍率ではなく、出力トークン1つあたりのスコアの倍率である点に注意が必要です。

前と何が違うのか:同社が挙げる3つの観察

同社は主な結果を3つにまとめています。

  1. 役割間の汎化:課題を解く軌跡だけで訓練しても、ワークフロー最適化役と評価役の能力も上がった。評価役と外部審査員との一致率は3サイクルで73%から93%へ上がったとしています。
  2. 複数エージェントの軌跡は訓練データとして効率的:第1ラウンドのMASSモデルは訓練トークン2,880万でベースに対する勝率68.3%、単一エージェントで学習した生徒は4,200万トークンで64.0%。同社はこれを「31%少ない教師ありトークンで上回った」と表現します。論文の要旨は同じ現象を「1.4倍多いトークンで訓練した単一エージェントの生徒を上回る」と書いています。
  3. ボトルネックは評価役より最適化役のことがある:ベースモデルを実行役に固定し、評価役だけをGPT-5.5に替えても改善は小さく、最適化役も替えると12課題すべてで5回以内に勝てるワークフローが見つかった。完全に同質なループでも12課題中11課題で見つかったが、時間がかかったとしています。

ブログにはほかに、2ラウンド後のモデルは課題文だけを渡されても、サブエージェントへの委任が110回中1回(ベース)から87回に増えた、という観察もあります。

誰がいつから使えるのか

発表は研究成果の公開で、製品としての提供ではありません。論文はarXivに2026年10月8日付で投稿されています(39ページ)。コードはGitHubのSakanaAI/massにあり、READMEには論文の2サイクル分の設定ファイル、12個の合成課題、LoRA訓練、BF16/FP8形式での書き出しなどが挙げられています。料金や提供地域の記載は、今回取得した4ページには見当たりませんでした。

筆者が公式ページで見たこと

日本時間6時8分に4ページを取得して読み比べたところ、sakana.ai/mass/ 本体は要旨と3つのリンク、結果3点だけの短い告知で、数表や手法の詳細は pub.sakana.ai/mass/ に置かれていました。ここで気づいたのは、同じ実験の数字がページによって少し違うことです。たとえばMLR-Benchは、ブログが「12課題・5試行」で1.58から2.40としているのに対し、GitHubのREADMEは107課題×3試行で1.71、1.77、2.25と載せています。READMEは「同梱のMLR-Bench設定は以前の12課題サブセット」「107課題の設定とAstaBenchなど4種の評価アダプタは含まれない」とも書いており、試行条件が異なる別の集計だと読めますが、私が突き合わせて確認したわけではありません。自分で数字を引用する際は、どのページの表かを分けて書くのが安全です。

限界と、読むときの注意

  • 出典は同社の発表のみ:数字はいずれもSakana AIと共著者(UC Berkeleyを含む)によるもので、今回の取得範囲に第三者による再現や検証は含まれません。
  • 規模が小さい:合成課題は12件、うち評価用は3件。MLR-Benchも12課題・5試行の部分集合で、同社はこの結果について、統計的結論は試行と課題のどちらで集計するかに左右されると注記しています。
  • 転移は一様でない:Terminal-Bench 2.0とSWE-bench Verifiedでは出力トークンあたりスコアが1を下回りました。READMEの表でも、この2つは第1、第2ラウンドと進むにつれて数値が下がっています(Terminal-Bench 0.375→0.353→0.352、SWE-bench 0.626→0.618→0.611)。同社は、ソフトウェア工学の課題を訓練データに加えれば解消できると見込んでいますが、これは実験結果ではなく同社の推測です。
  • ワークフロー探索は不安定:良いワークフローに到達することと、それを安定して改善することは別問題で、強い反復の後に急落することもあると同社が書いています。
  • コードは研究用:READMEは、論文の全アブレーションは含まず、現在の探索ドライバーはアルゴリズム1と比較の仕方が異なると断っています。
  • 安全面:同社は、モデルが自分の評価者でもあるとき、共有された盲点により誤りが進歩として受け入れられ、次のモデルに取り込まれる恐れがあると明記しています。そのため、こうした失敗を理解し、検知と介入の手段を保つ必要があるとしています。
  • 日本語ページ:今回取得した4ページはいずれも英語で、日本語版は確認できませんでした。

Sakana AIの直近の動きは、9月10〜17日のSakana Chat・Marlinの更新やFrontier Intelligence Groupの公表の記事でも整理しています。同社の概要はSakana AIとはをご覧ください。

出典と確認時刻

上記4ページは、いずれも日本時間2026年10月12日6時8分台に取得し、内容を確認しました。GitHubの表示は14コミット、スター8でした。本記事は続報があり次第更新します。

この記事でよく聞かれること

Sakana AIのMASS(Multi-Agent Self-Supervision)とは何ですか?
Sakana AIが2026年10月12日付で公開した、再帰的自己改善(RSI)の手法です。1つの共有モデルが仮想サブエージェントのチームで課題を解き、ワークフローを探索し、自分の判断で最良の実行を選び、その実行を学習に戻します。論文(arXiv:2610.12176)とコード(GitHub)も公開されています。
MASSで性能はどのくらい上がったのですか?
同社によると、27BのオープンウェイトモデルQwen3.6-27Bで2サイクル回した後、MLR-Bench・DSBench・ScienceAgentBench・AstaBenchの4つで、出力トークンあたりのスコアがベースモデルの1.2〜1.6倍になりました。一方、Terminal-Bench 2.0は0.96倍、SWE-bench Verifiedは0.94倍で、同社自身が転移は一様でないと書いています。
MASSのコードは誰でも使えますか?
GitHubのSakanaAI/massで公開されています。READMEは「研究用の実装」と位置づけ、論文の全てのアブレーション(要素ごとの比較実験)や分析は含まないと書いています。流れの下見とオフラインのテストはGPU不要ですが、実際の実験にはvLLMでのモデル提供やGPUの割り当てを含む準備が案内されています。
MASSの安全面の懸念は何ですか?
同社は、モデルが自分自身の評価者でもある閉じたループでは、共有された盲点により誤りが進歩として受け入れられ、学習で強化されうると書いています。そのうえで、こうした失敗を理解し、検知して介入する手段を保つ必要があるとしています。
シェア: ポスト はてブ

出典・参照資料

AI時短ラボ

大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

関連記事

エージェンティックAIとは──AI事業者ガイドライン(第1.2版)の脚注は「複数のAIエージェントにより自律的に意思決定を下しアクションを起こす目標主導型のAIシステム」と書き、本文での定義は「次年度以降」に回した。AIエージェントとの違い、複数エージェントが協調するときに起きる問題(Anthropicの脆弱性266件・談合・縄張り争い)、同じ課題を5回やって全部成功するか(IBMのPass^k)の記事画像

エージェンティックAIとは AI事業者ガイドライン(第1.2版)の脚注は「複数のAIエージェントにより自律的に意思決定を下しアクションを起こす目標主導型のAIシステム」と書き、本文での定義は「次年度以降」に回した。AIエージェントとの違い、複数エージェントが協調するときに起きる問題(Anthropicの脆弱性266件・談合・縄張り争い)、同じ課題を5回やって全部成功するか(IBMのPass^k)

研究
Our framework for reporting model misalignment(OpenAI公式の画像)

OpenAI、モデルの「不整合」を公開報告する枠組みを発表 「業界は最高速度で拡大を続けられるほどアライメントを解いていない」、初回6件は漏れたAPIキーの無断使用・数字の捏造・要約に埋めた「隠せ」の指示

研究
AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突くの記事画像

AIエージェントへの攻撃成功率85% OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く

研究
AIが独力でこなせる作業時間、3〜7ヶ月ごとに倍──METRの「タイムホライズン」を原文で読むの記事画像

AIが独力でこなせる作業時間、3〜7ヶ月ごとに倍 METRの「タイムホライズン」を原文で読む

研究(発表 1月29日)
「JIT-Agent」とは何か──harnessそのものを「その場で生成するモデル」に育てるという発想の記事画像

「JIT-Agent」とは何か harnessそのものを「その場で生成するモデル」に育てるという発想

研究
「AI 2027」を書いた本人たちが、なぜ「AI 2040」を書き直したのか──著者陣の軌道修正を原文で読むの記事画像

「AI 2027」を書いた本人たちが、なぜ「AI 2040」を書き直したのか 著者陣の軌道修正を原文で読む

研究(発表 2025年4月3日)
AIエージェントのベンチマークは「ハック」できる──1つのタスクも解かずに満点近くを叩き出した実証研究の記事画像

AIエージェントのベンチマークは「ハック」できる 1つのタスクも解かずに満点近くを叩き出した実証研究

研究
『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸の記事画像

『できること』ではなく『やりたがること』を測る PropensityBenchが導入した安全性評価の軸

研究