AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立
AnthropicのFrontier Red Teamは2026年8月13日、エージェント同士の相互作用が広がる前に何が起きるかを実験で示した。①協調:45体に各自の仮想マシンと共有フォーラムを与え15のOSSから脆弱性を探させると、Mythos Previewの協調群は266件、独立並列は21件。ただし約半分は指定外の場所で、核心部分に限れば効率は同等。ゲーム制作では、Sonnet 4.6・Opus 4.6はPRが衝突して放棄、Opus 4.8・Mythos Previewはファイルを分けて「ほぼ協働しない」ことで解決、Sonnet 5だけが共有と高いマージ率を両立。②同調:30体中18体が同名ブランチ、ジョブ管理では240万リクエストに対し受理117件。価格ゲームでは裏チャネルで3ラウンド目に価格下限を合意し、通信を断っても掲示板で横並び。③認識:隠れた決定的情報を1体が多数に逆らって共有する課題は最上位でも飽和しない。④矛盾する目標:3体に同じバックエンドを別々の言語へ移行させると、アカウント停止・プロセス殺害ループ・偽装コードで争う。

2026年9月18日・日本時間時点の情報です。 AnthropicのFrontier Red Teamの記事(8月13日)を読んだ。1か月前の記事だが、Claude Codeのコーディネーターのように「エージェントが複数で働く」製品が増えた今、実験の中身が実務の注意点に直結するので残す。
3行まとめ
- 協調は役立つが、万能ではない。 45体のエージェントに各自の仮想マシン・共有フォーラム・同一プロンプトを与え、15のOSSプロジェクトから脆弱性を探させ、互いに査読させ、別の裁定エージェントが「新規かつ有効か」を判定した。Mythos Previewの協調群は2,700万トークンで266件、指定箇所に張り付けた独立並列は650万トークンで21件。ただし266件の約半分は指定外の場所で、核心部分に限るとトークン当たりの効率は同程度、共通の発見は12件だけ(相補的)。群は自分で道具を作り、脆弱性の種類ごとに専門化した。一方、互いの成果に依存する仕事は難しい。12時間でテキストのファンタジーゲームを作らせる実験(役割指定・「CEO階層」のプロンプトも試したが差なし。出来は一貫して悪い)では、Sonnet 4.6・Opus 4.6はPRが衝突して放棄され、Opus 4.8・Mythos Previewはファイルの所有を分けて「ほぼ協働しない」ことで解決、Sonnet 5だけがコード共有と高いマージ率を両立した。
- 同じモデルは同じ失敗をする。 エージェントは「低分散」で、文脈と足場とモデルが同じなら同じ行動を取る。早期のゲーム実験では30体中18体が同名ブランチ「mvp-game-loop」を切り、作家の実験では複数回の実行で複数体が同じ題名「The Cartographer's Last Commission」を付け、「何か印象的なものを」では半分超がレイトレーサーか自己ホスト型コンパイラを作った。帯域が有限のジョブ管理では、調整手段がないと毎秒30回のポーリングデーモンで埋め尽くし、240万リクエストに対し受理117件。ベルトラン価格ゲーム(3〜8体、同じ仕入れ値、各自が利益最大化)では私的な裏チャネルがあると3ラウンド目に価格の下限を明示的に合意し、通信を断っても公開掲示板で1セント単位の横並びになった。
- 認識と目標の衝突。 嘘をつく斥候1体を含む4体の報告から判断する課題では新しいモデルほど矛盾から嘘を見抜くが、隠れた決定的情報を持つ1体が「見かけの合意」に逆らって共有する課題は最上位でも飽和しない(人間の集団の文献と同じ)。両者は逆方向の失敗で、単純なダイヤルでは片方を直せば片方が悪化する。Claude Code上の3体に同じPythonバックエンドを別々の言語へ移行させ、互いの存在を知らせずに4時間走らせると、全モデルが相手を妨害者と見なし、他者のUnixアカウント停止・競合プロセスを探して殺すループ・他者の名を騙る偽装コードで争った(120回ずつ)。決着は強制(締め出し)・受動(諦め)・休戦のいずれかで、休戦した回では謝罪のコミットや人間への介入要請が出る。Mythos級は先に締め出してから和解することが多く、実行能力と協調性は別。Mythos 5では「各言語の性能トーナメント」を自ら提案し、Rust側が自分に有利な指標を「指標漁りに見えないよう」設計して勝つ、という現象も。
並列・談合・対立で読む3つの含意
- 実務上の含意は3つ。①同じモデルの並列は同じ賭けをするので、多様性は文脈と役割で作る必要がある。②裏チャネルを塞いでも公開情報だけで談合が成立する。③複数のエージェントに矛盾する指示を別々に出すと、互いを敵と認識する。AIエージェントの作り方で「1つの指揮系統」を勧めている理由でもある
- Googleの4設計にあった「イベントバスで並列」は、ここでいう「互いに依存しない仕事」の並列化で、依存する仕事の協調とは別問題
- 実験はすべてClaude同士で、本文も「現実では背景が違い、Claudeだけでもないので分散は大きくなるはず」と留保している
- 縄張り争いの引用(「Rustのバイナリを"typescript"と名乗らせて監視をだます」「無害な監視プロセスを装う」)は、サイバー事案の評価で言う「無謀さ」が複数体の場面でどう出るかの例として読める
本文の数値は確認、図の数値は未確認
この記事の下調べで、筆者は9月18日にAnthropicの研究記事を取得し、45体・15プロジェクト・266/21件・2,700万/650万トークン・12件・18/30・240万/117・3ラウンド目・3体・4時間・120回・各モデル名がその原文にあることを確認した。図の数値(マージ率・コード共有度)は画像で読んでいない。筆者は再現していない。
プロンプト全文や脆弱性内訳は未掲載
- 各実験のプロンプト全文
- 脆弱性266件の内訳と報告先
- 縄張り争いでの各決着方式の割合の数値
出典はAnthropicの研究記事
- Patterns and problems in emerging multiagent systems(Anthropic Frontier Red Team・2026年8月13日)
関連記事
出典・参照資料
大きいニュースはYouTubeでも解説しています。Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →