AI時短ラボ
モデル· 約21分

Odysseyの世界モデル「Agora-2」にOpus 5.5を4回入れてみた──0キルから50キル、ボス撃破まで。ゲームエンジンのどこをAIが引き受け、どこがルールのまま残っているか

Odysseyが9月21日に公開したマルチエージェント世界モデル「Agora-2」は、ゲームエンジンの「ルールの計算」と「画面の描画」を2つの学習モデルに置き換え、人間とAIが同じ世界に入れる研究プレビューとしてブラウザで公開されている。技術レポートによると、人間が操作できるのは最大4人で残り16体は自律キャラ、地図・シナリオ・敵の出現・ポータルは今も従来のエンジンが受け持つ。AI時短ラボは9月25日にClaude Opus 5.5へ4回プレイさせた。画面を見て1手ずつ操作した1・2回目は0キル、ページが受け取る地図と位置のデータを読むプログラムを自分で書いた3回目にボスのAndarielを倒し、4回目は50キルだった。

Agora-2のボス戦の画面に「全部AIが描いてる」の文字を載せた解説動画のサムネイル
執筆・編集:
目次

2026年9月25日夜・日本時間時点の情報です。Odysseyは9月21日、人間とAIエージェントが同じ世界に入って遊べるマルチエージェント世界モデル「Agora-2」の研究プレビューを公開し、ブラウザ(agora.odyssey.systems)から誰でも試せるようにした。公式ブログによると、Agora-2はDiablo II(Blizzard)のキャプチャで学習しており、実質的に「a learned game engine(学習されたゲームエンジン)」として働く。AI時短ラボでは、あわせて公開された技術レポート(23ページ)を読み、9月25日の午後にAnthropicのClaude Opus 5.5に4回プレイさせた。

この記事では、ブログ、技術レポート、Odysseyの過去の発表3本、それに4回分のプレイ記録(録画・終了画面のスコア表・ページが受け取った状態データ)をもとに、Agora-2がゲームエンジンのどの仕事をAIに置き換え、どこを従来のルールに残しているかを整理する。動画版(15分45秒)も公開している: https://youtu.be/5VLHU0BD8_4

3行まとめ

  1. Agora-2は、ゲームエンジンの「ルールの計算」と「画面の描画」を、2つの学習モデルに分けて置き換えた。 技術レポートによると、約446万パラメータのシミュレーションモデルが全員の操作から次の瞬間の共有状態(移動・攻撃・ダメージ・アニメーション)を予測し、約10億パラメータの描画モデルがその状態から各プレイヤーの640×480の画面を生成する。描画モデルはプレイヤー1人にGPU1枚で、毎秒30コマは目標値。
  2. ただしエンジンが無くなったわけではない。 レポートは、地図・シナリオ・敵の出現の足場・ポータルなどは従来のゲームエンジンが今も受け持ち、死亡や復活の管理はサーバーのルールが行うと書いている。ブログの「最大20の人間とエージェント」も、レポートでは人間が操作できるのは最大4人で、残り16体は自律キャラという内訳になっている。
  3. Opus 5.5は、画面を見て1手ずつ操作した1・2回目は0キルだった。 ページが受け取る地図と位置のデータを読んで道を計算するプログラムを自分で書いた3回目にボスのAndarielを倒し(体力140→16.5)、直した4回目は50キル2デス。4回目には、Opus 5.5が40マス以上離れている間にAIの仲間2体が画面の外でAndarielを倒しており、画面とは別に世界の状態が進んでいることを記録で確かめられた。

Agora-2の要点

項目 内容(出典)
発表 2026年9月21日、Odysseyブログ「Introducing Agora-2」(Oliver Cameron氏)
何か 人間とエージェントが共有する世界をリアルタイムに生成するマルチエージェント世界モデル。公開されたのは遊べる研究プレビュー(ブログ)
参加者 ブログ:最大20の人間とエージェント(Agora-1の5倍)/レポート:人間の操作は最大4人+自律キャラ16体
題材 ブログ:Diablo IIのキャプチャで学習/レポート本文:計装したRust製のアイソメトリック(斜め見下ろし)ゲームエンジンから記録
しくみ シミュレーションモデル(約446万パラメータ)が共有状態を進め、プレイヤーごとの描画モデル(約10億パラメータ・flow matching)が画面を作る(レポート)
画面 640×480。潜在表現の更新を毎秒15回、表示を毎秒30コマにするのが目標(レポート §6.2)
学習 描画モデルは約433万区間の記録で、B200 GPU 32枚を使い6万回+6万回の更新(レポート 付録A)
配信 4人のセッションでNVIDIA RTX PRO 4500を4枚。1枚につき1人分の描画モデル(レポート §6.1)
前作 Agora-1(2026年5月18日)。題材はGoldenEyeで、最大4人
遊び方 agora.odyssey.systems。9月25日時点ではログインなしで始められ、1試合10分

ブログとレポートで書き方が違う2点

1つ目は人数だ。ブログは「最大20の人間とエージェント」と書くが、レポートの序論は、人間が操作するキャラ最大4体と自律キャラ16体を同時に扱うと説明している。合計は20で一致するが、20人の人間が同時に遊べるという意味ではない。今回のプレイでも、待合室の表示は「1/4」のように最大4人だった。

2つ目は題材だ。ブログはDiablo IIのキャプチャで学習したと書いている。一方、今回取得したレポートのPDFを全文検索すると「Diablo」は0件で、データの節には「計装したRust製のアイソメトリックゲームエンジン」から記録したとある。ただしレポートの図3にはDurielというボスの名前が出てきて、今回のプレイでもAndarielとMephistoというボスが現れた。どちらもDiablo IIに出てくるボスと同じ名前だ。レポートが言うRust製のエンジンが、Diablo IIを再現したものなのか別物なのかは、この2つの文書だけでは判断できない。

世界モデルとは何で、Odysseyはなぜゲームから始めるのか

Odysseyは9月15日のOdyssey-3の発表で、世界モデルを「learned dynamical systems(学習された力学系)」と説明している。今の状態と行動を入れると、次に世界がどうなるかを予測するモデルのことだ。言語モデルが次の単語を予測するのに対し、世界モデルは次の瞬間の世界を予測する。予測を繰り返せば、そのまま世界のシミュレーターとして使える。

では、シミュレーターがあると何がうれしいのか。Odysseyは6月12日のブログ「The Era of Multi-Agent Imagined Experience」で、AIの歩みを3幕に分けている。囲碁やチェスのように自分と対戦して強くなった時代、人間の文章を大量に真似して学ぶ大規模言語モデルの時代、そして今から始まる「経験の時代」だ。その中心にある考え方を、ブログは「an agent doesn't have to learn in the real world.(エージェントは現実世界で学ぶ必要がない)」と書く。世界モデルの中で練習し、身につけた技を現実に持ち出せばよい、という主張だ。

実例として、Odyssey-3の発表は、シミュレーションの運転データ20時間だけで学んだ方策が、インドの道路で車を閉ループで自動運転したと書いている。安全ドライバーが介入するまでに走れた距離は、実際の走行映像で学んだ方策の約77%だったという。

Agora-2はこの流れを複数のエージェントに広げたものだ。ブログは使い道として、AIの訓練・ロボット・自動運転・防衛・エネルギー・サイバーセキュリティ・ゲームを挙げる。背景として、AIを使ったサイバー攻撃やエージェント同士の談合が報告されていることにも触れ、AI同士の関わり方を、現実のシステムを危険にさらさずに調べる手段になるとしている。ブログはさらに、強化学習で訓練したエージェントに、相手を追う・障害物を避ける・行き詰まったら抜け出す、といった行動を学ばせていると説明し、エージェントと、それを鍛える世界モデルが互いを改善していく研究としてPROWL(arXiv 2605.18803)を挙げている。

ルールの係と絵の係:ゲームエンジンの2つの仕事をどう置き換えたか

ふつうのゲームでは、人が書いたコードが動き・当たり判定・ダメージを計算し、その結果を決まった絵として画面に描く。レポートによると、Agora-2はこの2つの仕事を別々の学習モデルに任せている。

ルールの係=シミュレーションモデル。 約446万パラメータ(付録では4,457,777)、4層で幅256のTransformerだ。全員の操作と直前の状態から、次の瞬間の共有状態を予測する。移動は、あらかじめ決めた14通りの動き方から1つを選ぶ。攻撃は3つの時計(攻撃の進み具合など)がどう進むかを予測し、ダメージ・アニメーションの種類と段階・飛び道具の発射と着弾も予測する。ルールの係は、パラメータ数でいえば描画モデルの200分の1以下の大きさしかない。

絵の係=描画モデル。 約10億パラメータの、flow matchingで学習したTransformer(16ブロック)だ。周囲12×12マスの地形、キャラ、エフェクトを1つずつトークンとして受け取り、そのプレイヤーの直前の映像も参照しながら、5段階の生成で潜在表現を1つ作る。1つの潜在表現から2コマ分の映像が出てくる。ブログによると、学習中はわざと直前の映像を頻繁に取り除き、渡された状態を頼りに描くよう仕向けているという。

動き方。 レポートの§6.2によると、ブラウザから届いた操作とエージェントの行動をシミュレーションモデルが受け取り、サーバーがその予測を適用して共有状態を進める。その後、プレイヤーごとの描画モデルが次の画面を生成し、WebRTCで各ブラウザへ送る。シミュレーションは毎秒30回の刻みで進み、描画は毎秒15回の潜在の更新=30コマの表示を目標にしている。

学び方。 レポートの§5によると、お手本になる本物のゲームエンジンを並列でたくさん動かし、各刻みの操作・全キャラの状態・何が起きたか・各プレイヤーの画面を記録した。学習データは、シミュレーションモデル用が1,108,800区間、描画モデル用が4,332,800区間。ふつうのプレイでは、壁に押し付ける・狭い隙間を通る・攻撃を空振りするといった場面がほとんど出てこない。そこでこうした場面を再現するシナリオを別に用意し、多めに集めたと書かれている。

AIが予測する部分と、ルールのまま残る部分

レポートの表2と§6.2は、どこが学習モデルでどこがルールかを分けて書いている。まとめると次のとおり。

担当 受け持つこと(レポート 表2・§6.2)
シミュレーションモデル(学習) 移動の枝と向きの選択、攻撃とクールダウンの時計、ダメージ、飛び道具、アニメーションの種類と段階
描画モデル(学習) 状態と直前の映像から、プレイヤーごとの次の画面を生成
エージェント方策(学習) 自律キャラの行動を選ぶ
サーバー 予測を適用して共有状態を進める。体力、死亡・死体の消去・出現・復活・回復のルール
従来のゲームエンジン 地図、シナリオ、敵が出てくる足場、シナリオが持つ物の効果

従来のエンジンが残っている部分について、レポートは「Native-engine scaffolding supplies maps, scenarios, spawning, and scenario-owned world-object effects.(ネイティブエンジンの足場が、地図・シナリオ・出現・シナリオが持つ物の効果を供給する)」と書いている。図3の説明でも、動きと描画は学習によるものだが、ポータルの出現はシナリオ側のルールに従う、と断っている。

つまり、「ゲームエンジン無しで動く」は言い過ぎだ。動き・戦闘・画面は学習モデルの予測から出てくるが、世界の骨組みと生死の管理はルールが持っている。学習にはお手本のエンジンも必要だった。AI時短ラボの解釈では、エンジンを消したというより、エンジンがやっていた中心の仕事を、学習モデルで再現できるようになった段階と読むのが近い。

Opus 5.5に4回遊ばせた記録:0キル、0キル、4キル、50キル

ここからは、AI時短ラボが9月25日の午後(日本時間)に実際にプレイした記録だ。操作したのはAnthropicのClaude Opus 5.5で、専用に立ち上げたブラウザを、決まった操作(キー入力・画面の保存など)だけで動かした。

回 操作のしかた 結果(終了画面のスコア表)
1回目 画面を撮って見て、1手ずつキーを押す 0キル。同じ世界にいたNEURONAUTは8キル
2回目 同上 0キル。人間が操作する枠はOpus 5.5の1つだけで、AIの仲間3体が付いてきた
3回目 Opus 5.5が書いたプログラムに任せる(ページが受け取る地図と位置のデータを読み、道を計算して戦う) 4キル0デス。Andarielを倒し、2面のThe Dark Towerへ
4回目 3回目のプログラムを直した版 50キル2デス

1回目(ソーサレス)。 スコア表には、ほかの参加者としてGUILEとNEURONAUTの名前が並んだ(NEURONAUTは終了時に「disconnected」表示)。Opus 5.5は1手ごとに画面を撮って考えてからキーを押していたので、数秒に1手しか動けず、敵のいる区画までたどり着けなかった。洞窟では、盾を持った小鬼の姿をしたキャラに合計24回攻撃した。まったく倒れないので調べると、ミニマップのデータでは敵として扱われていなかった。敵として動く相手ではなく、置物だったと判断している。

2回目(バーバリアン)。 人間が操作する枠に入っていたのはOpus 5.5だけで、AIの仲間3体が付いてきた。レポートにある、人間についてくる自律キャラだ。この回も0キルだった。

3回目。 やり方を変えた。Agora-2のページは、映像とは別に、ミニマップ用の地図と全キャラの位置をサーバーから受け取っている。Opus 5.5はページのプログラムを読み、ミニマップの色の意味(黄=自分、緑=仲間とほかの参加者、赤=敵、オレンジ=ボス)を確かめたうえで、そのデータを読み取り、地図の上で道を計算して敵に近づき攻撃するプログラムを書いた。正確に言えば、1コマずつOpus 5.5が判断しているのではなく、判断のしかたを書いたのがOpus 5.5だ。洞窟の奥のAndarielとは正面からの殴り合いになり、体力を140から16.5まで削られながら倒した。するとポータルが開き、2面のThe Dark Towerに移ると、ボスはMephistoに変わった。

ただし、このプログラムには誤りがあった。地図のデータには1〜3の数字が入っていて、Opus 5.5はこれを「通りやすさ」と読んでいた。録画を見ていたチャンネル運営者から「進めない所に進もうとしている」と指摘されて調べ直すと、数字が違うマスどうしは行き来できないことが多く、床の高さの段だと考えられた。崖を正面から登ろうとしていたわけだ。

4回目。 高さの段が変わる移動は遠回りを選ぶ、進めなかったマスは覚えておく、ボスが倒れたらポータルを目指す、という3点を直した。約10回/秒で状態を記録しながら遊び、結果は50キル2デス。2回倒されたが、復活して試合を続けた。

画面の外で倒されたボスが示すこと

4回目で起きたことが、Agora-2の設計をいちばんよく表していた。Opus 5.5のキャラが洞窟の別の場所を歩いている間に、AIの仲間2体がAndarielを倒していたのだ。記録(10,565件)で撃破の直前を見ると、Andarielとの距離は、仲間の2体が1.5マスと1.9マス、Opus 5.5のキャラは40.6マスだった。Opus 5.5の画面にボスは映っていない。

ブログは、キャラの情報は特定の視点とは別に状態として保たれるので、「they remain available when an entity is out of frame(画面の外にいても失われない)」と説明している。今回の記録は、この説明と合っていた。そもそも、映像ではなくサーバーが送る状態データを読んで遊べたこと自体が、絵とは別に世界の状態があることの裏付けになっている。

一方で、今回確かめられたのはサーバー側の状態だけだ。同じ出来事が、ほかのプレイヤーの画面にも食い違いなく描かれていたかどうかは確かめていない。レポートも、視点どうしの見た目の一致はまだ評価していないと書いている。

遊んで気になった点と、レポート自身が「まだ測っていない」と書く点

遊んで気になったのは2点だ。1つは、置物と敵が見た目では区別しにくいこと。1回目の24回の攻撃は、そのせいで起きた。もう1つは、キャラの歩く速さがかなり遅く感じられたことだ。

レポートの「Limitations」の節は、まだ評価していないことをはっきり書いている。

  • 長く遊んだときの画質、プレイヤーどうしの画面の一致、操作どおりに動くか、エージェント方策の強さは未評価
  • 毎秒15回・30コマは目標値で、実際に続けて出ているフレームレートや、操作してから画面が変わるまでの遅れは定量評価していない
  • 新しい見た目・ルール・環境への移し替えは試していない
  • シミュレーションの予測の誤りは、時間とともに積み重なりうる

評価済みの数字もある。1ステップ先の予測で、移動の枝の正答率は85.17%、障害物で止められる場面に限ると68.17%、アニメーションの種類は95.84%だった。ぶつかる場面がいちばん難しいという結果は、Opus 5.5が崖で苦労したことと重なる。画質は、VAEを使った比較対象のPSNR 20.67dBに対して30.11dBで、9.44dB高い。ただしレポートは、この比較は学習予算・データ・条件づけが揃っていない完成品どうしの比較で、構造の良し悪しだけを比べたものではないと注記している。

AI時短ラボ側でも、フレームレートと遅延は測っていない。

遊び方(9月25日時点)

  1. ブラウザで agora.odyssey.systems を開く(ログイン不要だった)
  2. アマゾン・ネクロマンサー・バーバリアン・パラディン・ソーサレスの5クラスから選び、名前を入れる
  3. 待合室で最大4人まで待つ。待たずに始めるなら「START ANYWAY」
  4. 1試合は10分。最初の場所は洞窟「The Den of Evil」。WASDで移動、スペースで攻撃

ゲームの映像は640×480でWebRTCで届き、BGMと効果音はサイト側で鳴っていた。研究プレビューなので、仕様は予告なく変わる可能性がある。

この記事で確かめていないこと

  • 一次資料(ブログ・技術レポート・過去の発表)は9月25日に取得した。レポートのPDFの作成日時は2026年9月25日6時24分(日本時間)で、9月21日の公開後に差し替えられた可能性がある。数字は取得した版のもの
  • ミニマップの色の意味は、ページのプログラムから読み取った。ボスを倒した後に出た水色の印はポータルと推測している
  • 1回目のGUILEとNEURONAUTが人間だったかAIだったかは確かめていない
  • 小鬼を置物と判断したのは、ミニマップのデータで敵として扱われていなかったことによる。当たり判定の問題だった可能性は残る
  • 3回目以降のプレイはOpus 5.5が書いたプログラムによる操作で、1コマずつの判断ではない

動画版では、この記事の内容をプレイ映像と一緒に15分45秒で見られる。編集もOpus 5.5が担当したので、編集への感想も動画のコメント欄で聞かせてほしい。

関連記事

シェア: ポスト はてブ

出典・参照資料

YouTubeで見る ↗

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

ワールドモデル(世界モデル)とは──「次の単語」ではなく「世界の次の状態」を予測するAIの記事画像
研究07.16読了7分

ワールドモデル(世界モデル)とは──「次の単語」ではなく「世界の次の状態」を予測するAI

出典 ─ 日本のロボティクスおよび製造業のリーダーたち
RunwayがGWM-1で目指す次──「動画生成」から「世界そのものをシミュレートする」への転換の記事画像
プロダクト09.06読了10分

RunwayがGWM-1で目指す次──「動画生成」から「世界そのものをシミュレートする」への転換

出典 ─ Runway Research
「空間知能」とは何か──Fei-Fei Liが掲げるAIの次のフロンティアの記事画像
研究09.05読了11分

「空間知能」とは何か──Fei-Fei Liが掲げるAIの次のフロンティア

出典 ─ Atlas: A World Model f
動画生成AIの『記憶』をKVキャッシュの外に出す──Alaya-EVOKEはH200で1.5秒分の映像を2.11秒で作り続けるの記事画像
研究09.01読了22分

動画生成AIの『記憶』をKVキャッシュの外に出す──Alaya-EVOKEはH200で1.5秒分の映像を2.11秒で作り続ける

出典 ─ Alaya-EVOKE: From Line
「VibeWorlding」とは何か──「なんとなくこんな世界」を3Dに組み立てさせたら、GPT-5.5でも成功率6割未満だったの記事画像
研究09.06読了10分

「VibeWorlding」とは何か──「なんとなくこんな世界」を3Dに組み立てさせたら、GPT-5.5でも成功率6割未満だった

出典 ─ VibeWorlding: Can Mult
Claude Opus 5.5が登場──入力4ドル・出力20ドルでOpus 5より2割安、公式ベンチ9項目のうち7項目で首位の記事画像
モデル09.22読了17分

Claude Opus 5.5が登場──入力4ドル・出力20ドルでOpus 5より2割安、公式ベンチ9項目のうち7項目で首位

出典 ─ Anthropic公式
Anthropicの「Model Hardware Standard(MHS)」──AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正までの記事画像
研究09.23読了7分

Anthropicの「Model Hardware Standard(MHS)」──AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正まで

出典 ─ Anthropic(2026年8月27日・9月18日取得)
Claudeが新しい酵素システム「ART」を自力で発見──指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいたの記事画像
研究09.23読了14分

Claudeが新しい酵素システム「ART」を自力で発見──指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいた

出典 ─ Anthropic公式「Claude dis