「Agora-2: Odysseyのプレイアブルなワールドモデルが4基のGPUで20人の参加者を同時に動作させる」のために生成されたヒーローカード。上部には3つのフラットなラインアイコンが横に並ぶ——人々が描かれた地球儀、ノードネットワーク、そしてGPUと表示されたチップ——タイトルの上にあり、その下にはサブタイトル「すべてのフレームはモデルから生み出される」が付く。下部に沿った3つの角丸のファクトピルには「20人の参加者」「4,457,777パラメータのシミュレーションモデル」「約10億パラメータのレンダラー」と書かれている。OrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

Agora-2:Odysseyのプレイアブル世界モデルが4台のGPUで20名の参加者を実行

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Agora-2は、20人の参加者を1つのシミュレーションに投入し、それをプレイアブルな研究プレビューと呼んでいる。Odysseyが公開したのは2026年9月21日、オリバー・キャメロン署名の「Introducing Agora-2: Advancing Multi-Agent World Simulation」と題した投稿で、一人歩きする数字は20だ。重要なのは、その内訳だ。1セッションは最大4人の同時操作可能な人間のコントローラーと16体の自律エンティティを支え、これらは同じ種類の参加者ではない——4人が移動コマンドを入力し、16体のポリシーがそれを実行する。Odysseyはポリシー自体を、同じく学習対象としたゲームのステージ上で訓練した。論文によれば、その世界はDiablo IIのキャプチャから学習される。

制御された参加者とシミュレートされた参加者の間のその区別こそが、Agora-2に関するほとんどすべての興味深い点が宿る場所だ。また、ほとんどの報道が曖昧になるのもそこである。なぜなら、「20人のプレイヤー」の方が、「4人のプレイヤーと16人の学習済みエージェントが、オフスクリーンでも持続する状態を共有する」よりも簡潔な文だからだ。Odysseyがリリースするものは、マルチプレイヤーを後付けしたビデオジェネレーターではない。それはむしろ、物理演算、アニメーション、レンダリングがすべて学習済みコンポーネントに置き換えられたゲームサーバーに近く、その唯一の真のコンテンツソースは録画されたプレイのデータセットである。

20名の参加者は4人と16件のポリシーです

Odysseyは、Agora-2がAgora-1の5倍の参加者をサポートし、単一環境のシミュレーションから、より長期的な振る舞いを持つ複数環境のシミュレーションへと移行したことを明言している。セッションごとの構成は次のとおりです:

• 人間の操作者 — 最大4人まで同時、それぞれが移動とアクションの入力を行う

• 自律的エンティティ — セッションごとに16体、プレイヤーではなく学習済みのモンスター方策およびコンパニオン方策によって駆動される

• 総参加者数 — 単一の共有ワールド状態で20名、これがOdysseyが真っ先に打ち出す数字です

• 環境 — Agora-1 がシミュレートできた単一の環境から、複数に増加

• コンテンツの基盤 — Diablo II のキャプチャであるため、世界、アセット、ルールはすべて1つの記録済みコーパスから継承されている

• リリース形態 — 製品ではなく、プレイ可能な研究プレビューであり、ウェイトもライセンスも価格もない

自律型の16体は飾りではない。Odysseyのレポートには、モンスター用とコンパニオン用のポリシーを別々に訓練することが記述されている。また、評価の件数は具体的だ。ベースとなる教師に加え、回復データと保持データから引き出された最終段階のモンスターポリシー例が23,771件、コンパニオンポリシー用の例が128,005件で、それぞれ252件の評価エピソードと24件の評価ケースに対して評価されている。これらのポリシーこそが、4人セッションに人が集まっているような感覚を与える。また、参加者数が容量の主張ではなく設計上の選択である理由でもある——16というのは、ワールドサーバーが4人の人間と一緒に担うよう訓練されたエージェントの数であり、理論上収容できる数ではない。

アーキテクチャは、1つの小さなモデルと1つの大きなモデルです。

Agora-2は、何が起こるかを決めるものと、それがどのように見えるかを決めるものを分離しており、両者の規模の差は論文の中で最も際立つ数値である。シミュレーションモデルは4,457,777個のパラメータ——およそ446万、4層の広がり、幅256、4ヘッド、4ステップの履歴ウィンドウ、14個の移動ブランチ、および向き用の別個のヘッド——を持つ。レンダラーは約10億パラメータのフローマッチングTransformerで、16ブロック、幅2,048、そのうち5つが因果的時間アテンションを担い、更新ごとに5ソルバーステップ実行される。

レンダラーは生の世界ではなく、342トークンのプレフィックスに条件付けられている:

• マップ — 144トークン、視点周辺の12×12のローカルタイルグリッド

• エンティティ — 36トークン、うち4つはユーザー制御の参加者用、32つはその他のエンティティスロット用

• 一時的な効果 — マップでもエンティティでもない効果に160トークン

• 表示と名簿 — カメラ操作とセッション名簿にそれぞれ 1 トークン

• 更新あたり — 300 個の画像トークンが、それら 342 個の条件付けトークンに対してアテンションを計算する

• コーデック — RAEベースの潜在表現で、2フレームを15×20×32に変換し、出力時にx264 CRF 18またはNVENC QP 18を適用

Odysseyは、条件付けがこのように構造化されている理由を明示している。学習された世界は、エンティティのプロパティを、特定のカメラよりも長く存続する状態に保つ必要がある。投稿はそれを端的に述べている——エンティティのプロパティは特定のビューとは独立に保持されるため、エンティティがフレーム外にあるときも利用可能であり続ける。その一文こそが、Agora-2をビデオモデルから区別するものである。直近のフレームだけに条件付けする生成器は、モンスターから目をそらした瞬間にそれを失う。明示的な状態を保つ世界モデルは失わない。

A screenshot of Odyssey's Agora-2 announcement page showing the Odyssey navigation bar and an 'Agora-2' button above a wide three-panel still of rendered gameplay, the headline 'Introducing Agora-2: Advancing Multi-Agent World Simulation', the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', the byline Oliver Cameron on the left with the date 'September 21st, 2026' on the right, and the opening paragraphs describing a playable research preview.

4つのGPUで4人のプレイヤーを賄える

レポートに記載されているサービング計画は、Agora-2で最も公表されていない部分であり、このような世界にどれほどのコストがかかるかを見積もる人にとって最も有用な部分です。Odysseyの4人プレイセッション向け構成は、NVIDIA RTX PRO 4500カード4枚です。GPUごとにレンダラーを1基配置し、そのうち1基のGPUがシミュレーションモデルとエージェントポリシーもホストします。公表されている目標は、毎秒15回の潜在更新と毎秒30フレームの表示です。

付録にある2つの数字が、その構成を具体的に示している。165ワットで、チームはレンダラーへの変更による推論の9.9%削減を測定した——実装あたり3,200回の呼び出しで、62.92ミリ秒から56.69ミリ秒への短縮である。また、レンダラーのトレーニングも同じくらい具体的だった。4,232,000セグメントに対する6万回の更新に続いて、4,332,800セグメントに対するさらに6万回の更新を行い、学習率1e-4のAdamW、バッチ128、EMA 0.9999で、32台のB200 GPU上で実行した。そのコーパスは項目別に列挙されている——1,200,000件の全ロスター戦闘セグメント、2,016,000件の層別特殊能力セグメント、504,000件の死体横断セグメント、512,000件の自律エンティティを含まない移動セグメント、100,800件のボスポータル・ライフサイクルセグメントである。

その2つの段落を一緒に読めば、製品の形は明らかだ。レンダラーは、パラメータ数では3桁、サービングでは同時視聴者1人につき1基のGPU、トレーニングでは32台のB200という点で、高コストな側の半分を占めている。シミュレーションモデル——世界で何が起きるかを実際に決める部分——は450万パラメータで、ほとんどの埋め込みテーブルより小さい。{{KEEP}}Agora-2{{/KEEP}}は、ゲームエンジンの衣装をまとったレンダリング問題だ。

公表された数字、そしてそれらが示していない一つのこと

このレポートの定量的な結果は、Odyssey自身の位置づけによれば、競合ベンチマークのスコアではなく、Odyssey自身の設計上の選択に対するアブレーションであり、そのように読まれるべきである:

• 構造化プレフィックス vs VAEベースライン — 平均二乗誤差0.001279およびPSNR 30.11 dB 対 0.010272および20.67 dB、9.44 dBの向上、30クリップと3シードからの90件のペア評価にわたる

• レンダラーアテンション — 構造化プレフィックスで2フレームデノイザ更新あたり20.09ミリ秒、クロスアテンションで37.06、プール型AdaLNで18.82、デノイザで45.8%削減、コアで34.1%

• 50%での履歴ドロップアウト — ストリーミング誤差0.05695およびコールドスタート0.19535(ドロップアウトなしの0.06041および0.21082に対して)、マップ摂動忠実度はわずかに悪化

• シミュレーション精度 — 移動分岐予測で85.17%、より難しいブロック例サブセットで68.17%、アニメーションモードで95.84%、予測されたモード切替は7.49%で、記録された3.54%に対して

これらの数値はすべて、Agora-2 の別の構成を基準に測定されたものです。そのいずれも、出荷済みシステムとの比較ではなく、ライブプレイを記述したものでもありません。報告書の第8節は、この隔たりについて率直に述べています。新しいアセット、ルール、環境への移行は未検証のままです。誤差は蓄積します。独立に生成された画像は、外観、可視性、イベントのタイミングにおいて依然として食い違う可能性があります。そして、全文を引用する価値のある一文は次のとおりです。ライブのマルチエージェント相互作用中の持続的フレームレートと入力から表示までのレイテンシは、定量的に評価されていません。上記の毎秒15回の更新と毎秒30フレームは目標値であり、測定値ではありません。

A generated scoreboard titled 'Agora-2 — what the report actually reports' listing six rows: participants — 4 human controllers plus 16 autonomous entities; simulation model — 4,457,777 parameters; renderer — about one billion parameters, five solver steps; serving — 4x RTX PRO 4500 per four-player session; targets — 15 latent updates and 30 displayed frames per second; live latency evaluation — none published. A footer reads 'All figures reported by Odyssey; none independently reproduced.'

プレビューの保存場所と、含まれないもの

プレイ可能なプレビューはOdyssey自身のサイトにあり、デモ用アドレスagora.odyssey.mlを通じてアクセスでき、これはagora.odyssey.systemsにリダイレクトされる。技術レポートは、同じ発表からリンクされているPDFである。公表されていないものは、公表されているものと同じくらい注目に値する。モデルの重み、リポジトリ、ライセンス、推論API、価格のいずれもない。Odysseyはこのリリースを研究プレビューと説明し、自社の基盤となるワールドモデル内でのマルチエージェント相互作用に向けた道筋を将来の課題として扱っている。PROWLは同社が拡大中の研究スレッドとして挙げられ、Odyssey-3が最終的な到達点として名指しされている。

これは、Agora-2 を使って構築しようと計画しているすべての人にとって重要な点です。なぜなら、今日の現実的な答えは「できない」だからです。当社を通じても、他の誰かのホスト型エンドポイントを通じても。OrcaRouter は Agora-2、Agora-1、Odyssey-3 を提供していません。それらのモデルルートは当社のカタログには存在しません。当社のプラットフォームが実際に提供しているのは、学習済みワールドの周辺に構築されるかもしれないものの残りの部分です:200以上のモデルをカバーし、各プロバイダーの定価でマークアップゼロで提供される単一のエンドポイント、そのためベンダーが値下げすればその変更は同じ日にここで反映され、プロバイダーが性能低下したときにリクエストを自動的にフェイルオーバーするルーティング層。もしモデルを使ってレベルレイアウトの生成、ポリシーコードの記述、録画されたプレイへのキャプション付けを行うことになったなら、そこが私たちが実際に手助けできる部分です。

何を見るべきか

Agora-2は確かな成果であり、同時に確かな留保もある。この二つは混同されやすい。成果とは、共有された持続的なマルチ環境ワールドを、記録されたプレイのコーパスから二十人の参加者向けにシミュレートし描画できること、そしてOdysseyがそれを可能にした具体的な設計上の決定——明示的な状態、構造化されたコンディショニング接頭辞、小さなシミュレーションモデル——を指し示せることである。留保とは、論文自身の第8節が、ライブレイテンシ、持続的なフレームレート、環境間の転移、誤差の蓄積を未評価として挙げていることだ。実際の四人プレイセッションからフレームレートのトレースが公開されるまでは、Agora-2はアーキテクチャを証明し、体験は未計測のまま残した、という要約が誠実である。

2番目に注目すべきは、進む方向性だ。Odyssey自身の枠組みでは、Agora-2は、マルチエージェント相互作用を基盤となるワールドモデルに組み込む道のりの一歩と位置づけられ、PROWLが研究上の拡張、Odyssey-3が明言されたターゲットとされている。もしそうなれば、興味深い問いは、ワールドモデルが20人の参加者を扱えるかどうかではなく、ワールドモデルが、それが一度も訓練されたことのない世界へと彼らを運べるかどうかになる——そしてそれはまさに、現行のレポートが答えを避けている転移の問いである。

A screenshot of Odyssey's Agora-2 announcement page scrolled into the body of the post, showing the paragraph describing Agora-2 as a learned game engine, the 'Experience Agora-2' and 'Read Technical Report' buttons, the 'Going forward' paragraph, two side-by-side gameplay panels captioned '2 humans battling RL-trained agents inside Agora-2, all in real time', and the section heading 'A World Simulation That Humans and Agents Can Share' with its opening paragraph explaining that Agora-2 maintains an explicit shared state that accounts for multiple participants' actions and their effects on one another.