
Agora-2:Odyssey 的可遊玩世界模型在四張 GPU 上執行 20 名參與者
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Agora-2把二十名參與者放進同一個模擬環境,並稱之為可遊玩的研究預覽。Odyssey 於 2026 年 9 月 21 日發布了它,貼文標題為「Introducing Agora-2: Advancing Multi-Agent World Simulation」,由 Oliver Cameron 署名,而廣為流傳的數字就是那個二十。真正要緊的數字,在於它內部的拆分。一個工作階段最多可同時容納四名人類控制者與十六個自主實體,而他們並不是同一類參與者——四個人鍵入移動指令,十六個策略負責執行。Odyssey 自己訓練了這些策略,而且是在一款它同樣訓練過的遊戲關卡上:論文指出,這個世界是從《暗黑破壞神 II》的畫面擷取中學習而來的。
受控參與者和模擬參與者之間的這項區別,正是 Agora-2 幾乎所有有趣之處所在。這也是大多數報導將會模糊帶過的地方,因為「20 名玩家」比「4 名玩家和 16 個學習型代理共享一個能在畫面外存續的狀態」是更乾淨俐落的句子。Odyssey 要推出的,並不是硬加上多人功能的影片生成器。它更接近一部遊戲伺服器,其物理、動畫和渲染全都被學習得來的元件取代,而它唯一真正的內容來源,是一份錄製遊玩過程的資料集。
二十名參與者就是四個人和十六項政策
Odyssey 明確指出,Agora-2 支援的參與者人數是 Agora-1 的五倍,且它已從模擬單一環境,轉變為模擬多個具備更長遠行為的環境。每個工作階段的樣貌如下:
• 人類控制器 — 最多可同時使用 4 個,每個提供移動與動作輸入
• 自主實體 — 每場工作階段 16 個,由學習得的怪物與同伴策略驅動,而非由玩家驅動
• 參與者總數 — 20 人位於同一個共享世界狀態中,這是 Odyssey 主打的數字
• 環境 — 多個,較 Agora-1 所能模擬的單一環境有所增加
• 內容基礎 — Diablo II 的擷取內容,因此世界、素材與規則全都承襲自同一份錄製的語料庫
• 發佈形式 — 可遊玩的研究預覽,並非產品,沒有權重、沒有授權,也沒有價格
那十六個自主單位並非裝飾。Odyssey 的報告描述了分別訓練怪物與夥伴策略,而評估數量十分具體:23,771 個最終階段的怪物策略範例,取自基礎教師再加上恢復與留存資料;以及 128,005 個夥伴策略範例,分別對照 252 個評估情節與 24 個評估案例進行評分。正是這些策略讓四人場次感覺熱鬧充實。它們也是參與者數量屬於設計選擇、而非承載能力宣稱的原因——十六是世界伺服器被訓練成能與四名人類一同承載的代理數,而非理論上能容納的數量。
該架構是一個小模型和一個大模型
Agora-2 將決定會發生什麼的元件與決定它看起來如何的元件分開,而兩者之間的規模差距是論文中最も?不,最引人注目的數字。模擬模型有 4,457,777 個參數——大約 446 萬個,四層深、寬度 256,四個注意力頭,四步歷史視窗,十四個移動分支,以及一個單獨處理朝向的頭。渲染器則是一個約十億參數的流匹配 Transformer,十六個區塊、寬度 2,048,其中五個帶有因果時間注意力,每次更新執行五個求解器步驟。
渲染器是以 342 個 token 的前綴為條件,而非以原始世界為條件:
• 地圖 — 144 個符元,以視點為中心的 12×12 局部圖磚網格
• 實體 — 36 個權杖,其中四個供使用者控制的參與者使用,32 個用於其他實體槽位
• 暫時性效果 — 160 個符記,用於既非地圖亦非實體的效果
• 檢視與名冊 — 相機動作與工作階段名冊各一個詞元
• 每次更新 — 300 個圖像 token 對那 342 個條件 token 進行注意力計算
• 編解碼器 — 以 RAE 為基礎的潛在表示,將 2 幀轉為 15×20×32,輸出時再使用 x264 CRF 18 或 NVENC QP 18
Odyssey 點出條件化之所以要如此架構的原因:一個學得的世界必須把實體屬性保持在某種狀態中,而該狀態的存續要超越任何特定攝影機。文章說得很直白——因為實體屬性是獨立於任何特定視角而被保留的,所以當實體不在畫面內時,它們依然可用。這句話正是把 Agora-2 與影片模型區分開來的那句話。只以近期影格為條件的生成器,會在你把視線從怪物移開的那一刻失去牠;而保有顯式狀態的世界模型則不會。

四張 GPU 買四個玩家
報告中的服務方案是 Agora-2 最少被宣傳的部分,卻對任何想估算這樣的世界要花多少成本的人最為有用。Odyssey 針對四人場次的配置是四張 NVIDIA RTX PRO 4500 顯示卡:每張 GPU 一個渲染器,其中一張 GPU 也同時承載模擬模型與代理策略。所宣稱的目標是每秒十五次潛在更新,並達到每秒三十個顯示影格。
附錄中的兩個數字讓該配置更為具體。在 165 瓦時,團隊測得渲染器的一項變更使推論減少 9.9%——在每個實作的 3,200 次呼叫中,從 62.92 毫秒降至 56.69 毫秒。而渲染器的訓練也同樣具體:在 4,232,000 個區段上進行六萬次更新,接著在 4,332,800 個區段上再進行六萬次,AdamW 學習率為 1e-4、批次 128、EMA 0.9999,在 32 張 B200 GPU 上執行。該語料庫已逐項列出——1,200,000 個完整陣容戰鬥區段、2,016,000 個分層特殊能力區段、504,000 個屍體穿越區段、512,000 個無自主實體的移動區段,以及 100,800 個首領傳送門生命週期區段。
把這兩段放在一起讀,產品的輪廓就很清楚了。渲染器是昂貴的那一半,在參數量上高出三個數量級,在服務時每位同時觀看者需要一顆 GPU,在訓練時則要三十二顆 B200。模擬模型——真正決定世界裡發生什麼事的那部分——是四百五十萬個參數,比大多數嵌入表還小。Agora-2 是一個披著遊戲引擎外衣的渲染問題。
已公布的數字,以及它們沒有顯示的一件事
該報告的量化結果,就 Odyssey 自身的表述而言,是其自身設計選擇的消融,而非競爭性基準分數,且應據此解讀:
• 結構化前綴 vs VAE 基線 — 均方誤差 0.001279、PSNR 30.11 dB,對比 0.010272 與 20.67 dB,增益達 9.44 dB,涵蓋來自 30 個片段與 3 個隨機種子的 90 次配對評估
• 渲染器注意力 — 使用結構化前綴時,每兩幀去噪器更新為 20.09 毫秒,相較於使用交叉注意力時的 37.06,以及使用池化 AdaLN 時的 18.82,去噪器減少 45.8%,核心部分減少 34.1%
歷史丟棄率為 50% 時 — 串流誤差為 0.05695、冷啟動為 0.19535,相較於無丟棄時的 0.06041 與 0.21082,地圖擾動保真度略差
• 模擬準確度——移動分支預測為 85.17%,較難的受阻範例子集為 68.17%,動畫模式為 95.84%,預測模式切換率為 7.49%,對比記錄到的 3.54%
這些數字中的每一項,都是相對於 Agora-2 的另一種配置來衡量的。它們都不是與已出貨系統的比較,也全都沒有描述即時遊玩。報告第 8 節對這個落差直言不諱。轉移到新素材、規則或環境仍未經測試。錯誤會累積。獨立生成的影像仍可能在外觀、可見性或事件時序上不一致。而值得完整引述的一句話是:即時多代理互動期間的持續影格率與輸入到顯示延遲,尚未經過量化評估。上述的每秒十五次更新與每秒三十格是目標,不是實測值。

預覽位於何處,以及它不包含哪些內容
可試玩預覽位於 Odyssey 自家網站,可透過示範網址 agora.odyssey.ml 前往,該網址會重新導向至 agora.odyssey.systems。技術報告則是同一則公告中所連結的 PDF。未公開的部分和已公開的部分同樣值得注意:沒有模型權重、沒有儲存庫、沒有授權條款、沒有推論 API,也沒有價格。Odyssey 將此次發布描述為研究預覽,並將在其基礎世界模型內邁向多代理人互動的發展軌跡視為未來工作,其中 PROWL 被列為其正在擴展的研究主線,而 Odyssey-3 則被指為最終目標。
對任何打算以 Agora-2 為基礎進行開發的人來說,這點很重要,因為現今實際的答案是:你辦不到——無論是透過我們,還是透過其他任何人的託管端點。OrcaRouter 不提供 Agora-2、Agora-1 或 Odyssey-3;這些模型路由並不存在於我們的目錄中。我們的平台確實承載的,是可能圍繞著一個學習世界(learned world)建構的其餘部分:一個涵蓋 200 多種模型的單一端點,以各供應商的定價表價格收費、零加成,因此當供應商調降價格時,變更當天就會在此上線,而一個路由層,能在供應商效能衰退時自動將請求容錯移轉。如果你最終是用某個模型來產生關卡配置、撰寫政策程式碼,或為錄製的遊玩過程加上字幕,那才是我們真正幫得上忙的部分。
看什麼
Agora-2 是一個真實的成果,但也有一個真實的但書,而這兩者很容易混淆。這項成果是:一個共享、持久的多環境世界可以從一個錄製的遊玩資料集中,為二十名參與者進行模擬與渲染,並且 Odyssey 能指出使其成功的具體設計決策——顯式狀態、結構化條件前綴、微小模擬模型。但書在於,論文本身的第8節將即時延遲、持續幀率、跨環境轉移與誤差累積列為未評估。除非有人發表來自真實四人遊戲場次的幀率追蹤記錄,否則誠實的總結是:Agora-2 證明了架構,但體驗仍未經測量。
第二件值得注意的事是發展方向。Odyssey 自身的框架將 Agora-2 定位為把多智能體互動放進基礎世界模型的一步,並以 PROWL 作為研究擴展、Odyssey-3 作為具名目標。若此事成真,有趣的問題就不再是世界模型能否承載二十名參與者,而是世界模型能否把他們帶進一個它從未受訓過的世界——而這正是當前報告拒絕回答的遷移問題。

