
Agora-2:Odyssey 的可玩世界模型在四块 GPU 上运行 20 名参与者
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Agora-2把二十名参与者放进同一个模拟里,并称其为可玩的研究预览版。Odyssey 于 2026 年 9 月 21 日发布了它,帖子标题为《推出 Agora-2:推进多智能体世界模拟》,署名 Oliver Cameron,而流传开来的数字就是那二十。真正要紧的数字是它内部的分割。一个会话最多支持四名同时在线的人类控制者,外加十六个自主实体,而这两者并不是同一类参与者——四个人输入移动指令,十六个策略负责执行。这些策略由 Odyssey 自己训练,所用游戏关卡也出自它训练过的同一款游戏:论文称,这个世界是从《Diablo II》的录制画面中学习而来的。
受控参与者与模拟参与者之间的这一区分,正是 Agora-2 几乎所有有趣之处所在。也正因如此,大多数报道都会把这一点模糊掉,因为“20 名玩家”比“四名玩家和十六个学习型智能体共享一个在屏幕外仍持续存在的状态”读起来更简洁。Odyssey 推出的并不是一个硬加上多人模式的视频生成器。它更接近一台游戏服务器,只不过其物理、动画和渲染全都被学习型组件取代了,而它唯一真正的素材来源,是一组录制游玩的数据集。
二十个参与者是四个人和十六项政策
Odyssey 明确指出,Agora-2 支持的参与者数量是 Agora-1 的五倍,并且已从模拟单一环境转向模拟具有更长时域行为的多个环境。每个会话的形态如下:
• 人类控制者 — 最多 4 个同时,每个提供移动与动作输入
• 自主实体——每局 16 个,由学习到的怪物与同伴策略驱动,而非由玩家驱动
• 参与者总数 — 20 人共处同一个共享世界状态,这正是 Odyssey 主打的数字
• 环境 — 多个,较 Agora-1 所能模拟的单一环境有所增加
内容基础——Diablo II 的捕获内容,因此世界、资产和规则均继承自同一份录制语料库
• 发布形式——可玩的研究预览版,而非产品,不提供权重、无许可证、不收费
这十六个自主智能体并非摆设。Odyssey 的报告描述了分别训练怪物策略与同伴策略,评估计数也很具体:来自基础教师以及恢复和留存数据的 23,771 个最终阶段怪物策略样本,以及同伴策略的 128,005 个样本,分别对照 252 个评估回合和 24 个评估用例进行评分。正是这些策略让一场四人局显得热闹充实。它们也正是为什么参与者数量是一种设计选择,而不是容量声明的理由——十六是世界服务器被训练为在四名人类之外可承载的智能体数量,而不是它理论上能够容纳的数量。
该架构由一个小模型和一个大模型组成
Agora-2 将决定会发生什么的部分与决定它看起来什么样的部分分离开来,而两者之间的规模差距是论文中最引人注目的数字。仿真模型有 4,457,777 个参数——大约 446 万,四层宽,宽度 256,四个注意力头,四步历史窗口,十四个移动分支,以及一个单独用于朝向的头。渲染器是一个约十亿参数的流匹配 transformer,十六个块,宽度 2,048,其中五个块带有因果时间注意力,每次更新运行五个求解器步骤。
渲染器以 342 个词元的前缀为条件,而不是以原始世界为条件:
• 地图 — 144 个 token,围绕视点的 12×12 本地瓦片网格
• 实体 — 36 个令牌,其中四个用于用户控制的参与者,32 个用于其他实体槽位
• 瞬态效果 — 既非地图也非实体的效果占用 160 个 token
• 查看和名单 — 相机操作与会话名单各需一个令牌
• 每次更新 —— 300 个图像 token 关注那 342 个条件 token
• 编解码器 — 基于 RAE 的潜表示,将 2 帧转换为 15×20×32,然后在输出时使用 x264 CRF 18 或 NVENC QP 18
Odyssey 指出了这种条件化之所以采用如此结构的原因:一个学习得到的世界需要让实体属性保持在一种比任何特定摄像机都更持久的状态中。文章直白地说——由于实体属性独立于任何特定视角而得以保留,当实体不在画面中时,它们仍然可用。正是这句话将 Agora-2 与视频模型区分开来。一个仅基于近期帧进行条件化的生成器,在你转开视线的那一刻就会丢失那个怪物;而一个保留显式状态的世界模型则不会。

四块GPU买四个玩家
报告中的服务方案是 Agora-2 宣传最少的部分,但对任何想估算这样一个世界需要多少成本的人来说却最有用。Odyssey 针对四人会话的配置是四块 NVIDIA RTX PRO 4500 显卡:每块 GPU 运行一个渲染器,其中一块 GPU 还同时承载仿真模型和智能体策略。其标称目标是每秒 15 次潜变量更新,同时每秒显示 30 帧。
附录中的两个数字让这一配置变得具体。在165瓦下,团队测得对渲染器的一项改动带来了9.9%的推理减少——在每种实现3,200次调用中,从62.92毫秒降至56.69毫秒。而渲染器的训练同样具体:在4,232,000个片段上进行六万次更新,随后在4,332,800个片段上再进行六万次更新,AdamW学习率为1e-4,批量128,EMA 0.9999,在32块B200 GPU上运行。该语料库被逐项列出——1,200,000个全员战斗片段、2,016,000个分层特殊能力片段、504,000个尸体穿越片段、512,000个无自主实体的移动片段,以及100,800个首领传送门生命周期片段。
把这两段放在一起读,产品的轮廓就清晰了。渲染器是昂贵的那一半:参数量上高出三个数量级,服务时每位并发观众要占用一块 GPU,训练时要用三十二块 B200。模拟模型——真正决定世界里发生什么的那部分——只有四百五十万参数,比大多数嵌入表还小。Agora-2 是一个披着游戏引擎外衣的渲染问题。
已公布的数字,以及它们没有展示的一件事
按照 Odyssey 自己的说法,报告中的定量结果是对其自身设计选择的消融,而非竞争性基准分数,并且应当这样解读:
• 结构化前缀对比 VAE 基线——均方误差 0.001279、PSNR 30.11 dB,而基线为 0.010272 和 20.67 dB,提升 9.44 dB;在来自 30 个片段和 3 个随机种子的 90 次配对评估中
• 渲染器注意力——使用结构化前缀时,每两次帧的降噪器更新为 20.09 毫秒,而交叉注意力为 37.06 毫秒,池化 AdaLN 为 18.82 毫秒,降噪器部分减少了 45.8%,核心部分减少了 34.1%
• 50% 历史 dropout — 0.05695 流式误差和 0.19535 冷启动,而无 dropout 时为 0.06041 和 0.21082,且地图扰动保真度略差
• 模拟准确率——在运动分支预测上为 85.17%,在更难的阻塞示例子集上为 68.17%,在动画模式下为 95.84%,预测模式切换率为 7.49%,而记录值为 3.54%
这些数字中的每一个都是对照 Agora-2 的另一种配置来衡量的。它们没有一项是与已发布系统的对比,也没有一项描述实时游玩。报告第 8 节坦率地指出了这一差距。迁移到新的资产、规则或环境仍未经测试。误差会累积。独立生成的图像在外观、可见性或事件时序上仍可能不一致。而值得全文引用的一句话是:实时多智能体交互期间的持续帧率和输入到显示延迟尚未经过定量评估。上文中的每秒 15 次更新和每秒 30 帧是目标,而不是测量值。

预览所在的位置,以及它不包含的内容
可玩预览位于 Odyssey 自己的网站上,可通过演示地址 agora.odyssey.ml 访问,该地址会重定向到 agora.odyssey.systems。技术报告是同一份公告中链接的 PDF。未发布的内容与已发布的内容同样引人注目:没有模型权重,没有代码仓库,没有许可证,没有推理 API,也没有价格。Odyssey 将此次发布描述为研究预览,并将其基础世界模型内部迈向多智能体交互的发展轨迹视为未来工作,其中 PROWL 被列为它正在扩展的研究线索,Odyssey-3 则被称作最终目标。
这对任何计划基于 Agora-2 进行构建的人都至关重要,因为如今实际的答案是:你做不到——通过我们做不到,通过其他任何人的托管端点也做不到。OrcaRouter 不提供 Agora-2、Agora-1 或 Odyssey-3;这些模型路由在我们的目录中并不存在。我们平台真正承载的,是可能围绕一个学习到的世界而搭建的其余部分:一个覆盖 200 多个模型的单一端点,按各提供商的原价定价,零加价,因此当供应商下调价格时,这里当天就会生效,以及一个能在提供商性能下降时自动将请求故障转移的路由层。如果你最终要用某个模型来生成关卡布局、编写策略代码或为录制的游玩过程添加字幕,那正是我们真正能帮上忙的部分。
看什么
Agora-2 是一个真实的成果,也附带一个真实的限制条件,而两者很容易被混淆。成果在于,一个共享、持久、多环境的世界可以基于录制游玩语料库,为二十名参与者进行模拟和渲染,并且 Odyssey 能够指出使其奏效的具体设计决策——显式状态、结构化的条件前缀、一个微型模拟模型。限制条件在于,论文自己的第 8 节将实时延迟、持续帧率、跨环境迁移和误差累积列为未评估。在有人发布来自真实四人会话的帧率轨迹之前,诚实的总结是:Agora-2 证明了架构,却让体验仍未被衡量。
第二个值得关注的点是行进方向。Odyssey 自己的框架把 Agora-2 定位为迈向将多智能体交互纳入基础世界模型的一步,其中 PROWL 是研究层面的扩展,Odyssey-3 则是被点名的目标。如果这一切成真,那么有趣的问题就不再是一个世界模型能否承载二十个参与者,而变成一个世界模型能否把他们带入一个它从未被训练过的世界——而这恰恰是当前这份报告拒绝回答的迁移问题。

