为 Agora-2 对比 MiniMax M3 生成的标题卡,副标题为“每位参与者一块 GPU,还是每百万 token 十三美分”。三张卡片:“MiniMax M3:每 1M $0.30/$1.20,缓存 $0.06”;“MiniMax M3:AA 指数 29,1M 上下文,开放权重”;“Agora-2:每个视图一块 RTX PRO 4500,未公布价格”。页脚写着“MiniMax M3 数据来自 Artificial Analysis;Agora-2 为厂商自报且未经复现。”
Guides & Insights

Agora-2 对比 MiniMax M3:每位参与者一块 GPU,还是每百万 token 十三美分

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

运行一群智能体的两种方式,以两种不同的货币计价。MiniMax M3每百万输入 token 收费 0.30 美元,每百万输出 token 收费 1.20 美元——这样的费率让一千个智能体的实验变成一笔普通开支,而不是一轮融资。Agora-2,这个多智能体世界模型,由Odyssey于 2026 年 9 月 21 日预览,其成本是每个参与者视角一块 NVIDIA RTX PRO 4500:四人会话要跑在四块 GPU 上,每块卡上运行一个渲染模型,生成该玩家的 640×480 视角,而这四块卡中还有一块同时承载共享模拟和十六个自主智能体策略。MiniMax M3 的数字是按 token 计算的,随你的智能体思考量的多少而伸缩。Agora-2 的数字是按"眼球"计算的,随你放入这个世界的同时参与者数量而伸缩。把二者相比,就是拿推理预算和渲染预算相比,而对任何计划在 2026 年做多智能体研究的人来说,这恰恰是值得去做的有用之事。

账本的代币方面

MiniMax M3 是 MiniMax 的开权重旗舰模型,于 2026 年 5 月 31 日发布:一个拥有 4280 亿参数的稀疏混合专家模型,每个 token 约激活 230 亿参数,上下文窗口为 1,048,576 个 token,其中 MiniMax 保证 512K 可用,支持文本、图像和视频输入,在 Artificial Analysis Intelligence Index v4.3.2 上得分为 29。据厂商数据,它在 BrowseComp 上报告为 83.5,在 BankerToolBench 上为 76.1——这些是 MiniMax 自己的数字,此处未经复现——而 Artificial Analysis 测得它的输出速度为每秒 145 个 token,在该榜单上位列第十快。

不过,对于智能体集群而言,真正相关的数字是缓存读取费率:每百万缓存 token 0.06 美元,仅为输入价格的五分之一。智能体循环以前缀为主导——相同的系统提示、相同的工具 schema、相同的不断累积的历史记录,每一轮都会重新发送——因此,对于一个循环的大部分 token 来说,其实际成本远更接近 0.06 美元,而非 0.30 美元。正是这种算术,使得 METR 在 OpenAI 2026 年 7 月 ExploitGym 评估中所记录的那种 1,200 个智能体规模的运行,成为研究团队真正能够复现、而不只是读到的东西。

账簿中GPU那一侧

Agora-2 的成本结构在其自己的实现附录中披露,具体得令人耳目一新。每个视图一张 RTX PRO 4500 Blackwell Server Edition。四人会话则用四张。这些显卡以每秒十五次潜在更新和每秒三十个显示帧、分辨率为 640×480 为目标生成每位参与者的视图,而仿真以 30 Hz 的 tick 推进。报告还给出了相关工作的训练规模:跨 32 块 B200 GPU 的有效全局批大小为 128。

换算成与 MiniMax M3 相同的单位,就是每个并发参与者对应一块数据中心 GPU,外加共享模拟搭在其中一块上运行。这是一种固定成本,不在乎你的智能体思考多久,也不会在它们安静下来时减少。由此会产生两个后果,而它们指向相反的方向。在参与者数量少、每个智能体推理量大的情况下,token 模型显然更便宜——你只为思考花几分钱,而房间里的第二个智能体不产生任何费用。在参与者数量多、交互密集的情况下,算术就反过来了:共享世界中的二十个并发参与者就是二十块 GPU,而这个数字不会随着每个参与者花费的 token 数量而增长。

• 成本单位 — Agora-2 每位参与者观看需一块 RTX PRO 4500,而 MiniMax M3 为每 100 万 tokens $0.30/$1.20

• 缓存读取 — Agora-2 不适用,不计 token 费用;而 MiniMax M3 每 1M 缓存收费 $0.06

• 独立评分 —— Agora-2 无公布数据,对比 MiniMax M3 AA Intelligence Index 29(v4.3.2)

• 上下文 — Agora-2 共享状态加有界逐视图历史,对比 MiniMax M3 的 1,048,576 tokens,保证 512K

• 输出 — Agora-2 640×480 视频,目标帧率 30 fps,对比 MiniMax M3 文本

• 获取方式 — Agora-2 浏览器预览,无 API,无权重;相较之下 MiniMax M3 开放权重、社区许可证、API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

为什么这两种成本不能相互替代

把这理解为非此即彼很容易,但它并非如此。MiniMax M3 是一个策略大脑:它读取部分可观测的局势,进行推理,调用工具并发出动作。Agora-2 则是一个环境,在其中动作产生的后果对其他参与者可见——一个模拟模型,用于预测各方的组合动作如何改变共享状态;一个世界服务器,负责应用这些动作;以及按视角渲染的渲染器,让每个参与者都能从自己的视角看到同一个世界。Odyssey 的十六个自主实体并不由任何语言模型驱动;它们是通过强化学习训练的循环标量策略与空间策略,消费十六步的观测历史,并每四个模拟 tick 行动一次。这一设计选择正是关键所在。在每秒三十个 tick 的频率下,决定该做什么是一个控制问题,而控制问题要通过训练一个小型策略来解决,而不是通过调用 API。

所以,对一个正在规划多智能体工作的团队来说,诚实的表述是:这些东西处在不同的层,而每一层你都得单独做预算。推理层便宜、有弹性,你可以货比三家。而环境层,如果你想要的不是游戏引擎,那它目前还是一个研究预览版,带着一块 GPU 形状的资源占用,并且没有公开的 API。这两个事实都还足够新——M3 从五月起,Agora-2 从九月起——以至于几乎还没有人对这个组合有任何成本模型。

什么是已验证的内容,什么是目标

MiniMax M3 的独立评分、上下文窗口、模态和价格都是已公布的事实,如今即可查证。其 BrowseComp 和 BankerToolBench 数据为厂商自行报告,你在引用它们时应始终标明这一点。

Agora-2 的数字完全来自 Team Odyssey 的技术报告,公司以外没有人复现过。其渲染结果——在三十段监控片段上,结构化前缀渲染器达到 30.11 dB PSNR,而 VAE 基线为 20.67 dB——是完整系统之间的比较,且训练预算并不对等,正如报告本身所指出的。其相比交叉注意力实现的 45.8% 去噪器时间缩减,来自在合成输入上随机初始化的去噪器,衡量的是执行成本而非图像质量。而其局限性部分明确说明,每秒十五次更新和每秒三十帧的速率只是目标;实时多智能体交互期间的持续帧率和输入到显示延迟“尚未得到定量评估”;长时程视觉质量、跨视角一致性和端到端动作遵循度仍未被评估;该环境需要一个带插桩的引擎,具有显式几何和固定的外观词汇表;并且超出训练域的迁移尚未测试。任何基于每个视角一块 GPU 构建成本模型的人,都应该先读那一节,因为每块 GPU 的吞吐量恰恰是尚未被测量的东西。

呼叫

如果你正在构建智能体集群——众多模型、长循环、工具调用、无渲染——MiniMax M3 是规模化实现这一目标最经济可靠的途径,而缓存读取价格才是决定你账单的数字。它在 OrcaRouter 上按 MiniMax 自身的标价路由,零加价,因此 $0.06 的缓存价格就是你实际支付的费用,并且在某个端点运行中途性能下降时可跨供应商故障转移。具体到集群场景,直通定价比往常更为重要:对缓存 token 收取的经销商利润,是乘以每个智能体每一轮次的利润。

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2 不是你可以路由到的东西——没有 API、没有价格、也没有权重,只有 Odyssey 的浏览器预览——而且我们不托管它。它实际上就是第一个共享世界模拟器,专门为了让许多参与者——人类和合成体——能够在受控条件下被观察互动而构建,而它下面的报告异常坦率地说明了它目前距离一个产品还有多远。如果你的问题是大规模推理,MiniMax M3 现已可用且便宜。如果你的问题是当一千个这样的推理者共享一个世界时会发生什么,Odyssey 已经建好了竞技场,把困难的测量留给别人去做。