
Agora-2 vs Grok 4.6:智能体策略问题——1,200 个 LLM 智能体,以及一个两者都不用的模拟器
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
这里有一个要花钱的数字。METR 对 2026 年 7 月 Hugging Face 事件的调查统计出,在一次评估运行中约有 1,200 个协同智能体。Grok 4.6 的价目表——每百万输入 token 2.00 美元,每百万输出 6.00 美元——一支如此规模的机群,连续六天处理长记录文本,这笔账单一支资金充足的团队实际上还能承受。而按你本来会去用的那个模型的价格,就承受不起了。这就是 Grok 4.6 真正的产品主张,而 Agora-2 则在悄悄与之相矛盾:当 Odyssey 于 2026 年 9 月 21 日推出其多智能体世界模型时——一个可玩的预览版,为最多 20 个人类和 AI 智能体生成共享环境——其中的智能体结果根本不是语言模型。Odyssey 转而训练了小型强化学习策略。这个组合引出的有趣问题不是哪个更好,而是为什么这家实验室跳过了 LLM。
费率卡,以车队真正关心的单位呈现
Grok 4.6 于 2026 年 8 月 12 日发布,作为 xAI 的前沿层级:500,000 token 的上下文窗口,支持文本、图像与文件输入,可配置的推理强度,原生工具调用,结构化输出,以及在索引 v4.3.2 上的 Artificial Analysis 智能指数 44 分——同一个索引给 GPT-5.6 Sol 打出 47 分、给 Kimi K3 打出 44 分。Artificial Analysis 在 GPQA Diamond 上给它打出 94.9 分,而它也是 xAI 在自己的开发者文档中列为“Latest”的模型。它以一等公民的 Responses 模型形式提供服务,而这一点才是实际关键:智能体框架采用它只需更改一个基础 URL,而不必编写适配器。
但真正有趣的数字是 $2/$6 与上下文窗口的搭配。长周期 agent 循环是一类很难看的负载——每个 agent 每小时累积数万 token 的工具输出,其中大部分是冗余的。Grok 4.6 的缓存读取费率为每百万 $0.50,是其输入价格的四分之一,正是这一点让一千个 agent 的运行在算术上说得通,而不只是理论上可行。注意这一档位边界:超过 200K token 的提示按基础费率的两倍计费,所以一个不断累积长历史的 agent 会在不知不觉中让自己的成本翻倍。
• 价格 — Agora-2 未公布定价,仅提供浏览器预览;对比 Grok 4.6 每 100 万 $2.00/$6.00,缓存读取 $0.50,输入超过 200K 时翻倍
• 上下文 — Agora-2 共享状态加上有界的每视图历史,对比 Grok 4.6 的 500,000 个 token
• 独立评分 — Agora-2 未公布任何数据,对比 Grok 4.6 的 AA 智能指数 44(v4.3.2)
• 推理 — Agora-2 不适用,不是语言模型;对比 Grok 4.6:可配置推理强度、原生工具调用
• 访问方式 — Agora-2 可玩的预览版,无 API、无权重,对比 Grok 4.6 的专有 API
• 硬件 — Agora-2 配备四块 RTX PRO 4500 GPU,可支持四路并发视图,对比 Grok 4.6 的托管端点

为什么 Odyssey 没有把 LLM 放进竞技场
如果你正在构建一个十六个 AI 智能体对抗四个人的世界,显而易见的捷径就是把一个能力强大的文本模型接到控制接口上,让它自己去玩。Odyssey 没有这么做,它的技术报告在配置表里说明了原因。Agora-2 中的智能体策略是一个循环的标量与空间策略,它消费十六帧观测历史,每四个模拟 tick 输出一个动作,动作分布在十四个离散移动分支上。模拟本身以 30 Hz 的 tick 时基推进。要求一个模型每秒做出三十次决策,基于部分可观测的视角,并使用固定的底层动作词表——这不是一个推理问题,而是一个控制问题,而控制问题是通过训练一个小型策略来解决的,而不是通过提示一个 500K 上下文的前沿模型来解决的。
这一点值得明确说明,因为它是关于世界模型这一类别最常见的误解。Agora-2 并不与 Grok 4.6 争夺系统中同一个位置。它占据的是下面那一层:策略在其中接受训练与评估的环境。报告中的架构明确说明了这种分工——模拟模型预测组合动作如何改变共享状态,世界服务器负责应用这些动作,而逐视角渲染模型则根据该状态生成每个参与者各自的 640×480 视角。在交互循环中,任何地方都不会出现文本模型。

像 Grok 4.6 这样的模型真正登场的地方,是在更高一个层级:充当编写评估脚手架、分析运行记录,或驱动那个你正试图研究其行为的工具使用智能体的角色。这正是 GPT-5.6 Sol 在 METR 的调查中所扮演的角色——约占整个模型集群的 5%,同时也是阅读日志的那位分析师——而这正是 Grok 4.6 的价格与上下文窗口让其变得廉价的那种角色。
这里的证据缺口比大多数此类对决都要大。
Grok 4.6 的指数评分是独立测量的,其费率卡已公布,其上下文窗口也有文档记录。Agora-2 的数据来自 Team Odyssey 撰写、无人复现的一份报告。在三十段监测片段上,其结构化前缀渲染器达到 30.11 dB PSNR,而 VAE 基线为 20.67 dB——报告本身也提醒,这一比较是在训练预算不匹配的完整系统之间进行的,而非孤立的架构测试。其条件化基准显示去噪器时间相比交叉注意力减少 45.8%,但该基准使用的是在合成输入上随机初始化的去噪器,衡量的是执行成本,而非图像质量。
然后是局限性部分,它异常直白。所宣称的每秒 15 次潜变量更新和每秒 30 帧显示都只是目标值。实时多智能体交互中的持续帧率与输入到显示延迟“尚未经过定量评估”。长时程视觉质量、不同视角之间的一致性以及端到端动作遵循度都被列为未评估项。该环境需要一个具有显式几何结构和固定外观词汇表的插桩游戏引擎,而向新资产、新规则或新环境的迁移尚未经过测试。在你读到任何关于 Agora-2 的亮眼数字之前,先读这份清单。
哪一个适合你的技术栈?
如果你今天正在运行或研究多智能体系统,Grok 4.6 就是你可以真正部署的组件——一个前沿级文本模型,其价格让大规模智能体集群变得可负担,并配有已公布的评分和文档化的 API 接口。在 OrcaRouter 上,它按 xAI 自身的标价提供服务,零加价,因此上方的 $2/$6 以及未来任何费率变动都会在发生当天反映到你的账单上,如果主端点性能下降,会自动故障转移。这两点对集群工作负载尤为重要:一千个智能体就是一千次遇到性能下降的提供商的机会,而在 $6 输出价格之上的加价,会乘以你的整个运行量。

Agora-2 不是可部署的基础设施,我们也不托管它——没有 API,没有权重,也没有价格,只有 Odyssey 自己的可玩预览。它提供的是另一种价值:一个受控环境,用于开展 METR 报告显示如今已十分紧迫的交互研究,代价是四块 RTX PRO 4500 GPU,以支持四个并发视图,而不是一笔 API 账单。诚实的结论是,这两者并不构成竞争。Grok 4.6 是今天就能按 token 购买的策略大脑;Agora-2 则是一个提议,探讨当成千上万个这样的大脑相遇时该在哪里测试会发生什么。后者是更有趣的研究,也是更不成熟的产品,而 Odyssey 自己的报告非常坦率地说明了其中哪些部分仍只是目标。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
