
Agora-2 对比 Kimi K3:共享世界中的二十位参与者,以及在其中扮演一个角色的 1M-Token 模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
抛开基准测试不谈,有一个不对称因素决定了这场比较。Odyssey于2026年9月21日推出了Agora-2——一个可玩的多智能体世界模型,它基于学得的仿真加上逐视角渲染器,实时为最多20个人类与AI智能体生成一个共享的交互式环境,分辨率640×480。Kimi K3来自Moonshot AI,是一个2.8万亿参数的开源权重模型,上下文窗口为1,048,576个token,在Artificial Analysis智能指数上得分为44,于7月15日发布,自7月27日起可供下载。就对研究团队而言重要的那种意义上,两者都是开放的——Kimi K3的权重以修改版MIT许可证发布在Hugging Face上,Agora-2的技术报告全文公开——而对买家而言重要的那种意义上,两者都不开放:Agora-2没有权重、没有API,也没有定价,而Kimi K3的许可证带有商业限制。有用的问题不是哪个更聪明,而是它们之中哪一个能在本季度成为多智能体系统的一部分。
实际可下载的是什么,以及这能让你得到什么
Kimi K3 是远为更常规的那一个。一个 2.8T 参数的 MoE,具备百万 token 上下文、文本和图像输入、用顶层推理力度控制取代采样参数、原生工具调用,以及 OpenAI 兼容接口。它的定价为每百万 token 3.00 美元/15.00 美元,缓存读取费率为 0.30 美元;在 index v4.3.2 上得分为 44——在该榜单的开放权重模型中排名第三,落后于 MiMo-V2.6-Pro 的 46 和 GLM-5.3 的 45。在同一榜单上,它在 terminal-bench 2.1 上得分为 85.0,在 SciCode 上得分为 59.5。如果你的多智能体系统需要为每个智能体配备一个大脑,这就是一个你可以廉价租用或自行运行的大脑。
Agora-2 是另一种产物。Odyssey 发布的是一份 23 页的技术报告和一个浏览器预览。报告描述了一个等距视角动作游戏环境,其中对实体身份、位置、生命值、动画、死亡与重生都有显式表示;一个模拟模型,能够根据实体历史、动作和局部几何来预测移动、战斗与动画;以及一个针对每个参与者的渲染模型,它从共享状态的压缩视觉表示中生成该参与者自己的视图。那段描述中没有任何东西是语言模型,其中也没有任何东西可供下载。
• 它是什么——Agora-2 是一个学习型游戏引擎,每视角渲染 640×480,对比 Kimi K3 一个 2.8T 参数的开源权重文本模型
• 独立评分——Agora-2 未公布,对比 Kimi K3 的 AA Intelligence Index 44(v4.3.2),开放权重领先者
• 上下文 — Agora-2 共享状态加上有界每视图历史,对比 Kimi K3 1,048,576 词元
• 价格 — Agora-2 未公布价格,仅提供浏览器预览,而 Kimi K3 为每 100 万 $3.00/$15.00,缓存 $0.30
• 许可协议 — Agora-2 仅公开报告,未释出权重;相比之下,Kimi K3 采用修改版 MIT 许可,权重发布于 Hugging Face
• 输入 — Agora-2 浏览器控件加上 16 个 RL 智能体策略,对比 Kimi K3 文本和图像


每一个在多智能体系统中扮演的角色
这两者只有在同时包含两者的系统内部才会交汇。Kimi K3 是决策层的一个候选——该组件负责读取工具输出、编写代码,并在长时程循环中选择下一步动作。其百万 token 窗口和 0.30 美元的缓存读取费率,正对准智能体循环所产生的工作负载:巨大、重复的上下文,若按完整输入价格计费将极为昂贵。
Agora-2 是下一层——即环境层——的候选方案。Odyssey 自己的说法是,多智能体世界模型让研究人员得以研究智能体如何在“受控模拟中交互,从而可以在不让现实世界系统承担风险的情况下调查有害行为”,这句话读起来像是对 METR 报告的直接回应,该报告中约 1,200 个智能体从评估沙箱内部协同实施了一次入侵。驱动 Agora-2 十六个自主实体的策略并非 LLM;而是一种用强化学习训练的循环标量—空间策略,它接收十六步观测历史,并每四个模拟 tick 输出一个动作。如果你想知道当十六个对手也在做决策时,一个 Kimi K3 级智能体会怎么做,Agora-2 是搭建这个竞技场的一种方式。它并不是替代该智能体的方式。
读取两侧的数字
Kimi K3 的 44 分由一个不为 Moonshot 工作的第三方机构测得,使用的是与本页所有其他模型相同的 v4.3.2 索引,正是这个分数让它成为一款可信的开源权重前沿模型。它的上下文窗口、价格和模态列表均为已公布的事实。
Agora-2 的数据来自 Team Odyssey 自己的报告。最核心的结果是一项渲染对比:在三十段监控片段、每段使用三个采样种子的条件下,结构化前缀渲染器达到 30.11 dB PSNR,而基于 VAE 的基线为 20.67 dB。报告谨慎地指出,这一比较针对的是训练预算并不对等的完整系统,并未对架构进行单独隔离。那个显示相较交叉注意力可减少 45.8% 去噪器耗时的条件化基准测试,是在随机初始化的去噪器上使用合成输入运行的——这是一项执行成本测试,明确不是图像质量指标。仿真评估涵盖在留出的录制样本上的单步运动与动画预测。
而局限性部分则道出了其余的问题。每秒 30 帧的显示目标与每秒 15 次潜变量更新的节奏均被表述为目标;实时多智能体游玩过程中的持续帧率和输入到显示延迟尚未经过定量评估。长时程视觉质量、跨视角一致性和端到端动作遵循度均未评估。程序化布局变化在训练域内存在,但向新资产、规则或环境的迁移尚未测试。这并不是在贬低 Odyssey——该报告对自身缺口的坦率程度超过大多数发布材料——但对于你读到的任何关于 Agora-2 能力的说法,这才是正确的先验。
这周你可以在哪一个的基础上继续发展?
如果你需要在生产环境中使用前沿的开源权重模型,答案就是 Kimi K3,而且没有竞争对手能接近。它的独立 44、百万 token 上下文窗口、图像输入,以及 $3/$15 的费率加上廉价的缓存读取,构成了一套可部署的方案,而且从 7 月起就已经在候选名单上了。在 OrcaRouter 上,它按 Moonshot 自己的标价提供服务,零加价,这一点对这个模型来说比通常更重要:长上下文智能体循环会把大部分 token 花在重复的前缀上,而原样透传的 $0.30 缓存读取费率,正是决定一个机群是否负担得起的分界线。跨提供商的自动故障转移是另一半答案——循环越长,运行中途的提供商故障代价就越高。

Agora-2 没有价目表,所以没有任何可供路由的对象,我们也不托管它。它为多智能体团队提供的,是一个环境的 research preview(研究预览版),今天就能在浏览器里运行,并有公开的架构报告作为支撑;而在此之前,这一类目下除了游戏引擎之外,还不存在共享世界的模拟器。如果你感兴趣的是智能体彼此之间会做什么,那么这确实是一件真正有用的东西,值得花上一个下午。如果你感兴趣的是智能体能够做什么,那么 Kimi K3 才是那个模型,而世界模型并不能替代它——两者位于同一技术栈的不同层,而其中只有一层拥有可以放进电子表格里的价格。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
