
MiMo-V2.6-Pro 对比 Claude Opus 5:便宜 21 倍,指数落后 5 分
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 636 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Xiaomi MiMo-V2.6-Pro 和 Claude Opus 5 是同一笔交易的两端,而这笔交易是有代价的。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Opus 5(最大努力)得 51 分,Xiaomi MiMo-V2.6-Pro 得 46 分。在价目表上,Claude Opus 5 每百万输入 token 收费 $5.00,每百万输出 token 收费 $25.00;MiMo-V2.6-Pro 则为 $0.43 和 $0.87。做个除法,答案是输入 11.6 倍、输出 28.7 倍——而在 Artificial Analysis 为两者发布的混合费率上是 21 倍。五个指数点要花二十一倍的钱。这到底是划算还是浪费,完全取决于你的工作负载如何利用那第五个点,而大多数团队在真正投入之前从未弄清楚这一点。
这两个模型,说白了。
Claude Opus 5 是 Anthropic 的专有旗舰模型,于 2026 年 7 月 24 日发布,拥有 100 万 token 上下文窗口,参数量未披露。Xiaomi MiMo-V2.6-Pro 是一个稀疏混合专家模型,总参数量为 1.02 万亿,激活参数为 420 亿,拥有 100 万 token 上下文窗口,原生支持文本、图像、视频和音频多模态,并公开发布了采用 MIT 许可证的权重。
• 权重 — MiMo-V2.6-Pro 采用 MIT 许可、可下载;Claude Opus 5 为专有模型,仅提供 API
• 参数 — MiMo-V2.6-Pro 总计 1.02T / 激活 42B;Claude Opus 5 未披露
• 上下文 — 两者均为 100 万 token;Claude Opus 5 在 Messages API 上的输出上限为 128K,在 Batch API 上为 300K
• 模态支持 — MiMo-V2.6-Pro 可接受文本、图像、视频和音频;Claude Opus 5 公布的输入范围为文本和图像
• 标价 — MiMo-V2.6-Pro 每 100 万 tokens 0.43 美元 / 0.87 美元;Claude Opus 5 5.00 美元 / 25.00 美元
• 缓存 — MiMo-V2.6-Pro 列出了 99% 的缓存折扣;Claude Opus 5 的缓存读取价格为每 100 万 0.50 美元,写入价格为 6.25 美元,TTL 为 5 分钟
• 每个 Intelligence Index 任务的实测成本 — MiMo-V2.6-Pro $0.13;Claude Opus 5 $5.86
• 服务性能 — MiMo-V2.6-Pro 每秒输出 134.3 个 token,首 token 延迟 2.15 秒;Claude Opus 5 每秒 57.9 个 token
最后那一对才是真正被忽略的。更便宜的模型同时也是更快的那个——在输出吞吐量上快 2.3 倍——因为它运行在小米及其合作伙伴掌控的硬件上,可以激进地做批处理。而以最高推理强度运行的 Claude Opus 5 是一个推理模型,每个 token 做的工作更多;速度差距不是缺陷,而是不同的产品。但这确实意味着,便宜那条车道并不是用延迟来换取折扣。它是用五个百分点的指数,以及在那第五个百分点所栖身的长尾任务上来换取折扣的。

这五个点究竟在哪里
在由十项评估组成的综合评分上,五分差距并非均匀分布,而综合得分掩盖了真正重要的东西。两个模型都在相同的 v4.3.2 套件上运行,该套件包括 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。已发布的页面没有分别列出两个模型在各评估项上的得分,这是本次比较双方都存在的一个真实局限,值得直说,而不是粉饰掩盖。
公开记录所显示的是方向性的。Claude Opus 5 在最大努力模式下,于 v4.3 套件中的 Terminal-Bench 4.0 上得分 49.0%,落后于 GPT-6 Astra 的 59.1% 和 Claude Fable 5.1 的 52.0%。在 AutomationBench-AA 上,Opus 5 在 28.3% 的工作流中完成了全部目标且未违反护栏,相比之下 GPT-6 Astra 为 41.6%,Fable 5.1 为 32.1%。这些是硬核的智能体指标,而它们恰恰是五分综合差距最不可能均匀分布的类别——MiMo-V2.6-Pro 自身的指数条目并未公布可比的智能体细分数据。
与此同时,两家公司各自公布的厂商数据彼此并不可比,而其中的原因值得直言不讳地讲清楚。Anthropic 的发布材料报告 SWE-bench Verified 为 96.0%,SWE-bench Pro 为 79.2%;有追踪者指出,Opus 5 发布时并未提供独立的 SWE-bench 条目,也没有经过独立审计的 SWE-bench Verified 数据。小米的材料则报告 MiMo-V2.6-Pro 在其强化学习运行过程中,于 DeepSWE v1.1 上从 58.4 提升到 72.57,依据的是小米自有的测试框架、使用 mini-swe-agent、并取三次运行的平均值,且未提交至公开的 DeepSWE 榜单。两套厂商测试框架、两个不同任务,毫无重叠。把 96.0% 和 72.57 并列在一起并据此得出结论,等于凭空发明一种并不存在的比较。

成本比较,正确做法
按 token 计算的算术低估了这一差距,因为两个模型完成同一项工作所消耗的 token 数量并不相同。Artificial Analysis 测量了各自运行完整 Intelligence Index 的实际成本:MiMo-V2.6-Pro 为 0.13 美元,Claude Opus 5 为 5.86 美元。在受控且完全相同的任务集上,这是 45 倍的差距,而且这是现有最公平的单一数字,因为两者的测量方式完全一致。
现在拿一个合理的生产循环来对照一下。一次30步的智能体运行,每步读取200,000个token的上下文、写入2,000个token,那么每次运行就是600万输入token和60,000输出token。按 Claude Opus 5 的标价,这是 $30.00 的输入和 $1.50 的输出——在没有任何缓存的情况下,每次运行 $31.50。在 MiMo-V2.6-Pro 上,则是 $2.58 的输入和 $0.05 的输出——$2.63。有了两家厂商都提供的缓存折扣,两种模型的输入侧都会塌缩,而比例只是移动、而非消失:便宜模型上99%的缓存折扣,对比昂贵模型上 $0.50 的缓存读取,在上下文密集的循环中,昂贵模型仍然领先一个数量级。
这正是支持采用低成本通道、反对全面替换的完整论据。如果你的工作负载是长期运行的智能体循环,会反复读取同一上下文数百次,那么单次运行的成本差异绝不是可以四舍五入忽略的小数——它决定了一项功能究竟能按用户负担得起地运行,还是根本做不到。这就是把 MiMo-V2.6-Pro 部署在大部分流量前面的理由。但这并不意味着要删掉 Claude Opus 5,因为第五个指数点能收回成本的那些任务,按定义恰恰是廉价模型一旦失败代价高昂的任务。

这里的路由决策是什么样的
Claude Opus 5 可以通过一个 OrcaRouter 密钥,以提供商目录价、0% 加价的方式接入,即anthropic/claude-opus-5,而那些你会拿来与它对比的前沿模型,也同样位于这同一个密钥之下。由于我们按提供商的目录价原样透传、不附加任何加价,因此无论哪一方的厂商价格发生变动,当天就会在我们这边同步生效,而无需等待重新报价。真正有意思的地方在于路由 DSL:你可以把这两个模型组合成一次调用,而不是在二者之间做选择——把工作负载的大头送进便宜的那条通道,再把长尾部分(自检未通过的任务,或匹配某个复杂度谓词的任务)路由到昂贵的那条。故障转移则是另一半。Claude Opus 5 的提供商覆盖范围很广;而在 Artificial Analysis 抓取数据时,MiMo-V2.6-Pro 仅由一家 API 提供商上架,对于一个你要放进生产链路的模型来说,这是一条过于单薄的路由。路由器能够回退,才让便宜通道变得可以放心采用。
值得直说,因为很容易想当然地以为相反:我们并不托管 MiMo-V2.6-Pro。如今要用上它,意味着得通过 Xiaomi 自己的平台,或某个将其列入目录的第三方平台。这里的路由论点关乎的是,你如何把这样的模型与我们确实提供的模型搭配使用,而不是声称它也是我们提供的模型之一。
该选哪一个
当任务的失败成本远超 token 成本,以至于五个指数点的差距都算得上廉价的保险时,就选 Claude Opus 5——长周期的智能体工作、伴随真实副作用,错误调用比慢一步更糟的工具调用场景,以及任何你已经花钱请人检查输出的场合。每指数任务 5.86 美元这个数字并不是回避它的理由;那就是这一档位的价格,而这一档位自有其存在的道理。
当用量是制约因素时,当工作负载上下文繁重且重复性强时,当你希望将权重放在自己的基础设施中时——MIT 许可证允许商业部署、修改和进一步训练——或者当你正在构建的产品,其单位经济效益只有在每千 token 五分之一美分时才成立时,选择 MiMo-V2.6-Pro。其 134.3 tokens/秒的速度使其能够胜任交互式使用,而大多数万亿参数开源模型做不到这一点。
如果有路由器,两个都选,因为对"哪个更好"最诚实的回答是:它们争夺的根本不是同一类请求。要避免的失败模式,是代价最高的那一种:因为最显眼的 21 倍比例就统一采用便宜模型,到第三个月才发现某一类特定请求必须用贵的那个,而且没有任何路径能把它路由过去。第二种失败模式正好相反——为一个 46 索引模型也能做到一模一样效果的摘要任务,付着 Opus 5 的费率。这两者都不是模型的问题,而是配置的问题,而配置恰恰是你在某个周二下午就能改掉的部分。
