OrcaRouter 模型雷达主视觉卡片,用于 MiMo-V2.6-Pro 与 Claude Opus 5 的对比,副标题为“五个指数点。二十一倍的价格。”,每个模型各占一个面板。
Guides & Insights

MiMo-V2.6-Pro 对比 Claude Opus 5:便宜 21 倍,指数落后 5 分

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Xiaomi MiMo-V2.6-Pro 和 Claude Opus 5 是同一笔交易的两端,而这笔交易是有代价的。在 Artificial Analysis Intelligence Index v4.3.2 上,Claude Opus 5(最大努力)得 51 分,Xiaomi MiMo-V2.6-Pro 得 46 分。在价目表上,Claude Opus 5 每百万输入 token 收费 $5.00,每百万输出 token 收费 $25.00;MiMo-V2.6-Pro 则为 $0.43 和 $0.87。做个除法,答案是输入 11.6 倍、输出 28.7 倍——而在 Artificial Analysis 为两者发布的混合费率上是 21 倍。五个指数点要花二十一倍的钱。这到底是划算还是浪费,完全取决于你的工作负载如何利用那第五个点,而大多数团队在真正投入之前从未弄清楚这一点。

这两个模型,说白了。

Claude Opus 5 是 Anthropic 的专有旗舰模型,于 2026 年 7 月 24 日发布,拥有 100 万 token 上下文窗口,参数量未披露。Xiaomi MiMo-V2.6-Pro 是一个稀疏混合专家模型,总参数量为 1.02 万亿,激活参数为 420 亿,拥有 100 万 token 上下文窗口,原生支持文本、图像、视频和音频多模态,并公开发布了采用 MIT 许可证的权重。

• 权重 — MiMo-V2.6-Pro 采用 MIT 许可、可下载;Claude Opus 5 为专有模型,仅提供 API

• 参数 — MiMo-V2.6-Pro 总计 1.02T / 激活 42B;Claude Opus 5 未披露

• 上下文 — 两者均为 100 万 token;Claude Opus 5 在 Messages API 上的输出上限为 128K,在 Batch API 上为 300K

• 模态支持 — MiMo-V2.6-Pro 可接受文本、图像、视频和音频;Claude Opus 5 公布的输入范围为文本和图像

• 标价 — MiMo-V2.6-Pro 每 100 万 tokens 0.43 美元 / 0.87 美元;Claude Opus 5 5.00 美元 / 25.00 美元

• 缓存 — MiMo-V2.6-Pro 列出了 99% 的缓存折扣;Claude Opus 5 的缓存读取价格为每 100 万 0.50 美元,写入价格为 6.25 美元,TTL 为 5 分钟

• 每个 Intelligence Index 任务的实测成本 — MiMo-V2.6-Pro $0.13;Claude Opus 5 $5.86

• 服务性能 — MiMo-V2.6-Pro 每秒输出 134.3 个 token,首 token 延迟 2.15 秒;Claude Opus 5 每秒 57.9 个 token

最后那一对才是真正被忽略的。更便宜的模型同时也是更快的那个——在输出吞吐量上快 2.3 倍——因为它运行在小米及其合作伙伴掌控的硬件上,可以激进地做批处理。而以最高推理强度运行的 Claude Opus 5 是一个推理模型,每个 token 做的工作更多;速度差距不是缺陷,而是不同的产品。但这确实意味着,便宜那条车道并不是用延迟来换取折扣。它是用五个百分点的指数,以及在那第五个百分点所栖身的长尾任务上来换取折扣的。

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

这五个点究竟在哪里

在由十项评估组成的综合评分上,五分差距并非均匀分布,而综合得分掩盖了真正重要的东西。两个模型都在相同的 v4.3.2 套件上运行,该套件包括 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。已发布的页面没有分别列出两个模型在各评估项上的得分,这是本次比较双方都存在的一个真实局限,值得直说,而不是粉饰掩盖。

公开记录所显示的是方向性的。Claude Opus 5 在最大努力模式下,于 v4.3 套件中的 Terminal-Bench 4.0 上得分 49.0%,落后于 GPT-6 Astra 的 59.1% 和 Claude Fable 5.1 的 52.0%。在 AutomationBench-AA 上,Opus 5 在 28.3% 的工作流中完成了全部目标且未违反护栏,相比之下 GPT-6 Astra 为 41.6%,Fable 5.1 为 32.1%。这些是硬核的智能体指标,而它们恰恰是五分综合差距最不可能均匀分布的类别——MiMo-V2.6-Pro 自身的指数条目并未公布可比的智能体细分数据。

与此同时,两家公司各自公布的厂商数据彼此并不可比,而其中的原因值得直言不讳地讲清楚。Anthropic 的发布材料报告 SWE-bench Verified 为 96.0%,SWE-bench Pro 为 79.2%;有追踪者指出,Opus 5 发布时并未提供独立的 SWE-bench 条目,也没有经过独立审计的 SWE-bench Verified 数据。小米的材料则报告 MiMo-V2.6-Pro 在其强化学习运行过程中,于 DeepSWE v1.1 上从 58.4 提升到 72.57,依据的是小米自有的测试框架、使用 mini-swe-agent、并取三次运行的平均值,且未提交至公开的 DeepSWE 榜单。两套厂商测试框架、两个不同任务,毫无重叠。把 96.0% 和 72.57 并列在一起并据此得出结论,等于凭空发明一种并不存在的比较。

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

成本比较,正确做法

按 token 计算的算术低估了这一差距,因为两个模型完成同一项工作所消耗的 token 数量并不相同。Artificial Analysis 测量了各自运行完整 Intelligence Index 的实际成本:MiMo-V2.6-Pro 为 0.13 美元,Claude Opus 5 为 5.86 美元。在受控且完全相同的任务集上,这是 45 倍的差距,而且这是现有最公平的单一数字,因为两者的测量方式完全一致。

现在拿一个合理的生产循环来对照一下。一次30步的智能体运行,每步读取200,000个token的上下文、写入2,000个token,那么每次运行就是600万输入token和60,000输出token。按 Claude Opus 5 的标价,这是 $30.00 的输入和 $1.50 的输出——在没有任何缓存的情况下,每次运行 $31.50。在 MiMo-V2.6-Pro 上,则是 $2.58 的输入和 $0.05 的输出——$2.63。有了两家厂商都提供的缓存折扣,两种模型的输入侧都会塌缩,而比例只是移动、而非消失:便宜模型上99%的缓存折扣,对比昂贵模型上 $0.50 的缓存读取,在上下文密集的循环中,昂贵模型仍然领先一个数量级。

这正是支持采用低成本通道、反对全面替换的完整论据。如果你的工作负载是长期运行的智能体循环,会反复读取同一上下文数百次,那么单次运行的成本差异绝不是可以四舍五入忽略的小数——它决定了一项功能究竟能按用户负担得起地运行,还是根本做不到。这就是把 MiMo-V2.6-Pro 部署在大部分流量前面的理由。但这并不意味着要删掉 Claude Opus 5,因为第五个指数点能收回成本的那些任务,按定义恰恰是廉价模型一旦失败代价高昂的任务。

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

这里的路由决策是什么样的

Claude Opus 5 可以通过一个 OrcaRouter 密钥,以提供商目录价、0% 加价的方式接入,即anthropic/claude-opus-5,而那些你会拿来与它对比的前沿模型,也同样位于这同一个密钥之下。由于我们按提供商的目录价原样透传、不附加任何加价,因此无论哪一方的厂商价格发生变动,当天就会在我们这边同步生效,而无需等待重新报价。真正有意思的地方在于路由 DSL:你可以把这两个模型组合成一次调用,而不是在二者之间做选择——把工作负载的大头送进便宜的那条通道,再把长尾部分(自检未通过的任务,或匹配某个复杂度谓词的任务)路由到昂贵的那条。故障转移则是另一半。Claude Opus 5 的提供商覆盖范围很广;而在 Artificial Analysis 抓取数据时,MiMo-V2.6-Pro 仅由一家 API 提供商上架,对于一个你要放进生产链路的模型来说,这是一条过于单薄的路由。路由器能够回退,才让便宜通道变得可以放心采用。

值得直说,因为很容易想当然地以为相反:我们并不托管 MiMo-V2.6-Pro。如今要用上它,意味着得通过 Xiaomi 自己的平台,或某个将其列入目录的第三方平台。这里的路由论点关乎的是,你如何把这样的模型与我们确实提供的模型搭配使用,而不是声称它也是我们提供的模型之一。

该选哪一个

当任务的失败成本远超 token 成本,以至于五个指数点的差距都算得上廉价的保险时,就选 Claude Opus 5——长周期的智能体工作、伴随真实副作用,错误调用比慢一步更糟的工具调用场景,以及任何你已经花钱请人检查输出的场合。每指数任务 5.86 美元这个数字并不是回避它的理由;那就是这一档位的价格,而这一档位自有其存在的道理。

当用量是制约因素时,当工作负载上下文繁重且重复性强时,当你希望将权重放在自己的基础设施中时——MIT 许可证允许商业部署、修改和进一步训练——或者当你正在构建的产品,其单位经济效益只有在每千 token 五分之一美分时才成立时,选择 MiMo-V2.6-Pro。其 134.3 tokens/秒的速度使其能够胜任交互式使用,而大多数万亿参数开源模型做不到这一点。

如果有路由器,两个都选,因为对"哪个更好"最诚实的回答是:它们争夺的根本不是同一类请求。要避免的失败模式,是代价最高的那一种:因为最显眼的 21 倍比例就统一采用便宜模型,到第三个月才发现某一类特定请求必须用贵的那个,而且没有任何路径能把它路由过去。第二种失败模式正好相反——为一个 46 索引模型也能做到一模一样效果的摘要任务,付着 Opus 5 的费率。这两者都不是模型的问题,而是配置的问题,而配置恰恰是你在某个周二下午就能改掉的部分。