一张生成的标题卡,上面写着 MiMo-V2.6-Pro vs Grok 4.7,副标题是“每项任务便宜 29 倍”,其下方两侧还有“更慢”字样,标题上方有三个扁平线性图标,暗示对比的硬币堆、速度表和打开的挂锁。OrcaRouter 标志被合成在右下角。
Guides & Insights

Xiaomi MiMo-V2.6-Pro 对比 Grok 4.7:每任务成本低 30 倍,而两者都不快

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

小米 MiMo-V2.6-Pro 和 Grok 4.7 均于 2026 年 9 月 21 日发布,在 Artificial Analysis 智能指数 v4.3.2 上双双得分为 46,而且都被给出这些测量结果的页面称为"慢"——MiMo-V2.6-Pro 为每秒 43.6 个输出 token,而中位数是 67.1;Grok 4.7 在 xhigh 努力级别下为 40。真正让两者拉开差距的,是得到一次回答要花多少钱。评测方给出的单任务成本为:这个中国开源权重模型 0.13 美元,Grok 4.7 模型 3.74 美元,相差约 29 倍。这并非单价差异,或者说并不只是单价差异:Grok 4.7 的输出单价是每百万 token 6.00 美元,而对方为 0.87 美元,相差七倍;这个倍数中其余的部分,则来自两个模型为得出答案各自消耗了多少 token。

同一个月里,两个模型,基于同一个指数,取得同样的分数,定价却仿佛分属市场上不同的年代。有意思的问题不是哪一个胜出,而是那29倍差距中,哪一部分是你能真正绕开的——因为在这组对比里,两者之中恰好只有一个是今天就能买到的路线,而它正是那个贵的。

同一天,同样的比分,不同的动物

Grok 4.7 于 2026 年 9 月 21 日发布,每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,上下文窗口为 500,000 token,知识截止日期为 2026 年 5 月,缓存折扣 75%,支持文本和图像输入、文本输出。在以 xhigh 努力水平运行时,它在该指数上测得 46 分;在 Grok Build 测试框架中的 Coding Agent Index 上为 56 分;在 AA-Briefcase 上为 1,657 Elo —— 在该榜单上排名第四,落后于三个 Anthropic 的条目,而每任务成本约为 Claude Opus 5 的一半。

Xiaomi MiMo-V2.6-Pro 是一个稀疏混合专家检查点,总参数量 1.02 万亿、激活参数量 420 亿,采用 MIT 许可,支持 100 万 token 上下文,接受文本、图像、语音和视频输入并输出文本,每百万 token 价格为 0.43 美元和 0.87 美元,并提供 99% 缓存折扣,使热提示词下的有效输入费率几乎降至零。Artificial Analysis 在指数上将列为 114 个开放权重模型中的第一,在成本上列为 114 个中的第十二。它可通过三家 API 提供商访问。它不在我们的路由上,而且在提供商完成模型接入之前,我们不会将其列入模型列表。

唯一能决定它的一句话

• 每个索引任务成本 — MiMo-V2.6-Pro $0.13;Grok 4.7 $3.74 — 29 倍 • 输出费率 — MiMo-V2.6-Pro $0.87 / 1M;Grok 4.7 $6.00 / 1M — 6.9 倍 • 索引运行中的输出 token 量 — MiMo-V2.6-Pro 140M;Grok 4.7 240M,而中位数为 88M • 输出速度 — MiMo-V2.6-Pro 43.6 t/s;Grok 4.7 40 t/s — 两者均低于中位数 • 上下文窗口 — MiMo-V2.6-Pro 1M;Grok 4.7 500K • 权重 — MiMo-V2.6-Pro 采用 MIT 许可并可下载;Grok 4.7 为专有,仅提供 API

把前两条放在一起读,差距的形状就清楚了。按标价计算,两者在输出上相差 6.9 倍。在索引运行中,两者在单次回答成本上相差 29 倍。中间的放大因子是冗长程度:Grok 4.7 生成了 2.4 亿输出 token,而同类中位数为 8800 万,MiMo-V2.6-Pro 则生成了 1.4 亿。这意味着在 6.9 倍的费率惩罚之上,又叠加了 1.71 倍的 token 惩罚,而 1.71 × 6.9 = 11.8——距离 29 倍的其余差距来自输入端,在那里,MiMo-V2.6-Pro 的 99% 缓存折扣和 $0.43 的输入费率,对任何带有重复前缀的工作负载都起到了主要的拉动作用。

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

冗长是人们估算时遗漏的数字

成本模型通常基于价目表和假设的 token 数量构建。这里这两部分都是错的。价目表错了,因为缓存折扣不是可有可无的脚注——99% 对 75%,这决定了一个系统提示词是每次调用都让你花钱,还是几乎不花你什么钱。token 数量错了,因为两个模型在相同工作中输出的 token 数并不相同,而评估器测量了这种差异:2.4 亿对 1.4 亿,在相同基准上相差 1.71 倍。

这些都不是你能从规格表上直接读出的代理指标。Grok 4.7 的冗长度排名在其所属类别 210 个模型中排第 94 位;MiMo-V2.6-Pro 的成本排名在同类 114 个模型中排第 12 位。一个团队如果引用 Grok 4.7 的价目表,并假设工作负载是 token 中性的,那么其预测的每任务成本大约只有该指数实际支出的四分之一。修正方法也不是把指数成本当作你的估算——它衡量的只是一个基准测试的形态。而是在投入之前测量你自己在两侧的 token 数量,因为这两个模型之间的差距在纸面上是 6.9 倍,在实践中是 29 倍,而这两个数字中只有一个对你的流量来说是真实的。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

两者都很慢,而这并不是平局。

Artificial Analysis 测得 Grok 4.7 的输出速度为每秒 40 个 token,称其“属于最慢之列”;MiMo-V2.6-Pro 为 43.6,被称为“明显偏慢”。这两个读数足够接近,速度不该成为二者之间的决胜因素。但它们背后的中位数却并非如此:MiMo-V2.6-Pro 所属的开源权重阵营中位数为 67.1。两个模型都远低于这一水平,而且 MiMo-V2.6-Pro 的首 token 延迟为 3.17 秒,中位数则是 2.31 秒——真正让人难受的是这个数字,且是在交互式循环中,而非批处理场景。

所以,对延迟这一面诚实的总结是:便宜 29 倍并不能给你带来更快的产品,它带来的是一个更慢但成本更低的产品——而如果你的用户正盯着光标看,那 3.17 秒的等待可能比省下的 token 代价更大。对于过夜批处理任务、离线评估,或任何以小时为计时单位的流水线来说,这笔交易就是明摆着的,29 倍几乎等于白赚。

路由器在这种配对下能做什么、不能做什么

在这一组对比中,我们自己的目录确实是一边倒的,这一点值得坦诚说明。Grok 4.7 已在 OrcaRouter 上线,模型为 grok/grok-4.7,按提供商自家定价 $2.00 / $6.00,最大输出 450K,并提供兼容 OpenAI SDK 的端点 https://api.orcarouter.ai/v1 —— 所以,如果这项对比让你想把 xAI 的模型和其他所有模型放在同一个密钥下使用,这条路径今天就已经存在。小米 MiMo-V2.6-Pro 不在我们的路由中;至于那一方,答案是厂商自家的 API,或者你已经在用的它所列三家提供商中的任意一家,我们不会假装并非如此。

在这样的对比中,路由器真正体现价值的地方,不在于模型本身,而在于那些并非模型的环节。一个密钥即可跨200+ 个模型,按每家供应商的标价、0% 加价使用,这意味着供应商降价会在当天就反映到你的账单上,而不是等到下一次合同续约。自动故障转移意味着 40 t/s 的路由性能下降不会把你的流水线一起拖垮。这个路由 DSL让你可以按照公布的每任务成本、而不是品牌忠诚度来做拆分——高流量用便宜模型,困难调用用强模型,按请求决定。而对于两个模型都不太合适的工作负载,模型融合可以让多个模型在一次调用的背后运行。

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

这种比较通常会引发的问题

29× 在我的工作负载下还成立吗?只有当你的 token 组合与索引运行的相近时才成立。如果你的输出很短,而提示词很长且已被缓存,那么倍数会向输出端 6.9× 的费率差距坍缩,并在输入端扩大——此时 MiMo-V2.6-Pro 的 99% 折扣是决定性因素。如果你的输出是冗长的推理轨迹,倍数则会扩大到超过 29×,因为 Grok 4.7 的冗长惩罚与输出长度成正比。

两边的 46 是同一个 46 吗? 它们是同一个指数、同一个版本、同一个量级——底层子分数分别为 46.32 和 46.45,相差 0.13 分,而该指数将两者均四舍五入为 46。Artificial Analysis 并未公布这两个模型中任何一个的单项评估细分数据,因此综合分数已是可获得的最细粒度结果,0.13 分的差异不应被解读为能力排名。

新项目应该默认选哪一个?如果工作负载是批处理、可容忍延迟且对成本敏感,那么每项任务 0.13 美元的 MiMo-V2.6-Pro 就是默认选择,而且开放权重意味着你不会受制于单一供应商的定价。如果你特别需要 xAI 的模型——Grok Build 测试基座的结果、AA-Briefcase 的排名、50 万上下文以及 2026 年 5 月的知识截止时间——Grok 4.7 如今是 OrcaRouter 上的一条现成路线,而每项任务的溢价就是获取这一特定能力所需付出的代价。这里没有任何一个模型能在这两方面同时胜出。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新