
Xiaomi MiMo-V2.6-Pro 对比 Grok 4.7:每任务成本低 30 倍,而两者都不快
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
小米 MiMo-V2.6-Pro 和 Grok 4.7 均于 2026 年 9 月 21 日发布,在 Artificial Analysis 智能指数 v4.3.2 上双双得分为 46,而且都被给出这些测量结果的页面称为"慢"——MiMo-V2.6-Pro 为每秒 43.6 个输出 token,而中位数是 67.1;Grok 4.7 在 xhigh 努力级别下为 40。真正让两者拉开差距的,是得到一次回答要花多少钱。评测方给出的单任务成本为:这个中国开源权重模型 0.13 美元,Grok 4.7 模型 3.74 美元,相差约 29 倍。这并非单价差异,或者说并不只是单价差异:Grok 4.7 的输出单价是每百万 token 6.00 美元,而对方为 0.87 美元,相差七倍;这个倍数中其余的部分,则来自两个模型为得出答案各自消耗了多少 token。
同一个月里,两个模型,基于同一个指数,取得同样的分数,定价却仿佛分属市场上不同的年代。有意思的问题不是哪一个胜出,而是那29倍差距中,哪一部分是你能真正绕开的——因为在这组对比里,两者之中恰好只有一个是今天就能买到的路线,而它正是那个贵的。
同一天,同样的比分,不同的动物
Grok 4.7 于 2026 年 9 月 21 日发布,每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,上下文窗口为 500,000 token,知识截止日期为 2026 年 5 月,缓存折扣 75%,支持文本和图像输入、文本输出。在以 xhigh 努力水平运行时,它在该指数上测得 46 分;在 Grok Build 测试框架中的 Coding Agent Index 上为 56 分;在 AA-Briefcase 上为 1,657 Elo —— 在该榜单上排名第四,落后于三个 Anthropic 的条目,而每任务成本约为 Claude Opus 5 的一半。
Xiaomi MiMo-V2.6-Pro 是一个稀疏混合专家检查点,总参数量 1.02 万亿、激活参数量 420 亿,采用 MIT 许可,支持 100 万 token 上下文,接受文本、图像、语音和视频输入并输出文本,每百万 token 价格为 0.43 美元和 0.87 美元,并提供 99% 缓存折扣,使热提示词下的有效输入费率几乎降至零。Artificial Analysis 在指数上将列为 114 个开放权重模型中的第一,在成本上列为 114 个中的第十二。它可通过三家 API 提供商访问。它不在我们的路由上,而且在提供商完成模型接入之前,我们不会将其列入模型列表。
唯一能决定它的一句话
• 每个索引任务成本 — MiMo-V2.6-Pro $0.13;Grok 4.7 $3.74 — 29 倍 • 输出费率 — MiMo-V2.6-Pro $0.87 / 1M;Grok 4.7 $6.00 / 1M — 6.9 倍 • 索引运行中的输出 token 量 — MiMo-V2.6-Pro 140M;Grok 4.7 240M,而中位数为 88M • 输出速度 — MiMo-V2.6-Pro 43.6 t/s;Grok 4.7 40 t/s — 两者均低于中位数 • 上下文窗口 — MiMo-V2.6-Pro 1M;Grok 4.7 500K • 权重 — MiMo-V2.6-Pro 采用 MIT 许可并可下载;Grok 4.7 为专有,仅提供 API
把前两条放在一起读,差距的形状就清楚了。按标价计算,两者在输出上相差 6.9 倍。在索引运行中,两者在单次回答成本上相差 29 倍。中间的放大因子是冗长程度:Grok 4.7 生成了 2.4 亿输出 token,而同类中位数为 8800 万,MiMo-V2.6-Pro 则生成了 1.4 亿。这意味着在 6.9 倍的费率惩罚之上,又叠加了 1.71 倍的 token 惩罚,而 1.71 × 6.9 = 11.8——距离 29 倍的其余差距来自输入端,在那里,MiMo-V2.6-Pro 的 99% 缓存折扣和 $0.43 的输入费率,对任何带有重复前缀的工作负载都起到了主要的拉动作用。

冗长是人们估算时遗漏的数字
成本模型通常基于价目表和假设的 token 数量构建。这里这两部分都是错的。价目表错了,因为缓存折扣不是可有可无的脚注——99% 对 75%,这决定了一个系统提示词是每次调用都让你花钱,还是几乎不花你什么钱。token 数量错了,因为两个模型在相同工作中输出的 token 数并不相同,而评估器测量了这种差异:2.4 亿对 1.4 亿,在相同基准上相差 1.71 倍。
这些都不是你能从规格表上直接读出的代理指标。Grok 4.7 的冗长度排名在其所属类别 210 个模型中排第 94 位;MiMo-V2.6-Pro 的成本排名在同类 114 个模型中排第 12 位。一个团队如果引用 Grok 4.7 的价目表,并假设工作负载是 token 中性的,那么其预测的每任务成本大约只有该指数实际支出的四分之一。修正方法也不是把指数成本当作你的估算——它衡量的只是一个基准测试的形态。而是在投入之前测量你自己在两侧的 token 数量,因为这两个模型之间的差距在纸面上是 6.9 倍,在实践中是 29 倍,而这两个数字中只有一个对你的流量来说是真实的。

两者都很慢,而这并不是平局。
Artificial Analysis 测得 Grok 4.7 的输出速度为每秒 40 个 token,称其“属于最慢之列”;MiMo-V2.6-Pro 为 43.6,被称为“明显偏慢”。这两个读数足够接近,速度不该成为二者之间的决胜因素。但它们背后的中位数却并非如此:MiMo-V2.6-Pro 所属的开源权重阵营中位数为 67.1。两个模型都远低于这一水平,而且 MiMo-V2.6-Pro 的首 token 延迟为 3.17 秒,中位数则是 2.31 秒——真正让人难受的是这个数字,且是在交互式循环中,而非批处理场景。
所以,对延迟这一面诚实的总结是:便宜 29 倍并不能给你带来更快的产品,它带来的是一个更慢但成本更低的产品——而如果你的用户正盯着光标看,那 3.17 秒的等待可能比省下的 token 代价更大。对于过夜批处理任务、离线评估,或任何以小时为计时单位的流水线来说,这笔交易就是明摆着的,29 倍几乎等于白赚。
路由器在这种配对下能做什么、不能做什么
在这一组对比中,我们自己的目录确实是一边倒的,这一点值得坦诚说明。Grok 4.7 已在 OrcaRouter 上线,模型为 grok/grok-4.7,按提供商自家定价 $2.00 / $6.00,最大输出 450K,并提供兼容 OpenAI SDK 的端点 https://api.orcarouter.ai/v1 —— 所以,如果这项对比让你想把 xAI 的模型和其他所有模型放在同一个密钥下使用,这条路径今天就已经存在。小米 MiMo-V2.6-Pro 不在我们的路由中;至于那一方,答案是厂商自家的 API,或者你已经在用的它所列三家提供商中的任意一家,我们不会假装并非如此。
在这样的对比中,路由器真正体现价值的地方,不在于模型本身,而在于那些并非模型的环节。一个密钥即可跨200+ 个模型,按每家供应商的标价、0% 加价使用,这意味着供应商降价会在当天就反映到你的账单上,而不是等到下一次合同续约。自动故障转移意味着 40 t/s 的路由性能下降不会把你的流水线一起拖垮。这个路由 DSL让你可以按照公布的每任务成本、而不是品牌忠诚度来做拆分——高流量用便宜模型,困难调用用强模型,按请求决定。而对于两个模型都不太合适的工作负载,模型融合可以让多个模型在一次调用的背后运行。

这种比较通常会引发的问题
29× 在我的工作负载下还成立吗?只有当你的 token 组合与索引运行的相近时才成立。如果你的输出很短,而提示词很长且已被缓存,那么倍数会向输出端 6.9× 的费率差距坍缩,并在输入端扩大——此时 MiMo-V2.6-Pro 的 99% 折扣是决定性因素。如果你的输出是冗长的推理轨迹,倍数则会扩大到超过 29×,因为 Grok 4.7 的冗长惩罚与输出长度成正比。
两边的 46 是同一个 46 吗? 它们是同一个指数、同一个版本、同一个量级——底层子分数分别为 46.32 和 46.45,相差 0.13 分,而该指数将两者均四舍五入为 46。Artificial Analysis 并未公布这两个模型中任何一个的单项评估细分数据,因此综合分数已是可获得的最细粒度结果,0.13 分的差异不应被解读为能力排名。
新项目应该默认选哪一个?如果工作负载是批处理、可容忍延迟且对成本敏感,那么每项任务 0.13 美元的 MiMo-V2.6-Pro 就是默认选择,而且开放权重意味着你不会受制于单一供应商的定价。如果你特别需要 xAI 的模型——Grok Build 测试基座的结果、AA-Briefcase 的排名、50 万上下文以及 2026 年 5 月的知识截止时间——Grok 4.7 如今是 OrcaRouter 上的一条现成路线,而每项任务的溢价就是获取这一特定能力所需付出的代价。这里没有任何一个模型能在这两方面同时胜出。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
