
MiMo-V2.6-Pro 以每任务 0.13 美元的价格,将开放权重模型推上帕累托前沿
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro 于 2026 年 9 月 21 日上线 Hugging Face,此后传播最广的数字是 46——这是它在 Artificial Analysis Intelligence Index v4.3.2 上的得分,也是任何开放权重模型在该综合指标上记录到的最高分。真正决定你能否实际运行它的数字要小得多。Artificial Analysis 在用自己的测试框架评估 MiMo-V2.6-Pro 时,测得每个 Intelligence Index 任务的计算成本为 0.1332 美元,而这一数字使该模型位于该网站“智能与每任务成本”图表的帕累托线上。在四舍五入下限之上,它是那条线上唯一的开放权重模型。
这比"顶尖开源权重模型"这一说法更为精准,也更有实用价值,而后者正是大多数发布报道所采用的框架。在智能维度上位列第一,告诉你的是上限;而位于成本曲线上,告诉你的则是在该价格下,市场上是否还有其他东西严格优于它。对于小米 MiMo-V2.6-Pro,截至本文撰写时,没有。
帕累托线实际衡量的是什么
该图表将Artificial Analysis评估过的每个模型绘制在两个坐标轴上:一轴是智能指数,另一轴是完成一项指数任务所需的加权平均美元成本。位于帕累托线上的模型,不可能被任何其他单一模型在两个坐标轴上同时超越——你找不到更聪明却更便宜的选择。位于该线下方且靠左的点则被支配,因而从线上掉落。
我们根据图表中嵌入的数据重新计算了前沿,而不是凭肉眼读取那条线。我们从同时具备指数评分和实测每任务成本的 326 个模型出发,当前的前沿由十四个点组成:
• Qwen3.5 2B(非推理)——指数 6.2,每任务成本四舍五入为 $0.000,开放权重
• Devstral 2 ——指数 8.6,每任务成本四舍五入为 $0.000,开放权重
• North Mini Code ——指数 9.9,每任务成本四舍五入为 $0.000,开放权重
• Claude Sonnet 4.6(非推理,高投入)——指数 24.7,每任务成本四舍五入为 $0.000,闭源
• Grok Build 0.1 0616 ——指数 27.2,每任务成本 $0.006,闭源
• GPT-5.6 Luna(高)——指数 32.1,每任务成本 $0.044,闭源
• GPT-5.6 Luna(极高)——指数 34.6,每任务成本 $0.085,闭源
• Xiaomi MiMo-V2.6-Pro ——指数 46.3,每任务成本 $0.133,MIT 许可的开放权重
• GPT-6 Astra(中)——指数 49.6,每任务成本 $1.541,闭源
• GPT-6 Astra(高)——指数 50.9,每任务成本 $1.725,闭源
• GPT-6 Astra(极高)——指数 52.4,每任务成本 $2.309,闭源
• GPT-6 Astra(最高)——指数 52.7,每任务成本 $3.258,闭源
• Claude Fable 5.1(极高,默认回退)——指数 53.2,每任务成本 $5.978,闭源
• Claude Fable 5.1(最高,默认回退)——指数 53.4,每任务成本 $7.630,闭源
从那份列表里能看出三件事。最便宜的四个点,其测得成本四舍五入到四位小数都为零,所以曲线中有意思的部分从 Grok Build 0.1 0616 开始。小米 MiMo-V2.6-Pro 是曲线上真正的拐点,而不是舍入造成的假象:再往上一个点,每任务成本是它的 11.6 倍,只换来多 3.3 个指数点。而在十个成本非零的前沿点中,恰好有一个是开放权重——这正是“顶级开放权重模型”这一说法所掩盖的事实。智能轴上最接近的开放权重模型是 GLM-5.3 (max),得分为 44.8,但离那条线还差得远:它每个指数任务花费 $2.006,是 MiMo-V2.6-Pro 的十五倍。Kimi K3 (max) 为 43.6,每任务 $2.000。

价目表没有变动,账单却变了。
小米这一代没有涨价。MiMo-V2.6-Pro 的定价为每百万输入 token 0.435 美元、每百万输出 token 0.87 美元,缓存命中输入价为 0.0036 美元——相当于 99.17% 的折扣——这与上一代旗舰采用的价格方案相同。按缓存命中/输入/输出 7:2:1 的混合比例计算,折合每百万 token 0.1765 美元。
然而,用 Intelligence Index 对 MiMo-V2.6-Pro 进行测试的成本达到 206.66 美元,即每项任务 0.1332 美元;而同一指数对 MiMo-V2.5-Pro 的测试成本为每项任务 0.054 美元。Artificial Analysis 记录到,在同一测试套件上,较新模型的输出 token 数为 1.4 亿,而较旧模型为 1.1 亿。费率卡没有变化;模型只是为回答同一个问题写了更多内容。这是对帕累托位置的一个诚实限定——小米 MiMo-V2.6-Pro 在成本轴上赢得一席之地,是因为它变得更冗长,而不是因为它变得更便宜。
对于任何要确定预算规模的人来说,实际结论是:如今,按 token 计价已很难预测一个工作负载要花多少钱。两个价目表完全相同的模型,在每项已完成任务成本上可能相差 2.5 倍。缓存折扣是撬动幅度最大的杠杆:在每百万缓存输入 token 0.0036 美元的水平下,复用上下文的提示与不复用上下文的提示之间的成本差距,比这份列表中大多数模型两两之间的差距还要大。
该评分涵盖与不涵盖的内容
46 是第三方测量结果,而这一点很重要,因为几乎所有其他已发布的关于 MiMo-V2.6-Pro 的数据都不是。索引版本也很重要:v4.3.2 是由十项评估组成的复合版本,涵盖推理、知识、数学和编码,而一个分数只有与同一版本上的其他分数相比才具有可比性。小米在发布时同时公布的厂商数据——DeepSWE v1.1 为 71.9,AutomationBench v1.0.6 为 53.1,Toolathlon-Verified 为 76.9,Terminal Bench 2.1 为 89.9,CyberGym 为 94.0——来自小米自己的测试框架和评分器,尚未被任何人复现。它们可作为该模型针对什么进行调优的方向性证据;但它们不是排行榜条目。
此次发布的另一半是开放权重包。Artificial Analysis 列出该模型总参数为 1.0T、激活参数为 42B,具有 100 万 token 的上下文窗口,支持文本、图像、语音和视频输入并以文本输出,采用 MIT 许可证,权重托管在 Hugging Face 上。而该仓库本身报告的 Safetensors 模型规模为 524B 参数——这是第三个数字,既不符合 1.0T 的总参数,也不符合 42B 的激活参数,且小米尚未对此进行核对统一。如果你计划进行自托管部署,那么在准备任何资源之前,这一差异值得先行厘清,因为 524B 的 FP8 检查点与 1T 的检查点是截然不同的硬件讨论。

一个你当前无法规划路线的边界点
可用性状况是本次发布最受制约的部分。当 Artificial Analysis 评估 Xiaomi MiMo-V2.6-Pro 时,仅为该模型计入了一个 API 提供商。Hugging Face 仓库指出,Xiaomi MiMo-V2.6-Pro 未被任何推理提供商部署。我们也不托管它,且不会暗示其他情况——如今获取该模型的途径是小米自有平台以及列出它的第三方目录。
这是一个故障转移问题,而不是质量问题,而路由器正是为解决这个具体问题而存在的。一个 API 接入数百个模型,并可在提供商之间自动故障转移,正是它把“某个提供商目前列出了这个模型”从架构风险变成了配置细节。这也是你会如何把迁移分阶段推进到这么新的模型上:将一部分流量发送给 Xiaomi MiMo-V2.6-Pro,在它后面保留一个经过验证的模型,并让路由器来转移请求,而不是让你的待命轮值来处理。这对于我们提供的模型有效。对于这一个,在它可以被路由之前,诚实的建议是不要把它放在关键路径上。
什么会让它偏离这条线?
帕累托位置只是一张快照,而非模型的固有属性。有三件事会改变它。小米的一次降价会让小米 MiMo-V2.6-Pro 进一步向左移动,使其更难被击败——而且由于我们以 0% 的加价率向下游传递供应商目录价,这样的降价无论在哪里落地,当天就会在我们这边生效。一个得分高于 46.3 的更便宜模型会把它彻底挤出榜单;GPT-6 Astra(low)已经以每任务 $0.818 的价格处在 45.8,虽然更贵,但在智能轴上已经逼近得令人不安。而对 MiMo-V2.6-Flash 的独立基准测试——它目前根本没有 Artificial Analysis 页面——可能会揭示,这个更便宜的同胞兄弟在大多数工作负载下都占据了曲线上更有利的位置。
就目前而言,站得住脚的是算术层面的说法。在当前的指数版本下、按当前公布的价格,市场上没有任何模型能在每任务成本更低的同时,还比小米 MiMo-V2.6-Pro 更聪明。这一结论能否经得起其首次独立复现的检验,才是值得关注的问题。

