
小米 MiMo-V2.6-Pro-UltraSpeed 对比小米 MiMo-V2.6:同一个检查点,十倍的价格
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed 和 Xiaomi MiMo-V2.6-Pro 并不是两个模型。它们是同一个模型的两种售卖方式。二者都由同一个万亿参数的 MiMo-V2.6 检查点提供服务,该检查点由小米于 2026 年 9 月发布——即 Xiaomi MiMo-V2.6 系列的 Pro 档,该系列中更小的成员是 Xiaomi MiMo-V2.6-Flash。两个 Pro 版本之间的差异完全在于 token 的输出速度,以及你为它们支付的价格。标准档每百万输入 token 收费 0.435 美元,每百万输出 token 收费 0.87 美元。UltraSpeed 档则收费 4.35 美元和 8.70 美元。在计费的输入端和输出端,这都是干净利落的十比一,而它换来的是约十倍输出速度的宣传——这是小米对其自家服务栈作出的宣称,目前尚无任何独立基准测试公布过相应数字。
所以,有趣的问题并不是哪个模型更好,而是为十倍的速度付出十倍的价钱是否合理——而在你把生产路径押注于此之前,这背后其实有一个值得先读一读的先例。
快速层是一个服务决策,而不是模型决策
小米对 UltraSpeed 系列的官方定位是:它在质量上与标准模型一致,区别仅在于吞吐量。这一点比听起来更重要,因为它消除了人们面对新层级时通常会有的犹豫理由。你不是在赌另一个检查点的性格、它的拒答行为或它的格式怪癖。你赌的是同样的权重,经过更激进的服务配置运行后,会在你的提示词上表现一致。如果这一点成立,那么在这两个层级之间切换就只是配置更改,而非迁移。
该服务配置的内部细节在这一代中尚未有文档记录。上一代 UltraSpeed 档位基于 2026 年 6 月的 MiMo-V2.5-Pro 检查点构建,小米当时称其仅在专家层使用 FP4 量化,采用一种名为 DFlash 的块并行推测解码方案,以及一个名为 TileRT 的运行时,并且运行在单个八 GPU 节点上。小米尚未公布 V2.6 档位对应的细节。请将早先的技术栈视为说明速度如何获得的背景信息,而非对当前运行内容的描述。
它所在的产品阵容规模不大。除了两个 Pro 档位之外,还有 MiMo-V2.6-Flash——这个较小的同门型号拥有 3090 亿总参数和 150 亿激活参数。Pro 是稀疏专家混合旗舰:Artificial Analysis 将其列为 1 万亿总参数、每 token 激活 420 亿参数、100 万 token 上下文窗口,并采用 MIT 许可证,权重发布在 Hugging Face 上。这些数字值得记住,因为整个比较都建立在它们之上。
什么是实际经过验证的,什么不是

上面两列之间的不对称,是本文中最重要的一件事。慢的那一侧
Artificial Analysis 对 MiMo-V2.6-Pro 进行了基准测试,并为其公布了 46 的 Intelligence Index 得分——在该模型被归入的 114 款模型类别中位列第一。测得通过小米 API 的输出速度为每秒 134.3 个 token,而该类别中位数为 77.9;首个数据块到达时间为 2.15 秒,中位数为 2.34。它列出的每个 Intelligence Index 任务成本为 0.13 美元,输入价格享有 99% 的缓存折扣,输出冗长度为 1.4 亿个 token。这些都是在明确配置下的独立数据,也是本次对比中唯一可靠的吞吐量基准。
对于 UltraSpeed 而言,已验证的列表要短得多:
• 输出速度——约为标准档位的十倍,由 Xiaomi 声称,并被列出该档位的平台反复引用。尚无第三方公布针对这一特定档位的每秒 token 数测量结果。
• 价格 — 每百万输入 token 4.35 美元,每百万输出 token 8.70 美元,两者均为标准层级的十倍。这两个费率旁边没有列出缓存层级。
• 质量——"与原版一致",这同样是供应商的说法。UltraSpeed 端点的独立评估尚未发布,因此质量未变的说法是未经检验,而非已被证伪。
• 上下文与模态——1,048,576 个 token,原生支持文本、图像、视频和音频输入,继承自基础检查点。
还有一个厂商基准测试值得特别点名,正是因为它的传播轨迹。小米公开的强化学习仪表盘在 2026 年 9 月直播了 V2.6 后训练运行,其中报告 DeepSWE v1.1 得分为:Pro 运行 72.57,Flash 为 65.68。这些分数来自小米自己的离线评估,使用 mini-swe-agent 测试框架,取三次平均,从未提交到公开排行榜,也没有在实验室之外被复现。如果你看到 72.57 被当作排行榜分数引用,那是一个穿着排行榜外衣的厂商数字。

先例:上次小米收了三倍,而不是十倍
这并不是小米的第一个速度等级,而前一个等级正是整个故事中最有用的对比——因为倍数发生了变化。
MiMo-V2.5-Pro-UltraSpeed 于 2026 年 6 月面世,基于 V2.5-Pro 检查点构建,其定价约为标准模型输出速率的三倍。小米当时的宣传口径与如今如出一辙:输出速度大约提升十倍。当时的报道称,在单个八 GPU 节点上可维持约每秒 1,000 个 token 的持续吞吐量,峰值接近 1,200,不过模型页面本身给出的范围更宽,为 500 至 1,000——而这一切均未经过独立验证。使用权限需通过申请表获取,而非开放注册。
把两者并排放在一起,变化本身就能说明问题。速度倍数基本维持在十倍左右。价格倍数则从三倍变成了十倍。对于同一种升级来说,这是一笔截然不同的交易,而 Xiaomi 尚未公布对这一变化的解释。它可能反映出服务成本确实更高——更大的检查点、更激进的解码配置,或发布时更紧张的计算容量。它也可能反映出某个才上线一天的服务档位所采用的发布窗口期定价。它目前还没有的,是一个你可以核实的公开理由。
有一个实际差异值得一提,尤其是对用过 V2.5 档位的人:那一档是需要申请的受限试用。而 V2.6 档位则被列为通过小米自有 API 以及多个第三方平台普遍可用,按公布的价格提供,无需申请步骤。无论还有什么其他变化,尝试它的门槛都降低了。
在实际工作负载中,十倍的代价是什么
百分比掩盖了这件事的形态,所以这里给出一次具体智能体运行的算术——它在整个生命周期内读取 2000 万个输入 token,并输出 200 万个输出 token。这是一种繁重但并非罕见的智能体工作负载,即模型循环执行工具调用,并反复读取自己的上下文。
• 标准层级,输入 — 2000万 tokens,每百万 $0.435:$8.70。
• 标准层级,输出 — 200 万 tokens,每百万 $0.87:$1.74。
• 标准套餐,总计 — 每次运行 $10.44。
• UltraSpeed 档位,输入 — 2000 万 Token,每百万 $4.35:$87.00。
• {{1}}UltraSpeed{{/1}}{{2}} 档位,{{/2}}{{3}}输出 — 每百万 200 万 token,单价 8.70 美元:17.40 美元。{{/3}}{{4}}{{/4}}
• UltraSpeed 档,总计 — 每次运行 $104.40。
差额是 93.96 美元,而且它恰好是整个账单的十倍,而不是其中某一项费用的十倍,因为这两个费率是一起按比例变化的。现在来看账本的另一面。按照 Artificial Analysis 对标准档测得的每秒 134.3 个输出 token,生成 200 万个输出 token 需要四个多小时的纯生成时间。速率提升到十倍时,大约需要二十五分钟。因此,多花的 94 美元在这次运行中大约换回了三个半小时的实际时间——如果你想这么算的话,大约相当于每节省一小时 27 美元。
这笔交易是否划算,完全取决于挂钟时间对你而言值多少,而有一个细节会打破天真的解读。在 Artificial Analysis 的页面上,标准档位的输入价格带有 99% 的缓存折扣,这意味着对于那些反复读取同一上下文的负载,账单中输入那一半可以缩水到几乎为零。UltraSpeed 的页面只列出这两个头号费率,没有缓存档位。如果你的负载缓存占比很高,实际倍数就不是十倍——而是糟糕得多,因为你恰好是在原本几乎不花钱的那一侧丢掉了折扣。如果你的负载以输出为主、缓存很少,那么十倍就接近真实数字。在相信任何一个数字之前,先测量你自己的用量构成。
开放权重的不对称
两个层级之间存在一种与价格或速度无关的结构性差异,而这一差异可能比二者都更为重要。
MiMo-V2.6-Pro 以 MIT 许可证发布,权重已发布于 Hugging Face。这允许商业部署、修改和进一步训练,也意味着标准模型有一个任何供应商都无法抬高的价格下限:如果托管费率不再划算,你可以自行部署该检查点。你无法在自己的硬件上达到小米的吞吐量,而且你需要为 GPU 付费,但这个选项存在,并且它限制了托管层级的收费上限。
UltraSpeed 没有这样的下限。UltraSpeed 没有专属权重,因为该档位是服务栈而非模型——检查点就是已经公开的那一个,你租用的是 Xiaomi 快速运行它的能力。这是一种可以正当出售的东西,形态与市场上其他所有速度档位相同。这确实意味着,十倍费率除了其他运行相同开放权重的提供商之外,没有任何竞争性制约;如果价格再次变动,也没有自托管的退路。

对照可用性情况来看:标准检查点可通过小米自有渠道及多个第三方平台获取,同时也提供下载。UltraSpeed 层级可通过小米自有 API 及多个第三方平台获取,而这是获取它的唯一途径。对于任何考虑长期依赖的人来说,这种可选性上的差异,值得与每 token 费率一并纳入成本考量。
谁应该服用哪个
这个决策的分野十分清晰:取决于你的成本中有多大比例来自输出 token,以及你的延迟预算中有多大比例花在生成而非排队上。
• 当工作负载具有输出密集、缓存占用低且需要交互的特点时——例如长文本生成、模型在工具调用之间进行大量推理的智能体循环,或任何另一端有人在等待请求结果的场景——就该选用 UltraSpeed。
• 当工作负载缓存密集、可容忍批处理,或在边际上对成本敏感时,采用标准层级——批量分类、基于固定语料库的检索增强回答、夜间评估运行,以及任何四小时的生成时间也无妨、因为无人盯着看的情况。
• 当你希望拥有自托管选项时,请选择标准套餐。如果你的合规要求需要可自行持有的模型权重,那么无论出价多高,UltraSpeed 都无法提供给你。
• 在亲自测量之前,两者都不要选。十倍这个说法是这里的核心数字,而它目前只是厂商自己声称的。花一个下午,把你自己的提示词在两个层级上都跑一遍,胜过任何已公布的数据,因为任何人独立验证过的那个唯一吞吐量数字,恰恰属于这场比较中较慢的一方。
关于最后一点,测试某个服务层级的机制与测试一个模型并无二致,而这正是路由层体现价值的地方。 OrcaRouter 通过单个 API 密钥承载 200 多个模型,按提供商标价计费,0% 加价全额让利,因此供应商调价当天就会体现在您这一侧,而无需等到下一次合同续约。自动故障转移意味着您仍在评估的层级绝不会独自承担生产路径的流量,而路由 DSL 让您可以将某一类请求发送到快速端点,其余请求发送到标准端点,无需维护两套集成。这一切都不需要专门依赖小米的模型——关键在于,当各层级都位于同一个密钥之后时,像这样的层级决策要逆转是很容易的。
什么能解决这个问题?
关于 MiMo-V2.6-Pro-UltraSpeed 与 MiMo-V2.6-Pro 对比这个问题,诚实的现状是:其中一半有实测支撑,另一半只是断言。标准档拥有独立的 Intelligence Index、独立的吞吐量数据,以及已公开发布的开放权重。快速档拥有的则是一个价格、一个上下文窗口,以及厂商的承诺——它是同一个模型,只是跑得更快。
三件事可以弥合这一差距。对 UltraSpeed 端点进行独立的吞吐量测量——Artificial Analysis 曾通过 Xiaomi 的 API 测量标准层级,因此同样的处理是可能的,只是尚未发生。为快速层级制定缓存策略,因为缺乏该策略正是让十倍账单在缓存密集型工作中变得更糟的原因。以及任何关于 V2.6 服务栈的已公布细节,就像 Xiaomi 为 V2.5 代际记录 FP4 专家、DFlash 和 TileRT 时所做的那样。
在那之前,十倍的价格是真实的,而十倍的速度只是一个说法。如果你的工作负载以输出为主,而且有人在等着结果,那么这种说法值得用你自己的提示词去验证——也值得放在一个抽象层后面验证,这样一旦它站不住脚,你当天下午就能切回去。
