
MiMo-V2.6-Flash 与 MiMo-V2.6:同一系列,两个检查点,一个身兼双职的名字
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
问两个人 MiMo-V2.6 是什么,可能会得到两个不同的模型。小米在 2026 年 9 月发布的这一产品是一个系列,包含两个已发布的检查点——MiMo-V2.6-Flash,拥有 3090 亿参数,以及 MiMo-V2.6-Pro,拥有 1.02 万亿参数——而单说 MiMo-V2.6这个名字,既会被用来指代整个系列,在大多数报道中也会被用来指代这一代的顶级层级。所以,一个标题为“MiMo-V2.6-Flash vs MiMo-V2.6”的页面,实际上是用效率检查点来对比人们想指旗舰时写下的那个名字。两个检查点于 2026 年 9 月 21 日相隔十八秒上线 Hugging Face,都采用 MIT 许可证,而且都以可下载为先——没有可供调用的小米端点。除此之外,二者几乎没有任何相同之处。
这比通常的命名之争更重要,因为两者并不是一个以后还能逐级攀登的规模阶梯。它们是各自独立的训练运行,有各自独立的基准表、各自独立的内存占用,而且——正如已公布的数值所示——还有几处是较小的那个直接胜出。
两个检查点,一分钟公布
这两个代码仓库分别是 XiaomiMiMo/MiMo-V2.6-Flash-RL(创建于 UTC 15:39:51)和 XiaomiMiMo/MiMo-V2.6-Pro-RL(创建于 UTC 15:39:33)。二者均未设置访问门控。两者都附有技术报告和模型卡,且小米都将它们描述为单次混合强化学习训练的产物——该训练将编码、通用智能体、视觉和网络安全任务合并到一次训练过程中,而非按领域分别进行多次训练。
• 参数 — MiMo-V2.6-Flash:总计 309B,每 token 激活 15B。MiMo-V2.6-Pro:总计 1.02T,激活 42B。两者均为稀疏混合专家模型。
• 骨干 — Flash 有 48 层,39 层滑动窗口和 9 层全注意力,隐藏大小为 4096,256 个路由专家激活 8 个,128 token 的滑动窗口,且没有共享专家。Pro 以更大的宽度运行相同的混合注意力思路。
• 模态 —— 两者都是原生全模态,将文本、图像、视频和音频纳入同一个模型,而不是三条硬拼在一起的流水线。Flash 搭载了一个 681M 参数的视觉 transformer、一个 308M 的音频 tokenizer 和一个 127M 的音频 patch 编码器。
• 上下文 —— 两者均宣称支持 1M tokens,且配置支持 1,048,576 token 的最大位置嵌入。
• 许可证 — 两者均采用 MIT 许可证,没有营收门槛,除常规条款外没有可接受使用的限制,也没有研究条款。商业部署、修改和再分发均获允许。
• 权重文件 — Flash 发布了 172.9 GB 的 FP8 权重数据,分布在 65 个分片中。Pro 的参数量大约是它的三倍,因此在你自行进行任何量化之前,其下载量就已达到半 TB 级别。
• 这些模型在哪里提供服务——Hugging Face、小米自家的 API 平台、AI Studio、MiMo Code 以及 MiMo 桌面应用。模型卡指出,目前这两个 checkpoint 都尚未由第三方推理服务商在 Hub 本身上部署。
让人付出硬件代价的碰撞
这种配对中的混淆,其实并不在于 Flash 和 Pro 之间。而是在于 MiMo-V2.6-Flash 和它之前推出的那款模型之间。
MiMo-V2-Flash 于 2025 年 12 月发布,小米自家发布公告的博文将其描述为一个混合专家模型:总参数量 3,090 亿,激活参数 150 亿,采用交错使用滑动窗口注意力与全注意力的混合注意力方案,并搭配激进的 128 token 滑动窗口。把这一点对照上文的要点列表来看。2026 年的检查点和 2025 年的检查点有着相同的核心规格轮廓、相同的滑动窗口大小和相同的激活预算——相隔九个月,来自不同的训练运行,具备不同的能力,基准测试表也各不相同。
所以,搜索“MiMo V2.6 Flash”会毫不费力地给你返回关于 MiMo-V2-Flash 的页面,还附带一个属于旧模型的 256K 上下文数值,以及每百万输入 token 0.1 美元的价格。如果你正在为节点做容量规划,这可不是无关紧要的错误。旧检查点和新检查点是不同的下载内容,有不同的服务配置方案,而新检查点声称上下文长度是原来的四倍。
命名中还藏着第二个更隐蔽的陷阱。两个代码仓库都以 -RL 结尾,这读起来像是搭在某个其他基础模型之上的强化学习适配器。它们不是适配器。该后缀标记的是后训练谱系:这些是流式 RL 运行产出的完整检查点。权重索引证实了这一点——数以万计的张量覆盖了整个主干网络、视觉编码器、音频栈以及推测草稿模型。
厂商自己的表格怎么说
本节中的每一个数字都来自两份模型卡中 Xiaomi 的评估表。Xiaomi 在自己的检查点上运行了这些测试工具。这些结果均未在实验室之外复现,也未出现在任何公开排行榜上,并且对比列是厂商自己对其他公司模型运行相同测试工具得到的结果。把排名当作参考信息,把小数位当作装饰即可。
• 代码智能体 — DeepSWE v1.1:Flash 67.9,Pro 71.9。Terminal Bench 2.1:Flash 87.6,Pro 89.9。ProgramBench:Flash 26.0。MiMo Code Bench:Flash 61.2。
• 通用智能体 — AutomationBench v1.0.6:Flash 52.3,Pro 53.1。Toolathlon-Verified:Flash 73.6,Pro 76.9。OSWorld-Verified:Flash 80.8,Pro 82.0。Agents' Last Exam:Flash 27.6。Terminal Bench 4.0:Flash 28.8。
• 网络安全——唯一一项较小模型领先的指标。CyberGym:Flash 95.1,而 Pro 为 94.0。MiMo Cyber Bench:Flash 77.2。随后成绩断崖式下跌:ExploitGym 6.0,ExploitBench 25.3,SEC Bench Pro 47.5。
• 视觉智能体 — MiMo VisualCoding:Flash 71.5,Pro 72.3。
把这些条目一路读下来,最诚实的总结是:Pro 几乎在所有方面都领先,但幅度很小,小到足以落在自行运行的评测框架的噪声范围内。在 DeepSWE 上,两者相差四分,而在同一个量表上,同一个检查点在小米自己的两次评估之间就移动了两分。
最后一点值得单独成段,因为它是两张卡里最有用的东西。小米公开的 RL 仪表盘在 9 月全程直播了两次训练过程,它公布的 Flash 成绩是65.68,在 DeepSWE v1.1 上、使用 mini-swe-agent 评测框架、取三次平均。而最终卡片上,所发布权重显示的是 67.9。与此同时,Pro 的仪表盘数字是 72.57,其卡片上印的却是 71.9 —— 反而降了。同一次训练的两个检查点,被评估了两次,而两次评估之间的差距,和两个模型之间的差距一样大。如果你从上周起就一直在引用仪表盘上的数字,那它们描述的是训练快照,而不是你今天会下载到的成品。

两者都不在路由器上。
这里就是决定大多数真实评估的部分。Xiaomi 这两个检查点都不出售:在其自家网站上,没有公布 MiMo-V2.6 这一代按 token 计的价格,也没有为其中任何一个公布可调用的模型标识符。取而代之的,是一个下载,以及——仅限 Pro——一家被 Artificial Analysis 认定为以每百万输入 token 0.435 美元、每百万输出 0.87 美元提供该模型的 API 提供商。那是提供商的挂牌信息,而不是厂商价目表,而且 Flash 完全没有可与之相比的东西。第三方目录页面上流传的数字也应同样解读。
所以,在 Flash 和 Pro 之间做选择,并不是在两个计价不同的端点之间做选择。它是在两份 GPU 账单之间做选择,而较小的那份大约只有较大那份的三分之一。这就是 Flash 全部的商业理由,而且它比基准测试表格所体现的更有说服力,因为在大多数人真正要购买去完成的任务上,这两个模型之间只相差几个点。
这样一来,剩下的就是那个熟悉的三岔路口:租用前沿模型、自持小模型,或自持大模型。前沿那一列正是小米在自己的表格中拿来对标的对象——在厂商自己的对比里,Claude Opus 5、GPT-5.6 Sol 和 Claude Fable 5 在 DeepSWE 上都比 Pro 高出几分,而这三者今天都可以通过 OrcaRouter 上的一个 API 密钥、按供应商标价调用,0% 加价透传。这对摆在你面前的那个具体决策很关键:供应商调价当天就会落到你这边,而不是等到下一次合同续签,因此随着托管价格浮动,租与自持之间的账算依然诚实。自动故障转移还意味着,你仍在评估中的模型不必独自承担生产链路的流量,同时你仍可从容决策。
如今在任何路由器上——包括我们自己的——你都做不到的一件事,就是调用 MiMo-V2.6-Flash 或 MiMo-V2.6-Pro。我们不路由任何 Xiaomi 模型,而 Xiaomi 自己的卡片中那条可用性说明指向的是 Xiaomi 自家的渠道:MiMo API 平台、AI Studio、MiMo Code 和桌面应用。
哪个检查点,以及什么时候
如果你想要 MiMo-V2.6 这一代,并且硬件是硬性约束,那就选 MiMo-V2.6-Flash。与旗舰型号相比,你在 DeepSWE 上大约要放弃 4 分,在大多数智能体基准测试上也要放弃一两分。你换来的是一个内存占用约为三分之一的检查点,它在小米自家表格的 CyberGym 上领先 Pro,并且共享相同的许可证、相同的 100 万 token 上下文宣称以及相同的多模态能力。对于从事网络安全评估工作的团队来说,CyberGym 那一列绝不是可以忽略不计的舍入误差。
如果工作负载是编程或长周期智能体任务,且节点费用已经支付,那就选择 MiMo-V2.6-Pro。它在几乎每一列上都是更好的模型,也是 Artificial Analysis 实际测量过的那个——在重新校准的 v4.3 量表上智能指数为 46,在其开放权重类别中的 114 个模型里排名第一,输出速度为每秒 134.3 个 token,标价为每百万输入 token 0.435 美元、每百万输出 token 0.87 美元——而在规划生产时,独立测量比厂商表格更有价值。
在你阅读配置文件而非摘要之前,两者都不要轻信。Flash 的模型卡描述了一个五层推测解码草稿模型,每次预测七个 token;而同一仓库中的 config.json 却把 num_nextn_predict_layers设为 3。模型卡的摘要并不是运行时实际读取的内容。而且仓库页面上的 Safetensors 区块显示 Flash 为 159B 参数、Pro 为 524B,这两者都与两个模型卡中的总参数量或激活参数量对不上。小米并未解释这一差异。请改以已发布的权重数据来估算规模,因为无论参数怎么计算,这才是你在显存中真正要为之付出的数量。

什么能解决这个问题
三件事,大致按有用程度排序。由第三方在相同的测试框架(DeepSWE 或 Terminal Bench)上运行——以提交结果而非自报结果的形式——会告诉你 Flash 与 Pro 之间四分的差距究竟是真实的位次,还是有利的配置。一份公开的价目表会把整个比较从硬件项目变成一行可以放在托管前沿模型旁边的条目。而小米表示将开源的 RL 环境,才是大多数团队真正想要的产物,因为要在你自己的轨迹上复现这个循环,你需要的正是它们。
在那之前,实用的解读范围很窄。MiMo-V2.6 是两个检查点,不是一个,而光提这个名字通常指的是贵的那个。如果你今天就要在该系列里做选择,诚实的默认选项是 Flash,除非你特别在意的某个基准测试列另有说法——而如果你还没准备好购买节点,那么目前两者都还不是正确答案。

