一张主标题卡,标题为“Xiaomi MiMo-V2.6-Flash 已发布”,副标题为“309B 开放权重,MIT 许可,1M token 上下文——发布于 2026 年 9 月 21 日”,并带有四个胶囊徽章:“总计 309B / 激活 15B”、“173 GB FP8 权重”、“1M token 上下文”以及“附技术报告”。
Guides & Insights

{{1}}Xiaomi MiMo-V2.6-Flash 发布:{{/1}}{{2}}一个你可自行部署的 309B 开源模型{{/2}}

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiMo-V2.6-Flash 于 2026 年 9 月 21 日 15:39 UTC 不再是一个训练任务,当时小米的 MiMo 团队把检查点以 XiaomiMiMo/MiMo-V2.6-Flash-RL 之名发布到了 Hugging Face 上——无门槛限制、MIT 许可、附有技术报告、索引中包含 65 个权重分片。XiaomiMiMo/MiMo-V2.6-Pro-RL在十八秒后跟进发布。一周之前,这两个模型还只是某个公开训练仪表盘上两张标着“已停止”的卡片,而关于它们被广泛重复的说法是:根本不存在任何权重。如今它们成了任何人都能下载并部署的文件。这实实在在改变了你能用这个模型做什么,而这一点与关于它的某则公告是两回事。

先说时间戳,因为这次发布没有遵循厂商惯常的宣传编排。9月22日查看小米自家博客,最新文章仍显示的是2025年12月MiMo-V2-Flash的发布。没有V2.6的发布文章,没有公布新一代的价格表,也没有小米为任一检查点宣布的可调用模型标识符。存在的只有一个代码库、一份技术报告、部署指南和一组厂商自己跑的基准测试表——外加模型卡里一个不太友好的小细节,只对打算真正加载它的人重要。

你能持有的两张卡

两个检查点都是原生全模态,声称具备 1M token 上下文,并且都采用 MIT 许可证——可商用、可微调、可再分发,没有营收门槛,也没有研究条款。该卡片称 Flash 是该系列中“效率均衡的检查点”,称 Pro 是旗舰;有趣之处在于,一旦你去看配置而不是营销话术,这两者究竟有何不同。

• 参数量 — MiMo-V2.6-Flash 总计 309B,每个 token 激活 15B;MiMo-V2.6-Pro 总计 1.02T,激活 42B。两者均为稀疏混合专家模型。

• 主干——Flash 为 48 层(39 层滑动窗口、9 层全局注意力),隐藏维度 4096,256 个路由专家中激活 8 个,滑动窗口为 128 个 token,无共享专家。第一个模块为带稠密前馈网络的全局注意力;其后的所有层交替排布。

• 编码器——一个 6.81 亿参数的 MiMo ViT(28 层,24 层滑动窗口加 4 层全注意力)、一个 3.08 亿参数的音频分词器和一个 1.27 亿参数的音频 patch 编码器,因此文本、图像、视频和音频都进入同一个模型,而不是三条硬拼在一起的处理流水线。

• 推测解码——一个五层的多 token 预测草稿模型,采用 DFlash 风格,卡片中描述为每次前向传播可预测后续七个 token,以便进行并行验证。

• 存储 — 已发布的索引显示,权重数据为 172.9 GB,分布在 65 个分片上,采用 FP8 (e4m3) 以及动态激活方案。这相当于每个参数约九字节:Xiaomi 交付的是大模型,而不是适合笔记本大小的量化版本。

三个不一致的数字

这一点值得直白说明,因为这三者都会影响部署决策,而不是基准测试层面的论证;而且它们都并非出于恶意——它们看起来像是说明文档、仓库页面和随附文件之间的文档漂移。

第一点是推测解码器。模型摘要称,MTP 头是一个五层草稿模型(drafter),每次预测七个词元。config.json在同一仓库中把num_nextn_predict_layers设为 3。这两个数字不可能描述同一个产物,而运行时读取的恰恰是配置。如果你要为推测解码估算内存,请以配置为准,并在加载后加以验证。

第二个问题更微妙,严格来说根本算不上错误,更像是一种读起来像错误的命名习惯。该仓库名为MiMo-V2.6-Flash-RL,这就容易让人以为它是一个强化学习适配器,而非一个模型。可它就是模型本身。-RL后缀标记的是后训练谱系——这个检查点是小米所直播的那次混合 RL 训练的产出,而不是叠在某个其他基座之上的 LoRA。权重索引也证实了这一点:数万个张量覆盖了整个主干、视觉编码器、音频栈以及草稿模型(drafter)。

第三种情况是:如果你是在仓库页面而非模型卡上确定硬件规模,那么你最先遇到的正是它。该页面上的 Safetensors 区块报告的是 159B 参数。这个数字既不是模型卡上的两个数字中的任何一个——既不是 309B 总参数量,也不是 15B 激活参数量——而它却是容量规划者最可能直接照抄的数字,因为它就紧挨着下载按钮。小米并未解释这一差异,我们也无法从外部判定;最可能的解读是,这是对量化张量的一种计数约定,而非另一个不同的模型。稳妥的做法是依据已发布的权重数据来确定规模:分布在 65 个分片中的 172.9 GB FP8 是一个无论参数如何计数都必须用 VRAM 来支付的数字。

基准测试说明了什么,以及是谁进行的

下面每一个数字都来自 Xiaomi 模型卡里其自家的评估表。它们没有一个经过独立复现,也没有一个出现在公开排行榜上,而那些对比列是厂商用同一套评测工具跑其他公司模型得到的自家结果。把结果的形态当作有信息量的,把小数点后的位数当作装饰。

• 代码智能体 — DeepSWE v1.1:Flash 67.9,Pro 71.9,对比 Claude Opus 5 的 74.0,GPT-5.6 Sol 的 73.0 以及 Claude Fable 5 的 70.0。在 Terminal Bench 2.1 上,Flash 达到 87.6,与 Opus 5 的 89.1 相比——差距小到可能由测试框架而非模型决定胜负。

• 通用智能体——在小米的测试运行中,AutomationBench v1.0.6 给 Flash 打出 52.3 分,高于 GPT-5.6 Sol(45.8)和 Claude Opus 5(50.3)。Toolathlon-Verified:Flash 73.6,Pro 76.9,Opus 5 80.6。

• 网络安全——表格中最悬殊的一列。CyberGym:Flash 95.1,高于其自家更大的同门模型 94.0,而 MiMo-V2.5-Pro 为 40.0。随后差距急转直下:ExploitGym 中 Flash 为 6.0,而 Opus 5 为 22.1;ExploitBench 为 25.3,对 70.0;SEC Bench Pro 为 47.5,而 GPT-5.6 Sol 为 79.1。

• 视觉智能体 — MiMo VisualCoding:Flash 71.5,Pro 72.3,Opus 5 70.0。

有一个数字值得单独拎出来,因为这是发布帖通常会藏起来的那类东西。Xiaomi 的 RL 仪表盘发布了 Flash 在 65.68,这是 DeepSWE v1.1 上的成绩——而模型卡现在印出 67.9,对应最终检查点上的同一基准。这两个不是同一种测量。仪表盘上的数字标注为 mini-swe-agent、avg@3,基于一个训练快照;模型卡中的表格是厂商对已发布权重的离线评估。这两分的差异来自运行最后阶段的增益,加上评估设置中发生的任何变化,而 Xiaomi 之外的任何人目前都无法将两者区分开。如果你从上周起一直引用 65.68,那它现在对于另一个产物来说就是一个过时的数字。

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

实际运行它需要多少成本

开放权重是一份许可,而不是一张账单,而这也正是此次发布不那么值得庆祝的地方。模型卡自身的部署部分推荐 SGLang(张量并行 16、数据并行 2,并启用 EAGLE 风格的多层推测路径),或采用张量并行 8 的 vLLM 方案,并指出稳定版 vLLM 可能落后于该架构。对于一个 309B 模型来说,这是一项多节点服务任务,其权重约占 173 GB,这还没算上为 1M token 上下文添加的 KV 缓存。推荐的采样参数为 temperature 1.0、top_p 0.95。

所以这里对“开源”的诚实界定是:小米移除了许可证壁垒,却把硬件壁垒原封不动地留在原地。现在,在你自己的轨迹数据上微调 Flash 是合法且可行的;但要在任何比一台正经 GPU 节点更小的设备上做这件事,则不行。这与托管端点是一种真实而不同的提供方式,也正因如此,使用这一代模型的两种方式并不构成竞争——它们覆盖的是不同的预算。

如果你想要这种能力却不想买节点,那么小米在那张表里用来做基准对比的模型就是务实的替代方案:GPT-5.6 Sol、Claude Opus 5 和 Claude Fable 5 如今都可以调用,而且它们一个 API 密钥即可在 OrcaRouter 上按提供商标价、0% 加价直通使用,所以你真正要做的决定是“买节点”还是“按调用量计费”。如果你想在做出选择之前,看看可调用层在相同编程任务上的表现对比,编程排行榜比厂商表格读起来更快。而今天在任何路由器上都做不到的,是调用 MiMo-V2.6-Flash 本身——我们不接入任何小米模型,小米自家卡片上的可用性说明也指向小米自己的渠道:MiMo API 平台、AI Studio、MiMo Code 和桌面应用。

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

定价问题仍然悬而未决

小米尚未公布 MiMo-V2.6-Flash 的按 token 计费费率。有关发布的报道称,该系列将沿用 MiMo-V2.5 的 API 定价,而这属于媒体说法,并非厂商价目表——V2.5 这一代已公布的海外费率约为每百万输入 token 0.1 美元,缓存输入则便宜一个数量级,但小米网站上没有任何信息证实新检查点会沿用这些价格。在价目表出现之前,你看到的任何 MiMo-V2.6 端点价格数字都只是某人的推测。

还有另外两件事仍然缺失,而且这两件事都在小米自己的待办清单上,而不是别人的。罗福莉在 RL 直播中的说法是,训练环境和 RL 代码将会开源,发布材料也重申了这一承诺;这些仓库目前提供的是权重、技术报告和部署说明,而不是训练栈。而且没有独立评估:没有提交到排行榜,也没有第三方复跑 DeepSWE 或 CyberGym 列。对于任何要判断一个拥有 15B 激活预算的 309B 模型是否值得占用一个节点的人来说,这才是最重要的差距。

什么会改变局面

有三个信号值得关注,大致按其能对决策产生多大影响的顺序排列。一份公开的价目表会把它从一个自托管项目变成一项你可以拿去与托管式前沿服务比较的条目。由第三方在相同测试框架上运行——DeepSWE 或 Terminal Bench,提交结果而非自我报告——将能确定 67.9 是真实排名还是一个有利配置。而 RL 环境如果落地,对大多数团队来说会是更有意思的产物,因为它们正是你在自有数据上复现自我改进循环所需要的东西。

在那之前,对这次发布的实际解读范围有限且明确。MiMo-V2.6-Flash 是一个正当的开放权重、MIT 许可、全模态智能体模型,其规模意味着需要集群——而且它是 MiMo-V2.6 一代中第一个你能真正拿到手的检查点,而上周还不能这么说它。

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新