OrcaRouter 模型雷达主视觉卡片,用于 MiMo-V2.6-Pro 与 DeepSeek V4 Pro 之间的对比,副标题为“两款开源旗舰,指数相差十分”,每个模型各占一个面板,页脚注明两者均采用 MIT 许可、具备 100 万 token 上下文窗口,且分数为 v4.3.2,与更早版本的指数不可比。
Guides & Insights

MiMo-V2.6-Pro 对比 DeepSeek V4 Pro:两大开源旗舰,指数相差十分

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Xiaomi MiMo-V2.6-Pro 和 DeepSeek V4 Pro 属于同一类对象——万亿参数级中国混合专家旗舰模型,MIT 许可,100 万 token 上下文,权重开放、今天就能下载——而它们在 Artificial Analysis Intelligence Index v4.3.2 上相差十分,46 对 36。它们对旗舰模型该用来做什么也存在分歧。DeepSeek V4 Pro 于 2026 年 8 月 13 日发布,是一款纯文本推理模型:1.6 万亿参数,激活 49 亿,其公开能力范围中没有任何视觉、音频或视频输入。Xiaomi MiMo-V2.6-Pro 于 2026 年 9 月 21 日发布,1.02 万亿参数,激活 42 亿,接受文本、图像、视频和音频。这一差异所决定的部署数量比那十分更多,而且在你比较其他任何东西之前,这是首先要弄清楚的。

同一许可证,不同机器

先从不折不扣相同的部分说起,因为这比你在两个相互竞争的实验室之间所预期的还要多。两者都以 MIT 许可证标签在公开代码仓库中发布,这意味着可以进行商业部署、修改和进一步训练,没有收入门槛或使用领域条款。两者都声称拥有 1M token 的上下文窗口。两者都是稀疏专家混合设计——这种架构在这个规模上已成为默认选择,而非差异化因素。而且,训练两者的实验室在方法上披露的信息都比西方前沿实验室少。

• 参数 — MiMo-V2.6-Pro 总计 1.02T / 激活 42B;DeepSeek V4 Pro 总计 1.6T / 激活 49B

• 输入模态 — MiMo-V2.6-Pro 支持文本、图像、视频、音频;DeepSeek V4 Pro 仅支持文本

• 上下文 — 两者均为 1M tokens;DeepSeek V4 Pro 的输出上限为 384K tokens

• 指数得分——MiMo-V2.6-Pro 在智能指数 v4.3.2 上得 46 分;DeepSeek V4 Pro 在同一版本上得 36 分

• 每项 Index 任务的成本 — MiMo-V2.6-Pro $0.13;DeepSeek V4 Pro $0.67

• 标价 — MiMo-V2.6-Pro 为每 100 万 tokens $0.43 / $0.87;DeepSeek V4 Pro 按 Artificial Analysis 所列,为 $1.32 / $3.96,尚未计入 DeepSeek 自身的峰谷时段定价

• 速度 — MiMo-V2.6-Pro 每秒输出 134.3 个 token;DeepSeek V4 Pro 97.4

• 首个 token 时间 — MiMo-V2.6-Pro 2.15 秒;DeepSeek V4 Pro 1.62 秒

把那份清单读两遍,因为有两行是反直觉的。更小的模型得分高出十分——420 亿活跃参数胜过 490 亿,这不是四舍五入的差别,而是后训练的结果,也是这次对比中最清晰的一个信号:强化学习的质量已经超越原始规模,成为真正的杠杆。而且更便宜的模型同时也是更快的那个,无论是吞吐量还是每任务成本都是如此,这与通常的取舍恰好相反。小米卖给你的不是用耐心换来的折扣。DeepSeek 的优势在于首 token 时间,1.62 秒对 2.15 秒——这是真实存在的,但也是 V4 Pro 唯一领先的类别。

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

为什么相同的索引版本在这里很重要

跨索引版本比较开放权重模型,正是大多数已发表对比出错的原因,因此版本号绝非无关紧要的脚注。Artificial Analysis 于 2026 年 9 月将 Intelligence Index 重建为 v4.3,而分数在这一分界线上出现了显著变动——Claude Opus 5 在 v4.2 与 v4.3 之间下降了三分,开放权重阵营也随之重新排序。上述两个数字均出自 v4.3.2,这意味着 46 与 36 彼此之间可以直接比较。但它们与你在别处看到的这两个模型的旧数据并不可比。

这不是假设。DeepSeek V4 Pro 在2026年8月被广泛报道为在较早的指数标尺上得分为53,我们当时自己的报道也采用了这一说法。在 v4.3.2 上,同一个模型的读数是36。模型本身没有任何改变;改变的是标尺。如果你的电子表格里把53与 MiMo-V2.6-Pro 的46放在一起,那么你得到的比较会把你引向错误的模型。正确的配对是46对36,正确的结论是:晚五周发布、参数量只有三分之二的模型,明显更领先。

两个实验室之间的报告差距

还有第二个更微妙的差异,它关乎每个实验室愿意接受检查的内容。

MiMo-V2.6-Pro 的 46 分是一项 Artificial Analysis 测量结果。这家评测机构在已发布的模型上运行了自己的评测套件——涵盖推理、知识、数学和编程的十项评测——并公布了结果,以及运行数据:每秒 134.3 个 token,首 token 耗时 2.15 秒,99% 的缓存折扣,每项索引任务 0.13 美元,总评测成本 206.66 美元。这是第三方关于小米模型给出的数字。

DeepSeek V4 Pro 最受关注的智能体指标均出自 DeepSeek 自身,而这些数字与独立评测结果之间的差距已有据可查。该公司的发布材料显示,Terminal-Bench 2.1 为 87.9,DeepSWE 为 62.7,CyberGym 为 83.3,SWE-bench Verified 为 80.6。独立测试则给出 Terminal-Bench 2.1 为 78.7——比厂商数字低约九分——以及 Artificial Analysis Coding Index 为 68.8。这些厂商数字没有一个得到复现,而 Terminal-Bench 上的差距之大,正是应当把其余数据视为宣称而非实测结果的理由。

Xiaomi 对同一个问题有自己的版本。其仪表板报告称,MiMo-V2.6-Pro 在其强化学习运行中于 DeepSWE v1.1 上从 58.4 提高到 72.57,该评估在 Xiaomi 自己的测试框架上使用 mini-swe-agent 进行,取三次平均。这不是排行榜提交,也没有任何外部方重新运行过它。因此,两个模型在厂商基准测试上都没有一份无瑕的健康证明。不同之处在于,MiMo-V2.6-Pro 还带有一个独立综合分数,而 DeepSeek 的发布在对应时刻并没有这个分数——如果你是基于证据而非营销在两者之间做选择,那么这就是应当被看重的非对称性。

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

这在生产环境中是什么样子

模态差异是实际的分水岭,而它对 DeepSeek 有利的频率,并不像十分差距所暗示的那么高。如果你的流水线需要摄取截图、以图像形式呈现的 PDF、视频帧或音频,MiMo-V2.6-Pro 能用单个模型原生处理,而 DeepSeek V4 Pro 完全无法处理——你需要在前面另加一个视觉模型,这意味着第二份合同、第二种故障模式和第二笔账单。如果你的工作负载是纯文本推理,那么额外的模态就是你不必为之付费的累赘。

每个索引任务的成本是另一个需要记住的数字。在受控且完全相同的任务集上,以相同方式对两者进行测量,$0.13 对 $0.67,差距达到五倍。DeepSeek 实行高峰/非高峰计费机制,会根据你调用时机的不同而大幅削减其实际费率,因此真实世界的比例在非高峰时段会缩小,在高峰时段则会扩大——如果你流量具有突发性且无法选择流量到达的时间,这个细节就很重要。

这正是 DeepSeek 一方拥有真正优势的地方,而这与模型本身无关:它就在我们的平台上。通过 OrcaRouter 密钥,可以按提供商列表价格、0% 加价访问 deepseek/deepseek-v4-pro ,并支持跨提供商自动故障转移以及在此之上的路由 DSL——因此高峰/非高峰的算账、提供商之间的价差以及回退路径,都是你可以配置的东西,而不是需要你从头搭建的东西。MiMo-V2.6-Pro 不在我们的平台上,这一点我们会直说:如今要访问它,意味着要走小米自有平台或某个将其收录的第三方目录,而在数据采集时,Artificial Analysis 只统计到一个 API 提供商。一条路线不是一条生产路线,这也正是把 MiMo-V2.6-Pro 视为一个现在就该评估、并需谨慎路由、且背后要有其他备选的模型的最有力理由。

哪一个,什么时候

如果你的工作只涉及文本,如果你需要 384K 的输出上限,如果你想要两者中最快的首 token 时间,或者如果你已经在我们平台上,并且想要一条具备故障转移且无需新集成的万亿参数开放权重通道,那就选择 DeepSeek V4 Pro。它作为现有选择是有原因的,而早五周意味着多出五周的工具、量化和服务方案积累,这是 9 月发布的模型尚未积累的。

如果任务是多模态的,如果每任务成本在你的单位经济效益中占主导,如果吞吐量比半秒的延迟更重要,或者如果你想要在独立测评指标上当前领先的开源权重模型,那就选择 MiMo-V2.6-Pro。两者的 MIT 许可证意味着无论选哪一个,权重问题都已解决——你可以把任一模型跑在自己的硬件上、对它进行微调,并将其商业化发布。

值得考虑的配置根本算不上一种取舍。用路由器,你可以保留 DeepSeek 通道,以非高峰费率处理纯文本推理,同时为多模态请求增设一条 MiMo 通道,并在负载较轻的那条路径前放置一个回退方案。这并非对冲,而是让每个请求匹配到真正能处理它的模型——相比选定一个赢家、再指望工作负载永不改变形态,这是更便宜也更持久的答案。

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

这个对比目前尚无法回答的问题

两款模型被引用最多的基准测试均由厂商自行运行,且未经复现。对 DeepSeek V4 Pro 而言,这一缺口自八月起就一直存在,也正是其独立评测分数低于发布时数字的原因。对 MiMo-V2.6-Pro 来说,独立综合评分已有,但智能体能力的分项拆解缺失——Artificial Analysis 只公布了 46 这一总分,并未给出其下各项评测的分布,而正是这一细节能说明一款模型究竟该放进智能体循环,还是问答流水线。

在那份对比结果公布之前,在有人重新运行小米的 DeepSWE 测试框架之前,站得住脚的立场比两家实验室的宣传都要窄:MiMo-V2.6-Pro 在一项独立综合指标以及实测的每任务成本上领先,DeepSeek V4 Pro 则在成熟度、输出长度、首 token 延迟,以及能够经由一条背后具备冗余的通道访问上领先。五周是很短的先发优势,而这是 DeepSeek 唯一拥有的先发优势。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新