
MiMo-V2.6-Pro 对比 Gemini 3.1 Pro:一个仅存在于某一指数版本上的 16 分差距
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 Xiaomi MiMo-V2.6-Pro 和 Gemini 3.1 Pro Preview 放在 Artificial Analysis Intelligence Index 上并列比较,你会得到 46 对 30——一款输入成本仅为五分之一的模型领先十六分。把它们放在两家厂商各自发布时公布的数据上并列比较,Gemini 3.1 Pro 则以十一分胜出。这两种解读都来自同一个评估方。它们之所以不一致,正是理解 2026 年 9 月如何比较模型时最有用的一件事:这个指数已在二者脚下被重建,而一个分数只有与产生它的版本号放在一起才有意义。
v4.3.2 综合评分是当前版本。它包含十项评估——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1——在该评分中,于 2026 年 9 月 22 日读取时,小米的模型得 46 分,谷歌得 30 分。在 2026 年 2 月 19 日发布时,Gemini 3.1 Pro Preview 在当时的量表上报告为 57 分,位居榜首。这两个 Gemini 数字并不是下降。它们是两把不同的尺子。
每个模型到底是什么
Gemini 3.1 Pro Preview 是 Google 的前沿推理模型,于 2026 年 2 月 19 日发布,七个月后仍带有 preview 标签。它拥有 100 万 token 的上下文窗口,输出上限为 65,536 token——Artificial Analysis 将其列为 64K,我们自己的模型页面则列为 65K——可接受文本、图像、PDF、音频和视频输入,输出文本。它是专有模型,参数量未公开,知识截止日期为 2025 年 1 月。Google 自家 API 的收费为:输入低于 200K 时,每百万输入 token 2.00 美元、每百万输出 token 12.00 美元;超过后分别涨至 4.00 美元和 18.00 美元,缓存输入为 0.20 美元。
Xiaomi MiMo-V2.6-Pro 于 2026 年 9 月 22 日正式全面开放,强化学习检查点仓库则在前一天出现。它是一款稀疏专家混合模型,总参数量达 1.02 万亿,每 token 激活 420 亿参数,上下文窗口为 100 万 token,原生支持文本、图像、视频和音频多模态,并以 MIT 许可证提供可下载权重。小米没有因新检查点而上调价格,而是维持上一代 MiMo-V2.5 的定价:每百万输入 token 0.43 美元、每百万输出 token 0.87 美元,缓存折扣 99%,在 7:2:1 的缓存命中/输入/输出组合下混合费率为 0.18 美元。
• {{1}}权重{{/1}} — Xiaomi MiMo-V2.6-Pro 采用 MIT 许可并可下载;Gemini 3.1 Pro Preview 为专有模型,仅提供 API
• 参数 — MiMo-V2.6-Pro 总计 1.02T / 激活 42B;Gemini 3.1 Pro Preview 未披露
• 上下文 — 两者均为 1M token;Gemini 3.1 Pro Preview 的输出上限为 65,536 个 token,MiMo-V2.6-Pro 未公布同等的上限
• 模态 — MiMo-V2.6-Pro 支持文本、图像、视频和音频;Gemini 3.1 Pro Preview 支持文本、图像、PDF、音频和视频
• 标价 — MiMo-V2.6-Pro 每 100 万 tokens 为 $0.43 / $0.87;Gemini 3.1 Pro Preview 在输入低于 200K 时为 $2.00 / $12.00,高于 200K 时为 $4.00 / $18.00
• 缓存 — MiMo-V2.6-Pro 99% 折扣;Gemini 3.1 Pro Preview 每 100 万次缓存读取 $0.20
• 速度 — MiMo-V2.6-Pro 134.3 输出 tokens/秒;Gemini 3.1 Pro Preview 121.8
• 首个 token 响应时间——MiMo-V2.6-Pro 2.15 秒;Gemini 3.1 Pro Preview 63.62 秒
• 运行索引的实测成本 — MiMo-V2.6-Pro $206.66,即每项任务 $0.13;Gemini 3.1 Pro Preview $1,310.21,即每项任务 $0.67

预览标签才是真正的区别
以上内容全部都是规格说明。真正改变你解读整篇对比方式的,是“preview”这个词。预览模型是一种候选模型,谷歌并未承诺会将其保留在该端点上。这一点对一个对比页面来说意义重大,而十六分的指数差距则不然,因为一个你无法指望六个月后还在那儿的模型,不是你据以标准化选型的模型——而谷歌自家的产品家族早已把它甩在身后。Gemini 3.6 Flash 和 Gemini 3.8 Flash 在编程和智能体任务上以更低的成本领先于 Gemini 3.1 Pro,这正是为何一篇关于 3.1 Pro 发布的技术评测称其为不折不扣的上一代产品。AA 页面本身在智能项上把它列为 202 个模型中的第 71 名。
小米的模型处于相反的位置。它本周发布,权重以 MIT 许可证开放,而服务特性是它最强的地方。每秒 134.3 个输出 token 使它在 114 个速度被测模型中排第 11,而 2.15 秒的首 token 时间比 Gemini 3.1 Pro Preview 的 63.62 秒快约三十倍。对于交互式应用来说,这并不是一个打破平局的因素。它是产品与演示之间的区别,而且是最可能在基准测试表上被忽视的数字。
钱到底流向何处
按 token 计算的算术低估了这两者之间的差距,因为模型完成同样的任务并不会消耗相同数量的 token。更清晰的数字是 Artificial Analysis 对每个模型运行其完整 Intelligence Index 所测得的:MiMo-V2.6-Pro 为 206.66 美元,Gemini 3.1 Pro Preview 为 1,310.21 美元。相同的套件、相同的测试框架、相同的测量方式——在完全相同的任务集上相差 6.3 倍,而且这个差异已经考虑到了推理模型会输出大量 token 进行思考这一事实。Gemini 3.1 Pro Preview 在整个指数中生成了 6700 万个输出 token;其价格层级模型的中位数是 9000 万,因此它实际上每分比同类模型更经济,而评估它的成本仍然是小米模型的六倍。
然后给它配上一条生产循环。一次 30 步的 agent 运行,每步读取 200,000 个 token 的上下文、每步写出 2,000 个 token,那么每次运行就是 600 万输入 token 和 60,000 输出 token。在低于 200K 档位的 Gemini 3.1 Pro Preview 上,这是 $12.00 的输入和 $0.72 的输出——每次运行 $12.72。在 MiMo-V2.6-Pro 上则是 $2.58 和 $0.05——$2.63。在 Google 模型上输入一旦超过 200,000 个 token,输入费率就翻倍到 $4.00,此时同一条循环还没算输出就已经要花 $24.00。缓存会改变这两个数字,但便宜模型上 99% 的折扣对上昂贵模型上 $0.20 的缓存读取,会让昂贵模型在上下文密集的循环上贵出整整一个数量级。

路由问题,诚实陈述
这部分很容易搞错。Gemini 3.1 Pro Preview 已在 OrcaRouter 上线,模型标识为 google/gemini-3.1-pro-preview,只需一个兼容 OpenAI 的密钥即可访问,价格按提供商目录价、0% 加价——因此 Google 一旦调价,我们这边当天就会同步生效,而不是等到下一个计费周期。Xiaomi MiMo-V2.6-Pro 不在 OrcaRouter 上。任何小米模型都不在,与其让模型页面给出相反的暗示,不如直接把这一点说清楚。如今要接入它,只能通过小米自家平台,或某个收录了它的第三方目录。
这种不对称性,恰恰是路由器在这场比较中能占有一席之地、而非沦为附注的原因。这两个模型争夺的并不是同一批请求。Gemini 3.1 Pro Preview 是你可能已经在付费使用的现有选择,而本页要回答的问题是:这个新的廉价模型能否分走它的一部分流量。要正确进行这项测试,就得把你自己的提示词分别发给两者并对比回答,而不是去读什么排行榜——而为此再开一份合同、再配一把密钥、再建立一套计费关系,正是让这项测试永远无法落地的阻力所在。一把密钥,两条通道由我们负责路由,比较就变成了一次配置更改。自动故障转移则补上了另一半:预览版模型可能在毫无预警的情况下被撤回或限流,而同一端点背后的第二条通道,正是把这种情况从一次服务中断变成一次路由决策的关键。

该选哪一个
当任务需要原生支持 PDF 和音频输入时,当你已经身处 Google 生态系统之中时,或者当你特别需要该模型的行为表现、并且能够承受预览版端点被弃用的风险时,就选择 Gemini 3.1 Pro Preview。其 63 秒的首 token 时间意味着,无论营销宣传如何强调交互性,它在实践中都是一款面向批处理和离线工作负载的模型。
当吞吐量是约束条件时,当循环上下文繁重且高度重复时,当你希望把权重部署在自己的硬件上时——MIT 许可证允许商业部署、修改和进一步训练——或者当首 token 延迟本身就是产品体验的一部分时,就选择 MiMo-V2.6-Pro。它是一个罕见的存在:既便宜又快速,而这种组合的价值远超那十六个指数点所体现的差距。
能改变这一局面的是 Gemini 3.1 Pro 的非预览版继任者,或者有人独立复现小米用其自有测试框架发布的 DeepSWE 数值——Pro 为 72.57,Flash 为 65.68,在整个强化学习运行过程中分别从 58.4 和 48.8 提升而来。这些数字是厂商自报的,是在小米的评分器上用 mini-swe-agent 按三次平均评估得出的,且未提交至任何公开排行榜。在有人重新运行这些评测之前,应该引用的是 Artificial Analysis 的 46,而且它与 30 是以同一把尺子衡量的。
OrcaRouter 将200 多个模型整合到一个兼容 OpenAI 的端点之后,按提供商标价提供,0% 加价,因此供应商一旦调价,当天即可生效。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
