
MiMo-V2.6-Pro 对比 GPT-5.6 Sol:每任务一个指数点的成本高出十五倍
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
在 2026 年 9 月 25 日读取的 Artificial Analysis Intelligence Index v4.3.2 上,GPT-5.6 Sol 在最高强度下得分为 47,Xiaomi 的 MiMo-V2.6-Pro 得分为 46。一分之差。真正区分它们的数字不是得分,也不是每 token 费率——而是单个索引任务成本:Artificial Analysis 公布 GPT-5.6 Sol 为 1.99 美元,MiMo-V2.6-Pro 为 0.13 美元。为一分付出十五倍的钱。而截至本次读取时,评测方自己关于该模型的页面已带有弃用提示,因为 GPT-6 Sol 已将其取代。
小米于2026年9月21日发布了 MiMo-V2.6-Pro 的权重和技术报告,距本次解读仅四天;OpenAI 于2026年7月9日发布了 GPT-5.6 Sol。上述两个事实都是自上次撰写这一对比组合以来新出现的,而且它们指向相反的方向。那份弃用通知表明,这一对比针对的是一个 OpenAI 早已越过的模型。而按任务计算的数据则表明,当两款模型都按标价报价时看起来像舍入误差的那点差距,在实际工作负载下,就是整个决策的关键。这两者中哪一个重要,取决于你是在采购一款模型,还是在替换一款模型。
这两页现在所说的内容
GPT-5.6 Sol 于 2026 年 7 月 9 日发布,是 GPT-5.6 系列的旗舰型号。在 OpenAI 第一方 API 上,其标价为每百万输入 token 4.00 美元、每百万输出 20.00 美元,并享有 90% 的缓存折扣;页面记录显示,本次索引运行共生成 9000 万个输出 token,而中位数为 8800 万个。它测得每秒 73 个输出 token,同一页面称其快于平均水平,后者中位数为 72 t/s。其索引条目在同类别 210 个模型中排名第 19。
Xiaomi MiMo-V2.6-Pro 是一个稀疏混合专家(MoE)检查点,总参数量 1.02 万亿,激活参数 420 亿,采用 MIT 许可,具备 100 万 token 的上下文窗口,支持文本、图像、语音和视频输入,输出为文本。其定价为每百万 token 0.43 美元和 0.87 美元,并享有 99% 的缓存折扣——分别是 Sol 输入价格的十分之一、输出价格的二十三分之一。在索引运行中,它生成了 1.4 亿个输出 token,实测输出速度为每秒 43.6 个 token,其页面称这相对于 67.1 t/s 的中位数而言明显偏慢。
• 索引任务成本 — MiMo-V2.6-Pro $0.13;GPT-5.6 Sol $1.99 — 差距为 15 倍 • 标价 — MiMo-V2.6-Pro 每 1M $0.43 / $0.87;GPT-5.6 Sol $4.00 / $20.00 • 缓存折扣 — MiMo-V2.6-Pro 99%;GPT-5.6 Sol 90% • 索引运行中的输出 token — MiMo-V2.6-Pro 140M;GPT-5.6 Sol 90M • 输出速度 — MiMo-V2.6-Pro 43.6 t/s,对比中位数 67.1;GPT-5.6 Sol 73 t/s,对比中位数 72 • 上下文与权重 — MiMo-V2.6-Pro 1M 且 MIT 许可;GPT-5.6 Sol 1M 且专有

弃用通知才是影响更大的那一行
Artificial Analysis 现在打开 GPT-5.6 Sol 页面时会显示一个方框提示:“该模型已弃用。我们仅继续针对默认的 1 万输入 token 工作负载进行性能基准测试”,后面接着一句:OpenAI 已推出更新的模型 GPT-6 Sol(max),应当改用它。因此,指数上的 47 分,反映的是一个不再值得购买的模型。这并不代表该读数有误——它是在同一指数、同一天、相同努力设置下测得的,与 46 分一样——但它改变了这一比较的意义。它不再是“我该用哪款旗舰”,而是“在它还是榜首的那一刻,专有模型榜单的顶端值多少成本”。
这种重新表述比听起来更重要,因为评估器页面上的弃用通知,是少数几个能让供应商的产品节奏以数据变更而非新闻稿形式显现的地方之一。分数是冻结的;模型并不对外提供。任何你针对 47 构建的东西,都是在针对一个快照构建。

为什么应该以每个任务的数值作为建模依据
按 token 计的费率会美化廉价模型,并在并非 token 中性的工作负载上造成误导。索引任务成本是另一种衡量方式:它是评估器为从每个模型得到一个答案实际花费的成本,同时计入了费率以及模型选择输出的 token 数量。在索引运行中,MiMo-V2.6-Pro 输出的 token 比 Sol 更多——1.4 亿对 9000 万,约 1.6 倍——但每个任务成本仍为 $0.13,而 Sol 为 $1.99。在输出上,费率优势约为 23 倍;冗长惩罚为 1.6 倍;两者综合就是每任务 15 倍的差距。
这就是成本模型应当建立其上的算术,也是当你把 $0.87 与 $20.00 相比后就停下时看不见的算术。它还会告诉你,什么会推翻这个结论。如果你的工作负载以极短的输出为主,Sol 的 token 数会向你的 token 数坍缩,二十三倍的费率差距起了主要作用,因此真实倍数会朝费率差距靠拢,而不是远离它。如果你的工作负载以冗长的推理轨迹为主,MiMo-V2.6-Pro 的 1.6× 冗长程度会叠加放大,$0.13 就会成为上限,而不是估算值。已公布的数字是对某一个基准测试形态的测量,而不是你可以直接交给财务部门的报价。
延迟线是诚实的平衡物
以每秒 43.6 个输出 token 的速度,MiMo-V2.6-Pro 比同日测得的 73 的 GPT-5.6 Sol 更慢——也比它自家页面拿来对比的模型更慢,后者的中位数是 67.1。它的页面也直言不讳地承认了这一点:“明显偏慢”。对于批量流水线而言,这是可以定价的吞吐成本。对于交互式智能体而言,这是一个产品决策,而每任务便宜十五倍并不能让慢模型变快。如果你的约束是每轮预算而非月度账单,那么真正重要的比值是 43.6 对 73,而 MiMo-V2.6-Pro 输掉了它。
这会落到路由器上的什么位置
这种组合的有用之处不在于“二选一”,而在于两个模型对应同一个指数,且评估器会为每个模型公布每项任务的成本,因此可以依据实测成本而非厂商分级来划分。在 OrcaRouter 上,目录可达200+ 个模型,只需一个密钥,按各供应商的标价、0% 加价——供应商降价当天就能反映到你的账单上,无需重新谈判第二份合同——并且路由 DSL让工作负载可以按任务而非按品牌,把廉价、高并发的调用交给一个模型,把困难的调用交给另一个模型。自动故障转移可覆盖更便宜的那条路线被降级的情况。小米 MiMo-V2.6-Pro 不在我们的路由中——在供应商完成接入之前,我们不会上架某个模型——因此就这项比较的这一方而言,诚实的答案是供应商自己的 API,或者你已有合作关系的任一托管平台。

下周之前该怎么处理这个
2026年9月25日发生了两处变化,其中只有一处与价格有关。GPT-5.6 Sol 在被测得的指数 47 上带有弃用通知,这使它不再是采购决策的对象,而只作为基准参照保留。MiMo-V2.6-Pro 的实测成本为每项指数任务 0.13 美元,而 Sol 为 1.99 美元,也就是为换取一个指数点要多花十五倍的钱——而且它的速度是每秒 43.6 个 token,既慢于与之对比的模型,也慢于它自身所属类别的中位数。在这两个数字变成决策依据之前,先拿它们套算你自己的流量:每任务成本是一项测量值,而非费率;延迟是一项测量值,而非观点。如果你的输出简短且非交互,那么选择开放检查点的理由比指数差距所显示的更为充分。如果你的输出很长,或者你的用户在等待,那十五倍的节省换来的是一个更慢的产品,而这种取舍只有你的工作负载才能定价。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
