
MiMo-V2.6-Pro 对比 GPT-5.6 Sol:一个指数点,二十二倍的混合费率
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在Artificial Analysis Intelligence Index v4.3.2上,于2026年9月22日读取,该厂商的GPT-5.6 Sol在最大努力下得分47,小米的MiMo-V2.6-Pro得分46。一分之差。Artificial Analysis为两者公布的综合费率——按7:2:1的缓存命中、输入、输出组合——GPT-5.6 Sol为3.08美元,MiMo-V2.6-Pro为0.18美元。为一个指数点付出22倍的费用,正是这场对决的全部格局,而有趣的问题不在于这一点是否值得。而在于这一点具体存在于哪些请求中,因为总体数据不会告诉你。
真正让这两者值得放在一起比较的原因是,它们显然并不属于同一类别。GPT-5.6 Sol 是一款专有的前沿模型,具备多智能体模式,还有与之相匹配的价目表。Xiaomi MiMo-V2.6-Pro 则是一个采用 MIT 许可的开源权重检查点,于 2026 年 9 月 22 日发布,强化学习代码库在前一天上线,而它的定价却像是中端模型。一个万亿参数的开源模型能与 OpenAI 的旗舰模型仅相差一分,这才是新闻所在。至于你要如何利用这一事实,那是另一个独立的决定。
这两个模型,说白了。
GPT-5.6 Sol 于 2026 年 7 月 9 日发布,作为 GPT-5.6 系列的旗舰,与 Terra 和 Luna 一同推出,OpenAI 将裸的 gpt-5.6别名路由到它。它是专有模型,接受文本和图像输入并返回文本,支持从 none 到 xhigh 的推理强度,外加 Sol 独有的“ultra”多智能体模式,知识截止日期为 2026 年 2 月。在 OpenAI 第一方 API 上,其标价为每百万输入 token 4.00 美元、每百万输出 20.00 美元,缓存输入为 0.50 美元,上下文窗口为 100 万 token。Artificial Analysis 测得每秒 77.3 个输出 token,首 token 时间 127.21 秒,运行完整索引的成本为 3,464.84 美元。
Xiaomi MiMo-V2.6-Pro 是一款稀疏专家混合模型,总参数量达 1.02 万亿,每 token 激活 420 亿参数,拥有 100 万 token 的上下文窗口,并具备覆盖文本、图像、视频和音频的原生多模态能力。小米延续了上一代的定价,而非针对新检查点上调价格,因此如此规模的模型标价仅为每百万 token 0.43 美元和 0.87 美元,并享有 99% 的缓存折扣。Artificial Analysis 实测输出速度为每秒 134.3 个 token,首 token 延迟 2.15 秒,运行该基准的成本为 206.66 美元——每项任务 0.13 美元。
• 权重 — MiMo-V2.6-Pro 采用 MIT 许可,可下载;GPT-5.6 Sol 为专有模型,仅提供 API
• 参数 — MiMo-V2.6-Pro 总计 1.02T / 激活 42B;GPT-5.6 Sol 未公开
• 上下文 — 两者均为 1M tokens;GPT-5.6 Sol 的输出上限为 128K
• 模态 — MiMo-V2.6-Pro 支持文本、图像、视频和音频;GPT-5.6 Sol 公布的输入范围为文本和图像
• 标价 — MiMo-V2.6-Pro 每 100 万 $0.43 / $0.87;GPT-5.6 Sol $4.00 / $20.00,缓存输入 $0.50
• 混合费率 — MiMo-V2.6-Pro 每 100 万 $0.18;GPT-5.6 Sol $3.08
• 每个索引任务的实测成本 — MiMo-V2.6-Pro $0.13;GPT-5.6 Sol 完成完整索引为 $3,464.84
• 速度 — MiMo-V2.6-Pro 每秒输出 134.3 个 token;GPT-5.6 Sol 77.3
• 首token时间 — MiMo-V2.6-Pro 2.15秒;GPT-5.6 Sol 127.21秒
• 推理控制——GPT-5.6 Sol 提供 none/low/medium/high/xhigh/max 六档,外加一种 ultra 多智能体模式;MiMo-V2.6-Pro 则未公布与之对等的档位梯度

那一个点实际所在的位置
在十项评估的复合评分中,一分的差距在总体层面不过是舍入误差,在单项层面却是天堑。该套件涵盖 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1——涉及推理、知识、数学与编程——而两家厂商均未公布这两个模型的分项评估明细。这一缺失是本页双方共有的真实局限,值得直言,而不是用复合评分来粉饰。
有记录可查的情况具有方向性,它指向智能体工作,认为差距集中在那里。GPT-5.6 Sol 的发布材料报告称,其在 Agents' Last Exam 上达到 53.6%——这是一项长期运行、覆盖 55 个领域的专业工作流评估,OpenAI 将其描述为新高;在 SWE-Bench Pro 上为 64.6%;在 Terminal-Bench 2.1 上为 88.8%;在用于计算机使用的 OSWorld 2.0 上为 62.6%。其 BrowseComp 得分 90.4%,在 ultra 模式下升至 92.2%,该模式运行四个并行子智能体,token 成本约为四倍。这些都是厂商在自家测试框架上给出的数字,通常的保留意见适用于其中每一项——但它们所属的类别,恰恰是一个百分点的综合差距最不可能被均匀分布的地方,而小米没有为 MiMo-V2.6-Pro 公布任何可比的智能体分项成绩。
制衡因素在于,MiMo-V2.6-Pro 自家的厂商数据完全属于另一个任务族。Xiaomi 报告称,该模型在其强化学习运行中于 DeepSWE v1.1 上从 58.4 提升至 72.57,评估使用 mini-swe-agent、取三次平均,基于 Xiaomi 自己的评分器,且从未提交至任何公开榜单。把 72.57 与任何 Sol 数字并列,就等于发明一种并不存在的比较。唯一由同一评估者对两个模型都实际运行过的数字,是 46 和 47。
成本比较,正确做法
按 token 计算的算术低估了差距,因为这两个模型完成同一项任务所消耗的 token 数量并不相同。公平的单一数字是 Artificial Analysis 为对每个模型运行其完整指数所测得的:MiMo-V2.6-Pro 为 $206.66,GPT-5.6 Sol 为 $3,464.84。相同的套件、相同的测试框架、以完全相同的方式测量——在受控任务集上存在 16.8 倍的差异,而且这一差异已经吸收了 Sol 是推理模型、会生成 token 进行思考这一事实。
现在来看一个生产环境中的循环。一次 30 步的智能体运行,每步读取 200,000 个 token 的上下文并写入 2,000 个 token,那么每次运行就是 600 万输入 token 和 60,000 输出 token。在 GPT-5.6 Sol 上按标价计算,这是 24.00 美元的输入和 1.20 美元的输出——在缓存之前每次运行 25.20 美元。在 MiMo-V2.6-Pro 上则是 2.58 美元和 0.05 美元——2.63 美元。缓存会同时改变两者:Sol 的缓存输入为 0.50 美元,而 MiMo-V2.6-Pro 有 99% 的折扣,即便如此,在上下文密集型循环上,昂贵模型仍会贵出一个数量级,而这正是智能体所运行的循环。
比较中延迟这一半比价格这一半更为悬殊,却得到的关注更少。GPT-5.6 Sol 测得首个 token 耗时 127.21 秒。MiMo-V2.6-Pro 测得 2.15 秒。这是五十九倍的差距,而这个数字决定了交互式产品究竟是否可能。以最高算力运行的 Sol 在实践中就是一个批处理模型——你提交,你等待,你再回来。如果你的应用会阻塞在首个 token 上,那么无论榜单怎么说,选择早已替你做出了。

一键双道
只需一个 OrcaRouter 密钥,即可按提供商标价、0% 加价访问这两款模型——GPT-5.6 Sol 即openai/gpt-5.6-sol,这是我们为其提供的自有路由。由于我们按提供商标价原价透传、不添加任何加价,任意一方的价格变动当天即可在我们的平台上生效,而无需等待重新报价。
路由 DSL 正是这种搭配变得有趣而非仅仅方便的地方。两个模型只差一个指数点,而其中一个每任务成本是另一个的十六倍,它们并不是供你二选一的替代方案——它们是一种双车道配置。把工作负载的大头送入廉价车道,并用你定义的谓词把长尾路由到昂贵车道:未通过自检的请求、符合复杂度规则的请求、失败成本高到足以让这点开销成为廉价保险的请求。故障转移是另一半。Sol 得到广泛服务;MiMo-V2.6-Pro 本周发布,而当 Artificial Analysis 捕捉到它时,只有一家 API 提供商将其列出——对于你要放进生产路径的模型来说,这是一条单薄的路线。一个能够回退的路由器,既让廉价车道可以安全采用,也让昂贵车道成为可选项而非必需项。

该选哪一个
当任务的失败成本远超 token 成本时,就选 GPT-5.6 Sol——长期智能体工作且带有真实副作用、计算机使用自动化、工具调用中一次错误调用比一次缓慢调用更糟的场景,以及任何你已经在花钱请人检查输出的情况。$3,464.84 的索引运行不是回避它的理由;这是该档位的价格,而该档位存在自有其道理。
当规模是约束条件时,当工作负载上下文繁重且高度重复时,当需要把首 token 延迟降到人类愿意等待的程度时,当你希望把权重放在自己的基础设施中——MIT 许可证允许商业部署、修改和进一步训练——或者当只有每千 token 成本低至五分之一美分时单位经济性才成立时,选择 MiMo-V2.6-Pro。其每秒 134.3 token 的速度,使其能够以大多数万亿参数开源模型无法做到的方式进行交互式使用,这是一种能力,而不是折扣。
如果你有路由器,那就两个都选,因为对"哪个更好"最诚实的回答是:一个百分点的综合得分差距并不是一个定论——它衡量的是两者平均而言有多相似,以及它们在尾部情形上可能有多大差异。要避免的失败模式是:因为成本比是22倍就把便宜模型定为标准,到第三个月才发现某一类请求需要贵的那个,而且没有任何路径能把它路由过去。镜像的失败则是:为一个46指数模型也能同样完成的摘要任务支付Sol级别的费率。两者都不是模型的问题。两者都是配置问题,而配置正是你可以在某个周二下午就动手改掉的那部分。
OrcaRouter 将200 多个模型整合到一个兼容 OpenAI 的端点之后,按提供商标价提供,0% 加价,因此供应商一旦调价,当天即可生效。
