
GPT-5.6 Sol Ultrafast 与 Xiaomi MiMo v2.6 Pro Ultraspeed:两档速度,一个缺失的价格
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
两家厂商在相隔三周的时间里推出了同一个产品构想,而二者之间的差异,最能说明各自真正在卖的是什么。小米这边于2026年9月22日落地:Xiaomi MiMo v2.6 Pro Ultraspeed 与 MiMo-V2.6-Pro 是同一个1.02万亿参数检查点,只是服务速度更快,价格为每百万输入token 4.35美元、每百万输出token 8.70美元,而标准 Pro 通道为0.44美元和0.87美元。该厂商的 GPT-5.6 Sol Ultrafast 则是把同样的手法用在 GPT-5.6 Sol 上:权重完全相同,最高每秒750个输出token,最高可达标准档的14倍,运行在 Cerebras 晶圆级硬件上——而且在8月13日该模式发布六周后,仍未公布任何价格。
把两者并排放在一起,异常之处立刻显现。小米在发布大多数基准测试之前,就先发布了一张价目表。OpenAI 发布了基准测试、硬件合作伙伴以及客户名单——却至今没有公布一个你可以据此做预算的数字。这两档服务中,有一档今天就能购买。另一档还只是 API 模式里的一个值。因此,比较二者与其说是在比谁更快,不如说是在比:当一家厂商已经告诉你价格,而另一家还没有时,一档速度服务究竟值多少。
每一个到底是什么
两者都不是新模型。这是共同的前提,值得直言不讳地指出,因为这两次发布所吸引的报道,都把服务层面的变更当成了能力发布。
MiMo v2.6 Pro Ultraspeed 是小米旗舰模型的一种服务配置:同样是 1.02T 参数的稀疏专家混合检查点,每个 token 激活 42B;同样是 100 万 token 上下文;同样原生支持文本、图像、视频和音频多模态;公开仓库里的权重同样采用 MIT 许可。小米自家的材料声称,在质量相同的情况下,输出速度最高可达标准 Pro 服务的 20 倍;而第三方在同一天对同一模型的目录收录信息则称约为 10 倍。目前还没有人公布能够调和这两者的实测数据。
GPT-5.6 Sol Ultrafast 是 OpenAI 旗舰模型的一种服务配置:相同的检查点、相同的推理行为、相同的 1,050,000 token 上下文窗口、相同的 128K 最大输出、相同的答案。其加速来自硬件而非调度——模型权重驻留在 Cerebras 晶圆级硅片的片上 SRAM 中,而不是在 GPU 内存与计算单元之间来回搬运——它也是 2026 年 1 月 OpenAI–Cerebras 算力合作的首个产品,据报道该合作规模约为三年 100 亿美元。
所以,诚实的比较维度并不是智能。而是供应商选择改变什么、为这一改变收了多少费用,以及这一改变中有多少是它允许你去验证的。

费率卡,包括空白的那张
• MiMo v2.6 Pro Ultraspeed — 每百万 tokens 输入 $4.35 / 输出 $8.70,由 Xiaomi 发布。
• MiMo-V2.6-Pro 标准版——$0.44 / $0.87,由小米的商业价目表公布。输入约为 9.9 倍,输出恰好为 10 倍。
• GPT-5.6 Sol Ultrafast —— 截至 2026 年 9 月 27 日,尚无已公布的价格表。OpenAI 的定价页面仍只有四个标签页 —— Standard、Batch、Flex、Fast —— 该档位并不在其中。
• GPT-5.6 Sol 标准版 — 每百万 $4.00 / $20.00,为 OpenAI 当前的促销价格;缓存输入为 $0.40,当输入超过约 272K tokens 后,长上下文档位价格升至 $8.00 / $30.00。
• OpenAI 迄今唯一一个同类高级选项定价——Fast 模式,价格为 $8.00 / $40.00,恰好是标准费率的两倍,输出速度最高可达约 2.5 倍。
最后那一行正是这个空白之所以重要的全部原因。小米的速度档位价格是标准通道的十倍,并宣称速度是十到二十倍;这作为一笔交易至少内部自洽:你按比例付更多钱,换取按比例更少的等待,而赌注在于实际耗时就是产品本身。OpenAI 的速度档位比 Fast mode 对更稀缺的硅资源提出了更大的占用要求,所以无论它最终定价多少,先例表明的都会是溢价而非折扣。但“先例表明是溢价”并不是一个数字,而在数字出现之前,这个档位根本无法在价格上与 UltraSpeed 比较——只能根据一个事实来比较:小米愿意说出自己的数字,而 OpenAI 不愿意。
这些数字是从哪里来的
这两个层级面临着截然相反的证据问题,值得将两者都明确指出来,而非采取折中的做法。
小米的速度声称在量级上含糊其辞,却锚定于一个已公布的价格。20倍是厂商设定的上限,其条件小米并未说明;10倍是一份产品目录所列、愿意标称的典型值;而真实的倍数落在一个宽泛的区间内,至今没有人在公开场合、在明确说明的并发水准下测量过。相比之下,价格是确切的,权重可依MIT许可证下载,技术报告与强化学习训练环境均已公开——你能查看小米做了什么,只是还无法验证它跑得有多快。
OpenAI 的速度宣称在量级上很具体,却没有任何可购买之物作为依据。最高每秒 750 个输出 token,最高为标准速度的 14 倍,表述直白。这也是输出 token 的吞吐量数字,而非端到端的统一倍数:输入处理和模型自身的推理不会按这一比例被压缩,这也是公司将其标为最高值的原因。支撑这些说法的基准由厂商自行报告,且其中一项还是跨厂商的——一场 2,500 题的 Humanity's Last Exam 运行据报在 11 小时 11 分钟内完成,而 Claude Fable 5 用了 78 小时 27 分钟,准确率相当。对此次发布的独立报道引用了同一轮运行中更窄的、约 11 倍的生成速度对比,而 Cerebras 自己的数据则暗示总测试时间约为 7 倍。三方,同一工作负载的三个不同比例,其中没有任何一个被第三方复现。Cerebras 另行报告在 GDP-Val 上实现 5.6 倍端到端加速,且没有可测量的质量损失,同样未获复现。
两组数字都是厂商公布的。区别在于,小米含糊的是速度,而 OpenAI 含糊的是成本;对于任何编制预算的人来说,成本是更难猜的那一项。

本周发生了什么,以及为何它无法缩小差距
这场对比之所以有新闻由头,靠的是一次提交,而非一则公告。ultrafast 这个取值自 2026 年 8 月 13 日起就存在于 OpenAI 公开的 openai-openapi schema 中——正是该模式被公布的同一天——其描述把它限定为 gpt-5.6-sol,并称其受访问控制。本周发生变动的那次提交更晚,也更小:2026 年 9 月 25 日,fe4f7a1 把 ultrafast 加进了另外两个枚举,即请求级别的 service-tier 参数和 agent 的 service-tier 策略字段。在那次提交之前,这两个列表是 auto、default、flex、priority、fast。之后则出现了一个描述为“Uses the ultrafast service tier.”的条目。ultrafast添加到service_tier枚举——这些枚举位于其公开的openai-openapi规范中——即该 schema 描述为“用于模型请求的服务层级”的字段,以及附加到 agent 的策略字段。在变更之前,该列表为 default、flex、priority、fast。变更之后,则有一个条目被描述为“Uses the ultrafast service tier.”
对于任何阅读相关报道的人来说,这一区别都很重要。这不是正在被创建的那个层级;它是正被接入智能体所配置字段的那个层级,这意味着最终可以为其编写客户端,而无需任何新端点。次日的一篇报道描述称,Responses API Playground 将迎来一个 Fast / Standard / Ultrafast 选择器,预计在 OpenAI 的 DevDay 大会之后会获得更广泛的访问权限。我们尚未看到该选择器,OpenAI 也没有发布推出说明,因此这部分只有单一信源。可以核实的是新增的 schema 条目,以及公告发布六周后费率表仍然缺席。
与此同时,小米这一档已经可购买五天了,并且仍是两者中唯一能开发票的那个。它自身悬而未决的问题则不同:10 倍溢价能否维持,还是会像新高端档位的大多数首发定价那样,一旦首发报道停止,就向标准档位漂移。Standard Pro 的 $0.44 / $0.87 是锚点,而以锚点十倍价格开盘的档位,很少会最终停在那里。
在它们之间做选择,鉴于你很可能做不到
令人不安但现实的事实是:对大多数读者来说,这是在比较一个你买不到的档位,和一个你大概不该按标价买的档位。GPT-5.6 Sol Ultrafast 是面向特定客户的候补名单预览,会随着容量增长而扩大,没有全面上市日期,也没有公布价格;MiMo v2.6 Pro Ultraspeed 则可以买到,价格昂贵,而且是为特定类型的买家打造的。
两者的工作负载测试是相同的,而且它关乎的是你请求图的形状,而不是提示词的规模。单次长生成获得的收益远低于宣传中的倍数,因为输入处理和推理并不会以相同比例加速。一个用户可见操作背后有四十步的智能体循环,获得的收益则更接近完整倍数,因为每一次往返都是用户正在承受的延迟。如果你的流量呈现第二种形态,那么两个层级都是为你准备的;如果呈现第一种形态,那么无论用哪个模型,标准通道始终都是正确的选择,而价格为 $0.44 / $0.87 的标准 MiMo-V2.6-Pro 通道,是在任何地方调用万亿参数级模型的最便宜方式之一。
无论哪个层级,都不会改变这一点:你购买的是延迟,而不是质量。如果你在相同的提示下,将 UltraSpeed 或 Ultrafast 与其自身的标准通道进行基准对比,并得到不同的答案,那么这是一个值得报告的发现,而不是一项功能——两家供应商的描述中都没有声称权重发生了变化。
这也正是路由器能挣得自己一席之地的情形,而且具体来说,是为了你拿不到的那一档。GPT-5.6 Sol 已在 OrcaRouter 上线,即openai/gpt-5.6-sol,按提供商自身的费率、token 零加价,通过 api.orcarouter.ai/v1 上的 OpenAI 兼容端点提供,因此你会回退使用的标准通道只差改一次基础 URL,而同一个密钥可承载200 多个模型。这一点很重要,因为对于“我该不该用 Ultrafast”这个问题,今天诚实的答案是“你用不了,所以得先决定在此期间由谁来承载交互流量”——而在无需排队等候的情况下换取低延迟的办法,就是把交互调用路由到目录中在满足你质量门槛的前提下实际耗时最短的模型,并把通宵任务留在能达标的最便宜通道上。等到那一档开放时,你要做的切换就是它。也要直白地说明我们不托管什么:OrcaRouter 上没有任何小米模型,因此 MiMo v2.6 Pro Ultraspeed 来自小米自家的 API 以及若干第三方平台,本页面并不是通往它的路径。

什么能了结它
三项测量,目前都还不存在。一份公开的 Ultrafast 费率卡,能让这次对比成为它本该有的那种对比,而不是一个带有缺口的对比。一份在明确说明的并发水平下的独立延迟分布,会告诉你 Xiaomi 的真实倍数更接近 10× 还是 20×,以及它是在负载下依然成立,而不是只在单流演示中成立。而对任一厂商基准测试套件的独立复现,则会让这两组数字都从“声称”栏中移出来。
在那之前,站得住脚的解读很有限。Xiaomi 推出了一个速度档位,有价格,但速度描述含糊;OpenAI 推出了一个速度档位,速度具体,但没有价格;两者都与各自作为定价参照的对象是同一个模型,而且两者都没有经过独立测量。如果你现在就需要低延迟,而且工作负载是交互式的,那么 UltraSpeed 是真实存在、可以购买,并且定价正好瞄准它想要的那类买家。如果你现在就需要它,而工作负载不是交互式的,那么两个模型的标准通道都更便宜、经过验证,而且今天就能用——而大家争论不休的那个档位,等到有人公布一个数字时,依然会在那里。
