
GPT-6 Astra Ultrafast 对比 Xiaomi MiMo v2.6 Pro Ultraspeed:相同的手法,两种不同的交易
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两个实验室在同样的两周内采取了相同的举措,而有趣之处在于,它们对客户购买的究竟是什么持有截然相反的假设。GPT-6 Astra Ultrafast 是该供应商的旗舰产品,通过 Ultrafast 服务层级销售——该模型于 2026 年 9 月 3 日发布,该层级自 2026 年 9 月 29 日起广泛可用,并在 NVIDIA 10 月 1 日的文章中被列为运行在 Blackwell GPU 上。Xiaomi MiMo v2.6 Pro Ultraspeed 是小米的版本,于 2026 年 9 月 22 日发布:与 MiMo-V2.6-Pro 相同的 1.02 万亿参数检查点,但以更快的速度提供服务,约为标准速率的十倍。
其中一个是以最快速度调用前沿模型的方式。另一个是现存最便宜的快速层级。从寻常意义上说,它们并非竞争对手——你得写出一个极其奇怪的应用程序,才会在每百万 token 300 美元的闭源旗舰模型与每百万 token 8.70 美元的开源权重模型之间做选择。这对组合之所以值得写上整整一页,是因为二者都是速度层级,而非模型本身,因此将它们放在一起比较,恰好能剥离出速度层级所提出的那个唯一问题:你到底是在为什么支付那个倍数?
两个层级售卖的都是同一个非物
这两个名字都不是检查点。这正是发布报道往往会含糊带过的部分,所以值得对这一点一板一眼。
• 名称所指的含义 —— GPT-6 Astra Ultrafast 就是设置了请求字段 service_tier: "ultrafast" 的 GPT-6 Astra;请求中的模型 id 仍然是 gpt-6-astra。Xiaomi MiMo v2.6 Pro Ultraspeed 则是通过更快的路径提供服务的 MiMo-V2.6-Pro checkpoint,并作为单独的计费项定价。
• 有哪些变化——批处理、投机解码、硬件分配、并发限制、连接处理。权重与你的 HTTP 请求之间的一切,而权重内部则一概不涉及。
• 不变的是什么——答案。相同的检查点在相同设置下应以不同的速率产生相同的内容。如果同一模型的两条通道在相同输入上出现分歧,那是应当上报的缺陷,而不是你所购买的能力。
• 为什么这对本次比较很重要——因为两个档位都没有声称相较各自的标准档位有基准提升,整个购买决策就归结为每 token 价格与所节省秒数之间的对比。这意味着这两笔交易由算术决定,而非由评测决定。
不过,这个框架中存在一处不对称,而且它并不在层级划分上。小米的 UltraSpeed 建立在开放许可的模型之上——根据小米自家的模型卡,MiMo-V2.6 的权重采用 MIT 许可证,而且该系列发布时还一并公开了其强化学习训练环境。OpenAI 的 Ultrafast 则建立在闭源旗舰模型之上,只能通过 API 访问。为开放权重支付速度倍数的费用是一个可逆的决定;你随时可以自己部署该检查点。为闭源旗舰模型支付同样的费用则不然。

两个价格倍数,以及它们能换来什么
正是在这里,这一对不再对称,而且双方的数值都异常整齐,因为每家供应商给出的都是一个倍数,而不是一个绝对值。
• GPT-6 Astra Ultrafast — 每百万输入 token 60.00 美元,缓存输入 6.00 美元,缓存写入 75.00 美元,输出 300.00 美元,而标准层级为 10.00 美元和 50.00 美元。所有列统一为 6.00 倍,在超过 272,000 个输入 token 后升至 120.00 美元和 450.00 美元。标准层级已按 OpenAI 的标价在我们的目录中上线,这是触达旗舰模型最便宜的方式。
• Xiaomi MiMo v2.6 Pro Ultraspeed —— 每百万 token 输入 4.35 美元、输出 8.70 美元,而标准 Pro 通道为 0.44 美元和 0.87 美元。也就是说,输入约为 9.9 倍,输出则恰好为 10 倍。
• 这些倍数所附带的提速说法——OpenAI 和 NVIDIA 均将 Astra Ultrafast 的 token 生成速度上限标为“最高可达”标准模式 Astra 的 8 倍。小米自家的材料则宣称,其输出速度最高可达标准版 Pro 服务的 20 倍;而第三方商品目录在同一天对同一型号的描述却称约为 10 倍。目前尚未有公开发布的测量结果能够调和这两个数字。
• 倍数与速度之比——OpenAI 的 6 倍价格换来的是宣称的 8 倍上限,因此这一档的定价低于其自身的最佳情形。取决于你相信哪一方的数字,小米 10 倍的价格换来的是宣称的 10 倍至 20 倍上限,因此在厂商宣称的上限下这笔交易是划算的,而按较低的那个数字来看则纯粹是打平。
这是两者之间唯一与决策最相关的差异,而且比标题价格所暗示的要小。按照供应商自己的说法,按每单位延迟消除计算,Astra Ultrafast是两者中更划算的交易。按每单位工作量计算,Xiaomi UltraSpeed在输入上比Ultrafast费率便宜约十四倍,在输出上便宜约三十四倍,并且比Astra的标准通道便宜两到六倍——但它是另一种模型,而且能力明显更弱,而这才是你实际做出的取舍。小米为该系列自己发布的模型卡公布的是架构和训练事实,而不是独立的综合评分,并且完全没有发布OpenAI旗舰模型所依据的该指数的任何读数。

两家供应商选择披露的内容
速度档位与其说是性能测试,不如说是信息披露测试,因为要验证这一说法所需的东西——在声明的并发量下的延迟分布——完全掌握在厂商手中。
英伟达10月1日的帖子是Astra层级背后最具体的公开声明,它贡献的是归属信息而非测量数据:Blackwell GPU、在OpenAI API中以及面向符合条件的ChatGPT Work和Codex用户提供,还有两名OpenAI工程师描述这一循环。OpenAI推理负责人Philippe Tillet表示,Astra能够“将这些知识转化为高性能内核,使NVIDIA硬件具有吸引力”;OpenAI计算首席技术官Uday Ruddarraju表示:“我们使用内部模型来优化NVIDIA GPU上的推理。”这两句话都没有给出该层级的吞吐量数字。8倍独立成说,除了“最高可达”之外没有任何限定。
小米的披露则走向了另一个方向——它公布了训练经济学,包括强化学习环境和代码,而其模型卡承载的是架构事实,而非服务事实。UltraSpeed 层级本身伴随着 20 倍的说法,却没有公布延迟曲线。这意味着,在一个速度层级存在就是为了回答的问题上,两家厂商同样帮不上忙,而这一平局才是诚实的发现。
选择,如果你确实不得不这样做的话
这两个档位重叠不多,所以这个决定与其说是在挑选优胜者,不如说是在认清你的购买属于这两者中的哪一种。
如果你要做的是智能体式的工作,而且模型选型已经确定,那就选 Astra Ultrafast。一个 40,000 输出 token 的任务,费用会从 $2.00 涨到 $12.00,而该层级是唯一能以更快速度获得前沿模型质量的途径。OpenAI 自己的文档对这项运行前提说得很明确:它推荐使用 WebSockets,“尤其是那些会连续快速发起大量工具调用的智能体应用”,并警告说“如果没有持久连接,网络开销可能会削弱延迟方面的收益”。启用该层级,却在底层保留按请求的 HTTP,那你就是付了 6 倍的钱,只换来一小部分的速度提升。在把它接入之前同样值得了解的是:该层级仅支持美国数据驻留和全球处理,没有欧盟或其他非美国区域的处理端点,而且它上线时的初始速率限制很低,即便对那些本来有资格获得更高额度的账户也是如此。
如果该模型只是你可以自行托管的流水线中的一种通用输入,那就选 MiMo v2.6 Pro Ultraspeed。MIT 许可证意味着标准 Pro 通道并非你唯一的退路——自托管才是。在 $4.35 和 $8.70 的价位上,它足够便宜,以至于更快的档位值得抱着试一试的心态启用,而不必按每个任务去论证其合理性,而且它的 1M token 上下文与旗舰模型相当。不过,要清楚你在买什么:为一个落后于前沿的模型支付大约十倍的费率——对于高吞吐量的抽取任务,这是正确的取舍;而对于任何答案质量决定工作流能否推进的场景,则是错误的选择。
两个快速层级都不在 OrcaRouter 上,这一点值得明说,而不是绕着弯子暗示。OrcaRouter 上提供的是 openai/gpt-6-astra——标准层级的旗舰模型,每百万 token 的价格为 10.00 美元和 50.00 美元,长上下文档位为 20.00 美元和 75.00 美元,上下文长度为 1,050,000 token,最大输出 128,000 token,通过兼容 OpenAI 的端点提供。这里完全没有托管任何小米模型,因此 MiMo-V2.6-Pro 及其 UltraSpeed 通道只能通过小米自家的 API 以及若干第三方平台访问。在本次对比中,支持 200 多个模型的端点的实际用途并不在于能访问那些快速层级。而在于:当你想知道那条昂贵的通道是否值它那好几倍的价格时,你可以在下一个请求里,用同一份凭据、同一个密钥,把同样的提示词发给一个更便宜的模型,然后就能得到答案。这是成本最低的实验,也正是能回答这个问题的实验——因为没有任何厂商公布过那条延迟曲线,让你无需实测就能得出答案。

诚实的解读
两家供应商在过去三周内都发布了针对延迟的价目表,但都没有发布任何测量结果。这种对称本身就是关键,而且带来了一个实际后果:今天你唯一能据以行动的数字就是价格,而这些价格异常具有参考价值,因为双方给出的都是一个干净的整数倍数,而不是量身定制的具体数字。
OpenAI 的快速档收费是其自身标准费率的六倍,并宣称上限为八倍。小米的收费是其自身标准费率的十倍,并宣称上限在十倍到二十倍之间,取决于你信谁的数字。若按厂商自己给出的数字做算术,两者几乎不相上下:OpenAI 的这一档每单位价格可换来宣称上限所值的 1.33 个速度单位,按同样算法,小米的则可换来 1.0 到 2.0 之间——而两者之所以都能说得通,是因为这两个档位面向的是不同的买家,而这些买家绝不会认真考虑对方的选项。价格也是这两项交易中目前唯一可审计的部分,因为费率卡是已发布的事实,而延迟宣称则不是。
