科技博客关于超快速AI推理的编辑风扁平矢量插画主图:浅色背景上,一枚深蓝色大圆角模型芯片散发柔和青色光晕,旁边是风格化闪电符号和指针指到最大值的速度表盘,快速令牌流沿着带有运动线条的水平速度线飞驰,还有一个小秒表。白色背景配以柔和的蓝青渐变点缀和一处微妙的暖色高光;极简扁平线条图标;简洁现代的几何无衬线字体;无可读文字、无字母、无单词、无水印、无第三方标志,16:9构图。
Guides & Insights

GPT-5.6 Sol Ultrafast:Ultrafast 以标准版6倍价格发布,但该模型仍仅限预览

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这个层级的等待已经结束,但这个模型还没有。在 2026 年 9 月 29 日的 DevDay 上,厂商把 Ultrafast 变成了可以买到的东西:全新的 ChatGPT Pro 500 套餐,每月 500 美元,已将其打包在内;API 现在公布了 Ultrafast 价目表,费率为标准费率的六倍——在 GPT-6 Astra 上每百万 token 输入 60.00 美元 / 输出 300.00 美元——厂商的 Codex 文档还确认,Pro 各层级完全不设五小时使用限制,而这一时间窗口适用于 Plus。以上全部均为厂商所述,发布在厂商自家的 DevDay 回顾、帮助页面和开发者文档上。没有变化的,是本页所讲的这个模型。GPT-5.6 Sol Ultrafast于 2026 年 8 月 13 日发布,是为 GPT-5.6 Sol 提供的 Cerebras 加速服务层级,最高可达标准吞吐量的 14 倍、每秒 750 个输出 token,但目前仍仅限预览访问——需通过厂商的客户团队安排——且仍然没有自己的公开定价。该层级已上线。Sol 变体仍在等待。

自我们最初撰写本文以来,出现了两次价格变动,而且方向相反。底层模型变便宜了:标准版 GPT-5.6 Sol 现在按每百万输入 token 收费 $4.00、每百万输出收费 $20.00,这是 OpenAI 的促销价,供应商称该价格至少持续到 2026 年 11 月 21 日——而不是 8 月时现行的 $5.00 / $30.00。在此之上的速度层级首次有了定价,而且并不便宜:GPT-6 Astra 上的 Ultrafast 每百万收费 $60.00 / $300.00。本文中的每一个数字都已在 2026-09-30 对照 OpenAI 公布的价格表、其 API 参考文档及其 Codex 定价文档重新核对。

超快速模式到底是什么

Ultrafast 是一个服务层级,而非一个新模型。OpenAI 于 2026 年 8 月 13 日发布了它,这是其 2026 年 1 月与芯片制造商 Cerebras 开展算力合作后的首个产品——据报道,这笔交易为期三年,金额约为 100 亿美元。标准的 GPT-5.6 Sol推理运行在 GPU 集群上,大部分时间都花在内存与计算单元之间搬运权重;而 Ultrafast 则将模型权重加载到 Cerebras 晶圆级芯片上 44 GB 的片上 SRAM 中。像 Sol 这种规模的模型会分层跨越数片晶圆,因此权重就位于计算单元所在之处。其结果是,吞吐量上限由硅片而非内存带宽决定。

硬件领域在2026年8月18日有了新进展。在Supernova活动上,Cerebras发布了CS-4——这是基于其Nexus平台构建的下一代机架级系统:每个机架配备三颗晶圆级引擎(Wafer-Scale Engine)芯片,令牌生成速度最高可达前代CS-3的2倍;据Cerebras称,在超过10万亿参数的模型上,每秒可生成超过1,000个令牌。这些是Cerebras对一款尚处于早期访问阶段、尚未广泛上市的系统所给出的官方说法。自发布以来,X平台上仅有一条帖子声称CS-4已经在以每秒约1,300个令牌的速度为GPT-5.6 Sol提供服务——这一数字与Cerebras自身公布的数据方向一致,但迄今为止无人证实。请将其视为一个早期信号:看似合理、未经证实,在据此规划容量之前值得重新核实。

对你的代码而言,真正重要的部分是:模型 ID、权重、推理行为和输出都与标准 GPT-5.6 Sol 完全一致。OpenAI 将 Ultrafast 定位为「每秒完成更多有用工作」,而非一个质量档位;预览版运行的是完整旗舰模型——提速并非源自换成更便宜的模型。改变的只有 token 产出的速度。

不要把 Ultrafast 和 fast mode 混为一谈。Fast mode 是标准硬件上单独、可购买的层级:输出速度最高约为 2.5 倍,但每个 token 需支付 2 倍的溢价,质量没有任何变化——它于 2026 年 7 月 30 日从 Priority Processing 更名而来,在 GPT-5.6 Sol 上价格为每 100 万 token 输入 $8.00 / 输出 $40.00。Ultrafast 则是另一回事——Cerebras 硬件,在 GPT-5.6 Sol 上最高可达 14 倍,在 GPT-6 Astra 上最高可达 8 倍,在 Astra 上收费为标准费率的 6 倍,而在 Sol 上仍未定价。这两个名称如今并排出现在同一个模型选择器中,而这仍然是本次发布中最令人困惑的一点。

有多快——重要的数字

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

最显眼的数字是 14 倍,而这个数字需要定义。OpenAI 表示,与标准 GPT-5.6 Sol 处理相比,Ultrafast 每秒最多可生成 750 个输出 token。这是一个针对输出 token 的吞吐量数字,而不是“一切运行速度都快 14 倍”这种笼统的说法——端到端请求时间还包括输入处理和模型自身的推理,这正是 14 倍被标注为最大值的原因。

• 最大输出吞吐量——高达每秒 750 个输出 token,据 OpenAI 的公告(2026-08-13)。

• 与标准处理相比——根据同一公告,最高可快 14 倍;实际提升幅度因输入长度和任务类型而异。

• Humanity's Last Exam,2,500 道题——OpenAI/Cerebras 报告称,GPT-5.6 Sol Ultrafast 在 11 小时 11 分钟内完成,而 Claude Fable 5 用了 78 小时 27 分钟,准确率相当。此为厂商自报数据,且该对比横跨两家厂商的硬件栈——应将其视为方向性参考,而非定论。

• 端到端 GDP-Val——Cerebras 报告整体速度提升 5.6 倍,质量无可测量的损失。同样为厂商报告的数据。

• Fast mode 与 Ultrafast 对比 —— Fast mode 最高可实现约 2.5× 的输出速度,代价是 2× 的价格溢价,且其上限与标准定价相同,约为 272K token 的边界。Ultrafast 的提升幅度更大:根据 8 月的公告,在 GPT-5.6 Sol 上达到 14×;而根据 OpenAI 当前的文档,在 Codex 中的 GPT-6 Astra 上最高可达 8×,发布报道称其输出速度最高可达每秒 300 个 token。

• CS-4,下一代硬件——Cerebras 声称 CS-4 机架在超过 10 万亿参数的模型上每秒可生成超过 1,000 个 token,token 生成速度最高可达 CS-3 的 2 倍。一份未经证实的社区报告称,GPT-5.6 Sol 在 CS-4 上的速度约为每秒 1,300 个 token——方向一致,但尚未得到 OpenAI 或 Cerebras 的确认。

在引用 14× 之前,有一点需要提醒:这是某一家厂商硬件上的输出吞吐量上限,而对八月那次发布的独立对比结果大致在 7× 到 11× 之间,具体取决于衡量的是工作负载的哪一部分。同样的审慎也适用于 CS-4 的速度信号——GPT-5.6 Sol 在 CS-4 上约 1,300 token/s 的这个数字,最初只是来自一条 X 帖子,而且 OpenAI 和 Cerebras 都未证实它。请把所有这些都视为厂商和社区的说法,而不是基准测试的定论。

Ultrafast 现在要花多少钱——以及为什么这仍然不能为 Sol 定价

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

直白地说,以下是 2026-09-30 时价格问题的现状。Ultrafast 有一个已公布的费率——针对 GPT-6 Astra,且仅针对 GPT-6 Astra。OpenAI 的定价页面现在在 Standard、Batch、Flex 和 Fast 旁设有一列 Ultrafast:在短上下文中,每百万 token $60.00 输入 / $6.00 缓存输入 / $75.00 缓存写入 / $300.00 输出,超过约 272K token 后翻倍至 $120.00 / $12.00 / $150.00 / $450.00。这是 Astra 标准费率的六倍,而 Fast 模式是两倍——这也是 OpenAI 首次为该层级给出明确数字。上方卡片是我们自己 2026-08-18 的快照,其美元数字已被两度取代:先是被标准费率下调,现在则是被这一 Ultrafast 行。那张表仍然缺少的是 GPT-5.6 Sol 的任何 Ultrafast 费率:Ultrafast 列恰好只列出一个模型,gpt-6-astra。该层级已有定价;这个模型则没有。

今天您可以按型号逐一进行定价的内容:

• 标准版 GPT-5.6 Sol —— 每 100 万 tokens 输入 $4.00 / 输出 $20.00,适用于长度不超过约 272K tokens 的提示词。OpenAI 将其列为促销定价,至少持续到 2026 年 11 月 21 日。这是你现在就可以调用的基准选项。

• 快速模式 — 在 GPT-5.6 Sol 上,短上下文为 $8.00 / $40.00,超过约 272K tokens 后翻倍至 $16.00 / $60.00。价格为标准费率的两倍,换来最高约 2.5× 的输出速度,而在 Sol 上,它仍是你能实际买到的最快选择。

• 提示缓存 — 缓存读取按每 1M 计费 $0.40(比全新输入便宜 90%);缓存写入按每 1M 计费 $5.00。

• 长上下文档位 —— 超过约 272K token 的输入在标准处理下按 $8.00 / $30.00 计费,且在模型约 1.05M token 的上下文窗口和 128K token 的最大输出范围内。

• Batch API — 短上下文 $2.00 / $10.00,长上下文 $4.00 / $15.00,统一 50% 折扣,周转时间约 24 小时。

对于 GPT-5.6 Sol 而言,Astra 数值是目前可获得的最佳线索,仅此而已。OpenAI 将 Ultrafast 定价为基础模型标准费率的 6 倍;将该乘数套用到 Sol 的 $4 / $20 上,就会得到每百万 $24 / $120。这是算术推算,而非已公布的价格——OpenAI 对 Sol Ultrafast 费率只字未提,而且 8 月预览批次根本没有按层级费率计费。在供应商公布该价格条目之前,请按标准 Sol 的 $4 / $20 或快速模式的 $8 / $40 来做规划。

如何使用——在 Astra 上广泛可用,在 Sol 上仍需申请

访问权限于 9 月 29 日一分为二,而这一划分对本页所涵盖的模型不利。Ultrafast 现已在 GPT-6 Astra 上广泛可用:OpenAI 的 API 文档称,它以低速率限制向所有 API 用户开放——使用层级 1–3 为每分钟 500,000 个 token,层级 4 为 100 万,层级 5 为 500 万——并且它随新的 Pro 500 计划以及符合条件的 Enterprise 和 Edu 计划内置于 ChatGPT Work 和 Codex 中;在这些计划中,工作区所有者必须将其开启,而对于需要在美国境外进行推理的工作区,它不受支持。GPT-5.6 Sol Ultrafast 并未随之迁移。同一份文档仍将其描述为通过 OpenAI 账户团队提供的预览访问,而 API schema 中该参数自身的描述仍写着 "currently available for gpt-5.6-sol"——这句话如今落后于文档的其余部分,而非引领它们。如果你今天想要这一层级,那就要在 Astra 上获取它。

界面问题也已有定论。TestingCatalog 于 2026-09-26 报道称,一个提供“标准”“快速”和“超快”选项的速度选择器一直以未发布状态存在于 Responses API Playground 中;三天后,OpenAI 就发布了完全对应的消费者版本,其中“超快”现已成为 Pro 500 上 ChatGPT Work 和 Codex 中模型选择器的一个选项。我们当时将那次发现标记为一家媒体对未发布 UI 的解读,并表示 OpenAI 并未证实其中任何内容。它在方向上是对的,而它所指向的推出是在 DevDay 上到来的,而非之后。

OpenAI 在 8 月公布的首批预览客户包括编程、商业、金融研究、客户支持以及其他交互式工作负载——这些团队的智能体在每次请求中会发起大量调用,响应延迟正是其瓶颈所在。Jane Street、Rogo 和 Podium 都在被点名的早期测试者之列。如果你的工作负载只是单轮对话,那么速度档位的重要性远不及在 40 次调用的智能体循环中那样突出。如今,实际的答案取决于你问的是哪款模型:在 GPT-6 Astra 上,你今天下午就能设置 service_tier: "ultrafast",而在 GPT-5.6 Sol 上,你仍然做不到。

你今天能做什么——务实的答案

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

虽然 GPT-5.6 Sol Ultrafast 仍留在预览阶段,但两款旗舰模型都已在 OrcaRouter 上线,按供应商价格计费,每 token 加价 $0 —— 模型 ID openai/gpt-5.6-sol,可通过 api.orcarouter.ai/v1 的 OpenAI 兼容端点访问,旁边的 GPT-6 Astra 则按标准价 $10.00 / $50.00 计费,而 OpenAI 现在正是在该模型之上新增了 Ultrafast 层级,我们并不提供该层级的路由。下方的截图来自 2026 年 8 月,显示的仍是当时现行的 $5.00 / $30.00 价格;如今 Sol 的价格是 $4.00 / $20.00,我们也正是按此价格原样透传。正因为采用透传,供应商的价格变动当天就会传导到我们这边:输入 $4.00 / 输出 $20.00,与 OpenAI 公布的数字完全一致,且不额外加收每 token 费用。如果你已经有 OpenAI 客户端,迁移只需更改 base URL 和模型 ID,别无其他。同一个密钥和端点可调用 200+ 个模型,因此 Sol 与它的同门兄弟相邻而坐 —— GPT-5.6 Terra 为 $2.00 / $12.00,GPT-5.6 Luna 为 $0.20 / $1.20 —— 还有你会拿来与之对比的开源权重模型,你可以按任务难度进行路由,而无需逐个重新集成。

在速度页面上,有两个 OrcaRouter 的细节值得点名。BYOK:自带你的 OpenAI 密钥,OpenAI 按自己的费率直接向你计费——OrcaRouter 每 token 加收 $0,并且你的提供商速率限制和额度保持不变。Guardrails:PII Shield 和内容政策在计费之前运行,因此被拦截的请求会返回一个干净的 400,且绝不会被收费;Agent Firewall 则在工具调用和 MCP 调用执行之前对其进行评分。Ultrafast 本身已在 GPT-6 Astra 上广泛可用,但不按可路由条款提供,也不面向 Sol——它是一个受访问控制的层级,按标准费率的 6 倍计费,而我们并不提供它。如果 OpenAI 有一天以标准条款提供它,把它接入同一个端点只需更改模型 ID;你今天搭建的设置可以原样延续。

诚实的边界——当Ultrafast不是答案时

速度叙事的一半如今已经尘埃落定,但仍有五个地方站不住脚:

“可用”并不等于“你可使用”。Ultrafast 已在 GPT-6 Astra 上向所有 API 用户开放,但它是以低速率限制开放的,在 OpenAI 的 schema 中仍被描述为受访问控制,它不支持欧盟或其他非美国区域的处理,并且在 Enterprise 工作区中,直到所有者启用之前都处于关闭状态。在 GPT-5.6 Sol 上则完全没有开放任何内容。在基于其中任何一个进行架构设计之前,请先检查你自己的访问权限。

14× 是上限,不是保证。它是在 Cerebras 硬件上的输出吞吐量上限;端到端延迟仍包含输入处理、模型的推理时间以及你自己的网络。一个推理繁重的提示词可能会把大部分实际耗时花在思考上,此时那个头条式的加速比就会缩水。

它在其中一个模型上有价格,在另一个上没有。Astra Ultrafast 费率已公布——是标准费率的 6 倍——而任何地方都没有 GPT-5.6 Sol 的 Ultrafast 行。请按标准 Sol 的 $4 / $20 或快速模式的 $8 / $40 来做预算,并将你看到的任何“GPT-5.6 Sol Ultrafast 成本”数字,包括上面的 $24 / $120 外推值,视为算术推算,而不是费率表。

这些基准测试结果是厂商自报的。11 小时的 HLE 运行和 5.6× 的 GDP-Val 数字,是 OpenAI/Cerebras 在 8 月公告中给出的数据;对加速幅度的独立估计大致在 7× 到 11× 之间,具体取决于衡量的是什么。再把 CS-4 的信号加入这份清单:CS-4 上 GPT-5.6 Sol 约 1,300 token/s 的数据来自单条 X 帖子,且没有独立证实。新的 Astra Ultrafast 数字——在 Codex 中达到 8×、价格为 6×——同样是 OpenAI 自己的说法。

而那个花的是钱而非时间的问题:它无法修复你本就不存在的瓶颈。如果你的智能体速度慢,是因为自身的编排、工具延迟或输入繁重的提示词,那么更快的输出路径也只能稍稍改善长尾延迟。层级匹配的决策——GPT-5.6 Sol 为 $4 / $20,对比 GPT-5.6 Terra 为 $2 / $12,对比 GPT-5.6 Luna 为 $0.20 / $1.20——对你的账单的影响,仍然超过任何速度层级。

归根结底。Ultrafast 不再是一个你只能读到相关消息的等待名单层级。截至 2026 年 9 月 29 日,OpenAI 已开始售卖它:随 500 美元的 ChatGPT Pro 500 套餐包含在 Work 和 Codex 中,在 GPT-6 Astra 上以较低的速率限制向所有 API 用户开放,定价为标准费率的六倍——每百万短上下文 60 美元 / 300 美元。 GPT-5.6 Sol Ultrafast,本页当初围绕其构建的 8 月预览版,没有变化:仍受访问控制,在 API schema 中仍仅限于 gpt-5.6-sol,仍未定价,而据报道 Sol 在 Cerebras 的 CS-4 上约 1,300 token/s 的数字,仍只是一条未经证实的 X 帖子。标准 GPT-5.6 Sol 定价为 4 美元 / 20 美元,是如今可在 OrcaRouter 上以零加价调用的模型;GPT-6 Astra 定价为 10 美元 / 50 美元,如果你想要那个获得 Ultrafast 行的模型,就可以调用它。

在 GPT-6 Astra 上,Ultrafast 现在要真花钱了——价格是标准版的 6 倍,或打包进 500 美元的 Pro 500 套餐——而 GPT-5.6 Sol Ultrafast 仍处于预览阶段。完整版 GPT-5.6 Sol 已在 OrcaRouter 上线,定价为每百万 token 4 美元 / 20 美元,零加价,可使用你自己的密钥。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新