科技博客关于超快速AI推理的编辑风扁平矢量插画主图:浅色背景上,一枚深蓝色大圆角模型芯片散发柔和青色光晕,旁边是风格化闪电符号和指针指到最大值的速度表盘,快速令牌流沿着带有运动线条的水平速度线飞驰,还有一个小秒表。白色背景配以柔和的蓝青渐变点缀和一处微妙的暖色高光;极简扁平线条图标;简洁现代的几何无衬线字体;无可读文字、无字母、无单词、无水印、无第三方标志,16:9构图。
Guides & Insights

GPT-5.6 Sol Ultrafast:速度提升14倍,750 Tok/s — CS-4 据报道约为1,300,暂无定价

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-5.6 Sol Ultrafast mode是旗舰模型的硬件加速服务层级——完整版的GPT-5.6 Sol模型运行在Cerebras晶圆级芯片上,而不是GPU集群上,速度最高可达标准处理的14倍,并在OpenAI于8月公布的该层级上实现每秒最多750个输出token。2026年8月18日,Cerebras发布了该层级将升级到的下一代CS-4系统,有一份早期未经证实的报告称,CS-4上的GPT-5.6 Sol每秒已能服务约1300个token。它不是更小的模型,也不是蒸馏版本:改变的只是硬件和调度方式,智能水平保持不变。它还缺少的是价格——截至2026年8月19日,Ultrafast是一个有限的API预览,没有公布的价目表,因此你今天实际可用来做预算的数字,是实时GPT-5.6 Sol模型页面上的标准层级价格:每百万输入token 5美元,每百万输出token 30美元,零加价直通。本文涵盖该模式是什么、这些数字实际上有多快(包括新的CS-4硬件和尚未验证的内容)、费用是多少(包括诚实的“尚无价格”答案),以及在它正式可用之前该怎么做。

超快速模式到底是什么

Ultrafast 是一个服务层级,而非新模型。OpenAI 于 2026 年 8 月 13 日宣布推出该服务,这是其与芯片制造商 Cerebras 于 2026 年 1 月达成的算力合作的首个产品——据报道,这笔交易在三年内价值约 100 亿美元。标准版 GPT-5.6 Sol 推理在 GPU 集群上运行,并将大量时间花在内存与计算单元之间搬运权重;而 Ultrafast 则将模型权重加载到 Cerebras 晶圆级芯片上 44 GB 的片上 SRAM 中。Sol 这种规模的模型会分层横跨多个晶圆,因此权重就放置在计算单元所在的位置。其结果是:吞吐上限由硅片本身决定,而非由内存带宽决定。

硬件领域在2026年8月18日有了新进展。在Supernova活动上,Cerebras发布了CS-4——这是基于其Nexus平台构建的下一代机架级系统:每个机架配备三颗晶圆级引擎(Wafer-Scale Engine)芯片,令牌生成速度最高可达前代CS-3的2倍;据Cerebras称,在超过10万亿参数的模型上,每秒可生成超过1,000个令牌。这些是Cerebras对一款尚处于早期访问阶段、尚未广泛上市的系统所给出的官方说法。自发布以来,X平台上仅有一条帖子声称CS-4已经在以每秒约1,300个令牌的速度为GPT-5.6 Sol提供服务——这一数字与Cerebras自身公布的数据方向一致,但迄今为止无人证实。请将其视为一个早期信号:看似合理、未经证实,在据此规划容量之前值得重新核实。

对你的代码而言,真正重要的部分是:模型 ID、权重、推理行为和输出都与标准 GPT-5.6 Sol 完全一致。OpenAI 将 Ultrafast 定位为「每秒完成更多有用工作」,而非一个质量档位;预览版运行的是完整旗舰模型——提速并非源自换成更便宜的模型。改变的只有 token 产出的速度。

不要把 Ultrafast 与现有的快速模式混为一谈。快速模式是标准硬件上单独购买的一个档位:输出速度最高约为 2.5 倍,但每个 token 需支付 2 倍的价格(每 1M 输入 $10 / 输出 $60),质量不变。Ultrafast 则完全是另一回事——采用 Cerebras 硬件,速度最高可达 14 倍,而且目前完全免费。

有多快——重要的数字

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

最显眼的数字是 14 倍,而这个数字需要定义。OpenAI 表示,与标准 GPT-5.6 Sol 处理相比,Ultrafast 每秒最多可生成 750 个输出 token。这是一个针对输出 token 的吞吐量数字,而不是“一切运行速度都快 14 倍”这种笼统的说法——端到端请求时间还包括输入处理和模型自身的推理,这正是 14 倍被标注为最大值的原因。

最大输出吞吐量——根据 OpenAI 的公告(2026-08-13),每秒最多可输出 750 个 token。

与标准处理相比——速度提升最高可达14倍(依据同一公告);实际增益因输入长度和任务类型而异。

Humanity's Last Exam,2,500道题——OpenAI/Cerebras 报告称,GPT-5.6 Sol Ultrafast 用时 11 小时 11 分钟完成,而 Claude Fable 5 耗时 78 小时 27 分钟,准确度相当。该结果为供应商自行报告,且对比涉及两家供应商的硬件栈——应视为方向性参考,而非定论。

端到端 GDP-Val——Cerebras 报告称整体快 5.6 倍,且无可衡量的质量损失。同样为供应商自报数据。

快速模式基线——现有可购买速度档位最高约为 2.5× 输出速度,价格溢价为 2×。

• CS-4,下一代硬件——Cerebras 声称 CS-4 机架在超过 10 万亿参数的模型上每秒可生成超过 1,000 个 token,token 生成速度最高可达 CS-3 的 2 倍。一份未经证实的社区报告称,GPT-5.6 Sol 在 CS-4 上的速度约为每秒 1,300 个 token——方向一致,但尚未得到 OpenAI 或 Cerebras 的确认。

在引用 14× 这个数字之前,有一点要提醒你:关于发布的独立报道引用了与 Claude Fable 5 相比约 11× 的生成速度对比,而 Cerebras 自己的数据则暗示同一轮跑批的总测试时间约为 7×——差异在于你衡量的是工作负载的哪一部分。同样的原则也适用于 CS-4 的速度信号:约 1,300 token/s 的数字最初只是一条 X 帖子,OpenAI 和 Cerebras 都没有证实过。这些都是本周发布的厂商或社区数字,目前均未经过独立验证。请把它们当作声明,而非基准测试的定论。

它要花多少钱——以及诚实的差距

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

以下是2026年8月19日价格问题的现状,直截了当地说:Ultrafast没有公布价格。OpenAI尚未公布价格,预览版也没有出现在任何公开价目表上。关于早期访问名额被捆绑或免费的报道纯属猜测,而非政策——在OpenAI为该层级定价之前,你在其他地方找到的任何“GPT-5.6 Sol Ultrafast cost”数字都只是猜测。

你今天可以定价的是 GPT-5.6 Sol 系列的其余部分,已根据 OpenAI 于 2026-08-18 公布的价格进行验证:

Standard GPT-5.6 Sol — 每1M tokens输入$5.00 / 输出$30.00。这是您现在即可调用的基线版本。

快速模式 — $10.00 / $60.00,2 倍溢价,最高可获得约 2.5 倍的输出速度。这是你实际能买到的最接近速度档位的产品。

提示词缓存读取 — 每1M $0.50(较新输入优惠90%);缓存写入按每1M $6.25计费。

长上下文档位 — 超过约 272K tokens 的输入按 $10.00 / $45.00 计费。

Batch API — $2.50 / $15.00,统一五折,约24小时处理时间。

为说明预期溢价:快速模式开创了先例——2.5 倍速度收取 2 倍标准费率。如果 Ultrafast 遵循类似曲线,其定价将远高于标准的 5 美元 / 30 美元——而且围绕预览版的评论也预计如此,因为 Cerebras 晶圆产能稀缺且昂贵。但预期溢价并非实际价格。在费率表出台之前,应按标准 Sol 或快速模式做规划。

如何使用它——预览现实

访问权限是第二个被坦诚承认的差距。Ultrafast 可通过 OpenAI API 向等候名单上的一批精选客户提供,该消息于 2026-08-13 公布,OpenAI 表示访问范围将“随着容量增长”而扩大。目前没有公布全面开放的具体日期。已公布的预览群体包括编程、商业、金融研究、客服支持以及其他交互式工作负载——这些团队的智能体每处理一个请求就要进行大量调用,响应延迟是它们的瓶颈所在。Jane Street、Rogo 和 Podium 是被点名的早期测试者中的几家。

它所设计的使用场景是:事件响应(在故障发生时读取日志、跟踪信息和差异对比)、对动态数据进行金融研究和欺诈检测、实时客户支持和语音服务(在语音中半秒静默就会被视为中断)、电子商务结账,以及将隔夜研究批次压缩为交互式会话。如果你的工作负载是单轮聊天,14×的差异远没有40次调用的智能体循环那么重要。

你今天能做什么——务实的答案

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

虽然 Ultrafast 仍处于预览阶段,但完整的 GPT-5.6 Sol 现已上线——在 OrcaRouter 上,标准层级按提供商费率提供服务,每 token 零加价,模型 ID 为 openai/gpt-5.6-sol,通过 OpenAI 兼容端点 api.orcarouter.ai/v1 即可访问。如果你已有 OpenAI 客户端,迁移只需更改 base URL 和模型 ID,其他无需任何改动。同一个密钥和端点支持 200 多个模型,因此 Sol 与 GPT-5.6 TerraGPT-5.6 LunaClaude Opus 5 以及你用来对比的开源权重模型并列——你可以按难度进行路由,而不必逐一重新集成。

速度页面上有两个 OrcaRouter 的特性值得一提。BYOK:自带 OpenAI 密钥,OpenAI 会按其自身费率直接向你收费——OrcaRouter 每 token 不增加任何费用,并保持你的提供商速率限制和余额不变。Guardrails:PII 盾和内容策略在计费之前运行,因此被阻止的请求会返回干净 400 错误,且永远不会被计费;Agent 防火墙会在工具和 MCP 调用执行之前对其进行评估。当——且如果——Ultrafast 以可路由的价格正式发布,将其插入同一端点只是模型 ID 的变更;你今天构建的设置将继续沿用。

诚实的边界——当Ultrafast不是答案时

14×的故事站不住脚的四个地方,因此你不应针对一个尚未确定的数字进行架构设计或预算规划:

14倍是上限,而非保证。这是Cerebras硬件上的输出吞吐量上限;端到端延迟仍包括输入处理、模型的推理时间以及你自己的网络。推理密集的提示可能会将大部分实际耗时花在思考上,此时宣传中的加速效果便会缩水。

它没有价格,也没有GA日期。截至2026-08-19,你无法购买Ultrafast——只能申请预览访问,而其背后的CS-4硬件仍处于早期访问阶段,并未正式发布。预算请参照标准Sol($5 / $30)或快速模式($10 / $60),并将你在网上看到的任何Ultrafast价格视为未经证实。

这些基准测试结果均为供应商自行报告。公告中OpenAI/Cerebras给出的数字包括11小时的HLE运行时间和5.6×的GDP-Val数值;独立估算大约在7×到11×之间,具体取决于衡量标准。将CS-4的速度信号也加入这一列表:GPT-5.6 Sol在CS-4上约1,300 token/s的数据仅来自一条X帖子,且没有独立确认。上述数据目前均未得到独立验证。

它不会解决一个你没有的瓶颈。 如果你的智能体变慢是因为你自己的编排、工具延迟或输入密集的提示,更快的输出路径只会略微改变尾部。层级匹配决策——GPT-5.6 Sol 为 $5 / $30,GPT-5.6 Terra 为 $2 / $12,GPT-5.6 Luna 为 $0.20 / $1.20——仍然比任何速度层级更能影响你的账单。

总而言之。GPT-5.6 Sol Ultrafast 是 OpenAI 为其旗舰模型推出的最快服务层级——在 Cerebras 硬件上使用相同的权重,吞吐量最高可达 14 倍,已公布层级的输出速度为每秒 750 个 token。据报道,Cerebras 新款 CS-4(2026-08-18 发布)可将 GPT-5.6 Sol 推向每秒约 1,300 个 token,但这一数字仅来自一条未经证实的 X 帖子。截至 2026-08-19,Ultrafast 仍是候补名单预览版,没有公开价格。如果你想找一个数字来做预算,老实说,现在还没有。标准版 GPT-5.6 Sol 定价 $5 / $30,是今天就能使用的;快速模式 $10 / $60 是可购买的速度层级;OrcaRouter 使用你自己的密钥转发这两者,零加价。现在就构建好路由——等 Ultrafast 有了价格和发布日期,只需改一个模型 ID 即可。

在 Ultrafast 获得定价之前,完整的 GPT-5.6 Sol 已在 GPT-5.6 Sol on OrcaRouter 上线,每百万 tokens 仅需 $5 / $30,零加价,可直接使用你自己的密钥。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube