
GPT-5.6 Sol Ultrafast:速度提升14倍,750 Tok/s — CS-4 据报道约为1,300,暂无定价
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
GPT-5.6 Sol Ultrafast mode是旗舰模型的硬件加速服务层级——完整版的GPT-5.6 Sol模型运行在Cerebras晶圆级芯片上,而不是GPU集群上,速度最高可达标准处理的14倍,并在OpenAI于8月公布的该层级上实现每秒最多750个输出token。2026年8月18日,Cerebras发布了该层级将升级到的下一代CS-4系统,有一份早期未经证实的报告称,CS-4上的GPT-5.6 Sol每秒已能服务约1300个token。它不是更小的模型,也不是蒸馏版本:改变的只是硬件和调度方式,智能水平保持不变。它还缺少的是价格——截至2026年8月19日,Ultrafast是一个有限的API预览,没有公布的价目表,因此你今天实际可用来做预算的数字,是实时GPT-5.6 Sol模型页面上的标准层级价格:每百万输入token 5美元,每百万输出token 30美元,零加价直通。本文涵盖该模式是什么、这些数字实际上有多快(包括新的CS-4硬件和尚未验证的内容)、费用是多少(包括诚实的“尚无价格”答案),以及在它正式可用之前该怎么做。
超快速模式到底是什么
Ultrafast 是一个服务层级,而非新模型。OpenAI 于 2026 年 8 月 13 日宣布推出该服务,这是其与芯片制造商 Cerebras 于 2026 年 1 月达成的算力合作的首个产品——据报道,这笔交易在三年内价值约 100 亿美元。标准版 GPT-5.6 Sol 推理在 GPU 集群上运行,并将大量时间花在内存与计算单元之间搬运权重;而 Ultrafast 则将模型权重加载到 Cerebras 晶圆级芯片上 44 GB 的片上 SRAM 中。Sol 这种规模的模型会分层横跨多个晶圆,因此权重就放置在计算单元所在的位置。其结果是:吞吐上限由硅片本身决定,而非由内存带宽决定。
硬件领域在2026年8月18日有了新进展。在Supernova活动上,Cerebras发布了CS-4——这是基于其Nexus平台构建的下一代机架级系统:每个机架配备三颗晶圆级引擎(Wafer-Scale Engine)芯片,令牌生成速度最高可达前代CS-3的2倍;据Cerebras称,在超过10万亿参数的模型上,每秒可生成超过1,000个令牌。这些是Cerebras对一款尚处于早期访问阶段、尚未广泛上市的系统所给出的官方说法。自发布以来,X平台上仅有一条帖子声称CS-4已经在以每秒约1,300个令牌的速度为GPT-5.6 Sol提供服务——这一数字与Cerebras自身公布的数据方向一致,但迄今为止无人证实。请将其视为一个早期信号:看似合理、未经证实,在据此规划容量之前值得重新核实。
对你的代码而言,真正重要的部分是:模型 ID、权重、推理行为和输出都与标准 GPT-5.6 Sol 完全一致。OpenAI 将 Ultrafast 定位为「每秒完成更多有用工作」,而非一个质量档位;预览版运行的是完整旗舰模型——提速并非源自换成更便宜的模型。改变的只有 token 产出的速度。
不要把 Ultrafast 与现有的快速模式混为一谈。快速模式是标准硬件上单独购买的一个档位:输出速度最高约为 2.5 倍,但每个 token 需支付 2 倍的价格(每 1M 输入 $10 / 输出 $60),质量不变。Ultrafast 则完全是另一回事——采用 Cerebras 硬件,速度最高可达 14 倍,而且目前完全免费。
有多快——重要的数字

最显眼的数字是 14 倍,而这个数字需要定义。OpenAI 表示,与标准 GPT-5.6 Sol 处理相比,Ultrafast 每秒最多可生成 750 个输出 token。这是一个针对输出 token 的吞吐量数字,而不是“一切运行速度都快 14 倍”这种笼统的说法——端到端请求时间还包括输入处理和模型自身的推理,这正是 14 倍被标注为最大值的原因。
• 最大输出吞吐量——根据 OpenAI 的公告(2026-08-13),每秒最多可输出 750 个 token。
• 与标准处理相比——速度提升最高可达14倍(依据同一公告);实际增益因输入长度和任务类型而异。
• Humanity's Last Exam,2,500道题——OpenAI/Cerebras 报告称,GPT-5.6 Sol Ultrafast 用时 11 小时 11 分钟完成,而 Claude Fable 5 耗时 78 小时 27 分钟,准确度相当。该结果为供应商自行报告,且对比涉及两家供应商的硬件栈——应视为方向性参考,而非定论。
• 端到端 GDP-Val——Cerebras 报告称整体快 5.6 倍,且无可衡量的质量损失。同样为供应商自报数据。
• 快速模式基线——现有可购买速度档位最高约为 2.5× 输出速度,价格溢价为 2×。
• CS-4,下一代硬件——Cerebras 声称 CS-4 机架在超过 10 万亿参数的模型上每秒可生成超过 1,000 个 token,token 生成速度最高可达 CS-3 的 2 倍。一份未经证实的社区报告称,GPT-5.6 Sol 在 CS-4 上的速度约为每秒 1,300 个 token——方向一致,但尚未得到 OpenAI 或 Cerebras 的确认。
在引用 14× 这个数字之前,有一点要提醒你:关于发布的独立报道引用了与 Claude Fable 5 相比约 11× 的生成速度对比,而 Cerebras 自己的数据则暗示同一轮跑批的总测试时间约为 7×——差异在于你衡量的是工作负载的哪一部分。同样的原则也适用于 CS-4 的速度信号:约 1,300 token/s 的数字最初只是一条 X 帖子,OpenAI 和 Cerebras 都没有证实过。这些都是本周发布的厂商或社区数字,目前均未经过独立验证。请把它们当作声明,而非基准测试的定论。
它要花多少钱——以及诚实的差距

以下是2026年8月19日价格问题的现状,直截了当地说:Ultrafast没有公布价格。OpenAI尚未公布价格,预览版也没有出现在任何公开价目表上。关于早期访问名额被捆绑或免费的报道纯属猜测,而非政策——在OpenAI为该层级定价之前,你在其他地方找到的任何“GPT-5.6 Sol Ultrafast cost”数字都只是猜测。
你今天可以定价的是 GPT-5.6 Sol 系列的其余部分,已根据 OpenAI 于 2026-08-18 公布的价格进行验证:
• Standard GPT-5.6 Sol — 每1M tokens输入$5.00 / 输出$30.00。这是您现在即可调用的基线版本。
• 快速模式 — $10.00 / $60.00,2 倍溢价,最高可获得约 2.5 倍的输出速度。这是你实际能买到的最接近速度档位的产品。
• 提示词缓存读取 — 每1M $0.50(较新输入优惠90%);缓存写入按每1M $6.25计费。
• 长上下文档位 — 超过约 272K tokens 的输入按 $10.00 / $45.00 计费。
• Batch API — $2.50 / $15.00,统一五折,约24小时处理时间。
为说明预期溢价:快速模式开创了先例——2.5 倍速度收取 2 倍标准费率。如果 Ultrafast 遵循类似曲线,其定价将远高于标准的 5 美元 / 30 美元——而且围绕预览版的评论也预计如此,因为 Cerebras 晶圆产能稀缺且昂贵。但预期溢价并非实际价格。在费率表出台之前,应按标准 Sol 或快速模式做规划。
如何使用它——预览现实
访问权限是第二个被坦诚承认的差距。Ultrafast 可通过 OpenAI API 向等候名单上的一批精选客户提供,该消息于 2026-08-13 公布,OpenAI 表示访问范围将“随着容量增长”而扩大。目前没有公布全面开放的具体日期。已公布的预览群体包括编程、商业、金融研究、客服支持以及其他交互式工作负载——这些团队的智能体每处理一个请求就要进行大量调用,响应延迟是它们的瓶颈所在。Jane Street、Rogo 和 Podium 是被点名的早期测试者中的几家。
它所设计的使用场景是:事件响应(在故障发生时读取日志、跟踪信息和差异对比)、对动态数据进行金融研究和欺诈检测、实时客户支持和语音服务(在语音中半秒静默就会被视为中断)、电子商务结账,以及将隔夜研究批次压缩为交互式会话。如果你的工作负载是单轮聊天,14×的差异远没有40次调用的智能体循环那么重要。
你今天能做什么——务实的答案

虽然 Ultrafast 仍处于预览阶段,但完整的 GPT-5.6 Sol 现已上线——在 OrcaRouter 上,标准层级按提供商费率提供服务,每 token 零加价,模型 ID 为 openai/gpt-5.6-sol,通过 OpenAI 兼容端点 api.orcarouter.ai/v1 即可访问。如果你已有 OpenAI 客户端,迁移只需更改 base URL 和模型 ID,其他无需任何改动。同一个密钥和端点支持 200 多个模型,因此 Sol 与 GPT-5.6 Terra、GPT-5.6 Luna、Claude Opus 5 以及你用来对比的开源权重模型并列——你可以按难度进行路由,而不必逐一重新集成。
速度页面上有两个 OrcaRouter 的特性值得一提。BYOK:自带 OpenAI 密钥,OpenAI 会按其自身费率直接向你收费——OrcaRouter 每 token 不增加任何费用,并保持你的提供商速率限制和余额不变。Guardrails:PII 盾和内容策略在计费之前运行,因此被阻止的请求会返回干净 400 错误,且永远不会被计费;Agent 防火墙会在工具和 MCP 调用执行之前对其进行评估。当——且如果——Ultrafast 以可路由的价格正式发布,将其插入同一端点只是模型 ID 的变更;你今天构建的设置将继续沿用。
诚实的边界——当Ultrafast不是答案时
14×的故事站不住脚的四个地方,因此你不应针对一个尚未确定的数字进行架构设计或预算规划:
14倍是上限,而非保证。这是Cerebras硬件上的输出吞吐量上限;端到端延迟仍包括输入处理、模型的推理时间以及你自己的网络。推理密集的提示可能会将大部分实际耗时花在思考上,此时宣传中的加速效果便会缩水。
它没有价格,也没有GA日期。截至2026-08-19,你无法购买Ultrafast——只能申请预览访问,而其背后的CS-4硬件仍处于早期访问阶段,并未正式发布。预算请参照标准Sol($5 / $30)或快速模式($10 / $60),并将你在网上看到的任何Ultrafast价格视为未经证实。
这些基准测试结果均为供应商自行报告。公告中OpenAI/Cerebras给出的数字包括11小时的HLE运行时间和5.6×的GDP-Val数值;独立估算大约在7×到11×之间,具体取决于衡量标准。将CS-4的速度信号也加入这一列表:GPT-5.6 Sol在CS-4上约1,300 token/s的数据仅来自一条X帖子,且没有独立确认。上述数据目前均未得到独立验证。
它不会解决一个你没有的瓶颈。 如果你的智能体变慢是因为你自己的编排、工具延迟或输入密集的提示,更快的输出路径只会略微改变尾部。层级匹配决策——GPT-5.6 Sol 为 $5 / $30,GPT-5.6 Terra 为 $2 / $12,GPT-5.6 Luna 为 $0.20 / $1.20——仍然比任何速度层级更能影响你的账单。
总而言之。GPT-5.6 Sol Ultrafast 是 OpenAI 为其旗舰模型推出的最快服务层级——在 Cerebras 硬件上使用相同的权重,吞吐量最高可达 14 倍,已公布层级的输出速度为每秒 750 个 token。据报道,Cerebras 新款 CS-4(2026-08-18 发布)可将 GPT-5.6 Sol 推向每秒约 1,300 个 token,但这一数字仅来自一条未经证实的 X 帖子。截至 2026-08-19,Ultrafast 仍是候补名单预览版,没有公开价格。如果你想找一个数字来做预算,老实说,现在还没有。标准版 GPT-5.6 Sol 定价 $5 / $30,是今天就能使用的;快速模式 $10 / $60 是可购买的速度层级;OrcaRouter 使用你自己的密钥转发这两者,零加价。现在就构建好路由——等 Ultrafast 有了价格和发布日期,只需改一个模型 ID 即可。
在 Ultrafast 获得定价之前,完整的 GPT-5.6 Sol 已在 GPT-5.6 Sol on OrcaRouter 上线,每百万 tokens 仅需 $5 / $30,零加价,可直接使用你自己的密钥。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
