一张生成的标题卡,主标题为“Ultrafast 对比 Standard”,副标题为“一个 GPT-6.1 Sol 检查点,两种费率卡”,标签上写着“$2.00 / $10.00 Standard”和“$12.00 / $60.00 Ultrafast”,并带有“6x”徽章和一行“相同的 token,六倍的账单”,底部页脚注明这些价格是 OpenAI 针对短上下文请求自己的列表价格。
Engineering & Research

GPT-6.1 Sol Ultrafast 与 GPT-6.1 Sol:快车道的成本高于前沿模型

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

开启 GPT-6.1 Sol Ultrafast 会让 GPT-6.1 Sol成为 GPT-6 家族中,生成一个并非由 GPT-6 Astra 产出的 token 最昂贵的方式。这就是一句话概括的全部对比,而它与“更便宜模型上的快速选项”听起来应该意味着的东西恰恰相反。Ultrafast 的定价是 Standard 的六倍——每百万输入 token 12.00 美元、每百万输出 token 60.00 美元,而后者分别为 2.00 美元和 10.00 美元——这使得一次快速 GPT-6.1 Sol 调用比正常速度下的 GPT-6 Astra 更贵,比正常速度下的 GPT-5.6 Sol 更贵,并且在价目表上与其他任何东西的差距都小到可以忽略不计。

这一切都不意味着该层级是个错误。它使其成为一次对延迟的购买,而本页要回答的问题是:这种延迟何时值得那个价格,何时不值得。被比较的两个产品是同一个检查点和相同的答案;全部区别只在于一个服务层级标志和一张账单。

相同的模型,而且值得确切说明到底有多相同

没有需要下载的 Ultrafast 检查点,没有单独的上下文长度限制,也没有不同的知识截止时间。你发送model: "gpt-6.1-sol",并搭配service_tier: "ultrafast",OpenAI 就会以不同的方式调度该请求;不带这个标志发送,你得到的就是 Standard。开发者实际编写代码时所面对的一切都完全相同:

• 模型 ID — gpt-6.1-sol 两者均适用,仅有一个默认快照,没有可固定到的带日期版本

• 上下文 —— 1,050,000 token 窗口,最大输入 922,000 token,最大输出 128,000 token,两者均是

• 知识截止日期——2026 年 4 月 30 日,两者均为

• 推理层级 — 低、中(默认)、高、xhigh、max,两者均支持;无和最小在两者上均不受支持

• 模态——支持文本和图像输入、文本输出

• 工具能力 — 通过 Responses API 为两者提供同一套网络搜索、文件搜索、图像生成、代码解释器、托管 shell、应用补丁、技能、计算机使用、MCP 和工具搜索

• 价格 — 每百万 tokens $2.00 / 缓存 $0.10 / 缓存写入 $2.50 / 输出 $10.00,对比 $12.00 / $0.60 / $15.00 / $60.00

• 超过 272K 输入 token 的长提示词 — 整个请求将按 2 倍的输入和缓存费率、1.5 倍的输出费率重新计价,两者均适用,因此 Ultrafast 长上下文的定价为 $24.00 / $1.20 / $30.00 / $90.00

• 速度 — Standard 就是标准档;Ultrafast 位于档位阶梯的最顶端,而 OpenAI 文档中唯一按特定模型公布的倍数属于 GPT-6 Astra,而非本模型

最后那句话是整篇文章中坦诚的警示。OpenAI 的文档称,GPT-6 Astra Ultrafast“在 Codex 中以标准模式生成 token 的速度最高可达 GPT-6 Astra 的 8 倍”。GPT-6.1 Sol 的文档描述了该层级,列出了其速率限制,并称其支持美国和欧盟的数据驻留——但它并未公布倍数。如果你购买它是因为期待八倍的速度,那你是从同系列的另一款模型上外推的,而这两者都不存在独立的实测数据。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context stepping to $120.00 / $12.00 / $150.00 / $450.00 in long context, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, with the page's note that short context means up to 272K input tokens.

实算示例:一次智能体回合在各通道上的开销

让一个编码智能体走一遍真实、毫不起眼的循环:每一轮都重新读取 40,000 个 token 的仓库上下文,并输出 6,000 个 token 的推理和补丁,而任务需要十二轮。先假设没有任何缓存——这是最悲观的情况,也是让该档位在输入上显得最糟的情况;然后再把上下文已缓存的情形做一遍,因为提示词缓存后的智能体实际上就是这么做的。

• 标准、未缓存 — 40,000 个输入 token 花费 $0.08,6,000 个输出 token 花费 $0.06,因此每轮 $0.14,$1.68用于该任务

•超快,未缓存 — 每轮输入 $0.48、输出 $0.36,每轮 $0.84,$10.08该任务共

• 标准、缓存的上下文——40,000 个 token 降至每百万 $0.10,因此单轮为 $0.064,整个任务为 $0.77

• 超快、已缓存的上下文 —— 在当前档位下,缓存输入为每百万 $0.60,因此本轮为 $0.384,整个任务为 $4.61

每一行的倍数都是六,这正是关键所在:缓存并不能让你免于该档位的影响,它会随档位一同放大。这些数字换来的是任务在大约八分之一的挂钟时间内完成,而全部的判断就在于:消除这段等待,是否值得为每个任务付出 2.40 至 8.40 美元。

不过,下面这个对比应该能帮大多数团队一锤定音。把相同的 token 数量放到 GPT-6 Astra 的 Standard 档位上算笔账——每轮输入 $0.40、输出 $0.30,整个任务 $8.40。GPT-6.1 Sol 上的 Ultrafast 每 token 单价比正常速度下的前沿模型还要贵。这并不是否定该档位,而是在说明你优化的究竟是哪个维度。如果你的问题在于回答质量,那么用 Standard 的 Astra 更划算。如果你的问题是有个人正盯着转圈等待,那么 Astra 和 Sol 都帮不上忙,而这个档位能。

在任何人依据这些数字编制预算之前,有一个注意事项:对于同一任务,不同模型的 token 数量并不恒定。这些是在相同假定的 token 数量下进行的按 token 比较,而这也是费率卡唯一支持的比较方式。请测量你自己的追踪数据。

A generated cost card headed 'One agent turn, four ways', comparing GPT-6.1 Sol Standard at $0.14 per turn and $1.68 over twelve turns uncached and $0.064 and $0.77 with prompt caching, GPT-6.1 Sol Ultrafast at $0.84 and $10.08 uncached and $0.384 and $4.61 cached, and GPT-6 Astra Standard at $0.70 and $8.40 on the same token counts, over a footer reading that these are OpenAI list rates per 1M tokens for short-context requests and that the per-turn and per-task figures are the article's arithmetic on those rates rather than vendor benchmarks.

你大概真正想要的档位是 Fast

在 Standard 与 Ultrafast 之间还有一条中间档位,而在 GPT-6.1 Sol 上,它正是大多数团队应当最先定价的那一档。Fast 模式按 Standard 的两倍费率运行——每百万 token 输入 $4.00、输出 $20.00——针对同一个检查点;OpenAI 已于 2026 年 7 月 30 日将 Priority processing 更名为 Fast 模式,因此它已经稳定运行了数月。它的费率仅为 Ultrafast 的三分之一,而换来的提速在该档位文档中被视为常规受支持的情形。

当延迟本身就是产品、而 token 体量又很小时,Ultrafast 才是正确答案:交互式 agent 必须等上一步输出返回才能迈出下一步;开发者循环里四十个短回合不断累积;演示场景中,停顿就是失败模式。当你想要一个整体更快的模型、又不打算为最后那一点提升付出三倍代价时,Fast 才是正确答案。而对于任何以小时计的截止期限,Batch 和 Flex 依然是正确答案——它们的价格是 Standard 的一半,而不是两倍。

速度也不是唯一的杠杆。如果你想消除的延迟是模型在思考,而不是模型在打字,那么这个层级对你毫无帮助:Ultrafast 压缩的是 token 生成,而 OpenAI 自己的描述是,它“缩短了生成输出 token 之间的时间”。一个把大部分墙钟时间花在推理上的请求会更早完成,但提前的幅度只是价格所暗示的一小部分。在你把层级往上调六档之前,先把推理强度调低一档,看看这对账单有什么影响。

标准通道所在之处

标准版 GPT-6.1 Sol 已上线 OrcaRouter,以 openai/gpt-6.1-sol 的形式提供,按供应商自家价格计费:每百万 token 输入 $2.00、输出 $10.00,并以 0% 加价率提供服务——即原厂标价直接透传,因此 OpenAI 一旦调价,你的用量账单当天就会体现出来,而不必等到下一次续费。同一个密钥可访问 200 多个模型,所以你在 Ultrafast 实验之后保留的标准通道流量,可以与任务所需的其他模型一起置于同一个集成之下,供应商服务降级时自动故障转移,还能用路由 DSL 把多个模型组合成单次调用。

Ultrafast 本身并不是我们能卖给你的东西,换个说法都会是不诚实的。它是由 O​penAI 针对你自己的账户计费的一项服务层级标记,而不是一个可单独路由的模型——我们托管的是检查点,而不是层级。把分层流量跑在你的供应商密钥上;把流量规模经由我们路由。

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s and 313.9M tokens of traffic, with the page's code snippet and EN language toggle visible in the header.

谁应该切换它

如果一个人或一个自动化消费方在每一次响应上都会被阻塞,并且每个任务的 token 用量足够小、使绝对账单停留在个位数美元的低位,那就让它保持开启——上面的算式算出一个十二轮的智能体任务约为 $10;如果它替代的是两分钟的人工等待,那这就是个便宜的补救措施,而如果它什么都没替代,那就是个昂贵的。

如果你的工作负载是按计划调度、批量处理、批量评估或每晚重跑的,就别开启它。如果你追求的是质量,关闭同样是正确选择:六倍的花费在这个模型上买不到任何额外的能力,而同样的钱投向 Standard 档的 GPT-6 Astra,是真正的升级,而不是一个转得更快的空转轮。Ultrafast 卖的是时间,而只有那些真正在等待它的工作流,才会觉得时间值每百万 token 60 美元。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新