OpenAI 下调 GPT-5.6 API 价格:有何变化、为何调整、如何获取
Guides & Insights

OpenAI 下调 GPT-5.6 API 价格:有何变化、为何调整、如何获取

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年7月30日,OpenAI下调了其两款低成本GPT-5.6模型的API价格——大幅降低最低档价格,并小幅下调中档价格。三周后,该公司将目光转向旗舰型号:2026年8月21日,OpenAI宣布GPT-5.6 Sol API价格在未来三个月内下降超过20%,该公司正致力于提高该模型的运行效率。本文详细解释了两轮调价的具体变化、背后的工程原理、新价格与竞争对手的对比、需要注意的隐藏成本、如何进一步削减账单——以及更低价格如何已经在OrcaRouter上以0%加价上线。

下文中的每个数字均标注了来源。定价按每百万个词元(输入/输出)计算。Luna 和 Terra 的费率反映的是 OpenAI 2026 年 7 月 30 日的费率表,该费率表由包括 Unite.AI 在内的媒体报道;Sol 的降价反映的是 OpenAI 2026 年 8 月 21 日的公告,其每词元价格由包括 Runtimewire 和 Reuters 在内的媒体报道。OrcaRouter 的直通模式页面显示相同的数字;竞争对手的数据均注明出处。价格时有变动——请在构建前核实。

TL;DR。OpenAI 于7月30日将GPT-5.6 Luna降价至$0.20 / $1.20(原价$1 / $6,降幅约80%),并将GPT-5.6 Terra降价至$2 / $12(原价$2.50 / $15,降幅约20%)。8月21日,折扣扩展至旗舰型号:据OpenAI表示,GPT-5.6 Sol的API价格在未来三个月内下降超过20%——从每百万token $5 / $30降至$4 / $20,同时基于token的Codex和ChatGPT Work积分可购买更多用量,订阅使用量保持不变。7月的降价得益于两项效率提升:重写的GPU内核(服务成本降低约20%)和重新设计的投机解码草稿模型(token生成速度提升15%以上)。如果你通过OrcaRouter这类厂商中立、0%加价的端点进行路由,新费率已即时生效——相同价格,一个兼容OpenAI的API,旁边还有所有竞品模型可供对比和路由切换。

关键要点

• GPT-5.6 Luna:现在每1M tokens收费$0.20 / $1.20,原价为$1 / $6——大约降价80%。

• GPT-5.6 Terra:现价 $2 / $12,原价 $2.50 / $15 — 降幅约 20%。

• GPT-5.6 Sol(旗舰版):未来三个月现为4美元/20美元,原为5美元/30美元——这是2026年8月21日宣布的超过20%的降价。

• Codex 和 ChatGPT Work 的基于代币的积分购买力更强:Sol 输入降至每 1M 令牌 100 积分,输出降至 500 积分(原为 125 / 750)。

• 订阅保持不变:Plus、Pro 和 Business 包含的使用量、每周五小时限制以及原有信用费率均不受影响。

• 原因:OpenAI 将这两轮都描述为效率红利——重写的生产级 GPU 内核(服务成本降低约 20%)加上投机解码草稿模型的重新设计(token 生成效率提升 15% 以上),据 OpenAI 7 月 29 日的工程博客所述。

• 如何获取:降价已反映在 OrcaRouter 上(0% 加价)— Luna 为 $0.20 / $1.20,Sol 为 $4 / $20 — 通过一个 OpenAI 兼容端点。

到底发生了什么变化

OpenAI 的 GPT-5.6 系列采用分层定价:Luna(快速、最便宜)、Terra(中端)和 Sol(旗舰)。7 月 30 日的降价惠及两个较便宜的层级。根据公布的价目表,GPT-5.6 Luna 从每百万输入/输出 token $1 / $6 降至 $0.20 / $1.20——输入和输出均下降约 80%;GPT-5.6 Terra 从 $2.50 / $15 降至 $2 / $12,降幅约 20%。GPT-5.6 Sol,这款专为最困难的推理和智能体编码打造的旗舰模型,当天未受影响——但到 2026 年 8 月 21 日,OpenAI 也宣布对其实施临时降价:未来三个月的 API 价格下调超过 20%,至每百万输入 token $4、每百万输出 token $20,缓存输入从 $0.50 降至 $0.40。同一公告还表示,你在 Codex 基于 token 的计划中购买的额度更耐用了,而订阅中包含的使用量保持不变。

每 token 的基础费率并非全貌。GPT-5.6 的定价还包含输入长度档位(超长上下文会进入更高费率)、提示缓存折扣(缓存输入远比全新输入便宜),以及批处理选项(异步任务享受折扣)。这三者在降价后仍然适用,因此对于缓存或批处理密集型工作负载,有效价格甚至还能更低。但要注意长上下文档位是反方向的风险:喂入超大提示词可能会让你跳到更高档位。

削减背后的两项优化

这不是亏本引流的手段——OpenAI将其定性为一次效率红利。在2026年7月29日的一篇工程博文中,OpenAI技术团队成员描述了Codex和ChatGPT Work背后推理及智能体框架的多项优化。其中两项尤为突出。其一,跨生产基础设施的GPU内核重写——借助Codex内部运行的Sol来重写公司自身的内核——OpenAI称此举将端到端服务成本削减了约20%。其二,一个重新设计的推测解码草稿模型,据称将令牌生成效率提升了超过15%。服务成本降低,并以高用量套餐降价的形式传导给客户,这就是故事的表面——而这背后,是整个行业都在追逐的一个反馈回路的缩影:用前沿模型来优化服务于这些模型自身的基础设施。

8月21日公布的Sol降价也采用了同样的表述。据OpenAI称,此次降价——未来三个月降幅超过20%——源于公司提高了模型的运行效率,且明确为临时性措施,而非永久性价格调整。

新价格对比

此次降价直指竞争对手。据Unite.AI报道,Luna新推出的$0.20/$1.20定价,输入价格约为Anthropic Haiku 4.5的五分之一,输出价格约为其四分之一;Terra新推出的$2/$12定价则低于Claude Sonnet 5的标准定价(据报道为$3/$15,自2026年8月31日起生效)。在开放权重模型阵营中,Luna目前的定价已接近DeepSeek V4系列和智谱GLM-5.2所确立的低成本推理价格下限(约$1.20/$4.10),阿里巴巴的Qwen和Google的Gemini Flash系列也处于相近区间。Sol临时降价至$4/$20,使旗舰产品仍远高于其自身的批量价格层级,但降低了溢价——其中输出token降价三分之一,对输出密集型智能体工作负载最为关键。对此举的报道指出,此举出台之际,OpenAI正面临来自Anthropic和中国AI模型日益激烈的竞争。

推理越来越便宜

退一步看,这次降价符合一项持续多年的趋势:随着实验室从相同硬件中榨取更多吞吐量,每一代模型在给定能力水平上的成本都急剧下降。OpenAI 自家较旧的定价档位就体现了这种随时间的下行趋势;每一项效率突破——更好的内核、推测解码、更廉价的注意力机制——往往在数月内就会表现为降价。对买家来说,实际的启示是要为一个推理成本按节奏下降的世界设计架构:不要过度绑定单一模型的定价,并保持切换成本低廉。

需要留意的隐藏成本:推理令牌

GPT-5.6 模型是推理模型,这会影响实际支出。启用推理时,模型会生成内部推理 token,并按输出计费——因此你的实际输出成本可能高于按“答案中的字数”直接估算的结果,尤其是在推理强度较高的困难提示词上。解决办法是根据任务调整推理强度(简单调用使用低或关闭),尽可能限制输出,并测量实际 token 用量,而不是想当然。更低的每 token 价格有帮助,但控制生成的 token 数量更有帮助。

这对开发者意味着什么

如果你用 GPT-5.6 Luna 或 Terra 处理高吞吐量工作——分类、抽取、路由、轻量级智能体、聊天——你的账单刚刚降了,有些情况下几乎砍掉大头,而且无需修改任何代码。这让用量档位对成本敏感型工作负载更具吸引力,也缩小了与廉价开源模型之间的价格差距。旗舰的定价账也变了,至少目前如此:Sol 未来三个月按 $4/$20 计费,拉低了顶级档位中重推理和智能体工作的成本;基于 token 的 Codex 和 ChatGPT Work 额度也更经用了。对于最棘手的任务,它仍是高端之选——只是比以前便宜了。制胜模式不变:按难度路由——简单的那 80% 交给廉价档位(或廉价开源模型),旗舰只在它能值回成本的地方上场。

如何进一步削减您的账单

此次降价是打基础的地板,而非终点线。最大的额外杠杆有:提示词缓存(复用稳定的系统提示词或长上下文,支付低得多的缓存输入费率);批量选项(以折扣价异步运行非紧急任务);分层与模型路由(将每个请求发送到能处理它的最便宜模型,包括开放模型);以及推理控制(不要为琐碎调用支付深度推理费用)。叠加起来,这些方式削减实际账单的幅度通常远超任何单一费率变化。举个具体参照:按每月1000万token、输入占比70%计算,Luna的新费率大约为每月5美元(使用缓存则约4.37美元);同样的用量在Sol上约为每月125美元——这就是按难度路由最有力的论据。

如何立即捕捉更低的价格

这是将一切串联起来的部分。OrcaRouter收取 0% 加价,并将提供商定价直接透传,因此 OpenAI 的降价已在 OrcaRouter 上生效:模型页面上现已显示 GPT-5.6 Luna $0.20 / $1.20、Terra $2 / $12、GPT-5.6 Sol $4 / $20——与 OpenAI 自己的定价一致,只需一个兼容 OpenAI 的端点,即可与其他 185+ 个模型一起访问。无需迁移即可享受降价,并且可以在一个地方将 Sol、Luna、Terra 与 DeepSeek、GLM、Qwen、Gemini、Claude 进行比价,然后将每个请求路由到对该任务最便宜的模型。此外还有免费套餐和 Offers 页面,可进一步节省费用。

降价已在 OrcaRouter 上生效:GPT-5.6 Luna 为每 1M tokens $0.20 / $1.20,GPT-5.6 Sol 为每 1M tokens $4 / $20,均以 0% 加价直接传递。

按难度规划路线,节省更多

最便宜的账单不是某一个模型——而是每次请求都用对的模型。由于OrcaRouter通过一个端点就能提供全部模型,你可以把简单、高并发的调用发送给Luna或一个便宜的开放模型,把Sol或其他旗舰模型留给困难的任务,只需修改配置即可切换,而无需重新集成。Luna降价使这种按难度路由的策略更加便宜,而暂时的Sol折扣也降低了困难调用的成本——无需你重新对接任何东西。

常见问题

OpenAI 将 GPT-5.6 的价格下调了多少?

GPT-5.6 Luna 的价格从每百万 tokens 的 $1 / $6 降至 $0.20 / $1.20(约下降 80%),GPT-5.6 Terra 则从 $2.50 / $15 降至 $2 / $12(约下降 20%)。2026年8月21日,OpenAI 还将 GPT-5.6 Sol 的价格从 $5 / $30 下调至 $4 / $20,为期三个月。

价格削减是什么时候生效的?

Luna 和 Terra 的降价于 2026 年 7 月 30 日生效,并已发布在公开的费率卡上。OpenAI 于 2026 年 8 月 21 日宣布 Sol 将临时降价,为期三个月。

为什么OpenAI降低了价格?

OpenAI 将 7 月份的降价归因于推理优化——重写的生产 GPU 内核(服务成本降低约 20%)和重新设计的推测解码草稿模型(token 生成效率提升 15% 以上)——根据 2026 年 7 月 29 日发布的一篇工程博客。OpenAI 以同样的方式解释了 Sol 的降价,将其视为在模型运行成本持续下降、市场竞争日益激烈的背景下所采取的一步。

旗舰款(Sol)降价了吗?

是的——暂时的。7月30日的降价使GPT-5.6 Sol的价格为每百万token 5美元/30美元,但2026年8月21日,OpenAI宣布未来三个月降价超过20%,降至每百万token 4美元/20美元。Codex和ChatGPT Work基于token的积分也能购买更多,而订阅使用量保持不变。

新价格与Anthropic和开源模型相比如何?

据报道,Luna 现在的输入/输出价格分别约为 Anthropic Haiku 4.5 的 1/5 和 1/4,而 Terra 则低于 Claude Sonnet 5 的标准定价($3 / $15)。Luna 也接近 DeepSeek 和 GLM-5.2 设定的廉价开源模型价格底线。

推理代币有什么猫腻?

GPT-5.6 是推理模型;内部推理令牌按输出计费,因此有效输出成本可能超出简单估算。可通过调整推理力度并设置输出上限来控制成本。

如何获得新的更低价格?

它们已在 OpenAI 的 API 上上线,并以 0% 加价率在 OrcaRouter 上线——其中 GPT-5.6 Luna 显示 $0.20 / $1.20,GPT-5.6 Sol 为 $4 / $20——通过一个与 OpenAI 兼容的端点即可接入,无需更改任何代码。

最重要的一点

OpenAI 7月30日的降价使得GPT-5.6 Luna和Terra在大批量工作负载下大幅更便宜,而8月21日的公告则将这一趋势延续到旗舰型号:GPT-5.6 Sol在未来三个月降至$4 / $20,同时Codex令牌额度可购买更多,订阅使用量保持不变。这两轮降价都是效率红利——一方面是内核重写和投机解码带来的提升,另一方面是更低的推理服务成本——也是对真实价格战的明确回应。按难度路由,善用缓存和批处理,并控制推理令牌以最大化节省。而且由于OrcaRouter以0%加价传递供应商定价,更低费率已在那里生效——Luna为$0.20 / $1.20,Sol为$4 / $20——同样价格、一个兼容OpenAI的端点、整个模型领域尽在一处。无需更改一行代码即可享受降价,让每个请求自动选择能胜任任务的最便宜模型。