GPT-5.6 降价后的定价:Luna、Terra 与 Sol 对比,以及该选哪一档
Guides & Insights

GPT-5.6 降价后的定价:Luna、Terra 与 Sol 对比,以及该选哪一档

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在 OpenAI 于 2026 年 7 月 30 日降价后,GPT-5.6 系列——GPT-5.6 Luna、GPT-5.6 Terra 和 GPT-5.6 Sol——大规模运行从未如此便宜。一周后,也就是 8 月 6 日,OpenAI 将同样的档位引入 ChatGPT 本身:GPT-5.6 Luna 正成为免费版和 Go 账户的默认模型,这些账户可享无限文本聊天,而 GPT-5.6 Sol 则为 Plus 和 Pro 进行了更新。8 月 19 日,OpenAI 和 Replit 宣布,Replit 面向 Core 和 Pro 订阅者的新 Free Mode 运行在 GPT-5.6 Luna 上——这是迄今为止第三方在走量档位上最大的一次押注。而在 8 月下旬,OpenAI 开始为重度消费者用户推出一项备用方案:一项“Luna Reserve”额度,让部分 ChatGPT Plus 和 Pro 账户在常规使用限额用尽后,仍可在 Codex 和 ChatGPT Work 中有限度地使用 GPT-5.6 Luna。但这三个档位的定价差异很大,而选对档位(再加上善用缓存、批处理和路由)是影响你 API 账单的最大单一杠杆。本指南将列出降价后的完整定价、实际成本示例、各档位与竞品的对比,以及如何通过一个端点在各档位之间路由。

价格按每百万个令牌(输入/输出)计费,反映的是已公布的降价后费率表及 OrcaRouter 的直通模型页面;分级和缓存费率来自 OrcaRouter 的模型页面,竞争对手数据已注明出处。本文中 ChatGPT 上线的细节以 OpenAI 于 2026 年 8 月 6 日的表述为准,Replit Free Mode 的细节以 OpenAI 和 Replit 于 2026 年 8 月 19 日的表述为准——均由厂商提供,未经独立测量。Luna Reserve 的细节以 OpenAI 帮助中心所记载的内容以及 OpenAI 员工和早期用户在 2026 年 8 月下旬报告的内容为准——来自厂商和社区的表述,未经独立核实。价格会变动——构建前请核实。

太长不看

GPT-5.6 Luna($0.20 / $1.20)是高并发场景的主力;Terra($2 / $12)是均衡的中间档;Sol($5 / $30)则是旗舰,用于最难的推理和智能体编程。三者都共享约 105 万 token 的上下文和 128K 的最大输出。提示缓存和批处理选项可进一步降低成本,而超长输入会将你转入更高档位。在消费者端,OpenAI 于 8 月 6 日宣布,GPT-5.6 Luna 正成为 Free 和 Go ChatGPT 账户的默认模型,提供不限量的纯文本聊天;同时更新版 GPT-5.6 Sol 正在向 Plus 和 Pro 推送。8 月 19 日,Replit 面向 Core 和 Pro 订阅者推出了基于 GPT-5.6 Luna 的 Free Mode,并按需将更难的任务上路由至 GPT-5.6 Sol。8 月下旬,OpenAI 还开始推送一项“Luna Reserve”回退机制,让部分 ChatGPT Plus 和 Pro 账户在常规额度用尽后,仍可在 Codex 和 ChatGPT Work 中获得有限的 GPT-5.6 Luna 用量——这一点有 OpenAI 的文档说明,而向选定账户推送的情况则由用户报告。简单多数场景用 Luna,需要更强能力时用 Terra,只有在值得其成本时才用 Sol——并通过一个兼容 OpenAI 的端点按难度路由,以尽量减少开销。

关键要点

• Luna:每100万token $0.20 / $1.20 — 速度快、价格低,适合高吞吐量、对延迟敏感的工作。

• Terra:$2 / $12 — 均衡的中档选择,适合无需旗舰即可应对的更高难度任务。

• Sol:$5 / $30 —— 深度推理、大规模编码与长时程智能体的旗舰之选。

• 缓存和批处理可进一步降低成本;长输入会让您进入价格更高的长上下文档位。

• ChatGPT(OpenAI 声明,8月6日):Luna 成为免费/Go 的默认选项,提供无限文本聊天;Sol 获得针对 Plus/Pro 的可靠性更新。

• Replit({{1}}8月19日宣布{{/1}}):Core/Pro 的免费模式运行在 GPT-5.6 Luna 上——每个 Replit 的使用量最高可提升30倍,更困难的任务会路由至 GPT-5.6 Sol。{{2}}Replit 声称,未经独立核实。{{/2}}

• Luna Reserve(8 月下旬,OpenAI 文档所述):一项设有上限的备用额度,让部分 ChatGPT Plus 和 Pro 账户在常规限制用尽后,仍可在 Codex 和 ChatGPT Work 中继续使用 GPT-5.6 Luna——并非无限量,且不适用于 Business 或 Enterprise 工作区。

• 最大的节省杠杆:按难度分配任务——不要为 Luna 能完成的工作支付 Sol 的费用。

新的 GPT-5.6 基础定价

以下是降价后的基础定价(每百万输入/输出 token):Luna 为 $0.20 / $1.20(从 $1 / $6 下调),Terra 为 $2 / $12(从 $2.50 / $15 下调),Sol 为 $5 / $30(不变)。两个较便宜的层级于 2026 年 7 月 30 日降价;旗舰层级保持不变。简而言之,低层级如今的定价面向规模化,而旗舰层级仍保持高端定位。

分层、缓存和批量定价

基础费率只是起点。GPT-5.6 的定价有三个会实质性改变你实际成本的调整项:

• 长上下文层级。超长输入的价格会逐级上调。在 OrcaRouter 的直通页面上,Luna 在达到大型上下文层级之前为 $0.20 / $1.20,超出后为 $0.40 / $1.80;Sol 在基础层级为 $5 / $30,在最大层级为 $10 / $45。层级由每个请求的输入 token 数量决定,因此少量超长提示词就会悄然拉高你的平均价格。

• 提示缓存。复用的上下文可享受大幅折扣计费——Luna 的缓存读取约为每百万 token $0.02(而未缓存时为 $0.20),缓存写入约为 $0.25;Sol 的缓存读取约为 $0.50(而未缓存时为 $5)。对于拥有稳定系统提示词的智能体和聊天应用,缓存通常是最显著的一项节省。

• Batch。非紧急任务以折扣价异步运行——非常适合批量分类、评估,以及延迟不重要的离线生成。

实例演示:实际成本究竟是多少

具体的数字能让各档位变得真实。以每月 1000 万 token、输入占 70%/输出占 30% 的拆分比例为例(典型的聊天/智能体混合场景):

• Luna:每月约 5 美元(使用提示缓存时大致为 4.37 美元)。

• Terra:每月约 $50。

• Sol:每月约 $125(使用缓存大约 $109)。

对于相同用量,Luna 和 Sol 之间存在 25 倍的价差——这正是为什么将每个请求匹配到最便宜且能胜任的层级,比任何单一费率都更重要。(这些与 OrcaRouter 页面上的成本计算器一致,该计算器基于标价估算;你的实际数字取决于缓存以及你的输入/输出组合。)

每一档究竟是做什么用的

GPT-5.6 Luna——高吞吐主力

Luna 是快速、高性价比的层级,专为高容量、对延迟敏感的工作负载而调优:聊天、分类、提取、路由以及轻量级智能体任务,其 p50 首 token 时间约为 1.65 秒。降价后,价格为 $0.20 / $1.20,旨在直接与廉价的开源模型竞争——是大多数简单调用的默认选择。它也是 O​penAI 正引导消费级 ChatGPT 走向的层级:根据其 8 月 6 日的公告,GPT-5.6 Luna 正在成为 Free 和 Go 账户的默认模型,纯文本聊天将变为无限量,而用于在更难问题上进行更高推理的新 Think 按钮将于下周推出(文件、图像和语音限制仍然保留)。O​penAI 表示,Luna 的事实性错误比它所取代的 GPT-5.5 Instant 少 62%——这是厂商自报的数据,但清晰地表明,该公司正将大部分流量导向这一走量层级。

2026年8月19日,Replit 将 GPT-5.6 Luna 作为其全新 Free Mode(免费模式)的引擎——这也是 Core 和 Pro 订阅用户的默认体验。日常聊天、头脑风暴和简单编码任务都在 Luna 上运行,不会消耗用户付费的 AI 积分预算;Replit 表示,Core 用户现在每月的产出最多可达到此前的 30 倍,其中包括最多 30 小时的聊天。当任务需要更强的推理能力时,Replit 的 Agent 会将相应部分的请求路由到更大的模型——即其 Power/Max 模式或 GPT-5.6 Sol——然后再回落到 Luna。以上是 Replit 和 OpenAI 官方公布的说法,尚未经独立验证——但这一方向与降价举措相符:价格降低 80% 的 Luna,才让一个始终在线、默认包含的服务层级得以成立。

另一个消费者端的新情况于2026年8月下旬出现:Luna Reserve。正如OpenAI在其帮助中心所记载,部分ChatGPT Plus和Pro账户在常规使用配额用尽后,可以在Codex和ChatGPT Work中获得有限的GPT-5.6 Luna使用池,作为后备方案——达到上限时会出现通知或月亮指示符,在储备持续期间你可以继续在Luna上工作。这并不是无限扩展:储备与常规配额相互独立,且自身也有限额;它只提供GPT-5.6 Luna(从不提供Terra或Sol),在Business或Enterprise工作区中不可用,并且达到常规限制并不保证能使用储备。OpenAI工作人员于8月27日确认了该储备的存在,早期用户报告称它正在向部分账户推出——这是供应商和社区的说法,尚未得到独立验证。一些早期社区报告还指出,储备运行的是GPT-5.6 Luna的浏览器精简版,因此在储备模式下,实时网页检查任务可能无法正常工作。

GPT-5.6 Terra — 均衡的中间之选

Terra 介于中端与旗舰之间:在更复杂的推理和编码任务上比 Luna 更强,但比 Sol 便宜得多。定价为 $2 / $12,当 Luna 稍显不足、又不需要旗舰模型时,它是一个合理的默认选择——适用于中等复杂度的信息抽取、起草以及仍需大规模运行的多步骤任务。

GPT-5.6 Sol — 旗舰之作

Sol 专为最艰巨的工作而打造:深度多步推理、大规模软件工程和长周期智能体工作流,能在约 105 万 token 的上下文中保持连贯,并支持最高 128K 的输出。其价格为 $5 / $30(基础价),属于高端之选——请将其留给确实需要它的任务,比如复杂的多文件编码或长时间的智能体运行。8 月 6 日,OpenAI 还在 ChatGPT 中为 Plus 和 Pro 用户更新了 GPT-5.6 Sol:该公司称,聊天版本在事实方面更加可靠——据 OpenAI 称,事实性错误减少了 68%——并能给出更聚焦的回答,还新增了一个滑块来控制其投入的推理力度。此次更新仅限聊天版(Work 和 Codex 背后的 Sol 保持不变),API 层级仍维持 $5 / $30。

推理 token 的注意事项

GP​T-5.​6 是推理模型,因此实际输出成本可能超出简单估算:当推理开启时,内部推理令牌会按输出计费。对于高推理难度的高难度提示,这可能占据你账单的主要部分。请根据任务调整推理力度(简单调用使用低或关闭),尽可能限制输出令牌,并测量实际用量。更低的每令牌费率有帮助;生成更少的令牌更有帮助。

各档位与竞争对手相比如何

此次降价重新定位了 GPT-5.6 在竞争格局中的位置。据报道,Luna 的 0.20 美元 / 1.20 美元如今在输入上比 Claude Haiku 4.5 低约 5 倍,在输出上低约 4 倍,而 Terra 的 2 美元 / 12 美元也低于 Claude Sonnet 5 的标准定价(据报道为 3 美元 / 15 美元)。与开放权重模型相比,Luna 已接近 DeepSeek V4 系列和智谱 GLM-5.2 所设定的价格下限(约 1.20 美元 / 4.10 美元),Qwen 和 Gemini Flash 各档位也与之相近。结论是:对于成本敏感的工作,Luna 如今已能与最便宜的可堪一用的模型竞争,而不再是它们的溢价替代品——而 Sol 仍然是真正的高端档位,提供无法以便宜价格获得的能力。

真正的节省杠杆:按难度路由

最便宜的费用并非来自单一档位——而是将每个请求匹配到能胜任它的最便宜模型。在实际操作中:把简单、高并发的调用交给 Luna(或某个廉价的开源模型),难度更高的任务升级到 Terra,仅在真正困难的那一小部分场景使用 Sol。再结合缓存与批处理,这种做法通常能比任何单次降价节省多得多的成本。难点在于运维层面:你不会想分别去重新集成三个 O​penAI 档位以及各种开源模型替代方案。

通过一个端点访问全部三者(以及更便宜的竞品)

这正是厂商中立路由器发挥作用的地方。OrcaRouter 通过一个兼容 OpenAI 的端点提供 GPT-5.6 Luna、Terra 和 Sol——价格与降价后一致,0% 加价——同时还提供更便宜的开源模型,如 DeepSeek V4 Pro、GLM-5.2 和 Qwen。切换档位(或让 Luna 与某个开源模型做 A/B 测试)只是改一下配置,而无需重新集成,而且你可以把每个请求路由到最便宜的那个模型。Luna Reserve 是同一思路在消费端的版本——一种内置的兜底机制,让部分用户在常规额度用完后仍能继续使用 GPT-5.6 Luna——而 API 端的对应机制则是自动故障转移,当某个提供商对请求限流或报错时,OrcaRouter 会处理这一情况。

降费后的 Luna 价格卡以标价显示在 OrcaRouter 自己的模型页面上——每百万 token 0.20 美元 / 1.20 美元——因为路由器以 0% 加价直接传递提供商价格,并附带典型月度账单的成本计算器。此外还有免费套餐和 Offers 页面,可享受更多优惠。

常见问题

降价后 GPT-5.6 的价格是多少?

Luna 为每百万输入/输出 token $0.20 / $1.20,Terra 为 $2 / $12,Sol 为 $5 / $30。Luna 和 Terra 于 2026 年 7 月 30 日降价;Sol 保持不变。

我应该使用哪个 GPT-5.6 层级?

{{1}}Luna 适用于高吞吐量、延迟敏感型工作;{{/1}} {{2}}Terra 适用于不需要旗舰级的较难任务;{{/2}} {{3}}Sol 适用于最困难的推理和智能体编码。{{/3}} 按难度路由以最小化成本。

GPT-5.6 Luna 在 ChatGPT 中是免费的吗?

OpenAI 于 8 月 6 日宣布,GPT-5.6 Luna 将成为免费版和 Go 版 ChatGPT 账户的默认模型,提供不限量的纯文本对话;文件上传、图像和语音工具仍有限制,而用于提升推理能力的 Think 按钮将另行逐步推出。以上均为 OpenAI 公布的计划,未经独立核实。

为什么 Replit 在免费模式下使用 GPT-5.6 Luna?

Replit 于 2026 年 8 月 19 日发布的 Free Mode,针对 Core 和 Pro 订阅用户默认使用 GPT-5.6 Luna 运行日常聊天、构思和简单编码,并在需要时将更困难的任务上交给更大的模型——其 Power/Max 模式或 GPT-5.6 Sol。Replit 将经济上的可行性归功于 7 月 30 日 Luna API 约 80% 的降价。这些都是厂商自述的计划,未经独立验证。

Luna Reserve 是什么?

O​penAI 为 Codex 和 ChatGPT Work 记录的一项备用配额:部分 ChatGPT Plus 和 Pro 账户在常规用量限额用尽后,会获得一个有限的 GPT-5.6 Luna 用量池,以便他们能继续工作,而不是被中断。它只服务于 GPT-5.6 Luna——从不是 Terra 或 Sol——有自己的上限,与常规用量分开,并且在 Business 或 Enterprise 工作区中不可用。其存在是 O​penAI 声明的(员工于 8 月 27 日确认);向选定账户的推出是社区报告的,未经独立核实。

GP​T-5.​6 每月费用是多少?

在每月1000万token(70%输入)的情况下:Luna约5美元,Terra约50美元,Sol约125美元——在缓存之前,差距达25倍。您的实际成本取决于缓存以及您的输入/输出混合比例。

三个层级都有相同的上下文窗口吗?

是的——上下文约为 1.05M token,输出最高可达 128K token,并支持视觉、工具、JSON 和推理功能。

提示缓存如何影响成本?

缓存能大幅降低重复上下文的成本——Luna 的缓存读取约为每百万 token 0.02 美元,而全新读取为 0.20 美元——因此应尽可能复用缓存提示。相反,长输入则可能使你进入价格更高的长上下文档位。

这些档位与 Anthropic 或开源模型相比如何?

据报道,Luna 的价格低于 Claude Haiku 4.5(输入约 5 倍 / 输出 4 倍),Terra 则低于 Claude Sonnet 5($3 / $15)。Luna 也接近廉价开源模型的价格下限(DeepSeek、GLM-5.2 约 $1.20/$4.10)。

我能在哪里同时使用全部三个层级?

通过 OrcaRouter 的单一 OpenAI 兼容端点,以 0% 加价提供服务,同时搭配更便宜的开源模型,实现基于难度的路由。

底线

降价之后,GPT-5.6 Luna($0.20 / $1.20)和 Terra($2 / $12)对高流量和中端任务很有吸引力,而 Sol($5 / $30)仍是高端旗舰——25倍的成本差距让智能路由更有价值。消费级产品发布强化了这一分层:OpenAI 将 Luna 设为免费默认选项,同时把 Sol 的可靠性更新保留给付费套餐;Replit 于 8 月 19 日推出的免费模式——基于 GPT-5.6 Luna,较难任务路由至 GPT-5.6 Sol——表明高流量产品也落在同一层级。此外,8 月底的 Luna Reserve 备用机制延续了这一模式,在部分 Plus 和 Pro 用户的常规额度用完后,仍将其保持在 GPT-5.6 Luna 上。对于 API 开发者来说,这又多了一个将简单流量路由到 Luna 的理由。最大节省来自按难度路由、利用缓存和批量处理,以及控制推理 token,而不是默认使用单一层级。要做到这一点,最简单的方式是通过像 OrcaRouter 这样的单一 0% 加价端点,在那里三个层级(按新价格)都与你想要对比的更便宜的开源模型并列呈现。