一张生成的 hero 主标题卡,上标为"模型发布 — 2026 年 9 月",主标题为"GPT-6 Sol 和 GPT-6 Luna",副标题为"每 token 价格减半,并不等于每任务成本减半。",另有四个标签,分别写着"GPT-6 Sol:每 1M $2.00 / $10.00"、"GPT-6 Luna:每 1M $0.10 / $0.50"、"Sol:指数 48,每任务 $1.06"和"Luna:指数 37,每任务 $0.07",以及一条脚注,写着"价格来自 OpenAI;指数与每任务成本来自 Artificial Analysis,2026 年 9 月 22 日。"真实的 OrcaRouter 徽标合成于右下角。
Guides & Insights

GPT-6 Sol 与 GPT-6 Luna:更便宜的 token 未必意味着更便宜的任务

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

厂商发布了GPT-6 SolGPT-6 Luna,发布时间为 2026 年 9 月 22 日,而各地的头条都是价格:Sol 为每百万输入 token 2.00 美元、输出 10.00 美元,Luna 为 0.10 美元和 0.50 美元,二者大约都只有GPT-5.6 SolGPT-5.6 Luna在当前促销费率下收费的一半,并且都远低于旗舰GPT-6 Astra的 10.00 美元/50.00 美元。厂商自己的公告开篇就说:“我们还让缓存和推理变得更高效了。”把这件事解读为降价故事的问题在于,真正落到你账单上的单位并不是 token,而是一项任务。而当天发布的首批独立测量结果显示,这两个新模型正是在这个单位上朝着相反方向漂移——其中 GPT-6 Luna 是两者中输入便宜二十倍的那个,但在与自己的前代相比时却是两者中表现更差的那个。这两个模型中,一个是纯升级,另一个是真正的取舍,而厂商的公告并没有区分二者。

在列出数字之前,先说清本文的证据来源规则,因为这里的两堆证据理应被赋予截然不同的权重。价格、上下文窗口、缓存费率和知识截止日期均来自 OpenAI 自家的 API 文档和定价表,查阅日期为 2026 年 9 月 23 日,其中服务层级和缓存写入相关的条目还对照了第三方成本追踪工具加以佐证,而非仅依据发布会内容。OpenAI 的基准测试表——AutomationBench、DeepSWE 1.1、OSWorld 2.0、Agents' Last Exam,以及一项内部事实性评估——均属厂商自报且未经复现,下文从中引用的每一个数字都已如此标注。独立数据来自 Artificial Analysis,该机构在发布当天对两款模型分别运行了其 Intelligence Index 和 Coding Agent Index;若要做出决策,这些才是值得信赖的数字。当两者出现分歧时,本文会如实指出,而不是取平均值。

发布,用一段话概括

Sol 和 Luna 是 GPT-6 家族中的中端和低端成员,采用 GPT-6 Astra 背后的方法训练,定位为以更快、更便宜的方式获得其大部分能力。OpenAI 的宣传框架是每任务成本,而非原始能力:它表示,在其内部事实性评估中,GPT-6 Sol 的错误数量约为 GPT-5.6 Sol 的一半,而 GPT-6 Luna 在更高推理强度下,能以大约百分之一的任务成本达到 GPT-5.6 Sol 的事实性水平。两者都接受文本和图像输入并输出文本,都拥有 1,050,000 token 的上下文窗口,输出上限为 128K——Artificial Analysis 对同一模型列出的是 872k,因此该窗口的上限应视为厂商宣称——并且两者都提供从 nonemax 的推理强度,而 GPT-6 Astra 不提供这一档位,因为 Astra 没有 none。模型 ID 为 gpt-6-solgpt-6-luna。可用渠道包括 API,面向 Plus、Pro、Business、Enterprise 和 Edu 账户的 ChatGPT Work 与 Codex,以及 Amazon Bedrock——后者在同日宣布两者正式可用。Free 和 Go 用户可在桌面应用中获取 Luna;目前两款模型都尚未登陆普通 Chat 模式。

四个独立数字说明了什么,以及它们为何彼此不一致

先从 GPT-6 Sol 说起,因为它的故事很简单。Artificial Analysis 给它在智能指数上打了 48 分,在已测的 212 个模型中排名第 18,每个指数任务的成本为 1.06 美元,而 GPT-5.6 Sol 为 1.99 美元——以大约一半的成本达到同等指数得分,而且这种单任务成本的改善是实打实的,并不会随时间蒸发。其编程智能体指数从 55 升至 57,Terminal-Bench 4.0 从 37% 提升到 43%,SWE-Atlas-QnA 从 54% 提升到 58%,每个任务成本 2.99 美元,位于帕累托前沿。其幻觉率从 92% 降至 60%,而其拒答行为发生了彻底的形态变化:上一代模型会回答 99% 的问题,如今它只回答 83%,以此换来了减少四分之一的错误答案,准确率则从 59% 微降至 54%。这是一个被教会了在不懂时就闭嘴的模型,而 AA-Omniscience 指数从 22 升至 27,正是用分数形式陈述的同一件事。

现在轮到 GPT-6 Luna,情况就变了。Artificial Analysis 给它的评分是Intelligence Index 37 分——与 GPT-5.6 Luna 的得分完全相同。它每项指数任务的成本从$0.18 降至 $0.07,减少约 60%,而且这一节省是真实的。但它的Coding Agent Index 下降,从 43 降至 41,其中 SWE-Atlas-QnA 从 49% 降至 44%,DeepSWE 1.1 从 66% 降至 64%。其幻觉率从 93% 改善至 77%,而弃答行为几乎不变——准确率 44% 对 43%,AA-Omniscience 从 −10 升至 1。综合来看:测得的智能相同,任务成本约为原来的 40%,但编程智能体更差,答案质量基本不变。

这不是矛盾,而且原因很重要。更便宜的 token 只有在模型为完成同一任务而消耗更多 token 时,才会让你得到更少——而独立数据表明,这些模型消耗得更多,而不是更少。每个索引任务的输出量,Sol 从 29k 升至 31k tokens,Luna 从 41k 升至 51k。GPT-6 Luna 的 60% 节省完全来自降价,而非更精简地运行。每任务 token 的漂移幅度小到在这里算下来仍然对你有利;但作为一个类别,它并没有小到可以忽视,因为正是通过这一机制,未来的降价可能被一个更啰嗦的模型抵消。出于同样的原因,OpenAI 自己的表述也已经转向每任务成本。

有两项退步不在两个头条指数之内,却值得点名,因为二者都未出现在 OpenAI 的公告中。在衡量知识工作交付成果的 GDPval-AA v2.1 中,GPT-6 Sol 大约下降 100 Elo,相较其前代;而 GPT-6 Luna 大约下降 75。GPT-6 Luna 也大约减少 45 Elo;在 AA-Briefcase v1.1 中,Sol 保持稳定——Artificial Analysis 将这一差距归因于表现力较弱以及缺少评分项。如果你对廉价层级的使用是批量摘要、信息抽取和分类,这些都不会影响到你。如果是起草需要某人签字确认的内容,那就会影响你。

A generated two-column scoreboard titled 'GPT-6 Sol vs GPT-6 Luna - the scoreboard'. The left column, GPT-6 Sol, lists Intelligence Index 48, cost per index task $1.06, Coding Agent Index 57, hallucination rate 60%, GDPval-AA about 100 Elo lower, and price per million tokens $2.00 / $10.00. The right column, GPT-6 Luna, lists Intelligence Index 37, cost per index task $0.07, Coding Agent Index 41, hallucination rate 77%, GDPval-AA about 75 Elo lower, and price per million tokens $0.10 / $0.50. A footer line credits Artificial Analysis for the index, cost and hallucination figures as of September 22, 2026 and OpenAI for the prices. The real OrcaRouter logo is composited in the bottom-right corner.

缓存变更才是真正的 API 新闻

在费率表底下,藏着一项对生产账单而言比头条降价更重要的变化,而 OpenAI 自己在公告帖里只用一句话点到它。有三处变化,第三处值得读两遍。

首先是折扣本身:缓存输入读取按输入价格的 10%计费,相当于 90% 的折扣,这与该系列原有的条款一致,而非新增条款。Sol 的缓存输入为每百万 $0.20,Luna 为 $0.01;缓存写入需支付 1.25 倍溢价,分别为 $2.50 和 $0.125,并采用单一的 30 分钟生存时间。

第二点是控制。通过 prompt_cache_optionsprompt_cache_breakpoint——这两个参数让你可以自行声明可复用的提示词前缀在哪里结束,而不必指望服务商替你去猜——实现的显式缓存,两个模型都支持。这并不是新增的 API 表面;真正的新变化在于,它现在值得一用了,因为默认命中率提高了。

第三项改变的是架构。调整推理力度,或开启和关闭工具,都不再使已缓存的prefix失效。在此之前,一个agent循环如果为困难步骤调高effort、再为简单步骤调低,每拨动一次都要为重新处理整个上下文付出代价;在对话中途添加或移除工具也是如此。如今在这两个模型上,这笔税已经消失。OpenAI引用了GitHub的说法,后者报告称,在数十亿次请求中,这些改动将需要全新处理的prompt token占比削减了一半以上。把这当作供应商提供的数据——它可信,但未经独立审计。

在一个长智能体循环上做一遍算术,两条公告的排名就会反转。一个在 200 轮对话中携带 30,000 token 系统提示和工具 schema 的循环,会搬运 600 万 token 的上下文。在没有缓存的情况下,在 GPT-6 Sol 上,这就是 12.00 美元的输入费用。若前缀以每百万 0.20 美元的价格缓存,则是 1.20 美元,再加上一次性的写入成本——一个数量级的差距,来自一个参数改动,而且此时费率下调还根本没用上。费率下调才是公告所推销的东西。真正改变这个数字的是缓存行为,也正是它让 2.00 美元的标称费率,在 OpenAI 正为这些模型推销的工作负载上,表现得像是便宜得多的东西。

费率卡,包括公告中略过的部分

表面费率并非{{1}}全部费率卡{{/1}},而且三档定价会改变{{2}}特定工作负载{{/2}}的决策。

基础 — GPT-6 Sol 输入 $2.00 / 输出 $10.00;GPT-6 Luna 输入 $0.10 / 输出 $0.50,按每百万 token 计,适用于输入 token 不超过 272K 的提示词。

长上下文——当输入 token 超过 272K 时,整个请求都按输入 2 倍、输出 1.5 倍计费:Sol 为 $4.00/$15.00,Luna 为 $0.20/$0.75。这是一个断崖式跳变,而非边际费率。如果你的提示词长达 300K token,你是在为整个请求支付双倍费用,而不是只为超出的那 28K 付费;把一份文档拆成两次低于阈值的调用,往往比一次性超过阈值发送更便宜。

服务层级 — Flex 使费用减半(Sol 为 $1.00/$5.00,Luna 为 $0.05/$0.25),以换取更慢的处理速度;Priority 则使其翻倍。两者都通过 service_tier 参数选择。Flex 是批处理类作业本应使用的地方,但它们几乎从不这么做。

缓存输入 — 在 Sol 上每百万 $0.20,在 Luna 上 $0.01,即 90% 折扣,TTL 为 30 分钟,缓存写入附加费为 1.25 倍。

上下文与输出 — 1,050,000 token 的上下文窗口,最大输出 128K,输入文本和图像,输出文本,推理强度从 nonemax,默认 medium

知识截止日期——GPT-6 Sol 为 2026 年 4 月 20 日,GPT-6 Luna 为 2026 年 5 月 18 日,同一系列内相隔一个月;在你假定这两个模型共享同一世界观之前,这一点值得了解。

OpenAI 的基准测试表说了什么,以及没有说什么

OpenAI 公布的对比全部按每任务成本计算,全部针对 Anthropic,且全部由厂商自行开展。在包含 47 个工具的智能体评测 AutomationBench 1.0.6 上,该公司报告称,GPT-6 Sol 在 xhigh 努力级别下得分为 33.2%,每任务成本为 0.27 美元,而 Claude Opus 5 为 26.9%,每任务成本约为其 11 倍。在 DeepSWE 1.1 上,该公司报告称 Sol 在最大努力级别下得分为 68.8%,而 Claude Fable 5 为 69.9%——得分上落后,但每任务成本低约 80%——Luna 则为 66.6%。在 OSWorld 2.0 上,Sol 在 xhigh 下得分为 60.5%,而 Opus 5 为 60.3%,每任务成本同样低约 80%。在 Agents' Last Exam 上,Sol 达到 56.4%,OpenAI 称其以每任务成本低 60% 的优势超过了 Opus 5 的最佳结果。

这些数字中的每一个都是供应商报告的,且未经复现,有两点需要注意,而不是将其搁置一旁。首先,OpenAI 的基准测试针对的是 Claude Opus 5,而不是在发布前几小时才推出的 Claude Opus 5.5,因此尚无同一测试框架下的比较能够确定哪个模型实际上能带来更低的每成功任务成本。其次,每任务成本并不等于每正确任务成本:一个在83%的情况下给出答案、其余情况选择弃答的模型,在将弃答计为任务的基准测试中,看起来每任务成本很低。上文中的独立弃答数据正是让你能够诚实定价的依据——GPT-6 Sol 在旧模型能回答99%问题的情况下只回答83%,这是一种有意为之的权衡,而它是否是一个好的权衡,完全取决于一个错误答案会让你付出多大代价。

OpenAI 报告称,GPT-6 Luna 在更高推理强度下,其事实准确性可与 GPT-5.6 Sol 相匹敌,而任务成本仅约为后者的百分之一。这是事实准确性的比较,而非能力比较,而独立的 Coding Agent Index 显示,GPT-6 Luna 以两分之差落后于 GPT-5.6 Luna,更不用说 GPT-5.6 Sol 了。

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing the model's Intelligence Index of 48 alongside its cost per task and its output-token and speed figures for the measured reasoning-effort settings.

实际该怎么做

GPT-6 Sol 是那个更省心的选择。在指数评分持平的情况下,任务成本减半,编程智能体更出色,幻觉大幅减少,弃答行为也发生了实质性改变——这些加起来,构成了一次可以按计划推进的升级,而不是一场赌博。如果你用的是 GPT-5.6 Sol,这就是一次迁移,而唯一真正的问题是:你的哪些提示词依赖于旧模型来者不拒的意愿。

GPT-6 Luna 是你在迁移之前该测试的那一个。它并非严格更优的 GPT-5.6 Luna;它是一个形态不同的版本——单项任务成本更低,对自身能声称什么更谨慎,但在智能体编程方面明显更差。对于大批量的分类、抽取、路由和摘要任务而言,这笔取舍几乎等于白捡钱。而对于任何要为编码智能体提供输入、或生成需由人签字确认的文档的场景,Coding Agent 上两个百分点的退步以及 GDPval 的下滑,正是要让你在把自有任务在两者上都跑过之前,继续在流程中保留 GPT-5.6 Luna 的原因。

这也正是不该把其中任何一个写死的理由。目前这两款模型都只支持 OpenAI,而这些层级所服务的工作负载——路由、抽取、低成本分类——恰恰就是那种场景:在同一端点背后接入第二家提供商,就能让模型退化变成无关紧要的事。OrcaRouter 按0% 的加价透传提供商的标价,因此厂商的价格一变,当天同样会落到我们这边,而路由 DSL让你可以把 GPT-6 Luna 部署在更便宜的模型后面,承接流量中较容易的那部分,而较难的那部分则交给 GPT-6 Sol——并配有自动故障转移,任一路径出现性能下降时自动触发。你不必在发布当天就选定赢家,也能从这次发布中获益。

诚实的提醒:截至 2026 年 9 月 23 日,GPT-6 Sol 和 GPT-6 Luna 无法通过 OrcaRouter 路由。我们目前尚未托管它们,上文任何内容都不应被解读为我们在宣称已经托管。我们今天能提供的是这组对比数据——GPT-5.6 Sol 为 $4.00/$20.00,GPT-5.6 Luna 为 $0.20/$1.20,GPT-6 Astra 为 $10.00/$50.00——而这正是你在决定是否迁移之前为迁移定价所需的信息。

Screenshot of the OrcaRouter model page for GPT-5.6 Luna, captured 23 September 2026, showing the model id openai/gpt-5.6-luna with its context window, input and output pricing per million tokens, measured time to first token and recent traffic.

接下来看什么

有三件事可以确定这次发布究竟意味着什么。第一件事是 GPT-5.6 Luna 的 $0.20/$1.20 费率能否撑过这个季度,因为从历史上看,来自单一供应商的“永久性”价格往往是开局之举,而非终局——而同日发布的 Claude Opus 5.5 表明,促成这次降价的压力并未消失。第二件事是这种“弃答”转变能否在实际应用中站得住脚:GPT-6 Sol 每六个问题就有一个拒绝回答,这类变化在实验室里读起来像是改进,而在一个默认会得到答案的流水线中,却像是一个坏掉的产品。第三件事是缓存行为在你的实际流量上是否真实存在,这一点本周就可以测量,而且只能通过测量来回答——折扣力度足够大,以至于花一小时为最长提示词埋点统计缓存命中率,比再看一张基准测试表更有价值。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新