
GPT-6 Luna vs GPT-5.6 Luna:同样的名字,一半的价格,更差的交付成果
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
两个模型共用一个词,以及一个实际上完全相同的独立评分。GPT-6 Luna在Artificial Analysis智能指数上达到37.26;GPT-5.6 Luna则达到37.32。0.07分的差距算不上一次测量,它就是噪声,而这是这组对比中最重要的事实。区分这两个模型的并非能力——而是每完成一项指数任务0.0681美元对0.1783美元的成本,以及一系列知识工作方面的退步,而降价对此只字未提。
这些日期对于解读这些数字很重要。GPT-5.6 Luna 于 2026 年 7 月 9 日发布,价格为每百万输入 token 0.20 美元、每百万输出 token 1.20 美元。GPT-6 Luna 于 2026 年 9 月 22 日发布,价格分别为 0.10 美元和 0.50 美元——恰好是输入费率的一半,输出费率则降低了 58%,OpenAI 称这是永久性的,而非促销性的。这是一次真正的降价,而且它也只是这个故事中较小的一半。更大的一半在于,新模型是一个不同的模型,而不是同一个模型重新定价。

一次迁移实际能带来什么,用数字说话
将两者放在决定迁移的各项维度上并排比较,结果并不均衡。有些行有所改善,有些出现退步,还有一行改善幅度很大。
• 价格 — GPT-6 Luna 每百万 token 输入 $0.10 / 输出 $0.50,而 GPT-5.6 Luna 为 $0.20 / $1.20。输入价格减半,输出价格降低 58%。
• 缓存输入——每百万美元 0.01 美元,对比 0.02 美元。基数减半后同样享受 90% 折扣,因此重复前缀的成本是七月份的一半。
• 每完成一项任务的成本——0.0681 美元,而同一测试套件上为 0.1783 美元。降幅达 62%,这一降幅大于 token 单价的下调幅度,因为任务构成并不完全相同。
• 每任务输出 token 数——50,537 对 41,235。新模型每完成一项任务要多啰嗦 23%,其 78% 的输出是从不体现在回复中的推理。
• 上下文窗口 — 1,050,000 tokens 对 1,000,000。相同的实际上限;两者的输出上限均为 128,000 tokens。
• 弃答——在 AA-Omniscience 上,幻觉率为 76.7%,而对比基准为 92.6%。这是整套结果中单项提升最大的一项,而且并非知识增长:准确率从 42.7% 升至 43.8%,基本持平。较新的模型选择拒答而非编造,这属于行为层面的变化,而非能力层面的变化。
• 知识工作交付成果 — AA-Briefcase v1.1 从 1,345.38 Elo 降至 1,299.23,GDPval-AA v2.1 从 1,443.14 降至 1,367.09。两者均下降,降幅分别约为 46 分和 76 分。
• 编码与长时程工作——Terminal-Bench 4.0 从 11.6% 升至 12.6%,SciCode 从 53.6% 升至 54.6%,这是此处上升的两行。与此相对,Coding Agent Index 从 43 降至 41,SWE 风格的智能体评估也呈相同走势。
• AutomationBench-AA —— 53.2%,对比 50.2%。上升了,且升幅超过该组中任何其他智能体指标。

回归出在工件上,而不是推理上。
最后两行中的模式值得点明,因为它就是整个决策的关键。新模型更擅长单步智能体操作,却更不擅长交回一份完成的文档。Artificial Analysis 将知识工作方面的退步归因于呈现质量以及跳过了评分标准所要求要素的交付物,而非事实性或推理失败——这恰恰是那种能通过冒烟测试、却会在评审中失败的回归。
把这两个事实放在一起看,迁移就会按输出的消费方清晰地一分为二。如果你的流水线读取的是结构化输出——JSON、分类结果、抽取出的字段、路由决策——那么呈现效果的回退不会让你付出任何代价,弃权改进是实打实的收益,62% 的任务成本下降也会完全兑现。如果阅读交付物的是人——报告、备忘录、面向客户的文件——那么较新的模型恰恰在你花钱购买的那件事上可量化地更差,而省下的钱实际上是在给你买一个审阅者。
弃权数据也值得同样的对待。一个模型从在它不知道的内容上有93%的情况会编造,变为有77%的情况会编造,对于护栏、合规筛查,或任何会让自信的错误答案传播的流水线来说,都是一个实质不同的对象。这种改进是真实的,是独立测得的,也是主张把工作迁移到新模型上的最有力论据——而这个论据完全不取决于价格。
你的代码中哪些会变,哪些不会变
降幅并没有如此规模的降价所暗示的那么大,而这正是好消息。上下文窗口属于同一量级,最大输出完全相同,都是 128,000 tokens,该系列的长上下文重新定价条款也没有变化:输入超过 272,000 tokens 的请求,其输入和缓存费率按 2 倍计费、输出按 1.5 倍计费,而且是针对整个请求计费,而不是只针对超出这条线的部分。一个在 GPT-5.6 Luna 上用到 300,000 tokens 时很贵的请求,在 GPT-6 Luna 上同样很贵——费率减半,断崖依旧,所以 7 月就该拆分的负载,现在仍然应该拆分。
effort 阶梯改变的是行为,而不是成本。GPT-6 Luna 提供 none、low、medium(默认值)、high、xhigh 和 max,而默认值很重要:针对某个模型默认 effort 调优过的流水线,并不自动适用于另一个模型。显式固定了设置的团队不受影响。采用默认值的团队运行的配置与 7 月时不同,而可见的症状将是 token 数量,而不是质量。
有一个陷阱值得重申,因为它并不会随着新模型的出现而消失。在 Chat Completions 端点上,只有当 reasoning effort 设为 none 时函数调用才可用;其他任何 effort 等级,以及所有内置工具,都需要使用 Responses API。一个团队若只是通过更改模型字符串来移植工具调用循环,会发现其工具在默认的 medium effort 下悄无声息地不可用,而解决办法是重写调用接口层,而不是调整某个参数。
今天你可以路由哪些内容,以及哪些不能路由
这是迁移中与基准测试毫无关系的部分。 GPT-5.6 Luna 已按标价上架 OrcaRouter —— 每百万输入 token 0.20 美元,每百万输出 token 1.20 美元,1,000,000 token 上下文窗口,128,000 token 最大输出,以及在我们自己的模型页面上根据实时流量测得的 1.60 秒 p50 首 token 时间。 我们按供应商标价原样传递,不加任何加价,因此 OpenAI 对这一系列重新定价的当天,我们这边就已生效,而不是等到下一个计费周期。

截至2026年9月23日,GPT-6 Luna 无法通过 OrcaRouter 进行路由。可用渠道是 OpenAI 自己的 API 以及承载该系列的云目录,而我们不会列出无法提供服务的模型。实际后果是,计划进行此迁移的团队今天可以调整定价,但今天无法调整路由——这一变更的两个部分将在不同日期落地。
与此同时,这使得大多数团队最终无论如何都会想要的安排成为可能。把 GPT-5.6 Luna 留在交付物就是产品的路径上,在输出由代码消费的地方运行 GPT-6 Luna,并把这条边界当作一个层级,而不是一次重写。因为你能访问的模型都位于同一个端点之后,同一个密钥下有 200 多个模型,并且支持跨提供商自动故障转移,所以增加或移除一个层级只是添加一条配置项,而不是再做一次集成——并且升级路径不再依赖于任何单一模型是否可用。
迁移决策,直白陈述
把工作转移到输出由机器读取、成功条件可验证的场景。分类、抽取、路由决策、护栏调用、批量转换处理和单步智能体操作都符合条件:综合表现不变,弃权行为显著改善,任务成本下降约 62%。当 Batch 价格为标准费率的一半、缓存输入为减半后基准的十分之一时,7 月还只是勉强可行的流水线,如今可以轻松实现。
不要迁移由人工对交付物签字确认的工作,也不要盲目迁移编码智能体路径。AA-Briefcase 下降 46 分和 GDPval 下降 76 分,这些数字虽小,却与 Coding Agent Index 下降 2 分指向同一方向;而 Artificial Analysis 描述的失效模式——跳过评分标准要素、呈现效果更弱——对自动化检查来说不可见。在打磨本身就是交付物的场景中,保留上一版模型。
把0.07分的指数打平当作它本就该被视作的那项发现来对待。这不是一个更聪明却更便宜的模型,而是一个形态不同、价格更低的模型;而一份迁移计划必须回答的问题是:你的工作负载消耗的是哪一种形态——不是哪个分数更高,因为在独立记录上,这两个分数就是同一个数字。
