
GPT-6 Luna 对比 Claude Opus 5:五十倍的价格,同一个下午
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-6 Luna每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.50 美元。Claude Opus 5则收费 5.00 美元和 25.00 美元。在价目表的两端,这都是五十倍的差距,而这也是任何人看到这对组合时最先注意到的一点——一款是厂商于 2026 年 9 月 22 日发布的模型,与之比价的另一款则由该公司于 2026 年 7 月 24 日推出,上市已有两个月。五十倍这个数字是真的,但它也几乎是这场对比中最没用的事实,因为这两者争抢的并不是同一类调用,还因为在 Luna 发布的当天下午,第二款模型所属的那一方发生了一件事。
GPT-6 Luna 是 OpenAI GPT-6 世代中的小杯型号,定位低于售价为 $2.00/$10.00 的 GPT-6 Sol,更远低于售价为 $10.00/$50.00 的旗舰 GPT-6 Astra。Claude Opus 5 一直是 Anthropic 的旗舰,直到 9 月 22 日 Anthropic 推出了售价 $4.00/$20.00 的 Claude Opus 5.5,将 Opus 5 降了一档。截至今天,本文标题中提到的这两款模型,都各自退居自家厂商产品阶梯的次席——而原因彼此毫无关联。这一点比价格比重要得多,也正是本文的起点。
下午两家供应商都发货了
OpenAI 于 9 月 22 日发布了 GPT-6 Sol 和 GPT-6 Luna。数小时前,Anthropic 发布了 Claude Opus 5.5。这句话中提到的三款模型里,有两款相较前代降价约一半——这与其说是巧合,不如说是一种市场规律:过去十八个月里,中国实验室接连发布开放权重模型,早已把"一个称职的 token"的成本狠狠压低,而两家厂商都在回应同一股压力。
对于任何持有 Claude Opus 5 部署的人来说,实际后果是:他们当初针对其构建的模型,已不再是 Anthropic 最卖力推销的模型。Claude Opus 5.5 的价格为 $4.00/$20.00——标价下调 20%——缓存输入为每百万 $0.20,低于 Opus 5 的 $0.50;Artificial Analysis 在最大努力设置下于其 Intelligence Index 上测得 58 分,这是其有记录以来的最高数值。Claude Opus 5 在同一指数上测得 51 分。如果你今天正在运行 Opus 5,那么本文标题中的那个“五十倍”对比并不是你眼前要面对的问题。你眼前的问题是是否要迁移到 Opus 5.5,而这一问题的答案,是与 GPT-6 Luna 正在做的任何事情都无关的另一套算术。
话虽如此,五十倍这个数字仍然左右着一个真实的决策,因为 GPT-6 Luna 所面向的工作负载,恰恰就是 Claude Opus 5 的账单会让人吃不消的那些工作负载。这两个事实可以同时成立。
这两者各自究竟是什么
规格,每个维度一行,每行都列出两侧:
• 每 100 万 tokens 价格 — GPT-6 Luna 输入 $0.10 / 输出 $0.50,对比 Claude Opus 5 输入 $5.00 / 输出 $25.00
• 缓存输入 — GPT-6 Luna 每 1M $0.01,相较 Opus 5 定价卡上 Claude Opus 5 的每 1M $0.50 便宜 90%,在 Opus 5.5 上则降至 $0.20
• 上下文窗口 — GPT-6 Luna 总计 1,050,000,最大输入 922,000,对比 Claude Opus 5 的 1M,两者输出 token 上限均为 128,000
• 长上下文调价 —— 当输入超过 272K token 时,GPT-6 Luna 的输入与缓存价格翻倍、输出价格上调至 1.5 倍,且按整个请求计费;相比之下,Claude Opus 5 在整个上下文窗口内保持统一价格
• AA Intelligence Index — GPT-6 Luna 37 在最大努力下 vs Claude Opus 5 51
• AA Intelligence Index,按推理努力匹配——GPT-6 Luna 29 在其默认的中等努力下,对比 Claude Opus 5 51 在 max 下,而这是 Anthropic 测量它时唯一采用的设置
• 输出速度 — GPT-6 Luna 153.9 tokens/秒 对比 Claude Opus 5 53.6 tokens/秒
• 运行索引的成本 —— GPT-6 Luna $122.39 对比 Claude Opus 5 $7,274.74
• 推理关闭开关 — GPT-6 Luna 提供无、低、中、高、极高和最高档,而 Claude Opus 5 的思考是自适应且始终开启的
• 发布日期 — GPT-6 Luna 2026-09-22 vs Claude Opus 5 2026-07-24

其中三行比其他行承担了更多信息量,而第一行就是努力程度那一行。GPT-6 Luna 的 37 分是它在最高努力程度下的得分。它的默认设置是中等,而在中等努力程度下,它的得分是 29。Claude Opus 5 的 51 分是最高努力程度下的数字,因为 Anthropic 并未公开 Artificial Analysis 所测量的更低设置。所以,标题上那 14 分的差距,其实是一个模型的上限与另一个模型的上限之间的比较——而一个安装了 GPT-6 Luna 却什么都不改的团队,跑出来的是 29,而不是 37。那是 22 分的差距,而不是 14 分,除非你特意去查努力程度的默认值,否则根本看不出来。
第二项是指数成本线。它不是报价——而是 Artificial Analysis 自掏腰包、在完整评估套件上运行每个模型所实际花掉的钱。$122.39 对 $7,274.74,是弄清模型有多好所需成本上的五十九倍差距,也是这两个模型在规模化运行时表现如何的最干净的可用代理指标。在那次运行中,Claude Opus 5 生成了 1.4 亿个 token;GPT-6 Luna 生成了 1.5 亿个。便宜的模型更啰嗦,但成本仍然只有其五十九分之一。
第三个是关闭开关。GPT-6 Luna 可以被要求完全不进行推理。Claude Opus 5 则不能。仅仅这一行规格,就决定了为什么这两个模型中的一个可以置于分类器、路由器或审核界面之后,而另一个不能;它也解释了价格差异中的很大一部分,而完全无需诉诸能力高低。
廉价档位不再廉价之处
GPT-6 Luna 的价目表上有一道断崖,而它是最不容忽视、代价最高的一项。超过 272,000 个输入 token 的请求,输入和缓存费率按两倍计费,输出费率按 1.5 倍计费——而且是按整个请求计费,而不是只按越线的部分。一次 300,000 个 token 的 GPT-6 Luna 调用,全部 300,000 个 token 都按每百万输入 token 0.20 美元计费,因为它超出了 28,000 个。把同一份文档拆成两次调用,成本就会减半,而提示词无需任何改动。
Claude Opus 5 没有对应的条款。其 $5.00/$25.00 的价格在整个 100 万 token 区间内保持不变,也就是说,五十倍的倍率在任何地方都是五十倍——只有在输入 token 超过 272K 之后例外:此时 GPT-6 Luna 的实际输入单价翻倍至 $0.20,输出单价升至 $0.75,差距缩小到二十五倍。依然极为悬殊。也依然值得了解,因为最有可能需要 30 万 token 工作上下文的,恰恰是两家厂商都在争相推销的智能体类工作负载。
第二件需要定价的是投入程度。用最高投入运行 GPT-6 Luna 去做一件中等投入本已足够的任务,是花掉你刚刚省下的钱的最常见方式。37 对 29 的差距,就是设置错误的代价规模;而且与价格条款不同,它不会出现在任何账单上——它表现为 token 用量,而后者看起来像是成功。
真正起决定作用的那道分水岭
诚实地讲,这一比较的结论是:这两个模型并非彼此的替代品,而价格比只是障眼法,它让人忽略了一个关于工作负载的问题——而这个问题无论从哪方面看都有明确答案。
GPT-6 Luna 适用于任何输出由程序而非人消费、且规模才是关键的场景。分类、抽取、路由决策、批量摘要,以及每个任务要发起上千次小调用的智能体的内部循环。在输入 $0.10/输出 $0.50、缓存输入单价仅 1 美分,且 Batch 与 Flex 按标准价一半计费的情况下,与 Opus 系列中的任何模型相比,这笔经济账都毫无悬念。Artificial Analysis 指出了一处在你迁移之前值得了解的真实退步:GPT-6 Luna 的 Coding Agent Index 下降两点至 41,而 GPT-5.6 Luna 为 43,下滑主要集中在 SWE-Atlas-QnA 和 DeepSWE v1.1 上。它还指出了同一量级的一处真实提升——该模型在 AA-Omniscience 上的幻觉率从约 93% 降至 77%,而准确率几乎没有变化。它更多是变得更频繁地拒绝作答,而不是知道得更多;对于任何有下游消费方的用途而言,这才是这桩交易中更有价值的那一半。
Claude Opus 5 适用于产出即产品的场景。Anthropic 自己公布的结果——由厂商报告,未经独立复现——显示它在 SWE-bench Verified 上达到 96.0%,在 SWE-bench Pro 上达到 79.2%,而 14 个百分点的指数差距,正是决定一个长周期智能体是完成任务,还是悄然半途而止的那种差距。如果你正处于模型能力所能达到的边缘,那么一个便宜五十倍、在默认投入下落后二十二个百分点的模型,并不是同一事物的更便宜版本。
同时运行两者而不做选择
这个比较之所以无法归结为单一建议,是因为这两类工作负载之间的边界并不稳定。每当任何一家供应商发布新东西,它就会移动;在本篇文章之前的三个星期里,它就移动了两次——一次是 Anthropic 将 Opus 的价格降至 $4.00/$20.00,另一次是 OpenAI 将其整个小模型层级的价格减半。一个在七月份就把赢家硬编码下来的团队,如今运行的就是错误的配置。
Claude Opus 5 已上线 OrcaRouter,价格与 Anthropic 的标价一致,在直通式定价下,这意味着供应商一旦调价,我们这边当天就会同步生效,而不必等经销商重新议价——这正是 Opus 5.5 的降价能直接进入我们的目录、而无需任何集成项目的原因。截至本文撰写时,GPT-6 Luna 尚未上线 OrcaRouter;你需要通过 OpenAI 自家的 API 才能使用它。所以,对于想同时用上两者的团队来说,最诚实的配置方案就是:一把 Claude Opus 5 的密钥,加上你原本用于 OpenAI 的那套配置,并由自动故障转移在某家供应商服务降级时填补空缺。只需改配置、而不用改代码路径,就能在 1 美分的分类器与 25 美元的推理模型之间切换路由,这比在九月份就选对更有价值。

本周做什么
如果你正在运行 Claude Opus 5,那么标题里那五十倍的差距就是一个真实数字,指向的是一个错误的决定。你的决定是 Opus 5.5——20% 的清单削减、更高的索引分数,以及下降了 60% 的缓存输入费率——而 GPT-6 Luna 则是另一个问题,只是恰好出现在同一页面上。
如果你正在 Opus 级模型上运行高吞吐量的分类或抽取流水线,那么 GPT-6 Luna 是你这个月能采取的最大单项成本优化举措,而迁移工作量比降价幅度所暗示的要小:同样的 1M 上下文级别、同样的 128,000 输出上限,以及两边都低五十倍的每 token 费率。在默认采用之前,先用 medium effort 测试一下;把你的长上下文调用放在 272,000 token 的正确一侧;并对照你自己的评测来检查编码回退,而不是对照厂商的图表。
而如果你两个都在跑,要修的不是你选了哪一个。而是改变主意目前要付出一次代码部署的代价。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
