一张标题卡比较 GPT-5.6 Luna 和 Claude Haiku 4.5,显示 Luna 的智能指数为 38,拥有 1M token 上下文窗口,定价为每百万 token 输入 $0.20、输出 $1.20;而 Haiku 4.5 的智能指数为 18,拥有 200K token 上下文,定价为输入 $1.00、输出 $5.00。
Guides & Insights

GPT-5.6 Luna vs Claude Haiku 4.5:廉价档位,两份截然不同的账单

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-5.6 LunaClaude Haiku 4.5是两个不同前沿模型家族中的低价档位,而它们之间的差距完全取决于你看的是哪个数字。若看标价,这简直是一边倒:每百万输入 token 0.20 美元对 1.00 美元。而按 Artificial Analysis 统计的每完成一项 Intelligence Index 任务的成本,则是 0.18 美元对 0.21 美元——相差约 14%。同样的两个模型,两个都站得住脚的答案,而它们出现分歧的原因,正是你在做出选择之前最该弄明白的一件事。

简而言之:Luna 在纸面上是更强的模型,吞吐量也更快,但它会进行长篇思考,并为此计费。Haiku 4.5 更旧、范围更小,而且在一次请求会花多少钱这件事上可预测得多。这两者中哪个更重要,取决于你的工作负载,而不是模型本身。

概览

供应商OpenAI vs Anthropic

发布日期 — 2026年7月9日 vs 2025年10月15日

上下文窗口 — 100 万 token 对比 20 万 token

最大输出 — 128K tokens 对比 64K tokens

输入 — 文本、图像和文件 vs 文本、图像和 PDF

每百万 tokens 的价格 — 输入 $0.20 / 输出 $1.20,对比输入 $1.00 / 输出 $5.00

Artificial Analysis Intelligence Index — 38,在 177 个中排名第 4;对比 18,在 200 个中排名第 138(两者均处于推理配置)

每项 Intelligence Index 任务的成本 — 0.18 美元 vs 0.21 美元

输出速度 — 109.4 tokens/秒 对比 84.7 tokens/秒

推理控制 — 从 none 到 max 的努力程度调节 vs 手动启用扩展思考,且没有 effort 参数

可靠知识截止时间 — 2026年2月,对比2025年2月(训练数据截至2025年7月)

退役承诺——未公布 vs 不早于2026年10月15日

GPT-5.6 Luna 真正胜出的地方

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

能力方面,优势悬殊。智能指数 38 对 18,这绝非旗鼓相当。在 Artificial Analysis 基于推理、知识、数学与编程评测构建的综合评分中,Luna 的排名高于 Haiku,而且它的每 token 成本还更低。如果你上一次比较这两个系列,用的还是 9 月之前的指数——当时 Luna 显示为 51 和 52——那么请注意,整个量表已在 2026 年 9 月重新评分,而 Luna 的优势在重新评分后依然得以保持。

上下文容量,五倍之差。1M token 的窗口对阵 200K,本身就决定了一类工作能否胜任:整仓库通读、长篇文档集、以及在 Haiku 上不得不先做摘要的冗长智能体记录。如果你的应用取决于它必须承载多少上下文,那么比较到这里就已见分晓。

输出余量,翻倍。128K 的最大输出 token 数对比 64K,对长文本生成以及那些返回结构化计划而非单行答案的智能体循环而言至关重要。

吞吐量。每秒 109.4 个输出 token 对比 84.7,对流式接口而言是实实在在的差异,不过这与响应性并不是一回事——参见下文的延迟部分。

价格,就写在标价牌上。输入便宜五倍、输出大约便宜四倍,这可不是可以忽略不计的零头;而对于短输出任务来说,这直接就是做决定的全部依据。

Claude Haiku 4.5 仍在哪些方面占有一席之地

成本可预测。Haiku 4.5 的推理是需要手动开启的扩展思考。关闭时,它直接作答,计费可预测。GPT-5.6 Luna 的思考强度调节最高可拉到最大,而每升一档都意味着按输出费率产生更多输出 token。希望预先设定成本上限的团队会发现,Haiku 更容易推算成本,即便其标价更高。

非推理配置的运行成本确实很低。Artificial Analysis 给 Claude 4.5 Haiku 的非推理配置打出的 Intelligence Index 为 15,且未公布每任务成本数据;对于那些标准仅仅是“正确解析”的工作——意图分类、字段提取、路由决策、审核分流——它是相当合适的选择。在这类任务上,15 与 38 之间的指数差距基本无关紧要,因为两者都没有被要求去思考。

缓存与批量折扣已相当成熟。 Haiku 4.5 提供 90% 的提示缓存读取折扣,以及 Batch API 上 50% 的折扣。Luna 的缓存经济性与之相当,因此这更接近平局,而非优势——但如果你的流水线已经在通过 Anthropic 的工具进行批处理,那么从 Haiku 迁移出去的成本是实实在在的,而且它不会出现在任何基准测试中。

实打实的运行记录。Haiku 4.5 自 2025 年 10 月起便已投入生产使用,并公开承诺其退役时间不会早于 2026 年 10 月 15 日。而 Luna 才两个月大。对于模型只是细节、而非产品本身的工作负载而言,十一个月的生产运行历史有着基准测试无法表达的价值。

在衡量真实性的那一个维度上,它是更真实的模型。Artificial Analysis 的正面比拼显示,Luna 在几乎所有能力项上都领先——AA-Briefcase 为 1,339 对 614,GDPval-AA v2 为 1,489 对 854,AutomationBench-AA 为 50% 对 3%,Humanity's Last Exam 为 39% 对 10%,GDPpdf 为 24% 对 4%。例外是 AA-Omniscience,它会对知识问题中自信的错误答案进行惩罚:Luna 在该项得分为 -10,而 Haiku 为 -4。负分意味着幻觉惩罚超过了准确性得分,而 Luna 所受的惩罚更大。更高的综合指数并不等同于更可靠的答案,而在唯一一个专门用来区分这两者的评估上,较旧的模型表现更好。

真实工作负载下的成本计算

假设有一条流水线,每月消耗 1 亿个输入 token,并产生 2000 万个输出 token。

GPT-5.6 Luna — 100 × $0.20 = $20,加上 20 × $1.20 = $24。每月合计 $44。

Claude Haiku 4.5 — 100 × $1.00 = $100,加上 20 × $5.00 = $100。每月共计 $200。

在这些比例下,Luna 大约便宜 4.5 倍,而这是大多数对比所公布的计算方式。现在改变一个假设。如果调高 Luna 的推理强度,其输出 token 就会增加,而输出是昂贵的一侧——按 1.20 美元计算,其成本是输入的六倍。把 Luna 推到在相同工作量下输出 1.5 亿个输出 token 的程度,就像它在 Artificial Analysis 的评估集上那样,那么 44 美元就会轻松超过 180 美元。4.5 倍的优势就会崩塌,趋近于持平。

教训不在于 Luna 很贵,而在于 Luna 的价格优势取决于它“说多少话”,而这是一个你能控制的参数。在抽取和分类任务中调低推理,折扣就是真实的。若所有任务都把推理开到最大,那你买到的就是一个能力更强、但价格已不再像其标价的模型。

延迟,以及一个你不该信任的数字

这两款模型公布的首次令牌时间数据几乎毫无参考价值,值得弄清其中的原因。在 Artificial Analysis 上,两款模型的推理配置都显示首令牌延迟高达数十秒甚至数百秒,因为测试框架要等到模型完成推理后才会输出令牌。这个数字衡量的是评测设置,而非模型自身的响应能力。

路由遥测是更好的来源,因为它衡量的是模型在生产环境中的表现。OrcaRouter 自己的数据表明,GPT-5.6 Luna 的首个 token 中位时间为 1.83 秒,95 百分位为 10.00 秒,而 Claude Haiku 4.5 的中位时间为 3.81 秒,95 百分位为 9.47 秒。正确解读的话,这说明两者比排行榜所显示的更接近:Luna 在典型请求上胜出,而尾部延迟彼此相差约半秒。如果你关心的是最坏情况而非平均值,那么两者之间几乎没有差别。

该选哪一个

选择 GPT-5.6 Luna,前提是你需要承载长上下文、任务能从真正的推理中获益、输出内容较长或结构化,或者你想在价格区间的最低位获得可用的最强模型。如果你技术栈的其余部分已经运行在 OpenAI 系的行为模式上,它也是更自然的选择。

选择 Claude Haiku 4.5,如果您的业务是短输出、高并发量,如果您需要一个能在请求运行之前就明确说出的成本上限,如果您的流水线已经围绕 Anth​hropic 的批处理和缓存构建,或者如果您更看重一个拥有生产历史和已公布生命周期的模型,而不是一个才问世两个月的模型。

两者都不要选——如果一项任务只需一个小型推理模型或微调后的分类器就能完成。这两个层级所承接的流量中,很大一部分是分类与抽取任务,交给更专精的模型来跑成本更低——而最便宜的模型,永远是你本就不需要的那个。

在一个密钥上同时运行两者

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

一旦两者都能通过单一端点访问,这种比较就不再是非此即彼。在 OrcaRouter 上,Claude Haiku 4.5 和 GPT-5.6 Luna 位于同一个兼容 OpenAI 的基础 URL 之后——一个 API 覆盖 200+ 模型,一个密钥、一条计费项,无需第二份合同,除模型标识符外无需改动任何代码。对于你尚未确定的层级选择而言,这能把一次迁移变成改一个配置值。

这里有两个功能真正发挥作用。跨提供商的自动故障转移意味着低成本层级可以承载生产流量,而不必依赖单一供应商——当模型足够便宜,以至于你每小时要发送成千上万次调用,而不是只发一次重要调用时,这就很有用。而路由 DSL 让你可以用多个模型组合出一次调用:把绝大多数直截了当的请求路由到 Luna,把剩下的升级到 GPT-5.6 Terra,并把 Haiku 4.5 留在池中作为后备,以便在你想要第二个提供商的答案而不是重试时使用。

在将 GPT-5.6 Luna 或 Claude Haiku 4.5 中的任何一个投入生产路径之前,请查看其实时的每 token 费率——这两项费率均以 0% 加价原样传递,因此供应商一调整,它们当天就会变动,而第三方价格追踪器则会滞后数天到数周。

真正值得回答的问题

GPT-5.6 Luna 真的比 Claude Haiku 4.5 便宜五倍吗?就输入 token 而言,是的——$0.20 对 $1.00。但就完成同一项已评估任务的成本而言,并非如此:$0.18 对 $0.21。这两种说法之间的差距在于 Luna 的冗长。完成同样的工作,它产生的输出 token 大约是 Haiku 的两倍,而输出 token 的成本是输入 token 的六倍。对于简短回答,这个标价大体上是诚实的。对于推理密集型工作,则不然。

我能在两者上以相同方式调整成本吗?不能,而这正是两者之间最被低估的差异。Luna 提供了一个推理投入强度调节旋钮,设置从 none 一直到 max,因此成本与质量会按每次请求显式地权衡取舍。Haiku 4.5 的扩展思考要么启用(并附带 token 预算),要么不启用——并不存在投入强度参数。如果你在意按请求控制成本,那么这两者中只有一个能给你提供这个杠杆。

那么每天处理几百万次调用的高吞吐量分类器呢?这两个模型都不需要为此进行推理。运行关闭了扩展思考的 Haiku 4.5,或者把 Luna 的 effort 设为 none,然后比较延迟和输出长度,而不是比较综合指数——到那时,真正相关的问题是首个 token 到达得有多快、答案要消耗多少 token,而智能基准测试已无法在两者之间做出区分。

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

一年之后,哪一个还会在?Claude Haiku 4.5 有公开承诺:在 2026 年 10 月 15 日之前不会退役。OpenAI 并未为 GPT-5.6 Luna 公布同等的日期,而且 GPT-5.6 系列之上已经有更新的一代 GPT-6 Astra。这两点都不是回避 Luna 的理由,但如果你的路线图设定了十一个月的规划周期,那就足以成为把模型标识符放在配置里、而非硬编码的理由。

的实时按 token 计费费率GPT-5.6 Luna,在同一密钥上以 0% 加价直通,不存在第二重计费关系。

的实时按 token 费率Claude Haiku 4.5采用同一端点,因此无需再签一份合同即可比较这两个档位。