为“价格相同,账单三倍”生成的主视觉卡片,标注为“同样的标签”,引语为“两个模型,0.10 美元和 0.50 美元,一个问题”,副标题为“Claude Haiku 5.5 对决 GPT-6 Luna:同样的两个数字,却有着截然不同的阈值。”四枚标签分别写着“0.10 美元 / 0.50 美元,两者相同”“100K 对 272K”“0.21 美元 对 0.07 美元”以及“43.40 对 38.12”。下方两张卡片分别标注为“相同”(“第一档下输入 0.10 美元、输出 0.50 美元,且两者均为 100 万 token 窗口”)和“不相同”(“阶梯设在 100,000 token,而对方为 272,000,且单任务成本相差三倍”)。页脚写着“各厂商公布的标准价;独立测量数据来自 Artificial Analysis,读取于 2026 年 10 月 8 日。”OrcaRouter 标志合成于右下角。
Guides & Insights

Claude Haiku 5.5 与 GPT-6 Luna:同样的标价,三倍的账单

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5和GPT-6 Luna在纸面定价上完全相同:每百万输入 token 0.10 美元,每百万输出 token 0.50 美元,一分不差的两个数字,却来自两家几乎在任何事情上都谈不拢的厂商。Anthropic 的发布文章甚至把 Luna 的分数印在自家模型旁边的那一栏——厂商可不会对自己认为不构成威胁的模型这么做。

这两张卡片在所有贴纸所掩盖的方面都截然不同。Luna 将这一费率一直维持到 272,000 个 token 才跳档;Claude Haiku 5.5 则在 100,000 处跳档。Claude Haiku 5.5 在 Artificial Analysis Intelligence Index v4.3.2 上得分 43.40,而 Luna 为 38.12——且每完成一项 Index 任务的成本为 0.21 美元,Luna 则为 0.07 美元。相同的价格,三倍的费用,高出五点的智能。这就是全部的取舍,而且它比这一区间内的大多数正面交锋都更干净利落。

两张卡片,并排显示

每百万个 token,以美元计,来自 Anthropic 和 OpenAI 公布的费率,并反映在我们自己的目录中,独立测量数据由 Artificial Analysis 提供。缓存于 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• 输入 — Claude Haiku 5.5:0.10 美元(100,000 tokens 以内),超出后 0.50 美元。GPT-6 Luna:0.10 美元(272,000 tokens 以内),超出后 0.20 美元。

• 输出 — Claude Haiku 5.5:$0.50 可处理最多 100,000 个 token,超出后 $2.50。GPT-6 Luna:$0.50 可处理最多 272,000 个 token,超出后 $0.75。

• 缓存输入与写入——在第一档阈值内均为 $0.01 和 $0.125,超过 100,000 个 token 后,Claude Haiku 5.5 变为 $0.05 和 $0.625,GPT-6 Luna 则在超过 272,000 个 token 后变为 $0.02 和 $0.25。

• 上下文与输出——两者均为 1M token;两者的最大输出均为 128,000。这两个确实完全同型。

• 思考 — 两者均为自适应,且都带有 effort 参数。Claude Haiku 5.5 的默认 effort 为 medium;并非所有已发布的分数都处于该设置下。

• 独立评分 — Claude Haiku 5.5 (Max) 43.40,在 182 个模型中排名第二。GPT-6 Luna (Max) 38.12,排名第八。

• 每项任务的独立成本 — 0.21 美元对 0.07 美元。

• 速度——每秒输出词元数为241.9,而对比对象为129.4,由同一评估器测得。

差异就在于阈值

两家供应商都制定了双档费率卡。他们选择的档位位置大相径庭,而位置本身远比顶端的数字重要得多。

Ant​hropic 的档位设在 100,000 个 token。低于该档位,你支付 $0.10 和 $0.50;高于该档位,则是五倍和五倍——$0.50 和 $2.50。Ant​hropic 表示,低于该阈值的提示词约占其上一代 Haiku 模型请求量的 90%,这既是该供应商自身的流量构成,也大体上合理描述了短调用型工作负载。

OpenAI 的档位设在 272,000 个 token。低于该档,$0.10 和 $0.50——与 Ant​hropic 完全相同。高于该档,$0.20 和 $0.75,分别是翻倍和上涨 50%。这是一个平缓得多的台阶,而且它的起点几乎达到其三倍远。

取一个 200,000 个 token 的提示词,这对于长文档流水线来说是合理的规模,对于 1M token 的窗口也完全合理。在 Claude Haiku 5.5 上,该请求按第二档计费:输入 $0.50,输出 $2.50。在 GPT-6 Luna 上,它仍处于第一档:输入 $0.10,输出 $0.50。同一请求,在两个标价相同的模型之间,输入费率是五倍,输出费率也是五倍。这不是细微差别——对于长提示工作负载来说,这就是整个比较的全部。

为什么相同的费率会产生三倍的账单

每任务成本才是决定高吞吐量流水线的关键数字,而在这里,两个模型的分歧方式根本无法用费率卡解释。

Artificial Analysis 将 GPT-6 Luna(Max)定为每项 Intelligence Index 任务 0.07 美元,将 Claude Haiku 5.5(Max)定为 0.21 美元——在完全相同的标价费率下,得分相差 5.28 分,成本却相差三倍。原因就在同一页,而且并不隐晦。Claude Haiku 5.5 在运行 Index 时生成了 4.4 亿个输出 token,而中位数为 1 亿,评估方称其非常冗长。GPT-6 Luna 生成了 1.4 亿个,相对于同样的 1 亿中位数,被描述为有些冗长。当输出是占主导的计量项时,三倍的输出 token 就是三倍的账单。

Anthropic 自己的数据也指向同一个方向。该厂商的成本与准确率对比图在 effort 区间内标绘了 Haiku 5.5,而发布时的重点表述是:对于复杂的智能体编程任务,Sonnet 5.5 和 Opus 5.5 仍是更好的选择,Haiku 5.5 则定位于上下文压缩、摘要和子智能体。任务越小,你为此买到的冗长问题就越少——而这恰恰是这款模型所针对的工作负载,也恰恰是那三倍成本差距值得对照你自己的日志、而非某个排行榜去核实的场景。

账本上再添一笔,这一条来自 Anthropic 的文档而非评测者:Claude Haiku 5.5 使用的是与 Claude 4.7 及之后版本相同的新分词器,因此同样的文本计得的 token 数比上一代 Haiku 大约多 30%。费率与 Luna 相同,分词器却不同。

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Ant​hropic 自己的表格关于 Luna 说了什么

Anthropic 的发布页面把 GPT-6 Luna 列为基准测试表格中的一列,而要如实报道这一点,就得附上归属说明:这些是 Anthropic 自己的评估,运行在 Anthropic 自己的测试框架上,针对的却是竞争对手的模型。它们由厂商自行报告,并未经独立复现;厂商拿自己的测试套件去对比竞争对手的分数,这样的比较应当加以权衡,而非照单全收。

• 知识工作 — GDPval-AA v2.1:Claude Haiku 5.5 得分 1620,GPT-6 Luna 得分 1437。AA-Briefcase v1.1:1578 对 1336。

• 计算机使用 — OSWorld 2.1 离线子集达 72.4%,对比 48.9%。

• 智能体编程——Terminal-Bench 4.0 达 39.2%,对比 16.4%;FrontierCode 1.1(Main)达 46.4%,对比 42.4%。

• 视觉推理 — 无工具时,Chartography 为 46.4%,而对比为 29.1%。

在厂商自家的评测框架中,Claude Haiku 5.5 在每一行都领先。在独立榜单上,它领先的幅度更小——43.40 对 38.12——这是厂商表格与第三方榜单之间常见的关系,也是这里同时列出两者的原因。两者在方向上一致,在幅度上不同。

该法案是决定性的一票。

把真正重要的四个事实摆在一起相互对照,对大多数工作负载来说,这个选择就不再难分伯仲了。

GPT-6 Luna 在独立测量中每完成一项任务的成本只有三分之一,其首个价格档位在上下文窗口中能覆盖到远十八倍的位置,在两项指标上的超阈值率都更低,并且它是两者中唯一一个长上下文惩罚为翻倍而非五倍增长的一方。Claude Haiku 5.5 在实测智能上领先,优势真实但幅度有限,输出速度快将近两倍,而且——在厂商自家的测试框架上,这一差距最为明显——在每一行已公布的基准测试中都领先。

如果你的调用很短,如果吞吐量是瓶颈,或者质量差异在你自己的评测中显现出来,那就付三倍的价钱。如果你的调用很长,如果它们是机器生成、从不被人类阅读,或者你运行的是每天触发上百万次的分类层级,那么同样的 $0.10 和 $0.50 会在另一边给你带来一份只有三分之一大小的账单,而你放弃的能力,只是在一个两个模型都接近榜首的排行榜上少五分。

从同一个地方调用其中任意一个

如此接近的对比,其有用之处在于你不必只听信任何人的说法,包括我们的。GPT-6 Luna 现已在 OrcaRouter 目录中按供应商费率提供,0% 加价——与上文所列相同的费率结构,原样透传而非混合计价——Claude Sonnet 5.5 和 Claude Opus 5.5 也是如此,这使得从低价档位升级到中档层级的测试成为一种配置,而非一个项目。一个密钥,一个 SDK,底层自动故障转移,如果升级逻辑属于路由而非你的应用,还可使用路由 DSL。

Claude Haiku 5.5 尚未列入目录。直白说明这一点,比暗示并非如此更有用:这次对比中的 Luna 一方,我们今天上午就能调用;而 Ant​hropic 一方,在情况改变之前,只能通过 Ant​hropic 来触达。

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

什么会改变答案

两件事,二者都值得观察,而不是估计。

第一点是冗长程度是否会变化。Claude Haiku 5.5 的每任务成本,取决于它在最大努力下每次回答消耗多少 token,而 effort 参数就是控制这一点的杠杆。把 effort 调得更低的团队——模型自己的默认值是 medium,而不是 max——会看到每任务成本数字更接近 Luna,得分也更接近 Luna。这种取舍是存在的;它值多少,是一个关于你的评测的问题,而不是关于模型的问题。

第二点是:随着两个模型积累更多实测运行,各自独立得出的每任务成本数字是否依然成立。单次榜单排名只是一个快照,而仅凭一个快照中出现的三倍差距,就值得在围绕它重建流水线之前,先用自己的账单加以核实。这正是共享端点存在的意义。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新