
Claude Haiku 5.5 对比 GPT-6 Luna Pro:一个模型对抗一种模式
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这场对比的一方是一个模型,另一方是一个设置。Claude Haiku 5.5于 2026 年 10 月 7 日全面可用,在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude on AWS 上,每百万输入 $0.10、每百万输出 $0.50。GPT-6 Luna Pro根本不是模型:要使用它,方法是调用 GPT-6 Luna,于 2026 年 9 月 22 日上线,价格同样是 $0.10 和 $0——并将 reasoning设置为high,而不是 standard。并不存在 gpt-6-luna-pro 这个标识符,在 OpenAI 那个做更多工作、并会就它未向你展示的 token 向你收费的模型上。这场对比的诚实表述不是“哪个模型获胜”,而是“哪种是花每百万输入 token 十美分的更好方式”:一个努力程度旋钮,还是一个以高努力运行的更大模型,而后者是单独的产品。对于简单任务,前者通常是赢家。对于困难任务,后者可能胜出——而且后者往往比前者更便宜。
从机制上说,“pro”是什么
OpenAI 的推理指南指出,GPT-5.6 和 GPT-6 模型在 Responses API 中支持两种模式,standard(默认)和 pro,可通过 reasoning.mode选择。模式是不同于 reasoning.effort 的控制项:模式决定模型在给出答案前需要做多少工作,推理强度则决定在你所选的模式内进行多少推理。GPT-6 Luna 文档中记录的推理强度取值为 none、low、medium(默认)、high、xhigh 和 max,且其中任意一个都可以与 pro 模式组合使用。
在计费方面,指南写得十分明确,而且略显反直觉。Pro 模式会把最终答案背后的所有模型工作汇总起来,并按“所选模型的标准 token 费率”对这些 token 计费。费率表上并不存在 pro 溢价。这项成本体现为用量,因为 Pro 模式“比标准模式执行更多的模型工作,从而增加 token 用量和成本”——而推理 token 按输出 token 计费,却只出现在 usage 对象中的 output_tokens_details.reasoning_tokens 字段里。如果你不查看该字段,这种增长在账单到来之前都是不可见的。
由此可以引出两个比较,值得区分开来。与标准模式下的 GPT-6 Luna相比,pro 模式是同一个模型,但在 token 消耗上有一个未知的倍数。与Claude Haiku 5.5相比,它也是一个处于不同规模的不同模型——上下文为 1,050,000 tokens(对比 1M),输入上限为 922,000 token,知识截止日期为 2026 年 5 月 18 日,并且处于一个 Anthropic 自己的发布文档在困难 agentic 工作上将其定位为略高于 Haiku 的层级。这两项差异在成本上方向一致,在能力上方向相反,这正是为什么两者都不能直接从价目表上读出来。
并排的价目表
两种模型都采用两档计费,而分档的阈值却各不相同——这一点比标价费率更重要,因为两者的标价完全相同。
• 输入——Claude Haiku 5.5:每百万 0.10 美元,100,000 个 token 以内;超出后 0.50 美元。GPT-6 Luna:0.10 美元,272,000 个 token 以内;超出后 0.20 美元。
• 输出 — Claude Haiku 5.5:100,000 个 token 以内 $0.50,超出后 $2.50。GPT-6 Luna:272,000 个 token 以内 $0.50,超出后 $0.75。
• 缓存 — Claude Haiku 5.5 的缓存读取为 $0.01、写入为 $0.125(低于该界限时),高于该界限时为 $0.05 和 $0.625。GPT-6 Luna 的缓存读取为 $0.01、写入为 $0.125(低于 272,000 个 token 时),超过后为 $0.02 和 $0.25。
• 上下文与输出 — Claude Haiku 5.5 为 100 万 tokens,最大输出 128,000 个 token;GPT-6 Luna 为 1,050,000 个 token,输入上限 922,000 个 token,最大输出 128,000 个 token。
• 思考—— 两者均自适应。Claude Haiku 5.5 默认采用中等努力程度;GPT-6 Luna 默认采用中等努力程度和标准模式,并可在此基础上按需选用专业模式。
• 批量与缓存折扣 — Claude Haiku 5.5 在 Message Batches API 上享受 50% 折扣;GPT-6 Luna 在 Batch 和 Flex 上享受 50% 折扣,在 Fast 模式下价格翻倍,区域处理还需额外支付 10% 的溢价。
唯一不太一样的是分词器。Anthropic 的文档指出,Claude Haiku 5.5 使用的是与 Claude 4.7 及之后版本共享的更新版分词器,因此同一段文本在 Claude Haiku 5.5 上会被计为大约比 Claude Haiku 4.5 多 30% 的 token。这并不会改变费率;它改变的是提示词达到 100,000 token 这一档位的速度,而且这是一项任何费率表都没有体现的真实成本差异。一段 90,000 token 的提示词实际会测算为大约 117,000 token,并按每百万输入 token 0.50 美元而非 0.10 美元计费——对于一段看起来完全在这条线以下的提示词来说,费率变成了五倍。
Pro 模式的代价,用任何人都能用的唯一单位来衡量
由于 {{1}}butler{{/1}} 尚未发布,值得说明的是每增加一个 token 的成本,以及这些可能的区间在大规模使用时会有怎样的表现。
• 按 GPT-6 Luna 每百万输出 token 收费 $0.50 计算,每个任务每额外产生 10,000 个输出 token 就要花费 $0.00。每天运行 100,000 个任务,那么这个增量就是额外的一笔——大约一天,或每月 $15,000,而这还是一个标价每百万一毛钱的模型。
• 作为参照,GPT-6 Luna 在最大强度下运行 Intelligence Index 时已消耗 1.4 亿输出 token,而中位数为 1 亿,评估者称其略显冗长。Anthropic 在其自家测试框架上运行的发布表格显示,GPT-6 Luna 在 Terminal-Bench 4.0 上为 16.4%,在 FrontierCode 1.1 上为 42.4%,而 Claude Haiku 5.5 分别为 39.2% 和 46.4%——厂商自报数据,一家厂商的测试套件,针对的是竞争对手的模型。
• 在独立榜单上,排名差距更小。Artificial Analysis 在 Intelligence Index v4.3.2 上给 Claude Haiku 5.5 在 Max effort 下打出 43 分,位列 182 个中的第二;给 GPT-6 Luna (Max) 打出 38 分,位列 182 个中的第八。这两个数字都是标准模式、最大努力下的结果。目前没有对 GPT-6 Luna 在专业模式下的独立评估:其页面没有专业模式条目,Artificial Analysis 也没有列出。
专业模式的结构性问题在于最后两点之间的相互作用。GPT-6 Luna 相对于 Claude Haiku 5.5 的全部成本优势都来自 token 效率——同一套测试中,输出 token 数为 1.4 亿,而对方为 4.4 亿,且费率相同,这就是为什么同一项评估在一侧每任务花费 $0.07,在另一侧为 $0.21。专业模式按定义就是一种会输出更多 token 的模式。开启它,就等于关掉了在这个比较中让该模型变得便宜的东西,而能告诉你它会高出多少的乘数并未公布。这并不是说专业模式不划算——在困难任务上,通常做得更多就是做得更好——而是说专业模式竞争的是能力,而不是价格,并且应当与它定价相近的中端模型进行比较,而不是与它所属的廉价层级进行比较。

各自真正胜出的地方
剥到决定本身,分歧便一目了然,尽管双方都并非没有前提条件。
Claude Haiku 5.5 占据着低价端。它在两个关键意义上都更快:Artificial Analysis 测得其输出速度为每秒 241.9 个 token,而 GPT-6 Luna 为 123.0;在 Index 测试中首 token 时间为 295 秒——这源于它在 Max 努力级别下作答前的思考耗时,而非网络指标。其价目表在 100,000 个 token 处进入第二档,而它的分词器会把提示词膨胀约 30%,因此长提示词工作负载在这两方面都比标价所示的付出更多。作为回报,它带来独立指数上 5 点的智能优势,以及一个从 Low 到 Max 的努力程度调节旋钮——这是两家厂商在这些发布中随附的最有用的成本控制手段。把努力程度调低,就是用那 5 点领先优势的一部分,换取更接近 GPT-6 Luna 的每任务成本。
GPT-6 Luna Pro 占据难度最高的一端,代价却无法量化。其底层模型在输入 token 超过 272,000 后,每 token 成本低于 Claude Haiku 5.5 在超过 100,000 后的成本:输入是后者的 2.5 分之一,输出是后者的 3 又 1/3 分之一;并且其第一档在上下文窗口中能延伸到的位置要远出十八倍。标准模式在每完成一项任务上的成本可测量地更低。Pro 模式以相同费率用这一点换取每个答案更多的计算量,而它在 Max effort 下能否胜过 Claude Haiku 5.5,或在特定任务上能否胜过中档模型,是没有任何已公布数字能回答的问题。要回答它,方法是用两种方式各跑一遍该任务,并读取 reasoning-token 字段。

尝试其中任意一个,但不押注它
这种比较的尴尬之处在于,其最重要的数字——Pro 模式的真实成本——只能通过让你自己的流量跑经它才能得出;而较小模型的有效成本,则取决于重新分词之后,你的提示词相对于 10 万 token 的分界线落在哪里。二者都是测量问题,而在共享端点上进行测量,要比跨两个供应商客户端更便宜。
GPT-6 Luna 今天已上架 OrcaRouter 的目录,按供应商标价提供,0% 加价全额让渡,因此本次对比所用的标准模式基线只需一个密钥即可调用,而且供应商那边一旦调价,当天就会传导到我们这边,而不必等到下一个计费周期。Claude Haiku 5.5 尚未进入该目录;我们今天实际路由的 Anthropic 层级是 Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5,这使得从低成本层级经由中间层级向上做升级测试变成了一条路由规则,而不是一次代码改动。底层的自动故障转移正是这一机制,让一个上线仅两天的模型能在你仍在对其做评估时承载生产流量:开始出故障的供应商会被绕开,而不是把请求拖垮——这正是本周就能开跑的试点,与必须排期才能完成的正式切换之间的区别。
是什么让它尘埃落定?
三件事,按其能多大程度改变答案排序。OpenAI 公布专业模式的 token 倍数,或者为专业档给出单独的价格行,就能把核心未知量变成一道算术题。Artificial Analysis 在同等投入水平下以专业模式重跑 GPT-6 Luna,则能从独立一方做到这一点。而对 Claude Haiku 5.5 以medium而非 Max 再跑一次独立测试,就能告诉你该模型在默认设置下的真实成本——而默认设置正是大多数人实际会部署的配置;榜单上的每任务 0.21 美元是 Max 投入档的数字,而 Max 并不是默认档。
在此之前,准确的总结范围很窄。Claude Haiku 5.5 是一个你现在就可以调用、定价和基准测试的模型,而在其层级所面向的用量规模下,它是更便宜的选择,并且有文档化的方法可以进一步降低成本。GPT-6 Luna Pro 是一个你可以调用的模型的配置,其费率卡不是问题,其 token 消耗未经审计,而对它的全部论证都建立在足够困难、以至于多花 token 本身就是目的的任务上。为那些任务购买它,在购买之前先测量它,并且在有人公布倍率之前,不要把它放到高用量路径上。

