
Claude Haiku 5.5 對上 GPT-6 Luna:標價相同,帳單卻貴三倍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Haiku 5.5與GPT-6 Luna在帳面上定價完全相同:每百萬輸入符元 0.10 美元、每百萬輸出符元 0.50 美元,這兩個數字精確到分都分毫不差,而出自兩家幾乎在任何事上都難得所見略同的廠商。Anthropic 的發布文章甚至把 Luna 的分數印在自家分數旁邊的那一欄,而這絕不是廠商面對他們認為不具威脅的模型時會做的事。
這兩張卡在標價貼紙所隱藏的一切上南轅北轍。Luna 把那個費率一路維持到 272,000 個 token 才調升;Claude Haiku 5.5 則在 100,000 個 token 就調升。Claude Haiku 5.5 在 Artificial Analysis Intelligence Index v4.3.2 上拿下 43.40 分,Luna 則是 38.12 分——而它每完成一項 Index 任務要價 $0.21,Luna 只要 $0.07。相同價格,三倍帳單,多出五點智能。這就是全部的取捨,而且比起這個價位帶裡的大多數正面對決,這一局乾淨俐落得多。
兩張卡片,並排
每百萬個 token 的美元價格,資料來自 Anthropic 與 OpenAI 公布的費率,並反映於我們自家的目錄中,獨立測量數據則歸屬於 Artificial Analysis。快取於 2026-10-08。

• 輸入 — Claude Haiku 5.5:100,000 個 token 以內 $0.10,超過則 $0.50。GPT-6 Luna:272,000 個 token 以內 $0.10,超過則 $0.20。
• 輸出 — Claude Haiku 5.5:0.50 美元(最多 100,000 個 token),超過則為 2.50 美元。GPT-6 Luna:0.50 美元(最多 272,000 個 token),超過則為 0.75 美元。
• 快取輸入與寫入——在第一個門檻以下皆為 $0.01 與 $0.125,Claude Haiku 5.5 在超過 100,000 個 token 後調升為 $0.05 與 $0.625,而 GPT-6 Luna 則在超過 272,000 後調升為 $0.02 與 $0.25。
• 上下文與輸出 — 兩者皆為 1M tokens;兩者的最大輸出皆為 128,000。這兩者確實是相同的形態。
• 思考 — 兩者皆為自適應,且都帶有 effort 參數。Claude Haiku 5.5 的預設 effort 為 medium;並非所有已公布的分數都是在該設定下取得的。
• 獨立評分 — Claude Haiku 5.5(Max)43.40,在 182 個模型中排名第二。GPT-6 Luna(Max)38.12,在 182 個模型中排名第八。
• 每項任務的獨立成本 — $0.21 對比 $0.07。
• 速度 — 由同一個評估器測得,每秒輸出 241.9 個 token,相較於 129.4。
閾值就是差異所在。
兩家廠商都建立了雙層費率表。他們設定的位置截然不同,而這個位置的安排,遠比最上層的數字重要得多。
Anthropic 的級距設在 100,000 個 token。低於此,你支付 $0.10 和 $0.50;超過此,則是五倍和五倍——$0.50 和 $2.50。Anthropic 表示,低於該門檻的提示約占其先前 Haiku 模型請求的 90%,這既是該廠商自身的流量組成,也大致合理描述了短呼叫工作負載的普遍情況。
OpenAI 的級距落在 272,000 個 token。低於此,價格是 $0.10 和 $0.50——與 Anthropic 相同。高於此,則是 $0.20 和 $0.75,一個是翻倍,另一個增加 50%。這是平緩得多的級距,而且起點幾乎遠了三倍。
以一個 200,000 token 的提示詞為例,這對長文件處理流程而言是合理的規模,對 1M token 的上下文視窗來說也完全合理。在 Claude Haiku 5.5 上,該請求會以第二級計費:輸入 $0.50,輸出 $2.50。在 GPT-6 Luna 上,則仍屬第一級:輸入 $0.10,輸出 $0.50。同一個請求,在兩款公告價格相同的模型之間,輸入費率是五倍,輸出費率也是五倍。這不是細微差異——對長提示詞工作負載而言,這就是全部的比較。
為什麼相同的費率會產生三倍的帳單
每項任務成本才是應該決定高吞吐量管線的數字,而在這一點上,這兩個模型分道揚鑣的方式,是費率表無法解釋的。
Artificial Analysis 的數據顯示,GPT-6 Luna(Max)每完成一項 Intelligence Index 任務的費用為 0.07 美元,而 Claude Haiku 5.5(Max)為 0.21 美元——在完全相同的標價費率下相差三倍,而分數差距僅 5.28 分。原因就在同一頁上,而且並不隱晦。Claude Haiku 5.5 在跑 Index 時產生了 4.4 億個輸出 token,對比中位數的 1 億,評估者稱其極為冗長。GPT-6 Luna 則產生了 1.4 億個,同樣對比 1 億的中位數,被形容為略嫌冗長。當輸出量是主導計價的計量單位時,三倍的輸出 token 就是三倍的帳單。
Anthropic 自家的數字也指向同一個方向。該廠商的成本與準確度對比圖將 Haiku 5.5 標繪於整個投入程度範圍;而發表時的重點引述是:Sonnet 5.5 與 Opus 5.5 仍是複雜代理式編碼工作的較佳選擇,Haiku 5.5 則改為定位在壓縮、摘要與子代理。工作越小,你買到的這種冗長問題就越少——而這正是該模型被打造來處理的工作負載,也正是在這種工作負載下,三倍的成本差距值得拿你自己的日誌來核對,而不是拿排行榜的來核對。
帳簿上再多一筆,這次是來自 Anthropic 的文件,而非評測者的:Claude Haiku 5.5 使用與 Claude 4.7 及後續版本共用的較新 tokenizer,因此同一段文字會比前一版 Haiku 多出約 30% 的 token 數。費率與 Luna 相同;分詞器則不同。

Anthropic 自家的表格對 Luna 有什麼說法
Anthropic 的發布頁面將 GPT-6 Luna 列為其基準測試表格中的一欄,而誠實報導此事的方式,就是附上出處說明:這些是 Anthropic 的評估結果,是在 Anthropic 自家的測試框架上,針對競爭對手的模型所跑出來的。這些數據由廠商自行提報,未經獨立重現,而一家廠商以自己的測試套件去對照競爭對手的成績,這樣的比較值得權衡,而非照單全收。
• 知識工作——GDPval-AA v2.1 中,Claude Haiku 5.5 拿下 1620 分,對比 GPT-6 Luna 的 1437 分。AA-Briefcase v1.1 則為 1578 分對上 1336 分。
• 電腦操作 — OSWorld 2.1 離線子集達 72.4%,相較於 48.9%。
• 代理式編碼 — Terminal-Bench 4.0 為 39.2%,相較之下為 16.4%;FrontierCode 1.1(Main)為 46.4%,相較之下為 42.4%。
• 視覺推理 — Chartography 在未使用工具的情況下達到 46.4%,相較於 29.1%。
在廠商自家的測試框架上,Claude Haiku 5.5 在每一列都領先。在獨立榜單上,它的領先幅度較小——43.40 對 38.12——這正是廠商表格與第三方表格之間常見的關係,也是這裡同時列出兩者的原因。兩者在方向上一致,在幅度上則不一致。
該法案是決定性的一票
把真正重要的四項事實並列對照,就會發現對大多數工作負載而言,這個選擇根本不再難以取捨。
GPT-6 Luna 在獨立量測下,每完成一項任務的成本只有三分之一,其首個價格級距可觸及的上下文視窗遠達十八倍,在兩項指標上的超閾值率都較低,而且它是兩者中唯一長上下文懲罰是翻倍而非五倍躍升的。Claude Haiku 5.5 在實測智慧上以真實但溫和的幅度領先,輸出速度快近兩倍,而且——在該廠商自家的測試框架上,差距最大之處——在每一列已公布的基準測試結果上都領先。
如果你的呼叫很短、如果瓶頸在於輸送量,或者品質差異會在你自己的評估中顯現,那就付三倍的錢。如果你的呼叫很長、如果它們是機器產生且永遠不會被人類閱讀,或者你正在執行每天觸發一百萬次的分類層級,那麼同樣的 $0.10 和 $0.50 會讓你在另一邊拿到只有三分之一大小的帳單,而你放棄的能力,就等於在兩個模型都接近榜首的排行榜上少五分。
從一個地方呼叫兩者中的任一個
如此接近的比較有個好處:你不必聽信任何人的說法,包括我們的。GPT-6 Luna 今天已在 OrcaRouter 目錄上,以供應商的價格提供,0% 加價——與上方所列相同的價格結構,原樣傳遞而非混合計價——Claude Sonnet 5.5 和 Claude Opus 5.5 也是如此,這讓從低成本層級升級到中階層級的測試成為一項設定,而非一個專案。一組金鑰、一套 SDK,底層具備自動容錯移轉,而若升級邏輯應落在路由而非你的應用程式中,還可使用路由 DSL。
Claude Haiku 5.5 尚未列入目錄。坦白這樣說,比暗示並非如此更有用:這項比較中的 Luna 端,我們今天早上就能呼叫;而 Anthropic 端則必須在 Anthropic 才能觸及,直到不再如此為止。

什麼會改變答案?
有兩件事,而且這兩件事都值得觀察,而非估算。
首先,問題在於冗長程度是否會改變。Claude Haiku 5.5 的每項任務成本,取決於它在最大投入程度下每次回答花費多少 token,而投入程度參數正是控制這點的槓桿。若團隊把投入程度調低——模型本身的預設是中等,而非最大——就會看到每項任務成本更接近 Luna,分數也更接近 Luna。這項取捨是可行的;它值不值得,是關於你的評估的問題,而不是關於模型的問題。
第二點是,隨著兩個模型累積更多實測執行,獨立的每任務成本數字是否仍然成立。單一次的排行榜名次只是一張快照,而某張快照中出現的三倍差距,值得先對照你自己的帳單確認,再圍繞它重建管線。這正是共享端點的用途。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
