一張生成的 hero card,標題為「Claude Haiku 5.5 對上 GPT-5.6 Luna」,副標為「價格標籤砍半,每次回答更超值」,顯示 Claude Haiku 5.5 的輸入 $0.10、輸出 $0.50,指數 43.40,對比 GPT-5.6 Luna 的輸入 $0.20、輸出 $1.20,指數 37.32,下方長條圖顯示「每完成一項任務的成本 $0.21 對上 $0.18」。
Engineering & Research

Claude Haiku 5.5 對比 GPT-5.6 Luna:Stitch 價格的一半,每項已完成任務多 19%

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

大家都在寫的價格對標是真的,而且並不是與這個模型對標。 Claude Haiku 5.5,廠商於 2026 年 10 月 7 日推出,標價為每百萬輸入 token $0.10、每百萬輸出 token $0.50,適用於最高 100,000 token 的提示。 GPT-5.6 Luna,2026 年 7 月 9 日推出的成本最佳化層級,標價為 $0.20 與 $1.20。因此廠商在兩項計價上都正好是舊款模型費率的一半——且正好等於 GPT-6 Luna,這個於 2026 年 9 月 22 日取代它的後繼者,也是廠商自家發布文章拿來對標的模型。

從這樣的位置來寫比較,確實很奇怪,所以值得把這場對決究竟是為了什麼講清楚。GPT-5.6 Luna 是兩者中唯一在獨立排行榜上已被列為棄用的模型,它不再是 OpenAI 旗艦費率表上的那個 Luna,卻仍然是如今許多整合程式碼裡會看到的 Luna。把它與 Claude Haiku 5.5 相比,問的是一場你可能早就該做的遷移,而不是在兩個現行模型中該呼叫哪一個的問題。

而對於這個顯而易見的問題,答案才是有趣的部分。在同一次獨立評估執行中,完成一項 Intelligence Index 任務的成本是 Claude Haiku 5.5 為 0.21 美元,GPT-5.6 Luna 為 0.18 美元。代幣價格只有一半,每個答案卻多出 19%。

這兩張費率卡

每百萬個 token 以美元計。Anthropic 和 OpenAI 的費率來自其各自的官方文件;共用的分數為 Artificial Analysis Intelligence Index v4.3.2,讀取日期為 2026-10-08。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GPT-5.6 Luna — the scoreboard' with rows Index v4.3.2 43.40 against 37.32, cost per task $0.21 against $0.18, input price $0.10 against $0.20, output price $0.50 against $1.20, Terminal Bench 4.0 0.3283 against 0.1162 and status 'current, API only' against 'superseded by GPT-6 Luna', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; prices per vendor documentation.'

• 輸入 — Claude Haiku 5.5 為 100,000 個 token 以內 $0.10,超過則為 $0.50;GPT-5.6 Luna 為 $0.20,超過 272,000 個 token 的請求則加倍至 $0.40。

• 輸出 — Claude Haiku 5.5:最多 100,000 個 token 為 $0.50,超過則為 $2.50;GPT-5.6 Luna $1.20,在長上下文路徑上升至 $1.80。

• C 輸入 — Claude Haiku 5 為 $0.01 和 $0.05,折扣 90%;GPT-5.6 Luna 為 $0.02,同樣是 90%,另加快取寫入費用 $0.05。

• 上下文 —— Claude Haiku 5.5 為 100 萬個 token,GPT-5.6 Luna 則為 1,050,000 個。兩者單次回應的上限皆為 128,000 個 token,而 OpenAI 為其模型公布的知識截止日期為 2026 年 2 月 16 日。

• 推理控制 — Claude Haiku 5.5 提供從 Low 到 Max 的努力程度調節,預設為 medium;GPT-5.6 Luna 提供六種設定:none / low / medium(預設)/ high / xhigh / max。

• 獨立分數——Claude Haiku 5.5 (Max) 為 43.40,而 GPT-5.6 Luna (Max) 為 37.32,在 182 個模型的排行榜上相差 6.07 分。

• 狀態 — Claude Haiku 5.5 為現行、專有、僅限 API 的模型。GPT-5.6 Luna 在獨立看板上帶有棄用標記,且已不再於 OpenAI 的旗艦定價表中佔有一列。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

價格只要一半,每則回答卻更貴

這裡的費率表計算對 Anthropic 異常有利——在短提示區間內,兩個計量器都乾淨俐落地呈現 2 倍——所以需要解釋的是每項任務的結果。

Claude Haiku 5.5 在每項 Intelligence Index 任務中輸出 162,164 個詞元,其中 129,047 個用於推理、33,118 個用於答案。GPT-5.6 Luna 則輸出 41,235 個,其中 28,098 個用於推理、13,136 個用於答案。Anthropic 的模型3.9 倍的詞元量花在同一件工作上,而以一半的輸出速率計算,這讓它每完成一項任務的成本高出 19%。速率上的優勢與冗長造成的劣勢相差不到兩倍,因此兩者幾乎相互抵銷——而剩下的差額則由 OpenAI 佔了上風。

兩個每項任務成本很接近,但各自的組成方式卻不同。GPT-5.6 Luna 每項任務 $0.1783,大約一半是快取寫入、四分之一是輸出;Claude Haiku 5.5 的 $0.2128 中,$0.1317 是輸入——大多是快取讀取——再加上 $0.0811 的輸出。以絕對值而言,這兩個模型都不貴,而且它們貴的地方不同,這正是為什麼每項任務總成本會趨於接近,而價目表卻相差兩倍。

這正是使得推理模型的逐 token 比較整體上不可靠的同一種效應,而它值得直白地指出:便宜的計價單位乘上龐大的 token 預算,兩者的乘積就是你實際支付的費用。Anthropic 自家的發布說明對此直言不諱,表示 Claude Haiku 5.5「用於提示詞最多達 100,000 個 token 的任務時,尤其物超所值,而這類任務約占我們先前 Haiku 模型請求量的 90%。」

混合計算從另一個方向講述了同樣的故事。在 Artificial Analysis 的 7:2:1 輸入偏重混合比例——也就是大多數生產流量實際呈現的形態——Claude Haiku 5.5 每百萬詞元為 $0.077,而 GPT-5.6 Luna 為 $0.174。這正是你從標價會預期的 2.26 倍。只有當你像推理工作負載那樣加重輸出計量的權重時,兩者才會趨同,而超過 100,000 個詞元後,它們就會交叉。

10 萬 token 的斷崖對上 27.2 萬 token 的那道

兩家供應商都會對長請求重新定價,而兩者的門檻相差超過兩倍半。

Anthropic 的分界點在 100,000 個輸入 token。超過此門檻後,Claude Haiku 5.5 的計價變成輸入 $0.50、輸出 $2.50——是短提示費率的五倍,且套用於整筆請求。OpenAI 的分界點在 272,000 個輸入 token。超過此門檻後,GPT-5.6 Luna 的計價變成輸入 $0.40、輸出 $1.80——輸入為 2 倍、輸出為 1.5 倍,同樣套用於整筆請求。

所以這個交叉點並非緩慢收斂,而是一個跳躍。一個 120,000 token 的檢索提示會落入 Anthropic 的長文本級距,並穩穩落在 OpenAI 的短文本級距之內,這會把 Anthropic 原本 2 倍的優勢翻轉成 OpenAI 在輸入上 1.25 倍、輸出上 1.39 倍的優勢。而且 Anthropic 的門檻低到讓文件密集的管線經常跨越它,OpenAI 的門檻則高到大多數這類管線永遠碰不到。

在 100,000 個 token 以下,這完全不會改變排序。超過 272,000 之後,排序會反轉,並維持反轉狀態。

什麼取代了你正在比較的模型?

這部分是應該決定你究竟要花多少時間在比較上的部分。

OpenAI 於 2026 年 9 月 22 日推出 GPT-6 Luna——比 Anthropic 推出 Claude Haiku 5.5 早十五天——輸入 0.10 美元、輸出 0.50 美元,具備 100 萬 token 上下文、128,000 token 回應上限,以及相同的六段式推理強度控制。在短提示情境下,兩項計費標準都與 Claude Haiku 5.5 的價目表完全相同。

在獨立榜單上,兩者差距接近,綜合排序無法分出勝負:Claude Haiku 5.5 得分 43.40,GPT-6 Luna 則為 38.12——Anthropic 仍領先 5.28 分——但每完成一項任務的成本為 $0.21 對 $0.068。這代表三倍的 OpenAI 優勢,而且是出現在真正計費的數字上;其原因與上述的冗長程度相同:GPT-6 Luna 在每項 Index 任務中輸出 50,012 個輸出 token,Claude Haiku 5.5 則為 162,164 個。

Anthropic 的發布貼文自己就做了比較,在一張表格中讓 Haiku 5.5 對上「GPT-6 Luna」,項目包括 GDPval-AA v2.1(1620 對 1437)、AA-Briefcase v1.1(1578 對 1336)、OSWorld 2.1 離線子集(72.4% 對 48.9%),以及 Terminal-Bench 4.0(39.2% 對 16.4%)。那些是 Anthropic 自家的數字,而且屬於廠商自行提報的數據,但對手的選擇才是關鍵線索:Anthropic 挑來擊敗的模型,正是本文標題中那個模型之後的那一款。

舊版 Luna 仍然勝出的地方

三件事,而其中沒有一件是能力。

影片與音訊。這兩個模型都不是原生支援影片——Claude Haiku 5.5 能讀取文字和圖像,而 GPT-5.6 Luna 也能讀取文字和圖像——所以這一列算是平手,而且兩者都輸給任何具備媒體管線的東西。

快取寫入。OpenAI 針對 GPT-5.6 Luna 公布了每百萬個 token 0.25 美元的快取寫入費率,而 Anthropic 對 Claude Haiku 5.5 則完全沒有公布,這表示誠實的說法是:寫入成本其實內含於 Anthropic 每百萬個 token 0.10 美元的輸入計費之中,而非不存在。對於前綴佔比高、快取存活期短的工作負載,每一輪都會付出這筆差額。

而長上下文這條路徑本身,OpenAI 更高的門檻是一項真正的結構性優勢,這與哪個模型更聰明毫無關係。

A capture of the OrcaRouter model page for GPT-5.6 Luna under openai/gpt-5.6-luna, showing a 128K maximum output, text, image and file input, public benchmarks by OpenAI dated 2026-07-09, a p50 time to first token, and the page's own description of the model as the fast, cost-efficient tier of OpenAI's GPT-5.6 series with a 1.05M-token context window.

兩者皆可呼叫,其中一個不是我們的

GPT-5.6 Luna 今日已登上 OrcaRouter 的型號目錄,代號為 openai/gpt-5.6-luna —— 輸入 $0.20、輸出 $1.20、快取寫入 $0.25,上下文 1,050,000 個 token,回應上限 128,000 個 token,其中 272,000 個 token 的長上下文層級在定價紀錄中是獨立列出的級距,而非被平均掉。以 OpenAI 的定價原價轉供,零加成,且自動容錯移轉在其底層運作,這對一個刻意被取代的模型而言具有特定的意義:一旦 OpenAI 自身的容量緊縮,路由會在您的錯誤預算之前先行轉移。

Claude Haiku 5.5 並未列於目錄中。它可透過 Anthropic 的 API,以及 AWS、Google Cloud 和 Microsoft Azure 取得,這才是準確的說法。目錄中確實收錄的 Anthropic 模型是 Claude Sonnet 5.5 與 Claude Opus 5.5,因此從廉價的分類層級升級到中階代理層級的路徑,是一項路由設定,而非一項整合工程——而 同一份目錄中的 GPT-6 Luna,其費率表與 Claude Haiku 5.5 所用的完全相同,這使得這個價位帶真正誠實的 A/B 測試,只是改動兩個字串,而非一場採購作業。

這個比較該怎麼辦

如果你的整合指定的是 gpt-5.6-luna,那麼有用的結論並不是 Claude Haiku 5.5 以六個指數點勝過它。而是:你所使用的模型,你的供應商已在其自家的 flash 層級中兩度將其取代——先是 Terra 的世代,接著是 GPT-6 Luna,而 Anthropic 本身也將其視為此價格帶的當前競爭者。遷移到 GPT-6 Luna 不僅與價目表相符,且在相同的獨立量測下,每項完成任務的成本降至三分之一。

如果你是在能力方面於 Claude Haiku 5.5 和 Luna 系列之間做選擇,Anthropic 在綜合項目、終端機與程式碼項目,以及電腦操作上都勝出,而且它自家的廠商比較表也這麼說。如果你是以帳單來做選擇,Luna 系列在每一次這類比較中都大幅勝出,原因是一個數字:每項任務 162,164 個輸出 token,對比 41,235 個。

這場對決真正定調的是:便宜兩倍的計費標準,價值不如精簡四倍的模型。Anthropic 把 Claude Haiku 5.5 的定價設成與 GPT-6 Luna 對齊,而它也確實做到了——在兩項計費標準上分毫不差——但要用它得出一個答案,成本仍高出三倍。