為「相同費率,帳單卻三倍」生成的主視覺卡片,掛上「SAME STICKER」徽章,引題為「兩個模型,$0.10 與 $0.50,一個問題」,副標為「Claude Haiku 5.5 對上 GPT-6 Luna:同樣的兩個數字,卻是非常不同的門檻。」四張資訊標籤寫著「$0.10 / $0.50 兩者相同」、「100K 對 272K」、「$0.21 對 $0.07」以及「43.40 對 38.12」。下方兩張卡片標示為「相同」(「第一級距下輸入 $0.10、輸出 $0.50,且兩者皆為 1M token 視窗」)與「不相同」(「級距分界落在 100,000 個 token 對上 272,000,且每項任務成本相差三倍」)。頁尾寫著「供應商公布的牌價;獨立量測來自 Artificial Analysis,擷取於 2026 年 10 月 8 日。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對上 GPT-6 Luna:標價相同,帳單卻貴三倍

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5與GPT-6 Luna在帳面上定價完全相同:每百萬輸入符元 0.10 美元、每百萬輸出符元 0.50 美元,這兩個數字精確到分都分毫不差,而出自兩家幾乎在任何事上都難得所見略同的廠商。Anthropic 的發布文章甚至把 Luna 的分數印在自家分數旁邊的那一欄,而這絕不是廠商面對他們認為不具威脅的模型時會做的事。

這兩張卡在標價貼紙所隱藏的一切上南轅北轍。Luna 把那個費率一路維持到 272,000 個 token 才調升;Claude Haiku 5.5 則在 100,000 個 token 就調升。Claude Haiku 5.5 在 Artificial Analysis Intelligence Index v4.3.2 上拿下 43.40 分,Luna 則是 38.12 分——而它每完成一項 Index 任務要價 $0.21,Luna 只要 $0.07。相同價格,三倍帳單,多出五點智能。這就是全部的取捨,而且比起這個價位帶裡的大多數正面對決,這一局乾淨俐落得多。

兩張卡片,並排

每百萬個 token 的美元價格,資料來自 Anthropic 與 OpenAI 公布的費率,並反映於我們自家的目錄中,獨立測量數據則歸屬於 Artificial Analysis。快取於 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• 輸入 — Claude Haiku 5.5:100,000 個 token 以內 $0.10,超過則 $0.50。GPT-6 Luna:272,000 個 token 以內 $0.10,超過則 $0.20。

• 輸出 — Claude Haiku 5.5:0.50 美元(最多 100,000 個 token),超過則為 2.50 美元。GPT-6 Luna:0.50 美元(最多 272,000 個 token),超過則為 0.75 美元。

• 快取輸入與寫入——在第一個門檻以下皆為 $0.01 與 $0.125,Claude Haiku 5.5 在超過 100,000 個 token 後調升為 $0.05 與 $0.625,而 GPT-6 Luna 則在超過 272,000 後調升為 $0.02 與 $0.25。

• 上下文與輸出 — 兩者皆為 1M tokens;兩者的最大輸出皆為 128,000。這兩者確實是相同的形態。

• 思考 — 兩者皆為自適應,且都帶有 effort 參數。Claude Haiku 5.5 的預設 effort 為 medium;並非所有已公布的分數都是在該設定下取得的。

• 獨立評分 — Claude Haiku 5.5(Max)43.40,在 182 個模型中排名第二。GPT-6 Luna(Max)38.12,在 182 個模型中排名第八。

• 每項任務的獨立成本 — $0.21 對比 $0.07。

• 速度 — 由同一個評估器測得,每秒輸出 241.9 個 token,相較於 129.4。

閾值就是差異所在。

兩家廠商都建立了雙層費率表。他們設定的位置截然不同,而這個位置的安排,遠比最上層的數字重要得多。

Anthropic 的級距設在 100,000 個 token。低於此,你支付 $0.10 和 $0.50;超過此,則是五倍和五倍——$0.50 和 $2.50。Anthropic 表示,低於該門檻的提示約占其先前 Haiku 模型請求的 90%,這既是該廠商自身的流量組成,也大致合理描述了短呼叫工作負載的普遍情況。

OpenAI 的級距落在 272,000 個 token。低於此,價格是 $0.10 和 $0.50——與 Anthropic 相同。高於此,則是 $0.20 和 $0.75,一個是翻倍,另一個增加 50%。這是平緩得多的級距,而且起點幾乎遠了三倍。

以一個 200,000 token 的提示詞為例,這對長文件處理流程而言是合理的規模,對 1M token 的上下文視窗來說也完全合理。在 Claude Haiku 5.5 上,該請求會以第二級計費:輸入 $0.50,輸出 $2.50。在 GPT-6 Luna 上,則仍屬第一級:輸入 $0.10,輸出 $0.50。同一個請求,在兩款公告價格相同的模型之間,輸入費率是五倍,輸出費率也是五倍。這不是細微差異——對長提示詞工作負載而言,這就是全部的比較。

為什麼相同的費率會產生三倍的帳單

每項任務成本才是應該決定高吞吐量管線的數字,而在這一點上,這兩個模型分道揚鑣的方式,是費率表無法解釋的。

Artificial Analysis 的數據顯示,GPT-6 Luna(Max)每完成一項 Intelligence Index 任務的費用為 0.07 美元,而 Claude Haiku 5.5(Max)為 0.21 美元——在完全相同的標價費率下相差三倍,而分數差距僅 5.28 分。原因就在同一頁上,而且並不隱晦。Claude Haiku 5.5 在跑 Index 時產生了 4.4 億個輸出 token,對比中位數的 1 億,評估者稱其極為冗長。GPT-6 Luna 則產生了 1.4 億個,同樣對比 1 億的中位數,被形容為略嫌冗長。當輸出量是主導計價的計量單位時,三倍的輸出 token 就是三倍的帳單。

Anthropic 自家的數字也指向同一個方向。該廠商的成本與準確度對比圖將 Haiku 5.5 標繪於整個投入程度範圍;而發表時的重點引述是:Sonnet 5.5 與 Opus 5.5 仍是複雜代理式編碼工作的較佳選擇,Haiku 5.5 則改為定位在壓縮、摘要與子代理。工作越小,你買到的這種冗長問題就越少——而這正是該模型被打造來處理的工作負載,也正是在這種工作負載下,三倍的成本差距值得拿你自己的日誌來核對,而不是拿排行榜的來核對。

帳簿上再多一筆,這次是來自 Ant​hropic 的文件,而非評測者的:Claude Haiku 5.5 使用與 Claude 4.7 及後續版本共用的較新 tokenizer,因此同一段文字會比前一版 Haiku 多出約 30% 的 token 數。費率與 Luna 相同;分詞器則不同。

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

Anthropic 自家的表格對 Luna 有什麼說法

Anthropic 的發布頁面將 GPT-6 Luna 列為其基準測試表格中的一欄,而誠實報導此事的方式,就是附上出處說明:這些是 Anthropic 的評估結果,是在 Anthropic 自家的測試框架上,針對競爭對手的模型所跑出來的。這些數據由廠商自行提報,未經獨立重現,而一家廠商以自己的測試套件去對照競爭對手的成績,這樣的比較值得權衡,而非照單全收。

• 知識工作——GDPval-AA v2.1 中,Claude Haiku 5.5 拿下 1620 分,對比 GPT-6 Luna 的 1437 分。AA-Briefcase v1.1 則為 1578 分對上 1336 分。

• 電腦操作 — OSWorld 2.1 離線子集達 72.4%,相較於 48.9%。

• 代理式編碼 — Terminal-Bench 4.0 為 39.2%,相較之下為 16.4%;FrontierCode 1.1(Main)為 46.4%,相較之下為 42.4%。

• 視覺推理 — Chartography 在未使用工具的情況下達到 46.4%,相較於 29.1%。

在廠商自家的測試框架上,Claude Haiku 5.5 在每一列都領先。在獨立榜單上,它的領先幅度較小——43.40 對 38.12——這正是廠商表格與第三方表格之間常見的關係,也是這裡同時列出兩者的原因。兩者在方向上一致,在幅度上則不一致。

該法案是決定性的一票

把真正重要的四項事實並列對照,就會發現對大多數工作負載而言,這個選擇根本不再難以取捨。

GPT-6 Luna 在獨立量測下,每完成一項任務的成本只有三分之一,其首個價格級距可觸及的上下文視窗遠達十八倍,在兩項指標上的超閾值率都較低,而且它是兩者中唯一長上下文懲罰是翻倍而非五倍躍升的。Claude Haiku 5.5 在實測智慧上以真實但溫和的幅度領先,輸出速度快近兩倍,而且——在該廠商自家的測試框架上,差距最大之處——在每一列已公布的基準測試結果上都領先。

如果你的呼叫很短、如果瓶頸在於輸送量,或者品質差異會在你自己的評估中顯現,那就付三倍的錢。如果你的呼叫很長、如果它們是機器產生且永遠不會被人類閱讀,或者你正在執行每天觸發一百萬次的分類層級,那麼同樣的 $0.10 和 $0.50 會讓你在另一邊拿到只有三分之一大小的帳單,而你放棄的能力,就等於在兩個模型都接近榜首的排行榜上少五分。

從一個地方呼叫兩者中的任一個

如此接近的比較有個好處:你不必聽信任何人的說法,包括我們的。GPT-6 Luna 今天已在 OrcaRouter 目錄上,以供應商的價格提供,0% 加價——與上方所列相同的價格結構,原樣傳遞而非混合計價——Claude Sonnet 5.5 和 Claude Opus 5.5 也是如此,這讓從低成本層級升級到中階層級的測試成為一項設定,而非一個專案。一組金鑰、一套 SDK,底層具備自動容錯移轉,而若升級邏輯應落在路由而非你的應用程式中,還可使用路由 DSL。

Claude Haiku 5.5 尚未列入目錄。坦白這樣說,比暗示並非如此更有用:這項比較中的 Luna 端,我們今天早上就能呼叫;而 Ant​hropic 端則必須在 Ant​hropic 才能觸及,直到不再如此為止。

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

什麼會改變答案?

有兩件事,而且這兩件事都值得觀察,而非估算。

首先,問題在於冗長程度是否會改變。Claude Haiku 5.5 的每項任務成本,取決於它在最大投入程度下每次回答花費多少 token,而投入程度參數正是控制這點的槓桿。若團隊把投入程度調低——模型本身的預設是中等,而非最大——就會看到每項任務成本更接近 Luna,分數也更接近 Luna。這項取捨是可行的;它值不值得,是關於你的評估的問題,而不是關於模型的問題。

第二點是,隨著兩個模型累積更多實測執行,獨立的每任務成本數字是否仍然成立。單一次的排行榜名次只是一張快照,而某張快照中出現的三倍差距,值得先對照你自己的帳單確認,再圍繞它重建管線。這正是共享端點的用途。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新