主視覺卡片,副標題為「Claude Haiku 5.5 vs Claude Sonnet 5.5」,等級標籤為「入門級 vs 前沿級」。兩張卡片並排:左邊標題為「Claude Haiku 5.5」,列出的行包括:指數 43、每項任務 $0.21,以及發佈日期 2026年10月7日;右邊標題為「Claude Sonnet 5.5」,列出的行包括:指數 56、每項任務 $7.60,以及發佈日期 2026年9月28日。兩者之間有一個居中徽章寫著「36倍實測成本差距」。頁腳一行寫著「每項任務成本與 Intelligence Index 由 Artificial Analysis 提供;兩個模型均支援 1M 上下文。」
Guides & Insights

Claude Haiku 5.5 對比 Claude Sonnet 5.5:20 倍的費率表,36 倍的實測帳單

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5與Claude Sonnet 5.5同屬一個系列,卻相隔六天、相差一個等級,兩者共用一百萬 token 的上下文視窗,並以相同的 API 形式回應。在官方公布的價目表上,大多數請求落所在的區間裡,較便宜的那個只要較貴的那個五分之一的價格。在獨立的 Artificial Analysis 排行榜上,差距比這還大:在 Claude Haiku 5.5 上完成一項 Intelligence Index 任務要 $0.21,而在 Claude Sonnet 5.5 上則要 $7.60,對應的 Intelligence Index 分別是 43 與 56。促成這篇文章的訊號,把它說成 Claude Haiku 5.5「遠勝 GPT-6 Luna」,而且「更接近 Sonnet 5.5」。前半段大致就是廠商自家比較表所呈現的結果。後半段則是量測數據開始與行銷說法不一致的地方,而值得精確說明究竟是哪裡不一致。

兩款模型,相隔六天,僅差一個等級

Claude Haiku 5.5 於 2026 年 10 月 7 日推出,模型 ID 為 claude-haiku-5-5。它是 Claude Haiku 4.5 的直接替代品,接受文字與圖像輸入並回傳文字,也是 Anthropic 首個提供可調 effort 設定的 Haiku 級模型——Low、Medium、High、Xhigh 與 Max,其中 medium 為 API 預設值。Anthropic 稱其為「我們歷來推出過最便宜、最快、能力最強的小型模型」,並在註腳中補充說明,這是指在各模型標準速度下最快,但當 Opus 模型以 Fast Mode 運行時,仍不及它們。

Claude Sonnet 5.5 早了六天推出,於 2026 年 9 月 28 日以 claude-sonnet-5-5 登場——這個層級是 Anthropic 定位為速度與智慧的最佳組合,也是它推薦用於複雜代理式編碼的選擇。同樣具備一百萬 token 的上下文視窗。與 Claude Haiku 5.5 不同,它沒有依提示長度分級的價格帶,而事實證明,這點比領先六天更為重要。

兩者現在都已在所有平台推出,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure,而且兩者都附有退役承諾,不早於推出後一年——Claude Haiku 5.5 為 2027 年 10 月 7 日,Claude Sonnet 5.5 為 2027 年 9 月 28 日。Anthropic 表示,Claude Sonnet 5.5 以零資料保留方式提供,與 Claude Opus 5.5 和 Claude Sonnet 5 一致。

費率卡,正反兩面,盡在一處

每百萬個 token,以美元計算,依 Anthropic 公布的費率:

• 輸入 — Claude Haiku 5.5:最多 100,000 個 token 的提示為 $0.10,超過該門檻為 $0.50;Claude Sonnet 5.5:固定 $2.00,無階梯。

• 輸出 — Claude Haiku 5.5 100,000 個 token 以內 $0.50,超過則 $2.50;Claude Sonnet 5.5 均一價 $10.00。

• 快取讀取 — Claude Haiku 5.5 在較低區間為 $0.01,超過該區間為 $0.05;Claude Sonnet 5.5 為 $0.10。Anthropic 在推出 Haiku 的同時,將 Claude Sonnet 5.5 的快取讀取價格從 $0.20 減半,並表示由於快取讀取占代理式 token 使用量的很大一部分,Claude Sonnet 5.5 現在在大多數代理式工作上的成本降低約 20%。

• 快取寫入 — Claude Haiku 5.5 在較低級距中,五分鐘寫入為 $0.125,一小時寫入為 $0.20;超過該級距則為 $0.625 與 $1.00;Claude Sonnet 5.5 五分鐘寫入為 $2.50,一小時為 $4.00。

• Batch — Batch API 無論輸入或輸出皆享 50% 折扣。這讓 Claude Haiku 5.5 在 100,000-token 門檻以下為 $0.05 與 $0.25,門檻以上為 $0.25 與 $1.25,對比 Claude Sonnet 5.5 的 $1.00 與 $5.00。

把這些線橫向對照來看,型態相當一致:在較低區間,你會看到 20 倍的輸入差距和 20 倍的輸出差距;在線之上則是 4 倍和 4 倍。Anthropic 的主打說法是,相較於 Claude Haiku 4.5 平均「執行成本低約 75%」,並在註腳中進一步說明為:低於 100,000 個 token 時便宜 90%,高於此則便宜 50%,而 tokenizer 的變更也已納入該平均值中。

100,000 個 token 的階段,就是運算出現轉折的地方。

兩股力量朝相反方向拉扯,而其中只有一股會反映在價目表上。價格相對於 Claude Haiku 4.5 大幅下滑。與此同時,Claude Haiku 5.5 搭載了更新版的分詞器,類似於 Claude Sonnet 5.5 與 Claude Opus 5.5 所用的版本,Anthropic 表示這「每項任務會使用略多一點的詞元」——因此同一段提示詞送進去,會以比前一代更多的計費詞元數量呈現。平均 75% 這個數字是兩者相抵後的淨結果,而且是供應商自己提供的數字。

100,000 個 Token 的門檻就是讓人措手不及的地方。Anthropic 對 Claude Haiku 5.5 的定價是依提示長度計算:提示超過 100,000 個 Token 的要求,整筆要求都會以較高價位計費,而不只是超過門檻的那部分 Token。提示長度會計入所有輸入 Token,包括快取讀取與快取寫入,而且每筆要求各自獨立計價——即使提示中有部分是快取命中,較長的要求仍支付較高價位區間,而較早的要求則維持當初計費的價格。一條安穩落在 90,000 個 Token 的檢索流程,支付的是 $0.10 和 $0.50。把視窗稍微往上推一格,整筆要求就會改以 $0.50 和 $2.50 計價。Claude Sonnet 5.5 不會這樣,因為完整的百萬 Token 視窗一律以標準價格計費。

隨之而來的是兩個後果,指向相反的方向。第一,人們預期的交叉點——長上下文讓昂貴的模型反而成為較便宜的那個——並不會發生:價目表上,線以上的 Claude Haiku 5.5 仍然只是 Claude Sonnet 5.5 的四分之一。第二,你原本指望的差距,會在你的工作負載變重時,正好從 20 倍縮小到 4 倍,而那正是絕對數字開始變得重要的時候。這個級距正是為什麼對成本敏感的管線需要自己的預算項目,而不是按每詞元計價的費率。

各家廠商所報告的自身得分

本節所有內容皆由廠商自行報告,且未經第三方重現。Anthropic 在其 Claude Haiku 5.5 與 Claude Sonnet 5.5 頁面上發布相同的比較組合,而兩頁重疊之處彼此一致:

• GDPval-AA v2.1,知識工作 —— Claude Haiku 5.5 為 1,620,相較於 Claude Sonnet 5.5 的 1,840、Claude Haiku 4.5 的 735,以及 GPT-6 Luna 的 1,437。

• AA-Briefcase v1.1 — Claude Haiku 5.5 為 1,578,相較之下 Claude Sonnet 5.5 為 1,824,Claude Haiku 4.5 為 614,GPT-6 Luna 為 1,336。

• OSWorld 2.1、電腦使用、離線子集 —— Claude Haiku 5.5 為 72.4%,相較之下 Claude Sonnet 5.5 為 83.9%、Claude Haiku 4.5 為 15.7%,而 GPT-6 Luna 則為 48.9%。

• Terminal-Bench 4.0,代理式編碼 — Claude Haiku 5.5 為 39.2%,相較之下 Claude Sonnet 5.5 為 70.6%,Claude Haiku 4.5 為 0.0%,GPT-6 Luna 為 16.4%。

• FrontierCode 1.1,Main —— Claude Haiku 5.5 為 46.4%,相較之下 Claude Sonnet 5.5 在 Xhigh effort 下為 52.1%,GPT-6 Luna 則為 42.4%。Anthropic 也指出,Claude Sonnet 5.5 在此項目上於 Max effort 的分數低於 Xhigh,並將此歸因於更頻繁使用程式碼審查技能,導致逾時或超出範圍的編輯。

• Chartography,無工具的視覺推理——Claude Haiku 5.5 為 46.4%,相較之下 Claude Sonnet 5.5 為 61.6%,Claude Haiku 4.5 為 6.4%,GPT-6 Luna 為 29.1%。

• Humanity's Last Exam — Claude Haiku 5.5 在無工具情況下為 45.9%,使用工具則為 57.4%;Claude Sonnet 5.5 使用工具為 64.5%,Claude Haiku 4.5 為 18.7%,而同一頁面上 Claude Sonnet 5.5 在無工具情況下為 56.9%。Anthropic 指出,GPT-6 系列的分數可能已經過時,因為 OpenAI 修復了一個圖像理解錯誤,而第三方分數尚未全部更新。

其中兩行值得讀兩遍。在 FrontierCode 上,這兩個模型可說相當接近——46.4% 對 52.1%——而在 Chartography 上,由於沒有工具可倚靠,差距達 15 個百分點。Terminal-Bench 4.0 則完全談不上接近:39.2% 對 70.6% 屬於不同的能力等級,這正是為什麼 Anthropic 的 Claude Sonnet 5.5 頁面仍指向 Claude Sonnet 5.5 與 Claude Opus 5.5 來處理複雜的代理式編碼,並將 Claude Haiku 5.5 定位為適合狹窄、高流量工作的模型。

獨立董事會增添什麼

Anthropic 的數據是拿自家模型彼此互比,以及與一個競爭對手相比。獨立排行榜則把兩者放進整個領域中比較,而它報告、供應商卻未報告的數字,是每項完成任務的成本。

Artificial Analysis 在 Max effort 下給 Claude Haiku 5.5 的 Intelligence Index 分數為 43,遠高於同類模型的中位數 13;它在該指數上產生 4.4 億個輸出 token,而中位數為 1 億——非常冗長——每百萬輸入 token 為 0.10 美元、每百萬輸出 token 為 0.50 美元,速度為每秒 242 個 token。其測得成本為每項 Intelligence Index 任務 0.21 美元。

同一份評測板給 Claude Sonnet 5.5 的分數是 56,中位數則為 26;它產生了 4.1 億個輸出 token,中位數為 8,800 萬;輸入為 $2.00、輸出為 $10.00,並享有 90% 快取折扣。其測得成本為每項 Intelligence Index 任務 $7.60。

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

把這兩行並排來看,比例就是重點。$0.21 對上 $7.60 是略高於 36 倍,而兩個模型在冗長程度上幾乎不相上下——440M 輸出符元對上 410M——所以那個倍數幾乎完全是價目表按其所述發揮作用。在供應商自家的價目表上,同樣的比較是 20 倍。多出來的部分來自按符元計價無法顯示的事物:在這個 effort 設定下,較便宜的模型每項任務以更少的計費符元得出答案,而且快取讀取的計費是 Claude Sonnet 5.5 費率的十分之一。相同的測試框架、相同的任務,獨立量測。

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

便宜層級實際上會在哪裡耗盡

Anthropic 公布的客戶數據,比基準測試更常左右最終選擇,而且全都指向同一個方向。Asana 回報任務完成的延遲降低超過 30%,每個代理回合的推論速度最高快 2.5 倍。Box 回報其分數比 Claude Haiku 4.5 高出 11 分,延遲約為一半。HubSpot 回報在其自家測試套件上看過的最佳分數,三次執行平均為 92.8%,並擁有最高的命中率與最低的偽陽性率。AlphaSense 每週透過「Ask in Document」執行約 800 萬次呼叫,並回報相較於 Claude Haiku 4.5 有統計上顯著的改善,0.84 對上 0.76。Cognition 回報,在以 Claude Haiku 5.5 作為搭檔的情況下,其 Fusion 代理的 FrontierCode 分數達到 66.2。

它們之中沒有一個是長程代理。它們都是單點解決方案——一個明確定義的步驟,變得更快、更便宜。這正是 Claude Haiku 5.5 所打造的形態,也正是 36 倍成本優勢是實質金錢而非四捨五入誤差的形態。這項優勢會隨著呼叫量而複合增長,並隨著呼叫深度而消失:每天十萬次分類呼叫,輸入 $0.10、輸出 $0.50,是一筆你會注意到消失的項目;而每次工作階段一百個代理回合,每個回合都重新讀取累積的上下文,則是一筆超線性增長的項目,因為超過門檻後的每個回合都需支付更高的費用級距。

Claude Sonnet 5.5 的反駁論點在於「每次嘗試的成本」,而非「每個詞元的成本」。Anthropic 表示,它比 Claude Sonnet 5 快 30% 以上,而且在多數工作上成本最多可降低 30%,而這項節省來自所需詞元更少,而非費率更低。第三方測試者給出了具體數字:Slack 回報輸出詞元少了約 14%,Balyasny 每次回答約 121k 詞元、相較之下為 497k,Box 快了 2.4 倍且詞元少了 12%,Lovable 的工具呼叫約少了三分之一、shell 執行約少了一半,Atlassian 的 Rovo Agents 最多快 30%,而 Base44 每次建置為 3.6 次迭代,Claude Opus 5 則為 7.7 次。一次奏效的回合,勝過四次沒中的回合。

還有第三個因素朝相反方向作用。Anthropic 在這一代把 effort 移到了模型層級的旋鈕上——Claude Haiku 5.5 的 effort 設定是每次請求設定一次,而不是依每次請求的思考預算來調整,而舊的 budget_tokens 模式在 4.6 模型上已棄用,在之後的模型上則不被接受。對於由多個服務呼叫同一個模型 ID 的機群來說,這是一種簡化。但對於任何會依每次呼叫自行調整推理規模的東西來說,這是一次改寫。

將兩者都運行在同一個端點後方

這個決定值得審慎做對,原因在於:一旦選錯,要收拾的代價很高——把正式環境的執行路徑從一個模型 ID 改接到另一個,意味著得動到每一個當初假設舊模型行為的呼叫點。要弄清楚某個工作負載該落在哪一層,更省成本的做法是讓兩者都跑在同一個端點後面,靠設定而非重構來在兩者之間移動流量。

這就是 OrcaRouter 的用途。Claude Sonnet 5.5 已在目錄中,型號為 anthropic/claude-sonnet-5.5,與 Claude Sonnet 5、Claude Opus 5.5 和 Claude Haiku 4.5 並列——較舊的 Haiku 層級仍可供使用,作為你遷移離開它時的參考基準。該平台以零加成直接傳遞供應商的定價,因此上述的 $2.00 和 $10.00 就是您支付的價格,反之亦然:當供應商調整價格時,新價格當天就會在此生效,Claude Sonnet 5.5 的快取讀取降價就是這樣傳到我們這裡的。這項特定決策所需的任務由兩項功能來完成。自動容錯移轉能讓仍在評估中的模型不占用你的關鍵路徑,而路由 DSL 讓你可以將低於 100,000 個 token 的呼叫送到便宜的層級,並在同一請求流程中把長上下文或長時間跨度的呼叫交給較貴的層級,無需第二份合約或第二個 SDK。

為了精確說明哪些有託管、哪些沒有:Claude Sonnet 5.5 目前可透過我們進行路由。Claude Haiku 5.5 尚未收錄於目錄中。在它被收錄之前,它仍存在於 Anthropic 自家的 API,以及上述三個雲端平台上。

如何決定

當任務範圍狹窄、量大且可驗證時——分類、擷取、路由、摘要,以及你已經建好的代理內部每一輪的工作——就選 Claude Haiku 5.5。20 倍的價差正是關鍵所在,100,000 token 的級距在設計上可避免,而獨立測得的每項任務 $0.21 說明這個優勢在供應商自家實驗室之外依然成立。依任務類別設定 effort 調節鈕,而不是讓它留在預設值;在 Haiku 等級的模型上,Low 與 Max 之間的差異是成本乘數,而非品質偏好。

當任務屬於長時程、代理式或難以驗證的情境時,就選 Claude Sonnet 5.5——例如必須能編譯的程式碼、必須讓螢幕停留在已知狀態的電腦操作,或任何答錯的代價高於這次呼叫成本的情況。Terminal-Bench 4.0 的 70.6% 對上 39.2% 並不是細微差異,而是不同能力等級,而且固定費率表意味著長脈絡不會悄悄讓整筆請求重新計價。如果你的工作負載確實落在兩者之間,誠實的答案是:目前這兩個模型都還沒有大量第三方重現結果作為後盾,指標分數來自單一測試框架,而上述引用的供應商數據是供應商自家提供的數字。

什麼會改變這個答案?

有三件事值得關注,而且都不是基準測試的發布。第一是對 Claude Haiku 5.5 在 Low、High 與 Xhigh effort(不只是 Max)的獨立評估,是否顯示出相同的每任務成本比,因為 effort 調節鈕是這項比較中最便宜的槓桿,卻也最缺乏測量。第二是 100,000-token 的級距是否延續;下一代若出現第三個級距,或完全沒有級距,對身處該門檻的每一條檢索管線來說,算式的改變都會比任何單一基準測試分數更大。第三是分詞器。如果後續的檢查點以較舊的速率將相同文字分詞,Anthropic 的 75% 平均值就會變成下限而非目標,而且與 Claude Sonnet 5.5 的差距會在兩者價格都沒變動的情況下擴大。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新