為「費率是十分之一,不代表帳單也是十分之一」生成的主視覺卡片,標記為「世代差距」,眉題為「兩款 Haiku 模型,相隔十一個月」,副標題為「Claude Haiku 5.5 對上 Claude Haiku 4.5,比較價格、token 與全新的 100,000 token 級距。」四個標籤寫著「$0.10 / $0.50」、「$1.00 / $5.00」、「1M 上下文」與「多 30% 的 token」。下方兩張卡片標示為「費率怎麼說」(「100,000 個 token 以下,輸入與輸出降低 90%」)與「帳單怎麼說」(「執行成本約少 75%,但 token 用量約多 30%」)。頁尾寫著「供應商定價文件,查閱於 2026 年 10 月 8 日。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5 對比 Claude Haiku 4.5:降價 90% 不等於節省 90%

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Haiku 5.5的定價為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元,適用於最多 100,000 個 token 的提示。Claude Haiku 4.5則一律是 1 美元與 5 美元,涵蓋它長久以來始終具備的整個 200,000-token 視窗。Ant​hropic 在一則註腳中把差距說成「低了 90%」,又在緊接其上的句子裡說「執行成本約少 75%」——而兩款模型相隔的十一個月,恰恰就是這兩個數字之間的距離。

那不是行銷上的障眼法。它是一個模型世代真實的樣貌:它在調整價格的同時,也改變了分詞器、預設思考模式與上下文視窗;這意味著,任何只是換掉模型 ID、就期待帳單能降到十分之一的人,最終會對算術感到失望,而不是對產品感到失望。

兩款型號,出貨時即如此

以下所有內容皆以每百萬個 token 計,單位為美元,且除非另有標註,否則均擷取自 Anthropic 自家的定價與模型文件,日期為 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Claude Haiku 4.5 - as shipped'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cache read $0.01 and $0.05, context 1M tokens, maximum output 128,000 tokens, thinking adaptive with an effort dial. Claude Haiku 4.5 reads input $1.00 flat, output $5.00 flat, cache read $0.10, context 200,000 tokens, maximum output 64,000 tokens, thinking manual with no effort dial. A footer reads 'Vendors' published list rates and model documentation.'

• 輸入 — Claude Haiku 5.5:最多 100,000 個 token 為 $0.10,超過則為 $0.50;Claude Haiku 4.5:無論長度皆為 $1.00。

• 輸出 — Claude Haiku 5.5:$0.50(最多 100,000 個 token),超過則為 $2.50;Claude Haiku 4.5:不論長度皆為 $5.00。

• 快取讀取 — Claude Haiku 5.5:$0.01(最多 100,000 個詞元),超過則為 $0.05;Claude Haiku 4.5:$0.10。快取寫入 — $0.125 與 $0.625,相較於 $1.25。

• 上下文 — 1M tokens 對比 200,000。最大輸出 — 128,000 tokens 對比 64,000。

• 思考 — Claude Haiku 5.5 是自適應的,且預設開啟,其努力程度調節預設為中等;Claude Haiku 4.5 採用較舊的手動形式,完全沒有努力參數。

• 獨立評分 —— Artificial Analysis Intelligence Index v4.3.2 將 Claude Haiku 5.5(Max)列於 43.40,在 182 個模型中排名第二,而 Claude 4.5 Haiku 則為 16.88,在 61 個模型中排名第三十 —— 評估方並將 4.5 的分數標註為估計值。

• 速度 — 同樣的來源下,Claude Haiku 5 每秒輸出 242 個權杖,相較於 4.5 世代的 89.7,這是舊模型唯一還稱得上從容的地方。

「十分之一價格」的故事在哪裡站不住腳

有三件事會蠶食這筆削減,而其中只有第一項是 Ant​hropic 自己的警告。

分詞器才是重點。Claude Haiku 5.5 採用的是 Claude 4.7 引進的新版分詞器,而 Anthropic 的文件指出,同樣的文字「在 Claude Haiku 4.5 上約會多出 30% 的 token 數」。你不是以相同的 token 數支付十分之一的費率;你是以大約 1.3 倍的 token 數支付十分之一的費率。供應商自家的遷移指南把這件事列為檢查清單上的第二項,排在每一項程式碼變更之前:重新計算你的提示,然後重新檢視 max_tokens 以及你的成本估算。

思考 token 會以輸出 token 計費,而 Claude Haiku 5.5 預設就會進行思考。Anthropic 的發布頁面明確指出,該模型在圖表上本身就「非常冗長」,而獨立測量結果比廠商更明確地佐證了這一點:在評估 Intelligence Index 時,Artificial Analysis 記錄到 Claude Haiku 5.5 產生 4.4 億個輸出 token,而整體中位數為 1 億個,並將該模型標記為非常冗長。對於帳單主要來自輸出的工作負載,便宜的輸入費率並沒有幫助。

10 萬個 token 的級距排第三。超過此門檻的費率是 $0.50 與 $2.50——是 Claude Haiku 4.5 在同一筆請求上收費的一半,這很划算,而且不是大多數讀者會讀到的那個方案。Anthropic 表示,低於門檻的提示詞約占前一版 Haiku 模型請求量的 90%;正是這個數字讓這道門檻作為標題還說得過去;而那也是供應商自家的流量組成,不是你的。

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 row in the models table and the published rate card beneath it, with the input, output, cache read and cache write rates and the prompt-length thresholds set out per million tokens.

同樣的工作對這兩個模型而言成本是多少

每完成一項任務的成本,是上述三種效應下仍屹立不搖的指標,因為它對模型所輸出的一切計費,而不僅僅是你送給它的內容。

Artificial Analysis 將 Claude Haiku 5.5(Max)列為每項 Intelligence Index 任務 $0.21——這個數字與其公布的 $0.10 輸入與 $0.50 輸出費率並列發布。它完全沒有公布 4.5 世代的每項任務成本數字;該圖磚顯示為未知,因為該模型從未以推理組態在該 Index 上執行過。該頁面確實公布的,是 $1.00 與 $5.00 的原始標價,以及一個不同且較低的實測分數。

所以,對買家而言,誠實的比較不是 token 上的 10 倍,而是更接近這樣:在 token 多 30% 的情況下,輸入費率是十分之一;當你超過 100K 時,輸出費率減半;而且模型每次回答所消耗的輸出 token 比前代更多——換來的是在同一份獨立排行榜上,能力分數從 16.88 躍升至 43.40。Ant​hropic 針對平均工作負載所引用的 75% 數字,是合理的規劃依據。它也是供應商針對你無法控制的流量組合所做的混合估計。

這次遷移不是單純換個模型 ID。

Ant​hropic 的遷移指南為任何要從 Claude Haiku 4.5 轉移的人列出十個項目,而且其中幾項是硬性失敗,而非建議。

• 手動 thinking 會失效 — thinking: {"type": "enabled", "budget_tokens": N} 會回傳錯誤。自適應 thinking 取代了它,而 thinking.display 必須設為 "summarized",才能看到推理內容。

• 取樣參數會失效 — temperature、top_p 和 top_k 都必須從請求中移除。

• 助理預填會中斷——以助理回合作結的對話會傳回錯誤;請改以使用者回合作結。

• 區塊順序變更 — 回應可以從思考區塊開始,因此將第一個內容區塊讀取為答案的程式碼必須改為依 type選取。

• 拒絕行為是新出現的——模型會執行安全分類器,可能回傳 stop_reason: "refusal",而且沒有伺服器端備援機制。

• 重播受限——思考區塊僅能在產生它們的帳號中運作,或是在與其連結的帳號中運作。

• Priority Tier 不會沿用——在 Claude Haiku 4.5 上持有 Priority Tier 承諾的組織必須另行規劃容量,因為 Claude Haiku 5.5 不支援該層級。

其中兩項比其他項目更值得注意。拒絕(refusal)停止原因是任何假設每個回應都有內容的迴圈中的控制流程變更,而綁定帳號的思考區塊則會破壞任何儲存對話並透過憑證集區重播這些對話的佇列。這兩者都要等到正式環境才會顯現。

在單一金鑰下執行兩個層級

對大多數團隊來說,實務上的問題並不是這兩種模型哪個比較好,因為答案完全取決於你正在進行哪一種呼叫。真正的問題是:級聯中便宜的那一段,能否獨立於其周遭的一切進行升級。

Claude Haiku 4.5 即日起已登上 OrcaRouter 目錄,價格比照 Anthropic 的定價、零加成,因此供應商費率會直接反映,Anthropic 對其所做的任何調整,我們這邊當天就會同步。Claude Sonnet 5.5 與 Claude Opus 5.5 也都在列,這表示現在就能打造一套兩層式管線——日常大多數任務交給小型模型,升級處理則交給較大型模型——再搭配一組金鑰、一套 SDK與底層的自動容錯移轉,而且日後要把小型那一環換成 Claude Haiku 5.5 時,只需變更模型 ID,而不必改寫程式。

Claude Haiku 5.5 還沒出現在目錄上,這一點值得直接講明,而不是留給人自己去揣測。模型正式推出與模型可供路由之間存在首日的時間差,這是正常現象,也並不代表我們承諾這個缺口何時會補上;今天早上能向我們呼叫的模型,就是上面提到的那些。

A screenshot of the OrcaRouter catalogue page for Claude Haiku 4.5, showing the model identifier, the provider Anthropic, the model description and a stat strip carrying the $1.00 per million input and $5.00 per million output rates alongside the context window and maximum output.

誰應該切換,以及應先切換哪一通話?

如果你的 Haiku 4.5 流量是分類、擷取、路由、壓縮,或少於 100,000 的提示,那就移過去——費率只有十分之一,視窗寬了五倍,而 effort 調節鈕給了你舊模型從未有過的成本槓桿。把預算調低約 75%,並在一週後用你自己的 token 數量來核對。

如果你的提示詞經常超過 100,000 個 token,你得到的是五折,而不是一折;而第二級距會改變比較基準,讓貨比三家變得值得:超過 100K 的輸出費率 $2.50 高於幾款相互競爭的小型模型對整個上下文視窗所收取的費用。

如果你之所以使用 Haiku 4.5,是因為它是唯一能裝下 200,000-token 文件的便宜選項,請留意有什麼改變了。現在視窗已達一百萬個 token,這是截然不同的產品,而保留舊模型的原因,也已經隨著它之所以便宜的原因悄然消失。