
Claude Haiku 5.5 的真正關鍵在於 10 萬 token 的懸崖:新版 Haiku 超過 10 萬 token 後的收費
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Haiku 5.5 於 2026 年 10 月 7 日推出,頭條價格為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元,而各處不斷被重複的那個數字,是 Anthropic 自己在公告中提出的:相較於 Haiku 4.5 相同兩個計費項目的費率,降價 90%。這個 90% 是真的。它同時也只涵蓋帳單其中一個維度的一半,而且一旦請求超過 100,000 個 token,其中每一項費率都會出現某種變化,而發布報導大多略過不提。本文要談的就是那條界線——跨越它的成本是多少、哪些工作負載實際會觸及它,以及為什麼「便宜 90%」是關於帳單某個切片的說法,而不是關於你的帳單。
這兩個價格,以及它們切換的地方
Anthropic 為模型公布了兩欄資料,而兩者之間的切換取決於請求大小的單一門檻,而非你所選擇的任何模型設定:
• 短層級,100,000 個 token(含)以下 — 每百萬輸入 token $0.10、每百萬輸出 token $0.50(Anthropic 定價表) • 長層級,超過 100,000 個 token — 每百萬輸入 token $0.50、每百萬輸出 token $2.50(Anthropic 定價表) • 快取讀取 — 每百萬 $0.01(短層級)與每百萬 $0.05(長層級) • Batch API — 任一欄位皆享 50% 折扣,且最大輸出長度為 300,000 個 token • 標準最大輸出 — 128,000 個 token,兩種層級皆提供 100 萬個 token 的上下文視窗

那些是 Anthropic 自己公布的費率,不是實測出來的,而且它們是目前的最新價目表:這麼新的模型,定價還沒時間變動,儘管 Anthropic 沒有任何義務維持它。
依序讀這四個數字,事情的全貌就顯而易見。長上下文層級的每一個費率都恰好是短上下文費率的五倍,而且它們全部的門檻同時都是相同的 100,000 個 Token。這裡沒有漸進的曲線、沒有內插、沒有中間帶——一筆 99,000 Token 的請求和一筆 101,000 Token 的請求,在整張帳單上的每一個 Token 都相差五倍,而不只是跨過那條線的那 2,000 個 Token。正是這一點讓它成為一道懸崖,而不是一段斜坡,也正是「便宜 90%」這種說法看不見的地方。

為什麼傷口看起來比實際還大
相較於 Haiku 4.5,也就是 Anthropic 所做的比較,短層級在輸入與輸出上都確實減少了 90%——同樣這兩欄,Haiku 4.5 每百萬 token 的收費是 $1.00 和 $5.00。長層級則另當別論:$0.50 和 $2.50 對比同樣的 $1.00 和 $5.00,是降價 50%,而不是 90%。所以,發表說法最誠實的版本是:Claude Haiku 5.5 在低於 100,000 個 token 時比 Haiku 4.5 便宜 90%,高於 100,000 個 token 時則便宜 50%;而這正是 Anthropic 自家文件在你把兩欄都讀過、而不是只讀一欄之後所給出的確切劃分。單一百分比並沒有錯;它是短層級的百分比,只是少了其適用條件就被呈現出來。
還有第二股往相反方向拉扯的力量,而它更有趣,因為它容易被忽略,卻又難以繞開。Claude Haiku 5.5 搭載了新的分詞器,而 Anthropic 自家的指引指出,同一段文字所對應的 token 數量,比 Haiku 4.5 為相同內容產生的數量高出大約 30%。相對於舊模型的計算方式,你原本每 token 支付的費用下降了,而你為*自己*文本的每個 token 支付的費用卻上升了約三分之一。Anthropic 所公布的淨數據——即該模型平均運行成本便宜約 75%——已經把這一點納入其中:牌價下調 90% 減去大約 30% 的 token 膨脹,在短上下文流量上落點就在那個區間附近;但這兩種效應可以分開,也值得分開來看。價格變動是你能從頁面上直接讀到的牌價變化;分詞器的變動則改變了你現有提示詞會消耗多少單位的該價格,而且它會先出現在你自己的 token 計數中,之後才會出現在其他地方。
對於每次呼叫原本就輕鬆維持在 100,000 個符元以下的工作負載,實際效果是每次呼叫成本直接降低,但部分被分詞器抵銷。對於並非如此的工作負載,在較長的那一半,這筆帳會反向計算兩次。
在超過 100,000 個 token 之上,實際上存在著什麼?
直覺反應是把長上下文定價歸入「agentic coding 與 RAG,不是我們」這一類。但這判斷得太快了,因為 100,000 token 這條線是每請求的界線,而每請求大小並不等同於任務大小。有幾種模式經常跨越這條線:
• 一個閱讀程式碼庫的代理,會在整個工作階段中將大量工作集保留在上下文中,而不是每一步都重新擷取
• 文件與合約分析,其中輸入是一份冗長的 PDF,再加上它自己的指令與少樣本範例——那種在還沒有人加入範例之前就有 60,000 個 token 的提示詞
• 將許多小型項目批次合併為一次呼叫,以攤銷每次呼叫的開銷,並藉此讓整個批次越過門檻的擷取管線
• 會將完整對話歷史內嵌保留、而非加以摘要的聊天產品,其中請求會單調成長,直到某個機制將其截斷
• 音訊與長影片轉錄形式的輸入,而這正是百萬 token 視窗所宣稱能支援的流量類型
100 萬 token 的上下文視窗,是規格表上讓那道斷崖值得一談的部分。Anthropic 販售的是能把極大型請求交給模型的能力,而定價結構的安排是:這項請求中最後 900,000 個 token 的成本,是前 100,000 個的五倍。這兩項事實都是刻意為之;只是分別在不同地方公布。如果你之所以會看這個模型,完全是因為長上下文視窗,那麼長上下文那一欄就是你的欄位,而發布百分比則是別人的。
價格對 Flash 層級造成的壓力
Anthropic 對這款模型所表明的意圖,是守住技術堆疊中低成本、高吞吐量的一端,而價目表也直白反映了這個意圖。Bloomberg 對這次發布的報導,將其定調為 Anthropic 在捍衛自身較低成本的定位,以對抗更便宜的開放權重競爭對手;而廠商端的說法則更進一步——新款 Haiku 的定價,就是要以大幅差距壓低直接競爭對手的價格。
只有在短層級,這項比較才站得住腳:$0.10 和 $0.50 是極具侵略性的低價。超過 100,000 個 token 後,$0.50 和 $2.50 的費率已不再比任何人的短層級費率更低;它們只是普通的中階層級數字。該廠商所謂「大幅差距」的說法,是針對費率表第一欄所做的陳述,而 Anthropic 有權在那裡這麼說——這是對其公布數字的準確解讀。這並非關於長上下文工作負載實際付費多少的主張,也不應被當成那樣引用。
模型其餘部分,簡要說明
Claude Haiku 5.5 保留了 Sonnet 與 Opus 系列已推出的功能,而非為了這個尺寸級別而加以刪減。它具備自適應思考,預設努力程度為中等,也是 Haiku 系列中首款配備可調式努力程度刻度(涵蓋 Low 到 Max)的模型。知識截止日為 2026 年 6 月,模型 ID 為 claude-haiku-5-5。Anthropic 表示其退役日期不會早於 2027 年 10 月 7 日——與發布日同一天,即一年之後——該模型已上架 Amazon Bedrock、Google Cloud 和 Microsoft Azure,以及 Anthropic 自家的 API。

在基準測試方面,發布文章中的一切都帶有相同的來源標籤,而且當之無愧:這些是供應商自行報告的數字,由銷售該模型的公司所測量,且在撰寫本文時,尚未有獨立重現的結果發表。
• GDPval-AA v2.1 — 廠商回報 Claude Haiku 5.5 為 1,620,相較於同一測試框架中 Haiku 4.5 的 735
• AA-Briefcase v1.1 — 廠商報告為 1,578,前一代則為 614
• OSWorld 2.1 — 廠商報告為 72.4%,相較之下為 15.7%
• Terminal-Bench 4.0 — 廠商回報為 39.2,相較於 0.0
• Humanity's Last Exam — 廠商報告為 45.9%,使用工具時為 57.4
那些差異的幅度,正是應該將它們標記出來、而非直接引用它們的原因。在由模型自家供應商所測量的 OS-agent 基準測試上,從 15.7 躍升到 72.4,這個數字在第三方以相同評測框架跑過之前,只能先寬鬆看待。Artificial Analysis 已於 2026 年 10 月初針對該模型發布自家指數——獨立數字為 43.395,其中 Terminal-Bench Hard 為 0.329、HLE 為 0.444——而當這項說法需要經得起質疑時,該組數字才是應該引用的。供應商數字與獨立數字並不衝突;它們只是不同的評測框架,而把它們混進同一句話,正是部落格文章最後會斷言供應商評測是事實的原因。
基礎架構的註記,因為我們自己也運行一套
Anthropic 透過自家 API,以及 Bedrock、Google Cloud 和 Azure 銷售 Claude Haiku 5.5。如果你正在決定該呼叫其中哪一個管道,或是要把它加到你技術堆疊中既有的其他模型旁邊,請注意:無論透過哪個通路銷售,原廠定價都相同,而 OrcaRouter 的設計就是要以零加成將該定價原樣傳遞出去——因此 Anthropic 在這款模型上的價格變動,在我們這邊是當天就生效,而不是延後跟進。我們的型錄也收錄了qwen/qwen3.8-flash,每百萬 token 為 $0.15 和 $0.47,以及z-ai/glm-5.3-flash,每百萬 token 為 $0.15 和 $0.50;這兩個模型最常被放在 Haiku 等級模型旁邊的位置,使用同一把金鑰、同一張帳單——這正是讓混合技術堆疊只需一份合約、而非三份的關鍵。我們本身並不提供 Claude Haiku 5.5;若要使用它,請直接呼叫 Anthropic。
如果你會路由多個模型,這個斷崖有一個實務上的推論:十萬個 token 的界線,正是原本便宜的請求會變得昂貴的地方,而請求本身並沒有任何實質改變。如果你的路由層能進行容錯移轉,明智的做法是讓長上下文流量指向門檻之上真正便宜的那個模型,並讓短上下文流量落到門檻之下便宜的那個模型,而不是假設單一模型的公告費率同時適用於兩者。
從發布會中能學到什麼
降價是真的,而且幅度很大,落在 100,000 個 token 以下的區間。這款模型是第一款具備完整交付功能集與 effort dial(努力程度調節鈕)的 Haiku,對代理式(agentic)用途而言,這點比價格更重要。基準測試的差距數字是廠商自行報告的,每次轉述時都應該如此標明。而價目表在 100,000 個 token 處有一個級距,會讓所有費率一次乘以五——對於讀的是你的技術堆疊、而不是讀新聞稿的人來說,這正是這次發布中最需要知道的一件事,而且必須在下一個 sprint 的 token 預算定案之前知道。
如果你想用自己的流量來核對這套計算,要取得的兩個數字,是你請求大小的第 95 百分位數,以及你在超過 100,000 個 token 的請求上的支出占比。如果第一個數字低於這條線,那麼 90% 就適用於你,而發布報導對你的情況也判斷正確。如果第二個數字占帳單中相當可觀的一部分,那麼真正重要的數字就是 50,而且值得針對你當初基於 90% 假設、在技術堆疊中選用的任何模型,重新跑一次成本估算。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
