
Claude Haiku 5.5 正式上線,每百萬個 Token 僅需 $0.10:75% 的宣稱,及其兩則註腳
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Anthropic 讓 Claude Haiku 5.5於 2026 年 10 月 7 日正式全面推出,每百萬輸入 token 收費 0.10 美元、每百萬輸出 token 收費 0.50 美元——這兩個數字與 OpenAI 對 GPT-6 Luna的收費相同,也是 Claude Haiku 4.5自 2025 年以來成本的五分之一,該模型當年推出時為 1.00 美元與 5.00 美元。Anthropic 發布文中的標題是,這款新模型平均而言「執行成本低了約 75%」,而這正是此後每一篇摘要都重複引用的數字。它還附帶兩個註腳,而大多數這些摘要都略去了:低於 100,000 個 token 時降幅為 90%,超過時降幅為 50%;而且 Claude Haiku 5.5 採用與 Claude 4.7 及之後版本共用的較新 tokenizer,因此同樣的文字算起來大約 多了 30% 的 token,相較於在 Claude Haiku 4.5。所以 75% 說的是帳單,而不是價目表;對於提示詞很長的人來說,這兩者是不同的事。該供應商自家的比較表也把 GPT-6 Luna 與 Claude Sonnet 5.5並列為旁邊的欄位,這使得這份發布文件格外容易引發爭論。
「少 75%」背後的算術
先看費率表,因為它並非單一費率。在 100,000 個 token 以內,輸入為每百萬個 token $0.10,超過之後為每百萬個 token $0.50——五倍。輸出則是每百萬 $0.50,接著是 $2.50。快取也遵循同樣的級距:五分鐘快取寫入在門檻以下為每百萬 $0.125,超過門檻為 $0.625;一小時寫入為 $0.20 與 $1.00;快取讀取則為 $0.01 與 $0.05。Message Batches API 對兩種計費都減免 50%,而在批次路徑上,模型支援最多 300,000 個輸出 token,並搭配 output-300k-2026-03-24 beta 標頭。
現在把分詞器也加進來看,因為主要宣稱正是在這裡變得有趣。一個在 Claude Haiku 4.5 分詞器上量得 90,000 個 token 的提示,在新的分詞器上量得約 117,000 個。它的大小沒有改變,但已跨過 100,000 token 這條線,因此每百萬輸入 token 以 $0.50 計費,而不是 $0.10。在 Claude Haiku 4.5 上,同樣內容的輸入成本是 $0.09(每百萬 $1.00 × 0.09 百萬)。在 Claude Haiku 5.5 上,成本是 $0.0585。這是 35% 的降幅——真實存在,但遠不及 90%。90% 這個數字適用於在分詞器擴增後仍低於這條線的請求,而大量短呼叫流量正落在這裡:一個 20,000 token 的分類呼叫會變成 26,000 token,仍留在第一級距,而在那裡,輸入價格確實是原本的十分之一。
由此可得出三件事,而它們值得分別看待,而非取平均:
• 短呼叫可享完整折扣。對於落在門檻之下的文件,其擷取、路由、分類與摘要,在輸入與輸出上都適用 90% 這個數字,再扣掉分詞器所造成的膨脹。
• 長時呼叫大約省下三分之一,而不是四分之三。 重新分詞後超過 100,000 個 token 的請求,每百萬 token 需支付 $0.50 和 $2.50——仍是 Claude Haiku 4.5 費率的一半,但它所屬的級距是牌告價所宣稱級距的五倍。
• 「平均減少 75%」是一個以流量加權的數字,而且是 Anthropic 自己的數字。這是該廠商對自身預期組合的描述,而 Anthropic 也明確指出,在上一代 Haiku 中,低於該門檻的提示約占了 90% 的請求。如果你的組合看起來不像那個組合,你的平均值就不會像那個平均值——而唯一能知道是哪一種的方法,就是在你設定預算之前,用新的分詞器對你自己的流量計算 token 數。

它還隨附了什麼?
這個模型不只是一個價格。其中有幾個會改變你如何針對它撰寫程式碼,而其中一個會破壞一個
• 自適應思考預設為開啟,並提供從低到最高的努力程度調節,預設為中等。這是首款具備可調整努力設定的 Haiku 級模型,也是影響每次回答品質與成本的主要槓桿。
• 取樣參數會遭到拒絕。 傳送非預設的 temperature、top_p或top_k會傳回 400。任何把這些引數沿用下去的移轉,都會在第一個請求就明顯失敗,而不是悄悄劣化;至少這算是誠實的失敗模式。
• 100 萬 token 的上下文,以及最高 128,000 個輸出 token,於同步 Messages API 中提供,知識截止時間為 2026 年 6 月,並承諾最快於 2027 年 10 月 7 日才會退役。
• 首日即登上五個平台:Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry,以及 AWS 上的 Claude Platform。這是同日全面推出,而非這類發布常見的分階段上線。
• 工具鏈也同步跟上了。Anthropic 的 Python 與 TypeScript SDK 現在已於 beta 階段支援電腦操作與瀏覽器操作,該公司也為 Max 5x(100 美元)、Max 20x(200 美元)及 Team(最高 500 美元共用額度)訂閱者新增了每月 API 額度。
• 安全態勢比價格所暗示的更為狹隘。Anthropic 表示,Claude Haiku 5.5 的網路安全防護措施比 Claude Haiku 4.5 的更嚴格,但比近期前沿模型更寬鬆——防禦用途比 Claude Sonnet 5.5 所允許的更廣,但滲透測試仍被封鎖——且生物學防護措施與 Claude Sonnet 5、Claude Sonnet 5.5 和 Claude Opus 5 相同。在 Anthropic 自家的評測套件上,對齊評估相較前代全面改善。
供應商表格怎麼說,以及獨立委員會怎麼說
Anthropic 發布了一張包含三個比較欄的基準測試表,而它值得作為一份關於供應商如何論證的文件來閱讀。以下每一個數字都是供應商自行報告的,是在 Anthropic 的測試框架上產生的,且沒有任何一項經過獨立重現;在出現 GPT-6 Luna 的地方,那是 Anthropic 以自己的評測對競爭對手的模型進行測試所得的結果。
•知識工作 — GDPval-AA v2 為 1620,Claude Haiku 5.5 對比 735 的 Claude Haiku 4.5,GPT-6 為 1437,Claude Sonnet 5.5 為 184。AA-Briefcase v1.1 則為 1578、614、1336 與 1824。
• 電腦操作 — OSWorld 2.1 離線模式下為 72.4%,相較於 15.7%、48.9% 與 83.9%。
• 推理 — Humanity's Last Exam 在無工具時為 45.9%,使用工具時為 57.4%;相較之下,Claude Haiku 4.5 為 10.2% 與 18.7%,Claude Sonnet 5.5 則為 56.9% 與 64.5%。
• 代理式編程——Terminal-Bench 4.0 為 39.2%,相較之下分別為 0.0%、16.4% 與 70.6%。FrontierCode 1.1(Main)為 46.4%,相較之下 GPT-6 Luna 為 42.4%,Claude Sonnet 5.5 為 52.1%。
• 圖表閱讀 — Chartography 在未使用工具的情況下為 46.4%,相較於 6.4%、29.1% 及 61.6%。
在那張表上,Claude Haiku 5.5 每一列都勝過前一代 Haiku 和 GPT-6 Luna,但大多數列都輸給 Claude Sonnet 5.5——這正是小階層模型的誠實樣貌:跨世代的大躍進,但在最困難的工作上仍低於中型模型一個階層。Anthropic 在文章中也這麼說,建議以 Claude Sonnet 5.5 和 Claude Opus 5.5 處理複雜的代理式編碼,同時把 Haiku 定位在壓縮、摘要、分類與子代理等角色。
獨立評測呈現的樣貌更為細膩,也需要投入更多注意力。Artificial Analysis 以 Max 努力程度測量 Claude Haiku 5.5,在其 Intelligence Index v4.3.2 上得分 43,在 182 個模型中排名第二,輸出速度為每秒 241.9 個 token——確實如宣傳所述那般快。它同時測得每完成一項 Index 任務的成本為 0.21 美元,因為該模型在執行整套測試時產生了 4.4 億個輸出 token,而中位數為 1 億;評測方形容它極為冗長。GPT-6 Luna 在同一指數上得分 38,每項任務成本為 0.07 美元。相同的標價,三倍的帳單。這並不與發布時的說法矛盾——而是發布說法所談論的同一現象,從另一端來看:價目表是你每 token 支付的費用,而你實際支付的金額是費率乘以 token 數,而 Claude Haiku 5.5 每個答案耗用的 token 比競爭對手更多。努力程度是那根槓桿;該模型的預設值是 medium,而非 Max,而將其設定得更低的團隊,將會看到更小的帳單,以及更低的分數。
從單一位置呼叫它
這次推出所帶出的遷移問題,不是「它是不是更好」,而是「我的流量在它上面要花多少成本」,而這個答案取決於你的提示詞長度、你的快取命中率,以及你選擇的投入程度設定。要做到這點,意味著得把你自己的提示詞集在兩個世代上都跑一遍——透過單一端點來做很便宜,跨兩個端點來做則很麻煩。
Claude Haiku 5.5 目前還沒登上 OrcaRouter 的型錄,而直接把這件事說清楚,比暗示它已經上架更有用。我們目前可呼叫的 Anthropic 模型是:Claude Haiku 4.5、Claude Sonnet 4.5 與 Claude Opus 4.5,即日起就能向我們呼叫,價格比照供應商定價,零加價、直接轉嫁,因此遷移測試的「改版前」這一段,會跑在你原本就會繼續使用的金鑰上,而「改版後」這一段,則是讓新模型在我們所路由的執行環境上運行。在此期間,共用端點為你帶來的是通話的自動容錯移轉,讓新模型能夠承載正式流量,實際路徑取決於它;此外還有路由 DSL,用來處理從 Haiku 升級到 Sonnet 應該寫在路由裡、而非應用程式碼裡的情況。

這次發布中的兩項客戶成果,值得延續作為線索,而非證明。Asana 回報延遲降低超過 30%,且每個代理回合的推論速度最高可達 2.5 倍;HubSpot 回報在其 CRM 套件上三次執行平均達 92.8%;AlphaSense 回報在 400 筆查詢上為 0.84,對比 0.76。這些是廠商在自己公告中精選的客戶數字,其價值在於告訴你該先測試哪些工作負載,而不是告訴你你會得到什麼。
什麼會改變局面?
75% 這個數字,會像每一項以流量加權的供應商說法一樣,靠你自己的帳單來定案。在獨立第三方這邊,真正還沒有答案的是每項任務成本這個數字。如果隨著更多次執行累積,它仍站得住腳,那麼對這次發布最誠實的總結會是:Anthropic 把價目表砍了 80%,並打造出一個每次回答都消耗更多 token 的模型,所以實際省下的金額是真的、幅度很大、取決於工作負載,而且很少是海報上印的那個數字。如果它會隨著 effort 設定與快取而下降,這個層級看起來又更好。無論如何,在切換之前要檢查的數字,是你在新 tokenizer 下每項任務所用的自身 token 數——那是發布文章唯一無法給你的數字。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
