
Claude Haiku 5.5:降價 90%、全新分詞器,以及 Anthropic 沒發布的那支影片
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
有人把一句話丟進 Claude Haiku 5.5,就換回一支完成的產品發表影片。這則提示詞於 2026 年 10 月 7 日晚間發在 X 上,全文是:「為你的發表會做一支爆紅十倍的影片,展現你的動態設計功力有多強。」貼文的說明文字只有三個字——「One shotted this video」——並附上那段影片。沒有重試、沒有分鏡腳本、沒有剪輯師。如果這就是 Claude 系列最便宜的模型現在的表現,那這個等級已不再是一種妥協。
那是這次發布中比較有趣的一半。另一半是算術,而真正的重點就在這裡:Claude Haiku 5.5在提示詞不超過 10 萬個 token 的情況下,每百萬輸入 token 收費 0.10 美元,每百萬輸出 token 收費 0.50 美元,而Claude Haiku 4.5則是固定收費 1 美元和 5 美元。Anthropic 自家的附註稱,在常見情況下這便宜了 90%——但緊接著又說,買方真正該據以規劃的數字更接近 75%。這兩個數字都正確,而它們之間的落差,正是這次發布中最重要的一件事。
Anthropic 在10月7日公開發表的內容
廠商的發布貼文與其定價文件對這東西的樣貌看法一致,而這一步比降價通常伴隨的步伐更大。

• 價格 — 對於最多 100,000 個 token 的提示,每百萬個輸入 token 為 $0.10,每百萬個輸出 token 為 $0.50。超過該門檻後,相同請求的計費為 $0.50 與 $2.50。快取讀取費用為每百萬 $0.01(最多 100K),超過則為 $0.05;快取寫入為 $0.125 與 $0.625。
• 情境 — 1M 個 token,最大輸出為 128,000 個 token。這與 Claude Fable 5.1、Claude Opus 5.5 和 Claude Sonnet 5.5 所擁有的相同視窗與相同輸出上限,在最便宜的等級上重現。
• 思考 — 透過 effort 參數進行的自適應思考,預設為 medium。Anthropic 表示,這是首款具備可調整 effort 設定的 Haiku 級模型,這意味著同一個模型 ID 能以低成本運行,也能以謹慎方式運行,而無需變更其他任何設定。
• Tokenizer — 與 Claude 4.7 及後續版本共用的較新 Tokenizer,它「對相同文字會產生大約多 30% 的 token」。Anthropic 的文件說明指出,確切增加幅度取決於內容與工作負載型態。
• 生命週期 — 知識截止日期為 2026 年 6 月,以及一項「不早於 2027 年 10 月 7 日」的退役承諾。
• 可用性 —— Claude API、Amazon Web Services、Google Cloud、Microsoft Azure,以及 AWS 上的 Claude Platform,第一天就全部同步登場。
10 倍貼紙與 75% 的現實
便宜十倍這個數字會流傳得最遠,也最有可能被錯誤地放進某人的預算模型裡。它適用於最高 100,000 個 token 的提示。Haiku 5.5 並非在整個視窗內都維持那個費率。
• 最高 100,000 個 token——輸入 $0.10、輸出 $0.50,相較於 Haiku 4.5 的 $1 與 $5。這就是 90% 的降幅,而 Anthropic 表示,對前一代 Haiku 模型提出的請求中,有 90% 落在此區間。
• 超過 100,000 個 token —— 輸入 $0.50、輸出 $2.50。在相同請求下,依然正好是 Haiku 4.5 收費的一半,而且沒有上限需要觸及。
• 分詞器——同樣的文字在 Haiku 4.5 上會多出大約 30% 的 token,因此每 token 的降價並不會一對一地反映為更低的帳單。
• 廠商自身的平均值——Anthropic 將這個組合描述為「執行成本約降低 75%」。那是它自家的數字,並非獨立測量結果,而這正是應該放進預測的數字。
• 快取經濟學——在常見區間中,快取讀取從每百萬 $0.10 降至 $0.01,對於任何會重新傳送長共享前綴的管線來說,這比輸入費率更為重要。
75% 這個數字也解釋了某件讀者原本可能解讀為矛盾的事。這兩個標題數字並不衝突;一個是針對某種請求型態的比率,另一個則是對真實流量組合的混合估算,而該組合包含了佔少數的超過 100 的部分,以及 tokenizer 的 token。如果你在為支出建模,請採用 75%,並在採信之前先檢查你自己的提示長度分布。
影片聲稱的是什麼,以及不是什麼
這段影片是真實的,提示詞在上方是逐字引用的,而時間戳記——10月7日 19:49 UTC,大約就是該模型上線的同一天——是可以查證的。歸屬對象是個別使用者,而非 Anthropic。
這個區別在這裡很重要,因為 Anthropic 自家針對 Claude Haiku 5.5 的產品頁面完全沒有嵌入影片:沒有播放器、沒有媒體檔案,只有一個連到該公司 YouTube 頻道的連結。如果有用該模型製作發布影片,廠商並未這麼說。所以準確的說法很有限:一名使用者報告用 Claude Haiku 5.5 一次就生成了一支發布影片,並公開了提示詞。它是否一次完成、成本多少,以及有多少在剪輯後保留下來,全都是來自單一來源的說法。把這段影片當作示範,而不是基準測試。
無論如何,這件事值得一提的原因是:影片生成並不在該模型的規格之中。Haiku 5.5 接受文字與圖像輸入,並回傳文字。若要產生那種品質的動態設計成果,就意味著是該模型在驅動其他東西——一條程式碼生成路徑、一套算繪管線、一個工具迴圈——而不是由它本身產生影格。這其實是在說明以 $0.10 輸入成本進行的代理式協調,而這才是真正令人意外的部分。
Anthropic 公布的數字
該廠商的發布表格是與 Haiku 4.5 的前後對照,並將 GPT-6 Luna 與 Claude Sonnet 5.5 放在相同欄位中作為規模參照。以下每一項數字都是 Anthropic 自行回報的評估結果,於 Anthropic 的測試框架上執行,並經轉載但未經獨立驗證。

• 知識工作 — GDPval-AA v2.1 達 1620,相較於 Haiku 4.5 的 735、GPT-6 Luna 的 1437 與 Sonnet 5.5 的 1840。AA-Briefcase v1.1 達 1578,相較於 614、1336 與 1824。
• 電腦操作 — OSWorld 2.1 在離線子集上達到 72.4%,相較之下 Haiku 4.5 為 15.7%、GPT-6 Luna 為 48.9%,而 Sonnet 5.5 為 83.9%。
• 跨領域推理——Humanity's Last Exam 不使用工具時為 45.9%,使用工具時為 57.4%;相較之下,Haiku 4.5 則為 10.2% 與 18.7%。
• 代理式編碼 — Terminal-Bench 4.0 為 39.2%,對比 0.0%、16.4% 與 70.6%。FrontierCode 1.1(Main)為 46.4%,對比 GPT-6 Luna 的 42.4% 與 Sonnet 5.5 的 52.1%。
• 視覺推理 —— Chartography 在不使用工具的情況下達到 46.4%,相較於 6.4%、29.1% 與 61.6%。
Anthropic 也異常直白地說明小型模型層級在哪些地方佔不了上風。它在 Terminal-Bench 圖表上的自家評論指出,Sonnet 5.5 與 Opus 5.5「在複雜的代理式程式編寫任務上仍是更好的選擇」,並改將 Haiku 5.5 定位於壓縮、摘要與子代理工作。文章中的客戶引述指向同一方向,也帶有同樣的但書——這些是早期存取合作夥伴描述自家評估,而非稽核:Asana 回報任務完成的延遲降低超過 30%,每個代理回合的推論速度最高快上 2.5 倍;HubSpot 在一套 CRM 入口網站測試套件上回報三次執行平均 92.8%;AlphaSense 在每週約 800 萬次呼叫的工作負載上,於 400 筆查詢中回報 0.84 對上 0.76;Box 回報比 Haiku 4.5 高出 11 個百分點,延遲約為一半;Rogo 描述一個 Haiku 5.5 子代理從 10-K 文件中提取某個業務分部的營收數字;而 Cognition 回報 Devin Fusion 在 Haiku 5.5 擔任副手的情況下,拿下 66.2 的 FrontierCode 分數。
獨立董事會怎麼說
廠商表格是廠商自家的。對任何要判斷這個層級是否已進步到足以改變生產流程的人來說,第一個外部排名才是更有用的數字。

Artificial Analysis 在 Intelligence Index v4.3.2 中,於 Claude Haiku 5.5 的 Max 配置下給予 43 分,在該排行榜的 182 個模型中排名第二,且遠高於該排行榜的中位數 13。同一頁面測得每秒 242 個輸出詞元——在 182 個模型中排名第九——以及每項 Intelligence Index 任務的成本為 $0.21。
那一頁上有兩件事比標題更值得注意。第一是冗長程度:在評估 Index 時,Artificial Analysis 記錄到 4.4 億個輸出 token,而中位數是 1 億,並形容該模型「非常冗長」。標價是按 token 計費的,所以一個長篇思考的模型會為此付出代價——這正是為什麼每項任務成本落在 $0.21,而非接近零,也是為什麼輸入削減 90% 並非故事的全貌。第二是努力階梯:同一頁揭露了從 Max 一路到 Low 的各種設定,而 Anthropic 的預設是 medium,不是 max。排行榜上的 43 是那個階梯的頂端,而不是你什麼都不做時會得到的設定。
執行比你已經能呼叫的層級再低一級的層級
Claude Haiku 5.5 不在 OrcaRouter 的目錄中,而這一點值得直言不諱地說出來,而不是暗示並非如此:從一個模型問世到它可被路由,發布日的落差通常為數天,有時甚至更久。
目前 Anthropic 目錄上的內容是 Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5,每一項都以供應商定價轉嫁,零加成,因此 Anthropic 所做的任何降價,在他們那邊生效的同一天就會落到我們這邊。對任何現在就想測試子代理模式的人來說,這就是實際的橋樑:一條把例行回合送往 Haiku 4.5、並將困難的回合向上升級的串接流程,今天就能運作,只需一組金鑰和一個 SDK,而日後把小段換成 Haiku 5.5,只是改動模型 ID,而非進行遷移。無論你選擇哪些環節,底下都有自動容錯移轉,因此單一供應商狀況不佳的午後,不會把整條管線一起拖下水。
如果你完全不想等待,同樣的 $0.10 輸入價位帶已由 GPT-6 Luna 佔據,而我們確實有將其納入路由,且該費率一路維持到 272,000 個 token 才調升。
誰應該搬家,誰不應該
如果你的工作負載是大量的分類、擷取、路由、壓縮或摘要,而且你的提示詞低於 100,000 個 token,那麼情況很簡單:費率是原來的十分之一,視窗寬了五倍,而努力程度旋鈕讓你能在請求需要時往另一個方向取捨。預算抓大約低 75%,你就不會大吃一驚。
如果你的提示詞經常超過 100,000 個 Token,你買到的是 50% 的降幅,而不是 90% 的降幅;而深度脈絡的比價仍值得花上一個下午——這個領域已有數個模型的價格,等於或低於此級距超過 100K 的費率。
而如果你的評估在 Terminal-Bench 型態的工作上仍然失敗,這就不是能修正它的模型;Anthropic 自己也這麼說,而 39.2% 對比 Sonnet 5.5 的 70.6%,是這篇文章中最明確的證據。對 10 月 7 日最誠實的總結是:有用智慧的下限大幅下降,上限則完全沒有移動。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
