一張為「Claude Haiku 5.5 的價格只要十分之一」生成的 hero card,標章為「最便宜的 CLAUDE」,引題為「ANTHROPIC,2026 年 10 月 7 日」,副標為「費率調降 90%、一個會多出約 30% token 的分詞器,以及一支 Anthropic 沒有發布的發表影片。」四個標籤寫著「輸入 $0.10」、「輸出 $0.50」、「1M 上下文」與「實際省下 75%」。下方兩張卡片標示為「降了什麼」(「10 萬 token 以下,輸入 $1.00 降至 $0.10,輸出 $5.00 降至 $0.50」)與「漲了什麼」(「同樣的文字換算成約多 30% 的 token」)。頁尾寫著「供應商定價文件,讀取於 2026 年 10 月 8 日。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Haiku 5.5:降價 90%、全新分詞器,以及 Anthropic 沒發布的那支影片

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

有人把一句話丟進 Claude Haiku 5.5,就換回一支完成的產品發表影片。這則提示詞於 2026 年 10 月 7 日晚間發在 X 上,全文是:「為你的發表會做一支爆紅十倍的影片,展現你的動態設計功力有多強。」貼文的說明文字只有三個字——「One shotted this video」——並附上那段影片。沒有重試、沒有分鏡腳本、沒有剪輯師。如果這就是 Claude 系列最便宜的模型現在的表現,那這個等級已不再是一種妥協。

那是這次發布中比較有趣的一半。另一半是算術,而真正的重點就在這裡:Claude Haiku 5.5在提示詞不超過 10 萬個 token 的情況下,每百萬輸入 token 收費 0.10 美元,每百萬輸出 token 收費 0.50 美元,而Claude Haiku 4.5則是固定收費 1 美元和 5 美元。Anthropic 自家的附註稱,在常見情況下這便宜了 90%——但緊接著又說,買方真正該據以規劃的數字更接近 75%。這兩個數字都正確,而它們之間的落差,正是這次發布中最重要的一件事。

Anthropic 在10月7日公開發表的內容

廠商的發布貼文與其定價文件對這東西的樣貌看法一致,而這一步比降價通常伴隨的步伐更大。

A generated scoreboard titled 'Claude Haiku 5.5 benchmark table - Anthropic's own harness' with two columns. Claude Haiku 5.5 reads GDPval-AA v2.1 1620, AA-Briefcase v1.1 1578, OSWorld 2.1 72.4%, Humanity's Last Exam 45.9%, Terminal-Bench 4.0 39.2% and Chartography 46.4%. Claude Haiku 4.5 reads 735, 614, 15.7%, 10.2%, 0.0% and 6.4%. A footer reads 'Vendor-reported evaluations published by Anthropic on October 7, 2026; not independently reproduced.'

• 價格 — 對於最多 100,000 個 token 的提示,每百萬個輸入 token 為 $0.10,每百萬個輸出 token 為 $0.50。超過該門檻後,相同請求的計費為 $0.50 與 $2.50。快取讀取費用為每百萬 $0.01(最多 100K),超過則為 $0.05;快取寫入為 $0.125 與 $0.625。

• 情境 — 1M 個 token,最大輸出為 128,000 個 token。這與 Claude Fable 5.1、Claude Opus 5.5 和 Claude Sonnet 5.5 所擁有的相同視窗與相同輸出上限,在最便宜的等級上重現。

• 思考 — 透過 effort 參數進行的自適應思考,預設為 medium。Ant​hropic 表示,這是首款具備可調整 effort 設定的 Haiku 級模型,這意味著同一個模型 ID 能以低成本運行,也能以謹慎方式運行,而無需變更其他任何設定。

• Tokenizer — 與 Claude 4.7 及後續版本共用的較新 Tokenizer,它「對相同文字會產生大約多 30% 的 token」。Anthropic 的文件說明指出,確切增加幅度取決於內容與工作負載型態。

• 生命週期 — 知識截止日期為 2026 年 6 月,以及一項「不早於 2027 年 10 月 7 日」的退役承諾。

• 可用性 —— Claude API、Amazon Web Services、Goo​gle Cloud、Microsoft Azure,以及 AWS 上的 Claude Platform,第一天就全部同步登場。

10 倍貼紙與 75% 的現實

便宜十倍這個數字會流傳得最遠,也最有可能被錯誤地放進某人的預算模型裡。它適用於最高 100,000 個 token 的提示。Haiku 5.5 並非在整個視窗內都維持那個費率。

• 最高 100,000 個 token——輸入 $0.10、輸出 $0.50,相較於 Haiku 4.5 的 $1 與 $5。這就是 90% 的降幅,而 Ant​hropic 表示,對前一代 Haiku 模型提出的請求中,有 90% 落在此區間。

• 超過 100,000 個 token —— 輸入 $0.50、輸出 $2.50。在相同請求下,依然正好是 Haiku 4.5 收費的一半,而且沒有上限需要觸及。

• 分詞器——同樣的文字在 Haiku 4.5 上會多出大約 30% 的 token,因此每 token 的降價並不會一對一地反映為更低的帳單。

• 廠商自身的平均值——Anthropic 將這個組合描述為「執行成本約降低 75%」。那是它自家的數字,並非獨立測量結果,而這正是應該放進預測的數字。

• 快取經濟學——在常見區間中,快取讀取從每百萬 $0.10 降至 $0.01,對於任何會重新傳送長共享前綴的管線來說,這比輸入費率更為重要。

75% 這個數字也解釋了某件讀者原本可能解讀為矛盾的事。這兩個標題數字並不衝突;一個是針對某種請求型態的比率,另一個則是對真實流量組合的混合估算,而該組合包含了佔少數的超過 100 的部分,以及 tokenizer 的 token。如果你在為支出建模,請採用 75%,並在採信之前先檢查你自己的提示長度分布。

影片聲稱的是什麼,以及不是什麼

這段影片是真實的,提示詞在上方是逐字引用的,而時間戳記——10月7日 19:49 UTC,大約就是該模型上線的同一天——是可以查證的。歸屬對象是個別使用者,而非 Anthropic。

這個區別在這裡很重要,因為 Anthropic 自家針對 Claude Haiku 5.5 的產品頁面完全沒有嵌入影片:沒有播放器、沒有媒體檔案,只有一個連到該公司 YouTube 頻道的連結。如果有用該模型製作發布影片,廠商並未這麼說。所以準確的說法很有限:一名使用者報告用 Claude Haiku 5.5 一次就生成了一支發布影片,並公開了提示詞。它是否一次完成、成本多少,以及有多少在剪輯後保留下來,全都是來自單一來源的說法。把這段影片當作示範,而不是基準測試。

無論如何,這件事值得一提的原因是:影片生成並不在該模型的規格之中。Haiku 5.5 接受文字與圖像輸入,並回傳文字。若要產生那種品質的動態設計成果,就意味著是該模型在驅動其他東西——一條程式碼生成路徑、一套算繪管線、一個工具迴圈——而不是由它本身產生影格。這其實是在說明以 $0.10 輸入成本進行的代理式協調,而這才是真正令人意外的部分。

Ant​hropic 公布的數字

該廠商的發布表格是與 Haiku 4.5 的前後對照,並將 GPT-6 Luna 與 Claude Sonnet 5.5 放在相同欄位中作為規模參照。以下每一項數字都是 Ant​hropic 自行回報的評估結果,於 Ant​hropic 的測試框架上執行,並經轉載但未經獨立驗證。

A screenshot of Anthropic's Claude Haiku 5.5 launch page, dated October 7 2026 and headed with the model name, the identifier claude-haiku-5-5 and the launch standfirst, with the vendor's reported evaluation rows and pricing notes below.

• 知識工作 — GDPval-AA v2.1 達 1620,相較於 Haiku 4.5 的 735、GPT-6 Luna 的 1437 與 Sonnet 5.5 的 1840。AA-Briefcase v1.1 達 1578,相較於 614、1336 與 1824。

• 電腦操作 — OSWorld 2.1 在離線子集上達到 72.4%,相較之下 Haiku 4.5 為 15.7%、GPT-6 Luna 為 48.9%,而 Sonnet 5.5 為 83.9%。

• 跨領域推理——Humanity's Last Exam 不使用工具時為 45.9%,使用工具時為 57.4%;相較之下,Haiku 4.5 則為 10.2% 與 18.7%。

• 代理式編碼 — Terminal-Bench 4.0 為 39.2%,對比 0.0%、16.4% 與 70.6%。FrontierCode 1.1(Main)為 46.4%,對比 GPT-6 Luna 的 42.4% 與 Sonnet 5.5 的 52.1%。

• 視覺推理 —— Chartography 在不使用工具的情況下達到 46.4%,相較於 6.4%、29.1% 與 61.6%。

Anthropic 也異常直白地說明小型模型層級在哪些地方佔不了上風。它在 Terminal-Bench 圖表上的自家評論指出,Sonnet 5.5 與 Opus 5.5「在複雜的代理式程式編寫任務上仍是更好的選擇」,並改將 Haiku 5.5 定位於壓縮、摘要與子代理工作。文章中的客戶引述指向同一方向,也帶有同樣的但書——這些是早期存取合作夥伴描述自家評估,而非稽核:Asana 回報任務完成的延遲降低超過 30%,每個代理回合的推論速度最高快上 2.5 倍;HubSpot 在一套 CRM 入口網站測試套件上回報三次執行平均 92.8%;AlphaSense 在每週約 800 萬次呼叫的工作負載上,於 400 筆查詢中回報 0.84 對上 0.76;Box 回報比 Haiku 4.5 高出 11 個百分點,延遲約為一半;Rogo 描述一個 Haiku 5.5 子代理從 10-K 文件中提取某個業務分部的營收數字;而 Cognition 回報 Devin Fusion 在 Haiku 5.5 擔任副手的情況下,拿下 66.2 的 FrontierCode 分數。

獨立董事會怎麼說

廠商表格是廠商自家的。對任何要判斷這個層級是否已進步到足以改變生產流程的人來說,第一個外部排名才是更有用的數字。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 in its Max configuration, showing an Intelligence Index v4.3.2 score of 43.40 ranked second of 182 models, an output speed of 242 tokens per second, a cost of $0.21 per Intelligence Index task, and the evaluator's note that the model generated 440 million output tokens against a 100 million median and is very verbose.

Artificial Analysis 在 Intelligence Index v4.3.2 中,於 Claude Haiku 5.5 的 Max 配置下給予 43 分,在該排行榜的 182 個模型中排名第二,且遠高於該排行榜的中位數 13。同一頁面測得每秒 242 個輸出詞元——在 182 個模型中排名第九——以及每項 Intelligence Index 任務的成本為 $0.21。

那一頁上有兩件事比標題更值得注意。第一是冗長程度:在評估 Index 時,Artificial Analysis 記錄到 4.4 億個輸出 token,而中位數是 1 億,並形容該模型「非常冗長」。標價是按 token 計費的,所以一個長篇思考的模型會為此付出代價——這正是為什麼每項任務成本落在 $0.21,而非接近零,也是為什麼輸入削減 90% 並非故事的全貌。第二是努力階梯:同一頁揭露了從 Max 一路到 Low 的各種設定,而 Anthropic 的預設是 medium,不是 max。排行榜上的 43 是那個階梯的頂端,而不是你什麼都不做時會得到的設定。

執行比你已經能呼叫的層級再低一級的層級

Claude Haiku 5.5 不在 OrcaRouter 的目錄中,而這一點值得直言不諱地說出來,而不是暗示並非如此:從一個模型問世到它可被路由,發布日的落差通常為數天,有時甚至更久。

目前 Anthropic 目錄上的內容是 Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5,每一項都以供應商定價轉嫁,零加成,因此 Anthropic 所做的任何降價,在他們那邊生效的同一天就會落到我們這邊。對任何現在就想測試子代理模式的人來說,這就是實際的橋樑:一條把例行回合送往 Haiku 4.5、並將困難的回合向上升級的串接流程,今天就能運作,只需一組金鑰和一個 SDK,而日後把小段換成 Haiku 5.5,只是改動模型 ID,而非進行遷移。無論你選擇哪些環節,底下都有自動容錯移轉,因此單一供應商狀況不佳的午後,不會把整條管線一起拖下水。

如果你完全不想等待,同樣的 $0.10 輸入價位帶已由 GPT-6 Luna 佔據,而我們確實有將其納入路由,且該費率一路維持到 272,000 個 token 才調升。

誰應該搬家,誰不應該

如果你的工作負載是大量的分類、擷取、路由、壓縮或摘要,而且你的提示詞低於 100,000 個 token,那麼情況很簡單:費率是原來的十分之一,視窗寬了五倍,而努力程度旋鈕讓你能在請求需要時往另一個方向取捨。預算抓大約低 75%,你就不會大吃一驚。

如果你的提示詞經常超過 100,000 個 Token,你買到的是 50% 的降幅,而不是 90% 的降幅;而深度脈絡的比價仍值得花上一個下午——這個領域已有數個模型的價格,等於或低於此級距超過 100K 的費率。

而如果你的評估在 Terminal-Bench 型態的工作上仍然失敗,這就不是能修正它的模型;Ant​hropic 自己也這麼說,而 39.2% 對比 Sonnet 5.5 的 70.6%,是這篇文章中最明確的證據。對 10 月 7 日最誠實的總結是:有用智慧的下限大幅下降,上限則完全沒有移動。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新