
每日 AI 簡報,10 月 8 日:Claude Haiku 5.5 以 $0.10 登場,Sonnet 5.5 快取讀取減半
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Haiku 5.5 於 2026 年 10 月 7 日推出,它是該公司歷來放在 API 背後最便宜的東西:在 prompt 最高達 100,000 個 token 的情況下,每百萬輸入 token 收費 $0.10,每百萬輸出 token 收費 $0.50,並具備 1M token 的上下文視窗,以及從 Low 到 Max 的努力程度設定。同一天,Claude Sonnet 5.5 的 prompt 快取讀取從每百萬 token $0.20 降至 $0.10,而這件事本身並沒有發布貼文。其中一項是產品,另一項則是支出項目,而這個支出項目才是本季會牽動更多錢的那一項。
先談價格,因為那是你今天就能採取行動的部分。接著是投入程度,那才是默默決定價格的關鍵。然後是快取費用調降,而付費使用 Sonnet 5.5 的人裡,有一半要到下一張帳單才會知道。
Claude Haiku 5.5 是什麼,依重要性排序
供應商自己的說法是「我們歷來推出過最便宜、最快且功能最強的小型模型」,而發布日期是 2026 年 10 月 7 日——比這份簡報早一天。模型 ID 是 claude-haiku-5-5。它能輸入文字與圖像,輸出文字。上下文視窗為 1,000,000 個 token,比 Claude Haiku 4.5 的 200,000 個有所提升,最大輸出為 128,000 個 token,而 Batch API 上的 beta 標頭可將其上調至 300,000。訓練截止日期為 2026 年 6 月,Anthropic 承諾在 2027 年 10 月 7 日之前不會將其退役。
對任何負責調度流量的人來說,最重要的一點並不是上下文視窗,而是這是首款具備可調整 effort 的 Haiku 等級模型。Effort 分為 Low、Medium、High、Xhigh 與 Max,預設為 Medium,而自適應思考預設為開啟——這項 Sonnet 與 Opus 才有的功能下放了一個層級。發布文章還提到兩件關於「購買」而非「打造」的事:Claude Max 與 Team 方案的每月 API 額度,Max 5x 為 100 美元、Max 20x 為 200 美元,Team 最多可彙整至 500 美元;以及 SDK 中對 beta 版電腦使用與瀏覽器使用的支援。安全防護也跟上了這個層級:網路安全防護比 Claude Haiku 4.5 更嚴格,滲透測試請求仍被封鎖,而生物安全防護則與 Claude Sonnet 5、Claude Sonnet 5.5 和 Claude Opus 5 一致。

價格,以及夾在中間那道 10 萬 token 的斷崖
公告費率是每百萬輸入詞元 $0.10、每百萬輸出詞元 $0.50。看清楚那個星號:那是提示在 100,000 詞元或以下的費率。超過 100,000 時,兩個數字都乘以五,變成輸入 $0.50、輸出 $2.50。快取寫入在五分鐘級距每百萬要 $0.125,在一小時級距、且位於低價區間內則為 $0.20,而快取讀取每百萬要 $0.01——是輸入費率的十分之一,這是 Anthropic 在任何模型上公布過最深的快取折扣。批次處理又讓一切再減半:低價區間內是 $0.05 和 $0.25,超過之後是 $0.25 和 $1.25。
將這與 Claude Haiku 4.5 相比,它仍在價目表上,輸入固定為 $1.00、輸出為 $5.00,沒有依上下文分層的定價,快取讀取為 $0.10,並有 200,000 個 token 的上下文窗口。新模型在相同提示形態下的價格只有其十分之一,上下文卻是其五倍。這裡沒有什麼遷移與否的算計需要做;算術上,兩者差距毫不接近。
懸崖正是設計時必須設法因應的部分。在輸入費率下,一個 99,000 個 token 的提示,每千次呼叫要價 99 美分。一個 101,000 個 token 的提示,每千次要價 5.05 美元。兩千個 token 的差距,帳單就是 5 倍,所以任何你建在低價區間上的東西,要嘛就安穩地遠低於 100,000 個 token,要嘛就刻意且一致地超過它——最糟的結果是一條管線剛好跨在那條線上,導致一半的流量得付高費率。
努力程度現在是一項定價參數,而預設值並非最便宜的。
因為 effort 預設為 Medium,而 thinking 預設為開啟,所以標價與實際價格並不是同一個數字。推理 token 會以輸出 token 計費。在 Anthropic 自行公布的 Artificial Analysis Intelligence Index 測試結果中——由廠商自行回報,我們並未重現——Claude Haiku 5.5 每個任務大約輸出 162,000 個 token,其中約 129,000 個是推理 token。該指數的中位數模型在整個測試套件中約輸出 1 億個 token;Haiku 5.5 則花費 4.4 億個。以每百萬輸出 token 0.50 美元計算,這種冗長程度仍可負擔,而這正是重點:以 Haiku 5.5 的費率,大量思考仍然比在一個輸出收費 5.00 美元的模型上少量思考更便宜。
在分類、擷取與路由決策上,若你想要的是快速答案而非深思熟慮的結果,就把 effort 設為 Low;至於任何使用者會讀到的內容,則維持在 Medium。降到 Low 也是讓冗長 agent 維持在 100,000 token 範圍內的可靠做法,因為它會先削減推理 token,之後才削減答案品質。
較低調的那一行:Sonnet 5.5 的快取讀取次數減半
Claude Sonnet 5.5 自 10 月 7 日起,讀取快取提示的價格為每百萬個 token $0.10,低於先前的 $0.20。Sonnet 5.5 的輸入價格是 $2.00,輸出價格是 $10.00,因此 0.05 倍快取讀取乘數如今與 Haiku 5.5 相同,卻套用在二十倍大的輸入費率上。Anthropic 自家估計,這能讓大多數代理式工作的成本降低約 20%;這是一項關於工作負載型態的說法,而非基準測試:唯有當你輸入中有很大一部分是你每一輪都不斷重新送出的穩定前綴時,這才成立。如果你的提示在每次呼叫時都獨一無二,這項變更既不會讓你多花錢,也不會替你省錢。
值得注意這波降價所隱含的意義。Anthropic 在中階模型上對長效前綴採取積極定價,而恰好就在此時推出極其便宜的小型模型,這讀來像是支持雙模型架構的論據:一條 Sonnet 5.5 路線搭配熱快取,負責需要判斷的工作;另一條 Haiku 5.5 路線,則負責不需要判斷的大量工作。
一天之後,獨立數據顯示了什麼
Artificial Analysis 在 Claude Haiku 5.5 發布隔天就給出了評分。其 Intelligence Index 總體讀數為 43,Max-effort 配置回報為 43.40,在榜上 182 個模型中排名第二。每個索引任務的成本為 $0.21,是第 46 便宜。以 7:2:1 的輸入對快取輸入對輸出混合計算,混合價格為每百萬 $0.08,這個數字讓先前的級別比較對其他所有模型都顯得有失公平。輸出速度為每秒 243.4 個 token,在榜上排名第九快,回報的首個 token 延遲約為 0.3 秒,並有 90% 的快取折扣。
那個 4.4 億 token 的輸出數字,是附在 43 分上的但書。分數是真的,而且是獨立跑出來的;冗長程度也是。一個思考這麼多的模型,每 token 成本低廉,但每項任務不一定便宜,而這兩個數字之間的落差,正是路由決策真正落腳之處。
為了有個規模概念,Anthropic 自己發布的比較中,Claude Haiku 5.5 在 GDPval-AA v2.1 上得到 1620,而 Claude Haiku 4.5 為 735;在 OSWorld 2.1 上為 72.4%,對比 15.7%;在 Humanity's Last Exam 無工具情況下為 45.9%,對比 10.2%;在 Terminal-Bench 4.0 上為 39.2%,對比 0.0%。這些是廠商自行報告、且在廠商自行選擇的評估上的數字,應以方向性指標來解讀,但方向並不隱晦——這不是小型模型的一次小幅升級。

無需第二份合約即可使用這些模型
Claude Haiku 5.5 可透過 Anthropic 自家的 API 取得,並由此延伸到任何轉售 Anthropic 模型的管道。在 OrcaRouter 的型號目錄中,Anthropic 系列目前提供 anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5 以及 anthropic/claude-fable-5.1——我們並不代管 Claude Haiku 5.5,而這份簡介也不會假裝並非如此。我們實際提供的是它之上的一個等級,而 OrcaRouter 以 0% 加成原樣傳遞供應商的定價,這正是為什麼 Sonnet 5.5 的快取讀取降價出現在我們的定價中,就在 Anthropic 做出這項調整的同一天,而不是等到排定的重新定價週期才反映。
實務版:如果你想在某個分類環節試用 Haiku 5.5,而判斷環節仍留在 Claude Sonnet 5.5,你手上就會有兩把金鑰而不是一把,而 A/B 的決定就落在路由層。這就是為什麼要用閘道而非直接整合的全部理由——單一端點、模型字串,以及供應商不穩時的容錯移轉路徑。

從這裡要關注什麼
三件事。第三方供應商是否會開始以低於 $0.10 的混合費率轉售 Haiku 5.5——這個價位正是路由層能真正體現價值,而不只是簡化採購的門檻。Anthropic 是否會延伸 100,000-token 的分層界線,因為對一個擁有 1M-token 視窗的模型來說,斷崖剛好落在 100,000 是很奇怪的事。以及 440-million-token 的冗長度數字是否會在某個點版本中下降,因為就是這單一數字,擋在 Haiku 5.5 與成為整個生產堆疊下半部顯而易見的預設選項之間。
