
Claude Sonnet 5.5 於 Claude 與 API 推出——帶來五項會破壞現有程式碼的變更
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 348 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 107 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
Claude Sonnet 5.5 已上線。供應商的公告日期為 2026 年 9 月 28 日,Claude Platform 模型頁面將其列為「Latest」,而識別碼是 claude-sonnet-5-5,涵蓋 Claude API、Amazon Bedrock、雲端主控台、Microsoft Foundry 以及 AWS 上的 Claude Platform。對 Claude 本身與 API 的推出,是本週正在進行的部分。會讓你耗上一整天的部分,則在同一份文件的其他地方:五項破壞性變更會影響已在 Claude Sonnet 5 上執行的程式碼,而第六項會改變回應結構,卻不會讓任何單一請求失敗。
這就是這次發布的樣貌。價目表並沒有變動:Claude Sonnet 5.5 每百萬輸入 token 要價 2 美元、每百萬輸出 token 要價 10 美元,與 Claude Sonnet 5 完全相同,快取讀取為 0.20 美元,五分鐘快取寫入則為 2.50 美元。能力倒是大幅躍進。在 Artificial Analysis 目前的版本中,新模型比它所取代的模型高出 18 分,這是該榜單上兩個連續 Sonnet 模型之間最大的差距。遷移成本也相應地是最大的。這一切都不是抱怨——一個變得更好卻沒有變得更貴的模型,是理想的情況——但這兩件事是一起到來的,而發布說明正是決定你這一週是否順遂的那一半。
9月28日實際上發布了什麼

規格是該層級的直線延續,而非新的形狀:
• 模型 ID — claude-sonnet-5-5在 Claude API、AWS 上的 Claude Platform 與 Microsoft Foundry 上;anthropic.claude-sonnet-5-5在 Amazon Bedrock 上
• 價格 — 每百萬輸入詞元 $2、每百萬輸出詞元 $10、五分鐘快取寫入 $2.50、一小時快取寫入 $4、快取讀取 $0.20
• 批次 — 雙向皆五折,即每 MTok $1 / $5
• 上下文與輸出 — 輸入 1M 個 token,同步輸出 128K 個 token,而 300K 的輸出則在 Message Batches API 上,於 output-300k-2026-03-24 beta 標頭之後
• 思考 — 自適應,預設強度為 高;知識與訓練截止時間均為 2026 年 6 月
• 生命週期 — 自上線起零資料保留,且已公布退役下限為不早於 2027 年 9 月 28 日
有兩個細節很容易被忽略,卻相當重要。第一,沒有長脈絡附加費:Anthropic 對完整的 100 萬 token 視窗一律按標準費率計費,因此一筆 900,000 token 的請求,每 token 的費用與一筆 9,000 token 的請求相同。第二,前一款模型 $2 / $10 的費率原本是導入期優惠價,並排定於 2026 年 9 月 1 日調漲至 $3 / $15;Anthropic 的定價頁面現在表示這項調漲不會發生,這使得 Sonnet 層級的現行價格成為長期承諾,而非促銷方案。這兩點都是供應商自己的說法,並非獨立查證的結果。
遷移清單,按它會咬人的順序
Anthropic 的 Sonnet 5.5 總覽對此異常直白:五項破壞性變更會影響已在 Claude Sonnet 5 上執行的程式碼。它們並非風格問題。每一項都會傳回錯誤,或悄悄改變行為。
• 強制工具使用會被拒絕。現在,tool_choice 設為 "any",或設為指定工具名稱時,會傳回錯誤,而不是限制模型。如果你的 agent 迴圈會固定使用某個工具來保證結構化呼叫,該迴圈會在第一個請求時就停止運作。替代做法是讓模型自行選擇並驗證結果,或將保證移到結構化輸出中。
• thinking: {"type": "disabled"} 會被拒絕。 直接關閉 thinking 已不再是受支援的設定。替代方案是 between_tools,它會關閉預先思考,並可在 high effort 或以下運作。這是模型上最低的 thinking 設定,而不是關閉開關。
• 思考區塊會綁定至模型與對話。前一輪產生的推理內容會從 Claude Sonnet 5 延續至 Claude Sonnet 5.5,但不會傳遞到其他系列,也不會跨帳戶延續。若應用程式在不同模型版本之間重播對話紀錄,將會發現在先前可被接受的思考區塊遭到拒絕。
• computer_20251124 在 Claude API 或 Google Cloud 上均不被接受。宣告使用舊版電腦操作工具的程式碼必須改用目前的工具組。
• 顧問工具會拒絕自家家族成員。Claude Opus 4.8、Claude Opus 4.7 與 Claude Sonnet 5 都被拒絕擔任顧問,因此任何以較小的 Claude 模型來檢查較大模型的流程,都需要重新配對。
接著還有一種不會造成任何失敗的變更。模型在工具呼叫之間輸出的文字,現在會出現在 thinking 區塊內,而不是當作一般輸出。若應用程式會將文字串流給使用者,在工具呼叫之間會變得一片安靜——沒有錯誤、沒有例外,只有一個看似停滯的 UI,直到你設定某個會把文字傳回的 display 值,或改用 between_tools。這是最可能進入正式環境的失敗模式,因為測試套件裡沒有任何東西會拋出例外。
再補充一點,為了完整起見:將 temperature、top_p 或 top_k 設為任何非預設值都會回傳 400。如果你的閘道或用戶端程式庫出於習慣而非刻意設定 temperature,這個習慣現在就會導致服務中斷。
30% 的說法,對照獨立數字

Anthropic 為 Claude Sonnet 5.5 主打的宣傳說法是,在每 token 費率相同的情況下,它「每項任務的成本比前代最多低 30%」,而且它「產生輸出的速度比 Claude Sonnet 5 快 30% 以上」。這兩項都是關於 token 而非價格的說法,而且兩者都是廠商自行報告的。第一項說法背後的機制,在廠商自家的基準測試表中就看得出來:在 Terminal-Bench 的 Medium effort 設定下,Anthropic 表示 Claude Sonnet 5.5 以「每項任務不到十分之一的成本」勝過 Claude Sonnet 5 的最佳分數,並對 CursorBench 在 Low effort 及 AA-Briefcase 在 Medium 下做出類似的宣稱。
這份獨立評估在方向上一致,但在幅度上不一致。在 Artificial Analysis 的 v4.3.2 智慧指數上——十項評估,以單一配置對每個模型執行——Claude Sonnet 5.5 得分 56,該頁面將其列為 216 個模型中的第 3 名。Claude Sonnet 5 在同一榜單上得分 38。這是同一層級、同一價格的兩個相鄰模型之間 18 分的變動,也是 Anthropic 今年在 Sonnet 系列內拉開的最大差距。
成本數字正是廠商說法較難站得住腳的地方。Artificial Analysis 測得 Claude Sonnet 5.5 每完成一項 Intelligence Index 任務的成本為 7.60 美元。這個數字並沒有比同級任何模型低 30%,因為該模型極度冗長:它輸出了 4.1 億個 token 才完成 Index 評估,而可比模型的中位數為 8,800 萬個。每個 token 的效率和每項任務的效率是兩回事,而 Claude Sonnet 5.5 在前者異常出色,在後者則僅屬平均。
Anthropic 在此次發布中自家提供的所有基準測試數據,都是由廠商自行提報,且未經第三方重現;其中兩項數據帶有值得重述的註腳:GDPval-AA v2.1 與 AA-Briefcase v1.1 的數字,是由 Artificial Analysis 在一個可能低估分數、帶有錯誤的預發布部署上執行;而 Anthropic 對其 FrontierCode 1.1 數據的說明,則解釋了為何 Claude Sonnet 5.5 在該評估中於 Max effort 下的分數低於 Xhigh。當一張表中模型在較低 effort 設定下反而勝過自己,這張表就是在告訴你:其基準測試配置尚未底定。
如何在不把生產路徑押在它上面的情況下測試它?
在遷移時,透過路由器來執行 Claude Sonnet 5.5,而不是直接對接廠商端點,有一個具體理由:在摸索的過程中,你不必在舊模型與新模型之間二選一。在 OrcaRouter 上,Claude Sonnet 5 自 6 月 30 日起即可路由,價格就是 Anthropic 自家的 $2 / $10,且沒有額外加價,它是單一 OpenAI 相容端點後方 200 多個模型之一,而且至今仍是大多數 Claude API 流量所跑的模型。Claude Sonnet 5.5 還沒納入我們的目錄,所以目前要使用它的途徑是 Anthropic 自家的 API。
在此期間可行的做法,是把一部分流量導向新模型,讓其餘流量交給容錯移轉來承接——並以 Claude Sonnet 5 作為備援,如此一來,五項破壞性變更中任一項所引發的 400 錯誤,只會退化成較慢的回應,而不是失敗的請求。這同時也是衡量廠商說法沒告訴你的事最省錢的方法:在相同的 effort 設定下,你自己在兩個模型上每個任務的 token 用量。那個 30% 的數字是 Anthropic 自家評估的平均值;你的流量並不是那個平均值。
接下來會是什麼
Anthropic 的公告表示,Claude Haiku 5.5 會在「未來幾週內」加入這個家族,屆時將完成小型層級的 5.5 世代。在那之前,對在正式環境中執行 Sonnet 的團隊來說,眼前的兩個決策可以分開處理:遷移是一天就能完成、可以排定時程的工作,而模型替換則是一項可以延後進行的量測。若以相反順序進行——先替換模型,卻在正式環境中發現強制工具使用錯誤——這種推行方式會讓你賠上一個週末。

