
Claude Sonnet 5.5:30% 成本宣稱,以及六項會破壞 Sonnet 5 程式碼的變更
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
Claude Sonnet 5.5於 2026 年 9 月 28 日推出,費率與Claude Sonnet 5完全相同——每百萬輸入 token 2 美元、每百萬輸出 token 10 美元、每百萬快取讀取 0.20 美元——而 Anthropic 的公告卻以「在大多數工作上執行速度快 30% 以上,成本最多降低 30%」為主打。這兩種說法都為真,而兩者之間的落差正是整件事的重點。省下的錢並不在價目表上,因為價目表根本沒動。它們來自以比前代所需更低的 effort 設定來執行模型,這意味著 30% 這個數字,是關於你必須自行選擇的運作點的主張,而不是你會自動繼承的價格。獨立測量讓這個分岔更加鮮明:在 Artificial Analysis 上,Claude Sonnet 5.5在最大 effort 下,於 Intelligence Index 上每項任務成本為7.60 美元,而5.09 美元則是Claude Sonnet 5在最大 effort 下的數字——大約 49% 更多,而非少 30%。這並不與 Anthropic 的數字矛盾。它是同一條曲線的另一端,而且如果沒有人重新跑一次 effort 掃描,大多數遷移預設都會落在這裡。
兩個主張假借同一數字
Anthropic 的文章在三處提出每項任務的宣稱,而每一處都倚賴 effort(投入程度)。最強的說法是:在 Terminal-Bench 4.0 上,以 Medium effort——Claude 應用程式中的預設值——Sonnet 5.5「以不到十分之一的每項任務成本,遠超 Sonnet 5 的最佳分數」。在 AA-Briefcase v1.1 上,以 Medium effort,它以大約九分之一的成本勝過 Sonnet 5 的最佳表現。在 CursorBench 4.0 上,以 Low effort,它以不到十分之一的成本超越 Sonnet 5 的最佳表現。
把這些當成一組來看,機制就顯而易見。Sonnet 5.5 的下限在若干評估上高於 Sonnet 5 的上限。你不是靠每 token 付得更少來得到那 30%,而是靠不再需要昂貴的設定來得到。Anthropic 在遷移文件中也是這麼說的,就在行銷說法的隔壁一頁:「努力程度已重新校準。某個努力程度所產生的思考量,已不同於它在 Claude Sonnet 5 上的表現。請重新執行你的努力程度掃描,而不是把某個設定直接沿用過來。」
那句話是Anthropic本週發表過、在營運上最為關鍵的一句話,卻偏偏是大多數發布報導中沒能寫進去的一句。
Anthropic 發布的內容——廠商自行報告、未經重現
本節中的所有內容都是 Anthropic 自己的量測,來自 Sonnet 5.5 的發布公告與系統卡。這是廠商的主張,不是獨立結果,而註腳脈絡與頭條數字同樣重要。
• Terminal-Bench 4.0(代理式編碼)—— Sonnet 5.5 為 70.6%,對比 Sonnet 5 的 10.3%。在被引用最多次的那一列上,這是足足七倍的躍升,也是大多數報導開頭所引用的數字。
• FrontierCode 1.1 (Main) — Sonnet 5.5 在 Xhigh 為 52.1%,在 Max 為 46.2%;Sonnet 5 為 42.4%;Claude Opus 5.5 為 54.4%;GPT-6 Sol 為 49.3%。請注意這個反轉:Sonnet 5.5 在 Max 的得分低於在 Xhigh 的得分
• CursorBench 4.0 — Sonnet 5.5 為 55.5%,Sonnet 5 為 34.1%,而 Opus 5.5 為 57.8%。CursorBench 4.0 並未公開公布 GPT-6 Sol 的成績。
• GDPval-AA v2.1(知識工作)— Sonnet 5.5 1844 Elo、Sonnet 5 1449、Opus 5.5 1846、GPT-6 Sol 1487。
• AA-Briefcase v1.1 — 在相同的四個模型上分別為 1811 / 1359 / 1822 / 1483。
• Humanity's Last Exam(使用工具)——64.5% / 54.9% / 67.7%。
• OSWorld 2.1(電腦操作,部分計分)— 80.1% / 57.0% / 81.8%。
• Chartography(視覺圖表辨識,不使用工具)— 61.6% / 15.6% / 64.4% / 53.6%.
有三個註腳應該跟著那些橫列一起走,而不是擺在它們下面。首先,Terminal-Bench 4.0 中 Opus 5.5 的 66.4% 數字,是在 Xhigh 推理強度下回報的,那是 Opus 5.5 得分最高的設定。第二,FrontierCode Max 的倒掛現象可以解釋:在 Max 模式下,Sonnet 5.5 更常執行 Claude Code 的程式碼審查 skill,而該 skill 會把審查工作拆分給許多子代理,其中有兩次造成了逾時,或產生超出任務範圍的編輯——即使這些變更是好的,FrontierCode 仍會懲罰超出範圍的變更。第三,而這點對廠商來說最不好受:Artificial Analysis 是在一個 預先發布版的 Sonnet 5.5 部署上執行 GDPval-AA 與 AA-Briefcase,Anthropic 表示該版本有個會讓結構化輸出請求的回應品質變差的錯誤。Anthropic 預期影響不大,且會低估 Sonnet 5.5,並表示該錯誤已修復。它還指出,OpenAI 最近修復了 GPT-6 Sol 的一個圖像理解錯誤,因此那些橫列中的 GPT-6 Sol 數據可能尚未反映目前的模型。

獨立運行對同一模型的說法
Artificial Analysis 已實測 Sonnet 5.5,且其頁面標明了確切配置:"Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)"。在該索引的同一修訂版本中,此類別有 216 個模型:
• Claude Sonnet 5.5 — 智慧指數 56,排名 216 個中的第 3 名。每項指數任務成本為 $7.60。在指數執行期間,它產生了 4.1 億個輸出 token,而中位數為 8,800 萬。
• Claude Sonnet 5 — 指數 38,在 216 個中排名第 58,於其標示為「(自適應推理,最大努力)」的專屬頁面上。每項任務成本 $5.09。370M 輸出 token
• Claude Opus 5.5 — 指數 58,在 216 個中排名第 1。每項任務 $5.98。每秒輸出 95.3 個 token。
• GPT-6 Sol — 指數 48,在 216 個中排名第 20,定價為 $2/$10。每項任務 $1.06,每秒輸出 89.8 個 token。
智力指數的差距——56 對 38,十八分——是本文中最強而有力的獨立佐證,也是讀者真正應該帶走的數字。成本數字則是那個需要附加但書的部分,而這點值得確切說明:這兩個數據點都是最高投入的設定,而在一個推理時間更長的模型上採取最高投入,是刻意選擇站在昂貴的位置。Sonnet 5.5 在該指數測試中燒掉了 4.1 億個 token,而 Sonnet 5 燒掉了 3.7 億個,兩者都遠高於 8,800 萬的中位數。一個在最高設定下思考更久的模型,在最高設定下成本就更高。這個數字所推翻的,不是「每項任務更便宜」,而是任何把它解讀為模型本身的屬性、而非設定所致屬性的讀法。
Artificial Analysis 尚未公布 Sonnet 5.5 的輸出速度數據——其頁面上的每秒輸出詞元(Output tokens per second)標示為 N/A,相較之下 Sonnet 5 為 78.7、Opus 5.5 為 95.3。因此,Anthropic 所宣稱「快 30% 以上」的那一半,目前僅屬廠商自行回報的數據。在有第三方實測之前,請將其視為方向性參考。

節省實際上從何而來,以及如何取得
如果你接受這個機制,遷移指示就會自己寫好,而 Anthropic 已經發布了它們:
• 預設請從 high 開始,而不是沿用你 Sonnet 5 設定裡寫的任何值。Anthropic 的建議是使用 high,除非你的工作負載屬於代理式(agentic)或對延遲敏感。
• 代理式編碼與多步驟工具使用——規格明確的任務從「中等」開始,較困難或較長的任務則調高至「高」。
• 聊天和其他延遲敏感的工作——從中等或低開始。 「成本只要十分之一」這類說法,就落在這個區間。
對於為什麼較低的設定能奏效,有一個前後一貫的解釋,而且這不是行銷話術。Anthropic 的早期測試者回報,Sonnet 5.5 比 Sonnet 5 更常將工具呼叫批次處理在一起,因而讓每項任務的步驟更少。CodeRabbit 在公告中的說法,就一則發表引述而言異常具體:Sonnet 5「過於頻繁動用網路搜尋的傾向,以及其高 token 用量,在這款新模型中都不復存在。」Sonnet 5.5 也沿用與 Sonnet 5 相同的分詞器,因此相同的文字會花費相同的 token——減少的是回合數與多餘的呼叫次數,而不是更便宜的詞彙。這也意味著你日誌中的 token 計數在升級前後仍可互相比較,讓前後對照的測量變得直接明瞭。
六項會破壞或改動 Sonnet 5 程式碼的變更
這是此版本中最耗費工程時間的部分,而這也正是遷移指南比基準測試圖表更有價值之處。六個之中有五個會傳回硬性錯誤;第六個則會靜默失敗。
• thinking: {"type": "disabled"} 現在會回傳 400。替代方案是 thinking: {"type": "between_tools"},它會關閉前置思考,是此模型上最低的思考設定。它可在低、中、高強度下運作,不需要 beta 標頭,且每個提供 Sonnet 5.5 的平台上都能使用。在 xhigh 或 max 強度下,between_tools 本身會回傳 400 —— 若你需要這些等級,請改用自適應思考(省略該欄位,或傳送 {"type": "adaptive"})。使用 between_tools 時,你也無法在對話中途變更強度。
• 不支援強制使用工具。 將 tool_choice 設為 {"type": "any"} 或 {"type": "tool", "name": "..."} 會傳回 400,並顯示訊息「tool_choice: 此模型不支援 type 'tool' 和 'any'。」同樣的檢查也適用於 token 計數端點。針對符合結構描述的輸入,文件記載的替代方案是將 tool_choice 設為 {"type": "auto"},並在工具上設定 strict: true,或將結構描述移至結構化輸出。
• 思考區塊會綁定至模型與對話。 Sonnet 5.5 會讀取來自 Sonnet 5、Opus 4.8、Haiku 4.5 及更早版本的思考區塊——而非來自 Opus 5、Opus 5.5,或任何 Fable 或 Mythos 模型。其他模型皆不會讀取 Sonnet 5.5 的區塊。將對話從 Sonnet 5 移至 5.5,推理內容會保留下來;將它從 Sonnet 5.5 移至其他任何模型,之後的回合便會在沒有這些內容的情況下執行。另外,API 現在會檢查自產生思考區塊以來,系統提示、工具清單或先前的訊息是否有所變更;而在 2026 年 8 月 31 日當天或之後建立的帳戶上,若確實有變更,便會傳回 400。請讓對話保持僅可附加,或一併送出 thinking-binding-controls-2026-08-01 beta 標頭,並帶有 prefix_mismatch_behavior: "drop_block"。
• computer_20251124 在 Claude API 和 Google Cloud 上遭到拒絕。在這些平台上,電腦操作功能需要使用 computer_toolset_20260801 工具集。Amazon Bedrock 仍接受較舊的工具——如果你在同一個代理程式上同時運行於這兩個平台,這是個值得留意的平台差異。
• 部分顧問配對已移除。 Sonnet 5.5 執行器接受 Mythos 5.1、Fable 5.1、Mythos 5、Fable 5、Opus 5.5、Opus 5 或 Sonnet 5.5 本身作為顧問。Opus 4.8、Opus 4.7 與 Sonnet 5 顧問可搭配 Sonnet 5 執行器運作,但搭配 Sonnet 5.5 執行器時會傳回 400。Sonnet 5.5 所接受的每個顧問都會以加密形式傳回建議,因此你的用戶端無法讀取建議文字。
• 工具呼叫之間的文字,現在會以思考區塊的形式送達——而在預設顯示「omitted」下,它是空的。 這是無聲的那一種。工具呼叫之間超過一兩句的註記,會以進度更新思考區塊的形式回來,而不是以文字形式。若應用程式將那段敘述串流給使用者,就會在工具呼叫之間靜默下來,沒有錯誤,日誌裡也什麼都沒有。修正方法是要麼設定 thinking.display,讓文字被傳回;要麼改用 between_tools,如此一來,文字就會以一般文字的形式回來。
遷移還會觸及的另外兩件事,兩者都不是錯誤。監控拒答:Sonnet 5.5 會回傳 stop_reason: "refusal",並附帶一個 stop_details 物件,指出五個政策領域之一——cyber、bio、frontier_llm、reasoning_extraction、general_harms——而 Anthropic 的伺服器端備援會針對 cyber 與 frontier_llm 的拒絕在 Sonnet 5 上重試,但不會重試其他三類。而且安全態勢確實改變了:Sonnet 5.5 是首個像 Opus 等級一樣搭載網路安全防護與備援機制的 Sonnet 模型,這表示風險較高的網路安全請求會明顯退回由 Sonnet 5 處理,也是首個具備反推理擷取分類器的 Sonnet。如果你的產品價值主張是安全性工具,在推出模型替換前,先測試那條界線。
定價,以及今天我們路線上真正有的是什麼
費率表與 Sonnet 5 相比維持不變,而其完整公布的形式簡短到足以直接說明:
• 輸入——每百萬個 token 收費 $2.00。輸出——每百萬個 token 收費 $10.00。兩者均與 Sonnet 5 相同,並已在 Anthropic 的 Sonnet 5.5 模型頁面上確認。
• 快取讀取 — 每百萬 $0.20,輸入可享 90% 折扣;5 分鐘快取寫入 每百萬 $2.50;1 小時快取寫入 每百萬 $4.00。Sonnet 5.5 的最小可快取提示為 512 個 token,低於 Sonnet 5 的 1,024 個。
• 批次 — 雙向皆享 5 折,因此每百萬為 $1.00 / $5.00。在 Message Batches API 上,使用 output-300k-2026-03-24 beta 標頭時,輸出可達 300K 個 token。
• 相較於 Opus 5.5 — Sonnet 5.5 正好是一半:$2/$10 對上 $4/$20,快取寫入費用為一半,快取讀取則同為 $0.20。這正是划算的遷移,而 Anthropic 也直言不諱:當 Sonnet 以較低強度運行時,這兩個模型最能相輔相成,而 Opus「在需要持續判斷的複雜、開放式工作上依然明顯更強」。
• 脈絡與輸出 — 1M 詞元脈絡、128K 最大輸出,預設啟用自適應思考,預設努力程度為高,可靠的知識截止時間為 2026 年 6 月,可提供零資料保留,退役時間不早於 2027 年 9 月 28 日。
有一點關於可用性的說明,我們寧願明說,而不願只用暗示:截至 2026 年 9 月 29 日,Claude Sonnet 5.5 並不在我們的模型目錄中。 它的前代 anthropic/claude-sonnet-5與體型更大的同系列型號 anthropic/claude-opus-5.5都在目錄中,而我們這邊的費率就是供應商自身提供的價格——Sonnet 5 為 $2.00 輸入、$10.00 輸出、$0.20 快取讀取、$2.50 快取寫入,未加收任何加成,因此供應商一調價,當天就會在我們這裡生效,而不是等到下一個計費週期。最後這項特性,正是讓費率表的解讀具有實用價值、而非只是裝飾的原因。

你今天可以用這個做什麼
對已經在正式環境中運行 Claude Sonnet 5 的團隊來說,誠實的推進順序共有三個步驟,而其中沒有任何一步是「把模型字串換掉,然後看著圖表變化」。
首先,重新執行 effort 掃描。如果你因為品質標準所需,而從 Sonnet 5 沿用 high 或 max 設定,那麼你現在正為不再需要購買的推理付費。獨立的每項任務成本數據顯示,階梯頂端變得更昂貴,而不是更便宜,而且供應商自己的成本說法都只描述了其中間區段。第二,在部署前修正兩條錯誤路徑——停用思考與強制工具使用——因為兩者都會立即且大聲地失敗,這是好消息。第三,留意敘述路徑,因為它會靜默失敗。
如果該模型還沒出現在你使用的路由上,低風險的評估方式是讓它與現有模型並行運行,而不是取而代之:把 Sonnet 5 固定為同一把金鑰上的備援,這樣一來,遇到拒絕、逾時或評估結果不佳時,請求就會被送往你已經信任的模型,而自動容錯移轉會完成整個迴路,無須再進行第二次整合。這就是為何要在單一端點背後、而非在使用者面前評估一個未經證實的模型——而在這裡,這個道理更成立了兩次,因為 Sonnet 5.5 的拒絕類別是全新的,而且它的 effort 校準明確與前代不同。當你準備好要更換預設模型時,同一把金鑰上的陣容可運行超過 200 個模型,這讓比較變成單純的設定變更,而不是再簽一份合約。
看什麼
有三件事將為這篇文章中懸而未決的問題給出答案,而這三件事都尚未發生。
獨立的輸出速度測量是第一項。Anthropic 聲稱比 Sonnet 5 快 30% 以上;Artificial Analysis 尚未公布 Sonnet 5.5 的數據,而這項說法在成本論述中確實發揮作用,因為更快的模型能用更少的實際時間完成同樣的任務,而且往往用更少的 token。Claude Haiku 5.5 是第二項——Anthropic 表示它將在「未來幾週內」推出,並且會位於 Sonnet 5.5 之下,這改變了高流量聊天區間的盤算,因為在該區間中,中等與低推理強度已讓 Sonnet 5.5 具備競爭力。第三項是修正作業:Artificial Analysis 在一份帶有結構化輸出錯誤的預發布版本上執行了 GDPval-AA 與 AA-Briefcase,Anthropic 預期這些分數會低估該模型,而這兩個數字都尚未重新跑過。如果它們上調,與 Opus 5.5 之間的知識工作差距會進一步縮小,「價格只要一半」的論點也會更站得住腳。
在那之前,站得住腳的摘要比公告來得窄,卻比基準圖表更有用。Claude Sonnet 5.5 在獨立指數上比 Sonnet 5 高出十八點智慧,且維持相同的公布費率;任何人只要沿著努力階梯往下調,就能獲得真實且可衡量的節省——而任何不這麼做的人,則會付出真實且可衡量的代價。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
