
Claude Sonnet 5.5 與 Claude Sonnet 5:價格相同,帳單不同
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
來自同一家廠商的兩個模型,同一等級、同名,而且——在已公布費率表的每一行上——價格也相同。Claude Sonnet 5 於 2026 年 6 月 30 日推出,每百萬個輸入 token 為 2.00 美元,每百萬個輸出 token 為 10.00 美元。Claude Sonnet 5.5 於 2026 年 9 月 28 日正式全面推出,價格為 2.00 美元與 10.00 美元;兩者的快取讀取皆為 0.20 美元,五分鐘快取寫入皆為 2.50 美元。價格沒有任何改變。改變的是價目表無法衡量的一切,而結果是:這兩個模型其中一個的實際營運成本明顯低於另一個,儘管每個 token 的價格完全相同。Anthropic 自己為該發布所下的標題,幾乎但未完全明說這一點:在費率表不變的情況下,大多數工作最高可降低 30% 成本。這兩句話要同時為真,唯一可能就是較新的模型用更少 token 完成相同工作;這正是基準測試所顯示的,也是獨立逐項任務數據所證實的。
Claude Sonnet 5.5 比 Claude Sonnet 5 更貴嗎?
不——不過無論如何,這個問題都值得認真看待,因為有許多遷移之所以出錯,正是把固定費率表當成了固定帳單。
就每個 token 而言,這兩個模型完全相同:輸入 $2.00,輸出 $10.00,讀取快取的 token 要 $0.20,寫入一個則要 $2.50。沒有分段費率,也沒有長上下文附加費。無論較新的模型是什麼,它都不是包裝成新一代的漲價。
每完成一項任務,情況會因你所描述的是誰的工作負載而翻轉。Artificial Analysis 在相同的 Intelligence Index v4.3 測試套件上報告,Claude Sonnet 5 每項任務的成本為 5.09 美元,Claude Sonnet 5.5 則為 7.60 美元——在相同費率下,較新的模型完成一項任務要貴 49%。同一份報告指出,Sonnet 5.5 在整個測試套件中產出了 4.1 億個 token,而 Sonnet 5 為 3.7 億個;相較之下,受追蹤領域的中位數為 8,800 萬個。在評估者的開放式提示中,較新的模型單純就是寫得更多,而在相同價格下,更多 token 就代表更高的帳單。
Anthropic 便宜 30% 的說法,是廠商就其自行選定的工作負載所做的宣稱。第三方的 $7.60 對比 $5.09,則是在另一組資料上的測量結果。兩者都沒錯;這個分歧就是事情的全貌,而決定性因素在於你的任務是否會限制自身輸出。
兩代之間實際上改變了什麼?
價目表是靜態的,模型則不然。若以單一清單呈現,差異幅度很大,且大多為單向。
• Terminal-Bench 4.0 — Claude Sonnet 5.5 達到 70.6%,相較於 Claude Sonnet 5 的 10.3%,這是 Anthropic 在此測試上公布過最大的單一代際躍進
• CursorBench 4.0 — 55.5%,相較於 34.1%
• 圖表繪製,無工具 — 61.6% 對 15.6%
• GDPval-AA v2.1 — 1844 對 1449
• AA-Briefcase v1.1 — 1811 對 1359
• Humanity's Last Exam,使用工具 — 64.5% 對 54.9%
• OSWorld 2.1,部分完成 — 80.1% 對 57.0%
• Artificial Analysis Intelligence Index v4.3 — 56 對 38,在相同「Adaptive Reasoning, Max Effort」組態設定下以第三方量表測量,差距達 18 分
那份清單的樣態並非均勻的進展。Chartography 從 15.6% 升至 61.6%,Terminal-Bench 從 10.3% 升至 70.6%,看起來像是原本不具備、如今已具備的能力,而不是有所改善的能力。Humanity's Last Exam 提升十分、OSWorld 提升二十三分,而價格維持不變,這是一個填補特定缺口、而非整體變得更聰明的世代所展現的模式。那 18 點的指數差距,正是這件事的算術平均:真實、龐大,且集中在工具使用、程式碼執行與視覺工作上。
對於任何仔細閱讀廠商表格的人來說,有一個註腳值得注意。Anthropic 指出,在 FrontierCode 上,Max effort 配置的得分低於 Xhigh,並標示 GDPval-AA 和 AA-Briefcase 的執行是在帶有結構化輸出錯誤的預發布部署上進行的。上述數字仍是目前可取得的最佳數據,但請將其視為來自單一部署的快照,而非該模型的永久特性。
為什麼價格相同,帳單卻不一樣?
三個機制,依其對實際發票的影響程度由高至低排列。
第一點是輸出長度紀律。Sonnet 5.5 是能力更強的代理,這意味著它在回答前會做更多事;在沒有長度限制的測試套件上,它寫出的內容比 Sonnet 5 多約 11%,而每 token 成本相同。在會限制輸出量的工作負載上——例如擷取成固定結構描述、分類、有界摘要——那 11% 永遠不會出現,而 30% 的說法也就變得可信,因為優勢在於用更少的回合得出答案,而不是每回合用更少的 token。
第二點是快取行為,而這正是為什麼快取讀取價格不變,並不代表快取成本不變。快取讀取與寫入在兩個模型上的定價相同,因此快取 token 量的任何變化都會直接反映到帳單上。完成一項代理式任務所需回合較少的模型,讀取其前綴的次數也較少。這是一種背後完全沒有價格變動的節省,而且在任何只列出費率表項目的比較表中都看不見。
第三點是多數團隊在遷移當天最常出錯的地方:effort 預設值。Claude Sonnet 5.5 透過 effort 參數來設定推理,提供 low、medium、high、xhigh 和 max 等設定,在 Claude Platform 上預設為 high,在 Claude 應用程式內則預設為 medium。如果你原本是從固定了推理預算的 Sonnet 5 部署遷移過來,新的預設值深度可能與你原本付費購買的層級不同。在假設這是省錢或增加成本之前,先實際測量。
還有一個行為上的後果,值得在推出前而非推出後提出。Anthropic 表示,Claude Sonnet 5.5 是首個在網路安全防護與備援機制上,與其頂級模型享有同等地位的 Sonnet,因此風險較高的網路安全請求會明顯退回到先前的 Sonnet。你的日誌會顯示一個你並未要求的模型。相關地,如果你在停用 thinking 的情況下執行 Sonnet,你必須改用一種工具間行為——這是程式碼變更,不是旗標。
在 OrcaRouter 上,anthropic/claude-sonnet-5 今天就能以單一憑證、依供應商定價、0% 加價進行路由,並與 Claude Opus 5.5、Claude Opus 5、DeepSeek V4 Pro 及 Gemini 3.1 Pro Preview 並列。Claude Sonnet 5.5 本身在我們的平台上尚未成為可路由的項目,因此這項比較目前實際的形式是:已在執行 Sonnet 5 的團隊可以在它上架當天就衡量出差異,而不必動用任何 API 金鑰,同時還能在這段期間內透過更改一個字串,在各層級之間進行容錯移轉。
人們在轉換前會問的問題
我可以同時執行兩者,並用自己的流量來比較嗎?目前還無法透過單一 OrcaRouter 憑證做到,因為 Claude Sonnet 5.5 並不是已列出的路由。變通做法是:在 Anthropic 自家的 API 上執行較新的模型,並透過我們執行較舊的模型,然後比較每完成一項任務的 token 數,而不是每 token 成本,因為那才是兩個模型真正有差異的數字。
價格維持不變,是否代表 Anthropic 並未針對這項新能力收費? 這代表在模型持續進步的同時,定價維持不變,這與前兩代 Sonnet 的模式如出一轍。這種做法是否會延續下去,屬於商業問題,而非技術問題,而唯一附帶的承諾,就是已公布的退役時程——不會早於 2027 年 9 月。
我該相信哪個數字,Anthropic 的 30% 還是第三方的 49%?就一般性主張而言,兩者都不該相信。Anthropic 的數字描述的是模型能在較少輪次內得出答案的工作負載;Artificial Analysis 的數字描述的則是無約束的指標套件,在其中冗長程度可以自由增長。選擇那個與你的提示集相似者;如果你無法辨別是哪一個,這種模糊本身就是答案——去測量它。
總結來說
Claude Sonnet 5.5 並非漲價,但也不自動等於省錢。Anthropic 把價目表上每一行的價格都維持不變,卻把模型換到那張表底下,這意味著整個經濟效益的論證全繫於每完成一項任務所需的 token 數——而這個數字,在廠商自行挑選的工作負載上好上 30%,在獨立評測者挑選的測試套件上卻差了 49%。如果你的任務本身會限制自己的輸出量,那就切換過去,收下這份好處。如果不會,價格持平並不是跳過實測的理由,因為你可能得為每項任務多付五成的費用,換來一個在這份工作上明確更好的模型。



