為 Claude Sonnet 5.5 與 Claude Sonnet 5 生成的主視覺標題卡,副標題為「價格相同,帳單不同」,兩側分別顯示每百萬個 token 為 $2.00 與 $10.00,下方則有分歧的每項任務成本數字,並將 OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Sonnet 5.5 與 Claude Sonnet 5:價格相同,帳單不同

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

來自同一家廠商的兩個模型,同一等級、同名,而且——在已公布費率表的每一行上——價格也相同。Claude Sonnet 5 於 2026 年 6 月 30 日推出,每百萬個輸入 token 為 2.00 美元,每百萬個輸出 token 為 10.00 美元。Claude Sonnet 5.5 於 2026 年 9 月 28 日正式全面推出,價格為 2.00 美元與 10.00 美元;兩者的快取讀取皆為 0.20 美元,五分鐘快取寫入皆為 2.50 美元。價格沒有任何改變。改變的是價目表無法衡量的一切,而結果是:這兩個模型其中一個的實際營運成本明顯低於另一個,儘管每個 token 的價格完全相同。Anthropic 自己為該發布所下的標題,幾乎但未完全明說這一點:在費率表不變的情況下,大多數工作最高可降低 30% 成本。這兩句話要同時為真,唯一可能就是較新的模型用更少 token 完成相同工作;這正是基準測試所顯示的,也是獨立逐項任務數據所證實的。

Claude Sonnet 5.5 比 Claude Sonnet 5 更貴嗎?

不——不過無論如何,這個問題都值得認真看待,因為有許多遷移之所以出錯,正是把固定費率表當成了固定帳單。

就每個 token 而言,這兩個模型完全相同:輸入 $2.00,輸出 $10.00,讀取快取的 token 要 $0.20,寫入一個則要 $2.50。沒有分段費率,也沒有長上下文附加費。無論較新的模型是什麼,它都不是包裝成新一代的漲價。

每完成一項任務,情況會因你所描述的是誰的工作負載而翻轉。Artificial Analysis 在相同的 Intelligence Index v4.3 測試套件上報告,Claude Sonnet 5 每項任務的成本為 5.09 美元,Claude Sonnet 5.5 則為 7.60 美元——在相同費率下,較新的模型完成一項任務要貴 49%。同一份報告指出,Sonnet 5.5 在整個測試套件中產出了 4.1 億個 token,而 Sonnet 5 為 3.7 億個;相較之下,受追蹤領域的中位數為 8,800 萬個。在評估者的開放式提示中,較新的模型單純就是寫得更多,而在相同價格下,更多 token 就代表更高的帳單。

Anthropic 便宜 30% 的說法,是廠商就其自行選定的工作負載所做的宣稱。第三方的 $7.60 對比 $5.09,則是在另一組資料上的測量結果。兩者都沒錯;這個分歧就是事情的全貌,而決定性因素在於你的任務是否會限制自身輸出。

兩代之間實際上改變了什麼?

價目表是靜態的,模型則不然。若以單一清單呈現,差異幅度很大,且大多為單向。

• Terminal-Bench 4.0 — Claude Sonnet 5.5 達到 70.6%,相較於 Claude Sonnet 5 的 10.3%,這是 Anthropic 在此測試上公布過最大的單一代際躍進

• CursorBench 4.0 — 55.5%,相較於 34.1%

• 圖表繪製,無工具 — 61.6% 對 15.6%

• GDPval-AA v2.1 — 1844 對 1449

• AA-Briefcase v1.1 — 1811 對 1359

• Humanity's Last Exam,使用工具 — 64.5% 對 54.9%

• OSWorld 2.1,部分完成 — 80.1% 對 57.0%

• Artificial Analysis Intelligence Index v4.3 — 56 對 38,在相同「Adaptive Reasoning, Max Effort」組態設定下以第三方量表測量,差距達 18 分

那份清單的樣態並非均勻的進展。Chartography 從 15.6% 升至 61.6%,Terminal-Bench 從 10.3% 升至 70.6%,看起來像是原本不具備、如今已具備的能力,而不是有所改善的能力。Humanity's Last Exam 提升十分、OSWorld 提升二十三分,而價格維持不變,這是一個填補特定缺口、而非整體變得更聰明的世代所展現的模式。那 18 點的指數差距,正是這件事的算術平均:真實、龐大,且集中在工具使用、程式碼執行與視覺工作上。

對於任何仔細閱讀廠商表格的人來說,有一個註腳值得注意。Anthropic 指出,在 FrontierCode 上,Max effort 配置的得分低於 Xhigh,並標示 GDPval-AA 和 AA-Briefcase 的執行是在帶有結構化輸出錯誤的預發布部署上進行的。上述數字仍是目前可取得的最佳數據,但請將其視為來自單一部署的快照,而非該模型的永久特性。

為什麼價格相同,帳單卻不一樣?

三個機制,依其對實際發票的影響程度由高至低排列。

第一點是輸出長度紀律。Sonnet 5.5 是能力更強的代理,這意味著它在回答前會做更多事;在沒有長度限制的測試套件上,它寫出的內容比 Sonnet 5 多約 11%,而每 token 成本相同。在會限制輸出量的工作負載上——例如擷取成固定結構描述、分類、有界摘要——那 11% 永遠不會出現,而 30% 的說法也就變得可信,因為優勢在於用更少的回合得出答案,而不是每回合用更少的 token。

第二點是快取行為,而這正是為什麼快取讀取價格不變,並不代表快取成本不變。快取讀取與寫入在兩個模型上的定價相同,因此快取 token 量的任何變化都會直接反映到帳單上。完成一項代理式任務所需回合較少的模型,讀取其前綴的次數也較少。這是一種背後完全沒有價格變動的節省,而且在任何只列出費率表項目的比較表中都看不見。

第三點是多數團隊在遷移當天最常出錯的地方:effort 預設值。Claude Sonnet 5.5 透過 effort 參數來設定推理,提供 low、medium、high、xhigh 和 max 等設定,在 Claude Platform 上預設為 high,在 Claude 應用程式內則預設為 medium。如果你原本是從固定了推理預算的 Sonnet 5 部署遷移過來,新的預設值深度可能與你原本付費購買的層級不同。在假設這是省錢或增加成本之前,先實際測量。

還有一個行為上的後果,值得在推出前而非推出後提出。Anthropic 表示,Claude Sonnet 5.5 是首個在網路安全防護與備援機制上,與其頂級模型享有同等地位的 Sonnet,因此風險較高的網路安全請求會明顯退回到先前的 Sonnet。你的日誌會顯示一個你並未要求的模型。相關地,如果你在停用 thinking 的情況下執行 Sonnet,你必須改用一種工具間行為——這是程式碼變更,不是旗標。

在 OrcaRouter 上,anthropic/claude-sonnet-5 今天就能以單一憑證、依供應商定價、0% 加價進行路由,並與 Claude Opus 5.5、Claude Opus 5、DeepSeek V4 Pro 及 Gemini 3.1 Pro Preview 並列。Claude Sonnet 5.5 本身在我們的平台上尚未成為可路由的項目,因此這項比較目前實際的形式是:已在執行 Sonnet 5 的團隊可以在它上架當天就衡量出差異,而不必動用任何 API 金鑰,同時還能在這段期間內透過更改一個字串,在各層級之間進行容錯移轉。

人們在轉換前會問的問題

我可以同時執行兩者,並用自己的流量來比較嗎?目前還無法透過單一 OrcaRouter 憑證做到,因為 Claude Sonnet 5.5 並不是已列出的路由。變通做法是:在 Anthropic 自家的 API 上執行較新的模型,並透過我們執行較舊的模型,然後比較每完成一項任務的 token 數,而不是每 token 成本,因為那才是兩個模型真正有差異的數字。

價格維持不變,是否代表 Anthropic 並未針對這項新能力收費? 這代表在模型持續進步的同時,定價維持不變,這與前兩代 Sonnet 的模式如出一轍。這種做法是否會延續下去,屬於商業問題,而非技術問題,而唯一附帶的承諾,就是已公布的退役時程——不會早於 2027 年 9 月。

我該相信哪個數字,Anthropic 的 30% 還是第三方的 49%?就一般性主張而言,兩者都不該相信。Anthropic 的數字描述的是模型能在較少輪次內得出答案的工作負載;Artificial Analysis 的數字描述的則是無約束的指標套件,在其中冗長程度可以自由增長。選擇那個與你的提示集相似者;如果你無法辨別是哪一個,這種模糊本身就是答案——去測量它。

總結來說

Claude Sonnet 5.5 並非漲價,但也不自動等於省錢。Anthropic 把價目表上每一行的價格都維持不變,卻把模型換到那張表底下,這意味著整個經濟效益的論證全繫於每完成一項任務所需的 token 數——而這個數字,在廠商自行挑選的工作負載上好上 30%,在獨立評測者挑選的測試套件上卻差了 49%。如果你的任務本身會限制自己的輸出量,那就切換過去,收下這份好處。如果不會,價格持平並不是跳過實測的理由,因為你可能得為每項任務多付五成的費用,換來一個在這份工作上明確更好的模型。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Sonnet 5 across eight rows. Both columns carry the identical rate card: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output. The rows that differ are AA Intelligence Index v4.3 score 56 for Claude Sonnet 5.5 against 38 for Claude Sonnet 5, $7.60 per task on the index run against $5.09, and Terminal-Bench 4.0 (vendor) 70.6% against 10.3%. The card heading reads "Identical rate cards, different bills: Claude Sonnet 5.5 against Claude Sonnet 5", and a footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Every price line is a tie by design: the two models share one rate card and differ only in what they emit to finish the same task."Screenshot of the OrcaRouter model page for Anthropic Claude Sonnet 5 (anthropic/claude-sonnet-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.24-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-06-30" line, and the $2.00 input and $10.00 output prices per million tokens.Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.