
Claude Sonnet 5.5 vs Claude Opus 5.5:基準測試趨同,帳單卻不然
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
Claude Sonnet 5.5 於 2026 年 9 月 28 日正式全面推出,每百萬個輸入符元 2.00 美元,每百萬個輸出符元 10.00 美元。Claude Opus 5.5,Anthropic 的旗艦模型,早了六天、在 9 月 22 日推出,價格為 4.00 美元與 20.00 美元——兩條價格線都恰好是兩倍。最直觀的解讀是:Opus 5.5 是上限,而 Sonnet 5.5 是當預算確實有限時所做出的妥協。Anthropic 自家的發布表格並不支持這種解讀。在公司公布的數字上,Claude Sonnet 5.5 在 GDPval-AA v2.1 拿下 1844,對上 Opus 5.5 的 1846;在 AA-Briefcase v1.1 是 1811 對 1822;在 Terminal-Bench 4.0 則是 70.6% 對 66.4%——它贏了那個衡量終端機內實際完成工作的基準測試。在那些數字下方兩行,Anthropic 自家的說明文字指出,Opus 5.5「在複雜、開放式的工作上仍明顯更強」。這兩種說法都為真,而設法同時成立地看待它們,正是這篇比較的主要用意所在。
發射表說了些什麼,以及它避而不談些什麼
Anthropic 基準測試區塊中的模式,是一個已經縮小了大部分差距的模型,而不是一個已經取得領先的模型。GDPval-AA v2.1,一個經濟加權的任務集,是兩分的平手。AA-Briefcase v1.1,一個文件與交付成果的評估,是十一分的平手。CursorBench 4.0 則相反:Sonnet 5.5 為 55.5%,對上 Opus 5.5 的 57.8%。OSWorld 2.1 為 80.1% 對上 81.8%,而 Humanity's Last Exam 使用工具時為 64.5% 對上 67.7%。只有 Terminal-Bench 4.0 打破了這個模式,而且打破得很徹底——70.6% 對上 66.4%,Sonnet 在代理式命令列工作上取得四分的優勢。
與其盯著數字,不如去看列標籤,就會浮現另一件事。那幾筆 Opus 5.5 的項目中,有幾項帶有 effort 註記——在 Xhigh 下為 66.4%——而一則註腳指出,在 FrontierCode 上,Max 設定的得分低於 Xhigh,而非更高。更高的 effort 並非單調遞增。一個精打細算的團隊若以為「最大 effort」是免費升級,那便是花錢買 token,換來至少一項 Anthropic 自家測試上更差的答案。而在 FrontierCode 1.1 上,同一則註腳指出 Sonnet 5.5 在 Max 設定下為 46.2%,對比 Opus 5.5 的 54.4%——這是旗艦機種仍在何處明顯拉開差距的最清楚單一數字:在獎勵持久性的任務定義之下所進行的長時程程式碼工作。
還有一點值得開門見山地說清楚,而不是把它埋起來。Anthropic 指出,其發布的 GDPval-AA 與 AA-Briefcase 測試是在一個預先發布的部署版本上執行,而該版本帶有結構化輸出(structured-outputs)錯誤。這會影響同一張表中的兩個模型,因此這項比較並未因此失效,但這確實意味著絕對數字應被視為一份快照,而非已成定論的結果。供應商的基準測試表是帶有方法論附錄的行銷產物,而這一份還附上了它的附錄。
獨立測量落在何處
Artificial Analysis 在單一測試框架下為兩個模型評分,採用其標示為「Adaptive Reasoning, Max Effort, Default Fallback」的相同配置,依據 Intelligence Index v4.3。Claude Opus 5.5 為 58 分。Claude Sonnet 5.5 為 56 分。在同一評分尺度上,這僅是兩分的差距,而同一位評測者給 Opus 5 的分數為 51、Sonnet 5 為 38、DeepSeek V4 Pro 為 36,Gemini 3.1 Pro Preview 則為 30。一款全新的 Sonnet 僅落後旗艦兩分,卻超前前一代 Opus 五分,這正是本次發布的實質主張,而且這是第三方的主張,而非廠商自身的主張。
接著,同一頁卻顛覆了這套經濟邏輯。Artificial Analysis 指出,Sonnet 5.5 的一次評估執行每項任務要價 7.60 美元,而 Opus 5.5 為 5.98 美元,儘管 Sonnet 5.5 每 token 的價格只有一半。原因就寫在那一頁上:Sonnet 5.5 在該索引套件中產生了 4.1 億個 token,而它所追蹤的模型的中位數為 8,800 萬個——用評估者的話來說,就是「極為冗長」。Opus 5.5 在同一套件中則產生了 2.6 億個。在每百萬輸出 token 分別為 10 美元與 20 美元的情況下,約 1.6 倍的冗長係數仍讓 Sonnet 5.5 每完成一項任務多付約 27%。
這是逐 token 價目表無法讓你看到的比較部分,也是這兩個數字能夠並存、彼此不矛盾的原因。以每個 token 計算,Sonnet 5.5 便宜了一半。以每個完成的任務計算,在一個提示開放式、且不講究輸出長度的評估套件上,它可能反而更貴。你的工作負載屬於哪一種情況,才是真正該做的決定。
投入程度、輸出上限,以及整合的樣貌
對買家而言,這兩款型號在機械方面的關鍵特性幾乎完全相同。
• 上下文 — 兩者皆為 1,000,000 個 token,且來自同一個供應商,因此提示工程的假設可原封不動地沿用
• 最大輸出 — 兩者皆為 128,000 個 token;批量生成在這裡並非差異化因素
• 模態 — 兩者皆支援文字、圖像與檔案輸入;兩者皆不接受音訊或視訊
• 推理控制 — 兩者皆採用自適應思考,深度由 effort 參數決定,而非由思考權杖預算決定。在 Claude 平台上,預設為高;在 Claude 應用程式內則為中。
• 快取寫入 — Claude Opus 5.5 每百萬 $5.00,對比 Claude Sonnet 5.5 的 $2.50,這是唯一一項,較便宜的模型同時也是餵入重建前綴時較便宜的那個模型
• 快取讀取 — 兩者皆為每百萬 $0.20,在長時間代理執行中佔主導地位的項目上完全打平
因為介面相符,所以它們之間的遷移只是模型字串的變更與工作量的重新評估,而不是一項整合專案。這在跨供應商之間並不常見,而這正是這個特定組合值得比較的根本原因:這兩個候選方案在價格和深度上不同,而不是在你必須撰寫的 API 上。
有一項運作上的差異值得單獨說明。Anthropic 表示,Claude Sonnet 5.5 是第一個在推出時,其網路安全防護與備援機制就與其頂級模型處於同等地位的 Sonnet,這意味著風險較高的網路安全請求會明顯被轉送到前一代 Sonnet,而不是由你指定的模型回答。如果你的工作負載涉及該領域,模型字串並不保證實際回應的是哪個模型——不論哪個層級都一樣。Anthropic 也指出,如果你在停用思考模式的情況下執行 Sonnet,就必須改用工具之間的行為(between-tools behaviour),這是程式碼變更,而不是設定旗標。這兩點都不是避開該模型的理由;兩者都是你在正式推出前應該先了解的原因。
在 OrcaRouter 上,Claude Opus 5.5 今天就能用與目錄中其他所有模型相同的憑證進行路由,以供應商定價、零加成提供,底層還具備自動容錯移轉機制。Claude Sonnet 5.5 目前還不是我們平台上的路由——這個模型才推出一一天,在它正式上架之前,誠實的說法是:你得透過 Anthropic 自家的 API 才能使用它。目前透過我們使用 Opus 5.5 的人,可以在它上架當天評估切換成本,而無須更動整合的其他任何部分。
哪一個要放在哪裡
從這些數字得出的分工:Claude Sonnet 5.5 適合終端機綁定的代理工作,在 Anthropic 自家的 Terminal-Bench 4.0 數據中,它是兩者中較強的一方,而且價格只要一半;Claude Sonnet 5.5 適合任何以吞吐量為導向的工作,因為成本差距只有在任務強制產生長輸出時才會縮小;Claude Opus 5.5 適合 FrontierCode 等級的工作、跨大型程式碼庫的長期重構,以及任何這樣的工作負載:54.4% 對 46.2% 的差距反映的是你實際問題的樣貌,而不是排行榜上的一列。
如果你的任務是開放式的,而且你無法預測輸出長度,就完全別把每 token 價格當成正確數字。在你決定採用哪種做法之前,先在你自己的流量上花一週測量每完成一項任務的 token 數;artificial-analysis 的 $7.60 對 $5.98 這項數據是個警告:便宜模型可能在你實際付費的指標上吃虧。
老實說:這已經不再是能力與成本之間的取捨。問題在於你的工作是否有界限。對於有界限、高產量、工具驅動的任務,根據現有證據,較便宜的模型同時也是較好的選擇,而旗艦模型不值得雙倍價格。對於開放式、長遠期的工作,Anthropic 自己的那句話——Opus 5.5 仍然明顯更強——才是該相信的,而再多的基準趨同目前也改變不了這一點。



