為 Claude Sonnet 5.5 對比 Claude Opus 5.5 生成的主視覺標題卡,副標題為「基準測試趨於一致,帳單卻不然」,左側顯示每百萬個詞元 $2.00 和 $10.00,右側則為 $4.00 和 $20.00,並將 OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5.5:基準測試趨同,帳單卻不然

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.5 於 2026 年 9 月 28 日正式全面推出,每百萬個輸入符元 2.00 美元,每百萬個輸出符元 10.00 美元。Claude Opus 5.5,Anthro​pic 的旗艦模型,早了六天、在 9 月 22 日推出,價格為 4.00 美元與 20.00 美元——兩條價格線都恰好是兩倍。最直觀的解讀是:Opus 5.5 是上限,而 Sonnet 5.5 是當預算確實有限時所做出的妥協。Anthro​pic 自家的發布表格並不支持這種解讀。在公司公布的數字上,Claude Sonnet 5.5 在 GDPval-AA v2.1 拿下 1844,對上 Opus 5.5 的 1846;在 AA-Briefcase v1.1 是 1811 對 1822;在 Terminal-Bench 4.0 則是 70.6% 對 66.4%——它贏了那個衡量終端機內實際完成工作的基準測試。在那些數字下方兩行,Anthro​pic 自家的說明文字指出,Opus 5.5「在複雜、開放式的工作上仍明顯更強」。這兩種說法都為真,而設法同時成立地看待它們,正是這篇比較的主要用意所在。

發射表說了些什麼,以及它避而不談些什麼

Anthropic 基準測試區塊中的模式,是一個已經縮小了大部分差距的模型,而不是一個已經取得領先的模型。GDPval-AA v2.1,一個經濟加權的任務集,是兩分的平手。AA-Briefcase v1.1,一個文件與交付成果的評估,是十一分的平手。CursorBench 4.0 則相反:Sonnet 5.5 為 55.5%,對上 Opus 5.5 的 57.8%。OSWorld 2.1 為 80.1% 對上 81.8%,而 Humanity's Last Exam 使用工具時為 64.5% 對上 67.7%。只有 Terminal-Bench 4.0 打破了這個模式,而且打破得很徹底——70.6% 對上 66.4%,Sonnet 在代理式命令列工作上取得四分的優勢。

與其盯著數字,不如去看列標籤,就會浮現另一件事。那幾筆 Opus 5.5 的項目中,有幾項帶有 effort 註記——在 Xhigh 下為 66.4%——而一則註腳指出,在 FrontierCode 上,Max 設定的得分低於 Xhigh,而非更高。更高的 effort 並非單調遞增。一個精打細算的團隊若以為「最大 effort」是免費升級,那便是花錢買 token,換來至少一項 Anthropic 自家測試上更差的答案。而在 FrontierCode 1.1 上,同一則註腳指出 Sonnet 5.5 在 Max 設定下為 46.2%,對比 Opus 5.5 的 54.4%——這是旗艦機種仍在何處明顯拉開差距的最清楚單一數字:在獎勵持久性的任務定義之下所進行的長時程程式碼工作。

還有一點值得開門見山地說清楚,而不是把它埋起來。Anthropic 指出,其發布的 GDPval-AA 與 AA-Briefcase 測試是在一個預先發布的部署版本上執行,而該版本帶有結構化輸出(structured-outputs)錯誤。這會影響同一張表中的兩個模型,因此這項比較並未因此失效,但這確實意味著絕對數字應被視為一份快照,而非已成定論的結果。供應商的基準測試表是帶有方法論附錄的行銷產物,而這一份還附上了它的附錄。

獨立測量落在何處

Artificial Analysis 在單一測試框架下為兩個模型評分,採用其標示為「Adaptive Reasoning, Max Effort, Default Fallback」的相同配置,依據 Intelligence Index v4.3。Claude Opus 5.5 為 58 分。Claude Sonnet 5.5 為 56 分。在同一評分尺度上,這僅是兩分的差距,而同一位評測者給 Opus 5 的分數為 51、Sonnet 5 為 38、DeepSeek V4 Pro 為 36,Gemini 3.1 Pro Preview 則為 30。一款全新的 Sonnet 僅落後旗艦兩分,卻超前前一代 Opus 五分,這正是本次發布的實質主張,而且這是第三方的主張,而非廠商自身的主張。

接著,同一頁卻顛覆了這套經濟邏輯。Artificial Analysis 指出,Sonnet 5.5 的一次評估執行每項任務要價 7.60 美元,而 Opus 5.5 為 5.98 美元,儘管 Sonnet 5.5 每 token 的價格只有一半。原因就寫在那一頁上:Sonnet 5.5 在該索引套件中產生了 4.1 億個 token,而它所追蹤的模型的中位數為 8,800 萬個——用評估者的話來說,就是「極為冗長」。Opus 5.5 在同一套件中則產生了 2.6 億個。在每百萬輸出 token 分別為 10 美元與 20 美元的情況下,約 1.6 倍的冗長係數仍讓 Sonnet 5.5 每完成一項任務多付約 27%。

這是逐 token 價目表無法讓你看到的比較部分,也是這兩個數字能夠並存、彼此不矛盾的原因。以每個 token 計算,Sonnet 5.5 便宜了一半。以每個完成的任務計算,在一個提示開放式、且不講究輸出長度的評估套件上,它可能反而更貴。你的工作負載屬於哪一種情況,才是真正該做的決定。

投入程度、輸出上限,以及整合的樣貌

對買家而言,這兩款型號在機械方面的關鍵特性幾乎完全相同。

• 上下文 — 兩者皆為 1,000,000 個 token,且來自同一個供應商,因此提示工程的假設可原封不動地沿用

• 最大輸出 — 兩者皆為 128,000 個 token;批量生成在這裡並非差異化因素

• 模態 — 兩者皆支援文字、圖像與檔案輸入;兩者皆不接受音訊或視訊

• 推理控制 — 兩者皆採用自適應思考,深度由 effort 參數決定,而非由思考權杖預算決定。在 Claude 平台上,預設為高;在 Claude 應用程式內則為中。

• 快取寫入 — Claude Opus 5.5 每百萬 $5.00,對比 Claude Sonnet 5.5 的 $2.50,這是唯一一項,較便宜的模型同時也是餵入重建前綴時較便宜的那個模型

• 快取讀取 — 兩者皆為每百萬 $0.20,在長時間代理執行中佔主導地位的項目上完全打平

因為介面相符,所以它們之間的遷移只是模型字串的變更與工作量的重新評估,而不是一項整合專案。這在跨供應商之間並不常見,而這正是這個特定組合值得比較的根本原因:這兩個候選方案在價格和深度上不同,而不是在你必須撰寫的 API 上。

有一項運作上的差異值得單獨說明。Anthropic 表示,Claude Sonnet 5.5 是第一個在推出時,其網路安全防護與備援機制就與其頂級模型處於同等地位的 Sonnet,這意味著風險較高的網路安全請求會明顯被轉送到前一代 Sonnet,而不是由你指定的模型回答。如果你的工作負載涉及該領域,模型字串並不保證實際回應的是哪個模型——不論哪個層級都一樣。Anthropic 也指出,如果你在停用思考模式的情況下執行 Sonnet,就必須改用工具之間的行為(between-tools behaviour),這是程式碼變更,而不是設定旗標。這兩點都不是避開該模型的理由;兩者都是你在正式推出前應該先了解的原因。

在 OrcaRouter 上,Claude Opus 5.5 今天就能用與目錄中其他所有模型相同的憑證進行路由,以供應商定價、零加成提供,底層還具備自動容錯移轉機制。Claude Sonnet 5.5 目前還不是我們平台上的路由——這個模型才推出一一天,在它正式上架之前,誠實的說法是:你得透過 Anthropic 自家的 API 才能使用它。目前透過我們使用 Opus 5.5 的人,可以在它上架當天評估切換成本,而無須更動整合的其他任何部分。

哪一個要放在哪裡

從這些數字得出的分工:Claude Sonnet 5.5 適合終端機綁定的代理工作,在 Anthropic 自家的 Terminal-Bench 4.0 數據中,它是兩者中較強的一方,而且價格只要一半;Claude Sonnet 5.5 適合任何以吞吐量為導向的工作,因為成本差距只有在任務強制產生長輸出時才會縮小;Claude Opus 5.5 適合 FrontierCode 等級的工作、跨大型程式碼庫的長期重構,以及任何這樣的工作負載:54.4% 對 46.2% 的差距反映的是你實際問題的樣貌,而不是排行榜上的一列。

如果你的任務是開放式的,而且你無法預測輸出長度,就完全別把每 token 價格當成正確數字。在你決定採用哪種做法之前,先在你自己的流量上花一週測量每完成一項任務的 token 數;artificial-analysis 的 $7.60 對 $5.98 這項數據是個警告:便宜模型可能在你實際付費的指標上吃虧。

老實說:這已經不再是能力與成本之間的取捨。問題在於你的工作是否有界限。對於有界限、高產量、工具驅動的任務,根據現有證據,較便宜的模型同時也是較好的選擇,而旗艦模型不值得雙倍價格。對於開放式、長遠期的工作,Anthropic 自己的那句話——Opus 5.5 仍然明顯更強——才是該相信的,而再多的基準趨同目前也改變不了這一點。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.