為 Claude Sonnet 5.5 對上 Claude Opus 5 生成的主視覺標題卡,副標題為「降價 60% 與五個百分點的差距」,顯示每百萬個 token 的 $2.00 與 $10.00,對比 $5.00 與 $25.00,並在右下角合成 OrcaRouter 標誌。
Guides & Insights

Claude Sonnet 5.5 與 Claude Opus 5:每一項都更便宜,指數排名也更領先

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Opus 5 於 2026 年 7 月 24 日推出,每百萬輸入 token 收費 $5.00,每百萬輸出 token 收費 $25.00。Claude Sonnet 5.5 於 2026 年 9 月 28 日正式全面推出,價格為 $2.00 與 $10.00。對一個新兩代的模型而言,這代表輸入費用降低 60%,輸出費用也降低 60%——而且,在 Artificial Analysis 對兩者所跑的測試框架上,這個模型在 Intelligence Index v4.3 上拿到 56 分,相較之下 Claude Opus 5 為 51 分。這是罕見的比較:較新、較便宜的模型同時在第三方指數上得分更高,而現任模型仍站得住腳的理由不在於基準排名,而是特定類型的工作。兩個模型都支援 1M token 的上下文,都能輸出最多 128K token,都能讀取文字、圖像與檔案,且都透過 effort 參數而非思考 token 預算來設定推理。由於兩者的介面相同,要在它們之間做選擇,純粹是完成一項任務的成本,以及哪些任務會失敗的問題。

{{1}}兩個版本{{/1}},{{2}}一個介面{{/2}}

先從變化有多小開始說起,因為這已經比大多數世代躍進還多了。

• 上下文視窗 — 兩者皆為 1,000,000 個 token

• 最大輸出 — 兩者皆為 128,000 個詞元

• 輸入方式 — 兩者皆支援文字、圖像與檔案;兩者皆不支援音訊與視訊

• 推理 — 自適應思考,兩者皆可設定投入程度,因此深度是請求參數,而非獨立的模型字串

• 能力——視覺、工具、JSON 與推理,兩者皆具備,根據 OrcaRouter 目錄中關於anthropic/claude-opus-5以及 Sonnet 系列的條目

實際結果是,為 Claude Opus 5 撰寫的提示詞不需要改寫就能在 Claude Sonnet 5.5 上執行,而以 128K 輸出上限調校的代理迴圈也不需要新的層級。遷移不過是替換模型字串,再加上重新確認你先前固定的是哪個 effort 設定——如此而已。對於經歷過過去兩年多模態、多參數轉型的團隊來說,這才是頭條,而不是基準測試。

唯一會改變的是價格,而且它是在每一個項目上都會改變,而不只是行銷投影片上的那兩個。

• 輸入 — 每百萬 $2.00,相較於 $5.00,降幅 60%

• 輸出 — 每百萬 10.00 美元,相較於 25.00 美元,削減 60%

• 快取讀取 — 每百萬 $0.20,相較於 $0.50,降幅達 60%

• 快取寫入 —— 每百萬 $2.50,相較於五分鐘視窗的 $10.00,調降 75%

如果你執行的代理會在每一輪重新讀取一段很長的前綴,那麼快取讀取這一項就是為遷移買單的關鍵。以 $0.20 對比 $0.50 來看,長時間工作階段中的每個快取 token 成本都降到舊成本的 40%,而在大多數代理式迴圈中,快取讀取占了 token 數量的大部分。這種節省會以每 token 頭條數字無法捕捉的方式複利累積。

五點從何而來

Artificial Analysis 在 Intelligence Index v4.3 上給 Claude Sonnet 5.5 打了 56 分,Claude Opus 5 則為 51 分,兩者都是在「Adaptive Reasoning, Max Effort」配置下測得。在那個量表上,五分不是四捨五入誤差——作為對照,同一評估者將 Sonnet 5 列在 38 分,Gemini 3.1 Pro Preview 列在 30 分,因此 Claude Opus 5 與 Claude Sonnet 5.5 之間的差距,是 Claude Opus 5 與上一代 Sonnet 之間差距的三分之一。

Anthropic 自家為 Claude Sonnet 5.5 公布的推出數據,以不同的量測工具指向了相同方向。該公司回報在 Terminal-Bench 4.0 上達到 70.6%——而同一項測試在較早的 Anthropic 表格中,Claude Opus 5 被記載為 89.1%;那個數字使用了不同的測試框架修訂版,不應從較新的數字中減去。這是本文最重要的一項資料出處告誡:Terminal-Bench 在 2026 年中途改用 4.0,收錄它的指數也配合修訂為 v4.3,而該基準的跨版本比較不能直接拿來做算術。若某個數字附有版本,請引用該版本。

可以乾淨比較的,是廠商自家 Sonnet 這一側的進展——Sonnet 5 在 Terminal-Bench 4.0 上的 10.3% 到 Sonnet 5.5 的 70.6%——以及第三方指數讀數,其中這兩個數字都來自同一天、同一套測試框架。根據這些證據,後繼機型在一般推理上確實已超越七月的旗艦款,這比任何廠商簡報所做的宣稱都更有力。

輸出長度陷阱

這裡就是計算結果不再眷顧較新模型的地方。

Artificial Analysis 報告指出,在其索引套件上評估 Claude Sonnet 5.5 每項任務要價 7.60 美元。Claude Opus 5 在同一套件上每項任務則要 5.86 美元。這款較新的模型,儘管價目表上每一項費率都打了六折,完成一項任務的成本卻高出約 30%。原因就在同一份報告裡:Sonnet 5.5 在整套測試中產出了 4.1 億個 token,而被追蹤模型的 token 中位數為 8,800 萬個,評估方將此標為「極度冗長」。Claude Opus 5 在同一套件中則產出了 1.4 億個。

把它算一算,機制很簡單。Sonnet 5.5 在相同工作上產生的輸出 token 大約是 Claude Opus 5 的三倍,而輸出價格僅為其 40%。三乘以 0.4 等於 1.2——在快取效應之前就是 20% 的懲罰,這與 $7.60 對比 $5.86 的結果落在同一範圍。每 token 的價格並沒有錯;只是它不是決定帳單金額的那個數字。

這並不代表較新的模型就更不值得買。這讓決定取決於多數比較所忽略的一件事:你的工作負載是否讓你能限制輸出。帶有長度指示的摘要工作、產生 JSON 的結構化擷取流程、回傳標籤的分類器——在這些情境中,冗長永遠不會出現,而價目表上 60% 的降幅是真金白銀。一個沒有輸出規範、被要求「修好這個儲存庫」的開放式代理,等於給了 Sonnet 5.5 三倍的繩子。

工作量設定與沒有人編列預算的移轉

兩種模型都透過具有多個層級的 effort 參數來展現推理深度,而且兩者都隨附預設值,而非固定值——Claude Platform 上為 high,Claude apps 內為 medium。遷移時的一大誘惑,就是直接讓設定維持在舊模型上的狀態,然後就宣稱完成。

這是個有可衡量原因的錯誤。Anthropic 自己針對 Claude Sonnet 5.5 的註腳指出,Max effort 組態在 FrontierCode 上的得分低於 Xhigh,這意味著 effort 並非單調調整旋鈕,而最高設定也不是免費升級。請透過衡量你的任務來設定 effort,而不是選擇可用的最昂貴選項。

在推出之前,Sonnet 這邊還有一項值得先了解的硬性行為差異。Anthropic 表示,Claude Sonnet 5.5 是首款隨附網路安全防護與備援機制的 Sonnet,且這些機制與其頂級模型一致,因此較高風險的安全請求會明顯退回由較早的 Sonnet 處理,而不是由你指定的模型提供服務。如果你的工作負載屬於該領域,你的日誌會顯示一個你並未請求的模型。Claude Opus 5 早於 Sonnet 系列上的這項安排,不過在 Anthropic 的產品中,旗艦層級的生物學與網路安全工作也存在同一類路由機制。

在 OrcaRouter 上,這兩個端點目前都已上線——anthropic/claude-opus-5 與 anthropic/claude-sonnet-5與其他所有項目並列於同一個目錄中,以供應商的定價收費,零加成——而 Claude Sonnet 5.5 一旦上架,就能透過同一組憑證存取。在此期間,真正相關的能力是自動容錯移轉:若某個 Anthropic 層級受到速率限制或傳回錯誤,要求即可在不修改程式碼的情況下改指向另一個層級,這是面對這項比較判斷失準時最經濟的避險方式。

該決定,以規則形式表述

如果你的工作範圍有界——你能掌控輸出形式、提示詞有既定結構,且每項任務的 token 數量可預測——那就改用 Claude Sonnet 5.5,收下這 60% 的降幅。該指數認同,費率表也認同,而另一方再也沒有能力上的論據可辯。

如果你的工作是開放式且具代理性質的,在看到任何一份價目表後先別急著相信,先跑實驗。在每個模型上,用你自己的流量為期一週測量每完成一項任務所消耗的 token 數;$7.60 對上 $5.86 的第三方結果是一項具體警告:較便宜的價目表可能產生更高的帳單。在你取得那個數字之前,Claude Opus 5 仍是長程自主工作的較安全預設選擇。

誠實的結論是:這是第一個 Sonnet 世代,旗艦機種的立論取決於任務型態,而非原始能力;而任何仍只憑模型名稱做決定的人,現在不是少拿 60% 的價值,就是每完成一項任務多付 30%,端看他們猜的是哪一邊。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run, 410M output tokens on the index suite. Right column Claude Opus 5: input $5.00, output $25.00, cache read $0.50, cache write $10.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 51, $5.86 per task on the index run, 140M output tokens on the index suite. A footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Sonnet 5.5 is 60% cheaper on input, output and cache reads and 75% cheaper on cache writes, and still costs about 30% more per finished task."Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5 (anthropic/claude-opus-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.19-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-07-24" line, and the $5.00 input and $25.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Claude Sonnet 5.5, named in full as "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)" and marked released September 2026, showing the In $2.00 and Out $10.00 rates, the Intelligence Index score of 56, the $7.60 average cost per task, and the 410M output tokens described as very verbose against a median of 88M.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新