一張為 Claude Opus 5.5 對上 Claude Sonnet 5 生成的標題卡,副標題為「一半的價格、二十點指數、五個月的盲區」,並有三個扁平線性圖示(堆疊資料庫標記、上升長條圖,以及附時鐘的日曆),底部一行寫著「指數依 Artificial Analysis 於最大投入下的數據;價格依 Anthropic。」真正的 OrcaRouter 標誌合成於右下角。
Guides & Insights

Claude Opus 5.5 對決 Claude Sonnet 5:一半的價格、二十分的指數差距,以及五個月的盲點

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果你只想要那條規則:預設執行 Claude Sonnet 5,並在任務失敗時升級到 Claude Opus 5.5,因為較便宜的模型價格確實只有一半,而且確實屬於不同的能力級別。支撐這條規則的兩個數字是 38 和 58——Sonnet 5 與 Opus 5.5 在 Artificial Analysis Intelligence Index 上的分數,由同一個評估器、在同一個配置系列下得出。在那個指數上,二十分的差距絕非僅是打破平手的依據,而且它更是目前你能建構出的任何 Claude 對 Claude 對決中最大的差距:Claude Opus 5.5 在 210 個模型中排名第 1,而 Claude Sonnet 5 排名第 54,兩者之間的價格差距是每百萬個輸入 token 相差 2 美元。

那是容易的一半。困難的一半在於,選擇性地升級需要知道哪些任務會失敗,而這兩個模型對 2026 年 1 月之後的世界看法不一致,這種不一致不會有任何評估會把它當作錯誤呈現出來。

二十分差距的背景脈絡

A two-column scoreboard comparing Claude Opus 5.5 and Claude Sonnet 5 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 38, ranked #54), price in and out ($4.00 / $20.00 per million against $2.00 / $10.00), default effort (medium against high), knowledge cutoff (Jun 2026 against Jan 2026), output speed (not yet published against 79.3 tokens per second) and cache read ($0.20 per million on both). The footer reads 'Index and speed figures per Artificial Analysis at max effort; prices, effort defaults and cutoffs per Anthropic.'

Artificial Analysis 會以每款模型的一種已公開配置來運行,而這兩者共享同一個家族標籤——「Adaptive Reasoning, Max Effort」——這讓比較變得格外乾淨:

• 智慧指數 — Claude Opus 5.5 58 分,在 210 個模型中排名第 1,對比 Claude Sonnet 5 38 分,排名第 54

• 價格 — Claude Opus 5.5 每百萬輸入 $4.00 / 輸出 $20.00,對比 Claude Sonnet 5 的 $2.00 / $10.00

• 輸出速度 — Claude Sonnet 5 為 79.3 個詞元/秒,而 Claude Opus 5.5 尚未登上排行榜

• 首個 token 時間 — Claude Sonnet 5 為 150.02 秒,排行榜中位數則為 3.83 秒

• 預設投入程度 — Claude Opus 5.5 中等 對比 Claude Sonnet 5

• 知識截止日期 — Claude Opus 5.5 為 2026 年 6 月,而 Claude Sonnet 5 則為 2026 年 1 月

• 上下文與輸出 — 兩者皆為 1M 上下文與 128K 最大輸出

排名欄是值得好好細想的部分。二十點指數差距不是排行榜上的四個名次,而是四十九個名次。在一個收錄 210 個模型的排行榜上,Opus 5.5 與 Sonnet 5 不是只差在價格的鄰居——它們身處不同級別,而每百萬 2 美元的價差,買到的是實實在在的能力躍進,而非一個標籤。任何把本週報導讀成「Anthropic 推出了更便宜的 Opus」,並以為 Sonnet 層級已將其吸納的人,都應該看看那對排名:Anthropic 自家的定價頁面仍將 Claude Sonnet 5 列為現行產品,而它在獨立排行榜上的位置並未移動。

有兩點但書讓這段話保持誠實。兩項分數都是在最高推理強度下跑出來的,而兩款模型的出貨預設值都不是最高——Sonnet 5 預設為 high,Opus 5.5 則預設為 medium。而速度那一列反而讓整體情況變得對 Sonnet 5 有利:每秒 79.3 個 token、首個 token 需時 150 秒,這是真實測得的延遲表現,而且是兩者當中唯一出現在榜上的數據。Opus 5.5 的速度與延遲尚未由 Artificial Analysis 公布,這意味著這場對決中的「更快」說法,目前是建立在廠商資料上,而非實測結果。

改變 Sonnet 5 價格的註腳

過去一個月來,關於 Claude Sonnet 5 最具體的一件事,是一句大多數報導都略過的話。當該模型於 2026 年 6 月 30 日推出時,其 $2 / $10 的費率被公布為適用至 8 月 31 日的導入價格,並預定於 9 月 1 日調漲至 $3 / $15。在 Anthropic 目前的定價頁面上,註腳寫道 $2/$10 的定價「現在已成為標準價格」,且調漲「將不會發生」。

這有兩點重要之處。顯而易見的一點是,一項原本宣布、後來又取消的 50% 調漲,如今成了一條你可以據以規劃的成本項目——Sonnet 5 不是那種還得推估何時到期的促銷費率。較不明顯的一點是,它讓升級的計算固定了下來。當 Sonnet 5 永久維持在 $2/$10,而 Opus 5.5 為 $4/$20,兩個層級之間的比率在雙向上都正好是 2 倍,而且穩定不變。一條升級規則若把比如五分之一的流量導向 Opus 5.5,其成本你只要計算一次,之後就不必再重算。

批次與快取費率同步變動,這正是整表比較之所以有用的原因:Sonnet 5 的批次價為 $1.00 / $5.00,對比 Opus 5.5 的 $2.00 / $10.00,而兩者的快取讀取都收費每百萬 $0.20。最後這個數字是貨真價實的平手——Opus 5.5 把快取讀取從 $0.50 降到 $0.20,而 Sonnet 5 本來就已經是這個價位。如果你的工作負載主要是反覆重讀龐大的快取內容,而非生成全新輸出,那麼較便宜模型的價格優勢會遠小於帳面比例所暗示的幅度,因為兩者唯一一致的項目,正是你花最多錢的項目。

截止點就是那個會悄無聲息地失效的部分。

A generated two-card graphic titled 'Knowledge cutoffs, five months apart', showing Claude Sonnet 5 with a knowledge cutoff of January 2026 against Claude Opus 5.5 with a cutoff of June 2026, separated by a marker reading '5 months of coverage'. The footer reads 'Cutoff dates per Anthropic's Claude model documentation, current as of September 2026.'

Claude Opus 5.5 的知識截止日期為 2026 年 6 月。Claude Sonnet 5 則是 2026 年 1 月。這中間相差了五個月,而這是這項比較中唯一不會自己張揚出來的一個面向。一個對某起事件一無所知的模型,並不會以你的錯誤處理機制能捕捉到的形式,在該事件上表現得比較慢或比較不準確——它會自信地從一個早已向前邁進的世界給出答案,而這種失誤看起來像是個乍看合理的錯誤答案,而不是拒答。

對某些工作負載而言,這無關緊要:重構一個慣例穩定的程式碼庫、摘要你提供的文件、轉換結構化資料。對另一些工作負載而言,光這一點就足以讓它不合格,無論那二十個指數點或價格如何。任何涉及 2026 年下半年發布的軟體、任何回答近期事件相關問題、任何依賴於一月之後有所變更的 API 或函式庫版本——這些任務無法被升級至 Opus 5.5,它們必須從那裡開始。這五個月不是品質差異;它們是範圍限制,而這應該歸於路由規則,而非評估之中。

兩款模型共享其餘的規格框架,這限制了能多大程度繞過截斷點。兩者都接受 100 萬個 token 的上下文,並最多回傳 128K;兩者都執行無法關閉的自適應思考,且都僅透過 effort 參數來調整深度。沒有任何配置會交給 Sonnet 5 更長的文件來補償。

執行拆分

這場對決的實用版本,是一個預設選項加上一個例外,而這個例外必須用「困難任務」以外的東西來定義。真正站得住腳的模式,是依任務類別而非難度來區分:把大量、且其知識截止點無關緊要、延遲表現也可接受的工作交給 Sonnet 5;任何涉及最新資訊、任何長遠跨度,或任何失敗一次的代價高於 token 差額的任務,則交給 Opus 5.5。

這是一種路由設定,而不是重寫,而這正是單一端點發揮價值的地方。Claude Sonnet 5 在 OrcaRouter 上採用 Anthropic 自家的 $2.00 / $10.00,而Claude Opus 5.5 在該處則是 $4.00 / $20.00——供應商定價原封不動地傳遞,0% 加價,因此你升級規則中的成本比率,就是 Anthropic 公布的比率,沒有任何加價層從中改動它。兩者都位於同一把金鑰之後,這意味著升級路徑只需編輯一條規則,而不必再進行一次整合;自動容錯移轉可避免故障的主要服務把請求一起拖垮;而用來決定你門檻的比較,可以在你自己的流量中執行,不必從兩份供應商表格中重建。

A screenshot of OrcaRouter's own model page for anthropic/claude-sonnet-5, headed 'Claude Sonnet 5' and credited to Anthropic, showing $2.00 input and $10.00 output per 1M tokens, a 1M-token context and a PERFORMANCE panel with 79.3 output tokens per second, a 150.02s time to first token and 55M output tokens over 7 days.

誰應該移動,誰應該等待

如果你已經採用 Claude Sonnet 5,而且它運作正常,那麼替換它的理由並不充分:這個模型價格只要一半,其費率如今已永久固定,而指數差距只在它表現失敗的任務上才有影響。在其上層加入 Claude Opus 5.5 的理由則很充分,前提是你說得出觸發時機——而觸發時機通常是截斷失敗,或是 Sonnet 5 以最大努力執行仍會出錯的任務。

如果你正在挑選你的第一個 Claude 模型,答案並不像價格比例看起來那麼均衡。20 點的指數差距,加上用兩倍 Token 換來的額外五個月知識,是一筆多數生產工作負載會在哪少數呼叫中接受的交易,而幾乎沒有工作負載會在所有呼叫中都接受。無論往哪個方向,都應避免的錯誤是把兩者視為可互換,並只根據成本來切換,因為隨之而來的失敗並不是答案變差——而是一個對已於一月終結的世界所給出的自信答案。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新