
Claude Opus 5.5 對決 Claude Sonnet 5:一半的價格、二十分的指數差距,以及五個月的盲點
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
如果你只想要那條規則:預設執行 Claude Sonnet 5,並在任務失敗時升級到 Claude Opus 5.5,因為較便宜的模型價格確實只有一半,而且確實屬於不同的能力級別。支撐這條規則的兩個數字是 38 和 58——Sonnet 5 與 Opus 5.5 在 Artificial Analysis Intelligence Index 上的分數,由同一個評估器、在同一個配置系列下得出。在那個指數上,二十分的差距絕非僅是打破平手的依據,而且它更是目前你能建構出的任何 Claude 對 Claude 對決中最大的差距:Claude Opus 5.5 在 210 個模型中排名第 1,而 Claude Sonnet 5 排名第 54,兩者之間的價格差距是每百萬個輸入 token 相差 2 美元。
那是容易的一半。困難的一半在於,選擇性地升級需要知道哪些任務會失敗,而這兩個模型對 2026 年 1 月之後的世界看法不一致,這種不一致不會有任何評估會把它當作錯誤呈現出來。
二十分差距的背景脈絡

Artificial Analysis 會以每款模型的一種已公開配置來運行,而這兩者共享同一個家族標籤——「Adaptive Reasoning, Max Effort」——這讓比較變得格外乾淨:
• 智慧指數 — Claude Opus 5.5 58 分,在 210 個模型中排名第 1,對比 Claude Sonnet 5 38 分,排名第 54
• 價格 — Claude Opus 5.5 每百萬輸入 $4.00 / 輸出 $20.00,對比 Claude Sonnet 5 的 $2.00 / $10.00
• 輸出速度 — Claude Sonnet 5 為 79.3 個詞元/秒,而 Claude Opus 5.5 尚未登上排行榜
• 首個 token 時間 — Claude Sonnet 5 為 150.02 秒,排行榜中位數則為 3.83 秒
• 預設投入程度 — Claude Opus 5.5 中等 對比 Claude Sonnet 5 高
• 知識截止日期 — Claude Opus 5.5 為 2026 年 6 月,而 Claude Sonnet 5 則為 2026 年 1 月
• 上下文與輸出 — 兩者皆為 1M 上下文與 128K 最大輸出
排名欄是值得好好細想的部分。二十點指數差距不是排行榜上的四個名次,而是四十九個名次。在一個收錄 210 個模型的排行榜上,Opus 5.5 與 Sonnet 5 不是只差在價格的鄰居——它們身處不同級別,而每百萬 2 美元的價差,買到的是實實在在的能力躍進,而非一個標籤。任何把本週報導讀成「Anthropic 推出了更便宜的 Opus」,並以為 Sonnet 層級已將其吸納的人,都應該看看那對排名:Anthropic 自家的定價頁面仍將 Claude Sonnet 5 列為現行產品,而它在獨立排行榜上的位置並未移動。
有兩點但書讓這段話保持誠實。兩項分數都是在最高推理強度下跑出來的,而兩款模型的出貨預設值都不是最高——Sonnet 5 預設為 high,Opus 5.5 則預設為 medium。而速度那一列反而讓整體情況變得對 Sonnet 5 有利:每秒 79.3 個 token、首個 token 需時 150 秒,這是真實測得的延遲表現,而且是兩者當中唯一出現在榜上的數據。Opus 5.5 的速度與延遲尚未由 Artificial Analysis 公布,這意味著這場對決中的「更快」說法,目前是建立在廠商資料上,而非實測結果。
改變 Sonnet 5 價格的註腳
過去一個月來,關於 Claude Sonnet 5 最具體的一件事,是一句大多數報導都略過的話。當該模型於 2026 年 6 月 30 日推出時,其 $2 / $10 的費率被公布為適用至 8 月 31 日的導入價格,並預定於 9 月 1 日調漲至 $3 / $15。在 Anthropic 目前的定價頁面上,註腳寫道 $2/$10 的定價「現在已成為標準價格」,且調漲「將不會發生」。
這有兩點重要之處。顯而易見的一點是,一項原本宣布、後來又取消的 50% 調漲,如今成了一條你可以據以規劃的成本項目——Sonnet 5 不是那種還得推估何時到期的促銷費率。較不明顯的一點是,它讓升級的計算固定了下來。當 Sonnet 5 永久維持在 $2/$10,而 Opus 5.5 為 $4/$20,兩個層級之間的比率在雙向上都正好是 2 倍,而且穩定不變。一條升級規則若把比如五分之一的流量導向 Opus 5.5,其成本你只要計算一次,之後就不必再重算。
批次與快取費率同步變動,這正是整表比較之所以有用的原因:Sonnet 5 的批次價為 $1.00 / $5.00,對比 Opus 5.5 的 $2.00 / $10.00,而兩者的快取讀取都收費每百萬 $0.20。最後這個數字是貨真價實的平手——Opus 5.5 把快取讀取從 $0.50 降到 $0.20,而 Sonnet 5 本來就已經是這個價位。如果你的工作負載主要是反覆重讀龐大的快取內容,而非生成全新輸出,那麼較便宜模型的價格優勢會遠小於帳面比例所暗示的幅度,因為兩者唯一一致的項目,正是你花最多錢的項目。
截止點就是那個會悄無聲息地失效的部分。

Claude Opus 5.5 的知識截止日期為 2026 年 6 月。Claude Sonnet 5 則是 2026 年 1 月。這中間相差了五個月,而這是這項比較中唯一不會自己張揚出來的一個面向。一個對某起事件一無所知的模型,並不會以你的錯誤處理機制能捕捉到的形式,在該事件上表現得比較慢或比較不準確——它會自信地從一個早已向前邁進的世界給出答案,而這種失誤看起來像是個乍看合理的錯誤答案,而不是拒答。
對某些工作負載而言,這無關緊要:重構一個慣例穩定的程式碼庫、摘要你提供的文件、轉換結構化資料。對另一些工作負載而言,光這一點就足以讓它不合格,無論那二十個指數點或價格如何。任何涉及 2026 年下半年發布的軟體、任何回答近期事件相關問題、任何依賴於一月之後有所變更的 API 或函式庫版本——這些任務無法被升級至 Opus 5.5,它們必須從那裡開始。這五個月不是品質差異;它們是範圍限制,而這應該歸於路由規則,而非評估之中。
兩款模型共享其餘的規格框架,這限制了能多大程度繞過截斷點。兩者都接受 100 萬個 token 的上下文,並最多回傳 128K;兩者都執行無法關閉的自適應思考,且都僅透過 effort 參數來調整深度。沒有任何配置會交給 Sonnet 5 更長的文件來補償。
執行拆分
這場對決的實用版本,是一個預設選項加上一個例外,而這個例外必須用「困難任務」以外的東西來定義。真正站得住腳的模式,是依任務類別而非難度來區分:把大量、且其知識截止點無關緊要、延遲表現也可接受的工作交給 Sonnet 5;任何涉及最新資訊、任何長遠跨度,或任何失敗一次的代價高於 token 差額的任務,則交給 Opus 5.5。
這是一種路由設定,而不是重寫,而這正是單一端點發揮價值的地方。Claude Sonnet 5 在 OrcaRouter 上採用 Anthropic 自家的 $2.00 / $10.00,而Claude Opus 5.5 在該處則是 $4.00 / $20.00——供應商定價原封不動地傳遞,0% 加價,因此你升級規則中的成本比率,就是 Anthropic 公布的比率,沒有任何加價層從中改動它。兩者都位於同一把金鑰之後,這意味著升級路徑只需編輯一條規則,而不必再進行一次整合;自動容錯移轉可避免故障的主要服務把請求一起拖垮;而用來決定你門檻的比較,可以在你自己的流量中執行,不必從兩份供應商表格中重建。

誰應該移動,誰應該等待
如果你已經採用 Claude Sonnet 5,而且它運作正常,那麼替換它的理由並不充分:這個模型價格只要一半,其費率如今已永久固定,而指數差距只在它表現失敗的任務上才有影響。在其上層加入 Claude Opus 5.5 的理由則很充分,前提是你說得出觸發時機——而觸發時機通常是截斷失敗,或是 Sonnet 5 以最大努力執行仍會出錯的任務。
如果你正在挑選你的第一個 Claude 模型,答案並不像價格比例看起來那麼均衡。20 點的指數差距,加上用兩倍 Token 換來的額外五個月知識,是一筆多數生產工作負載會在哪少數呼叫中接受的交易,而幾乎沒有工作負載會在所有呼叫中都接受。無論往哪個方向,都應避免的錯誤是把兩者視為可互換,並只根據成本來切換,因為隨之而來的失敗並不是答案變差——而是一個對已於一月終結的世界所給出的自信答案。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
