
Claude Opus 5.5 對比 Claude Opus 5:投入程度等級的意義並不相同
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
在比較 Claude Opus 5.5與Claude Opus 5之前,首先要了解的是:這兩個模型並不共用同一套 effort 尺度,而本週你會讀到的幾乎每一篇捉對比較都忽略了這一點。Opus 5 預設為 high effort。Opus 5.5 預設為 medium,而且在同名的層級上,它每一回合思考得比前代更多。所以「Opus 5.5 在預設設定下對上 Opus 5 在預設設定下」並不是一場受控實驗——而是兩種不同思考量的比較。廠商在自己的遷移指南裡也這麼說:要測試多個 effort 層級,而且不要沿用 Opus 5 的設定,因為同名的層級並不對應到相同的思考預算。一旦你把這一點控制住,兩個模型之間的差距在某些地方會縮小,在另一些地方則會擴大,而升級與否的決定關鍵也不再是純粹的能力,而是每完成一項任務的成本,以及四項會讓今日在 Opus 5 上運行的程式碼失效的 API 變更。
實際上究竟有何不同,逐項規格比較

這兩款模型在紙面上比版本號所暗示的更接近:
• 價格 — Claude Opus 5.5 為每百萬個 token 輸入 $4.00 / 輸出 $20.00,相較於 Claude Opus 5 的 $5.00 / $25.00
• 快取讀取 — 每百萬 $0.20 相較於每百萬 $0.50,在主宰代理式執行的費用項目上降低 60%
• 快取寫入 — 在 5.5 上,5 分鐘時段為每百萬 $5,1 小時時段為 $8,相較於 Opus 5 的 $6.25
• 上下文與輸出 — 兩者皆具備 100 萬個 token 的上下文與 128K 的輸出;兩者在 Batch API 上只要加上 output-300k-2026-03-24 beta 標頭
• 預設努力程度 — 中等於 Opus 5.5,對比 高於 Opus 5
• 思考 — 在兩者中皆為自適應且始終開啟,但在 Opus 5.5 上已完全無法停用
• 知識截止日期 — 2026 年 6 月 vs 2026 年 5 月
• 延遲——Anthropic 將 Opus 5.5 在現行產品陣容中評為「中等」,並表示其生成輸出的速度比 Opus 5 快 30% 以上。
• 退役 — Opus 5.5 不得早於 2027 年 9 月 22 日,Opus 5 不得早於 2027 年 7 月 24 日
請注意有哪些項目並不不同:上下文視窗、輸出上限、批次折扣,以及恆常啟用的自適應思考模型。Opus 5.5 並非上下文更大或輸出更長的模型。它是在相同規格範圍內更便宜、更快速、更省 token 的模型。
基準測試,以及每一項背後努力付出的星號註記

這些數字來自 Anthropic 的發布資料——由廠商自行報告、在其自家模型上跑出——而在這裡,effort 設定比模型名稱更重要:
• Terminal-Bench 4.0 — 66.4% 對比 52.3%,其中 Opus 5.5 是以 xhigh 努力程度執行,而非預設值
• FrontierCode v1.1(主要)— 54.4% 對 48.0%,而 Opus 5.5 在預設中等投入下為 54.6%
• CursorBench 4.0 — 57.8% 對 46.6%,以及中等難度下的 52.5%
• GDPval-AA v2.1 — 1846 Elo 對比 1708
• AutomationBench — 40.0% 對比 26.9%
• Humanity's Last Exam,使用工具 — 67.7% 對 63.6%
• Terminal-Bench-Science 0.1 — 58.7% 對 29.0%,是這組中差距最懸殊的一項
• OSWorld 2.0 — 部分得分 81.8% 對比 74.0%
• Chartography,搭配工具 — 89.0% 對 83.4%
FrontierCode 的結果才是值得研究的那一個。Opus 5.5 在 xhigh 下得分 54.4%,在 medium 下得分 54.6%——統計上是同一個數字,卻只用了極小部分的思考預算。無論 Anthropic 做了什麼改進,在那個基準測試上,都不是靠更用力思考得來的。CursorBench 則朝相反方向走:xhigh 下 57.8%,對上 medium 下 52.5%,五個百分點的差距說明在某些任務上,投入更多努力仍能換得真實的準確度。這給的教訓不是「用 medium」或「用 xhigh」;而是現在正確的努力程度得按個別工作負載來測量,而讓 Opus 5 維持在 high 預設值的舊習慣,已不再能告訴你任何關於新模型的事。
Anthropic 補充了一項值得再三強調的但書:在這個能力水準上,基準測試的差距「已不再是判斷實際應用差異的可靠依據」,而該公司也表示,其內部與 Claude Fable 5.1 的差距比已公布的分数所顯示的還要小。這是一家廠商在告訴你,別過度解讀它自家的表格。
每項已完成任務的成本,才是決定性的比較基準
以每 token 價格來衡量 agent 是錯誤的單位,而這場對決正是這一點顯現之處。Anthropic 自家提供的實例:一項併購分析在 Opus 5.5 上花了 63 分鐘,成本比同一任務在 Opus 5 上低了 50%,而後者花了 93 分鐘。價目表解釋了其中一部分——輸入與輸出降價 20%,快取讀取降價 60%——但並非全部。其餘則來自模型用更少的 token 與更少的輪次達到相同的結果。隨著發布一同公布的客戶證言也指向同一方向:Box 回報 token 用量僅三分之一,答案精簡約 40%;Kiro 的 token 大約減半,呼叫次數少了 40%;Factory 的輸出 token 少了 20–25%;GitHub 則是其所測得 token 與步驟數最少的之一。
那些是廠商發布的客戶說法,不是經審計的結果,而整體「在典型工作負載上便宜約 40%」是 Anthropic 對其自行選定的工作負載平均值所做的描述。就你自己的規劃而言,老實的版本是:假定 20% 的標價降幅是真的、可以算數,並把額外那 20% 當成一個假設,你可以在一個下午用兩個模型跑同一項任務並計算 token 數來驗證。
關於快取為何能發揮超乎其份量的作用,這裡有一個結構性的說明。一個每一輪都重新傳送冗長系統提示與檔案樹的代理,其大部分輸入是按快取讀取費率計費,而非全新輸入費率。把這個從每百萬 $0.50 降到 $0.20,對長時間執行工作階段的經濟效益影響,遠比表面上的費率數字更大——而這正是為什麼一個在 Opus 5 上僅勉強可行的工作負載,能在 Opus 5.5 上變得明顯可行,而你的提示完全不必更動。
四項破壞性變更,作為遷移檢查清單
Opus 5.5 是新模型,並非重新命名的 Opus 5,而 Anthropic 的遷移說明列出四項變更,這些變更會破壞已在生產環境中運行的程式碼:
• Thinking 無法停用。任何關閉 thinking 的程式碼路徑都會出錯或改變行為,而深度現在只能透過 effort 參數來控制。
• 強制使用工具會傳回錯誤。tool_choice 不支援強制指定具名工具。
• 思考區塊與產生它們的模型以及對話綁定,因此無法像某些管線所假設的那樣跨模型重播。
• 較早的 computer_20251124電腦使用工具在 Claude API 或 Google Cloud 上不被接受。
還有第五項變更,它不會導致任何測試失敗,因此更加危險。如今工具呼叫之間的文字會在預設顯示設定下文字為空的思考區塊內回傳。如果你的應用程式將該文字以進度更新形式串流給使用者,那麼在工具呼叫之間它會變得悄無聲息,直到你設定一個能回傳該文字的顯示值為止。每一項測試都通過;只是介面不再出聲敘述。
前三項也適用於 Claude Fable 5.1,因此已經遷移到該模型的團隊,已經完成了這部分工作。仍使用 Opus 5 的團隊則尚未做到。
何時 Opus 5 仍是正確的選擇
升級並非自動的,而且有四個真正的理由留下來:
• 成本可預測性。Opus 5 是你已經描述過其特性的模型。如果你的預算是根據它的 token 消耗量來建模,那麼改用一個在相同具名努力程度下思考量不同的模型,會使你的預算模型失效,直到你重新測量為止。
• 相容性。如果你的技術堆疊有任何部分依賴停用思考、強制使用工具,或較舊的 computer-use 工具,那麼這次遷移就是程式碼工作,而不是字串替換。
• 防護路由。Opus 5.5 隨附 Fable 5.1 等級的防護機制,這表示大多數網路安全請求會被重新導向至 Claude Opus 4.8,而生物學相關工作則會改由 Claude Opus 5 處理,除非你的帳戶已通過驗證。若你的產品屬於這兩個領域之一,「升級」可能意味著你的使用者會從較小的模型取得答案。Opus 5 沒有這種路由。
• 使用壽命。Opus 5 短期內不會退役——Anthropic 列出最早要到 2027 年 7 月 24 日才會退役,距今還有十個月。
對其他人來說,這筆帳很簡單:更強的能力、更低的價格、更少的 token,以及一份單一工程師一天內就能完成的遷移檢查清單。
在切換期間同時執行兩者

任何旗艦級模型遷移最棘手的部分就是中間階段:你想讓新流量跑 Opus 5.5,卻不想把正式環境路徑押在一個你還沒在自己 effort 設定下實測出特性的模型上;同時你還想在摸索期間讓 Opus 5 繼續服務。這是路由問題,而不是重新平台化的問題,值得把什麼東西位在哪裡講清楚。Claude Opus 5 現已在 OrcaRouter 上線,採 Anthropic 自家的定價、0% 加成——供應商定價直接透傳,因此供應商調價當天我方即時生效,而不必等到同步之後。Claude Opus 5.5 目前還不是我們的路由之一;它可透過 Anthropic 自家 API 與各大雲端平台取得。等它上線後,它只會是同一把金鑰上的另一條路由,而不是第二份合約和第二套 SDK,這正是讓你能把一定比例的流量導向新模型,同時自動容錯移轉讓其餘流量留在你已經掌握特性的那個模型上。跨兩者組合一次呼叫——由其中一個起草、另一個負責驗證——只需要一行 routing-DSL。
要精確說明那能為你帶來什麼。它不會給你一份 Opus 5.5 的獨立基準測試;目前沒有任何東西做得到,因為唯一已公布的直接對比是 Anthropic 自家的,而獨立追蹤機構仍在確定投入程度設定。它給你的是唯一一項真正能預測你帳單的測量值——針對你的提示詞、在你實際部署的投入層級下。
決策規則
如果你要著手一項新工作,請使用 Claude Opus 5.5,並從中等投入程度開始,接著衡量低投入程度在你的任務上是否站得住腳——Anthropic 回報,在多項程式設計評測中,低投入程度的表現已接近其較高設定,成本卻低得多,而上述 FrontierCode 的數據也顯示,預設值並不會讓你少拿到多少好處。
如果你在生產環境中運行 Claude Opus 5,促使你遷移的觸發點並不是那張基準測試表。而是你能否吸收四項 API 變更,以及你的工作負載是否落在資安或生物學領域——在這些領域,防護機制的路由會悄悄把你的一部分流量交給一個較小的模型。這次升級的其他一切,都不過是披著模型發布外衣的降價,而這樣的降價值得把握。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
