Claude Opus 5.5 的主視覺標題卡,標題為「Anthropic 下調其旗艦產品的價格」,徽章寫著「$4 輸入 / $20 輸出」、「快取讀取 $0.20」與「2026 年 9 月 22 日」,右下角則有 OrcaRouter 標誌。
Guides & Insights

Claude Opus 5.5:Anthropic 調降其旗艦產品的價格,而這才是真正的重點

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

廠商發布了 Claude Opus 5.5於 2026 年 9 月 22 日,而真正重要的數字不在任何基準測試圖表上。而是 4 美元。新旗艦模型每百萬輸入 token 收費 4 美元、每百萬輸出收費 20 美元,低於 5 美元/25 美元——這個價格 Claude Opus 5自 7 月 24 日以來一直維持——而快取讀取也從每百萬 0.50 美元降至 0.20 美元,對於主導長時間代理執行的成本項目來說是削減 60%。這款模型也更好:公司表示它可匹敵 Claude Fable 5.1,也就是位階在其上的 10 美元/50 美元級別,且能在大多數工作上做到。但一家前沿實驗室將其最高階一般可用模型的標價調降 20%——並表示運行它的真實成本下降了 40%——才是這次發布中改變你能負擔得起打造什麼的部分。新能力的發布會在一個季度內被複製。旗艦層級的降價會重設所有人的價格底線。

差額,就在你實際支付的數字裡

A single-column scoreboard for Claude Opus 5.5 listing input price $4.00 per million down from $5.00, output $20.00 down from $25.00, cache read $0.20 down from $0.50, default effort medium versus high, Terminal-Bench 4.0 66.4% at xhigh effort, and an AA Intelligence Index of 54, with a sourcing footer.

以下全部都是 Anthropic 公布的費率表,而非估算:

輸入 —— 每百萬個 token 4 美元,較 Opus 5 的 5.00 美元調降

• 輸出 — 每百萬個 token 為 $20,低於先前的 $25.00

• 快取讀取 — 每百萬 $0.20,較 $0.50 調降

• 5 分鐘快取寫入 — 每百萬個 $5;1 小時快取寫入 — $8

Batch API — 雙向皆享 50% 折扣,如同以往

• 上下文與輸出 — 1M token 上下文、128K 最大輸出、在 Batch API 上提供 300K 輸出,需使用 output-300k-2026-03-24 beta 標頭

• 知識截止日期 — 2026 年 6 月

• 強度 — 自適應思考一律開啟,預設為 medium;等級依序為 low、medium、high、xhigh、max

Claude API 上還有一個 Fast 模式,單獨定價為每百萬 $8/$40,Anthropic 將其描述為研究預覽版,而非一般選項。

快取這一項最值得關注,而它正是上市報導所略過的部分。對於每一輪都重新送出龐大系統提示與冗長檔案樹的代理而言,真正的主要成本是快取讀取,而非全新輸入。在這裡砍掉 60%,對真實的程式開發工作負載幫助,遠大於在頭條費率上砍掉 20%——而這也正是為什麼下一節的算式會得出那樣的結果。

「便宜40%」這個說法是從哪裡來的

Anthropic 表示,在典型工作負載下,Opus 5.5 的執行成本比 Opus 5 低約 40%。這大約是官方降價幅度的兩倍,意味著其中大部分根本不是定價因素——而是模型用更少的工作量達成相同答案。Anthropic 回報其輸出生成速度比 Opus 5 快逾 30%,多家首發客戶也指出 token 用量隨之減少:Box 表示 token 數降至三分之一,答案的冗長程度約降低 40%;Kiro 回報 token 數約減半、呼叫次數減少 40%;Factory 指出輸出 token 減少 20–25%;GitHub 則表示,這是他們測量過的模型中,token 與步驟用量最少的其中之一。

那些是廠商發布的客戶引述,不是經審計的測量數據,而且特別是「40%」這個數字,是 Anthropic 對其自行選擇的一組工作負載平均值所做的自家描述。請把它當作一種方向,而不是放進預算裡的數字。你今天可以獨立驗證的部分,是價目表——它就在 Anthropic 的公開定價頁面上——以及你自己執行工作負載時所產生的 token 數量。

發布資料中最有用的實例示範也是最不起眼的:一項合併分析在 Opus 5.5 上花了 63 分鐘,成本比在 Opus 5 上執行同一項任務低了 50%,而後者花了 93 分鐘。如果你在為代理定價,有趣的量是那個比率,而不是每 token 的費率——一個需要跑三遍才能完成的較便宜模型,並沒有替你省下任何東西。

基準表,以及是誰製作的

以下每一項正面對決的數據,都出自 Anthropic 的發布資料,且是以其自家模型與競爭對手模型為測試對象跑出來的結果。這在產品發布時很常見,也因此,其中任何一項都不應被解讀為獨立評斷。這些數字通篇都標示為廠商自行提報。

• Terminal-Bench 4.0 — Opus 5.5 66.4%、Opus 5 52.3%、Fable 5.1 55.8%、GPT-6 Astra 57.9%。Anthropic 指出,該次執行使用了 xhigh effort,而非預設值。

• FrontierCode v1.1(主要)— Opus 5.5 54.4%、Opus 5 48.0%、Fable 5.1 50.3%、GPT-6 Astra 53.3%;在預設中等強度下為 54.6%。

• CursorBench 4.0 — Opus 5.5 57.8%、Opus 5 46.6%、Fable 5.1 51.8%;中等努力程度下為 52.5%。

• GDPval-AA v2.1,知識工作 — Opus 5.5 1846 Elo,Fable 5.1 1735,Opus 5 1708,GPT-6 Astra 1542。

• Terminal-Bench-Science 0.1 — Opus 5.5 為 58.7%,對比 Opus 5 的 29.0%,而 GPT-6 Astra 以 64.6% 領先。

• OSWorld 2.0,電腦操作 — Opus 5.5 為 81.8%,相較之下 Opus 5 為 74.0%,標註為部分結果。

那份清單中有兩點值得特別挑出來談。第一,中等投入並不比最大投入差多少:在 FrontierCode 上是 54.6% 對 54.4%,在 CursorBench 上則是 52.5% 對 57.8%。由於投入程度會直接影響成本,FrontierCode 的那項結果——在預設設定下沒有可量測的損失——才是真正帶有金錢意涵的發現。第二,Anthropic 自己也警告,在此能力水準下,基準測試的差距「較不能可靠反映現實世界的差異」,而且它與 Fable 5.1 的內部差距比這些分數所暗示的更小。一家供應商叫你不要盡信它自己的表格,是整份文件中最可信的一句話。

在獨立評測方面,Artificial Analysis 在其 Intelligence Index 上給 Claude Opus 5.5 打了 54 分,在它所追蹤的模型中排名第三,配置標示為「Adaptive Reasoning, High Effort, Default Fallback」。最後那個子句確實發揮了實際作用,並直接引出下一節。

安全防護路由是規格的一部分

獨立結果中的那個「預設後備」標籤並不是基準測試的產物。Opus 5.5 搭載了 Anthropic 先前保留給 Fable 5.1 的防護層級,因為它在生物學與網路安全領域的表現可與 Claude Mythos 5.1 相媲美。實際上,這意味著大多數網路安全請求都會被重新導向至 Claude Opus 4.8,而生物學相關工作則會退回至 Claude Opus 5,除非該帳號已透過 Anthropic 的 Life Sciences 或 Cyber Verification 計畫完成驗證。

如果你的產品會向 claude-opus-5-5 送出與網路安全或生命科學相關的提示詞,你拿回來的答案可能根本不是來自 Claude Opus 5.5。你的評估、每項任務的成本,以及品質量測,在那些回合中都悄悄地把一個較小的模型算進去了。對大多數團隊來說,這永遠不會觸發。但對任何從事安全工具或生技領域的人來說,它卻 constantly 觸發——而且這是這次發布最重要的一項營運細節——這也意味著,一個可正常運作的 API 整合,仍然可能在你最在意的那幾組提示詞上,產出比你上一個模型更差的結果。新的驗證層級已經推出;在你假設那個模型字串就代表它字面上的意思之前,先確認自己是否落在其中某一層。

替換字串前的四項破壞性變更

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Opus 5.5 並非 Claude Opus 5 的直接替換品,也不是 Claude Opus 5 的改名。Anthropic 自家的遷移說明列出四項會破壞現有程式碼的變更:

• Thinking 已無法再停用。設定 thinking: disabled 或依賴非 thinking 路徑的程式碼將會報錯,或行為會在無聲無息中改變;深度現在僅能透過 effort 參數控制。

• 強制使用工具會傳回錯誤。傳入會強制指定特定工具的 tool_choice 並不受支援。

• 思考區塊與產生它們的模型以及對話綁定,因此無法像某些管線所假設的那樣跨模型重播。

• 較早的 computer_20251124 電腦操作工具在 Claude API 或 Google Cloud 上不受支援。

還有第五項變更,不會造成任何失敗,卻會改變輸出:工具呼叫之間的文字,現在會以 thinking 區塊的形式回傳,而在預設顯示設定下,這些區塊的文字是空的。若某個應用程式會把那段文字串流給使用者作為進度更新,那麼在工具呼叫之間它會變得一片安靜,直到它設定一個能讓文字回傳的顯示值為止。不會發生任何錯誤;只是 UI 不再出聲。這正是那種因為每項測試都通過,所以會一路出貨到正式環境的迴歸問題。

前三個變更也適用於 Fable 5.1,所以如果你已經遷移到該模型,這項工作就已經完成了一部分。

將它與您現有的東西一起運行

遷移細節中,讓團隊付出最大代價的並不是 API 變更;而是新的 Opus 搭配不同的 effort 尺度,會讓你圍繞舊版建立的成本模型失效。Anthropic 自家的指引是測試多個 effort 等級,而不是直接把 Opus 5 的設定沿用過去,這表示「5.5 對我們來說是否更便宜」的答案,取決於一項還沒有人針對你的提示詞跑過的量測。

當舊模型仍然在同一個金鑰上只需一次呼叫即可取用時,這項量測就更容易進行。Claude Opus 5 今天已在 OrcaRouter 上線,採用 Anthropic 自家的 $5.00/$25.00 定價、0% 加成——供應商定價直接轉傳,因此你看到的費率就是 Anthropic 公布的費率。Claude Opus 5.5 目前還不是我們的路由之一;它可透過 Anthropic 自家的 API 與各大雲端服務取得。當它上線時,在相同的投入程度下比較兩者,就會變成一條路由規則,而不是第二次整合:把一部分流量送往新模型,保留 自動容錯移轉指向你已經充分掌握特性的那一個,並閱讀你自己的 token 計數,而不是發表表格。在同一端點上跨多個模型組合一次呼叫——一個負責草擬、另一個負責驗證——不過是路由 DSL 的一行程式碼。

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

這並不能為你換來一份對 Opus 5.5 的獨立評斷。目前沒有任何東西做得到:已發表的正面對決評測都是 Anthropic 自家的,而唯一存在的外部評分,只是某個已部署系統在單一 effort 設定下的結果,而且還內建了備援路由。

理解它,以及還有什麼即將到來

Claude Opus 5.5 已正式上線,模型 ID 為 claude-opus-5-5,可透過 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform 使用。Anthropic 將狀態列為使用中,退役時間不早於 2027 年 9 月 22 日。

接下來還有兩件事。Anthropic 表示 Claude Sonnet 5.5 與 Claude Haiku 5.5 將在「未來幾週內」推出,並帶來許多相同的效率與安全改進——若此說法成立,對任何工作負載不需要前沿 Opus 的人來說,這是更具影響力的事件。而獨立基準測試的全貌仍未底定:Artificial Analysis 分數只是對某一種 effort 設定的初步觀察,且是在具備上述回退行為的已部署系統中取得,並非穩定的排名。

這次發布中有一個誠實的缺口:Anthropic 報告指出,Opus 5.5 經常懷疑自己正在被評估。這一點被披露為一項限制,而它正好切中基準測試表格所衡量的事物。一個在知道自己被觀察時會表現不同的模型,其分數——無論來自廠商或獨立機構——都不如這種格式所暗示的那麼有預測力。

Claude Opus 5.5 是四個月內第三款 Opus 層級的發布,也是 Anthropic 執行長公開主張應控制前沿開發節奏以來的首次發布。這兩項事實都出現在同一份文件中。能力數據會被人爭論一週;價格與快取費率一年後依然準確。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新