
Claude Opus 5:Anthropic 的接近前沿模型,價格僅為 Fable 5 的一半。
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
2026年7月24日,Anthropic推出了Claude Opus 5——在一天之内,它做了一件对「更便宜」的模型来说罕见的事:登上了独立排行榜的榜首。Anthropic宣称Opus 5接近前沿智能的Claude Fable 5以一半的价格推出,并在同一天登陆Claude.ai、Claude API、Claude Code和Claude Cowork。自那以后,Artificial Analysis将其评为智能指数上的第一名模型。本指南将介绍Opus 5的实际面貌、哪些是独立验证vs供应商报告的、其新的努力程度调节旋钮和安全态势、实际使用成本,以及谁应该切换。
以下每個圖表都標有來源,因為在這個速度下,故事每天都變化:上市當天顯示「尚無獨立評分」的內容,現在已是「獨立排名第一」。基準和價格會變動——在確定預算之前,請先核實。
TL;DR。Claude Opus 5 的定價為每 100 萬輸入代幣 5 美元,每 100 萬輸出代幣 25 美元——與 Opus 4.8 相同,且正好是 Fable 5 定價(10 美元 / 50 美元)的一半。在人工分析智能指數(Artificial Analysis Intelligence Index)上,它目前以 61 分(最大努力模式)領先,是 170 個受評模型中的最強模型,略勝 Fable 5(60 分),並以一半的成本達到同等水準。Anthropic 自家的發布基準測試也證實了這一點:Frontier-Bench v0.1 達 43.3%(Fable 5 為 33.7%),同時在 Zapier 的 AutomationBench 和 OSWorld 2.0 電腦使用基準測試中領先。有兩點讓它不只是降價:一個努力程度調節器(低/中/高/最大),可依請求在成本與能力之間取捨;以及歷代 Opus 中最強的安全防護。如果你已經基於 Claude 開發,升級風險低且不會增加帳單;如果你正要在各大旗艦模型之間做選擇,Opus 5 現在是兼具價值與品質的領導者——請用自己的工作負載來驗證。
關鍵要點
• 現在獨立排名第一。Artificial Analysis 將 Claude Opus 5 (max effort) 以 61 分列於其智能指數上——為排名最高的模型,領先 Fable 5 (60 分)。
• 價格僅為 Fable 5 的一半。每 1M tokens 收費 $5 / $25,與 Opus 4.8 相同,且僅為 Fable 5 收費 $10 / $50 的一半——以中階價格提供前沿領先的品質。
• 新的努力刻度。低/中/高/最大設定以代幣(成本)換取能力;「最大」是排行榜頂端,較便宜的設定仍能擊敗大多數對手。
• 專為代理程式和電腦使用而打造。Anthropic 強調完成多步驟任務(AutomationBench)和驅動真實的使用者介面(OSWorld 2.0),而不僅僅是單一答案。
• 最安全的 Opus 版本。Anthropic 稱其為「最對齊的 Opus 模型」,預計其網路分類器介入頻率將比 Fable 5 減少約 85%——對合法工作的錯誤拒絕更少。
• 廣泛的即時可用性。在 Claude Max 上為預設模型,在 Claude Pro 上為最強大的模型,並且從第一天起就在 API、Claude Code 和 Claude Cowork 上提供。
閱讀本簡報的注意事項:所有歸因於 Anthropic 的內容均為發布資料中的廠商聲明;獨立數據(智慧指數)則歸屬於 Artificial Analysis。若某項數字尚未公佈(如獨立的 SWE-bench Verified 分數),我們會如實說明而非猜測。
Claude Opus 5 到底是什麼
Opus 5 是 Anthropic Opus 系列的最新成員——屬於「重量級」層級,高於 Sonnet 和 Haiku。它位於 Opus 4.8 之上,在獨立智能指數中已微幅超越 Anthropic 2026 年 6 月的旗艦前沿模型 Fable 5。它的突出之處並非能力的小幅提升,而是組合:近乎頂尖的智慧,配上工作馬級的價格。Anthropic 將其描述為「深思熟慮且主動積極」的模型,針對編碼、代理工作流程及日常企業辦公室工作而設計。
具體來說,Opus 5 每100萬輸入代幣收費5美元,每100萬輸出代幣收費25美元。這與 Opus 4.8 相同,是 Fable 5 收費(10美元/50美元)的一半。它是 Claude Max 的預設選項,也是 Claude Pro 上最強大的選項,並且從發佈日起可透過 Claude API、Claude Code(用於編碼)和 Claude Cowork(用於協作代理工作)使用。上下文視窗為 Opus 系列100萬級。
究竟有什麼新內容?
最明確的發佈日訊號是Anthropic的Frontier-Bench v0.1,這是一套高難度的推理與任務組合:Opus 5得分43.3%,而Fable 5為33.7%,Opus 4.8則為18.7%。在該基準測試中,Anthropic較便宜的新模型超越了自家較昂貴的旗艦機種——這項說法之後也獲得了獨立評分機構的呼應。
另外兩個供應商基準測試填補了「為實際工作而生」的故事。在 Zapier 的 AutomationBench 上,該基準測試衡量模型是否能夠將業務任務從頭到尾完成,而不僅僅是開始執行,Anthropic 表示 Opus 5 的通過率大約是成本相當的下一個最接近模型的 1.5 倍,而且即使是最便宜的設置也擊敗了所有競爭對手的最佳結果。在 OSWorld 2.0(一個電腦使用基準測試)上,Anthropic 報告 Opus 5 在各個價格點上均優於競爭對手,並以約三分之一的預算超越了 Fable 5 的峰值成績。Opus 5 還在 Anthropic 追蹤的所有生命科學評估中優於 Opus 4.8,其中最大的進步——超過 10 個百分點——出現在有機化學任務上,例如從光譜數據讀取分子結構。
努力調節器:只為你需要的功能付費
最引人注目的功能——也是多數評測者聚焦的——是努力程度設定。Opus 5 讓您選擇模型在回答請求時付出多少努力:低、中、高或最高。更高努力意味更多內部推理令牌(因此成本更高、延遲更大)和更高品質;更低努力節省令牌,獲得更快、更便宜的答案。實際上,這是您 AI 帳單上的一個調節旋鈕。
這就是為什麼 Artificial Analysis 列出了幾個 Opus 5 條目(medium、high、xhigh、max):每個努力等級都是成本-品質曲線上的不同點。「max」設定目前以 61 分位居智慧指數榜首;較低的設定則以些許品質換取每項任務實質更低的成本,而根據 Anthropic 的說法,即使是這些較低設定,也勝過多數競爭對手的最佳成果。實際上,這意味著單一模型既能服務你對延遲敏感、高流量的呼叫(low/medium),也能處理你最困難的推理工作(high/max)——你可以依請求進行調整,而不必切換模型。

基準測試深度解析:這些測試實際測量的是什麼
在信任每個數字之前,了解其含義是有幫助的。Artificial Analysis Intelligence Index是一個由第三方運行的許多獨立評估(推理、數學、編碼、知識)的綜合;61分使Opus 5在170個模型中排名第一,這是這裡最可信的單一訊號,恰恰因為Anthropic沒有運行它。Frontier-Bench v0.1(Opus 5為43.3%)是Anthropic自己的困難測試集——一個相對訊號,表明Opus 5解決了比Fable 5(33.7%)或Opus 4.8(18.7%)更困難的問題,而不是學校意義上的「43%正確」。
AutomationBench和OSWorld 2.0比單一的推理分數更重要,如果你的使用場景是代理程式。AutomationBench 獎勵任務完成——一個僅起草郵件的代理與一個實際提交費用報告的代理之間的差異——而 OSWorld 2.0 獎勵操作真實電腦介面的能力。Anthropic 宣稱 Opus 5 以三分之一的成本達到了 Fable 5 的 OSWorld 頂峰,如今 Intelligence Index 證實了其綜合地位,這成為將代理工作負載遷移到 Opus 5 的有力論據。唯一的缺口:目前尚無針對 Opus 5 的獨立審計的 SWE-bench Verified 數據(Fable 5 為 95.0%,Opus 4.8 為 88.6%),因此若需純粹的編碼準確性引用,請等待該數字。

實際上的成本是多少
按token定價是抽象的,按任務計價才會反映在帳單上。以一個代表性的代理步驟為例:20,000個輸入token和3,000個輸出token。Opus 5(以及Opus 4.8):輸入20k × $5/1M = $0.10,輸出3k × $25/1M = $0.075,所以每次呼叫約$0.175。Fable 5 定價$10 / $50:輸入$0.20加輸出$0.15,約$0.35——大約是兩倍。若每月執行10萬次這類呼叫,Opus 5 約需$17,500,而Fable 5 則約需$35,000。由於《智能指數》現在將Opus 5評為超越Fable 5,這不再是「接近Fable 5但更便宜」——而是領先同級的品質,月費卻大約只有其一半。
努力程度調整再次改變了運算方式。高流量的支援管道可以將大多數通話設定為低或中等努力程度——這比上述數字更便宜——並將最高努力程度保留給少數真正棘手的問題。Anthropic 的觀點是,即使便宜的設定也能勝過競爭對手的最高水準,因此你很少需要為未使用的功能付費。請根據自身情況模擬不同的努力程度組合,而不是假設每次通話都使用最高設定。
如何访问并使用 Claude Opus 5
Opus 5 現已在五個地方立即提供:Claude.ai(在 Max 方案中為預設模型,在 Pro 方案中為最強選項)、Claude API(模型 ID 見 Anthropic 文件)、Claude Code(用於終端機和 IDE 編碼)以及 Claude Cowork(用於協作、多步驟的代理工作)。API 使用者將 effort 等級設為參數,因此成本與能力之間的取捨可依每個請求程式化調整。如果您已經呼叫 Opus 4.8,切換只需更改模型 ID,價格不變——這是 Anthropic 近期推出的摩擦最低的升級。
適用對象:三種情境
1. 代理型與電腦使用管線
如果你的產品運行多步驟代理程式或驅動瀏覽器或桌面,Opus 5 的 AutomationBench 和 OSWorld 2.0 結果正是針對你而設——如今獲得獨立 #1 智能指數的支持。以中等努力執行大部分步驟,並對困難步驟升級至高/最大;在承諾之前先在你自己的代理程式追蹤上進行試點。
2. 關注預算的編碼團隊
Opus 5 從第一天起就以 Opus 4.8 的價格納入 Claude Code。憑藉智慧指數的領先優勢,它成為了強大的預設編碼工具;唯一缺少的是獨立的 SWE-bench Verified 數據(Fable 5 仍以 95.0% 的成績保有該項紀錄)。對於已在使用 Claude 的團隊來說,此次升級風險低且無需承受價格上漲。
3. 企業標準化於單一模型
廣泛可用性、1M級上下文、最安全的Opus對齊設定檔,以及涵蓋廉價批量處理與高難度推理的力度調節器,讓Opus 5成為混合辦公與工程工作的合理單一預設方案——其成本遠比前沿旗艦更容易合理化。

安全與對齊
Anthropic 將 Opus 5 定位為其最安全的 Opus 版本:「最具一致性的 Opus 模型」,以及「最不易被誘導誤用的模型」。一個實際後果對真實部署至關重要:Anthropic 預期 Opus 5 的網路分類器干預頻率將比 Fable 5 減少約 85%。換言之,這意味著在合法的安全、程式碼或研究工作上,錯誤拒絕的情況將會減少——這是高度設防的尖端模型常見的困擾——同時仍能有效阻止真正的濫用行為。一如既往,請根據您自身的內容與合規要求進行驗證,而非僅憑此立場照單全收。
Fable 5 的出口管制故事現在已在系統提示中。
Fable 5 的發布一點也不順利,而這個背景對任何將 Claude Opus 5 與之比較的人來說都很重要。三天後,也就是在 Claude Fable 5 與 Claude Mythos 5 於 2026 年 6 月 9 日推出之後,Anthropic 為了遵守美國商務部的出口管制命令,暫停了這兩款模型;管制於 6 月 30 日解除,7 月 1 日恢復存取。這一系列事件有據可查——Simon Willison 即時目睹 Anthropic API 開始回傳錯誤,Anthropic 也發布了關於暫停與恢復的聲明。
新的地方在於 Opus 5 如何處理關於它的問題。該模型的訓練截止日期是 2026 年 5 月,因此停用及其逆轉都不在它學到的範圍內。紅隊成員 Pliny the Liberator 於 7 月 25 日發布的大約 20 萬字元的Claude Opus 5系統提示——Anthropic 尚未確認該文件與生產版本相符——記錄了完整的時間線,並指示模型如實回答有關停用的問題,而不是否認;當無法確認當前狀態時,引導使用者查閱 Anthropic 的官方聲明。這是供應商將截止日期後的歷史寫入提示、使模型不會對自身家族即興編造的一個具體例子。
何時不應使用
當您特別需要一個經過獨立審計的 SWE-bench Verified 編碼數字來引用時,請不要去拿 Opus 5——那個數字尚未發布,而 Fable 5 (95.0%) 仍然佔據它。不要假設每個努力設定都是第一名;排行榜上最高的 61 是最大設定,較低的設定會以犧牲一些品質來換取成本,因此請對您實際將運行的努力級別進行基準測試。對於純粹的高吞吐量、延遲敏感的文本且無需推理需求,一個更便宜的效率層級模型(例如 Gemini 3.6 Flash ,價格為 $1.50 / $7.50)仍將在每個令牌上更便宜——Opus 5 是一個推理和代理模型,不是大量文本模型。
常見問題
Claude Opus 5 要多少錢?
$5 per 1M input tokens and $25 per 1M output tokens — the same as Opus 4.8, and half of Fable 5's $10 / $50. [Anthropic]
Opus 5真的是#1模型嗎?
在Artificial Analysis Intelligence Index上,是的,截至本文撰寫時:Claude Opus 5(最大努力)在170個模型中領先,得分61,領先Fable 5的60分。這是一個獨立評分,並非供應商宣稱。其他排行榜和您自己的工作負載可能排名不同,且排名會隨著模型的加入而變化。
什麼是努力刻度盤?
一種按請求設定的選項(low/medium/high/max),透過權衡 token——進而影響成本與延遲——來換取能力。Max 在排行榜上居首;較便宜的設定依然能擊敗多數競爭對手(根據 Anthropic)。API 使用者將其作為參數設定。
Opus 5 是否比 Fable 5 更好?
在獨立的智慧指數(61 對 60)和 Anthropic 的 Frontier-Bench v0.1(43.3% 對 33.7%)上,是的——價格卻只要一半。Fable 5 仍然在獨立測量的 SWE-bench Verified(95.0%)上領先,因此就純粹的程式碼準確度引用而言,Fable 5 保留了那個特定的桂冠。
Opus 5 與 Opus 4.8 相比如何?
Same $5/$25 price, materially higher vendor benchmarks (Frontier-Bench v0.1 43.3% vs 18.7%) and gains across every tracked life-sciences eval, plus the new effort dial and safer alignment. For existing 4.8 users it's a free-of-price-increase upgrade.
它有多安全?
Anthropic 稱其為最對齊的 Opus 模型,也是最不容易被濫用的版本,並預期其網路分類器的干預頻率將比 Fable 5 降低約 85%——對合法工作的錯誤拒絕通常會更少。
Claude Opus 5 可以在哪裡使用?
Claude.ai (Max 上的預設,Pro 上最強大), Claude API, Claude Code 和 Claude Cowork — 自 2026 年 7 月 24 日起上線。
上下文窗口?
Opus系列1M令牌類別(Opus 4.8為1M,無長文本附加費)。Anthropic尚未單獨公布Opus 5的數據,因此在確認之前將其視為1M類別。
它是否支援圖片或影片?
Opus 5 主要是一個文字與工具推理模型。針對重度多模態(圖像/影片)理解,像Gemini 3.1 Pro這類模型是專為此設計的;請使用 Opus 5 進行文字、程式碼和代理相關任務。
底線
Claude Opus 5 的意義不僅止於定價調整。它的定價像一匹工作馬——$5/$25,只有 Fable 5 的一半,與 Opus 4.8 相同——但現在它以 61 分(最大努力)領先獨立 Artificial Analysis Intelligence Index,背後有強大的廠商基準(Frontier-Bench v0.1 43.3%、AutomationBench、OSWorld 2.0)、一個真正實用的努力度旋鈕,以及所有 Opus 中最安全的對齊設定檔。唯一需要注意的是仍缺失獨立的 SWE-bench Verified 分數,而 Fable 5(95.0%)仍握有程式碼準確度的引用。對現有 Claude 用戶而言,升級風險低且不會提高帳單;對其他人來說,Opus 5 現在是品質價格比最難超越的模型——請在你的實際工作負載中驗證它,並透過 OrcaRouter 的唯一 OpenAI 相容端點,將其與所有競爭對手一起路由。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
