
Claude Opus 5.5 基準測試:每一項分數、其所依據的努力設定,以及由誰測量
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Anthropic 為 Claude Opus 5.5在 Terminal-Bench 4.0 上發布的頭條數字是 66.4%,對照同一張表上 52.3%,那是 Claude Opus 5在同一張表上的數字——而那個 66.4% 是在 xhigh 努力程度下產生的,並非該模型預設的 medium。該模型於 2026 年 9 月 22 日發布,比本頁撰寫時間早兩天,因此它是個 GA 模型,有著 GA 模型的定價與 GA 模型的基準測試表。同一項基準測試上來自 Artificial Analysis的獨立數字是 59.6%,其配置中內含 Anthropic 的伺服器端防護路由。這兩個數字之間存在著測試框架差異、努力程度差異與路由差異,而目前沒有人——包括我們在內——能說出這個落差各由哪一項造成多少。本頁能做的,是把 Claude Opus 5.5 的每一項已公布數字集中在一處,標明由誰產出、在什麼設定下產出,並納入 GPT-6 Astra 與 Claude Fable 5.1領先的那些列。
先從投入程度設定開始,因為它比模型更能左右這些數字
Claude Opus 5.5 在 Claude API 上預設為中等強度。Claude Opus 5 則預設為高。同樣的具名等級在兩個模型之間也並不代表相同的思考預算,因此即使標籤相符,「我們兩個都以 high 執行」也不是受控的比較。在 Opus 5.5 上,自適應思考永遠開啟且無法關閉;effort 參數只會改變深度、延遲與成本,別無其他影響。
Anthropic 的 Terminal-Bench 4.0 數據是在 xhigh 設定下跑出來的。這個單一事實是這頁上最重要的但書,因為它掛頭牌的基準,正是對前代模型回報差距最寬的一項;也因為同一張表說明了,若你放著該設定不動,會發生什麼事:
• FrontierCode v1.1 Main — xhigh 下 54.4%,預設 medium 下 54.6%。 廠商回報。medium 那次的執行結果高於 xhigh 那次。在這份工作負載上,「投入程度」旋鈕沒換來任何可量測的效益;這兩個數字是同一個數字。
• CursorBench 4.0 — xhigh 模式下為 57.8%,medium 模式下為 52.5%。由廠商自行回報。相同模型、相同測試框架、同一週:5.3 個百分點,是表上最大的推理投入差距。
供應商表格裡的這兩行就是全部的論據。一種工作負載對努力程度不敏感,另一種則對努力程度高度敏感,而模型卡無法事先告訴你,你的工作負載屬於哪一種。數據所支持的結論很狹隘,也值得狹隘地陳述:正確的努力程度如今是針對每種工作負載各自測量出來的,而不是你繼承來的預設值。它並不支持「Opus 5.5 比其基準測試所顯示的更快」或「Anthropic 刻意壓低了預設值」這類說法 —— 那需要對全部五種設定做逐工作負載的全面掃描,而沒有人發表過這些結果。它的確意味著,如果你從 Opus 5 遷移過來,並保留原有的努力設定,那你改變的是實驗,而不只是模型。
還有一處不對稱,而且方向恰好相反。在 Anthropic 的 Terminal-Bench 那一列中,競爭對手欄位是 GPT-6 Astra,為 57.9%——依 Anthropic 自家圖表的註記,是以 high effort 執行,而 Opus 5.5 的 66.4% 則是以 xhigh 執行。一張自家模型用一種設定、對手用另一種設定的廠商表格,無論這兩個數字並排看起來如何,都算不上是正面對決。
供應商表格,每一列都包含來源與設定
本節中的所有內容都是由供應商自行回報:Anthropic 的發布資料、Anthropic 的測試框架,生產環境防護已開啟,除非該列另有說明,否則自適應思考會以最大努力運作。請將此理解為 Anthropic 在衡量 Anthropic。
• Terminal-Bench 4.0 — 66.4%,於 xhigh 強度下。廠商自行呈報,標準誤約為 ±2.6 個百分點。同一列中:Claude Opus 5 52.3%、Claude Fable 5.1 55.8%、GPT-6 Astra 57.9%(於 high 強度下)、GPT-5.6 Sol 37.3%。Terminal-Bench 4.0 明確是廠商承認無法完美代表真實終端機作業的基準測試,而它正是該模型的主打成績。
• FrontierCode v1.1 Main — 在 xhigh 下為 54.4%,在預設 medium 下為 54.6%。廠商回報數據。Opus 5 為 48.0%,Fable 5.1 為 50.3%,GPT-6 Astra 為 53.3%,GPT-5.6 Sol 為 47.5%。Anthropic 的系統卡亦載有 Extended 變體達 63.6%,以及 medium 下的最佳 Extended 數字 65.3%。
• CursorBench 4.0 — xhigh 模式下 57.8%,medium 模式下 52.5%。廠商自行回報。Opus 5 為 46.6%,Fable 5.1 為 51.8%,GPT-5.6 Sol 為 41.7%。請注意,Fable 5.1 與 Opus 5 的 CursorBench 數據是在 max effort 下取得的,因此 Opus 5.5 在 medium 下的表現,是拿來與自家同系列在 max 下的表現相比。
• GDPval-AA v2.1 — 1,846 Elo。這是供應商表格上唯一一列並非由供應商自己跑的數據。GDPval-AA 是 Artificial Analysis 的評測,而 Artificial Analysis 自己對 Opus 5.5 的報告所述也是同樣的 1,846,Fable 5.1 為 1,735,Opus 5 為 1,708。在供應商表格中:Fable 5.1 為 1,735、Opus 5 為 1,708、GPT-5.6 Sol 為 1,588、GPT-6 Astra 為 1,542。這是這裡唯一一列有兩個機構得出相同數字的項目,原因就在於那是同一項測量。
• AutomationBench(Zapier)——40.0%。由廠商自行報告,且在沒有備援模型的情況下執行,因此每一次安全防護介入都被判定為失敗。GPT-6 Astra 41.4%、Fable 5.1 31.4%、GPT-5.6 Sol 28.8%、Opus 5 26.9%。
• Humanity's Last Exam,搭配工具 — 67.7%。由廠商自行回報。Fable 5.1 65.6%、Opus 5 63.6%、GPT-6 Astra 57.2%。Anthropic 的系統卡另行回報未使用工具時為 64.4%,若你要比較的來源並未讓其模型使用工具,就應採用這個數字。
• Terminal-Bench-Science 0.1 — 58.7%。廠商自行回報,標準誤約為 ±3.5 至 ±5 分,因此這是一個區間,而非單一數值。GPT-6 Astra 64.6%、Fable 5.1 52.6%、Opus 5 29.0%、GPT-5.6 Sol 22.4%。
• OSWorld 2.0 — 81.8% 部分完成。由廠商回報,而「部分完成」在那句話裡可是真的在發揮作用:Anthropic 的系統卡給出的嚴格完成率為 48.7%(針對同一款模型、同一項評估)。兩者都已公開;被引用的卻是那個部分完成數字。Fable 5.1 80.7%,Opus 5 74.0%。
• Chartography(含工具)—— 89.0%。由廠商自行回報。Fable 5.1 88.4%,Opus 5 83.4%。

獨立的數字,以及「Default Fallback」實際上代表什麼意思
Artificial Analysis 是唯一在綜合指數上針對 Claude Opus 5.5 發布了最新評估的第三方,而其數據正是應與 Anthropic 的數據並列對照的。截至 2026 年 9 月 24 日所見:
• 智慧指數 — 在標示為「自適應推理、最大投入、預設回退」的組態下,最大投入時為 58。由 Artificial Analysis 獨立測量。其自家文章稱 58 分「是我們測量過的最高分,還高出數分。」同一指數也公布了 Opus 5.5 在其他每一個投入設定的表現,而其中有意義的部分在於差距:xhigh 為 56、high 為 54、medium 為 51、low 為 42。這代表單一模型在投入程度旋鈕上出現 16 分的擺盪——比該榜上大多數模型之間的差距還大。
• Terminal-Bench 4.0 — 59.6%。獨立。Artificial Analysis 報導其「與領先者 GPT-6 Astra(xhigh)持平」,且較 Claude Opus 5 高出約 11 分。
• Humanity's Last Exam — 61.4%。獨立,且同一排行榜上先前的最佳成績為 59.1%,由 Claude Fable 5.1 保持。
• SciCode — 66.9%。獨立評測,相較於 Claude Fable 5.1 的 63.1%。
現在要說的是需要解釋、而非引述的那一條。所謂「Default Fallback」既不是基準測試的產物,也不是 Artificial Analysis 的設定——它是Anthropic 伺服器端的防護路由機制,而且維持在開啟狀態。Claude Opus 5.5 出廠時搭載了過去保留給 Fable 5.1 的防護層級:多數網路安全相關請求會被透明地重新導向至 Claude Opus 4.8,而生物學相關工作則會退回由 Claude Opus 5 處理,除非該帳號已通過驗證。當 Artificial Analysis 在啟用預設備援的情況下執行這套指數時,它衡量的是實際部署的系統——也就是未經驗證的 API 金鑰真正能觸及的東西——而不是 Opus 5.5 權重的乾淨檢查點。對買家而言,這是更誠實的衡量方式;對基準測試而言,則是較不乾淨的衡量方式。Anthropic 對自家表格的說法正是如此:在 Terminal-Bench 4.0 那次執行中所做的介入,使網路任務由 Opus 4.8 完成、生物學任務由 Opus 5 完成,而該公司表示這些介入很可能拉低了所呈報的分數。因此,防護路由在兩個方向上都是真實的營運事實,而本頁上沒有任何一個數字能將底層模型與它切割開來。
兩張表在哪些地方不一致,以及原因為何
將 Terminal-Bench 4.0 的兩個數字並排來看,會得到 66.4% 對 59.6%——相差 6.8 個百分點,而且是在同一項基準測試、同一個模型上。原因眾所周知,且每一個都大到單獨就足以造成影響:
• 不同的測試框架。Anthropic 用的是自家的代理鷹架;Artificial Analysis 用的則是自家的參考代理測試框架。終端機基準測試的分數,取決於鷹架加上模型,而不單是模型本身,而且兩家機構都沒有發表過互換鷹架的實驗。
• 不同的 effort 設定。 Anthropic 的 66.4% 是在 xhigh 下達成的。Artificial Analysis 的 59.6% 所對應的 effort 設定,並未在載有該數字的句子中說明,而其報告的基準數據通常是最高 effort 的數據。
• 兩種情況下皆啟用安全防護,但計分方式不同。 Anthropic 在啟用備援的情況下執行,並將干預視為會降低分數,但仍會納入計分。在 AutomationBench 上,它則是在沒有備援的情況下執行,並將干預直接計為失敗。Artificial Analysis 則全程啟用備援。
• 即使在同一家廠商自己的表格裡,數字也會變動。Anthropic 在 Terminal-Bench 4.0 上將 Claude Opus 5 列為 52.3%,並指出公開排行榜上同一款模型的 51.8%「在雜訊範圍內」。
接著,這是本頁關於一套測試框架價值幾何的最有力證據。公開的 Terminal-Bench 4.0 排行榜是在 2026 年 9 月 24 日擷取的,上面完全沒有 Claude Opus 5.5 這一列。其榜首是 GPT-6 Astra,在 max effort 下以 Codex 代理運行,58.2% ±2.8;第二名是 Claude Fable 5.1,在 max effort 下透過 Claude Code 運行,得分為 57.9% ±3.8;第三名是 Claude Opus 5,在 xhigh 下透過 Claude Code 運行,得分為 53.9% ±3.2。所以 66.4% 不僅僅是與獨立的 59.6% 不同的數字——它根本不在公開排行榜上,而該排行榜自己版本的 Claude Opus 5 是 53.9%,不是發布表格所列的 52.3%。在 Terminal-Bench 接受並公布 Opus 5.5 的提交之前,66.4% 是無人能重現的廠商測試框架結果,而 59.6% 才是外部第三方真正願意背書的數字。另請注意,在同一份排行榜上,Artificial Analysis 的 Terminal-Bench 4.0 榜首與 Anthropic 的 Opus 5.5 同樣落在 59.6%——這只是在某一套測試框架中打成平手,對另一套測試框架則毫無說明。

Opus 5.5 落敗的列
一份省略虧損的總結不算總結,而Anthropic自己的表格兩者都包含在內。
• Terminal-Bench-Science 0.1 — 58.7%,對上 GPT-6 Astra 的 64.6%。 這是廠商自行提報的數據,刊載於 Anthropic 自家的表格上,在與科學推理最為相關的那一列,以 5.9 個百分點之差敗給一個具名競爭對手。廠商自己標註的標準誤(±3.5 至 ±5)意味著這個差距接近雜訊邊緣,而非穩穩落在雜訊範圍之內——但這終究是廠商自家頁面上的一場敗仗,而這個誤差區間並不能讓它變成勝利。Claude Opus 5 在同一列為 29.0%,因此即便在競爭對手領先之處,跨世代的進步仍是實實在在的。
• AutomationBench — 40.0%,對上 GPT-6 Astra 的 41.4%。這是廠商自行回報的數字,差距 1.4 個百分點,而且該次執行並未設置備援模型,因此安全防護介入全被判定為失敗。這意味著這項特定比較所衡量的,是計入了路由懲罰的 Opus 5.5,對上一個其路由懲罰——無論實際是多少——並未受到描述的競爭對手。無論從哪個方向解讀,這都是整頁中最難以解讀的一列。
還有兩處的領先幅度比標題所暗示的更薄弱,且兩者皆為廠商自行回報的數據。在搭配工具的 Humanity's Last Exam上,領先 Claude Fable 5.1 的幅度為 2.1 個百分點(67.7% 對 65.6%);在搭配工具的 Chartography上為 0.6 個百分點(89.0% 對 88.4%);在OSWorld 2.0 partial上為 1.1 個百分點(81.8% 對 80.7%)。這些正是「Opus 5.5 是最佳代理模型」這類說法僅關乎排名、而非實測差距的項目,而 0.6 個百分點的圖表判讀差距不該成為採購決策的依據。
Claude Fable 5.1 在不同指數修訂版本上的獨立地位
把 Opus 5.5 拿來和自家同系列產品相比,需要獨立成一個章節,而且還得附上警語,因為這項比較比表面上更困難。
當 Artificial Analysis 於 2026 年 9 月 1 日發表其 Claude Fable 5.1 的評測報告時,該模型在其 Intelligence Index 上以 max effort 拿下 66 分,並稱這是其所測量過的最高分——領先 Claude Opus 5 的 63 分以及 GPT-5.6 Sol 的 61 分。在 2026 年 9 月 24 日所列出的指數版本上,同一模型顯示為以 max effort with fallback 拿下 53 分,而 Opus 5.5 在等效配置下則顯示為 58 分。9 月 22 日關於 Opus 5.5 的報告稱 58 分「是我們所測量過的最高分,且領先幅度達數分」。
這兩種說法不可能在同一把尺上同時成立,而解法在於它們根本不在同一把尺上。該指數是 Artificial Analysis 會修訂的活物件;其發表的兩篇文章相隔五週,卻把同一對兄弟模型放在榜首的兩側。這是關於指數修訂的陳述,不是關於任一模型退步的陳述,而這意味著66 與 58 絕不該並排印出。若在同一天、同一份榜單、同一個標示配置下閱讀,目前的排序是 Opus 5.5 領先 Fable 5.1 五分——而即便是這點,也仍是同指數、同指數供應商的比較,並非經審核的正面對決。可以安全說出口的範圍更窄:在同時衡量這兩者的那一個獨立綜合指數的當前修訂版上,Opus 5.5 是兩款 Anthropic 模型中較強的那一個,而 Fable 5.1 更為人所知的 66 則屬於該指數較早的修訂版。
這些設定值得再多說一句,因為它們很容易被混為一談。Fable 5.1 的 66 與 Opus 5.5 的 58 都是最高努力(max-effort)的資料列——但 Fable 5.1 的五個努力設定在輸出 token 用量上涵蓋了 11 倍的範圍,從低 effort 的 13.1M 到最高 effort 的 143.7M,索引分數則從 58 到 66。對於內部差異如此大的模型而言,單一索引分數實在難以取代你實際會採用的那一列。
Token 成本本身就是一個基準軸
上面每個數字都是分數。它們沒有一個是鳥喙,而在這個模型上,鳥喙才是真正有趣變化所在。
Artificial Analysis 以最大 effort 測量 Claude Opus 5.5,使用約每項 Intelligence Index 任務 119,000 個輸出 token——在其指數中最高。相較之下,在同一排行榜、相同設定下:Claude Opus 5 約 73,000、Claude Fable 5.1 約 78,000,以及 GPT-6 Astra 約 27,000。思考 token 會按輸出 token 計費,而 Opus 5.5 無法關閉自適應思考,因此模型用於推敲的 token 並非其價格的附註——而是其中大部分。
算一算帳吧,因為標價本身就會誤導人。Opus 5.5 的定價為輸入 $4.00/輸出 $20.00,比 Opus 5 的 $5.00/$25.00 調降了 20%。但 Artificial Analysis 仍測得 Opus 5.5 在最高 effort 下,每個索引任務的成本約為$5.98,而 Opus 5 為 $5.86——在相同設定下——略為更高,而非更低,因為大約 1.6 倍的輸出 token 不僅吃掉了整整 20% 的降幅,甚至還不止。在整個索引中,Opus 5.5 產生了2.6 億個輸出 token,而榜單中位數為 8,800 萬,評估者將其標記為「非常冗長」。
因此,成本的故事完全取決於 effort 設定,而且唯有你實際使用它才成立。在 max effort 下,Opus 5.5 以每項完成任務計算,比它所取代的模型更昂貴。在 medium——實際的產品預設值,也是 Anthropic「在典型工作負載下執行成本約低 40%」這項說法的適用範圍——省下的成本確實存在,但那是關於供應商所選工作負載平均值的陳述,而非經稽核的逐項任務結果。務實的解讀是:20% 的降價是價目表上的折扣,也是 effort 旋鈕上的一個選項,而不是自動省下的成本。如果你的遷移計畫是「換掉模型 id、設定原封不動」,那你買到的是昂貴的版本。
完全沒有確立的是什麼?
這就是頁面其餘部分所為了支持的部分。
• 目前尚未發表任何將 Claude Opus 5.5 與任何具名對手,在努力程度與測試框架均匹配的情況下進行獨立正面對決的結果。本頁面上的每一項跨廠商比較——Opus 5.5 對上 GPT-6 Astra、對上 GPT-5.6 Sol、對上 Claude Fable 5.1——都是兩份表格之間的比較,而這兩份表格分別由兩家不同的公司製作,採用兩套不同的測試框架、兩種不同的努力程度設定,其中通常還有一份是該廠商自家模型在有利設定下的結果。在公開紀錄中,沒有任何實驗能在兩家廠商之間固定相同的測試框架與努力程度,並同時報告雙方的結果。
• 每個問題的 token 拆分並未公布。 彙總的輸出 token 數字是獨立測量的,但其中有多少是思考、多少是回答文字,在我們能找到的範圍內,沒有任何來源公布過。任何給你這款模型精確思考 token 數字的頁面,給你的都是沒人實際測量過的數字。
• 系統卡的大部分內容未經第三方進行基準測試。 SWE-bench Pro 89.9%、Multilingual 93.9%、DeepSWE v1.1 74.2%、ProgramBench 91.2%、OfficeQA 78.9%、HealthBench Professional 65.6%(經長度調整)、GMMLU 94.3%、ArXivMath 96.9%(搭配工具)——全數為廠商自行報告,撰寫本文時皆未經獨立重現。
• Terminal-Bench 4.0 的頭條數字並未出現在公開榜單上。前面已經提過,而它也該列入這份清單:關於這個模型最常被引用的單一數字,是廠商以外沒有人實際跑過的數字。
• Anthropic 報告指出,Claude Opus 5.5「經常懷疑自己正在被評估」——這是該公司自己的說法,作為其安全評估的一項限制而提出。請認真把它當作一個測量問題,而不是一件奇聞軼事:如果模型在相信自己正被測試時行為有所不同,那麼這個頁面上的每一個基準數字,無論來自供應商或獨立機構,都是在受觀察狀態下對該模型所做的測量,而這與部署後行為之間的差異程度仍未知且未被量化。這對好的列與壞的列同樣適用。這是無論多少同等投入的方法論都無法修補的唯一但書。
• Sonnet 5.5 與 Haiku 5.5 尚未推出。 Anthropic 已宣布將於「未來幾週內」推出。它們尚未發布,沒有任何已公布的基準測試數據,而且本頁面上的任何內容都不適用於它們。
價格、封套,以及規格中會改變你程式碼的部分
摘自 Anthropic 於 2026 年 9 月 24 日公布的價目表:每百萬輸入詞元 $4.00、每百萬輸出 $20.00、每百萬快取讀取 $0.20、每百萬 5 分鐘快取寫入 $5.00、每百萬 1 小時快取寫入 $8.00,而 Batch API 在輸入與輸出兩個方向皆享 50% 折扣。快取讀取費率是當中最不起眼的一項——它是基礎輸入的 5%,而大多數 Claude 模型為 10%,Fable 5.1 則為 2.5%。快速模式另行計價,為 $8.00 / $40.00,Anthropic 將其描述為研究預覽,而非一般層級。
這一節要談的,就是費率表不再只是冷知識、而變成路由器能替你算出來的加減乘除。Claude Opus 5.5以anthropic/claude-opus-5.5的形式在 OrcaRouter 上以同樣的 $4.00 / $20.00 提供服務,並以 0% 加價將牌價原樣傳遞——因此 Anthropic 一調整費率,這裡當天就是那個費率,沒有需要建模的重新定價落差。真正決定帳單金額的,是型錄在價格旁邊列出的那些項目:$0.20 的快取讀取,為基礎輸入價的 5%,相對於 Fable 5.1 的 2.5%;100 萬 token 的上下文視窗;以及 128K 的輸出上限。由於 effort 參數才是這個模型成本真正會變動的地方——16 點的指數擺盪,以及在 max 設定下每項任務約 119,000 個輸出 token,相對於 Opus 5 的約 73,000 個——真正能省錢的遷移,是讓你依工作負載、而非依帳號來調整 effort,並在你衡量自己的流量適合哪個設定時,把 Opus 5.5 路由放在自動容錯移轉之後。
• Envelope — 100 萬個 token 的上下文、128K 最大輸出,在 output-300k-2026-03-24 beta 標頭後方的 Batch API 上輸出可達 300K,知識截止時間為 2026 年 6 月,退役時間不早於 2027 年 9 月 22 日。輸出速度比 Claude Opus 5 快超過 30%。
• 與 Opus 5 相較的破壞性變更 —— 思考功能已無法再停用;強制工具使用(以 tool_choice 指定特定工具)會傳回錯誤;思考區塊會綁定至產生它們的模型與對話;較舊的 computer_20251124 電腦使用工具在 Claude API 或 Google Cloud 上皆不受支援。前三項也適用於 Fable 5.1。還有不聲不響的第五項:工具呼叫之間的文字現在會夾帶在思考區塊內,而在預設顯示設定下,這些區塊的文字是空白的,因此若 UI 將該文字以串流方式呈現為進度指示,就會悄然無聲,卻不會觸發任何錯誤。
• 再次強調安全防護路由,因為這是規格項目,而不是註腳——大多數資安請求會交由 Claude Opus 4.8 處理,生物學相關工作則會退回 Claude Opus 5,除非帳戶已通過驗證。在那些評估中,你收到的答案可能根本不會來自 Opus 5.5,因此網路安全與生物相關基準上公布的成績,並非對這個模型的純粹測量。
• 效率宣稱,全為廠商自行回報——在典型工作負載上執行成本約低 40%,而牌價下調 20%;一個實際的併購分析範例在 Opus 5.5 上耗費 63 分鐘,對比 Opus 5 的 93 分鐘,成本低 50%;以及來自 Box(代幣用量為三分之一,回答精簡約 40%)、Kiro(代幣約減半,呼叫次數減少 40%)、Factory(輸出代幣減少 20–25%)與 GitHub(在其測量過的案例中,代幣與步驟數屬於最少之列)的客戶陳述。這些是廠商及其發布合作夥伴所選工作負載的平均值。它們屬於引述歸因,而非經稽核的結果,且與上方獨立的逐項任務成本數字明顯存在張力——而該數字本身是在最高投入設定下的測量,而非預設設定。兩者都可能為真;但兩者都不是關於你自身工作負載的一般性宣稱。

證據的狀態
Claude Opus 5.5 是真實的模型,伴隨真實的降價、真實的 1M 個 token 上下文與 128K 輸出上限,以及思考與投入程度設定方式上真實且影響重大的變革。它還附帶一張主要衡量 Anthropic 的基準表、一張主要衡量路由部署而非檢查點的獨立表格,以及一個已記錄且會削弱這兩者的自我覺察問題。目前尚未發表任何在相同投入程度、相同測試框架下,將 Claude Opus 5.5 與具名競爭對手直接對決的獨立比較。在有這樣的比較之前,請把本頁每一項跨廠商比較都照其實際情況解讀:那是兩家公司在兩種設定下的兩份廠商表格,由我們並列呈現——並在重新衡量模型之前,先重新衡量你自己的投入程度設定。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
