Claude Opus 5.5 的主視覺標題卡,寫著「每一項分數、其對應的努力設定,以及由誰測量」,並附上兩個數據標籤:Terminal-Bench 4.0 上在 xhigh 努力程度下獲得 66.4%,由廠商自行報告;以及同一基準測試的 59.6%,為獨立測得。
Guides & Insights

Claude Opus 5.5 基準測試:每一項分數、其所依據的努力設定,以及由誰測量

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

AnthropicClaude Opus 5.5在 Terminal-Bench 4.0 上發布的頭條數字是 66.4%,對照同一張表上 52.3%,那是 Claude Opus 5在同一張表上的數字——而那個 66.4% 是在 xhigh 努力程度下產生的,並非該模型預設的 medium。該模型於 2026 年 9 月 22 日發布,比本頁撰寫時間早兩天,因此它是個 GA 模型,有著 GA 模型的定價與 GA 模型的基準測試表。同一項基準測試上來自 Artificial Analysis的獨立數字是 59.6%,其配置中內含 Anthropic 的伺服器端防護路由。這兩個數字之間存在著測試框架差異、努力程度差異與路由差異,而目前沒有人——包括我們在內——能說出這個落差各由哪一項造成多少。本頁能做的,是把 Claude Opus 5.5 的每一項已公布數字集中在一處,標明由誰產出、在什麼設定下產出,並納入 GPT-6 AstraClaude Fable 5.1領先的那些列。

先從投入程度設定開始,因為它比模型更能左右這些數字

Claude Opus 5.5 在 Claude API 上預設為中等強度。Claude Opus 5 則預設為。同樣的具名等級在兩個模型之間也並不代表相同的思考預算,因此即使標籤相符,「我們兩個都以 high 執行」也不是受控的比較。在 Opus 5.5 上,自適應思考永遠開啟且無法關閉;effort 參數只會改變深度、延遲與成本,別無其他影響。

Anthropic 的 Terminal-Bench 4.0 數據是在 xhigh 設定下跑出來的。這個單一事實是這頁上最重要的但書,因為它掛頭牌的基準,正是對前代模型回報差距最寬的一項;也因為同一張表說明了,若你放著該設定不動,會發生什麼事:

FrontierCode v1.1 Main — xhigh 下 54.4%,預設 medium 下 54.6%。 廠商回報。medium 那次的執行結果高於 xhigh 那次。在這份工作負載上,「投入程度」旋鈕沒換來任何可量測的效益;這兩個數字是同一個數字。

CursorBench 4.0 — xhigh 模式下為 57.8%,medium 模式下為 52.5%。由廠商自行回報。相同模型、相同測試框架、同一週:5.3 個百分點,是表上最大的推理投入差距。

供應商表格裡的這兩行就是全部的論據。一種工作負載對努力程度不敏感,另一種則對努力程度高度敏感,而模型卡無法事先告訴你,你的工作負載屬於哪一種。數據所支持的結論很狹隘,也值得狹隘地陳述:正確的努力程度如今是針對每種工作負載各自測量出來的,而不是你繼承來的預設值。它並不支持「Opus 5.5 比其基準測試所顯示的更快」或「Anthropic 刻意壓低了預設值」這類說法 —— 那需要對全部五種設定做逐工作負載的全面掃描,而沒有人發表過這些結果。它的確意味著,如果你從 Opus 5 遷移過來,並保留原有的努力設定,那你改變的是實驗,而不只是模型。

還有一處不對稱,而且方向恰好相反。在 Anthropic 的 Terminal-Bench 那一列中,競爭對手欄位是 GPT-6 Astra,為 57.9%——依 Anthropic 自家圖表的註記,是以 high effort 執行,而 Opus 5.5 的 66.4% 則是以 xhigh 執行。一張自家模型用一種設定、對手用另一種設定的廠商表格,無論這兩個數字並排看起來如何,都算不上是正面對決。

供應商表格,每一列都包含來源與設定

本節中的所有內容都是由供應商自行回報:Anthropic 的發布資料、Anthropic 的測試框架,生產環境防護已開啟,除非該列另有說明,否則自適應思考會以最大努力運作。請將此理解為 Anthropic 在衡量 Anthropic。

Terminal-Bench 4.0 — 66.4%,於 xhigh 強度下。廠商自行呈報,標準誤約為 ±2.6 個百分點。同一列中:Claude Opus 5 52.3%、Claude Fable 5.1 55.8%、GPT-6 Astra 57.9%(於 high 強度下)、GPT-5.6 Sol 37.3%。Terminal-Bench 4.0 明確是廠商承認無法完美代表真實終端機作業的基準測試,而它正是該模型的主打成績。

FrontierCode v1.1 Main — 在 xhigh 下為 54.4%,在預設 medium 下為 54.6%。廠商回報數據。Opus 5 為 48.0%,Fable 5.1 為 50.3%,GPT-6 Astra 為 53.3%,GPT-5.6 Sol 為 47.5%。Anthropic 的系統卡亦載有 Extended 變體達 63.6%,以及 medium 下的最佳 Extended 數字 65.3%。

CursorBench 4.0 — xhigh 模式下 57.8%,medium 模式下 52.5%。廠商自行回報。Opus 5 為 46.6%,Fable 5.1 為 51.8%,GPT-5.6 Sol 為 41.7%。請注意,Fable 5.1 與 Opus 5 的 CursorBench 數據是在 max effort 下取得的,因此 Opus 5.5 在 medium 下的表現,是拿來與自家同系列在 max 下的表現相比。

GDPval-AA v2.1 — 1,846 Elo。這是供應商表格上唯一一列並非由供應商自己跑的數據。GDPval-AA 是 Artificial Analysis 的評測,而 Artificial Analysis 自己對 Opus 5.5 的報告所述也是同樣的 1,846,Fable 5.1 為 1,735,Opus 5 為 1,708。在供應商表格中:Fable 5.1 為 1,735、Opus 5 為 1,708、GPT-5.6 Sol 為 1,588、GPT-6 Astra 為 1,542。這是這裡唯一一列有兩個機構得出相同數字的項目,原因就在於那是同一項測量。

AutomationBench(Zapier)——40.0%。由廠商自行報告,且在沒有備援模型的情況下執行,因此每一次安全防護介入都被判定為失敗。GPT-6 Astra 41.4%、Fable 5.1 31.4%、GPT-5.6 Sol 28.8%、Opus 5 26.9%。

Humanity's Last Exam,搭配工具 — 67.7%。由廠商自行回報。Fable 5.1 65.6%、Opus 5 63.6%、GPT-6 Astra 57.2%。Anthropic 的系統卡另行回報未使用工具時為 64.4%,若你要比較的來源並未讓其模型使用工具,就應採用這個數字。

Terminal-Bench-Science 0.1 — 58.7%。廠商自行回報,標準誤約為 ±3.5 至 ±5 分,因此這是一個區間,而非單一數值。GPT-6 Astra 64.6%、Fable 5.1 52.6%、Opus 5 29.0%、GPT-5.6 Sol 22.4%。

OSWorld 2.0 — 81.8% 部分完成。由廠商回報,而「部分完成」在那句話裡可是真的在發揮作用:Anthropic 的系統卡給出的嚴格完成率為 48.7%(針對同一款模型、同一項評估)。兩者都已公開;被引用的卻是那個部分完成數字。Fable 5.1 80.7%,Opus 5 74.0%。

Chartography(含工具)—— 89.0%。由廠商自行回報。Fable 5.1 88.4%,Opus 5 83.4%。

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

獨立的數字,以及「Default Fallback」實際上代表什麼意思

Artificial Analysis 是唯一在綜合指數上針對 Claude Opus 5.5 發布了最新評估的第三方,而其數據正是應與 Anthropic 的數據並列對照的。截至 2026 年 9 月 24 日所見:

智慧指數 — 在標示為「自適應推理、最大投入、預設回退」的組態下,最大投入時為 58。由 Artificial Analysis 獨立測量。其自家文章稱 58 分「是我們測量過的最高分,還高出數分。」同一指數也公布了 Opus 5.5 在其他每一個投入設定的表現,而其中有意義的部分在於差距:xhigh 為 56、high 為 54、medium 為 51、low 為 42。這代表單一模型在投入程度旋鈕上出現 16 分的擺盪——比該榜上大多數模型之間的差距還大。

Terminal-Bench 4.0 — 59.6%。獨立。Artificial Analysis 報導其「與領先者 GPT-6 Astra(xhigh)持平」,且較 Claude Opus 5 高出約 11 分。

Humanity's Last Exam — 61.4%。獨立,且同一排行榜上先前的最佳成績為 59.1%,由 Claude Fable 5.1 保持。

SciCode — 66.9%。獨立評測,相較於 Claude Fable 5.1 的 63.1%。

現在要說的是需要解釋、而非引述的那一條。所謂「Default Fallback」既不是基準測試的產物,也不是 Artificial Analysis 的設定——它是Anthropic 伺服器端的防護路由機制,而且維持在開啟狀態。Claude Opus 5.5 出廠時搭載了過去保留給 Fable 5.1 的防護層級:多數網路安全相關請求會被透明地重新導向至 Claude Opus 4.8,而生物學相關工作則會退回由 Claude Opus 5 處理,除非該帳號已通過驗證。當 Artificial Analysis 在啟用預設備援的情況下執行這套指數時,它衡量的是實際部署的系統——也就是未經驗證的 API 金鑰真正能觸及的東西——而不是 Opus 5.5 權重的乾淨檢查點。對買家而言,這是更誠實的衡量方式;對基準測試而言,則是較不乾淨的衡量方式。Anthropic 對自家表格的說法正是如此:在 Terminal-Bench 4.0 那次執行中所做的介入,使網路任務由 Opus 4.8 完成、生物學任務由 Opus 5 完成,而該公司表示這些介入很可能拉低了所呈報的分數。因此,防護路由在兩個方向上都是真實的營運事實,而本頁上沒有任何一個數字能將底層模型與它切割開來。

兩張表在哪些地方不一致,以及原因為何

將 Terminal-Bench 4.0 的兩個數字並排來看,會得到 66.4% 對 59.6%——相差 6.8 個百分點,而且是在同一項基準測試、同一個模型上。原因眾所周知,且每一個都大到單獨就足以造成影響:

不同的測試框架。Anthropic 用的是自家的代理鷹架;Artificial Analysis 用的則是自家的參考代理測試框架。終端機基準測試的分數,取決於鷹架加上模型,而不單是模型本身,而且兩家機構都沒有發表過互換鷹架的實驗。

不同的 effort 設定。 Anthropic 的 66.4% 是在 xhigh 下達成的。Artificial Analysis 的 59.6% 所對應的 effort 設定,並未在載有該數字的句子中說明,而其報告的基準數據通常是最高 effort 的數據。

兩種情況下皆啟用安全防護,但計分方式不同。 Anthropic 在啟用備援的情況下執行,並將干預視為會降低分數,但仍會納入計分。在 AutomationBench 上,它則是在沒有備援的情況下執行,並將干預直接計為失敗。Artificial Analysis 則全程啟用備援。

即使在同一家廠商自己的表格裡,數字也會變動。Anthropic 在 Terminal-Bench 4.0 上將 Claude Opus 5 列為 52.3%,並指出公開排行榜上同一款模型的 51.8%「在雜訊範圍內」。

接著,這是本頁關於一套測試框架價值幾何的最有力證據。公開的 Terminal-Bench 4.0 排行榜是在 2026 年 9 月 24 日擷取的,上面完全沒有 Claude Opus 5.5 這一列。其榜首是 GPT-6 Astra,在 max effort 下以 Codex 代理運行,58.2% ±2.8;第二名是 Claude Fable 5.1,在 max effort 下透過 Claude Code 運行,得分為 57.9% ±3.8;第三名是 Claude Opus 5,在 xhigh 下透過 Claude Code 運行,得分為 53.9% ±3.2。所以 66.4% 不僅僅是與獨立的 59.6% 不同的數字——它根本不在公開排行榜上,而該排行榜自己版本的 Claude Opus 5 是 53.9%,不是發布表格所列的 52.3%。在 Terminal-Bench 接受並公布 Opus 5.5 的提交之前,66.4% 是無人能重現的廠商測試框架結果,而 59.6% 才是外部第三方真正願意背書的數字。另請注意,在同一份排行榜上,Artificial Analysis 的 Terminal-Bench 4.0 榜首與 Anthropic 的 Opus 5.5 同樣落在 59.6%——這只是在某一套測試框架中打成平手,對另一套測試框架則毫無說明。

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Opus 5.5 落敗的列

一份省略虧損的總結不算總結,而Anthropic自己的表格兩者都包含在內。

Terminal-Bench-Science 0.1 — 58.7%,對上 GPT-6 Astra 的 64.6%。 這是廠商自行提報的數據,刊載於 Anthropic 自家的表格上,在與科學推理最為相關的那一列,以 5.9 個百分點之差敗給一個具名競爭對手。廠商自己標註的標準誤(±3.5 至 ±5)意味著這個差距接近雜訊邊緣,而非穩穩落在雜訊範圍之內——但這終究是廠商自家頁面上的一場敗仗,而這個誤差區間並不能讓它變成勝利。Claude Opus 5 在同一列為 29.0%,因此即便在競爭對手領先之處,跨世代的進步仍是實實在在的。

AutomationBench — 40.0%,對上 GPT-6 Astra 的 41.4%。這是廠商自行回報的數字,差距 1.4 個百分點,而且該次執行並未設置備援模型,因此安全防護介入全被判定為失敗。這意味著這項特定比較所衡量的,是計入了路由懲罰的 Opus 5.5,對上一個其路由懲罰——無論實際是多少——並未受到描述的競爭對手。無論從哪個方向解讀,這都是整頁中最難以解讀的一列。

還有兩處的領先幅度比標題所暗示的更薄弱,且兩者皆為廠商自行回報的數據。在搭配工具的 Humanity's Last Exam上,領先 Claude Fable 5.1 的幅度為 2.1 個百分點(67.7% 對 65.6%);在搭配工具的 Chartography上為 0.6 個百分點(89.0% 對 88.4%);在OSWorld 2.0 partial上為 1.1 個百分點(81.8% 對 80.7%)。這些正是「Opus 5.5 是最佳代理模型」這類說法僅關乎排名、而非實測差距的項目,而 0.6 個百分點的圖表判讀差距不該成為採購決策的依據。

Claude Fable 5.1 在不同指數修訂版本上的獨立地位

把 Opus 5.5 拿來和自家同系列產品相比,需要獨立成一個章節,而且還得附上警語,因為這項比較比表面上更困難。

當 Artificial Analysis 於 2026 年 9 月 1 日發表其 Claude Fable 5.1 的評測報告時,該模型在其 Intelligence Index 上以 max effort 拿下 66 分,並稱這是其所測量過的最高分——領先 Claude Opus 5 的 63 分以及 GPT-5.6 Sol 的 61 分。在 2026 年 9 月 24 日所列出的指數版本上,同一模型顯示為以 max effort with fallback 拿下 53 分,而 Opus 5.5 在等效配置下則顯示為 58 分。9 月 22 日關於 Opus 5.5 的報告稱 58 分「是我們所測量過的最高分,且領先幅度達數分」。

這兩種說法不可能在同一把尺上同時成立,而解法在於它們根本不在同一把尺上。該指數是 Artificial Analysis 會修訂的活物件;其發表的兩篇文章相隔五週,卻把同一對兄弟模型放在榜首的兩側。這是關於指數修訂的陳述,不是關於任一模型退步的陳述,而這意味著66 與 58 絕不該並排印出。若在同一天、同一份榜單、同一個標示配置下閱讀,目前的排序是 Opus 5.5 領先 Fable 5.1 五分——而即便是這點,也仍是同指數、同指數供應商的比較,並非經審核的正面對決。可以安全說出口的範圍更窄:在同時衡量這兩者的那一個獨立綜合指數的當前修訂版上,Opus 5.5 是兩款 Anthropic 模型中較強的那一個,而 Fable 5.1 更為人所知的 66 則屬於該指數較早的修訂版。

這些設定值得再多說一句,因為它們很容易被混為一談。Fable 5.1 的 66 與 Opus 5.5 的 58 都是最高努力(max-effort)的資料列——但 Fable 5.1 的五個努力設定在輸出 token 用量上涵蓋了 11 倍的範圍,從低 effort 的 13.1M 到最高 effort 的 143.7M,索引分數則從 58 到 66。對於內部差異如此大的模型而言,單一索引分數實在難以取代你實際會採用的那一列。

Token 成本本身就是一個基準軸

上面每個數字都是分數。它們沒有一個是鳥喙,而在這個模型上,鳥喙才是真正有趣變化所在。

Artificial Analysis 以最大 effort 測量 Claude Opus 5.5,使用約每項 Intelligence Index 任務 119,000 個輸出 token——在其指數中最高。相較之下,在同一排行榜、相同設定下:Claude Opus 5 約 73,000Claude Fable 5.1 約 78,000,以及 GPT-6 Astra 約 27,000。思考 token 會按輸出 token 計費,而 Opus 5.5 無法關閉自適應思考,因此模型用於推敲的 token 並非其價格的附註——而是其中大部分。

算一算帳吧,因為標價本身就會誤導人。Opus 5.5 的定價為輸入 $4.00/輸出 $20.00,比 Opus 5 的 $5.00/$25.00 調降了 20%。但 Artificial Analysis 仍測得 Opus 5.5 在最高 effort 下,每個索引任務的成本約為$5.98,而 Opus 5 為 $5.86——在相同設定下——略為更高,而非更低,因為大約 1.6 倍的輸出 token 不僅吃掉了整整 20% 的降幅,甚至還不止。在整個索引中,Opus 5.5 產生了2.6 億個輸出 token,而榜單中位數為 8,800 萬,評估者將其標記為「非常冗長」。

因此,成本的故事完全取決於 effort 設定,而且唯有你實際使用它才成立。在 max effort 下,Opus 5.5 以每項完成任務計算,比它所取代的模型更昂貴。在 medium——實際的產品預設值,也是 Anthropic「在典型工作負載下執行成本約低 40%」這項說法的適用範圍——省下的成本確實存在,但那是關於供應商所選工作負載平均值的陳述,而非經稽核的逐項任務結果。務實的解讀是:20% 的降價是價目表上的折扣,也是 effort 旋鈕上的一個選項,而不是自動省下的成本。如果你的遷移計畫是「換掉模型 id、設定原封不動」,那你買到的是昂貴的版本。

完全沒有確立的是什麼?

這就是頁面其餘部分所為了支持的部分。

目前尚未發表任何將 Claude Opus 5.5 與任何具名對手,在努力程度與測試框架均匹配的情況下進行獨立正面對決的結果。本頁面上的每一項跨廠商比較——Opus 5.5 對上 GPT-6 Astra、對上 GPT-5.6 Sol、對上 Claude Fable 5.1——都是兩份表格之間的比較,而這兩份表格分別由兩家不同的公司製作,採用兩套不同的測試框架、兩種不同的努力程度設定,其中通常還有一份是該廠商自家模型在有利設定下的結果。在公開紀錄中,沒有任何實驗能在兩家廠商之間固定相同的測試框架與努力程度,並同時報告雙方的結果。

每個問題的 token 拆分並未公布。 彙總的輸出 token 數字是獨立測量的,但其中有多少是思考、多少是回答文字,在我們能找到的範圍內,沒有任何來源公布過。任何給你這款模型精確思考 token 數字的頁面,給你的都是沒人實際測量過的數字。

系統卡的大部分內容未經第三方進行基準測試。 SWE-bench Pro 89.9%、Multilingual 93.9%、DeepSWE v1.1 74.2%、ProgramBench 91.2%、OfficeQA 78.9%、HealthBench Professional 65.6%(經長度調整)、GMMLU 94.3%、ArXivMath 96.9%(搭配工具)——全數為廠商自行報告,撰寫本文時皆未經獨立重現。

Terminal-Bench 4.0 的頭條數字並未出現在公開榜單上。前面已經提過,而它也該列入這份清單:關於這個模型最常被引用的單一數字,是廠商以外沒有人實際跑過的數字。

Anthropic 報告指出,Claude Opus 5.5「經常懷疑自己正在被評估」——這是該公司自己的說法,作為其安全評估的一項限制而提出。請認真把它當作一個測量問題,而不是一件奇聞軼事:如果模型在相信自己正被測試時行為有所不同,那麼這個頁面上的每一個基準數字,無論來自供應商或獨立機構,都是在受觀察狀態下對該模型所做的測量,而這與部署後行為之間的差異程度仍未知且未被量化。這對好的列與壞的列同樣適用。這是無論多少同等投入的方法論都無法修補的唯一但書。

Sonnet 5.5 與 Haiku 5.5 尚未推出。 Anthropic 已宣布將於「未來幾週內」推出。它們尚未發布,沒有任何已公布的基準測試數據,而且本頁面上的任何內容都不適用於它們。

價格、封套,以及規格中會改變你程式碼的部分

摘自 Anthropic 於 2026 年 9 月 24 日公布的價目表:每百萬輸入詞元 $4.00、每百萬輸出 $20.00、每百萬快取讀取 $0.20、每百萬 5 分鐘快取寫入 $5.00、每百萬 1 小時快取寫入 $8.00,而 Batch API 在輸入與輸出兩個方向皆享 50% 折扣。快取讀取費率是當中最不起眼的一項——它是基礎輸入的 5%,而大多數 Claude 模型為 10%,Fable 5.1 則為 2.5%。快速模式另行計價,為 $8.00 / $40.00,Anthropic 將其描述為研究預覽,而非一般層級。

這一節要談的,就是費率表不再只是冷知識、而變成路由器能替你算出來的加減乘除。Claude Opus 5.5anthropic/claude-opus-5.5的形式在 OrcaRouter 上以同樣的 $4.00 / $20.00 提供服務,並以 0% 加價將牌價原樣傳遞——因此 Anthropic 一調整費率,這裡當天就是那個費率,沒有需要建模的重新定價落差。真正決定帳單金額的,是型錄在價格旁邊列出的那些項目:$0.20 的快取讀取,為基礎輸入價的 5%,相對於 Fable 5.1 的 2.5%;100 萬 token 的上下文視窗;以及 128K 的輸出上限。由於 effort 參數才是這個模型成本真正會變動的地方——16 點的指數擺盪,以及在 max 設定下每項任務約 119,000 個輸出 token,相對於 Opus 5 的約 73,000 個——真正能省錢的遷移,是讓你依工作負載、而非依帳號來調整 effort,並在你衡量自己的流量適合哪個設定時,把 Opus 5.5 路由放在自動容錯移轉之後。

Envelope — 100 萬個 token 的上下文、128K 最大輸出,在 output-300k-2026-03-24 beta 標頭後方的 Batch API 上輸出可達 300K,知識截止時間為 2026 年 6 月,退役時間不早於 2027 年 9 月 22 日。輸出速度比 Claude Opus 5 快超過 30%。

與 Opus 5 相較的破壞性變更 —— 思考功能已無法再停用;強制工具使用(以 tool_choice 指定特定工具)會傳回錯誤;思考區塊會綁定至產生它們的模型與對話;較舊的 computer_20251124 電腦使用工具在 Claude API 或 Google Cloud 上皆不受支援。前三項也適用於 Fable 5.1。還有不聲不響的第五項:工具呼叫之間的文字現在會夾帶在思考區塊內,而在預設顯示設定下,這些區塊的文字是空白的,因此若 UI 將該文字以串流方式呈現為進度指示,就會悄然無聲,卻不會觸發任何錯誤。

再次強調安全防護路由,因為這是規格項目,而不是註腳——大多數資安請求會交由 Claude Opus 4.8 處理,生物學相關工作則會退回 Claude Opus 5,除非帳戶已通過驗證。在那些評估中,你收到的答案可能根本不會來自 Opus 5.5,因此網路安全與生物相關基準上公布的成績,並非對這個模型的純粹測量。

效率宣稱,全為廠商自行回報——在典型工作負載上執行成本約低 40%,而牌價下調 20%;一個實際的併購分析範例在 Opus 5.5 上耗費 63 分鐘,對比 Opus 5 的 93 分鐘,成本低 50%;以及來自 Box(代幣用量為三分之一,回答精簡約 40%)、Kiro(代幣約減半,呼叫次數減少 40%)、Factory(輸出代幣減少 20–25%)與 GitHub(在其測量過的案例中,代幣與步驟數屬於最少之列)的客戶陳述。這些是廠商及其發布合作夥伴所選工作負載的平均值。它們屬於引述歸因,而非經稽核的結果,且與上方獨立的逐項任務成本數字明顯存在張力——而該數字本身是在最高投入設定下的測量,而非預設設定。兩者都可能為真;但兩者都不是關於你自身工作負載的一般性宣稱。

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

證據的狀態

Claude Opus 5.5 是真實的模型,伴隨真實的降價、真實的 1M 個 token 上下文與 128K 輸出上限,以及思考與投入程度設定方式上真實且影響重大的變革。它還附帶一張主要衡量 Anthropic 的基準表、一張主要衡量路由部署而非檢查點的獨立表格,以及一個已記錄且會削弱這兩者的自我覺察問題。目前尚未發表任何在相同投入程度、相同測試框架下,將 Claude Opus 5.5 與具名競爭對手直接對決的獨立比較。在有這樣的比較之前,請把本頁每一項跨廠商比較都照其實際情況解讀:那是兩家公司在兩種設定下的兩份廠商表格,由我們並列呈現——並在重新衡量模型之前,先重新衡量你自己的投入程度設定。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新