一張標題卡寫著「Claude Opus 5.5 以 66 分登上 Coding Agent Index 榜首」,副標題為「代幣更便宜,任務帳單卻更貴」,下方有三張圓角卡片:Coding Agent Index 66、每項任務成本 $13.04,上升 21%,以及 Claude Opus 5:60 分,$10.79。
Guides & Insights

Claude Opus 5.5 以 66 分登上 Coding Agent Index 榜首——而任務帳單上漲 21%

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

供應商調降了Claude Opus 5.5的 token 價格,降幅 20%,時間是 2026 年 9 月 22 日。兩天後,Artificial Analysis 公布了程式碼代理(coding agent)的測量結果,顯示這波降價對代理帳單造成了什麼影響:每項任務成本上升了 21%,來到$13.04,高於$10.79同一指數對Claude Opus 5。分數也上升了——66,在 Coding Agent Index 上,Artificial Analysis 稱這是它測量過的最高分,領先 Claude Opus 5 六分,並以四分領先Claude Fable 5.1,而且是在相同配置下。這兩件事同時為真,而它們之所以能同時為真,正是這份排名的整段來龍去脈。單價更便宜的 token,若模型用得更多,就不是更便宜的任務;而在長時間代理執行、推理強度開到最大時,Claude Opus 5.5 會用掉多得多的 token。

Coding Agent Index 實際上評分什麼

這不是一份模型排行榜。上頭的每一列,都是一個harness 與模型的配對——一個在特定 coding agent 內、以特定 effort 設定運行的 checkpoint。大家都在引用的是 Claude Opus 5.5,以max effort 在Claude Code 中運行,而這正是 Anthropic 打造並據以調校的 harness。Claude Opus 5 的 60 與 Claude Fable 5.1 的 62 來自同一個 harness、同一個 effort 設定,這正是它們之所以堪稱誠實比較的原因;任一模型若換到不同的 coding agent,那一列就是不同的量測結果,不會被印在這裡當成同一回事。

這份索引有版本之分,而版本比其上所掛的品牌名稱更為重要。目前以v1.5發布的榜單,平均了三項評估,每項權重相同,且每項皆以每道任務三次嘗試平均後的 pass@1 回報:

Terminal-Bench 4.0 — 代理式 shell 與命令列工作:瀏覽檔案系統、正確使用工具、從中途的失敗中復原,並完成多步驟工作流程。

DeepSWE v1.1 — 軟體工程任務,也就是儲存庫編輯類的工作。

SWE-Atlas-QnA — 儲存庫理解問題,其答案是透過閱讀程式碼庫、而非修改它來找到的。

三項評估、一個數字,以及緊接在旁印出的每項任務成本欄位。正是這個成本欄位,讓這份指數比單一分數更為實用,也正是它,使那個頭條數字比表面上看起來更難解讀。

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

三個組成部分,以及這六個要點的由來

Artificial Analysis 在發布綜合指標的同時也公布了各組成項目列,而它們的變動並不平均:

Terminal-Bench 4.063.1%Claude Opus 5.5 對比54.5%的 Claude Opus 5,提升了8.6 個百分點。這是整組中最大的單一進步幅度。

DeepSWE v1.168.4% 對比 62.5%,上升 5.9 個百分點

SWE-Atlas-QnA66.4%對比62.1%,上升4.3 個百分點

把這三項平均起來,你會得到 66.0,也就是綜合分數。進步的分布才是有趣之處:模型在閱讀程式碼庫方面進步最少,在操作 shell 方面進步最多。Terminal-Bench 是最接近人們實際所說的「coding agent」的評測——一個長時間執行的迴圈,模型在其中選擇指令、讀取輸出,並決定下一步要做什麼,而且步驟之間沒有人類介入。在那裡躍升 8.6 分,說明的是持續使用工具的能力,而不是程式碼生成。

注意這暗示了應該預期改進出現在哪裡。如果你的工作負載是「解釋這個儲存庫」,Claude Opus 5.5 相較於 Claude Opus 5 只是小幅升級——四分。如果你的工作負載是「執行到測試套件通過,並修復壞掉的部分」,那它是表中最大的躍升。

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

排名旁邊印的數字:每項任務 $13.04

以下是讓這次降價看起來與當初公布方式不同的算術。Anthropic 對 Claude Opus 5.5 的定價為 每百萬輸入 token 4.00 美元,以及 每百萬輸出 20.00 美元,低於 Claude Opus 5 的 5.00 美元與 25.00 美元,快取讀取則下降 60% 至 0.20 美元每百萬。這每一項都更便宜。Artificial Analysis 對任務在最大努力下成本的估算無論如何都更高:

每項任務成本 — Claude Opus 5.5 為 $13.04,相較於 Claude Opus 5 的 $10.79,上升了 21%,且是在同一指數、同一測試框架、相同 effort 設定下。

每項任務的總 token 數 — 大約 15.6M 對比 11.4M,上升約 37%

每項任務的輸出 token — 約 333,000,對比 137,000,增加超過一倍。輸出是成本高昂的方向,也是變動幅度最大的一項。

每項任務的快取輸入——大約 14.6M,對比 10.9M,上升約 34%。60% 的快取讀取縮減在這裡確實發揮了作用;只是仍不足以抵銷一項多讀了三分之一脈絡的任務。

用公布的費率加總一下,結果自然就浮現了。單看輸出 token:333,000 個 token 以每百萬 $20.00 計算,大約是$6.66——約占整個 $13.04 估算的一半,而這只來自一個翻倍的單一項目。快取讀取那一項數量龐大,價格卻幾乎免費:14.6M 個 token 以每百萬 $0.20 計算,不到 $3。20% 的降幅是真的,快取的降幅也是真的;但在代理迴圈中開到最大 effort 時,它們就是被一個思考更久、寫得更多的模型給抵銷掉了。

這對你如何編列預算有直接影響。如果你的團隊每天以最高強度執行 500 個編碼代理任務,$10.79 與 $13.04 之間的差距約為 每天 $1,125——在相同任務數量下,每月約 $34,000。這個數字應該擺在批准模型變更的人面前,而它不是降價所暗示的數字。

為什麼 $5.98 和 $13.04 都是真的

Artificial Analysis 在幾天前針對同一個模型發布了不同的每項任務成本數字,若不加標籤把兩者並讀,會讓人覺得它們互相矛盾。其實並非如此——它們是兩份不同的評估,而這個差異很具啟發性。

Intelligence Index上,9月22日的報導將Claude Opus 5.5每項任務的成本定為$5.98,與Claude Opus 5的$5.86大致持平,儘管每項任務約有119,000個輸出token,而Opus 5為73,000個。在該處,降價與多出的token幾乎正好互相抵銷。在Coding Agent Index上,以最高努力程度運行、在Claude Code中,同一款模型的成本為$13.04,相對於$10.79。

兩者都是針對不同工作負載的誠實量測。問答評測是一次簡短的交流;代理任務則是一長串工具呼叫的迴圈,且上下文會不斷增長,而成長會在輸出方向上產生複合效應,而輸出正是價格最高的地方。實務上的教訓是,「降價是否能抵銷額外的 token?」並沒有單一答案——這取決於任務長度,而且任務越長、越具代理性,抵銷效果就越差。如果你是根據簡答基準測試來編列預算,就會低估代理的帳單。

三個應該放在這一行的注意事項

66 是 Claude Code 的數字,不是裸模型的數字。該指數刻意將模型與測試框架配對,理由是工具路由、重試邏輯與上下文管理,與代理的實測效能密不可分。這在此對 Anthropic 有利,因為它受評所用的框架正是自家的。Artificial Analysis 標示框架比較檢視功能即將推出;在它問世之前,沒有人能說這六分的領先中,有多少來自檢查點本身,又有多少來自圍繞它的鷹架。

Anthropic 自家的 Terminal-Bench 4.0 數字比這個組件更高,而且是由 Anthropic 自己跑的。 發布資料顯示 66.4%xhigh effort 下;Coding Agent Index 的組件則是 63.1% 在 max 下,而 Artificial Analysis 另一項獨立執行的測試測得 59.6%(於其自家測試框架、同一基準版本上)。三個數字、三種配置、三個來源。上方那一列的 63.1% 是該指數自身的組件,只應與該指數上的其他數字互相比較;廠商自報的 66.4% 未經第三方重現,而且屬於不同的 effort 設定。

索引改版會造成變動。本部落格在九月初曾報導同一份排行榜較早版本中不同的 Coding Agent Index 資料列,而那些較舊的數字無法與 v1.5 相提並論——當 Terminal-Bench 4.0 取代先前版本時,評估集本身就已經改變了。第三方鏡像網站仍帶著標示舊版號的過時快照。如果這份索引上某個 Claude Opus 5.5 的數字並非出自目前的 v1.5 資料列,就不要把它放在 v1.5 的數字旁邊,也不要計算兩者之間的差值。

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

實際要部署什麼

這項排名是最大投入程度下的數字,而最大投入是幾乎沒有人應該預設採用的設定。Claude Opus 5.5 有五種投入程度設定——低、中、高、xhigh 和 max——而模型預設為中。Artificial Analysis 尚未在較低設定下公布 Coding Agent Index 的資料列,因此那些設定下的成本節省,在此指數上無法量化;在 Intelligence Index 上,同一模型在中投入程度下得分 51——與 Claude Opus 5 的 max 相當——$1.34 每項任務。節省正是來自這個方向,而且這是一項設定,不是不同的模型。

現實中的做法是分流:把最大努力程度留給長時間自主執行的迴圈,也就是你真正要買的 8.6 分 Terminal-Bench 提升,而日常作業則以較低的努力程度執行,在該設定下模型仍明顯領先 Claude Opus 5 最終達到的水準。由於努力程度是請求參數而非部署設定,這種分流就是一條路由規則,而且兩個模型都位於同一份型錄上——Anthropic 的 牌價以 0% 加成原樣轉嫁,因此供應商降價在 anthropic/claude-opus-5.5 上於宣布當天即刻生效,而要針對你自己的任務對兩者進行 A/B 測試,也不涉及第二份合約或程式碼變更。特別是在最大努力這條路徑上,單一任務可能就是一次長時間的無人值守執行,此時自動容錯移轉才能避免供應商卡住讓你賠上整個迴圈。

什麼仍未被衡量

有三件事會改變這個局面,而它們目前都還不存在。目前沒有在相同努力程度、相同測試框架下,將 Claude Opus 5.5 與對手檢查點相比較的評測——所有可取得的跨廠商比較,都只是兩份廠商表格並排陳列。也沒有任何已發表的 Coding Agent Index 測試是在中等或高努力程度下執行,而多數正式環境流量理應落在那裡。而測試框架歸因的問題——66 分之中有多少來自模型、多少來自 Claude Code——已被該指數承認並延後處理。

你今天能據以行動的資訊,比一份排名更狹隘,卻也更有用。Claude Opus 5.5 在持續的 shell 驅動代理式工作上,確實比 Claude Opus 5 更強——那是唯一一項大幅、一致且獨立產生的增益。在測得該增益的設定下,它每項任務的成本也更高,約高出每項任務 $2.25,而每 token 的降價並沒有涵蓋到那個數字。在迴圈很長、失敗成本很高的地方,以最大投入程度部署它;其他地方則沿用較便宜的設定;並在較低投入程度的資料列出現時重新檢查該指標,因為那才是多數團隊實際上會付費的配置。如果你只是為了降價而切換,那你買錯東西了——這個模型每 token 更便宜,但每項任務更貴,而這兩個數字中只有一個會出現在你的帳單上。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新