一张标题卡,上面写着“Claude Opus 5.5 以 66 分登顶 Coding Agent Index”,副标题为“更便宜的 token,更高的任务账单”,下方有三张圆角卡片:Coding Agent Index 66、每任务成本 $13.04,上涨 21%,以及 Claude Opus 5:60 分,$10.79。
Guides & Insights

Claude Opus 5.5 以 66 分登顶编程智能体指数——而任务账单上涨 21%

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

厂商于 2026 年 9 月 22 日将 Claude Opus 5.5的 token 价格下调了 20%。两天后,Artificial Analysis 公布了其编码智能体测量结果,展示了这次降价对智能体账单的实际影响:每任务成本上升了 21%,达到 $13.04,而此前$10.79是同一指数对 Claude Opus 5的收费标准。分数也上升了——66,在 Coding Agent Index 上,Artificial Analysis 称这是其测得过的最高分,比同一配置下的 Claude Opus 5 高出 6 分,比 Claude Fable 5.1在同一配置下高出 4 分。这两件事同时成立,而它们之所以同时成立,正是这份排名的全部要义所在。一个模型消耗更多的、更便宜的 token,并不等于更便宜的任务;而在长时间智能体运行中开到最高推理努力时,Claude Opus 5.5 消耗的 token 要多得多。

Coding Agent Index 实际评分的是什么

这不是模型排行榜。它上面的每一行都是一个运行框架与模型的组合——一个在特定编程智能体中、以特定努力设置运行的检查点。所有人都在引用的那一行是 Claude Opus 5.5 在 max 努力设置下、运行于 Claude Code,而它正是 Anthropic 构建并以其为调优基准的运行框架。Claude Opus 5 的 60 和 Claude Fable 5.1 的 62 来自同一个运行框架和同一个努力设置,这正是它们能构成诚实比较的原因;任一模型若放在不同的编程智能体中,那一行就是另一种测量,不会在这里被当作同一个测量列出。

该指数是有版本编号的,而其版本比上面的品牌名称更重要。目前发布的榜单为v1.5,它对三项评测取平均值,每项权重相同,每项均以 pass@1 报告,即每个任务三次尝试的平均值:

Terminal-Bench 4.0 — 智能体 shell 与命令行工作:浏览文件系统、正确使用工具、从中间故障中恢复,并完成多步骤工作流。

DeepSWE v1.1 — 软件工程任务,即仓库编辑类工作。

SWE-Atlas-QnA — 仓库理解类问题,其答案通过阅读代码库而非修改代码库来获得。

三项评估、一个数字,以及紧挨着它印出的一列每任务成本。正是这列成本,让这个指数比单独一个分数更有用;也正是它,让那个头条数字比表面看起来更难解读。

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

三个组成部分,以及这六个点的来源

Artificial Analysis 在发布综合指标的同时也发布了组件行,而它们的变动并不一致:

Terminal-Bench 4.063.1%:Claude Opus 5.5 对比 54.5%的 Claude Opus 5,提升了 8.6 个百分点。这是本组中单项提升最大的一项。

DeepSWE v1.168.4%对比62.5%,提升了5.9个百分点

SWE-Atlas-QnA66.4%对比 62.1%,提升 4.3 个百分点

把这三项平均一下得到 66.0,这就是综合得分。有意思的是提升的分布形态:模型在阅读代码库上提升最少,在驱动 shell 上提升最多。Terminal-Bench 是最贴近人们通常所说的“编程智能体”含义的评测——一个长时间运行的循环,模型在其中选择命令、读取输出、决定下一步做什么,各步骤之间没有人类介入。在那里提升 8.6 个点,说明的是持续的工具使用能力,而非代码生成能力。

注意这对该在何处预期改进意味着什么。如果你的工作负载是“解释这个仓库”,Claude Opus 5.5 相比 Claude Opus 5 只是小幅升级——四个点。如果你的工作负载是“运行到测试套件通过,并修复出错的地方”,那它就是表中最大的跃升。

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

排名旁边显示的数字:每项任务 $13.04

以下是这笔账,它让这次降价看起来与公布时的方式不同。Anthropic 对 Claude Opus 5.5 的标价是 每百万输入 token 4.00 美元,以及 每百万输出 20.00 美元,低于 Claude Opus 5 的 5.00 美元和 25.00 美元,缓存读取下降 60% 至 0.20 美元每百万。这些条目中的每一项都更便宜。但 Artificial Analysis 对任务在最大努力下成本的估算反而更高:

每项任务成本——Claude Opus 5.5 为 13.04 美元,而 Claude Opus 5 为 10.79 美元,上升 21%,且基于相同的指数、相同的测试框架、相同的 effort 设置。

每项任务的令牌总数 — 大约15.6M,相比之下11.4M,增长了约37%

每任务输出令牌数 —— 大约 333,000,相比之下为 137,000,翻了一倍多。输出是成本高昂的方向,也是变动幅度最大的一项。

每个任务的缓存输入 — 大约14.6M,对比10.9M,增长约34%。60% 的缓存读取削减在这里确实发挥了作用;只是这还不足以抵消任务多读取三分之一上下文所带来的影响。

用公布的价格把账算一遍,结果就自然显现。单看输出 token:333,000 个 token 按每百万 $20.00 计算,约为 $6.66——约占整个 $13.04 估算的一半,而这仅来自一个翻倍的单一行项目。缓存读取这一项数量庞大、价格却几乎可以忽略:14.6M 个 token 按每百万 $0.20 计算,不到 $3。20% 的降价是真实的,缓存带来的削减也是真实的;但在智能体循环上开到最大努力时,它们会被一个思考更久、写得更多的模型完全盖过。

这对你如何做预算有着直接影响。如果你的团队以最大投入每天运行 500 个编码智能体任务,那么在任务数量相同的情况下,$10.79 与 $13.04 之间的差异大约是 每天 $1,125——每月约 $34,000。这才是应该摆到批准模型变更的人面前的数字,而它并不是降价所暗示的那个数字。

为什么 5.98 美元和 13.04 美元都成立

几天前,Artificial Analysis 针对同一模型发布了不同的每任务成本数据;若忽略标签将两者放在一起阅读,它们看起来像是自相矛盾。事实并非如此——它们是两种不同的评估,而这种差异颇具启发性。

Intelligence Index上,9 月 22 日的文章将 Claude Opus 5.5 的每任务成本定为$5.98,与 Claude Opus 5 的 $5.86 大致持平,尽管其每任务输出约 119,000 个 token,而 Opus 5 为 73,000。在这里,降价与多出的 token 几乎正好相互抵消。在Coding Agent Index上,在最大努力档位下、于 Claude Code 中,同一模型的成本为 $13.04,而对比为 $10.79。

两者都是对不同工作负载的诚实测量。问答评测只是一次简短的交互;而智能体任务则是由工具调用构成的漫长循环,上下文不断增长,并且这种增长会在输出方向上复利式累积,而输出方向正是价格最高的地方。实际的经验是,「降价能否抵消多出来的 token?」并没有唯一的答案——它取决于任务长度,任务越长、越具智能体特征,抵消效果就越差。如果你依据短答案基准来制定预算,就会低估智能体的账单。

三条适用于该行的警示

66 是 Claude Code 的分数,而不是裸模型的分数。 该指数有意将模型与测试框架(harness)配对评估,理由是工具路由、重试逻辑与上下文管理同智能体的实测表现密不可分。这一点在这里对 Anthropic 有利,因为给它打分的框架正是它自家的。Artificial Analysis 已将"框架对比"视图标注为即将推出;在它问世之前,没人能说清这六分的领先有多少来自模型检查点,又有多少来自其外围的脚手架。

Anthropic 自己给出的 Terminal-Bench 4.0 数值高于这一分项,而且是由 Anthropic 运行的。 发布材料报告称 66.4%xhigh 推理强度下;Coding Agent Index 的分项为 63.1% 在 max 推理强度下,而 Artificial Analysis 的另一次独立运行测得 59.6%;这一结果是在其自有测试框架中、针对同一基准版本测得的。三个数字,三种配置,三个提供方。上一行中的 63.1% 是该指数自身的分项,只应与其所在指数上的其他数字比较;厂商的 66.4% 是厂商报告的,未经第三方复现,并且属于不同的推理强度设置。

指数版本已有变动。本博客曾在 9 月初报道过同一榜单较早版本上不同的 Coding Agent Index 行,而那些较早的数字与 v1.5 不可比——当 Terminal-Bench 4.0 取代较早版本时,评测集本身已经改变。第三方镜像仍带有标注旧版本号的过期快照。如果该指数上 Claude Opus 5.5 的某个数字并非来自当前 v1.5 行,就不要把它与 v1.5 的数字并列,也不要在两者之间计算差值。

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

实际要部署什么

该排名是最大努力值下的数字,而最大努力这种设置几乎没人应该默认发布。Claude Opus 5.5 有五档努力设置——低、中、高、xhigh 和 max——而模型默认采用中档。Artificial Analysis 尚未发布较低设置下的 Coding Agent Index 数据行,因此在该索引上那里的成本节省无法量化;在 Intelligence Index 上,同一模型在中等设置下得分为 51——与 Claude Opus 5 的 max 持平——仅需 $1.34每次任务。节省正存在于这个方向,而且它是一项设置,而非另一个模型。

现实的做法是拆分:对长时间自主运行的循环保留最大 effort,因为 8.6 分的 Terminal-Bench 提升正是你要为之付费的东西;而把日常性工作放到较低的 effort 下运行,此时模型的表现仍远高于 Claude Opus 5 最终达到的水平。由于 effort 是请求参数而非部署配置,这种拆分就是一条路由规则,而且两个模型都位于同一份目录中——Anthropic 的挂牌价以 0% 加价透传,因此供应商一旦降价,anthropic/claude-opus-5.5 在降价公布的当天就会生效,并且用你自己的任务对两者做 A/B 测试不涉及第二份合同或任何代码改动。具体到最大 effort 这条路径,单个任务可能是一次长时间无人值守的运行,此时自动故障转移正是避免某个供应商卡住而让你损失整个循环的关键。

还有什么尚未被测量

有三种情况会改变这一局面,而它们目前一个都还不存在。没有任何在同等努力程度、同等测试框架下将 Claude Opus 5.5 与竞争对手检查点进行对比的研究——所有可得的跨厂商比较,都只是两张并排摆放的厂商表格。也没有任何以中等或高努力程度运行的已发布 Coding Agent Index 结果,而大多数生产流量恰恰会落在这一区间。至于测试框架归因问题——66 分里有多少来自模型、多少来自 Claude Code——Coding Agent Index 已承认这一点,但将其延后处理。

你今天能实际采取行动的内容,比一份排名范围更窄,也更有用。Claude Opus 5.5 在持续性的、由 shell 驱动的智能体工作方面,确实比 Claude Opus 5 更好——这是唯一一个具有大幅、一致且独立得出的提升的组成部分。在测得该提升的配置下,它的每任务成本也更高,大约每任务多 $2.25,而每 token 的降价并没有达到这个数字。在循环很长且失败成本很高的地方,以最大努力程度部署它;在其他所有地方保留更便宜的设置;并在较低努力程度的行出现时重新核对索引,因为那才是大多数团队实际会付费的配置。如果你仅仅为了降价而切换,那你买错了东西——该模型每 token 更便宜,但每任务更贵,而这两个数字中只有一个会出现在你的账单上。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新