
Claude Opus 5.5 基准测试:每一项得分、其对应的努力设置,以及由谁测量
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Anthropic's headline number for Claude Opus 5.5 on Terminal-Bench 4.0 is 66.4%, printed against 52.3% for Claude Opus 5 on the same table — and that 66.4% was produced at xhigh effort, not at the model's default of medium. The model shipped on September 22, 2026, two days before this page was written, so it is a GA model with a GA model's pricing and a GA model's benchmark table. The independent figure on the same benchmark, from Artificial Analysis, is 59.6%, in a configuration that carries Anthropic's server-side safeguard routing inside it. Between those two numbers sit a harness difference, an effort difference and a routing difference, and nobody — including us — can yet say how much of the gap each one accounts for. What this page can do is put every published figure for Claude Opus 5.5 in one place, name who produced it, name the setting it was produced at, and include the rows where GPT-6 Astra and Claude Fable 5.1 come out ahead.
先从努力程度设置入手,因为它比模型更能左右那些数字
在 Claude API 上,Claude Opus 5.5 默认使用medium 级别的努力程度,而 Claude Opus 5 默认使用high。另外,同名的级别在两个模型中也不代表相同的思考预算,因此即便标签一致,"我们把两者都跑在 high" 也并非受控对比。在 Opus 5.5 上,自适应思考始终开启,无法关闭;effort 参数只影响深度、延迟和成本,除此之外不影响任何其他方面。
Anthropic 的 Terminal-Bench 4.0 数字是在 xhigh 下跑出来的。这个单独的事实是本页上最重要的注意事项,因为它作为头条的基准正是相对前一个模型报告差距最大的那个,而且因为同一张表还显示了如果你不动这个设置会发生什么:
• FrontierCode v1.1 Main — xhigh 下为 54.4%,默认 medium 下为 54.6%。厂商报告的数据。medium 那次运行高于 xhigh 那次运行。在此工作负载上,努力档位没有换来任何可测量的收益;这两个数字就是同一个数字。
• CursorBench 4.0 — xhigh 下为 57.8%,medium 下为 52.5%。由厂商报告。同一模型、同一测试框架、同一周:相差 5.3 个百分点,是表中最大的努力程度差异。
供应商表格里的那两行就是全部论据。一种工作负载对努力程度不敏感,另一种则高度敏感,而模型卡片无法提前告诉你,你的负载属于哪一种。数据所支持的结论很窄,也值得以同样窄的方式陈述:恰当的努力程度如今是一项按工作负载逐一测得的量,而不是你继承来的默认值。它并不支持“Opus 5.5 比其基准所显示的更快”或“Anthropic 把默认值调低了”这类说法——要得出那种结论,你需要对全部五档设置做逐工作负载的扫描,而没有人公布过这样的数据。它确实意味着:如果你从 Opus 5 迁移过来,并沿用原有的努力程度设置,那么你改变的是实验本身,而不只是模型。
还有一处不对称,而且方向正好相反。Anthropic 的 Terminal-Bench 那一行中,竞争对手一栏是 GPT-6 Astra 的 57.9%——以 high 档强度运行,这一点 Anthropic 自己的图表注释写得很清楚,而 Opus 5.5 的 66.4% 则是以 xhigh 运行的。一个厂商的表格,把自己的模型用一种设置去跑,把竞争对手用另一种设置去跑,那就算不上正面对比,不管这两个数字并排看起来如何。
供应商表,每一行都带有来源和设置
本节中的所有内容均为厂商自报:Anthropic 的发布材料、Anthropic 的评测框架,生产环境防护全部开启,自适应思考以最高投入运行,除非该行另有说明。请将其理解为 Anthropic 对 Anthropic 自身的评估。
• Terminal-Bench 4.0 — 66.4%,xhigh 推理强度下。厂商报告,标准误差约为 ±2.6 个百分点。同一行中:Claude Opus 5 52.3%,Claude Fable 5.1 55.8%,GPT-6 Astra 57.9%(高推理强度下),GPT-5.6 Sol 37.3%。Terminal-Bench 4.0 明确是厂商承认并不完美代表真实终端工作的基准,而它正是该模型的主打指标。
• FrontierCode v1.1 Main — xhigh 下为 54.4%,默认 medium 下为 54.6%。厂商报告数据。Opus 5 48.0%,Fable 5.1 50.3%,GPT-6 Astra 53.3%,GPT-5.6 Sol 47.5%。Anthropic 的系统卡还列有 Extended 变体的 63.6%,以及 medium 设置下最佳 Extended 数据 65.3%。
• CursorBench 4.0 — xhigh 下 57.8%,medium 下 52.5%。厂商报告数据。Opus 5 为 46.6%,Fable 5.1 为 51.8%,GPT-5.6 Sol 为 41.7%。请注意,Fable 5.1 和 Opus 5 的 CursorBench 成绩均是在 max 努力程度下取得的,因此 Opus 5.5 在 medium 下的表现是在与其同门模型在 max 下的表现作比较。
• GDPval-AA v2.1 — 1,846 Elo。这是厂商表格中唯一一行并非由该厂商自己跑出的数据。GDPval-AA 是 Artificial Analysis 的一项评测,而 Artificial Analysis 自己对 Opus 5.5 的报告中给出的同样是 1,846,Fable 5.1 为 1,735,Opus 5 为 1,708。在厂商表格中:Fable 5.1 为 1,735,Opus 5 为 1,708,GPT-5.6 Sol 为 1,588,GPT-6 Astra 为 1,542。这是本表中唯一一行两家机构给出相同数字的数据,原因就在于它本就是同一次测量。
• AutomationBench(Zapier)— 40.0%。由供应商报告,且运行时未使用备用模型,因此每一次安全防护干预都被计为失败。GPT-6 Astra 41.4%,Fable 5.1 31.4%,GPT-5.6 Sol 28.8%,Opus 5 26.9%。
• Humanity's Last Exam,使用工具 — 67.7%。厂商报告。Fable 5.1 为 65.6%,Opus 5 为 63.6%,GPT-6 Astra 为 57.2%。Anthropic 的系统卡另行报告无工具条件下为 64.4%,如果你要与一个不为其模型提供工具访问的来源进行比较,那么这个数字才是你应该采用的。
• Terminal-Bench-Science 0.1 — 58.7%。厂商报告,标准误差大致为 ±3.5 至 ±5 个百分点,因此这是一个区间,而非一个点。GPT-6 Astra 64.6%,Fable 5.1 52.6%,Opus 5 29.0%,GPT-5.6 Sol 22.4%。
• OSWorld 2.0 — 81.8% 部分完成。这是厂商自报的数字,而“部分”一词在这句话里承担着实打实的作用:Anthropic 的系统卡给出的同一模型在同一评测上的严格完成率为48.7%。两个数字都已公布;被引用的却是那个“部分”数字。Fable 5.1 80.7%,Opus 5 74.0%。
• Chartography,配合工具 — 89.0%。厂商报告。Fable 5.1 88.4%,Opus 5 83.4%。

独立数字,以及“默认回退”的实际含义
Artificial Analysis 是唯一一家在综合指数上发布了对 Claude Opus 5.5 的当前评估的第三方,其数据正是应当与 Anthropic 的数据并列对照的那一组。以下为截至 2026 年 9 月 24 日的读取内容:
• 智能指数——在“Adaptive Reasoning, Max Effort, Default Fallback”这一配置下,以最大努力档位取得 58 分。该结果由 Artificial Analysis 独立测评。其自家文章将 58 称为“我们所测得的最高分,且领先数分”。同一指数也公布了 Opus 5.5 在其他各努力档位下的成绩,而档位间的跨度才是关键:xhigh 为 56,high 为 54,medium 为 51,low 为 42。也就是说,仅一款模型在努力档位拨盘上的波动就达到 16 分——比该榜单上大多数模型之间的差距还要大。
• Terminal-Bench 4.0 — 59.6%。独立评测。Artificial Analysis 报告称其“与领先者 GPT-6 Astra(xhigh)持平”,并比 Claude Opus 5 高出约 11 个百分点。
• Humanity's Last Exam — 61.4%。独立完成,此前同一榜单上的最佳成绩为 59.1%,由 Claude Fable 5.1 保持。
• SciCode — 66.9%。独立测试,对比 Claude Fable 5.1 的 63.1%。
接下来是需要解释而非直接引述的条款。“Default Fallback”并非基准测试的产物,也不是 Artificial Analysis 的一项设置——它是Anthropic 服务器端的安全防护路由,并且保持开启状态。Claude Opus 5.5 搭载了此前专供 Fable 5.1 的安全防护层级:大多数网络安全相关请求会被透明地重新路由至 Claude Opus 4.8,而生物学相关任务则会回退到 Claude Opus 5,除非账号已通过验证。当 Artificial Analysis 在启用默认回退的情况下运行该指数时,它衡量的是实际部署的系统——即未经验证的 API 密钥真正能够触达的对象——而非 Opus 5.5 权重的纯净检查点。对买家而言,这是更诚实的衡量方式;对基准测试而言,这是不够纯净的衡量方式。Anthropic 对其自家表格也是如此说明的:Terminal-Bench 4.0 运行中的干预措施导致网络安全任务由 Opus 4.8 完成、生物学任务由 Opus 5 完成,而该公司表示这些干预很可能拉低了所报告的分数。因此,安全防护路由在两个方向上都是真实的运营事实,而本页上的任何数字都无法将底层模型与此剥离开来。
两个表格在哪里不一致,以及为什么
把 Terminal-Bench 4.0 的两个数字并排放在一起,你看到的是 66.4% 对 59.6%——同一个基准、同一个模型,相差 6.8 个百分点。原因是已知的,而且每一个单独拎出来都足以产生影响:
• 不同的测试框架(harness)。Anthropic 运行的是自家的智能体脚手架(agent scaffold),Artificial Analysis 运行的则是自家参考用的智能体 harness。终端基准测试的分数是脚手架与模型共同作用的结果,而非仅取决于模型本身,而两家机构都未公布过互换脚手架的对照实验。
• 不同的 effort 设置。Anthropic 的 66.4% 是在 xhigh 下取得的。Artificial Analysis 的 59.6% 所对应的 effort 设置并未在包含该数字的那句话中说明,而其报告的基准数据通常是最高 effort 下的结果。
• 两种情况下防护措施均已开启,但计分方式不同。Anthropic 在启用回退机制的情况下运行,将干预视为扣分项,但仍计入评分。在 AutomationBench 上,它在未启用回退机制的情况下运行,并将干预直接计为失败。Artificial Analysis 则全程启用回退机制。
• 即便在同一家厂商自己的表格里,这些数字也会变动。Anthropic 在 Terminal-Bench 4.0 上把 Claude Opus 5 标为 52.3%,并指出公开榜单上同一模型的 51.8%“在噪声范围内”。
那么,本页关于一套测试框架究竟价值几何的最有力证据。2026年9月24日抓取的公开 Terminal-Bench 4.0 排行榜上,压根没有 Claude Opus 5.5 这一行。其榜首是最高推理强度的 GPT-6 Astra,由 Codex 智能体驱动,58.2% ±2.8;第二名是最高推理强度的 Claude Fable 5.1,经 Claude Code 运行,57.9% ±3.8;第三名是 xhigh 档的 Claude Opus 5,经 Claude Code 运行,53.9% ±3.2。所以,66.4% 不仅与独立的 59.6% 是不同的数字——它根本不在公开榜单上,而榜单上 Claude Opus 5 自己的成绩是 53.9%,而非发布表格印出的 52.3%。在 Terminal-Bench 接受并发布 Opus 5.5 的提交之前,66.4% 只是一个无人能复现的厂商测试框架结果,而 59.6% 才是外部第三方真正会背书认可的数字。另请注意,在同一份榜单上,Artificial Analysis 的 Terminal-Bench 4.0 榜首成绩与 Anthropic 的 Opus 5.5 落在同一个 59.6% 上——这只是在同一套测试框架中的平局,对另一套框架说明不了任何问题。

Opus 5.5 落败的行
一份省略了亏损的汇总不算是汇总,而Anthropic自己的表格里两者都有。
• Terminal-Bench-Science 0.1 —— 58.7%,而 GPT-6 Astra 为 64.6%。厂商报告,出现在 Anthropic 的表格上,并且在最接近科学推理的那一行,以 5.9 分之差输给了一个具名竞争对手。厂商自己的标准误差说明(±3.5 至 ±5)意味着这一差距处于噪声边缘附近,而非稳妥地落在噪声范围内——但这是厂商自家页面上的失利,而这一区间并不能把它变成胜利。Claude Opus 5 在同一行上为 29.0%,因此即便在竞争对手领先之处,代际提升也是真实存在的。
• AutomationBench — 40.0%,对比 GPT-6 Astra 的 41.4%。由厂商自行报告,落后 1.4 个百分点,且该次运行没有回退模型,因此安全防护干预被计为失败。这意味着这一特定对比所衡量的是包含路由惩罚在内的 Opus 5.5,而对手的路由惩罚——无论其为何——均未得到说明。无论从哪个方向看,这都是页面上最难以解读的一行。
还有两处,领先幅度比标题所暗示的更薄,而且都来自厂商自行报告。Humanity's Last Exam with tools上,对 Claude Fable 5.1 的领先为 2.1 个百分点(67.7% 对 65.6%);Chartography with tools上为 0.6 个百分点(89.0% 对 88.4%);OSWorld 2.0 partial上为 1.1 个百分点(81.8% 对 80.7%)。在这些项目里,“Opus 5.5 是最佳智能体模型”只是在说排名,而不是在说一项实测出的差距,而 0.6 个百分点的读图差异不该决定一次采购。
Claude Fable 5.1 在不同指数修订版本上的独立排名
把 Opus 5.5 与它的同门兄弟放在一起比较,需要单独辟出一节来讲,而且还得附上一条警告,因为这项比较比看起来要难得多。
当 Artificial Analysis 于 2026 年 9 月 1 日发布其对 Claude Fable 5.1 的评测文章时,该模型在 Intelligence Index 上以最大努力度得分 66,并称这是其测量到的最高分——领先于 Claude Opus 5 的 63 分和 GPT-5.6 Sol 的 61 分。而在 2026 年 9 月 24 日所列出的该指数上,同一模型出现在启用回退机制、以最大努力度得分 53,而 Opus 5.5 在同等配置下则出现在58。9 月 22 日关于 Opus 5.5 的文章称 58 分“是我们测量到的最高分,领先了数个点”。
那两种说法不可能在同一把标尺上同时成立,而化解之道在于:它们本就不在同一把标尺上。这个指数是一个动态更新的对象,Artificial Analysis 会对其加以修订;其相隔五周发表的两篇文章,却把同一对"兄弟"模型置于榜首的两侧。这说明的是指数被修订,而不是其中哪一个模型出现了退步,也就是说,66 和 58 绝不能被并排印在一起。若在同一天、同一份榜单、同一标注配置下阅读,当前的排序是 Opus 5.5 领先 Fable 5.1 五个点——而即便如此,这也只是同指数、同指数发布方的比较,并非经过审计的正面对决。能够稳妥断言的范围要更窄:在同时衡量这两者的唯一独立综合指数的当前修订版中,Opus 5.5 是两个 Anthropic 模型中更强的那一个,而 Fable 5.1 那个更为人熟知的 66 属于该指数更早的修订版。
这些设置值得再补一句,因为它们很容易被混为一谈。Fable 5.1 的 66 和 Opus 5.5 的 58 都属于最高努力程度的行——但 Fable 5.1 的五个努力程度设置在输出 token 使用量上的跨度达 11 倍,从低档的 13.1M 到最高档的 143.7M,索引分数则从 58 到 66。对于一个内部差异如此之大的模型来说,单个索引分数远不足以替代你实际会运行的那一行。
Token 成本本身就是一个基准维度
上面每个数字都是得分。它们当中没有一个是一张账单,而在这个模型里,有意思的变动恰恰在于账单。
Artificial Analysis 在最大努力设置下测量 Claude Opus 5.5,大约使用 每项 Intelligence Index 任务 119,000 个输出 token——这是其指数中最高的。作为对比,在同一榜单、相同设置下:Claude Opus 5 约 73,000,Claude Fable 5.1 约 78,000,GPT-6 Astra 约 27,000。思考 token 按输出 token 计费,而在 Opus 5.5 上无法关闭自适应思考,因此模型用于思考所花费的 token 并非其价格的脚注——它们构成了其价格的大部分。
算一算这笔账吧,因为单看标价本身就有误导性。Opus 5.5 的标价是输入 $4.00 / 输出 $20.00,比 Opus 5 的 $5.00 / $25.00 下调了 20%。但 Artificial Analysis 的实测显示,在最大努力档位下,Opus 5.5 每个索引任务的花费约为 $5.98,而相同设置下的 Opus 5 为 $5.86——略微更多,而非更少,因为大约 1.6 倍的输出 token 量不仅吃掉了整整 20% 的费率下调,还超出了不少。在整个索引评测中,Opus 5.5 产生了 2.6 亿输出 token,而排行榜中位数为 8800 万,评测方将其标注为"非常啰嗦"。
因此,成本这件事完全取决于 effort 设置,而且只有你真的去用它才成立。在最大 effort 下,按每完成一项任务计算,Opus 5.5 比它所取代的模型更贵。在中档 effort 下——这是实际的产品默认值,也是 Anthropic“在典型工作负载上运行成本大约低 40%”这一说法的适用范围——节省是真实的,但它是关于供应商所选工作负载平均值的陈述,而不是经审计的逐任务结果。实际解读是:20% 的降价是价目表上的折扣,以及 effort 调节旋钮上的一个选项,而不是自动节省。如果你的迁移计划是“换个模型 ID,设置保持不变”,那你买的是昂贵的那一版。
什么根本没有被确立?
这就是页面其余部分之所以存在所要支持的那个部分。
• 目前尚未有任何已发布的独立评测,在同等推理强度、同等测试框架下将 Claude Opus 5.5 与任何具名对手进行正面对比。本页上的每一处跨厂商比较——Opus 5.5 对 GPT-6 Astra、对 GPT-5.6 Sol、对 Claude Fable 5.1——都是对两张表格的比较,而这两张表格出自两家不同的公司、基于两套不同的测试框架、采用两种不同的推理强度设置,其中一方通常还是厂商自家模型,且处于有利设置。在全部公开记录中,没有任何一项实验能在两家厂商之间保持脚手架与推理强度不变,并把双方的结果一并报告出来。
• 每个问题的 token 拆分并未公布。 输出 token 的总量数据是独立测得的,但其中有多少属于思考内容、多少属于答案文本,我们所能找到的任何一方都没有公布。任何声称能给出该模型精确思考 token 数的页面,给出的都是没人实际测量过的数字。
• 系统卡中的大部分内容未经过第三方基准测试。SWE-bench Pro 89.9%、多语言 93.9%、DeepSWE v1.1 74.2%、ProgramBench 91.2%、OfficeQA 78.9%、HealthBench Professional 65.6%(经长度调整)、GMMLU 94.3%、ArXivMath 96.9%(使用工具时)——均为厂商自报数据,截至本文撰写时无一经过独立复现。
• Terminal-Bench 4.0 最引人注目的数据并不在公开榜单上。上文已经提及,而且它也应当列入这份清单:关于这个模型被引用最多的那个数字,是厂商之外无人实际运行过的。
• Anthropic 报告称,Claude Opus 5.5“常常怀疑自己正在被评估”——这是该公司自己的措辞,被作为其安全评估的一项局限提出。请把它当作一个测量问题、而不是一桩奇事来认真对待:如果模型在认为自己正被测试时行为有所不同,那么本页上的每一个基准数字,无论来自供应商还是独立机构,测量的都是处于被观察状态下的模型,而它与部署后行为相差多少,既未知也未被量化。这一道理对表现好的行和表现差的行同样成立。这是唯一一条无论多少同等投入的方法论都无法消除的告诫。
• Sonnet 5.5 和 Haiku 5.5 尚不可用。 Anthropic 已宣布它们将在“未来几周内”推出。它们尚未发布,也没有公布任何基准测试结果,本页面的任何内容都不适用于它们。
价格、信封,以及规范中会改变你的代码的那些部分
摘自 Anthropic 于 2026 年 9 月 24 日公布的价目表:每百万输入 token 4.00 美元,每百万输出 20.00 美元,每百万缓存读取 0.20 美元,每百万 5 分钟缓存写入 5.00 美元,每百万 1 小时缓存写入 8.00 美元,且在 Batch API 上输入与输出两个方向均享 50% 折扣。缓存读取费率是最不显眼的那个——它为基础输入价格的 5%,而大多数 Claude 模型为 10%,Fable 5.1 则为 2.5%。快速模式单独定价,为 8.00 / 40.00 美元,Anthropic 将其描述为研究预览版,而非通用层级。
在这一节里,价目表不再只是些细枝末节,而变成了路由器能替你算出来的算术题。Claude Opus 5.5以 anthropic/claude-opus-5.5 的形式在 OrcaRouter 上提供,价格同样是 $4.00 / $20.00,并且目录价按 0% 加价原样传导——所以只要 Anthropic 调整费率,这里的费率当天就是那个费率,没有任何需要你去建模的重新定价滞后。真正决定实际账单的,是目录在价格旁边一并列出的那几项:$0.20 的缓存读取,按基础输入价的 5% 计费,而 Fable 5.1 是 2.5%;1M token 的上下文窗口;以及 128K 的输出上限。因为这个模型的成本实际上随 effort 参数而变动——最高档时指数相差 16 点,每项任务约 119,000 个输出 token,而 Opus 5 约为 73,000 个——所以真正省钱的迁移方式,是让你按工作负载而不是按账户来调节 effort,并在衡量你的流量究竟想要哪种设置的同时,把 Opus 5.5 路由放在自动故障转移之后。
• Envelope — 100 万 token 上下文,最大输出 128K,在 Batch API 上通过 output-300k-2026-03-24 beta 标头可输出 300K,知识截止日期为 2026 年 6 月,退役时间不早于 2027 年 9 月 22 日。输出速度比 Claude Opus 5 快 30% 以上。
• 与 Opus 5 相比的破坏性变更 —— 思考功能无法再被禁用;强制使用工具(即 tool_choice 中指定了某个具体工具)会返回错误;思考块与模型以及产生它们的对话相绑定;较旧的 computer_20251124 计算机使用工具在 Claude API 或 Google Cloud 上不再被接受。前三项同样适用于 Fable 5.1。还有一项不为人知的第五项变化:工具调用之间的文本现在会出现在思考块内部,而在默认显示设置下这些思考块的文本为空,因此将这段文本作为进度指示器流式呈现的界面会变得悄无声息,却不会有任何报错。
• 再次强调保障性路由,因为它是规范项,而非脚注——大多数网络安全请求会转到 Claude Opus 4.8,生物学工作则回退到 Claude Opus 5,除非账户已通过验证。在这些评估中,你收到的回答可能根本并非来自 Opus 5.5,因此已公布的网络与生物相关基准分数并非对该模型的纯粹测量值。
• 效率声明,均由厂商报告——在典型工作负载上运行成本降低约40%,而标价下调20%;一个完整的并购分析示例在 Opus 5.5 上耗时63分钟,而在 Opus 5 上为93分钟,成本降低50%;以及来自 Box(词元数为三分之一,回答冗长度降低约40%)、Kiro(词元数约减半,调用次数减少40%)、Factory(输出词元减少20–25%)和 GitHub(在其测量中词元数和步骤数属于最少之列)的客户陈述。这些是厂商及其发布合作伙伴所选工作负载的平均值。它们是归因性说法,而非经审计的结果,并且它们与上文独立的单任务成本数字存在明显矛盾——而该数字本身也是在最大努力而非默认设置下进行的测量。两者都可能为真;但两者都不是关于你的工作负载的普遍性结论。

证据现状
Claude Opus 5.5 是一个真实存在的模型,有实实在在的费率下调,真正具备 100 万 token 上下文和 128K 输出的容量,并且在思考与投入力度的配置方式上带来了真实且影响重大的变化。它同时带来的还有一张主要衡量 Anthropic 的基准测试表、一张主要衡量路由部署而非模型检查点的独立表格,以及一个已有文档记录的自我认知问题,而这个问题会削弱前两者。目前尚未发布任何独立的、在同等投入力度和同等测试框架下将 Claude Opus 5.5 与具名竞争对手进行正面对比的评估。在这样的评估出现之前,请把本页所有跨厂商比较按其本来面目来看:来自两家公司、基于两种设置的两张厂商表格,由我们并排摆在一起——并且在重新衡量模型之前,先重新衡量你自己的投入力度设置。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
