
Claude Opus 5.5 对比 Claude Opus 5:努力级别含义并不相同
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
在将 Claude Opus 5.5与Claude Opus 5进行对比之前,首先要明白的一点是:这两个模型并不共用同一套 effort 等级,而本周你能读到的几乎每一篇正面对比都忽略了这一点。Opus 5 默认使用 high effort。Opus 5.5 默认使用 medium,而且在同名的等级下,它每一轮思考得都比前代更多。所以,“默认设置下的 Opus 5.5 对比默认设置下的 Opus 5”并不是一次受控实验——它比较的是两种不同的思考量。厂商在自己的迁移指南里也明说了这一点:要测试多个 effort 等级,并且不要沿用 Opus 5 的设置,因为同名等级并不对应相同的思考预算。一旦你控制了这一变量,两个模型之间的差距在某些方面会缩小,在另一些方面则会拉大,而升级决策的关键就落在了原始能力之外的东西上——每个已完成任务的成本,以及四项会破坏当前运行在 Opus 5 上的代码的 API 变更。
逐项规格来看,实际有什么不同

从纸面上看,这两款型号之间的差距比版本号所显示的要小:
• 价格 — Claude Opus 5.5 每百万 token 输入 $4.00 / 输出 $20.00,而 Claude Opus 5 为 $5.00 / $25.00
• 缓存读取 — 每百万 $0.20 对比每百万 $0.50,在占据智能体运行主导地位的费用项上降低了 60%
• 缓存写入 — 在 5.5 上,5 分钟窗口每百万 5 美元、1 小时窗口 8 美元,而 Opus 5 为 6.25 美元
• 上下文与输出——两者均支持 100 万 token 上下文和 128K 输出;在 Batch API 上,两者启用output-300k-2026-03-24 Beta 标头
• 默认 effort —— medium:Opus 5.5 上为 high:Opus 5 上
• 思考——在两者中均为自适应且始终开启,但在 Opus 5.5 上,它已完全无法再被禁用
• 知识截止时间 — 2026年6月 vs 2026年5月
• 延迟 — 在当前产品阵容中,Anthropic 将 Opus 5.5 评为“中等”,并表示其生成输出的速度比 Opus 5 快 30% 以上
• 退役 — Opus 5.5 不早于 2027 年 9 月 22 日,Opus 5 不早于 2027 年 7 月 24 日
请注意哪些没有变化:上下文窗口、输出上限、批量折扣,以及始终开启的自适应思考模型。Opus 5.5 并不是上下文更大或输出更长的模型。它是在同一范围内更便宜、更快、更节省 token 的模型。
基准测试,以及每一项上关于投入的星号

这些数据来自 Anthropic 的发布材料——由厂商自行报告,并针对其自家模型运行——而在这里,effort 设置比模型名称更重要:
• Terminal-Bench 4.0 — 66.4% 对 52.3%,其中 Opus 5.5 是在 xhigh 努力级别而非默认级别下运行的
• FrontierCode v1.1(Main)— 54.4% 对 48.0%,而 Opus 5.5 在默认中等努力级别下为 54.6%
• CursorBench 4.0 — 57.8% 对比 46.6%,以及在中等档位下为 52.5%
• GDPval-AA v2.1 — 1846 Elo 对比 1708
• AutomationBench — 40.0% 对比 26.9%
• Humanity's Last Exam,使用工具 — 67.7% 对比 63.6%
• Terminal-Bench-Science 0.1 — 58.7% 对 29.0%,是该组中差距最大的一项
• OSWorld 2.0 — 81.8% 部分得分 对比 74.0%
• Chartography,使用工具 — 89.0% 对比 83.4%
FrontierCode 的结果才值得研究。Opus 5.5 在 xhigh 下得分 54.4%,在 medium 下得分 54.6%——从统计上看是同一个数字,却只用了思考预算的一小部分。无论 Anthropic 做了什么改进,在该基准上,这些改进都不是来自更用力地思考。CursorBench 则相反:xhigh 下为 57.8%,medium 下为 52.5%,五个百分点的差距说明,在某些任务上,投入更多努力仍能换来真正的准确率提升。结论并不是“使用 medium”或“使用 xhigh”;而是说,合适的努力程度如今要按工作负载分别衡量,而过去让 Opus 5 保持 high 默认档的习惯,已经无法说明新模型的任何情况。
Anthropic 补充了一个值得反复强调的告诫:在这一能力水平上,基准测试的领先幅度“对现实世界中的差异而言,是较不可靠的指引”,而该公司表示,其与 Claude Fable 5.1 的内部差距比已公布分数所暗示的要窄。这无异于厂商在告诉你,不要过度解读它自己的表格。
每项已完成任务的成本才是决定性对比
对智能体而言,按 token 计价是错误的单位,而这次对比正是这一点显露之处。Anthropic 自己给出的示例:一项并购分析在 Opus 5.5 上耗时 63 分钟,成本比在 Opus 5 上完成同一任务低 50%,后者耗时 93 分钟。价目表只能解释其中一部分——输入和输出降价 20%,缓存读取降价 60%——但并非全部。其余部分来自模型用更少的 token 和更少的轮次达到同样的结果。随发布一同公布的客户评价也指向同一方向:Box 报告 token 用量降至三分之一,回答冗长度减少约 40%;Kiro 的 token 用量约为一半,调用次数减少 40%;Factory 的输出 token 减少 20–25%;GitHub 则是其测量过的 token 和步骤最少的情况之一。
那些是供应商发布的客户声明,不是经审计的结果;汇总性的“在典型工作负载上便宜约 40%”是 Anthropic 对其所选工作负载平均值的概括。为了你自己做规划,诚实的说法是:假设 20% 的标价下调真实且可兑现,把额外的 20% 当作一个假设,你可以花一个下午,在两种模型上运行同一任务并统计 token 数量来检验。
关于缓存降价为何能发挥超乎寻常的作用,这里有一则结构性说明。一个每轮都重新发送冗长系统提示和文件树的智能体,其大部分输入按缓存读取费率计费,而非按全新输入费率计费。将这一费率从每百万 0.50 美元降到 0.20 美元,对长时运行会话经济性的改变,远大于表面标价变化所带来的影响——也正是这个原因,在 Opus 5 上勉强可行的负载,无需对提示词做任何改动,就能在 Opus 5.5 上变得明显可行。
四个破坏性变更,作为迁移检查清单
Opus 5.5 是一款新模型,而非更名后的 Opus 5,Anthropic 的迁移说明列出了四项会破坏已在生产环境中运行的代码的变更:
• 无法禁用思考。任何关闭思考的代码路径都会报错或改变行为,而深度现在只能通过 effort 参数来控制。
• 强制使用工具会返回错误。tool_choice不支持强制指定具名工具。
• 思考块与生成它们的模型以及对话绑定,因此它们无法像一些流水线所假设的那样跨模型重放。
• 较早的 computer_20251124计算机使用工具在 Claude API 或 Google Cloud 上不被接受。
还有第五项改动,它不会让任何测试失败,因此反而更加危险。工具调用之间的文本现在会以思考块的形式返回,而在默认显示设置下,这些思考块的文本是空的。如果你的应用会将这段文本以进度更新的形式流式传输给用户,那么在两次工具调用之间它就会陷入沉默,直到你设置一个能让文本返回的显示值。所有测试都通过,只是界面不再出声解说了。
前三项也适用于 Claude Fable 5.1,因此已经迁移到该模型的团队已经完成了这项工作的一部分。仍在使用 Opus 5 的团队则尚未完成。
何时仍应选择 Opus 5
升级不会自动进行,确实有四个留下来的理由:
• 成本可预测性。Opus 5 是一个你已经刻画过其特征的模型。如果你的预算是基于其 token 消耗来建模的,那么迁移到一个在相同命名努力级别下思考量不同的模型,就会使该预算模型失效,直到你重新测量为止。
• 兼容性。如果你技术栈的任何部分依赖于禁用思考、强制使用工具或旧版 computer-use 工具,那么迁移就是代码工作,而不是字符串替换。
• 路由保护。Opus 5.5 搭载了 Fable 5.1 级别的防护措施,这意味着大多数网络安全请求都会被重新路由到 Claude Opus 4.8,而生物学方面的工作则会回退到 Claude Opus 5——除非你的账户已通过验证。如果你的产品属于这两个领域中的任何一个,"升级"都可能意味着你的用户得到的是由更小的模型给出的回答。Opus 5 没有这种路由。
• 长期可用性。Opus 5 短期内不会退场——Anthropic 将其退役时间列为不早于 2027 年 7 月 24 日,距今还有十个月。
对其他所有人来说,这笔账算起来很简单:更强的能力、更低的价格、更少的 token,还有一份一名工程师一天就能走完的迁移清单。
切换期间同时运行两者

任何旗舰模型迁移中最棘手的部分都是中间阶段:你希望新流量用上 Opus 5.5,却又不想把生产路径押在一个尚未在你自己的 effort 设置下充分评估过的模型上;同时,在摸清情况之前,你还想继续让 Opus 5 提供服务。这更像是路由问题,而不是重新搭建平台的问题,因此值得精确厘清什么该放在哪里。 Claude Opus 5 今天已在 OrcaRouter 上,采用 Anthropic 自己的标价,0% 加价——提供商标价直接透传,因此厂商费率变动当天就会在我们这边生效,而无需等到同步之后。Claude Opus 5.5 还不是我们的路由之一;它可通过 Anthropic 自己的 API 和各大云厂商获取。当它上线时,它会成为同一密钥上的又一条路由,而不是第二份合同和第二个 SDK,这正是让你可以把一定比例的流量放到新模型上,同时自动故障转移让其余流量留在你已经评估过的模型上。跨两者组合调用——一个模型生成草稿,另一个执行验证——只需一行 routing-DSL 代码。
要准确说清这能给你带来什么。它不会给你一个关于 Opus 5.5 的独立基准测试;目前没有任何东西能做到这一点,因为唯一已发布的正面交锋对比来自 Anthropic 自己,而独立追踪方仍在确定投入强度配置。它能给你的,是唯一一个真正能预测你账单的测量结果:基于你自己的提示词、在你将要发布的投入强度下测得的那个结果。
决策规则
如果你要开始一个新项目,请使用 Claude Opus 5.5,并从 medium 努力级别起步,然后测量 low 在你的任务上是否依然够用——Anthropic 报告称,在多项编程评测中,低级别能以低得多的成本逼近其更高设置,而上面的 FrontierCode 数据表明,默认设置并没有留下多少可挖掘的空间。
如果你在生产环境中运行 Claude Opus 5,促使你迁移的并不是那张基准测试表,而是你能否消化四项 API 变更,以及你的工作负载是否落在网络安全或生物学领域——在这些领域,防护路由会悄然把你的一部分流量交给一个更小的模型。这次升级的其余部分,不过是一次披着模型发布外衣的降价,而这样的降价值得拿下。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
