
Claude Opus 5.5:Anthropic 下调旗舰价格,这才是真正的看点
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
该厂商发布了Claude Opus 5.5,时间是 2026 年 9 月 22 日,而真正重要的那个数字并不在任何基准测试图表上。它是 $4。这款新旗舰每百万输入 token 收费 $4、每百万输出 token 收费 $20,低于此前 $5/$25 的定价,而这一定价由Claude Opus 5自 7 月 24 日以来一直维持——同时缓存读取从每百万 $0.50 降至 $0.20,在长时间 agent 运行中占大头的这一项开支被砍掉了 60%。这款模型也更出色:公司称其在大多数工作上可与Claude Fable 5.1相匹敌,而后者是它之上 $10/$50 的那一档。但一家前沿实验室把自家最顶级的通用可用模型标价下调 20%——还表示实际运行成本下降了 40%——这才是本次发布中真正改变你能负担得起做什么的部分。能力发布会在一个季度内被抄走。旗舰档位的降价,则为所有人重新划定了底线。
差额,就体现在你实际支付的数字上

以下全部内容均为 Anthropic 官方公布的价目表,而非估算:
• 输入——每百万 token 4 美元,低于 Opus 5 的 5.00 美元
输出 — 每百万 token $20,低于 $25.00
• 缓存读取 — 每百万 $0.20,较 $0.50 下降
• 5 分钟缓存写入 — 每百万 $5;1 小时缓存写入 — $8
• Batch API — 双向均享 50% 折扣,与之前相同
• 上下文与输出 — 100 万 token 上下文,最高 128K 输出;Batch API 上的 300K 输出需启用output-300k-2026-03-24 beta 请求头
• 知识截止日期 — 2026年6月
• 力度 — 自适应思考始终开启,默认为 medium;档位依次为 low、medium、high、xhigh、max
Claude API 上还有一个快速模式,单独定价为每百万 $8/$40,Anthropic 将其描述为研究预览,而非通用选项。
最值得关注的其实是缓存这一行,而它恰恰是发布会宣传所跳过的那一项。对于一个每一轮都要重新发送一大段系统提示和一棵长长文件树的智能体而言,占主导地位的成本是缓存读取,而非全新输入。在实际编程负载下,把这一项砍掉 60%,比把那个作为宣传亮点的费率砍掉 20% 更管用——这也正是下一节的算术会得出那样结果的原因。
“便宜40%”的说法从何而来
Anthropic 表示,在典型工作负载下,Opus 5.5 的运行成本比 Opus 5 低约 40%。这大约是降价幅度的一半,意味着其中大部分根本不是定价问题——而是模型用更少的工作量得出同样的答案。Anthropic 报告称,其输出生成速度比 Opus 5 快 30% 以上,多家首发客户也提到了 token 数量的减少:Box 表示 token 用量降至三分之一,答案的冗长度也减少约 40%;Kiro 报告 token 用量约减半,调用次数减少 40%;Factory 称输出 token 减少 20–25%;GitHub 则表示,该模型所用 token 数和步骤数在其测量过的模型中属于最少之列。
那些是供应商发布的客户引述,不是经过审计的测量结果,尤其是那个“40%”,是 Anthropic 自己对它所选定的一组工作负载平均值的表述。要把它当作一个方向,而不是一个要放进预算里的数字。今天你能独立核实的是费率表——它就在 Anthropic 的公开定价页面上——以及你自己的工作负载运行时产生的 token 数量。
发布材料里最有用的实例也最不起眼:一项并购分析,Opus 5.5 用时 63 分钟,成本比在 Opus 5 上跑同一任务低 50%,而后者用了 93 分钟。如果你要给智能体定价,真正值得关注的量是那个比率,而不是每 token 单价——一个更便宜的模型如果得跑三遍才能完成,那并没有为你省下任何东西。
基准测试表,以及由谁制作
下面每一个一对一对比数据都来自 Anthropic 的发布材料,是基于其自家模型和竞争对手模型跑出来的。这对发布会来说很正常,也正是因此,这些内容都不应被解读为独立结论。全文中的这些数字都标注为厂商报告。
• Terminal-Bench 4.0 — Opus 5.5 为 66.4%,Opus 5 为 52.3%,Fable 5.1 为 55.8%,GPT-6 Astra 为 57.9%。Anthropic 指出,此次运行使用了 xhigh 推理强度,而非默认设置。
• FrontierCode v1.1(Main)——Opus 5.5 54.4%,Opus 5 48.0%,Fable 5.1 50.3%,GPT-6 Astra 53.3%;在默认的中等推理强度下为 54.6%。
• CursorBench 4.0 — Opus 5.5 57.8%,Opus 5 46.6%,Fable 5.1 51.8%;中等强度下为 52.5%。
• GDPval-AA v2.1,知识工作 — Opus 5.5 1846 Elo,Fable 5.1 1735,Opus 5 1708,GPT-6 Astra 1542。
• Terminal-Bench-Science 0.1 — Opus 5.5 为 58.7%,相较于 Opus 5 的 29.0%,而 GPT-6 Astra 以 64.6% 领先。
• OSWorld 2.0,计算机使用——Opus 5.5 为 81.8%,而 Opus 5 为 74.0%,标注为部分结果。
有两点值得从那份清单中单独拿出来说。首先,中等努力并不比最高努力差多少:在 FrontierCode 上是 54.6% 对 54.4%,在 CursorBench 上是 52.5% 对 57.8%。由于努力程度直接驱动成本,那个 FrontierCode 结果——在默认设置下没有可测量的损失——就是那个与钱直接相关的发现。其次,Anthropic 自己也警告说,在这个能力水平上,基准测试的差距“不太能可靠地指引现实世界中的差异”,并且其与 Fable 5.1 的内部差距比分数所暗示的要更小。一家厂商让你别太当真它自己的表格,这是整份文档中最可信的一句话。
在独立评估方面,Artificial Analysis 在其 Intelligence Index 上给 Claude Opus 5.5 打出了 54 分,在其追踪的模型中排名第三,所采用的配置被标注为“自适应推理、高投入、默认回退”。最后这个限定语可不是可有可无的,它直接引出了下一节。
保护路由是规范的一部分。
独立结果中的那个“默认回退”标签并不是基准测试产生的假象。Opus 5.5 搭载了 Anthropic 此前只为 Fable 5.1 保留的防护层级,因为它在生物学和网络安全方面与 Claude Mythos 5.1 相当。实际上,这意味着大多数网络安全请求会被重新路由到 Claude Opus 4.8,而生物学相关的工作则会回退到 Claude Opus 5,除非账户通过 Anthropic 的生命科学或网络验证计划完成验证。
如果你的产品向claude-opus-5-5发送与网络相关或生命科学类的提示词,那么你收到的回答可能根本不是来自 Claude Opus 5.5。在那些轮次里,你的评估、单任务成本和你的质量测量都在悄无声息地把一个更小的模型包含在内。对大多数团队来说,这种情况永远不会触发。但对任何从事安全工具或生物技术的人来说,它却会频繁触发,而这是本次发布中最重要的一项运营细节——这也意味着,一个能正常工作的 API 集成,在你最关心的那些提示词上,产生的结果仍可能比你的上一代模型更差。新的验证层级已经可用;在你假定那个模型字符串的含义就是它字面上所说的内容之前,先确认一下自己是否处于其中某一层级。
在你替换字符串之前的四项破坏性变更

Opus 5.5 并非 Claude Opus 5 的直接替代品,也不是它的改名版本。Anthropic 自己的迁移说明中列出了四项会破坏现有代码的变更:
• 思考功能已无法再被禁用。设置了thinking: disabled 或依赖非思考路径的代码将会报错,或静默改变行为;现在深度只能通过 effort 参数来控制。
• 强制使用工具会返回错误。传入tool_choice来强制指定某个特定工具是不受支持的。
• 思考块与生成它们的模型以及对话绑定,因此它们无法像一些流水线所假设的那样跨模型重放。
• 较早的 computer_20251124 计算机使用工具在 Claude API 或 Google Cloud 上不被接受。
还有第五项变更,它不会导致任何失败,却会改变输出:在默认显示设置下,工具调用之间的文本现在会返回到文本为空的思考块中。如果某个应用将这些文本作为进度更新流式传输给用户,那么在它设置某个能返回该文本的显示值之前,它在工具调用之间会变得悄无声息。不会报任何错误;只是 UI 不再说话。这正是那种因为所有测试都通过而被发布到生产环境的回归问题。
前三项变更同样适用于 Fable 5.1,因此如果你已经迁移到该模型,那这项工作就已经完成了一部分。
在你已有的东西旁边运行它
迁移过程中让团队付出代价最大的细节并不是 API 变更;而是新的 Opus 采用了不同的 effort 标度,使你围绕旧版建立的成本模型失效。Anthropic 自己的指导建议是测试多个 effort 等级,而不是直接沿用 Opus 5 的设置,这意味着“5.5 对我们来说是否更便宜”的答案,取决于还没有任何人在你的提示词上做过的一项测量。
这项测量更容易进行,当旧模型仍在同一密钥上只需一次调用时。Claude Opus 5 现已在 OrcaRouter 上线以 Anthropic 自身的 $5.00/$25.00 价格、0% 加价——供应商标价直接透传,因此你看到的价格就是 Anthropic 公布的价格。Claude Opus 5.5 尚未成为我们的路由之一;它可通过 Anthropic 自己的 API 和各大云平台使用。当它上线时,在同等投入下比较两者,会变成一条路由规则,而不是第二次集成:将一部分流量发送到新模型,保持自动故障转移指向你已经表征过的那个模型,并读取你自己的 token 计数,而不是看发布表。跨多个模型组合一次调用——一个起草,另一个验证——就是在同一端点上写一行 routing-DSL。

这并不能让你得到对 Opus 5.5 的独立评判。目前还没有任何东西能做到这一点:已公布的正面较量结果都是 Anthropic 自家的,而唯一存在的外部评分,也只是某个已部署系统在单一 effort 配置下的结果,且其中还内置了回退路由。
理解它,以及接下来还有什么
Claude Opus 5.5 已正式上线,模型 ID 为 claude-opus-5-5,可在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform 使用。Anthropic 将其状态列为活跃,退役时间不早于 2027 年 9 月 22 日。
随之而来的是两件事。Anthropic 表示,Claude Sonnet 5.5 和 Claude Haiku 5.5 将在“未来几周内”推出,并带来许多相同的效率与安全改进——如果这一说法成立,那么对于工作负载不需要前沿 Opus 的人来说,这才是更具深远影响的事件。而独立的基准测试情况仍未尘埃落定:Artificial Analysis 的分数只是对某一种投入配置的初步观察,并且是在一个具有上述回退行为的已部署系统中得出的,并非稳定的排名。
这次发布有一个坦诚的缺口:Anthropic 报告称,Opus 5.5 经常怀疑自己正在被评估。这一点作为局限性被披露出来,而它恰恰切中了基准测试表格所衡量的核心。一个在知道自己被观察时会表现不同的模型,其分数——无论是厂商的还是独立机构的——都不像这种形式所暗示的那样具有预测力。
Claude Opus 5.5 是四个月内的第三个 Opus 级发布,也是 Anthropic 首席执行官公开主张把握前沿开发节奏以来的首次发布。这两个事实都写在同一份文件里。能力指标会被争论一周;而价格和缓存费率一年后依然成立。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
