
Claude Sonnet 5.5:30%成本声明,以及会破坏Sonnet 5代码的六项变更
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
Claude Sonnet 5.5于 2026 年 9 月 28 日发布,费率与Claude Sonnet 5完全一致——每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 0.20 美元——而 Anthropic 的公告却以“对大多数工作负载而言运行速度快 30% 以上,成本最多可降低 30%”作为主打。这两句话都是真的,而它们之间的落差就是整个故事。省下的钱并不在费率表上,因为费率表根本没有动。它来自以比前代所需的更低的 effort 设置来运行模型,这意味着那个 30% 说的是一种你必须自己选择的运行点,而不是你自动继承的价格。独立测量让这个分岔变得格外分明:在 Artificial Analysis 上,Claude Sonnet 5.5在最高 effort 下,在每个任务上的成本为每任务 7.60 美元(Intelligence Index),而5.09 美元对应的是Claude Sonnet 5在最高 effort 下大约高出 49%,而不是低 30%。这并不是对 Anthropic 那个数字的反驳,而是同一条曲线的另一端;如果没有人重新跑一遍自己的 effort 扫描,大多数迁移默认就会落在这里。
两个主张共用一个数字
Anthropic 的博文在三处做出了这一每任务性能主张,而每一处都依赖 effort 这一条件。最强力的说法是:在 Terminal-Bench 4.0 上,于 Medium effort(Claude 应用中的默认设置)下,Sonnet 5.5“远超 Sonnet 5 的最佳成绩,而每任务成本不到其十分之一”。在 AA-Briefcase v1.1 上,于 Medium effort 下,它以约九分之一的成本击败了 Sonnet 5 的最佳成绩。在 CursorBench 4.0 上,于 Low effort 下,它以不到十分之一的成本超过了 Sonnet 5 的最佳成绩。
把这些放在一起看,机制就一目了然。Sonnet 5.5 的 下限高于 Sonnet 5 的 上限,在多项评估中都是如此。你并不是通过为每个 token 支付更少费用来获得这 30%;而是通过不再需要昂贵设置来获得它。Anthropic 在迁移文档中也是这么说的,就在营销材料旁边一页:“投入级别已重新校准。一个投入级别产生的思考量,不再与它在 Claude Sonnet 5 上时相同。请重新运行你的投入级别扫描,而不是沿用某个设置。”
那句话是 Anthropic 本周发布的在运营层面最重要的一句话,而它恰恰没能出现在大多数发布报道中。
Anthropic 公布的内容——厂商自述,未经复现
本节中的所有内容都是 Anthropic 自己的测量,来自 Sonnet 5.5 发布公告和系统卡。这是厂商的说法,而非独立结果,而脚注的来龙去脉与最显眼的数字同样重要。
• Terminal-Bench 4.0(智能体编程)——Sonnet 5.5 为 70.6%,而 Sonnet 5 仅为 10.3%。在被引用最多的那一行数据上,这是一次七倍的跃升,也正是大多数报道开篇所引用的数字。
• FrontierCode 1.1 (Main) — Sonnet 5.5 在 Xhigh 下为 52.1%,在 Max 下为 46.2%;Sonnet 5 为 42.4%;Claude Opus 5.5 为 54.4%;GPT-6 Sol 为 49.3%。注意这一反转:Sonnet 5.5 的得分更低:在 Max 下比在 Xhigh 下。
• CursorBench 4.0 — Sonnet 5.5 为 55.5%,而 Sonnet 5 为 34.1%,Opus 5.5 为 57.8%。CursorBench 4.0 未公开发布 GPT-6 Sol 的成绩。
• GDPval-AA v2.1(知识工作)——Sonnet 5.5 1844 Elo,Sonnet 5 1449,Opus 5.5 1846,GPT-6 Sol 1487。
• AA-Briefcase v1.1 — 在相同的四个模型上分别为 1811 / 1359 / 1822 / 1483。
• Humanity's Last Exam(使用工具)— 64.5% / 54.9% / 67.7%。
• OSWorld 2.1(计算机使用,部分得分)— 80.1% / 57.0% / 81.8%。
• Chartography(视觉图表识别,无需工具)—— 61.6% / 15.6% / 64.4% / 53.6%。
有三条脚注应当随那些行一起出现,而不是列在它们下方。 首先,Terminal-Bench 4.0 中 Opus 5.5 的 66.4% 这一数字是在 Xhigh effort 下报告的,这是 Opus 5.5 得分最高的配置。 其次,FrontierCode Max 的倒挂现象得到了解释:在 Max 下,Sonnet 5.5 更常运行 Claude Code 的代码审查技能,该技能会将审查工作拆分给许多子代理,而在两个案例中,这导致了超时或超出任务范围的修改——即便这些修改是好的,FrontierCode 也会惩罚超出范围的更改。 第三,而且对厂商来说最不轻松的是,Artificial Analysis 在一个预发布的 Sonnet 5.5 部署上运行了 GDPval-AA 和 AA-Briefcase,Anthropic 称该部署存在一个会降低结构化输出请求响应质量的缺陷。Anthropic 预计影响很小,并且会低估 Sonnet 5.5,还表示该缺陷已修复。它还指出,OpenAI 最近修复了 GPT-6 Sol 中的一个图像理解缺陷,因此那些行中的 GPT-6 Sol 数据可能尚未反映当前模型。

独立运行对同一个模型怎么说
Artificial Analysis 已对 Sonnet 5.5 进行了测量,其页面标明了确切配置:“Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)”。在该索引的同一修订版中,该类别共有 216 个模型:
• Claude Sonnet 5.5 — 智能指数 56,排名第 3(共 216)。每次指数任务成本为 $7.60。它在指数运行期间生成了 410M 个输出 token,而中位数为 88M。
• Claude Sonnet 5 — 指数 38,在 216 个中排名第 58,在其专属页面上标注为“(自适应推理,最大力度)”。每任务成本 5.09 美元。3.7 亿输出 token。
• Claude Opus 5.5 — 指数 58,在 216 个中排名第 1。每任务 $5.98。每秒输出 95.3 个 token。
• GPT-6 Sol — 指数 48,在 216 个中排名第 20,列表价 $2/$10。每任务 $1.06,每秒输出 89.8 个 token。
Intelligence Index 的差距——56 对 38,十八个百分点——是本文中最有力的独立佐证,也是读者真正应该记住的那个数字。成本数字则是需要附加说明的一个,而且值得准确说明:这两个数据点都是最大努力配置,而在一个推理更久的模型上采用最大努力,是一种刻意选择的昂贵位置。Sonnet 5.5 在该指数运行中消耗了 410M tokens,而 Sonnet 5 消耗了 370M,二者都远高于 88M 的中位数。一个在最高设置下思考更久的模型,在最高设置下成本更高。这个数字所证伪的并不是“每个任务更便宜”,而是任何把它解读为模型属性、而非设置属性的说法。
Artificial Analysis 尚未公布 Sonnet 5.5 的输出速度数据——其页面上每秒输出 token 显示为 N/A,而 Sonnet 5 为 78.7,Opus 5.5 为 95.3。因此,Anthropic 宣称中“快 30% 以上”的那一半目前仅属厂商自报数据。在第三方实测之前,请将其视为方向性参考。

节省实际上从何而来,以及如何获得
如果你接受这一机制,迁移说明便会自行写就,而 Anthropic 已经发布了它们:
• 默认从 high 开始,而不是沿用你 Sonnet 5 配置中的任何设置。Anthropic 的指导是使用 high,除非你的工作负载是智能体型或对延迟敏感的。
• 智能体编程与多步骤工具使用——从中等档开始适用于定义明确的任务,遇到更难或更长的任务时再调高至高档。
• 聊天以及其他对延迟敏感的工作——从中或低档开始。这正是“成本只需十分之一”这类说法所对应的档位。
有一种合理的解释说明为什么较低的设置有效,而这并不是营销话术。Anthropic 的早期测试者报告称,Sonnet 5.5 比 Sonnet 5 更倾向于将工具调用批量合并,从而使每个任务的步骤更少。CodeRabbit 在公告中的说明对于发布引语来说异常具体:Sonnet 5“过于频繁地诉诸网络搜索的倾向以及其高 token 消耗,在这个新模型中都已消失。” Sonnet 5.5 还保留了与 Sonnet 5 相同的分词器,因此相同的文本消耗相同的 token——减少的是轮次和冗余调用,而不是更便宜的词汇表。这也意味着你日志中的 token 计数在升级前后仍具可比性,从而使前后测量变得直接。
破坏或改变 Sonnet 5 代码的六项变更
这是发布中耗费工程时间的部分,也正是在这里,迁移指南比基准图表更有价值。六个中有五个会返回硬错误;第六个则会静默失败。
• thinking: {"type": "disabled"} 现在会返回 400。替代方案是 thinking: {"type": "between_tools"},它会关闭预先思考,并且是该模型上最低的思考设置。它在低、中、高 effort 下均可工作,无需 beta 标头,并且在所有提供 Sonnet 5.5 的平台上都可用。在 xhigh 或 max effort 下,between_tools 本身会返回 400——如果你需要这些级别,请使用自适应思考(省略该字段,或发送 {"type": "adaptive"})。使用 between_tools 时,你也无法在对话中途更改 effort。
• 不支持强制工具使用。将 tool_choice 设置为 {"type": "any"} 或 {"type": "tool", "name": "..."} 会返回 400,并附带消息“tool_choice: type 'tool' and 'any' are not supported for this model.”。同样的检查也适用于 token 计数端点。对于符合 schema 的输入,文档中记载的替代方案是 tool_choice: {"type": "auto"} 加上在工具上设置 strict: true,或者将 schema 迁移到结构化输出。
• 思考块与模型和对话绑定。 Sonnet 5.5 会读取来自 Sonnet 5、Opus 4.8、Haiku 4.5 及更早版本的思考块——不会读取来自 Opus 5、Opus 5.5 或任何 Fable 或 Mythos 模型的思考块。没有其他模型会读取 Sonnet 5.5 的思考块。将对话从 Sonnet 5 移到 5.5,推理内容会保留;将其从 Sonnet 5.5 移到其他任何模型,后续轮次就会在没有它的情况下运行。另外,API 现在会检查自某个思考块生成以来,系统提示、工具列表或更早的消息是否发生了更改;对于在 2026 年 8 月 31 日或之后创建的账户,如果这些内容发生了更改,就会返回 400。保持对话仅追加,或发送带有 prefix_mismatch_behavior: "drop_block" 的 thinking-binding-controls-2026-08-01 beta 标头。
• computer_20251124 在 Claude API 和 Google Cloud 上已被拒绝。在这些平台上使用计算机功能需要 computer_toolset_20260801 工具集。Amazon Bedrock 仍然接受较旧的工具——如果你在两者上运行同一个 agent,这是一个值得指出的平台差异。
• 部分顾问配对已不再可用。Sonnet 5.5 执行器可接受 Mythos 5.1、Fable 5.1、Mythos 5、Fable 5、Opus 5.5、Opus 5 或 Sonnet 5.5 本身作为顾问。Opus 4.8、Opus 4.7 和 Sonnet 5 顾问可与 Sonnet 5 执行器配合使用,但搭配 Sonnet 5.5 执行器时会返回 400。Sonnet 5.5 接受的每个顾问返回的建议均经过加密,因此你的客户端无法读取建议文本。
• 工具调用之间的文本现在会出现在 thinking blocks 内——而在默认的 display: "omitted" 下,它是空的。这就是静默的那个。工具调用之间超过一两句话的注释会以进度更新 thinking blocks 的形式返回,而不是作为文本返回。一个将这类叙述流式传输给用户的应用会在工具调用之间陷入静默,没有错误,日志中也没有任何内容。修复方法要么是设置 thinking.display,以便返回文本,要么切换到 between_tools,在这种情况下,文本会作为普通文本返回。
迁移还会触及另外两件事,二者都不属于错误。对拒答情况的监控:Sonnet 5.5 会返回 stop_reason: "refusal",并带有一个 stop_details 对象,其中指明五个政策领域之一——cyber、bio、frontier_llm、reasoning_extraction、general_harms——而 Anthropic 的服务器端回退机制会在 Sonnet 5 上重试 cyber 和 frontier_llm 的拒绝,但不会重试另外三个。而安全态势确实变了:Sonnet 5.5 是首个像 Opus 级别那样随附 cyber 防护措施和回退机制的 Sonnet 模型,这意味着风险更高的网络安全请求会明显回退到 Sonnet 5;它也是首个配备针对推理提取的分类器的 Sonnet。如果你的产品价值主张是一款安全工具,那么在交付模型切换之前,请测试这一点。
定价,以及今天真正在我们路线上的内容
费率表与 Sonnet 5 相比没有变化,而且其完整公布形态足够简短,可以直接说明:
• 输入 — 每百万 token 2.00 美元。 输出 — 每百万 token 10.00 美元。两者均与 Sonnet 5 相同,已在 Anthropic 的 Sonnet 5.5 模型页面上确认。
• 缓存读取 — 每百万 $0.20,输入费用可享 90% 折扣;5 分钟缓存写入 每百万 $2.50;1 小时缓存写入 每百万 $4.00。在 Sonnet 5.5 上,可缓存提示的最低长度为 512 个 token,低于 Sonnet 5 的 1,024 个。
• 批处理 — 双向均享 50% 折扣,即每百万 $1.00 / $5.00。在 Message Batches API 上,使用 output-300k-2026-03-24 beta 标头时,输出最高可达 300K tokens。
• 对比 Opus 5.5——Sonnet 5.5 的价格恰好只有一半:每百万 token $2/$10 对 $4/$20,缓存写入费用减半,缓存读取费用则同为 $0.20。这才是划算的迁移,而 Anthropic 也直言不讳:当 Sonnet 以较低的推理强度运行时,两个模型互补效果最佳,而 Opus“在需要持续判断的复杂、开放式任务中依然明显更强”。
• 上下文与输出 — 1M token 上下文,128K 最大输出,默认开启自适应思考,默认 effort 为 high,可靠知识截止日期为 2026 年 6 月,可提供零数据保留,退役时间不早于 2027 年 9 月 28 日。
有一条可用性说明,我们宁愿明说,也不愿暗示:截至 2026 年 9 月 29 日,Claude Sonnet 5.5 不在我们的模型目录中。它的前代产品anthropic/claude-sonnet-5以及它更大的同门anthropic/claude-opus-5.5都在目录中,而在我们这边,它的费率就是供应商自己的费率——Sonnet 5 为输入 $2.00、输出 $10.00、缓存读取 $0.20、缓存写入 $2.50,未加任何加价,因此供应商的价格一旦变动,当天就会在这里生效,而不是等到下一个计费周期。正是最后这一点,让费率表的解读具有实际价值,而不只是装饰。

你现在可以用它做什么
对于一个已经在生产环境中运行 Claude Sonnet 5 的团队来说,诚实的推进顺序分为三步,而其中没有一步是“替换模型字符串,然后盯着图表看”。
首先,重新运行推理力度扫描。如果你是因为质量标准要求而从 Sonnet 5 沿用了高或最高设置,那么你现在正在为不再需要购买的推理付费。独立的每任务成本数据表明,阶梯的顶端变得更贵了,而不是更便宜,而供应商自己的成本说法描述的都是其中间档。其次,在部署前修复两条错误路径——禁用思考与强制工具使用——因为两者都会立即并明显地失败,这是好消息。第三,留意叙述路径,因为它会静默失败。
如果该模型还没有出现在你使用的路由上,低风险的评估方式是让它并行运行,而不是取而代之:把 Sonnet 5 固定为同一密钥上的回退模型,这样一旦出现拒绝、超时或评估不佳,请求就会转给你已经信任的模型,而自动故障转移无需第二次集成即可完成闭环。这就是在一个端点背后、而不是在用户面前评估未经证实模型的全部理由——而这一点在这里更是双重成立,因为 Sonnet 5.5 的拒绝类别是全新的,其投入程度的校准也明确与其前代不同。当你准备更换默认模型时,单一密钥上的模型阵容可达200 多个模型,这让比较变成一次配置更改,而不是第二份合约。
看什么
三件事将解决本文中的未解问题,但目前一件都还没有发生。
独立的输出速度测量是第一项。Anthropic 声称比 Sonnet 5 快 30% 以上;Artificial Analysis 尚未公布 Sonnet 5.5 的相关数据,而这一说法在成本论证中确实发挥着实际作用,因为更快的模型能在更短的实际时间内完成同一任务,而且往往消耗更少的 token。Claude Haiku 5.5 是第二项——Anthropic 表示它将在“未来几周内”推出,并将定位在 Sonnet 5.5 之下,这会改变高流量聊天场景的算法,因为在中等和低努力水平下,Sonnet 5.5 本就已具备竞争力。第三项是修正补测:Artificial Analysis 是在一个存在结构化输出缺陷的预发布版本上运行 GDPval-AA 和 AA-Briefcase 的,Anthropic 预计这些分数会低估该模型,而这两个数字都尚未重新测试。如果它们上调,与 Opus 5.5 之间的知识工作差距将进一步缩小,“价格减半”的论点也会更有说服力。
在那之前,站得住脚的总结比公告更狭窄,却比基准图表更有用。Claude Sonnet 5.5 在独立指数上比 Sonnet 5 有十八点的智能提升,公布费率相同,任何沿努力程度阶梯向下移动的人都能获得真实且可衡量的节省——而不这样做的人则会付出真实且可衡量的代价。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
