
Claude Sonnet 5.5 已在 Claude 和 API 上线——带来五项会破坏现有代码的变更
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 348 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 107 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
Claude Sonnet 5.5 已正式上线。厂商公告的日期为 2026 年 9 月 28 日,Claude Platform 模型页面将其标注为"Latest",其标识符为 claude-sonnet-5-5,适用于 Claude API、Amazon Bedrock、各云控制台、Microsoft Foundry 以及 AWS 上的 Claude Platform。本周正在推进的,是向 Claude 本身和 API 的推送。而会让你搭进去一整天的,则在同一份文档的别处:五项破坏性变更会影响已在 Claude Sonnet 5 上运行的代码,还有第六项会在不让任何请求失败的情况下改变响应结构。
这就是本次发布的样子。价目表没有动:Claude Sonnet 5.5 每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元,与 Claude Sonnet 5 完全相同,缓存读取为 0.20 美元,五分钟缓存写入为 2.50 美元。能力却提升了很多。在 Artificial Analysis 当前修订版榜单上,新模型比它所取代的模型高出 18 分,这是该榜单上连续两代 Sonnet 模型之间最大的差距。迁移成本相应地也是最大的。这些都不是抱怨——一个变得更好却没有更贵的模型正是理想情况——但这两个事实是一同到来的,而发布说明正是决定你这周过得好不好的那一半。
9月28日到底发布了什么?

该规范是该层级的直接延续,而不是一种新形态:
• 模型 ID — claude-sonnet-5-5在 Claude API、AWS 上的 Claude Platform 和 Microsoft Foundry 上为 anthropic.claude-sonnet-5-5在 Amazon Bedrock 上为
• 价格 — 输入 $2 / MTok,输出 $10 / MTok,五分钟缓存写入 $2.50,一小时缓存写入 $4,缓存读取 $0.20
• 批处理 — 双向均享 5 折,即每百万 Token $1 / $5
• 上下文与输出 — 输入 1M tokens,同步输出 128K tokens;在 Message Batches API 上可输出 300K,需启用 output-300k-2026-03-24 beta 请求头
• 思考 — 自适应,默认投入程度为 高;知识与训练的截止时间均为 2026 年 6 月
• 生命周期 — 从发布起零数据保留,并公布退役下限不早于 2027 年 9 月 28 日
有两个细节容易被忽略,却很重要。第一,不存在长上下文附加费:Anthropic 按标准费率对完整的 100 万 token 窗口计费,因此一个 90 万 token 的请求与一个 9,000 token 的请求,每 token 成本相同。第二,上一代模型 $2 / $10 的费率最初是促销定价,原定于 2026 年 9 月 1 日上调至 $3 / $15;Anthropic 的定价页面现在声明该次涨价不会发生,这使得 Sonnet 档位的当前价格成为一项长期承诺,而非短期促销。这两点都属于厂商声明,而非独立调查得出的结论。
迁移清单,按它们将依次造成麻烦的顺序
Anthropic 的 Sonnet 5.5 概览对此异常直白:有五项破坏性变更会影响已在 Claude Sonnet 5 上运行的代码。它们并非风格层面的问题。每一项要么返回错误,要么悄无声息地改变行为。
• 强制工具调用会被拒绝。现在,tool_choice设为"any",或指定某个具体工具时,会返回错误,而不再对模型施加约束。如果你的智能体循环通过固定某个工具来保证结构化调用,那么在首次请求时该循环就会失效。替代做法是让模型自行选择并校验结果,或者把这种保证转移到结构化输出中。
• thinking: {"type": "disabled"} 会被拒绝。彻底关闭思考不再是受支持的设置。替代方案是 between_tools,它会关闭前置思考,并在 high effort 或更低时可用。它是模型上最低的思考设置,而不是关闭开关。
• 思考块会绑定到模型和对话。上一轮产生的推理会从 Claude Sonnet 5 延续到 Claude Sonnet 5.5,但不会延续到另一个系列,也不会跨账户延续。跨模型版本重放对话记录的应用程序会发现,原本被接受的思考块现在会被拒绝。
• computer_20251124 不被接受,无论是在 Claude API 还是 Google Cloud 上。声明了较早 computer-use 工具版本的代码必须迁移到当前工具集。
• 顾问工具会拒绝自己的同族模型。Claude Opus 4.8、Claude Opus 4.7 和 Claude Sonnet 5 被拒绝担任顾问,因此任何使用较小的 Claude 模型来核查较大模型的流水线都需要重新配对。
接下来是那种不会导致任何失败的变更。模型在工具调用之间发出的文本,现在会出现在 thinking 块中,而不是作为普通输出。向用户流式传输文本的应用在工具调用之间会陷入沉默——没有错误,没有异常,只是 UI 看起来卡住了,直到你设置一个能返回文本的 display 值,或切换到 between_tools。这是最有可能进入生产环境的故障模式,因为测试套件里没有任何东西会抛出异常。
为完整起见,再补充一点:将temperature、top_p或top_k设为任何非默认值都会返回 400。如果你的网关或客户端库是出于习惯而非有意设置 temperature,那么这个习惯现在会导致服务中断。
30%的说法,对照独立数据

Anthropic 为 Claude Sonnet 5.5 打造的营销宣传语是:在每 token 费率相同的情况下,它“完成每项任务的成本比前代最多低 30%”,并且“生成输出的速度比 Claude Sonnet 5 快 30% 以上”。这两种说法针对的都是 token,而非价格,而且都来自厂商自报。第一种说法背后的机制,在厂商自己的基准测试表中清晰可见:在 Terminal-Bench 的 Medium effort 档位下,Anthropic 称 Claude Sonnet 5.5 以“每项任务成本不到十分之一”击败了 Claude Sonnet 5 的最佳成绩,并对 Low effort 下的 CursorBench 和 Medium 下的 AA-Briefcase 给出了类似说法。
独立评测在方向上一致,在幅度上存在分歧。在 Artificial Analysis 的 v4.3.2 智能指数中——十项评测,所有模型均以同一配置运行——Claude Sonnet 5.5 得分为 56,该页面将其列为 216 个模型中的第 3 名。Claude Sonnet 5 在同一榜单上得分为 38。这意味着同一层级、同一价位的两个相邻模型之间相差 18 分,也是 Anthropic 今年在 Sonnet 系列内部拉开的最大差距。
成本数字正是厂商说法更难站得住脚的地方。Artificial Analysis 测得 Claude Sonnet 5.5 每完成一项 Intelligence Index 任务的成本为 7.60 美元。这个数字并不比同类中的任何模型低 30%,因为该模型极其冗长:为完成 Index 评估,它输出了 4.1 亿个输出 token,而同类可比模型的中位数为 8800 万个。每 token 效率与每任务效率是不同的量,Claude Sonnet 5.5 在第一个方面异常出色,在第二个方面则只是平均水平。
Anthropic 针对此次发布自行公布的所有基准测试数据均为厂商报告,尚未被第三方复现,其中两项还带有值得重复的脚注:GDPval-AA v2.1 和 AA-Briefcase v1.1 的数据由 Artificial Analysis 在一个预发布部署上运行,而该部署存在一个可能低估分数的 bug;Anthropic 对其 FrontierCode 1.1 数据的说明则解释了,为什么 Claude Sonnet 5.5 在该评估中 Max effort 下的得分低于 Xhigh。一张模型在更低 effort 设置下击败自己的表格,就是在告诉你:它的基准测试配置尚未确定。
如何在不拿生产路径冒险的情况下测试它
在迁移过程中,通过路由器运行 Claude Sonnet 5.5,而不是直接对接供应商端点,有一个具体原因:你不必在了解情况期间就只能在旧模型和新模型之间二选一。在 OrcaRouter 上,Claude Sonnet 5 自 6 月 30 日起就已可路由,价格为 Anthropic 自家的 $2 / $10,未加价,并且是单一 OpenAI 兼容端点背后 200 多个模型之一,它仍然是承载大多数 Claude API 流量的模型。Claude Sonnet 5.5 尚未进入我们的目录,因此目前接入它的途径是 Anthropic 自己的 API。
与此同时,可行的做法是把一部分流量发送给新模型,让故障转移承接其余部分——以 Claude Sonnet 5 作为回退模型,这样,五个破坏性变更中任意一个返回的 400 都会降级为更慢的回答,而不是一次失败的请求。这也是衡量厂商宣称所无法告诉你的事情的最省钱方式:在相同 effort 设置下,你自己在两个模型上每个任务消耗的 token 数。30% 这个数字是 Anthropic 自家各项评估的平均值;你的流量并不是那个平均值。
接下来会到来什么
Anthropic 的公告称,Claude Haiku 5.5 将在“未来几周”加入该系列,这将补齐小模型层级的 5.5 代。在那之前,对于在生产环境中运行 Sonnet 的团队来说,摆在面前的两个决策可以分开处理:迁移是一项可以排期、只需一天的工作,而模型切换则是一项可以推迟的测量。按相反顺序来做——先切换模型,然后在生产环境中发现强制工具调用错误——就是这次推广中会让你搭进一个周末的那种做法。

