
Claude Sonnet 5.5:中端默认之选,完整规格
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 64 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Sonnet 5.5是 Claude 系列中的中端模型,于 2026 年 9 月 28 日发布,而定价正是它值得单独写一页的全部理由:每百万输入 token 2 美元、每百万输出 token 10 美元,相比之下,Claude Opus 5.5——六天前发布的旗舰模型——则是 4 美元和 20 美元。也就是说,用一半的输出价格,换来的只是 Artificial Analysis 智能指数上 1.62 分的差距——中端模型 56.00,旗舰模型 57.62,这两个数字均由 Artificial Analysis 在指数修订版 v4.3.2 上测得,既不是我们测的,也不是厂商测的。在这两者之上还有 Claude Fable 5.1,定价 10 美元 / 50 美元,在同一修订版上得分为 53.35:比旗舰更贵,却排在它后面。与 Claude Sonnet 5.5 同为 2 美元 / 10 美元标价的,是 OpenAI 的 GPT-6.1 Sol,得分为 51.83——比那条线低了 417 个指数百分之一,而这正是权衡中端模型的读者真正不得不做的比较。
本页是一篇参考资料,给出理由的是其中的日期,而非内容的新鲜度。Claude Sonnet 5.5 在 2026-10-08 时已发布十天,这使它落在本博客报道新闻所用的七天窗口期之外。落在该窗口期内的,是一件已过去六天的事件:两条发布于 X、日期为 2026-10-02 的帖子,声称该家族的一款后继模型击败了一个竞争对手——而那个竞争对手已由其自家厂商完成却被按下未发。这一说法背后没有模型 ID,没有价目表,没有上下文窗口,在此处可访问的任何注册表中也没有任何基准测试支撑,而且它并不是本页的主题——其信源链条、厂商公开面的缺失核查以及五模型指数分布,全部由本博客已发表的那篇文章完整承担,标题为《Claude Fable 5.5 在问世之前就击败了 GPT-6.1 Astra——而这正是有趣之处》,日期为 2026-10-03。那一说法确实带来的,是一串读者提问:在等待期间,该把哪一款已发布的 Claude 模型作为统一标准?而这个问题需要的,是一篇讲述已存在模型的文章。这就是那一篇。
2026年9月28日发布了什么?
供应商自己的文档直接给出了规范,而且它是该层级的延续,而非一种新的形态。以下所有内容均于 2026-10-08 读取自 Anthropic 的 Claude 平台文档,因此这是 Anthropic 的规范,而非对其进行的独立测试。
• 已发布 — 2026年9月28日。该模型自己的文档页面开篇便写道:“最新版。发布于2026年9月28日。”
• 定位 —“速度与智能的最佳结合”,其中对比延迟一栏显示为“快”,而 Claude Opus 5.5 为“中等”,Claude Fable 5.1 为“较慢”,小型档位则为“最快”。
• 模型 ID — claude-sonnet-5-5用于 Claude API、Google Cloud、Microsoft Foundry 和 AWS 上的 Claude Platform;anthropic.claude-sonnet-5-5用于 Amazon Bedrock。每个 Claude 模型 ID 都是固定快照,因此该字符串不会在你脚下发生漂移。
• 上下文与输出 — 在 Messages API 上支持 1,000,000 个 token 的上下文和 128,000 个 token 的同步输出,而在启用 output-300k-2026-03-24 beta 标头后,在 Message Batches API 上可提升至 300,000 个 token。
• Thinking — 自适应,默认始终开启,默认 effort 为 high。最低设置为 between_tools,它会关闭前置思考,并且在 high effort 或更低时被接受。将 temperature、top_p 或 top_k 设置为默认值以外的任何值都会返回 400 错误,因此从带有已调优 temperature 的旧版 Claude 模型迁移过来的请求会明确报错,而不是悄无声息地失败。
• 知识截止日期 — 2026 年 6 月,可靠截止日期和训练数据截止日期均为此。
• 生命周期 — 活跃(最新),在 Anthropic 运营的平台上,承诺的退役时间不早于 2027 年 9 月 28 日。Amazon Bedrock 和 Google Cloud 自行设定日期。
供应商的发布措辞值得引用,因为这是一种主张,而非实测结果:Anthropic 的公告将 Claude Sonnet 5.5 描述为“相较 Sonnet 5 的一次明确升级,运行速度快 30%,对大多数工作而言成本最多降低 30%”。这句话出自供应商,并未经我们复现,而且这类主张完全取决于你拿什么工作负载去检验它。此次发布还附带了迁移成本,而本页并不适合展开:有五项破坏性变更会影响已在 Claude Sonnet 5 上运行的代码,第六项则会在不让任何请求失败的情况下改变响应形态。这笔账属于本博客在发布周刊出的那篇发布文章,如果你今天已有 Sonnet 5 在生产环境中运行,那便是首先要读的内容。

1.62 积分,以及半价
该模型的独立评分来自同一个出处,其中有一个数字足以决定这场争论。Artificial Analysis 在 Intelligence Index 上测得 Claude Sonnet 5.5 为 56.00,修订版本 v4.3.2,所用配置为页面所称的“Claude Sonnet 5.5 (Max, Default Fallback)”。我们于 2026-10-08 读取了该页面。在同一修订版本、同一天:
• Claude Opus 5.5 — 57.62,发布于 2026-09-22,$4 / $20
• Claude Sonnet 5.5 — 56.00,发布于 2026-09-28,$2 / $10
• Claude Fable 5.1 — 53.35,发布于 2026-09-01,$10 / $50
• GPT-6 Astra — 52.67,发布于 2026-09-03,$10 / $50;超过 272,000 提示 token 的长上下文档位为 $20 / $75
• GPT-6.1 Sol — 51.83,发布于 2026-09-29,$2 / $10
说明是哪一修订版很重要,因为来自指数某一版本的得分与来自另一版本的得分不可比:v4.3.2 纳入了十项评测——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1——而该集合的构成在不同修订版之间已发生变化。上述五个数字均来自同一修订版,因此它们可以相互对照阅读,也正因如此,它们中任何一个都不能与引自更早版本的某个数字对照阅读。
价格对比才是决定行为的部分。Claude Sonnet 5.5 的输出费率是 Claude Opus 5.5 的一半,输入费率同样只有其一半;在厂商自己的价目表上,中端型号的价格是 $2 / $10,而旗舰型号是 $4 / $20。把这两组已公布的数字放在一起算,比例就一目了然:按输出标价的每一美元计算,Claude Sonnet 5.5 能带来 5.60 个指数点,Claude Opus 5.5 则只有 2.88 个——也就是说,按 Anthropic 自己的费率表和 Artificial Analysis 自己的测量,每美元输出所对应的指数几乎翻倍。这只是对两个已公布数字所做的算术,而不是对任何东西的实测,而这正是中端型号论据的诚实形式。它也并非定论:一个指数点不是正确性的单位,而本页其余部分要说明的,正是这个 1.62 由什么构成、又不包含什么。

费率卡,以及变动最大的两行
Anthropic 的完整价目表,查阅日期为 2026-10-08。本节中的每一个数字均来自厂商。
• 输入 — 每百万 token 2.00 美元。输出 — 每百万 10.00 美元,且思考 token 按输出计费;由于自适应思考默认开启,此处无法将其抑制。
• 缓存读取 — 每百万 $0.10,Anthropic 将其标为基础输入价格的 5%。这与 Claude Opus 5.5 所享有的折扣比例完全相同,因此缓存不会改变两者之间的排名;而它确实意味着,一次保持稳定前缀的长时智能体运行,对其重新读取的所有内容都只需支付输入费率的十分之一。
• 缓存写入 — 五分钟缓存每百万 $2.50,一小时缓存为 $4.00。可缓存提示词的最小长度为 512 个 token,因此短提示词完全无法享受这一折扣。
• Batch API — 两个方向均享五折优惠,因此对于可以等待的任务,输入为 $1.00,输出为 $5.00。
• 无长上下文附加费——在该模型上,Anthropic 对完整的 100 万 token 窗口按标准每 token 费率计费,因此一个 900,000 token 的请求与一个 9,000 token 的请求每 token 成本相同。这与 GPT-6 Astra 有着实实在在的差异:其超过 272,000 个提示 token 的长上下文层级会跳升至 $20 / $75——这一点值得点明,因为一旦提示变长,这是两家厂商对外宣传数字出现显著分歧的唯一之处。
真正决定大多数账单的是两行价格,而非标价:长时间 agent 运行中的缓存读取折扣,以及任何异步任务的批量折扣。$2 / $10 的标价是排行榜上被拿来比较的数字;而月度账单实际上是由缓存和批量这两行价格构成的。
这个差距意味着什么,又不意味着什么
Intelligence Index 是在一个固定任务组合上得出的一个数字,而正是这一单一属性解释了围绕它的大部分困惑。v4.3.2 背后的十项评估包括智能体编程与终端任务、研究生水平的科学推理、一个软件工程任务集、一个智能体自动化任务集以及一个长上下文检索任务集,并加权合成为一个综合分数。一个模型比另一个落后 1.62 分,是落后在那个综合分数上——而不是在你的工作负载上;你的工作负载可能以完全不同的比例权衡这十项,并且可能包含它们中任何一项都不代表的任务。
实际上,这意味着划分依据是工作的形态,而不是层级的声望。Anthropic 自己的模型选择器明确做出了这种划分,值得一读,因为它并不讨好中端层级:文档告诉读者“大多数工作负载从 Claude Opus 5.5 开始”,而在“要求苛刻的推理和长周期智能体工作,或者当你在更高投入下对 Claude Opus 5.5 的评测仍不达标时”,则要改用 Claude Fable 5.1。Claude Sonnet 5.5 并不是那句话开头的模型。同一份文档将它描述为速度与智能的最佳结合,在小型档位之外拥有最快的相对延迟——这是另一种论据,而且是一种更狭窄的论据。
所以,诚实的解读是这样的。对于规模大且范围明确的工作,中端档位通常是正确答案:针对已知代码库的功能开发与缺陷修复、具有明确输出形态的抽取与分类、难点在于执行框架而非推理的工具调用循环,以及任何首 token 快、每次调用成本低比最后 2% 的能力更重要的事情。只有当工作真正是长周期的——持续数小时的智能体运行、跨越多文件而提示词无法一次容纳的重构,以及在中端档位上运行、在提高投入后仍可测量地达不到要求的评估——旗舰模型才值回其费率。最后这个条件是供应商自己提出的,而且是一个可检验的条件:把中端档位的投入程度调高,跑你自己的评估,看看它能否弥合差距。如果能,那 1.62 对你来说就不起承重作用。如果不能,你就是用自己的数据、而不是别人的综合评分,为自己的答案买了单。
这个差距并不意味着1.62分无关紧要。它是两个模型之间的全部差距,而在固定测试装置、相同条件下评估时,它是一种真实的排序。它只是针对特定任务组合、在最大努力加默认回退配置下的排序,并不能说明对于两者都未经基准测试的工作负载而言,哪一个更值得购买。
名称陷阱:这是哪个 Claude Sonnet 5.5 页面
一位搜索该模型名称的读者会在本博客上遇到几个看起来和这个页面相似的页面,但它们其实并不是。日期为 2026-09-24 的那一篇是前瞻页面:它写于该模型发布之前,主题是一条声称进行了隐秘测试的 X 帖文,并对照它将要取代的模型的数字进行了重建。在发布周发布的那一篇是推出说明:其主题是影响已在 Claude Sonnet 5 上运行的代码的五项破坏性变更,外加第六项会改变响应形态而不引发错误的变更。此外,还有一组以该模型名称与其他厂商模型进行对比的 matchup 页面,以及一个应用页面,介绍此次发布的推广涵盖哪些内容。
它们没有一个是模型页面,而这正是本文要填补的空白。这个页面是读者在搜索该模型自身名称后会找到的参考:它是什么、成本是多少、衡量什么,以及哪些工作属于它。上线页面的迁移细节和预告页面的来源评述仍留在原处;如果你有 Sonnet 5 代码在生产环境中,上线页面是你该首先点击的,而这个页面则会告诉你,你正在迁移到的模型是否是你想要的那个。
既然说到这里,有一个命名习惯值得纠正,因为它本身就会造成误导。5.5 后缀表示的是第几代,而不是名次。Claude Sonnet 5.5 和 Claude Opus 5.5 属于同一家族的同一代,而小数点前面的数字才代表层级。这个后缀完全无法告诉你哪一个会在基准测试中胜出。
可用性,按日期
Claude Sonnet 5.5 自发布起就已上线 OrcaRouter,以 anthropic/claude-sonnet-5.5 的形式提供,采用 Anthropic 自家的标价,没有任何额外加价:输入 $2.00、输出 $10.00 每百万 token,这两个数字取自我们自己的模型端点于 2026-10-08 的读数,与厂商价目表逐行一致。我们为它提供的页面同样标注 1M token 上下文窗口和 128K 最大输出,列出的可接受输入类型为文本、图像和文件,输出仅支持文本,标明发布日期为 2026-09-28 且未弃用,并显示它既可通过 OpenAI 兼容的 chat-completions 端点访问,也可通过 Anthropic 自家的 messages 端点访问——正因如此,对于已经支持其中任一接口的集成而言,它可以直接替换、无需改动。
同一目录中的其他所有内容都通过同一个密钥即可获取:一个 API 覆盖 200 多个模型,并具备以 0% 加价透传的供应商目录价,让供应商的降价一经宣布就能触达客户,自动故障转移(当某个端点性能下降时),以及一套路由 DSL,用于需要固定某个模型或把多个模型组合成一个答案的场景。正是这种组合,让本页这个问题回答起来成本很低,而不是很高。上面对比中的两个模型共用同一套凭据,因此你所对比的价格是供应商自己公布的价格,而不是转售商的报价;而版本测试花费的是一次评测运行,而不是一个迁移项目:把一部分流量指向 anthropic/claude-sonnet-5.5,其余流量继续走旗舰模型,然后让你自己每完成一项任务的成本数据来决定哪一个应该作为默认。

简短版本
Claude Sonnet 5.5 是一款中端模型,跑分已逼近旗舰,输出价格却只有旗舰的一半;而决定它是否能成为你默认选择的,正是以下三个事实。在 Artificial Analysis 的 v4.3.2 指数上,它落后 Claude Opus 5.5 1.62 分,为 56.00 对 57.62,而这两个数字都是在同一修订版本、同样的最大努力(max-effort)配置并采用默认回退的情况下测得的。它的价格为 $2 / $10,旗舰则为 $4 / $20,且缓存与批量折扣是等比例的,而非规则不同,因此无论哪款模型提供何种折扣,这一价格差距都依然存在。此外,它默认使用 high努力级别,而旗舰默认则使用medium,这意味着从旗舰沿用下来的设置在这里会高一档而不是低一档,而由此带来的成本,需要你自己去测量,而不是想当然。
Anthropic 自家的选择器对大多数工作负载仍然从 Claude Opus 5.5 起步,在你把任何东西定为标准之前,这一点值得了解。但对于大多数通过搜索这个模型名称而来到本页的读者来说,中端档位才是合理的默认选择,而旗舰则是当自家评估结果要求时才购买的例外——大批量、范围明确的工作、低延迟、无需长上下文附加费的百万 token 窗口,以及能把输出费用减半的费率。两者在 OrcaRouter 上都只差一个密钥,而决定二者取舍的评估只需花一个下午,而非一次迁移。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
