为 Claude Sonnet 5.5 与 Claude Sonnet 5 生成了主视觉标题卡,副标题为“价格相同,账单不同”,两侧均显示每百万 token 2.00 美元和 10.00 美元,下方为分道扬镳的每任务成本数值,右下角合成 OrcaRouter 标志。
Guides & Insights

Claude Sonnet 5.5 对比 Claude Sonnet 5:价格相同,账单不同

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

两款来自同一供应商、同一档位、同一名称的模型,而且在已公布价目表的每一行上——价格都完全相同。Claude Sonnet 5 于 2026 年 6 月 30 日发布,每百万输入 token 2.00 美元,每百万输出 token 10.00 美元。Claude Sonnet 5.5 于 2026 年 9 月 28 日正式全面可用,价格同样为 2.00 美元和 10.00 美元,两者的缓存读取均为 0.20 美元,五分钟缓存写入均为 2.50 美元。价格没有任何变化。改变的是价格表无法衡量的一切,结果就是:这两个模型中,有一个的运营成本明显低于另一个,尽管每 token 的成本完全相同。Anthropic 自己为这次发布拟的标题几乎点明了这一点,却又没有完全说破:在价目表不变的情况下,大多数工作的成本最高可降低 30%。这两句话同时成立的唯一可能,就是较新的模型用更少的 token 完成同样的工作,而这正是基准测试所显示的,也是独立的分任务数据所证实的。

Claude Sonnet 5.5 比 Claude Sonnet 5 更贵吗?

不——而且无论如何,这个问题都值得认真对待,因为大量迁移之所以出错,正是因为把统一的费率卡当成了统一的账单。

按 token 计,两个模型完全相同:输入 $2.00,输出 $10.00,读取缓存 token 为 $0.20,写入一个为 $2.50。没有分层档位,也没有长上下文附加费。无论这个更新的模型是什么,它都不是披着新一代外衣的涨价。

每完成一项任务,情况就会根据你所描述的是谁的工作负载而翻转。Artificial Analysis 报告称,在同一个 Intelligence Index v4.3 套件上,Claude Sonnet 5 每项任务成本为 5.09 美元,而 Claude Sonnet 5.5 每项任务成本为 7.60 美元——在费率相同的情况下,较新的模型完成一项任务的成本高出 49%。同一份报告指出,Sonnet 5.5 在整个套件中共输出 4.1 亿个 token,而 Sonnet 5 为 3.7 亿个,而所追踪领域的中位数为 8800 万。在评估者的开放式提示上,较新的模型就是写得多,而在价格相同的情况下,token 越多,账单就越大。

Anthropic 所谓“便宜 30%”的说法,是厂商针对自家挑选的工作负载给出的说法。第三方测出的 7.60 美元对 5.09 美元,则是在另一组数据上的实测结果。两者都没有错;这种分歧本身就是事情的全貌,而决定性因素在于你的任务是否会自行限定其输出长度。

两代之间实际改变了什么

费率卡是静态的;模型则不是。若排成单一列表,差值很大,且大多是单向的。

• Terminal-Bench 4.0 —— Claude Sonnet 5.5 取得 70.6% 的成绩,而 Claude Sonnet 5 仅为 10.3%,这是 Anthropic 在该测试上公布的最大单代跃升

• Cursor 4.0 — 55.5% 对 34.1%

• 图表学,无工具——61.6% 对 15.6%

• GDPval-AA v2.1 — 1844 对比 1449

• AA-Briefcase v1.1 — 1811 对 1359

• 人类最后的考试,带工具 — 64.5% 对 54.9%

• OSWorld 2.1,部分完成 — 80.1% 对 57.0%

• Artificial Analysis Intelligence Index v4.3 — 56 对 38,在相同的“Adaptive Reasoning, Max Effort”配置下由第三方量表测得,相差 18 分

那份榜单的形态并不是整齐划一的进步。Chartography 从 15.6% 升到 61.6%,Terminal-Bench 从 10.3% 升到 70.6%,这些看起来像是原本缺失、如今才具备的能力,而不是有所提升的能力。Humanity's Last Exam 提升 10 个百分点,OSWorld 提升 23 个百分点,而价格保持不变,这正是一代模型填补特定空白、而非整体变得更聪明的模式。18 个百分点的指数差距就是这一点的算术平均:真实、巨大,并且集中在工具使用、代码执行和视觉工作上。

对于任何仔细阅读厂商表格的人来说,有一条脚注值得注意。Anthropic 指出,在 FrontierCode 上,Max effort 配置的得分低于 Xhigh,并标注说 GDPval-AA 和 AA-Briefcase 的运行是在一个带有结构化输出缺陷的预发布部署上执行的。上述数字仍是目前可获得的最佳数据,但请将其视为来自某一次部署的快照,而非模型的永久特性。

为什么价格相同而账单不同

三种机制,按其影响真实发票的程度从大到小排列。

首先是输出长度上的自律。Sonnet 5.5 是能力更强的智能体,这意味着它在作答之前会做更多工作;而在没有长度限制的测试套件上,它写出的内容比 Sonnet 5 多约 11%,而每 token 的成本相同。在限制输出的工作负载上——例如抽取到固定 schema、分类、有界摘要——那 11% 永远不会出现,30% 的说法也就变得可信,因为收益在于以更少的轮次得到答案,而不是每轮用更少的 token。

第二点是缓存行为,而这正是缓存读取价格不变并不意味着缓存成本不变的原因。在这两个模型上,缓存读取和写入的定价完全相同,因此缓存令牌数量的任何变化都会直接反映到账单上。一个完成智能体任务所需轮次更少的模型,读取其前缀的次数也更少。这是一种背后根本没有价格变动支撑的节省,而且在所有只列出价目表条目的对比表中都不可见。

第三点是大多数团队在迁移当天最容易搞错的一点:effort 默认值。Claude Sonnet 5.5 通过 effort 参数配置推理,提供 low、medium、high、xhigh 和 max 设置,在 Claude 平台上默认为 high,在 Claude 应用内则默认为 medium。如果你是从固定了推理预算的 Sonnet 5 部署迁移而来的,新的默认值所对应的推理深度可能与你原本付费使用的并不相同。在假定会节省成本或增加支出之前,先进行测量。

有一个行为层面的后果,值得在发布前而不是发布后指出。Anthropic 表示,Claude Sonnet 5.5 是首个在 cyber 和回退机制方面与其顶级模型处于同等水平的 Sonnet,因此风险更高的网络安全请求会明显回退到 Sonnet。你的日志将显示一个你并未请求的模型。与此相关,如果你在启用 thinking 的情况下运行 Sonnet,就必须切换到 between-tools——这是代码更改,而不是一个开关。

在 OrcaRouter 上,anthropic/claude-sonnet-5 如今即可凭借单个凭据、按提供商的标价、以 0% 加价进行路由,并与 Claude Opus 5.5、Claude Opus 5、DeepSeek V4 Pro 和 Gemini 3.1 Pro Preview 并列。Claude Sonnet 5.5 本身尚未成为我们平台上的路由,因此目前这一对比的实际形态是:已经在运行 Sonnet 5 的团队可以在它上线当天就测出差异,而无须改动 API 密钥,并且在此期间只需更改一个字符串,即可在各层级之间进行故障转移。

人们在切换前会问的问题

我能同时运行两者,并在我自己的流量上做对比吗?目前还不能通过同一个 OrcaRouter 凭证实现,因为 Claude Sonnet 5.5 并不在已列出的路由中。变通做法是:在 Anthropic 自己的 API 上运行较新的模型,而通过我们来运行较旧的模型,然后比较每个已完成任务的 token 数,而不是每个 token 的成本,因为这才是两个模型真正存在差异的指标。

价格不变是否意味着 Anthropic 没有为这项新能力收费?这意味着在模型能力提升的同时,标价保持不变,这与前两代 Sonnet 的做法如出一辙。这种状况能否持续是商业问题,而非技术问题,而唯一附带的承诺是已公布的退役窗口期——不早于 2027 年 9 月。

我该相信哪个数字,Anthropic 的 30%,还是第三方的 49%?作为一般性结论,两个都不能信。Anthropic 的数字描述的是模型能在更少轮次内得出答案的工作负载;Artificial Analysis 的数字描述的则是一个不受约束的索引测试集,其中冗长程度可以自由增长。选择与你自己的提示集相似的那一个;如果你判断不出哪个才是,那么这种模糊性本身就是答案——去测量它。

最重要的一点

Claude Sonnet 5.5 并非涨价,但它也并非自动就能省钱。Anthropic 把费率卡上的每一行都保持不变,却在下面更换了模型,这意味着整个经济账都取决于每完成一项任务所消耗的 token 数——这个数字在供应商挑选的工作负载上好了 30%,而在独立评估者挑选的测试套件上差了 49%。如果你的任务能自行限定输出,那就切换并拿下这一优势。如果不能,价格不变也并不是跳过测量的理由,因为为了一个在这项工作上明确更出色的模型,你每项任务可能要付出多一半的费用。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Sonnet 5 across eight rows. Both columns carry the identical rate card: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output. The rows that differ are AA Intelligence Index v4.3 score 56 for Claude Sonnet 5.5 against 38 for Claude Sonnet 5, $7.60 per task on the index run against $5.09, and Terminal-Bench 4.0 (vendor) 70.6% against 10.3%. The card heading reads "Identical rate cards, different bills: Claude Sonnet 5.5 against Claude Sonnet 5", and a footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Every price line is a tie by design: the two models share one rate card and differ only in what they emit to finish the same task."Screenshot of the OrcaRouter model page for Anthropic Claude Sonnet 5 (anthropic/claude-sonnet-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.24-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-06-30" line, and the $2.00 input and $10.00 output prices per million tokens.Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.