
Claude Sonnet 5.5 对比 Claude Sonnet 5:价格相同,账单不同
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
两款来自同一供应商、同一档位、同一名称的模型,而且在已公布价目表的每一行上——价格都完全相同。Claude Sonnet 5 于 2026 年 6 月 30 日发布,每百万输入 token 2.00 美元,每百万输出 token 10.00 美元。Claude Sonnet 5.5 于 2026 年 9 月 28 日正式全面可用,价格同样为 2.00 美元和 10.00 美元,两者的缓存读取均为 0.20 美元,五分钟缓存写入均为 2.50 美元。价格没有任何变化。改变的是价格表无法衡量的一切,结果就是:这两个模型中,有一个的运营成本明显低于另一个,尽管每 token 的成本完全相同。Anthropic 自己为这次发布拟的标题几乎点明了这一点,却又没有完全说破:在价目表不变的情况下,大多数工作的成本最高可降低 30%。这两句话同时成立的唯一可能,就是较新的模型用更少的 token 完成同样的工作,而这正是基准测试所显示的,也是独立的分任务数据所证实的。
Claude Sonnet 5.5 比 Claude Sonnet 5 更贵吗?
不——而且无论如何,这个问题都值得认真对待,因为大量迁移之所以出错,正是因为把统一的费率卡当成了统一的账单。
按 token 计,两个模型完全相同:输入 $2.00,输出 $10.00,读取缓存 token 为 $0.20,写入一个为 $2.50。没有分层档位,也没有长上下文附加费。无论这个更新的模型是什么,它都不是披着新一代外衣的涨价。
每完成一项任务,情况就会根据你所描述的是谁的工作负载而翻转。Artificial Analysis 报告称,在同一个 Intelligence Index v4.3 套件上,Claude Sonnet 5 每项任务成本为 5.09 美元,而 Claude Sonnet 5.5 每项任务成本为 7.60 美元——在费率相同的情况下,较新的模型完成一项任务的成本高出 49%。同一份报告指出,Sonnet 5.5 在整个套件中共输出 4.1 亿个 token,而 Sonnet 5 为 3.7 亿个,而所追踪领域的中位数为 8800 万。在评估者的开放式提示上,较新的模型就是写得多,而在价格相同的情况下,token 越多,账单就越大。
Anthropic 所谓“便宜 30%”的说法,是厂商针对自家挑选的工作负载给出的说法。第三方测出的 7.60 美元对 5.09 美元,则是在另一组数据上的实测结果。两者都没有错;这种分歧本身就是事情的全貌,而决定性因素在于你的任务是否会自行限定其输出长度。
两代之间实际改变了什么
费率卡是静态的;模型则不是。若排成单一列表,差值很大,且大多是单向的。
• Terminal-Bench 4.0 —— Claude Sonnet 5.5 取得 70.6% 的成绩,而 Claude Sonnet 5 仅为 10.3%,这是 Anthropic 在该测试上公布的最大单代跃升
• Cursor 4.0 — 55.5% 对 34.1%
• 图表学,无工具——61.6% 对 15.6%
• GDPval-AA v2.1 — 1844 对比 1449
• AA-Briefcase v1.1 — 1811 对 1359
• 人类最后的考试,带工具 — 64.5% 对 54.9%
• OSWorld 2.1,部分完成 — 80.1% 对 57.0%
• Artificial Analysis Intelligence Index v4.3 — 56 对 38,在相同的“Adaptive Reasoning, Max Effort”配置下由第三方量表测得,相差 18 分
那份榜单的形态并不是整齐划一的进步。Chartography 从 15.6% 升到 61.6%,Terminal-Bench 从 10.3% 升到 70.6%,这些看起来像是原本缺失、如今才具备的能力,而不是有所提升的能力。Humanity's Last Exam 提升 10 个百分点,OSWorld 提升 23 个百分点,而价格保持不变,这正是一代模型填补特定空白、而非整体变得更聪明的模式。18 个百分点的指数差距就是这一点的算术平均:真实、巨大,并且集中在工具使用、代码执行和视觉工作上。
对于任何仔细阅读厂商表格的人来说,有一条脚注值得注意。Anthropic 指出,在 FrontierCode 上,Max effort 配置的得分低于 Xhigh,并标注说 GDPval-AA 和 AA-Briefcase 的运行是在一个带有结构化输出缺陷的预发布部署上执行的。上述数字仍是目前可获得的最佳数据,但请将其视为来自某一次部署的快照,而非模型的永久特性。
为什么价格相同而账单不同
三种机制,按其影响真实发票的程度从大到小排列。
首先是输出长度上的自律。Sonnet 5.5 是能力更强的智能体,这意味着它在作答之前会做更多工作;而在没有长度限制的测试套件上,它写出的内容比 Sonnet 5 多约 11%,而每 token 的成本相同。在限制输出的工作负载上——例如抽取到固定 schema、分类、有界摘要——那 11% 永远不会出现,30% 的说法也就变得可信,因为收益在于以更少的轮次得到答案,而不是每轮用更少的 token。
第二点是缓存行为,而这正是缓存读取价格不变并不意味着缓存成本不变的原因。在这两个模型上,缓存读取和写入的定价完全相同,因此缓存令牌数量的任何变化都会直接反映到账单上。一个完成智能体任务所需轮次更少的模型,读取其前缀的次数也更少。这是一种背后根本没有价格变动支撑的节省,而且在所有只列出价目表条目的对比表中都不可见。
第三点是大多数团队在迁移当天最容易搞错的一点:effort 默认值。Claude Sonnet 5.5 通过 effort 参数配置推理,提供 low、medium、high、xhigh 和 max 设置,在 Claude 平台上默认为 high,在 Claude 应用内则默认为 medium。如果你是从固定了推理预算的 Sonnet 5 部署迁移而来的,新的默认值所对应的推理深度可能与你原本付费使用的并不相同。在假定会节省成本或增加支出之前,先进行测量。
有一个行为层面的后果,值得在发布前而不是发布后指出。Anthropic 表示,Claude Sonnet 5.5 是首个在 cyber 和回退机制方面与其顶级模型处于同等水平的 Sonnet,因此风险更高的网络安全请求会明显回退到 Sonnet。你的日志将显示一个你并未请求的模型。与此相关,如果你在启用 thinking 的情况下运行 Sonnet,就必须切换到 between-tools——这是代码更改,而不是一个开关。
在 OrcaRouter 上,anthropic/claude-sonnet-5 如今即可凭借单个凭据、按提供商的标价、以 0% 加价进行路由,并与 Claude Opus 5.5、Claude Opus 5、DeepSeek V4 Pro 和 Gemini 3.1 Pro Preview 并列。Claude Sonnet 5.5 本身尚未成为我们平台上的路由,因此目前这一对比的实际形态是:已经在运行 Sonnet 5 的团队可以在它上线当天就测出差异,而无须改动 API 密钥,并且在此期间只需更改一个字符串,即可在各层级之间进行故障转移。
人们在切换前会问的问题
我能同时运行两者,并在我自己的流量上做对比吗?目前还不能通过同一个 OrcaRouter 凭证实现,因为 Claude Sonnet 5.5 并不在已列出的路由中。变通做法是:在 Anthropic 自己的 API 上运行较新的模型,而通过我们来运行较旧的模型,然后比较每个已完成任务的 token 数,而不是每个 token 的成本,因为这才是两个模型真正存在差异的指标。
价格不变是否意味着 Anthropic 没有为这项新能力收费?这意味着在模型能力提升的同时,标价保持不变,这与前两代 Sonnet 的做法如出一辙。这种状况能否持续是商业问题,而非技术问题,而唯一附带的承诺是已公布的退役窗口期——不早于 2027 年 9 月。
我该相信哪个数字,Anthropic 的 30%,还是第三方的 49%?作为一般性结论,两个都不能信。Anthropic 的数字描述的是模型能在更少轮次内得出答案的工作负载;Artificial Analysis 的数字描述的则是一个不受约束的索引测试集,其中冗长程度可以自由增长。选择与你自己的提示集相似的那一个;如果你判断不出哪个才是,那么这种模糊性本身就是答案——去测量它。
最重要的一点
Claude Sonnet 5.5 并非涨价,但它也并非自动就能省钱。Anthropic 把费率卡上的每一行都保持不变,却在下面更换了模型,这意味着整个经济账都取决于每完成一项任务所消耗的 token 数——这个数字在供应商挑选的工作负载上好了 30%,而在独立评估者挑选的测试套件上差了 49%。如果你的任务能自行限定输出,那就切换并拿下这一优势。如果不能,价格不变也并不是跳过测量的理由,因为为了一个在这项工作上明确更出色的模型,你每项任务可能要付出多一半的费用。



