为 Claude Sonnet 5.5 与 Claude Opus 5.5 生成的主视觉标题卡,副标题为“基准测试趋同,账单却不然”,左侧显示每百万 token $2.00 和 $10.00,右侧为 $4.00 和 $20.00,右下角合成有 OrcaRouter 徽标。
Guides & Insights

Claude Sonnet 5.5 对比 Claude Opus 5.5:基准测试趋同,账单却不然

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.5 于 2026 年 9 月 28 日正式全面可用,价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元。Anthropic 的旗舰模型 Claude Opus 5.5 早六天、于 9 月 22 日发布,价格为 4.00 美元和 20.00 美元——两项价格恰好翻倍。最直观的解读是:Opus 5.5 是天花板,而 Sonnet 5.5 是预算有限时不得不做的妥协。但 Anthropic 自家发布的表格并不支持这种解读。按照该公司公布的数字,在 GDPval-AA v2.1 上,Claude Sonnet 5.5 拿下 1844 分,Opus 5.5 为 1846 分;在 AA-Briefcase v1.1 上为 1811 对 1822;在 Terminal-Bench 4.0 上则是 70.6% 对 66.4%——它赢下了那个衡量终端内实际完成工作的基准测试。而在这些数字下方两行,Anthropic 自己的图注写着:Opus 5.5“在复杂、开放式的工作上依然明显更强”。这两句话都成立,而想清楚如何同时容纳它们,正是这份对比存在的主要意义。

发布表透露了什么,又拒绝透露什么

Anthropic 基准测试板块所呈现的模式是:这是一款已填补大部分差距、而非取得领先的模型。GDPval-AA v2.1 是一套按经济权重构建的任务集,结果为 2 个百分点的持平。AA-Briefcase v1.1 是一项文档与交付物评测,为 11 个百分点的持平。CursorBench 4.0 则相反:Sonnet 5.5 为 55.5%,Opus 5.5 为 57.8%。OSWorld 2.1 为 80.1% 对 81.8%,Humanity's Last Exam 在使用工具的情况下为 64.5% 对 67.7%。只有 Terminal-Bench 4.0 打破了这一模式,而且打破得很彻底——70.6% 对 66.4%,Sonnet 在智能体命令行任务上领先 4 个百分点。

不看数字,改看行标签,就会浮现出另一番景象。其中若干条 Opus 5.5 记录带有 effort 标注——Xhigh 下为 66.4%——而一条脚注指出,Max 配置在 FrontierCode 上的得分比 Xhigh更低,而非更高。更高的 effort 并非单调递增。一个注重成本的团队若以为“最大 effort”是免费升级,那就是在 Anthropic 自家的至少一项测试上多花 token 却换回更差的答案。而在 FrontierCode 1.1 上,同一条脚注显示 Sonnet 5.5 在 Max 配置下为 46.2%,对比 Opus 5.5 的 54.4%——这是说明旗舰型号究竟在何处仍能拉开身位的最清晰的一个数字:在奖励坚持性的任务定义之下从事长时程代码工作。

还有一点值得直说,而不是一笔带过。Anthropic 指出,其发布的 GDPval-AA 和 AA-Briefcase 运行结果,是在一个带有结构化输出缺陷的预发布部署上执行的。这会影响同一张表中的两个模型,因此比较并未因此失效,但这确实意味着绝对数值应被视为快照,而不是最终定论。厂商的基准测试表本质上是附有方法论附录的营销产物,而这一张表还把自己的附录一并附上了。

独立测量最终落在何处

Artificial Analysis 在同一个测试框架下,用其标注为“Adaptive Reasoning, Max Effort, Default Fallback”的同一配置,基于 Intelligence Index v4.3 为这两款模型打分。Claude Opus 5.5 得 58 分。Claude Sonnet 5.5 得 56 分。在同一个评测方给出 Opus 5 为 51、Sonnet 5 为 38、DeepSeek V4 Pro 为 36、Gemini 3.1 Pro Preview 为 30 的量表上,这就是两分的差距。一款新的 Sonnet 以低于旗舰两点、高于上一代 Opus 五点的成绩登场,是本次发布的核心主张,而且这是第三方的主张,而非厂商自己的主张。

随后,同一页面又颠覆了这一经济账。Artificial Analysis 报告称,一次 Sonnet 5.5 评估运行每项任务花费 7.60 美元,而 Opus 5.5 为 5.98 美元,尽管 Sonnet 5.5 每 token 价格只有一半。原因就在页面中:Sonnet 5.5 在整个索引套件中生成了 4.1 亿个 token,而它所追踪的模型中位数为 8800 万——用评估者的话说,“非常啰嗦”。Opus 5.5 在同一套件中生成了 2.6 亿个。在每百万输出 token 10 美元对 20 美元的情况下,大约 1.6 倍的啰嗦系数仍使 Sonnet 5.5 每完成一项任务多付约 27%。

这正是按 token 计价的价目表无法向你展示的那部分对比,也是这两个数字能够并存而不矛盾的原因。按 token 计算,Sonnet 5.5 便宜一半。按完成的任务计算,在一个包含开放式提示词且没有输出长度约束的评测套件上,它可能更贵。哪一种情况描述了你的工作负载,才是真正要做的决定。

工作量级别、输出上限以及集成的形态

对买家而言,这两款车型在机械方面的重要特性几乎完全相同。

• 上下文 — 两者均为 1,000,000 个 token,来自同一提供商,因此提示工程假设可原样迁移

• 最大输出 — 两者均为 128,000 tokens;批量生成在这里并不是差异化优势

• 模态 — 两者均支持文本、图像和文件输入;两者均不接受音频或视频

• 推理控制——两者均采用自适应思考,深度由 effort 参数而非思考 token 预算决定。在 Claude Platform 上,默认值为高;在 Claude 应用内,默认值为中。

• 缓存写入 — Claude Opus 5.5 每百万 $5.00,而 Claude Sonnet 5.5 为 $2.50;这是唯一一项更便宜的模型在喂入重建前缀时也同样更便宜的费用

• 缓存读取 — 两者均为每百万 $0.20,在主导长时间 Agent 运行的那一项上完全持平

由于二者的接口面一致,在它们之间迁移只需更改模型字符串并重新衡量工作量,而不是一个集成项目。这在跨供应商场景中并不常见,也正是这个特定组合之所以值得比较的原因所在:这两个候选方案在价格和深度上存在差异,而不在于你必须编写的 API。

有一项运营层面的差异值得单独说明。Anthropic 表示,Claude Sonnet 5.5 是首个在发布时便为其配备与顶级模型同等地位的网络安全防护措施与回退机制的 Sonnet 模型,这意味着风险较高的网络安全请求会被明确路由至上一代 Sonnet,而不是由你指定的那个模型来回答。如果你的工作负载涉及该领域,那么模型字符串并不能保证究竟是哪个模型做出了响应——在任一层级上都是如此。Anthropic 还指出,如果你在禁用思考功能的情况下运行 Sonnet,就必须改为使用工具间行为(between-tools behaviour),这是一项代码变更,而非配置开关。这两点都不是回避该模型的理由;它们都是在上线前应当了解清楚的理由。

在 OrcaRouter 上,Claude Opus 5.5 如今已能使用与目录中其他所有模型相同的凭据进行路由,按供应商的标价、0% 加价,其底层还提供自动故障转移。Claude Sonnet 5.5 目前尚未成为我们平台上的一条路由——该模型才发布一天,在它被列入之前,诚实的说法是:你只能通过 Anthropic 自家的 API 来访问它。目前通过我们运行 Opus 5.5 的用户,可以在它上线当天就评估切换的成本,而无需改动其集成的任何其他部分。

哪个放到哪里

由此得出的分工是:终端类智能体工作用 Claude Sonnet 5.5,因为在 Anthropic 自家的 Terminal-Bench 4.0 数据上它是两者中更强的一个,而且价格只有一半;任何以吞吐量为核心的任务也用 Claude Sonnet 5.5,因为只有当任务强制生成长输出时,成本差距才会缩小;涉及 FrontierCode 级别的工作、跨大型代码库的长周期重构,以及任何 54.4% 对 46.2% 的差距反映的是你实际问题形态而非排行榜名次的工作负载,则用 Claude Opus 5.5。

如果你的任务是开放式的、你无法预测输出长度,那就把按 token 计价的价格完全当成一个用错的数字。在你决定走哪条路之前,先用自己的真实流量花一周时间测量每个已完成任务所消耗的 token 数;artificial-analysis 给出的 7.60 美元对 5.98 美元这个数字就是一个警告:便宜的那个模型可能在你真正付费的那个指标上反而输掉。

诚实地说:这已经不再是能力与成本之间的取舍。问题在于你的工作是否有边界。对于有边界、高频、由工具驱动的任务,从现有证据看,更便宜的模型同时也是更好的那一个,旗舰模型不值两倍的价钱。而对于开放式、长周期的工作,Anthropic 自己那句话——Opus 5.5 依然明显更强——才是应该相信的,无论基准测试如何趋同,目前都改变不了这一点。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.