为 Claude Sonnet 5.5 与 Claude Opus 5 生成了主视觉标题卡,副标题为“降价 60%,差距 5 个百分点”,展示每百万 token 2.00 美元和 10.00 美元对应 5.00 美元和 25.00 美元,并在右下角合成 OrcaRouter 标志。
Guides & Insights

Claude Sonnet 5.5 对比 Claude Opus 5:每项都更便宜,且在指数上领先

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Opus 5 于 2026 年 7 月 24 日发布,定价为每百万输入 token 5.00 美元、每百万输出 token 25.00 美元。Claude Sonnet 5.5 于 2026 年 9 月 28 日正式可用,定价分别为 2.00 美元和 10.00 美元。对于一款新两代的模型来说,这意味着输入价格降低 60%、输出价格降低 60%——而且在 Artificial Analysis 对两者运行的测试框架上,这款模型在 Intelligence Index v4.3 上得分为 56,而 Claude Opus 5 为 51。这是一次罕见的对比:更新、更便宜的模型在第三方指数上同时也是得分更高的那一个,而现有模型仅剩的理由不再是基准排名,而是某一类特定的工作。两款模型都支持 100 万 token 的上下文,最多都可输出 128K token,都能读取文本、图像和文件,并且都通过 effort 参数而非思考 token 预算来配置推理。由于各项表面能力相同,在两者之间做选择就纯粹是这样一个问题:完成一项任务要花多少钱,以及哪些任务会失败。

两个版本,一个界面

先从变化之微小谈起,因为这已超越多数世代更迭的变化。

• 上下文窗口 — 两者均为 1,000,000 个 token

• 最大值 — 两者均为 128,000 个 token

• 输入方式 — 两者均支持文本、图像和文件;两者均不支持音频和视频

• 推理 — 自适应思考,两者的努力程度均可配置,因此深度是一个请求参数,而非单独的模型字符串

• 能力 — 视觉、工具、JSON 与推理,二者均支持,依据 OrcaRouter 目录中anthropic/claude-opus-5以及 Sonnet 系列的相关条目

实际结果是,为 Claude Opus 5 编写的提示词无需重写,就能在 Claude Sonnet 5.5 上运行;围绕 128K 输出上限调校的智能体循环,也不需要一个新的层级。迁移不过是替换模型字符串,再重新检查你之前固定的是哪个 effort 设置——仅此而已。对于经历过过去两年多模态、多参数转型的团队来说,这才是头条,而不是基准测试成绩。

唯一会变的是价格,而且它在每一行都会变,而不只是营销幻灯片上的那两行。

• 输入 — 每百万 2.00 美元,相比 5.00 美元,降低了 60%

• 输出 — 每百万 $10.00,相较 $25.00,下降 60%

• 缓存读取——每百万 $0.20,相比 $0.50,降低 60%

• 缓存写入 — 每百万 $2.50,相比五分钟窗口的 $10.00,降低了 75%

如果你运行的智能体在每一轮都会重新读取一段很长的前缀,那么真正为迁移买单的就是缓存读取这一项。在 $0.20 对 $0.50 的情况下,长会话中的每个缓存 token 成本都会降到原先的 40%,而在大多数智能体循环中,缓存读取占 token 数量的大头。这种节省的累积方式,是单看每 token 的宣传数字所无法体现的。

五点从何而来

Artificial Analysis 在 Intelligence Index v4.3 上给 Claude Sonnet 5.5 打出 56 分、给 Claude Opus 5 打出 51 分,两项成绩均是在“Adaptive Reasoning, Max Effort”配置下测得的。在这个量表上,5 分的差距可不是四舍五入造成的误差——作为参照,同一评测方给 Sonnet 5 的评分为 38,给 Gemini 3.1 Pro Preview 的评分为 30,因此 Claude Opus 5 与 Claude Sonnet 5.5 之间的差距,是 Claude Opus 5 与上一代 Sonnet 之间差距的三分之一。

Anthropic 自己为 Claude Sonnet 5.5 发布的发布数据,用另一种标尺指向了同一个方向。该公司报告在 Terminal-Bench 4.0 上为 70.6%——而在更早的一份 Anthropic 表格中,Claude Opus 5 在同一测试上被记录为 89.1%;这个数字使用了不同的测试框架修订版,不应从较新的那个数字中减去。这是本文中最重要的一条来源警示:Terminal-Bench 在 2026 年中途转向 4.0,承载它的指数也相应修订为 v4.3 以匹配,而该基准的跨版本比较不能做算术。凡是数字附有版本,就要引用该版本。

能够清晰比较的,是厂商自家 Sonnet 一侧的进展——在 Terminal-Bench 4.0 上,Sonnet 5 的 10.3% 到 Sonnet 5.5 的 70.6%——以及第三方指数的读数,其中两个数字都来自同一天、同一套测试框架。基于这一证据,后继者在通用推理上确实超越了 7 月的旗舰,这比任何厂商幻灯片所宣称的都更有力。

输出长度的陷阱

这里就是算术不再对较新模型手下留情的地方。

Artificial Analysis 报告称,在其指数套件上评估 Claude Sonnet 5.5 的成本为每项任务 7.60 美元。在同一套件上,Claude Opus 5 的成本为每项任务 5.86 美元。这款更新的模型虽然在费率卡的每一项上都降价 60%,但用它完成一项任务的成本却大约高出 30%。原因就在同一份报告中:Sonnet 5.5 在整个套件中输出了 4.1 亿个 token,而所追踪模型的输出中位数为 8800 万个,评估方将此称为“非常啰嗦”。Claude Opus 5 在同一套件上输出了 1.4 亿个。

拆解开来算,机制很简单。在相同的工作上,Sonnet 5.5 产生的输出 token 数量约为 Claude Opus 5 的三倍,而输出价格只有它的 40%。三乘以 0.4 等于 1.2——在计入缓存影响之前,就已经有 20% 的额外支出,这大致正是 7.60 美元对 5.86 美元这一结果的量级。每 token 价格并没有错;只是它并非决定账单的那个数字。

这并不会让较新的模型成为更差的购买选择。它让决策取决于大多数对比都会忽略的一点:你的工作负载是否允许你约束输出。带长度指令的摘要任务、产出 JSON 的结构化抽取流水线、返回标签的分类器——在所有这些场景中,冗长都根本不会出现,而费率卡上 60% 的降幅则是真金白银。一个被要求“修复仓库”却毫无输出约束的开放式智能体,等于把三倍的绳子交到了 Sonnet 5.5 手里。

工作量设置和没人预留预算的迁移

两个模型都通过一个具有多个级别的 effort 参数来暴露推理深度,并且两者都附带默认值而非固定值——在 Claude Platform 上为 high,在 Claude 应用内为 medium。迁移时的一大诱惑,就是把该设置留在旧模型上的原处,然后便宣告任务完成。

这是一个有明确可量化依据的错误。Anthropic 自己为 Claude Sonnet 5.5 写的脚注就指出,在 FrontierCode 上,Max 努力档位的得分低于 Xhigh,这意味着努力档位并不是一个单调可调的旋钮,最高档位也不是免费的性能升级。设定努力档位应当基于对你任务的实测结果,而不是直接选可用的最贵选项。

在 Sonnet 方面还有一个硬性行为差异,在正式推出前值得了解。Anthropic 表示,Claude Sonnet 5.5 是首个随附与其顶级模型相匹配的网络防护措施和回退机制的 Sonnet,因此风险更高的安全请求会明显回退到较早的 Sonnet,而不是由你指定的模型来服务。如果你的工作负载属于该领域,日志中会显示一个你并未请求的模型。Claude Opus 5 早于 Sonnet 产品线上的这一安排出现,不过,在 Anthropic 的整个产品中,旗舰层级上针对生物学和网络安全工作的同类路由也存在。

在 OrcaRouter 上,这两个端点如今都已上线——anthropic/claude-opus-5 和 anthropic/claude-sonnet-5与其他所有内容一样位于同一目录中,按提供商的标价定价,0% 加价——而且一旦 Claude Sonnet 5.5 被列入目录,就能通过同一凭据访问。与此同时,相关的能力是自动故障转移:如果某个 Anthropic 层级受到速率限制或返回错误,请求可以在无需更改代码的情况下重新指向另一个层级,这是应对本次比较判断有误的最廉价对冲方式。

该决定,以规则形式陈述

如果你的工作是边界明确的——输出形态由你掌控,提示词是结构化的,每个任务的 token 数量可预测——那就转向 Claude Sonnet 5.5,拿下那 60% 的降幅。指数认同,价目表认同,反方已经没有任何关于能力的论据可讲。

如果你的工作是开放式且具有自主性的,那么在相信任何一份价目表之前,先运行实验。分别在两个模型上,用你自己的流量测量每完成一项任务所消耗的 token 数,持续一周;每百万 token 7.60 美元对 5.86 美元的第三方结果,是一个明确的警告:更便宜的费率卡可能带来更高的账单。在拿到这个数字之前,对于长周期自主工作,Claude Opus 5 仍是更稳妥的默认选择。

诚实的结论是:这是第一代 Sonnet,其旗舰机型的卖点取决于任务形态,而不是原始能力;任何仍只凭模型名称做决定的人,现在要么白白丢掉 60% 的收益,要么每完成一个任务多付 30%,而这完全取决于他们猜的是哪个方向。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run, 410M output tokens on the index suite. Right column Claude Opus 5: input $5.00, output $25.00, cache read $0.50, cache write $10.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 51, $5.86 per task on the index run, 140M output tokens on the index suite. A footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Sonnet 5.5 is 60% cheaper on input, output and cache reads and 75% cheaper on cache writes, and still costs about 30% more per finished task."Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5 (anthropic/claude-opus-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.19-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-07-24" line, and the $5.00 input and $25.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Claude Sonnet 5.5, named in full as "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)" and marked released September 2026, showing the In $2.00 and Out $10.00 rates, the Intelligence Index score of 56, the $7.60 average cost per task, and the 410M output tokens described as very verbose against a median of 88M.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新