一张为 Claude Opus 5.5 对阵 Claude Sonnet 5 生成的标题卡,副标题为“一半的价格,二十个指数点,五个月的盲区”,配有三个扁平线性图标(一个堆叠数据库标记、一个上升柱状图,以及一个带时钟的日历),页脚一行文字写着“指数依据 Artificial Analysis 在最大投入下的数据;价格依据 Anthropic。”真实的 OrcaRouter 徽标合成于右下角。
Guides & Insights

Claude Opus 5.5 对比 Claude Sonnet 5:一半的价格、二十个指数点,以及五个月的盲区

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你只想要那条规则:默认运行 Claude Sonnet 5,在任务失败时升级到 Claude Opus 5.5,因为更便宜的模型价格确实只有一半,而且确实属于不同的能力级别。这背后的两个数字是 38 和 58——Sonnet 5 和 Opus 5.5 在 Artificial Analysis Intelligence Index 上的得分,由同一评估方、在同一配置系列下得出。在该指数上二十分的差距不是用来打破平局的,而且它是你目前能构建的任何 Claude 对 Claude 的对比中最大的差距:Claude Opus 5.5在 210 个模型中排名第 1,而Claude Sonnet 5排名第 54,两者之间的价格差为每百万输入 token 2 美元。

那只是简单的一半。困难的那一半在于,有选择地升级需要知道哪些任务会失败,而这两个模型对2026年1月之后的世界存在分歧,这种分歧是任何评估都不会暴露为错误的。

二十个百分点的差距,结合背景来看

A two-column scoreboard comparing Claude Opus 5.5 and Claude Sonnet 5 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 38, ranked #54), price in and out ($4.00 / $20.00 per million against $2.00 / $10.00), default effort (medium against high), knowledge cutoff (Jun 2026 against Jan 2026), output speed (not yet published against 79.3 tokens per second) and cache read ($0.20 per million on both). The footer reads 'Index and speed figures per Artificial Analysis at max effort; prices, effort defaults and cutoffs per Anthropic.'

Artificial Analysis 以单一公开配置运行每个模型,而这两个模型共享同一个系列标签——"自适应推理,最大努力"——这使得比较异常清晰:

• 智能指数 — Claude Opus 5.5 得 58 分,在 210 个中排名第 1;而 Claude Sonnet 5 得 38 分,排名第 54

• 价格 — Claude Opus 5.5 每百万 $4.00 输入 / $20.00 输出,对比 Claude Sonnet 5 $2.00 / $10.00

• 输出速度 — Claude Sonnet 5 为 79.3 tokens/秒,而 Claude Opus 5.5 尚未在榜单上公布

• 首 token 时间 — Claude Sonnet 5 为 150.02 秒,而排行榜中位数为 3.83 秒

• 默认投入力度 — Claude Opus 5.5 对比 Claude Sonnet 5

• 知识截止日期——Claude Opus 5.5 为 2026 年 6 月,而 Claude Sonnet 5 为 2026 年 1 月

• 上下文与输出 — 两者的上下文均为 1M,最大输出均为 128K

排名那一栏才是值得细细琢磨的部分。二十个指数点不是排行榜上的四个位次;而是四十九个。在一个包含 210 个模型的榜单上,Opus 5.5 和 Sonnet 5 并不是仅靠价格差异区分开的相邻者——它们处在不同的区间,而每百万 2 美元的差距买到的是实打实的能力阶跃,而不是一个徽章。任何把本周的报道读成“Anthropic 推出了一款更便宜的 Opus”并以为 Sonnet 层级已将其吸收的人,都应该看看那一对排名:Anthropic 自己的定价页面仍将 Claude Sonnet 5 列为当前产品,而它在独立榜单上的位置并没有变化。

有两点说明让这个结论保持诚实。两项得分都是在最高努力档位下跑出来的,而两款模型的出厂默认设置都不是最高——Sonnet 5 默认是 ,Opus 5.5 默认是 。而速度那几行让情况朝着有利于 Sonnet 5 的方向变得更加复杂:每秒 79.3 个 token、首个 token 耗时 150 秒,这是一个真实测量出来的延迟表现,而且它是两者中唯一出现在榜单上的。Artificial Analysis 尚未公布 Opus 5.5 的速度与延迟,这意味着这场对比中的“更快”一说目前依赖的是厂商材料,而非实测数据。

改变 Sonnet 5 价格的脚注

过去一个月里,围绕 Claude Sonnet 5 最具体的一件事,是一句大多数报道都略过的话。2026 年 6 月 30 日该模型发布时,其 $2 / $10 的费率被宣布为截至 8 月 31 日的优惠定价,并计划于 9 月 1 日上调至 $3 / $15。而在 Anthropic 目前的定价页面上,脚注写道,$2/$10 的定价“现已成为标准价格”,涨价“将不会发生”。

这一点之所以重要,原因有两个。显而易见的一点是,一项已宣布随后又被取消的 50% 涨价,如今成了一条你可以据此规划的成本项——Sonnet 5 不是一个你必须为其建模到期时间的促销费率。不那么明显的一点是,它固定了升级的算术。在 Sonnet 5 永久定价为 $2/$10、Opus 5.5 为 $4/$20 的情况下,这两个层级之间的比率在两个方向上正好都是 2 倍,而且稳定不变。一条把比如说五分之一流量送往 Opus 5.5 的升级规则,其成本你只需计算一次,之后就不必再反复重算。

批量和缓存费率同步变动,这正是整表对比有用的原因:Sonnet 5 的批量价格为 $1.00 / $5.00,而 Opus 5.5 为 $2.00 / $10.00,且两者的缓存读取都按每百万 $0.20 计费。最后这个数字是真正的平手——Opus 5.5 将其缓存读取价格从 $0.50 降至 $0.20,而 Sonnet 5 原本就已如此。如果你的工作负载主要是重新读取大型缓存上下文,而不是生成全新输出,那么更便宜模型的价格优势就远不如表面比例所暗示的那么大,因为两者唯一一致的那一项,恰恰是你花费最多的那一项。

切断装置就是那种会静默失效的部件。

A generated two-card graphic titled 'Knowledge cutoffs, five months apart', showing Claude Sonnet 5 with a knowledge cutoff of January 2026 against Claude Opus 5.5 with a cutoff of June 2026, separated by a marker reading '5 months of coverage'. The footer reads 'Cutoff dates per Anthropic's Claude model documentation, current as of September 2026.'

Claude Opus 5.5 的知识截止日期是 2026 年 6 月。Claude Sonnet 5 的则是 2026 年 1 月。两者相差五个月,而这正是本次比较中唯一不会自行显露的维度。一个不知道某个事件的模型,并不会以你的错误处理能够捕捉到的方式,在该事件上变慢或变得不那么准确——它会自信地从那个已经向前演进的世界出发作答,而这种失败看起来像是一个貌似合理的错误答案,而不是一次拒答。

对某些工作负载来说,这无关紧要:重构一个约定稳定的代码库、总结你提供的文档、转换结构化数据。对另一些工作负载来说,单凭这一点就足以一票否决,无论那二十个指数点或价格如何。任何涉及 2026 年下半年发布的软件的任务、任何回答近期事件相关问题的任务、任何依赖在一月之后发生变化的 API 或库版本的任务——这些任务不能升级到 Opus 5.5,它们必须从一开始就在那里进行。这五个月并不是质量差异;它们是一种范围限制,应该归入路由规则,而不是评估中。

两个模型共享其余的参数范围,这限制了知识截止点能在多大程度上被绕过。两者都接受 100 万 token 的上下文,最多返回 128K,两者都运行无法关闭的自适应思考,并且都只能通过 effort 参数来调节深度。不存在一种配置能让 Sonnet 5 获得更长的文档作为补偿。

运行拆分

这个组合的实用版本是"默认"与"例外"的关系,而例外必须由"困难任务"以外的东西来界定。真正站得住脚的模式是按任务类别划分,而不是按难度划分:大批量工作用 Sonnet 5,因为在这类场景下它的知识截止时间无关紧要,延迟表现也可以接受;凡是涉及时效性、长周期,或者一次失败尝试的代价超过 token 差价的任务,就用 Opus 5.5。

那是一种路由配置,而不是一次重写,而这正是一个单一端点得以立足之处。Claude Sonnet 5 已在 OrcaRouter 上,价格就是 Anthropic 自家的 $2.00 / $10.00,而Claude Opus 5.5 在那里是 $4.00 / $20.00——按供应商标价原样透传,0% 加价,因此你的升级规则中的成本比就是 Anthropic 公布的成本比,没有任何加价层会去挪动它。两者共用一把密钥,这意味着升级路径只需改一条规则,而不必再做一次集成;自动故障转移能让出故障的主端点不至于把请求一起拖垮;而决定你阈值的那个对比,你可以在自己的流量里直接跑出来,而不必从两张厂商价目表里拼凑还原。

A screenshot of OrcaRouter's own model page for anthropic/claude-sonnet-5, headed 'Claude Sonnet 5' and credited to Anthropic, showing $2.00 input and $10.00 output per 1M tokens, a 1M-token context and a PERFORMANCE panel with 79.3 output tokens per second, a 150.02s time to first token and 55M output tokens over 7 days.

谁该动,谁该等

如果你已经在使用 Claude Sonnet 5,而且它运行良好,那么替换它的理由就很弱:该模型价格只有一半,其费率现在是永久性的,而指数差距只会在它失败的任务上才有影响。在其之上增加 Claude Opus 5.5 的理由则很充分,前提是你能明确说出触发条件——而触发条件通常是知识截止失败,或者是 Sonnet 5 以最大努力运行时仍然会出错的任务。

如果你正在选择自己的第一个 Claude 模型,答案并不像价格比看起来那样均衡。用两倍的 token 换取 20 点的指数差距和额外五个月的知识,是一笔大多数生产工作负载只会在少数调用中接受的取舍,而几乎没有工作负载会在所有调用中都接受它。无论偏向哪一边,要避免的错误都是把两者视为可互换,并仅根据成本来切换,因为随之而来的失败并不是更差的回答——而是一个自信满满、却基于一个已于一月终结的世界的回答。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新