
Claude Sonnet 5.5 对比 Claude Opus 5:每项都更便宜,且在指数上领先
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
Claude Opus 5 于 2026 年 7 月 24 日发布,定价为每百万输入 token 5.00 美元、每百万输出 token 25.00 美元。Claude Sonnet 5.5 于 2026 年 9 月 28 日正式可用,定价分别为 2.00 美元和 10.00 美元。对于一款新两代的模型来说,这意味着输入价格降低 60%、输出价格降低 60%——而且在 Artificial Analysis 对两者运行的测试框架上,这款模型在 Intelligence Index v4.3 上得分为 56,而 Claude Opus 5 为 51。这是一次罕见的对比:更新、更便宜的模型在第三方指数上同时也是得分更高的那一个,而现有模型仅剩的理由不再是基准排名,而是某一类特定的工作。两款模型都支持 100 万 token 的上下文,最多都可输出 128K token,都能读取文本、图像和文件,并且都通过 effort 参数而非思考 token 预算来配置推理。由于各项表面能力相同,在两者之间做选择就纯粹是这样一个问题:完成一项任务要花多少钱,以及哪些任务会失败。
两个版本,一个界面
先从变化之微小谈起,因为这已超越多数世代更迭的变化。
• 上下文窗口 — 两者均为 1,000,000 个 token
• 最大值 — 两者均为 128,000 个 token
• 输入方式 — 两者均支持文本、图像和文件;两者均不支持音频和视频
• 推理 — 自适应思考,两者的努力程度均可配置,因此深度是一个请求参数,而非单独的模型字符串
• 能力 — 视觉、工具、JSON 与推理,二者均支持,依据 OrcaRouter 目录中anthropic/claude-opus-5以及 Sonnet 系列的相关条目
实际结果是,为 Claude Opus 5 编写的提示词无需重写,就能在 Claude Sonnet 5.5 上运行;围绕 128K 输出上限调校的智能体循环,也不需要一个新的层级。迁移不过是替换模型字符串,再重新检查你之前固定的是哪个 effort 设置——仅此而已。对于经历过过去两年多模态、多参数转型的团队来说,这才是头条,而不是基准测试成绩。
唯一会变的是价格,而且它在每一行都会变,而不只是营销幻灯片上的那两行。
• 输入 — 每百万 2.00 美元,相比 5.00 美元,降低了 60%
• 输出 — 每百万 $10.00,相较 $25.00,下降 60%
• 缓存读取——每百万 $0.20,相比 $0.50,降低 60%
• 缓存写入 — 每百万 $2.50,相比五分钟窗口的 $10.00,降低了 75%
如果你运行的智能体在每一轮都会重新读取一段很长的前缀,那么真正为迁移买单的就是缓存读取这一项。在 $0.20 对 $0.50 的情况下,长会话中的每个缓存 token 成本都会降到原先的 40%,而在大多数智能体循环中,缓存读取占 token 数量的大头。这种节省的累积方式,是单看每 token 的宣传数字所无法体现的。
五点从何而来
Artificial Analysis 在 Intelligence Index v4.3 上给 Claude Sonnet 5.5 打出 56 分、给 Claude Opus 5 打出 51 分,两项成绩均是在“Adaptive Reasoning, Max Effort”配置下测得的。在这个量表上,5 分的差距可不是四舍五入造成的误差——作为参照,同一评测方给 Sonnet 5 的评分为 38,给 Gemini 3.1 Pro Preview 的评分为 30,因此 Claude Opus 5 与 Claude Sonnet 5.5 之间的差距,是 Claude Opus 5 与上一代 Sonnet 之间差距的三分之一。
Anthropic 自己为 Claude Sonnet 5.5 发布的发布数据,用另一种标尺指向了同一个方向。该公司报告在 Terminal-Bench 4.0 上为 70.6%——而在更早的一份 Anthropic 表格中,Claude Opus 5 在同一测试上被记录为 89.1%;这个数字使用了不同的测试框架修订版,不应从较新的那个数字中减去。这是本文中最重要的一条来源警示:Terminal-Bench 在 2026 年中途转向 4.0,承载它的指数也相应修订为 v4.3 以匹配,而该基准的跨版本比较不能做算术。凡是数字附有版本,就要引用该版本。
能够清晰比较的,是厂商自家 Sonnet 一侧的进展——在 Terminal-Bench 4.0 上,Sonnet 5 的 10.3% 到 Sonnet 5.5 的 70.6%——以及第三方指数的读数,其中两个数字都来自同一天、同一套测试框架。基于这一证据,后继者在通用推理上确实超越了 7 月的旗舰,这比任何厂商幻灯片所宣称的都更有力。
输出长度的陷阱
这里就是算术不再对较新模型手下留情的地方。
Artificial Analysis 报告称,在其指数套件上评估 Claude Sonnet 5.5 的成本为每项任务 7.60 美元。在同一套件上,Claude Opus 5 的成本为每项任务 5.86 美元。这款更新的模型虽然在费率卡的每一项上都降价 60%,但用它完成一项任务的成本却大约高出 30%。原因就在同一份报告中:Sonnet 5.5 在整个套件中输出了 4.1 亿个 token,而所追踪模型的输出中位数为 8800 万个,评估方将此称为“非常啰嗦”。Claude Opus 5 在同一套件上输出了 1.4 亿个。
拆解开来算,机制很简单。在相同的工作上,Sonnet 5.5 产生的输出 token 数量约为 Claude Opus 5 的三倍,而输出价格只有它的 40%。三乘以 0.4 等于 1.2——在计入缓存影响之前,就已经有 20% 的额外支出,这大致正是 7.60 美元对 5.86 美元这一结果的量级。每 token 价格并没有错;只是它并非决定账单的那个数字。
这并不会让较新的模型成为更差的购买选择。它让决策取决于大多数对比都会忽略的一点:你的工作负载是否允许你约束输出。带长度指令的摘要任务、产出 JSON 的结构化抽取流水线、返回标签的分类器——在所有这些场景中,冗长都根本不会出现,而费率卡上 60% 的降幅则是真金白银。一个被要求“修复仓库”却毫无输出约束的开放式智能体,等于把三倍的绳子交到了 Sonnet 5.5 手里。
工作量设置和没人预留预算的迁移
两个模型都通过一个具有多个级别的 effort 参数来暴露推理深度,并且两者都附带默认值而非固定值——在 Claude Platform 上为 high,在 Claude 应用内为 medium。迁移时的一大诱惑,就是把该设置留在旧模型上的原处,然后便宣告任务完成。
这是一个有明确可量化依据的错误。Anthropic 自己为 Claude Sonnet 5.5 写的脚注就指出,在 FrontierCode 上,Max 努力档位的得分低于 Xhigh,这意味着努力档位并不是一个单调可调的旋钮,最高档位也不是免费的性能升级。设定努力档位应当基于对你任务的实测结果,而不是直接选可用的最贵选项。
在 Sonnet 方面还有一个硬性行为差异,在正式推出前值得了解。Anthropic 表示,Claude Sonnet 5.5 是首个随附与其顶级模型相匹配的网络防护措施和回退机制的 Sonnet,因此风险更高的安全请求会明显回退到较早的 Sonnet,而不是由你指定的模型来服务。如果你的工作负载属于该领域,日志中会显示一个你并未请求的模型。Claude Opus 5 早于 Sonnet 产品线上的这一安排出现,不过,在 Anthropic 的整个产品中,旗舰层级上针对生物学和网络安全工作的同类路由也存在。
在 OrcaRouter 上,这两个端点如今都已上线——anthropic/claude-opus-5 和 anthropic/claude-sonnet-5与其他所有内容一样位于同一目录中,按提供商的标价定价,0% 加价——而且一旦 Claude Sonnet 5.5 被列入目录,就能通过同一凭据访问。与此同时,相关的能力是自动故障转移:如果某个 Anthropic 层级受到速率限制或返回错误,请求可以在无需更改代码的情况下重新指向另一个层级,这是应对本次比较判断有误的最廉价对冲方式。
该决定,以规则形式陈述
如果你的工作是边界明确的——输出形态由你掌控,提示词是结构化的,每个任务的 token 数量可预测——那就转向 Claude Sonnet 5.5,拿下那 60% 的降幅。指数认同,价目表认同,反方已经没有任何关于能力的论据可讲。
如果你的工作是开放式且具有自主性的,那么在相信任何一份价目表之前,先运行实验。分别在两个模型上,用你自己的流量测量每完成一项任务所消耗的 token 数,持续一周;每百万 token 7.60 美元对 5.86 美元的第三方结果,是一个明确的警告:更便宜的费率卡可能带来更高的账单。在拿到这个数字之前,对于长周期自主工作,Claude Opus 5 仍是更稳妥的默认选择。
诚实的结论是:这是第一代 Sonnet,其旗舰机型的卖点取决于任务形态,而不是原始能力;任何仍只凭模型名称做决定的人,现在要么白白丢掉 60% 的收益,要么每完成一个任务多付 30%,而这完全取决于他们猜的是哪个方向。



本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
