Claude Opus 5.5 与 GPT-5.6 Sol 的主视觉标题卡,标题为"两个几乎不重叠的发布对照表",徽章上分别显示 $4.00 对 $5.00、66.4% 对 37.3%,以及截止日期 6月 对 2月,右下角为 OrcaRouter 标志。
Guides & Insights

Claude Opus 5.5 对比 GPT-5.6 Sol:两张几乎不重叠的发布时间表

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

本周将Claude Opus 5.5GPT-5.6 Sol并排放在一起,你首先注意到的并不是谁胜出,而是这两家厂商发布的基准测试表格几乎没有任何一行是重合的。Claude Opus 5.5 于 2026 年 9 月 22 日发布,其发布材料显示它在 Terminal-Bench 4.0 上领先 GPT-5.6 Sol 29 分。而自 2026 年 7 月 9 日起全面可用的 Sol,其发布材料主打的反而是 Terminal-Bench 2.1——Sol Ultra 在该项得分 91.9%——以及 Artificial Analysis Coding Agent Index,它在该榜单以 80 分登顶。两张表都是真实的,且都是由在各自表上胜出的那家厂商自己跑出来的。真正有用的问题不是抽象地看哪个模型更好,而是哪个基准测试、在谁的测试框架下运行,才能真正说明你的工作负载情况。这个问题比两篇发布博文希望你提出的都要更难,而本次对比正是围绕它展开的。

这两个模型,并排

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• 供应商 — AnthropicOpenAI

• 发布日期 — Claude Opus 5.5 于 2026年9月22日 对比 GPT-5.6 Sol 于 2026年7月9日

• 每百万 token 价格 — 输入 $4.00 / 输出 $20.00,对比输入 $5.00 / 输出 $30.00

• 缓存读取 — 在 Opus 5.5 上为每百万 $0.20;Sol 的缓存费率按平台设定,并未公布单一可比的数字

• 上下文窗口 — 两者均为 1M token

• 最大输出 — 两者均为 128K tokens,而 Anthropic 的 Batch API 在带上 beta 标头时可达到 300K

• 知识截止日期 — Opus 5.5 为 2026 年 6 月,而 Sol 为 2026 年 2 月 16 日

• 推理控制——自适应思考始终开启,默认等强度,档位从低到最高,对比一个最高推理强度设置,外加可协调并行子代理的 Ultra 模式

• 产品阵容 — Opus 5.5 是 5.5 系列中的首款,Sonnet 5.5 和 Haiku 5.5 承诺将在未来几周内推出;而 Sol 则是与 Terra 和 Luna 并列的三层级系列中的旗舰。

这些行中有两行的作用比其他行更大。知识截止时间的差距长达四个月,如果你的提示词涉及今年春天发生的任何事情,这一点就很关键。而 Opus 5.5 现在的输入和输出价格都低于 Sol——这与三个月前相比出现了反转,当时 Sol 是获得前沿级输出的更便宜途径,而 Claude Opus 5 的价格为 $5/$25。

唯一实际同时出现两个模型的行

公开发布的表格中,只有一张同时包含这两个模型,而且它来自 Anthropic。其中的每一项数据都是厂商自行报告的,由销售这两款模型中之一的公司制作:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 对比 GPT-5.6 Sol 37.3%

• Terminal-Bench-Science 0.1 — 58.7% 对 22.4%

• FrontierCode v1.1(主线)— 54.4% vs 47.5%

• CursorBench 4.0 — 57.8% 对比 41.7%

• AutomationBench — 40.0% 对比 28.8%

• GDPval-AA v2.1 — 1846 Elo 对比 1588

那是一次全胜,而 Terminal-Bench 两行上的差距大到值得审视,而不是照单全收。Anthropic 自己的脚注替你做了一部分这项工作:Opus 5.5 的 Terminal-Bench 运行使用了 xhigh effort,而非默认设置;而在默认的 medium effort 下,FrontierCode 的优势缩小到 54.6% 对 47.5%——是七个百分点的差距,而不是那些头条数字所显示的那样。Anthropic 还为整张表附加了一条普遍警告,称在这一能力水平上,基准差距“不太能可靠地反映现实世界中的差异”,并且其与 Claude Fable 5.1 的内部差距比分数所暗示的更小。一个厂商给自己的表格打折扣,是其中\最值得信任的一句话。

还要注意那张表里缺少什么:任何 OpenAI 模型获胜的基准测试。一份只包含有利行的厂商表格,并不能证明是全面碾压;它只能证明是经过了行挑选。

OpenAI 自己的数字怎么说

Sol 的发布材料则讲述了另一番故事:不同的基准测试,不同的评测框架。据其 7 月发布时报告:

• Terminal-Bench 2.1 — Sol Ultra 达到 91.9%,标准版 Sol 为 88.8%,而 Claude Mythos 5 为 88.0%,Claude Fable 5 为 84.3%

• Artificial Analysis Coding Agent Index — 80,当时被描述为最先进水平,比 Claude Fable 5 高出 2.8 分

• 智能体终极考试(Agents' Last Exam),长时间运行的专业工作流 —— 53.6,OpenAI 报告称这一成绩比 Claude Fable 5 领先 13.1 分

• BrowseComp — 92.2%;OSWorld 2.0 — 62.6%;SWE-Bench Pro — 64.6%

那些行里没有一行包含 Claude Opus 5.5,因为它在七月时还不存在。Sol 的表格是为了击败 Fable 5 和 Mythos 5 而搭建的,而它确实做到了。至于它能否击败 Opus 5.5,两家厂商的材料都没有给出答案——这两张表格相隔两个月编制,针对的是不同的对手。

SWE-Bench Pro 这一行值得特别说明,因为这是 OpenAI 的发布材料中唯一显示其模型落败的地方:Sol 为 64.6%,而 Claude Fable 5 为 80%。OpenAI 的回应是质疑该基准的有效性,估计其大约 30% 的任务是有问题的。这很可能属实。这也及时提醒我们:“这个基准有缺陷”是两家实验室都会提出的说法,而且总是针对他们落败的那个基准。

无人能靠表格解决的测试框架问题

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

两张表对不上,原因不是某家厂商在撒谎。而是因为智能体编码基准测试衡量的是模型加上脚手架,而脚手架各不相同。Terminal-Bench 4.0 和 Terminal-Bench 2.1 是同一理念的不同修订版,由不同的人运行,工具预算不同,重试规则也不同。Anthropic 的 Opus 5.5 分数是在 Anthropic 的测试框架中得出的;OpenAI 的 Sol 分数则是在 Codex 风格的工具中得出的。把任一模型放进另一方的测试框架,分数就会变。

独立数据(只要存在的话)所描述的竞争,比这两张表都要更胶着。2026年8月的一项第三方智能体基准测试,让多个模型在真实应用任务上运行,认定 GPT-5.6 Sol 是准确性、成本与速度的最佳组合——每次运行约 0.52 美元、耗时五分钟——而 Claude Opus 5(并非 5.5)则最为准确,在 92% 的运行中胜出。另一份涵盖企业代码任务的排行榜把 Claude Opus 5 排在首位,达 96.4%,GPT-5.6 Sol 以 86.5% 位列第三,同样是把 Sol 与上一代 Opus 而非新一代作比较。两者都不是与 Opus 5.5 的正面交锋,也都没能给出定论。但它们确实说明了一点:当对比由厂商以外的第三方来做时,差距就会变得很小。

实际启示是:不要再把这些表格当作排名来读,而要开始把它们当作一组假设来读。如果你的工作是长周期终端自动化,那么 Anthropic 在 Terminal-Bench 上的差距就是一个值得在你自己的任务上检验的假设。如果是多步骤专业研究,Sol 在 Agents' Last Exam 上的结果也是同一类假设。没有实际运行,这两个数字都不会迁移到你的工作负载上。

每个已完成任务的成本,这才是唯一重要的成本

在价目表上,Claude Opus 5.5 现在双向都更便宜:输入为 $4.00,对比 $5.00;输出为 $20.00,对比 $30.00;缓存读取费率为 $0.20,比 Claude Opus 5 收取的费用低 60%。对于每一轮都会重新发送长系统提示词的智能体来说,那条缓存费率项是主要成本,也是长时间运行的会话无需对提示词做任何更改就能显著变得更便宜的原因。

但每 token 的价格从来不是决定智能体账单的因素。OpenAI 在发布 Sol 时为它提出的理由,靠的是 token 效率而非标价——它报告编码 token 效率提升了 54%,输出 token 数和耗时不到 Claude Fable 5 的一半,成本还低了约三分之一。Anthropic 为 Opus 5.5 提出的是镜像式的论证:在典型工作负载下,运行成本比 Claude Opus 5 低约 40%,而价目表只降了 20%,Box、Kiro、Factory 和 GitHub 的客户证言也都提到 token 或步骤数大幅减少。两种说法指向同一个方向——用更少轮次完成任务的模型胜出——而两者都没有经过独立审计。

在确实存在独立每任务成本计算的地方,它目前更青睐 Sol:9 月发表的一项分析显示,GPT-5.6 Sol 在 SWE-bench Verified 上以 96.2% 的成功率,每个已解决问题花费 1.56 美元,而 Claude Opus 4.8 为 88.6%。这是拿 Sol 与一个较旧的 Anthropic 模型相比,而不是与 Opus 5.5 相比,因此它只是一个起点,而非定论——但它提醒我们,一个第一次尝试就能解决问题的模型,比一个更便宜却需要三次尝试的模型成本更低。唯一能替你一锤定音的衡量,是你自己的任务,用两种方式各跑一遍,并把 token 计数摆在眼前。

与其说是采购问题,不如说是路由问题,而且值得精确说明的是,其中哪一侧已经可以解决。GPT-5.6 Sol 今天已在 OrcaRouter 上以 OpenAI 自己的标价、0% 加价提供——供应商标价直接透传,因此供应商费率变动当天就会在我们这边生效,而不是等到同步之后。Claude Opus 5.5 还不是我们的路由之一;它可通过 Anthropic 自己的 API 和各大云平台使用。一旦它上线,同一个密钥即可同时服务两者,这才能把这项实验变成一条路由规则,而不是第二份合同和第二个 SDK:把工作负载发送到你自己的数据更青睐的那个模型,让自动故障转移指向另一个,并让路由 DSL 行按请求而不是按季度来决定。任何一侧降价都是配置变更,而不是迁移。

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

在两者真正不同之处

剔除基准测试后,仍有四项差异留存,且全都可以核验:

• 知识截止时间。Opus 5.5 是 2026 年 6 月,而 Sol 是 2026 年 2 月 16 日。对于任何涉及近期库、近期事件或近期变更的 API 的内容来说,四个月的差距是实实在在的,而没有任何基准测试能捕捉到这一点。

• 保障路由。Opus 5.5 搭载了 Fable 5.1 级别的安全保障措施:大多数网络安全相关请求会被重新路由至 Claude Opus 4.8,而生物学相关工作则会回退到 Claude Opus 5,除非账户已通过验证。如果你的产品属于这两个领域中的任何一个,那么你的一部分流量实际上是由一个更小的模型来应答的。Sol 没有同类有据可查的路由机制,不过 OpenAI 确实说明了其自身与网络相关的安全评估。

• 编排能力。Sol 提供了 Ultra 模式,可协调多个并行子代理(默认四个),并配有最大推理投入程度的设置。Opus 5.5 两项都不作为平台功能提供;它的杠杆是 effort 参数,而多模型组合是需要你自己搭建或路由的东西,而不是厂商直接交到你手上的。

• 系列定价。Sol 是三个层级之一,Terra 和 Luna 位于其下——在 7 月 30 日的更新中,Luna 的价格下调了 80%,Terra 的则下调了 20%。Anthropic 更便宜的同门产品 Sonnet 5.5 和 Haiku 5.5 已宣布,但尚未推出。如果你的工作负载是混合型的,OpenAI 目前就提供更便宜的档位。

在两者之间选择

如果你的工作是长时间运行的智能体编码或知识工作,如果每个 token 的价格至关重要,如果你的提示词涉及最近四个月内的任何内容,或者如果 100 万 token 上下文、每百万缓存 token 0.20 美元的价格正是让你的架构变得可负担的关键,那就选择 Claude Opus 5.5。先从 medium努力级别开始,而不是沿用继承而来的 high 设置,并衡量low是否撑得住。

在以下情况下选择 GPT-5.6 Sol:如果你想要供应商捆绑的编排模式;如果你需要今天——而不是几周后——就能获得低于旗舰的更便宜档位;或者如果你的工作负载恰好是 Sol 自身发布证据最能覆盖的那一类——长周期专业工作流和计算机使用,据其报告,这类场景取得了最强结果。

如果你目前使用的是 Claude Opus 5,请注意 Opus 5.5 并非可直接替换:思考功能不再能够被禁用,强制工具使用会返回错误,思考块与模型和对话相绑定,而且较旧的 computer_20251124 计算机使用工具在 Claude API 或 Google Cloud 上不被接受。前三项同样适用于 Claude Fable 5.1。而切换到 Sol 则完全是另一套集成方式。

真正能为这场比较定论的,是在匹配的努力程度、匹配的评测框架下,让两个模型在同一个任务集上各进行一次独立运行。截至本周,还没有人发布过这样一次运行。在有人做到之前,诚实的立场就是证据所支持的那一个:Anthropic 的表格偏向 Opus 5.5,而它由 Anthropic 制作;OpenAI 的表格偏向 Sol,而它由 OpenAI 制作;现有的独立结果把 Sol 与此前的 Opus 相比较,描述的是一场接近得多的竞争;而将决定你账单的那两行——每完成一个任务所消耗的 token 数和缓存读取量——正是两家厂商都不公布的那两行。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新