主视觉标题卡显示“GPT-6 Sol Pro 对比 Claude Opus 5”,副标题为“没人会放进表格里的努力阶梯”,并带有双栏“GPT-6 Sol Pro”/“Claude Opus 5”标签对,以及页脚一行文字“供应商列表未经审计;数据来自 Artificial Analysis。”,右下角为真实的 OrcaRouter 徽标。
Guides & Insights

GPT-6 Sol Pro 对比 Claude Opus 5:没人写进对比表的努力阶梯

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Sol Pro 和 Claude Opus 5 经常被拿来相互比较,而且几乎总是用错误的设置来比。流传最广的比较方式是,把 Claude Opus 5 调到最高推理强度,去对 GPT-6 Sol Pro 的最高推理强度,这会在中性指数上产生三个百分点的差距,以及五倍的成本差异。把两个模型都设成各自厂商作为默认值发布的配置——并记住,前一个名字里的“Pro”是一种推理配置,而不是一个独立模型——三个百分点的差距就会彻底消失。剩下的只有成本差异,而这也是整个说法中唯一能在生产账单面前站得住脚的部分。

这不是什么呈现上的障眼法。它是两条彼此未经校准的努力阶梯所直接导致的结果,而这两条阶梯由两家厂商各自发布,这两家厂商又都拿对方更早的模型作为基准来对标。

在任何比较之前,这两个模型实际上是什么

GPT-6 SolOpenAI 的中端推理模型,自 2026 年 9 月 22 日起全面可用,价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元。OpenAI 的开发者文档中并不存在 gpt-6-sol-pro 这一模型标识符——该页面只列出一条 Sol 条目:1,050,000 token 的上下文窗口、922,000 token 的最大输入、128,000 token 的输出上限、2026 年 4 月 20 日的知识截止日期,以及依次为 none、low、medium、high、xhigh 和 max 的推理力度档位,默认值为 medium。“Pro”是推理模式的一个取值,与 GPT-5.6 一代确立、并由这一代继承的别名模式相同。确实存在名为 GPT-5.6 Sol Pro 的第三方目录条目,其目前标价为 2.00 美元和 10.00 美元——也就是 GPT-6 Sol 的价格——但这只是命名造成的假象,并非真实产品。

Claude Opus 5 是 Anthropic 推出的一个真实存在、单独计费的模型,自 2026 年 7 月 24 日起正式开放使用,输入价格为每百万 token 5.00 美元,输出价格为每百万 token 25.00 美元。其上下文窗口为 1,000,000 token,同步输出上限为 128,000,而它自身的努力程度阶梯——output_config.effort——包含 low、medium、high、xhigh 和 max,默认值为 high。思考功能为自适应模式且默认开启,这在 Opus 系列中尚属首次。

还有一个事实决定了以下所有内容,而现有的任何对比页面都未曾提及:Anthropic 自家的生命周期表将 Claude Opus 5 列为活跃(旧版),并附有一条迁移提示横幅,指向 Claude Opus 5.5——后者已于 2026 年 9 月 22 日全面可用,定价为 $4.00 和 $20.00。OpenAI 的发布图表仍以 Opus 5 而非 5.5 作为基准进行对比。参与对比的是上一代的 Opus 模型。

那两条价格线,逐行来看

两者都是供应商列表——OpenAI 和 Anthropic 自己公布的数据,由托管它们的平台原样传递而来。

• 输入 — GPT-6 Sol 每百万个 token 2.00 美元,对比 Claude Opus 5 每百万个 token 5.00 美元

• 输出 — GPT-6 Sol 每百万 tokens $10.00 对比 Claude Opus 5 每百万 tokens $25.00

• 缓存读取 — GPT-6 Sol 每百万 token 收费 $0.20,而 Claude Opus 5 每百万 token 收费 $0.50;两者的费率均为未缓存输入费率的固定 10%

• 缓存写入 — GPT-6 Sol 在单一 TTL 下为每百万 token 2.50 美元,而 Claude Opus 5 在五分钟 TTL 下为 6.25 美元、在一小时 TTL 下为 10.00 美元;较长的 TTL 是 OpenAI 并未提供的选项,而它恰恰是大多数对比表格不经意间引用的那一档,因为它正是出现在托管目录卡片上的那个价格

• 长上下文处理——GPT-6 Sol 会将超过其输入阈值的请求重新定价,并对整个请求按更高费率计费;Claude Opus 5 则完全不加收长上下文附加费,因此一个 900,000 token 的请求与一个 9,000 token 的请求按相同的每 token 费率计费

• 批处理 — GPT-6 Sol 提供一个按标准折扣计费的批处理端点,而 Claude Opus 5 的 Message Batches API 则对输入与输出两个方向均提供 50% 折扣,并且 Anthropic 的批处理折扣可与提示缓存叠加使用

• 上下文窗口 — GPT-6 Sol 1,050,000 个 token,对比 Claude Opus 5 的 1,000,000 个 token

• 最大输出 — 两者均为 128,000 个 token,而 Claude Opus 5 在 output-300k-2026-03-24 beta 请求头下,可将 Message Batches API 上的该上限提升至 300,000

批处理加缓存的组合是这份清单上最少被谈及的一项,也是最能改变算账结果的一项。50% 的批处理折扣,若能叠加按输入费率十分之一计价的缓存读取,与单独的 50% 批处理折扣相比就是截然不同的优惠;而对于长时间的综合生成任务——Anthropic 30 万 token 的批处理输出上限同样适用于此类任务——它能弥合按标价计算时看似无法逾越的差距中相当可观的一部分。

A two-column scoreboard card titled 'GPT-6 Sol vs Claude Opus 5 - the scoreboard'. Left column 'GPT-6 Sol': AA Index, max effort 48; AA Index, default effort 48; cost per task, max $1.06; cost per task, default $0.37; price in/out $2 / $10; context window 1.05M. Right column 'Claude Opus 5': AA Index, max effort 51; AA Index, default effort 48; cost per task, max $5.86; cost per task, default $3.61; price in/out $5 / $25; context window 1M. A footer line reads 'Vendor list prices; index figures per Artificial Analysis.', with the real OrcaRouter logo bottom-right.

努力阶梯才是真正的比较

这个数字应该出现在所有这些文章里。在 Artificial Analysis 上——其测试框架是唯一一个中立、且为两个模型都发布了完整努力程度阶梯的——Claude Opus 5 在最大努力下得分 51,每个索引任务花费 5.86 美元。在其默认的高努力设置下,它得分 48,花费 3.61 美元。GPT-6 Sol 在最大努力下得分 48,花费 1.06 美元——而在高努力下得分 43,花费 0.37 美元。

把这两行放在一起看。Claude Opus 5 在 Anthropic 作为默认配置发布的那个努力(effort)设置下运行,其指数得分与全速运行的 GPT-6 Sol 完全一致。发布报道所称的那三点差距,只有在你把两个模型都拨到各自刻度的最高档时才会出现,而最高档并不是这两个模型默认运行的档位。Opus 5 在最大努力档位下的优势是真实的,而要获得它,每完成一个任务的成本大约要高出五倍半。

那些数字本应附有两项诚实告诫,而引用它们的页面却都缺了这两项。

• 指数版本并非一成不变。自 7 月以来,在 Artificial Analysis 指数的历次修订中,Opus 5 的得分先后被公布为 61、63、54 和 51。这些分数本身都没错;但若脱离了版本标注,每一个都是错的。上文中的 51 是当前的榜单分数,它与从发布日文章中引用的 61 并不具有可比性。

• 不同厂商之间的努力阶梯并未经过校准。一个模型上的“高”与另一个模型上的“高”并不代表相同程度的思考量。在名义上不同的设置下得到匹配的分数,是关于成本的证据,而不是关于能力对等的证据。

独立记录比看上去更单薄的地方

Claude Opus 5 背后已有八周的第三方测评数据,以及一组明确标注为厂商自报的发布数据——Frontier-Bench v0.1 为 43.3%,ARC-AGI-3 为 30.2%,GDPval-AA v2 为 1,861 Elo。这些数据无一不是对照 GPT-5.6 Sol 或 Claude Fable 5 测得的,而非对照 GPT-6 Sol。目前没有任何共享测试框架的结果,能让 Opus 5 与 GPT-6 Sol 在 Anthropic 自己的基准测试上正面交锋;而 Anthropic 的系统卡也承认,该模型在整体能力上并不比 Claude Fable 5 更强。

这份独立记录在另一个方向上也附带了一则警示。在 Artificial Analysis 的 AA-Omniscience 评测中,Opus 5 的幻觉率为 50%,比 Opus 4.8 上升了十四个百分点——有记录的原因在于拒答率从约 23% 降至 7%,于是模型回答的问题更多,答错的也更多。Vals AI 另行披露,在 Terminal-Bench 运行期间,Opus 5 和 Fable 5 曾使用 Opus 4.8 作为拒答回退;将受影响的九次通过重新归类为失败后,Opus 5 的成绩从 84.64% 变为 81.27%。这些发现并不足以否定其资格,但一篇主张 Opus 5 是更可靠选择的文章,需要把它们一并附上。

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing an Artificial Analysis Intelligence Index of 48 at maximum reasoning effort and 43 at high effort, a cost per index task of $1.06 and $0.37, a 1.05M-token context window, a 128k-token maximum output, and blended list pricing of $2.00 per million input tokens and $10.00 per million output tokens, above the 'Intelligence Index vs Cost to Run Intelligence' scatter chart with the reasoning-models-only filter applied.

GPT-6 Sol 的独立记录,本周只有一项数字那么宽:上方那项指数得分,是在最大努力档位下测得的,而它身后,是十八个月模型发布在第三方测试中积累起来的成果。这种不对称——八周的审视对一天——才是买家仍可能支付五倍溢价的诚实理由,而且它比那个三分差的头条数字更站得住脚。

路由层改变决策之处

Claude Opus 5 已上线于 OrcaRouter的目录,输入 $5.00、输出 $25.00、缓存读取 $0.50、缓存写入 $10.00 每百万 token,窗口为 1,000,000 token,输出上限为 128,000 token,并同时支持 /v1/chat/completions 和 /v1/messages 端点——按提供商列表价原样透传,不额外加价,因此 Anthropic 那边的价格一旦生效,我们这边当天就会同步生效。模型卡上的缓存写入数字采用的是一小时 TTL 的费率;Anthropic 的分钟档位是 $6.25,只引用其中一个数字却不说明是哪一个,两个数字就会看起来像是自相矛盾。

GPT-6 Sol 不是我们提供的渠道之一,因此这里没有任何关于通过我们获取其价格的声明。

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), captured 23 September 2026, showing an input price of $5.00 per million tokens, an output price of $25.00 per million tokens, a 1,000,000-token context window, a 128,000-token output cap, reasoning and tools tags, a 'Traffic — Last 7 days' section, and both the /v1/chat/completions and /v1/messages endpoints.

在这种对比中,单一端点真正带来的,是同时容纳两种答案的能力。选择 Opus 5 的理由和选择 Sol 的理由都取决于投入程度,而投入程度是逐请求参数,而不是一纸合同。一个团队如果通过一个密钥来路由这两个模型,并借助自动故障转移,就可以把需要 Opus 5 最大投入上限的工作发送给 Opus 5,并把高用量层级以中等投入发送给 Sol,而无需第二套集成或第二组速率限制。路由 DSL将这一决策编排进调用中,而不是编排进迁移项目——这一点在这里尤其重要,因为对于这一对模型,正确答案会随请求而变,而不是随季度而变。

决策规则

• 在已知质量门槛下的大批量工作——GPT-6 Sol,中等或高努力档位。以每任务 $0.25 的价格换取四十个索引点,是这块板上最便宜的可信报价;而且努力档位是一个有据可查的参数,不是猜测。

• 需要能力范围顶端且付得起相应费用的工作——使用 xhigh 或 max 档的 Claude Opus 5。比 Sol 的上限高出三个指数点,每项任务 $4.88 至 $5.86,并且是两者中唯一具有 300,000 个 token 批处理输出上限的。

• 大规模语料库批处理任务——Claude Opus 5,依据的是结构性论点,而非按 token 计算的论点。无长上下文附加费,批处理折扣可与缓存叠加,并且为存活时间超过五分钟窗口的前缀提供一小时缓存 TTL。

• 凡是答错代价高昂的场景——就目前的公开记录而言,两者都不合格。本次发布中,Opus 5 的幻觉率上升了十四个百分点,而 Sol 的第三方记录窄得只有一个数字。

• 如果你看到的对比是"Opus 5 max 对 Sol max"——在做决定之前,先用默认强度重新跑一遍。真正做决定的场景恰恰在那里,而这正是现有覆盖范围从未向你展示的那一种配置。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新