生成的标题卡上写着“GPT-6 vs Claude Opus 5”,并带有一个标签,上面写着“Opus 5 已被 Claude Opus 5.5 取代,2026年9月22日”,以及另一个标签,上面写着“GPT-6 Sol 已被 GPT-6.1 Sol 取代,2026年9月29日”,页脚则写着“两个模型仍在路由中;指数数据来自 Artificial Analysis。”OrcaRouter 标志合成在右下角。
Guides & Insights

GPT-6 与 Claude Opus 5:这场对决的双方都已被取代

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

The most useful thing to know about GPT-6 versus Claude Opus 5 is that both halves of the matchup are one generation behind their own vendors. Claude Opus 5 shipped on 24 July 2026 and was replaced by Claude Opus 5.5 on 22 September. GPT-6 Sol shipped on 22 September and was replaced by GPT-6.1 Sol on 29 September. If you searched for this comparison because you are choosing between them for new work, you are choosing between two models that each vendor has already moved past — and the honest version of this article is about when the older pair is still the right call, not about who wins.

这两个模型到底是什么

Claude Opus 5 曾是 Anthropic 的旗舰模型:拥有 1,000,000 token 的上下文窗口、128,000 token 的最大输出量,支持文本、图像和文件输入,标价为每百万输入 token 5.00 美元、每百万输出 token 25.00 美元,缓存输入价格为 0.50 美元,缓存写入价格为 10.00 美元。它是一个单一模型,只有一个 id,anthropic/claude-opus-5。

GPT-6 Sol 是三款模型一代中的中档——GPT-6 Astra在其之上,GPT-6 Luna在其之下——它拥有相同的超过 100 万 token 上下文(OpenAI 一侧的目录列为 1,050,000,而 Opus 5 为 1,000,000),相同的 128,000 token 输出上限,以及相同的文本/图像/文件输入。其标价为 $2.00 / $10.00,缓存输入费率为 $0.20,缓存写入费率为 $2.50。它的费率卡包含一项 Anthropic 费率卡所没有的阶梯:任何超过 272,000 输入 token 的请求都会将整个请求重新定价为 $4.00 / $15.00。

在短上下文一端,这意味着每 token 存在 2.5 倍的价格差距,且对 Sol 有利;这一差距在缓存上也同样成立——Sol 的缓存输入折扣为 90%,而 Opus 5 为 98%,这使差距缩小至每百万 $0.20 对 $0.50,而非将差距消除。在长上下文工作负载下,这一差距只会减半,而不会消失。

• 输入 — GPT-6 Sol 每百万 $2.00,对比 Claude Opus 5 $5.00
• 输出 — GPT-6 Sol 每百万 $10.00,对比 Claude Opus 5 $25.00
• 缓存输入 — GPT-6 Sol 每百万 $0.20,对比 Claude Opus 5 $0.50
• 缓存写入 — GPT-6 Sol 每百万 $2.50,对比 Claude Opus 5 $10.00
• 超过 272K 输入 — GPT-6 Sol 会将整个请求重新定价为 $4.00 / $15.00;Opus 5 的定价卡上没有等效档位
• 上下文与输出 — 输入 1,050,000 和输出 128,000,对比输入 1,000,000 和输出 128,000

独立板块,其差距大于价格

Price favours GPT-6 Sol by 2.5x. The board favours Claude Opus 5 by more than the price gap would suggest, which is the opposite of the usual cheap-model story.

• AA 智能指数 — Claude Opus 5 50.8,排名第 11;GPT-6 Sol 47.6,排名第 14
• AA 编程指数 — Claude Opus 5 78.0,在该榜单上排名第 2;GPT-6 Sol 60.0
• GPQA Diamond — Claude Opus 5 93.2
• Humanity's Last Exam — Claude Opus 5 54.9 对比 GPT-6 Sol 47.9
• Terminal-Bench 2.1 — Claude Opus 5 89.1
• Terminal-Bench 4.0 — Claude Opus 5 49.0 对比 GPT-6 Sol 43.9
• τ-bench 银行业务 — Claude Opus 5 42.1
• SciCode — Claude Opus 5 56.4 对比 GPT-6 Sol 57.6
• 长上下文召回 — Claude Opus 5 79.3 对比 GPT-6 Sol 83.7

有两行走向相反,它们值得点名,因为汇总结果把它们掩盖了。GPT-6 Sol 在长上下文召回上以 4.4 分击败 Opus 5,并在SciCode上以 1.2 分稍占上风。所以诚实的图景并不是“Opus 5 样样都更强”——而是 Opus 5 在编程和智能体榜单上明显领先(24 分的 Coding Index 领先属于另一个量级的结果),而 Sol 则守住了长窗口检索这一行,并在两项科学代码指标中的一项上打成平手。

在任一数字被其他地方引用之前,先说明一个方法上的注意事项:Artificial Analysis 不保证两个模型页面是在同一天、依据同一指数修订版本生成的,而且它会将其同类组拆分——开放权重模型与同一规模级别的其他开放权重模型一起排名,闭源模型则在闭源价格带内比较。这里的两个模型都是闭源,因此这两个数字来自这条界线的同一侧,但请将不到一分的差异视为方向性信号,而非受控测量结果。本文中的每个厂商数字都是厂商用自家模型对自家前代模型进行基准测试所得,并已照此标注。

这两个替换改变了什么?

Claude Opus 5.5于 9 月 22 日发布,价格为 $4.00 / $20.00——在两项计价指标上都比 Opus 5 更便宜,其 $0.20 的缓存输入价格与 Sol 持平——并在同一智能指数上取得 57.6 分。这比 Opus 5 高出 6.8 分,成本却低 20%。任何主张在新构建中继续使用 Opus 5 的论点,都必须解释:为了留在较旧的检查点上,为何值得付出 6.8 个指数分以及每百万 $1.00/$5.00 的代价。

GPT-6.1 Sol于 9 月 29 日发布,价格与 GPT-6 Sol 相同,均为 $2.00 / $10.00,在该指数上得分 51.8,而 Sol 为 47.6;其缓存输入价格为 $0.10,使缓存读取成本减半。同样的价格,更高的分数,更优的缓存经济性。为 GPT-6 Sol 单独辩护的唯一理由,与适用于 Opus 5 的理由相同:一套以它为基线建立的回归测试套件——更换模型会使你原本信任的那些对比结果失效。

团队继续使用较旧的那一对模型,还有第二个更不显眼的原因,而且它跟基准测试无关。这两者都是在生产环境中拥有最长使用历史的检查点。Opus 5 自 7 月 24 日起便可调用,GPT-6 Sol 则自 9 月 22 日起可调用;独立评估方对两者的测量已经持续了足够长的时间,足以呈现出一种走势,而不只是一个单次读数。在我们自己的路由数据中,Sol 过去七天的流量约为 210 万 tokens;Opus 5 的则约为 2300 万。这些是滚动窗口数据,而非累计总量,每次读取之间都会有所变化——但它们提醒我们,即便替代型号已经发布,Opus 5 仍在生产环境中承担着实际工作。

延迟与成本的形态,正是 Sol 体现其价值之处

• 首个 token 中位延迟——GPT-6 Sol 6,785 毫秒,对比 Claude Opus 5 4,652 毫秒
• 输出速度中位数——GPT-6 Sol 179.6 token/秒,对比 Claude Opus 5 82.2 token/秒
• 我方观测到的七日流量——GPT-6 Sol 约 210 万 token,Claude Opus 5 约 2,300 万 token

Sol 大约在 2.1 秒后才给出第一个 token,但随后流式输出的速度是 Opus 5 的两倍多。在长时间生成中——也就是输出是数千个 token 而非几十个的那种运行——第二个数字占主导地位,而一个更早完成的便宜模型,其价值比它的价目表所显示的要高。在简短且对延迟敏感的调用中,用户真正感受到的是第一个 token 的数字。

这两项都是来自我们自己路由的服务测量数据,基于七天滚动窗口统计,每次读取时都会有所波动。它们适合用来比较两个模型的形态,而不适合作为服务级别预期来引用。

A generated two-column comparison scoreboard titled "GPT-6 Sol vs Claude Opus 5 — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7, Output speed 180 tok/s. The right column, Claude Opus 5, reads Input $5.00, Output $25.00, AA Intelligence 50.8, AA Coding 78.0, Long-context recall 79.3, Output speed 82 tok/s. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

在迁移未决期间运行该配对

这个对比之所以还值得回答,是因为这两种替换都不是即插即用的决定。如果你的评估是基于 Claude Opus 5 构建的,那么迁移到 Opus 5.5 是重新设定基线,而不是升级;GPT-6 Sol 相对于 GPT-6.1 Sol 也是如此。在这个窗口期,有用的做法是在你自己的流量上把两代模型并排跑起来,而不是根据别人的榜单来做选择。

这四个模型都位于 OrcaRouter 的同一个目录中——Claude Opus 5、Claude Opus 5.5、GPT-6 Sol 和 GPT-6.1 Sol,通过一个置于 200+ 个模型之前的 API 调用,提供商的目录价以 0% 加价透传,因此供应商降价当天就能在这里生效,而不是等到你下次对账时——这让比较变成了一个路由问题,而非采购问题。路由 DSL 让你可以按请求大小或按比例分流:把一部分生产流量发送到更新的检查点,用你自己的评估将其与基线进行对比,当数据稳定时再扩大分流比例,并在数据稳定之前保留旧模型作为回退。跨提供商自动故障转移可应对路由在迁移过程中性能下降的情况,而这正是让人半途放弃迁移的失败模式。

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the Anthropic vendor label, a 2026-07-24 catalogue release date, a 1M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $5.00 per million input, $25.00 per million output, a 4.65 s median time to first token, a 10.00 s p95, and 23.0M tokens routed in seven days.Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

既然两者都已被取代,谁该选哪一个?

如果你要开始做新项目:这两个都别选。Claude Opus 5.5 比 Claude Opus 5 更便宜,得分还高 6.8 分;GPT-6.1 Sol 与 GPT-6 Sol 价格相同,但指数更好,缓存读取费用减半。唯一值得从较旧的那两个模型开始的原因,是你对某个无法更改的检查点存在硬性依赖。

如果你已经在运行其中之一:这个决策关乎的是你的回归测试套件,而不是这些榜单。Claude Opus 5 仍然是两者中更强的编程与智能体模型,且优势明显,因此一条在它上面已经稳定的编程流水线应当与 Opus 5.5 进行对比,而不是横向迁移到 GPT-6 级别。运行在 GPT-6 Sol 上的高吞吐、成本敏感的流水线则拥有更轻松的升级路径——价格相同、得分更高、缓存更好——而推迟的诚实理由仅仅是你还没有重新运行你的评估。

如果你想要的答案只是这两者中哪一个胜出:Claude Opus 5 胜出,在几乎每一个榜单上都是如此,但价格是 2.5 倍。GPT-6 Sol 的卖点从来不是它更好,而是它足够便宜,值得这个差价——而这个卖点现在属于 GPT-6.1 Sol:同样的价格,更好的分数。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新