
GPT-6.1 Sol 对决 Claude Opus 5.5:真实存在的差距,分布不均
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 141 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 294 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
5.8 分的差距:Claude Opus 5.5与GPT-6.1 Sol在 Artificial Analysis 智能指数上,这是本组所有配对中差距最大的一个,而且与其中大多数不同,它不会因为改个设置就缩小。Claude Opus 5.5 于 2026 年 9 月 22 日发布,定价为每百万输入 token 4.00 美元、每百万输出 token 20.00 美元,得分 57.6。GPT-6.1 Sol 于 2026 年 9 月 29 日发布,定价为 2.00 美元和 10.00 美元,得分 51.8。Claude Opus 5.5 是得分更高的模型,其领先幅度比大多数前沿模型彼此之间的差距还大,而为此付出的代价是每任务成本高出 8.3 倍——5.98 美元对 0.72 美元。到目前为止,贵的那个模型就是在单纯地赢,而这正是这一比较中最无趣的版本。真正让它值得一读的是,这 5.8 分并没有均匀分布在整套测试中:在决定大多数长文档和长会话任务表现的那一个维度上,两个模型之间相差不到两分。
两者是同一市场定位中的旗舰型号:1M 级上下文窗口、128K 输出上限,支持文本、图像和文件输入,一方具备扩展思考,另一方则配备五档努力等级阶梯。Claude Opus 5.5 接替 Claude Opus 5,定位于高要求的推理、编程和长周期智能体工作;GPT-6.1 Sol 比 GPT-6 Astra 低一个层级,定位于智能体编程、计算机操作和文档密集型专业工作。它们瞄准的是同样的工作任务。而测量结果表明,它们在这些任务上的表现并不同样出色。
5.8分究竟在哪里
综合指数会掩盖其各个组成部分。把各项单独的评估抽出来,差距就不再像差距,而开始像一幅画像。
• Humanity's Last Exam — Claude Opus 5.5 61.4% 对 GPT-6.1 Sol 52.9%,在抽象推理上相差 8.5 个百分点
• SciCode —— Claude Opus 5.5 达 66.9%,GPT-6.1 Sol 为 54.2%,在研究级代码上相差 12.7 个百分点
• 长上下文召回 —— Claude Opus 5.5 达 84.7%,GPT-6.1 Sol 为 83.0%,在从长输入中检索事实这一项上相差 1.7 个百分点
• Terminal-Bench 4.0 — Claude Opus 5.5 达到 59.6%,而对照的 Sol 数据并未在同一修订版本中公布
• 上下文窗口 — GPT-6.1 Sol 1,050,000 个 token,对比 Claude Opus 5.5 1,000,000 个 token,两者输出上限均为 128,000 个 token
• 每个索引任务的成本 — Claude Opus 5.5 为 5.98 美元,而 GPT-6.1 Sol 为 0.72 美元
分布才是关键。当任务是在抽象层面进行推理——一道高难度考试题,或一个没有现成答案可抄的研究级编程问题——Claude Opus 5.5 明显领先,而 12.7 个百分点的 SciCode 差距并非噪声。当任务是在超长输入中找到正确的段落并加以利用时,两个模型实际上旗鼓相当,而 GPT-6.1 Sol 凭借多出 50,000 个 token 的容量守住了这一位置。生产环境中很大一部分 LLM 工作属于第二类:检索增强式问答、合同与文件审查、日志与转录分析、大型代码仓库的代码审查。这类工作由第三个要点衡量,而非前两个,而在这个要点上,溢价换来的是 1.7 个百分点。
诚实地读取索引行
两个注意事项应当紧挨着那些数字,而不是放在页面底部。
这些配置有所不同。Artificial Analysis 在图表中让 Claude Opus 5.5 采用“Max, Default Fallback”配置,让 GPT-6.1 Sol 以最大努力程度运行。两者都是各模型公开发布的最强设置,因此比较是公平的,但这是对两个上限的比较,而不是对两个实际发布默认值的比较。Claude Opus 5.5 在托管 API 中的自身默认值可能不同于图表中所运行的配置,而 GPT-6.1 Sol 的默认努力程度为中等。
Terminal-Bench 这一行有一侧被刻意留空。Claude Opus 5.5 的 59.6% 来自它被发布时所在的 Artificial Analysis 修订版本;而对应的 GPT-6.1 Sol 数字在与之匹配的修订版本中并不存在。引用同一基准测试不同运行中的数字会是错误的比较,诚实的做法是让该单元格保持空白,而不是用一个大致正确的数字来填充它。
冗长程度在这里的指向与面对更便宜的同类模型时相同:Claude Opus 5.5 在索引套件上输出 2.6 亿个 token,而 GPT-6.1 Sol 为 6700 万——在单价已然翻倍的情况下,差距仍达 3.9 倍。当价目表上输入是 2 倍、输出也是 2 倍时,每任务 8.3 倍的比率正源于此。溢价是 8.3 倍,并非因为该模型贵 8.3 倍——而是因为它贵 2 倍,却思考了 3.9 倍之久。
支持支付它的理由
如果你的工作与前两条要点相似,那么这笔账很直接,而且结果偏向 Claude Opus 5.5。研究级科学代码上 12.7 个百分点的差距、高难度抽象推理上 8.5 个百分点的差距,正是“能无人值守地关闭工单的智能体”与“每三步就需要人工介入的智能体”之间的区别。在大型代码库上进行智能体编程,是两家厂商最先提及的工作负载,也是差距最悬殊的工作负载。为了避免一次失败运行让工程师搭进去二十分钟,每个任务付 $5.98 而不是 $0.72,这并不是一个需要犹豫的选择。
还有第二种论点,它根本不涉及分数。Claude Opus 5.5 问世已有十五天,已经积累了大量的第三方评估、评审和部署经验,而一个问世仅八天的模型并不具备这些。对于生产路径而言,周边知识的成熟度具有某种该指数并未定价的价值。
反对的理由,以及决定此事的数字
反方论点就在长上下文那一行。如果你流量的主要形态是“大输入、短回答”——对许多团队来说确实如此——那么你被计费所依据的维度并不是你实际消耗的维度。在长上下文召回上,两个模型相差 1.7 个百分点,价格比却达到 8.3 倍,而更便宜的模型还拥有更大的窗口。这正是溢价真实存在、可被量化,并且花在了工作负载从未用到的能力上的情形。
那么,起决定作用的数字并不是那个指数。它是你的任务中看起来像 SciCode 而不是像回忆型任务的那部分所占的比例。能够从自己的日志中回答这个问题的团队,就应该从自己的日志中回答;基准测试套件只是一组任务组合的代理,而组合才是变量。
两者都在同一个键上,这正是这个问题能够被回答的原因


Claude Opus 5.5 已在 OrcaRouter 上线,价格为其自身的 $4.00 / $20.00,缓存读取为 $0.20。GPT-6.1 Sol 已在 OrcaRouter 上线,价格为 $2.00 / $10.00,当提示超过 272,000 个 token 时升至 $4.00 / $15.00,缓存读取为 $0.10。两者均按提供商标价,无任何额外加价,只需一个密钥、一份账单。
对于这种组合而言,这一点比通常更为重要,因为这两个模型并非彼此的替代品——它们是一个路由决策。把长文档和高吞吐量的工作交给 GPT-6.1 Sol,把高难度推理和代码修改类工作留在 Claude Opus 5.5 上,而两者都位于同一个端点之后,使用同一套凭据。如果某条路由性能下降,自动故障转移会将该调用转移到其他路由,而不是让它失败;而且由于路由是声明式的,它可以按任务类别来表达,而不必按应用来表达。测试这种分工只是一次配置变更,而不是一次迁移。
最后值得说的是这种对比的时效性。两个模型都才发布几天或几周。GPT-6.1 Sol 只公布了一种独立配置;Claude Opus 5.5 也只有一种。每个模型只跑一次只是一个快照,而真正值得警惕的失败模式并不是这些数字中有一个是错的——而是中等投入的配置,或者第二个评估者,会重新勾勒出整体画像。在那之前,站得住脚的解读就是各组成部分所给出的结论:在高难度推理和研究代码上存在决定性差距,在长上下文任务上差距较小,以及一笔 8.3× 的账单,必须由你工作负载中类似于前者的那部分来证明其合理性。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
