
GPT-6 对决 Claude Opus 5.5:人人刚拿到的那个模型,对阵依然领先的那一个
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
2026年10月7日,GPT-6成为超过12亿每周活跃ChatGPT用户所对话的模型,但它仍然不是独立榜单上得分最高的模型。GPT-6 Sol——OpenAI为ChatGPT Plus、Pro、Business和Enterprise开启的层级——在Artificial Analysis的Intelligence Index v4.3.2上得分为47.6。Anthropic于2026年9月22日发布、每百万输入token收费4.00美元、每百万输出token收费20.00美元的Claude Opus 5.5,在同一版本上得分为57.6。十分之差,就出在两家厂商的市场团队都愿意接受评分的唯一一项衡量指标上。
这个差距是真实存在的,我不会淡化它。但这也是十月份这对组合中最无趣的事实,因为本周发生变化的东西并不是一项基准测试。GPT-6 随着 OpenAI 称为 Intelligent UI 的能力向所有人登陆 ChatGPT,而支撑该轮推广中付费档位的模型是 GPT-6 Sol。所以,现在有用的比较不再是“哪个 API 更好”——而是“刚刚用上 GPT-6 的那 12 亿人实际上得到了什么,这足以让一个开发者或一个团队停止为 Claude Opus 5.5 付费吗”。这两个答案并不相同,而差异并不在那十分上。
10月7日究竟发生了什么变化?
要准确说明日期,因为这不是一次发布:GPT-6 Sol 和 GPT-6 Luna 于 2026 年 9 月 22 日作为 API 模型上线。旗舰模型 GPT-6 Astra 比它们更早——OpenAI 于 2026 年 9 月 3 日发布了它。10 月 7 日发生的是,GPT-6 面向 Plus、Pro、Business 和 Enterprise 登陆 ChatGPT 的 Chat 标签页,Free 和 Go 层级从 10 月 8 日起跟进;企业访问权限仍取决于工作场所管理员的设置。这是一次分发事件,而非发布,这一区别对任何阅读较早报道的人来说都很重要。
依附于它的这项能力才是真正全新的部分。Intelligent UI 让 GPT-6 能够用文本、图形、可点击按钮、表单和图表组合出答案,具体形式视问题而定,并在模型生成的同时流式输出界面。OpenAI 自己的说法是:比较可能会以并排形式返回,解释会以交互式图表呈现,而当纯文本才是正确答案时,就返回纯文本答案。随之一同公布的还有两项由厂商报告的内部结果:在高价值的日常智能体任务上,GPT-6 在 Extra High 推理强度下开始作答的时间与 GPT-5.6 在 Medium 下相同,而整体得分优于 GPT-5.6 在 Extra High 下的表现;而在需要网络搜索的问题上,GPT-6 Instant 开始作答的时间平均比 GPT-5.6 Instant 快 44%。两者都是 OpenAI 自己的数据,转载自其自身的公告,且目前都尚未有独立的复现。
两张费率卡,以及这十个积分是在哪里购买的
本周两个模型都没有改变价格。Claude Opus 5.5 自 9 月 22 日以来一直是输入 $4.00、输出 $20.00。GPT-6 Sol 自同一天起一直是 $2.00 和 $10.00。每个维度一行,每行两边都列出:
• 标题输入 — GPT-6 Sol 每 100 万 token 2.00 美元 vs Claude Opus 5.5 4.00 美元;Sol 的价格只有一半
• 标题输出 — GPT-6 Sol 每 100 万 token 10.00 美元 vs Claude Opus 5.5 20.00 美元;同样只有一半
• 长上下文条款 — 当输入超过 272,000 token 时,GPT-6 Sol 会对整个请求重新定价,输入 4.00 美元、输出 15.00 美元;Claude Opus 5.5 在其 100 万窗口下没有可比的分档
• 缓存输入 — GPT-6 Sol 每 100 万 token 0.20 美元 vs Claude Opus 5.5 0.20 美元;持平
• 运行完整 Intelligence Index 套件的成本 — Claude Opus 5.5 每项任务 5.98 美元 vs GPT-6 Sol 1.04 美元,为了那十个点换来的正是 5.7 倍的差距
• 上下文窗口 — GPT-6 Sol 1,050,000 token vs Claude Opus 5.5 1,000,000,两者的输出上限均为 128,000 token

第四行才是决定大多数实际部署的那一行,而它并不是营销页面上的那一行。GPT-6 Sol 的长上下文附加费相对于它自己的宣传数字而言相当激进:只要请求的输入 token 超过 272,000,整个请求都按 4.00 美元和 15.00 美元计费,而不只是超出部分。对于一个在上下文中持有长时间会话、并携带大型文档的智能体来说,这会悄然抹去大部分半价优势。Claude Opus 5.5 没有同等的阶梯,因此一个 400,000 token 的请求,其每 token 费率与 4,000 token 的请求相同。
十个点位于哪里,因为它们分布不均
综合指数会隐藏自身的构成成分,而这一项隐藏着一个异常参差不齐的分布特征。调出可用于对照解读两家供应商数字的单项评估:
• Humanity's Last Exam——Claude Opus 5.5 为 61.4%,GPT-6 Sol 为 47.9%,在抽象推理上相差 13.5 个百分点
• SciCode——Claude Opus 5.5 为 66.9%,GPT-6 Sol 为 57.6%,在研究级代码上相差 9.3 个百分点
• Terminal-Bench 4.0——Claude Opus 5.5 为 59.6%,GPT-6 Sol 为 43.9%
• 长上下文召回——Claude Opus 5.5 为 84.7%,GPT-6 Sol 为 83.7%,仅相差 1.0 个百分点,是本页差距最小的一项
• 多轮智能体工具调用——在 τ²-Bench 系列上,两款模型的分差仅有几个百分点,二者均表现强劲

分布本身就是全部答案。在抽象推理方面——一道高难度考题、一个没有现成答案可抄的研究问题——Claude Opus 5.5 明显领先,而且差距大得绝不可能是噪声。在从超长输入中提取某个事实方面,两者实际上旗鼓相当,而 GPT-6 Sol 的上下文窗口略大一点。如果你的工作负载是长文档检索和长会话智能体任务,那这 10 个百分点基本上是别人的问题。如果它属于新颖推理,那它就是你的问题,而要想避开它,每个任务都得多付 5.7 倍的成本。
ChatGPT 的推出能告诉你什么,以及不能告诉你什么
有一种诱惑,是把“每周 12 亿用户现在用上了 GPT-6”解读为关于能力的证据。事实并非如此。这是关于分发覆盖的证据,而 OpenAI 明确表示,ChatGPT 的这次铺开由付费层级的 GPT-6 Sol 和 Free 与 Go 的 GPT-6 Luna 提供支持,两者都“为日常对话而调优”——这与 API 产品是不同的优化目标。Work 和 Codex 背后的模型并未因这次发布而改变,这是公告中最清晰的一个信号:这是一次面向消费者端的事件,而非一次能力发布。任何要对“12 亿人使用的那款 GPT-6”做基准测试的人都应该知道,他们测量的是一个经过聊天调优的部署,而不是 API 端点。
发布真正改变的是默认选项。一个对所有人直接可用的模型,最终会出现在远多于需要刻意挑选的模型的原型、内部工具和半成品副项目里。如果你是在为某个长期存在的东西挑选 API,这种无处不在的熟悉感确实有其价值——但它不值十个指数点,也不值推理密集型流水线上 5.7 倍的单任务成本。
同时运行两者而不做选择
对“我该不该切换”这个问题,诚实的答案是:这两个模型想承担的是不同的任务,而切换问题在很大程度上是一个路由问题。两者都在 OrcaRouter 的目录中——GPT-6 Sol 按供应商的 $2.00/$10.00 计价,其中 $4.00/$15.00 的长上下文档位原样沿用,以及 Claude Opus 5.5 定价为 $4.00/$20.00——通过一个密钥和一个 OpenAI 兼容端点提供,在提供商标价基础上加价 0%。在供应商调整消费者版本发布的这一周,这一点比平时更重要,因为我们的价格线是提供商的,而不是我们自己的。
适合这种组合的模式是分流:把长文档和长会话流量发给两者中在该 token 数下更便宜的那一个——而在超过 272,000 个 token 之后,更便宜的那个不再是 GPT-6 Sol——并把新颖推理流量发给 Claude Opus 5.5,同时将 GPT-6 Sol 作为自动故障转移保留起来,这样某条路由上的速率限制就不会变成你这边的服务中断。你不必先解决那场十点之争才能上线;你只需要知道,你的哪些请求正落在该模式所适用的那部分分布之中。

判决,姑且如此
在两家实验室都会公布对比数据的衡量指标上,Claude Opus 5.5 是更好的模型;而在对高难度推理最关键的两项评测上,它的领先优势还相当明显。按标价计算,GPT-6 Sol 的价格只有前者的一半,在独立测试套件上的单任务成本只有五分之一,而且如今已是你的大多数同事已经打开的那款应用中的默认模型。这两个事实本周都没有改变;真正改变的是,GPT-6 不再是你必须去选择的东西,而变成了你已经拥有的东西。
值得关注的是,OpenAI 的下一步究竟是能力上的进阶,还是又一次分发上的动作。它自己的公告明确设定了这一预期——该公司表示,希望 ChatGPT 随着时间推移构建更多人们所需的界面——而这是一份关于界面的路线图,而非关于指数分数。如果你的决策取决于这个指数,Claude Opus 5.5 仍然胜出。如果取决于规模化下的成本,以及模型是大家都已经熟悉的那一个,那么 GPT-6 Sol 是今天更稳妥的默认选择,其中长上下文条款是它的价目表中你必须预算进去的那一项。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
