
Claude Opus 5.5 vs GPT-6 Sol:价格减半,直到上下文变长
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Anthropic 和 OpenAI 在同一天下午发布了各自的竞争性旗舰模型。 Claude Opus 5.5于 2026 年 9 月 22 日上线,定价为每百万输入 token 4 美元、每百万输出 token 20 美元,相较 Claude Opus 5 两项价格均下调 20%。 GPT-6 Sol同日上线,输入 2 美元、输出 10 美元,相较 GPT-5.6 Sol 直接降价 50%,OpenAI 称这是永久定价,而非促销。只读这两句话,胜负似乎还没开始就已注定:OpenAI 的模型价格只有一半,而半价就是半价。但把两份价目表的其余部分读完,差距基本就消失了——不是因为任何一家厂商改了什么,而是因为两款模型都会对同一类请求加收附加费,而这对 Sol 优势的侵蚀远大于对 Anthropic 的影响。
两张费率卡,都包含一个阶梯
低于 272,000 个输入 token 时,这是当前前沿中最简单的比较:
• 输入 — GPT-6 Sol 每百万 $2.00,对比 Claude Opus 5.5 每百万 $4.00
• 输出 — GPT-6 Sol 每百万 $10.00,对比 Claude Opus 5.5 的 $20.00
• 缓存输入 — 与 Claude Opus 5.5 每百万 $0.20(基础输入价格的 5% 倍率)相比,GPT-6 Sol 的缓存部分约低 90%
• 上下文与输出 — GPT-6 Sol 872K(据 Artificial Analysis 测量),其他来源宣称 1M,最大输出 128K,对比 Claude Opus 5.5 的 1M 和 128K
• 知识截止日期——Claude Opus 5.5 为 2026 年 6 月,而 GPT-6 Sol 未以相同方式说明
超过 272,000 个输入 token 后,双方的计费算法都会发生变化,而且变化幅度并不相同。GPT-6 Sol 会对整个请求重新定价——不是只针对超出部分,而是整个调用——输入费率大约是原来的两倍,输出费率则是原来的一倍半,最终约为输入 $4.00、输出 $15.00。Claude Opus 5.5 的费率表没有长上下文分档:Anthropic 在整个 100 万 token 窗口内均按 $4.00 和 $20.00 计费,并表示一次 90 万 token 的请求,其每 token 成本与一次 9K token 的请求相同。
把这些放在一起看,排序就会在一个意想不到的地方发生反转。在长上下文调用中,两个模型的输入费率都收敛在 4 美元左右——Sol 在输入上的半价优势彻底消失——而输出端的差距则从 2 倍收窄到约 15 美元对 20 美元,优势从 50% 变成了 25%。Sol 依然更便宜。但它已经不再便宜到足以成为决策中唯一的数字,原因在于这两种附加费的形态不同:Anthropic 的模型收取的是固定费率,只是恰好更高;而 OpenAI 收取的是一种惩罚性费用,它落得最重的地方,恰恰是智能体式、读取代码仓库、处理文档集这类工作负载——而这正是两家公司推销这些模型所瞄准的场景。

独立评分,这是唯一在同等条件下的对比

两张发布表都没有包含对方的新模型——两者都是在同日发布落地之前编写的——因此厂商材料根本无法为这两者排名。Artificial Analysis 可以,因为它在同一个公开配置中运行每个模型:
• 智能指数 — Claude Opus 5.5 58,在 210 个中排名第 1;对比 GPT-6 Sol 48,排名第 18
• 配置标签 — 两者均按最大努力评分;Claude Opus 5.5 额外标注为“默认回退”
• 输出速度 — GPT-6 Sol 113.3 tokens/秒,排名第 38 位,对比 Claude Opus 5.5 尚未发布
• 首个 token 耗时 — GPT-6 Sol 142.74 秒,对比榜单中位数 3.83 秒;Claude Opus 5.5 尚未公布
• 价格 — GPT-6 Sol 每百万 $2.00 / $10.00,对比 Claude Opus 5.5 $4.00 / $20.00
十个指数点和十七个名次的差距,是当前所有 Claude 对 OpenAI 配对中最大的一次,而且它本月第二次不利于更便宜的模型——同样的模式在此前一次对比中就出现过:GPT-6 Sol 对上 Claude Opus 5,在成本低 60% 的情况下以三分之差落败。速度这一行则正好相反,而且其重要性超出表面所见:每秒 113.3 个 token 大约是 GPT-6 Astra 旗舰机型的两倍,也是这一组中最快的数字。再加上 142 秒的首 token 延迟,整体画像是一个思考很久、然后写得很快的模型——这对任何交互式场景都不合适,而对长时间无人值守的运行则尚属合理。
这两个数字和厂商的数据一样,都带有同样的说明:它们都是在最高努力(max effort)档位下测得的结果,而两款模型正式发布的默认档位都并非最高努力。medium在从 low 到 max 的努力档位刻度上,Claude Opus 5.5 默认使用 medium;GPT-6 Sol 则提供了从 none 到 max 的刻度。用最高努力指数来比较上限是公平的,但用它来预测你的账单则会产生误导。
双向切换时,哪些东西会出问题?
这里的迁移阻力是不对称的,无论采取哪种举措,都值得事先了解。
Claude Opus 5.5 并非 Claude Opus 5 的直接替代品。思考已无法再被禁用,因此设置非思考路径的代码将会报错,或悄然改变行为。强制工具调用会返回错误。思考块与生成它们的模型和对话绑定,因此无法跨模型重放。较旧的 computer_20251124 计算机使用工具在 Claude API 或 Google Cloud 上不被接受。另外,工具调用之间的文本现在会返回在思考块内,而在默认显示设置下这些思考块是空的,因此将这段文本作为进度流式输出的应用程序,在调用之间只会悄然静默,而不会抛出任何错误。
GPT-6 Sol 的 effort 档位是两者中更灵活的那个:它可以在对话过程中更改,而不会使提示缓存失效,这意味着在同一份上下文上先做一次低成本的首轮尝试、再进行一次高成本的重试,是一种受支持的模式,而不是会破坏缓存的做法。对于任何在单次会话内运行分层推理的人来说,这都是实打实的工程优势,也是支持 Sol 的最有力论据——而这一点在任何价格表里都看不到。
同时运行两者,并根据你自己的数据做决定
对于这场对比,诚实的立场是:厂商的表格无法给出定论,独立指数也只能确定上限。剩下的就是工作负载问题——你的上下文实际会运行多久,以及一次失败尝试要付出多大代价——而这一点可以基于你自己的实际流量来衡量,而不是靠一份新闻稿来争论。
两款模型均可通过 OrcaRouter 按提供商目录价路由,0% 加价:GPT-6 Sol 为 OpenAI 的 $2.00 / $10.00,Claude Opus 5.5 为 Anthropic 的 $4.00 / $20.00。由于透传完全精确,且价格随厂商调价当日同步变动,你在预发环境测得的比率就是你在生产环境支付的比率,没有任何加价层需要你重新推算。一个密钥即可同时覆盖两者,因此把低于 272K 的调用发给 Sol、把长上下文调用发给你评测中胜出的那个模型,这条路由规则只是一次配置变更,而非第二套集成——而且 自动故障转移意味着无论哪一侧当天发布新模型,你都可以把一部分流量切过去,而不必拿整条流水线去下注。

这个在与法案接触后仍能存活下来的版本
GPT-6 Sol 在每一项、每一种配置下都是更便宜的模型,这一点没有争议。站不住脚的是这样一种假设:可以把“半价”当作规划时所依据的数字:在长上下文调用中,输入费率大致在 $4 处相交,而输出差距缩小到四分之一,这与发布页面所描述的是截然不同的决策。将此与十点的指数差距、十七个名次,以及实测 142 秒的首 token 放在一起权衡,对大多数工作负载而言,选择自然就分明了——Sol 作为短上下文和中上下文下的高用量默认选项,Claude Opus 5.5 则用于上下文很长,或任务难到重试成本高于 token 差价之时。值得避免的错误是仅凭宣传费率就在两者中做选择,因为真正决定这两个模型所针对的用例的,是每张费率卡上的第二个数字。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
