
Claude Sonnet 5.5 对比 GPT-6 Sol:2 美元档位如今已坐拥两款旗舰
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
Claude Sonnet 5.5 和 GPT-6 Sol 的定价完全相同——每百万输入 token 2 美元,每百万输出 token 10 美元——而且它们在 2026 年 9 月下旬相隔六天先后问世。这个巧合并不是有趣之处。有趣的是,当 Artificial Analysis 在其 v4.3.2 Intelligence Index 上对两者进行测评时,Anthropic 这款中端模型竟然超过了 OpenAI 一直作为旗舰产品出售的模型:Claude Sonnet 5.5 为 56,而 GPT-6 Sol 为 47。在同一修订版本上,Claude Sonnet 5——Sonnet 5.5 所取代的模型——得分为 38。
所以这不再是便宜档位与昂贵档位之间的比较。这是同一价位下、来自两个实验室的两款模型之间的比较,其中 Anthropic 的那款与其自身前代之间有 18 个百分点的差距,而在与 OpenAI 的最高端发布版相比时,Anthropic 领先 9 个百分点。下面的一切都旨在弄清:这些差距中哪些能在真实工作负载的检验下依然成立,哪些只是基准测试的假象。
每个模型实际上是什么
Claude Sonnet 5.5 是 Anthropic 5.5 代中的第二款模型,于 2026 年 9 月 28 日发布,在曾预告其推出的 Claude Opus 5.5 发布五天后问世。它使用的 id 为 claude-sonnet-5-5,可在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 中使用,保留该层级的 100 万 token 上下文窗口和 128K 输出上限,并完全沿用 Claude Sonnet 5 的价格:输入 $2,输出 $10,缓存读取每百万 token $0.20,五分钟缓存写入 $2.50。它从第一天起即可提供零数据保留,Anthropic 的退役承诺持续至 2027 年 9 月 28 日。

GPT-6 Sol 是那个被令人困惑地称为 GPT-5.6 Sol 的模型的继任者——OrcaRouter 仍将其列为可访问,价格为输入 $4、输出 $20,而 Artificial Analysis 此后已将其标记为弃用,并指向 GPT-6 Sol。新模型于 2026 年 9 月 22 日上线,价格为 $2 / $10,具有 1,050,000 令牌的上下文窗口、128K 的输出上限,并采用分级费率:$2 / $10 的标价适用于最多 272,000 个输入令牌,超出部分则按 $4 / $15 计费。
最后那个细节,正是"相同定价"这一说法最先站不住脚的地方。
价格持平仅对短提示词成立。
两份费率卡都报价 2 美元和 10 美元,几乎所有发布日对比也都止步于此。请按真正决定账单的条款,把两者并排比较:
• 主要费率 — Claude Sonnet 5.5 $2 / $10 对比 GPT-6 Sol $2 / $10
• 长上下文费率 — Sonnet 5.5 对完整的 1M 窗口按标准费率计费;GPT-6 Sol 在输入 token 超过 272,000 时翻倍至 $4 / $15
• 上下文窗口 — 1,000,000 词元 vs 1,050,000 词元
• 最大输出 — 同步 API 上两者均为 128K token;Sonnet 5.5 在 Message Batches API 上通过output-300k-2026-03-24 标头可达 300K
• 批量折扣 — Sonnet 5.5 的输入和输出均可享受 50% 折扣;请查阅 OpenAI 关于 Sol 的现行条款,而不要想当然地认为两者条件相同
• 缓存读取 — 两者均为每百万 $0.20
在 GPT-6 Sol 上,对包含 80 万 token 的代码仓库做一次全量扫描,每 token 的成本是 Claude Sonnet 5.5 的两倍,而这恰恰是这两款模型共同主打的工作负载。如果你的提示词很短,那么两者的价目表确实旗鼓相当,价格不该成为任何决定的依据。如果提示词很长,那价格早已替你做了决定。
Anthropic 自己的记分板,要仔细读
Anthropic 发布了一份四栏对比,对比对象为 Claude Sonnet 5、Claude Opus 5.5 和 GPT-6 Sol。这些由厂商报告的数值,目前尚无任何第三方复现:

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% 对比 Sonnet 5 10.3%
• FrontierCode 1.1、Main —— 在 Max effort 下,Sonnet 5.5 为 46.2%,Sonnet 5 为 42.4%,Opus 5.5 为 54.4%,GPT-6 Sol 为 49.3%
• CursorBench 4.0 — Sonnet 5.5 55.5% 对比 Sonnet 5 34.1% 对比 Opus 5.5 57.8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 vs Sonnet 5 1449 vs Opus 5.5 1846 vs GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 对比 Sonnet 5 1359 对比 Opus 5.5 1822 对比 GPT-6 Sol 1483
• 人类最后的考试(Humanity's Last Exam),启用工具 — Sonnet 5.5 64.5% 对比 Sonnet 5 54.9% 对比 Opus 5.5 67.7%
• OSWorld 2.1,部分 — Sonnet 5.5 80.1% 对比 Sonnet 5 57.0% 对比 Opus 5.5 81.8%
• 图表解读,无工具 — Sonnet 5.5 61.6% 对比 Sonnet 5 15.6% 对比 Opus 5.5 64.4% 对比 GPT-6 Sol 53.6%
其中两行带有脚注,而且两者都很重要。GPT-6 Sol 的 GDPval-AA、AA-Briefcase 和 Chartography 数据被 Anthropic 标注为是在 OpenAI 方面修复图像理解之后测得的,而 Sonnet 5.5 的 FrontierCode 数值是其 Max-effort 结果,Anthropic 指出该结果低于其在同一评估中的 Xhigh 结果。一个供应商在由自己运行的基准测试上将自己与竞争对手比较,并用脚注对双方加以限定,这并不是中立的证据。这是发布当天可获得的最佳证据,但它与测量不是一回事。
独立数字能说明什么,不能说明什么
Artificial Analysis 发布了首次独立运行结果:在 v4.3.2 上 Index 为 56,每个 Index 任务成本为 7.60 美元,冗长度指标为 4.1 亿个输出 token,而中位数为 8800 万。这个冗长度数字值得比目前获得更多关注。这意味着该模型在得出答案的过程中往往会消耗大量 token,而这正是一项效率主张背后的机制——该主张并非来自 Anthropic 自己的表格。
Anthropic 表示,Claude Sonnet 5.5 的输出生成速度比 Claude Sonnet 5 快 30%,并且在相同的每 token 费率下,“每项任务成本最多低 30%”。这两个说法合在一起,描述的是一个用更少 token 完成同样工作的模型,而不是一张更便宜的价格表。这种说法是否成立,正是 4.1 亿 token 的冗长程度读数要检验的,而仅凭一次独立运行并不足以定论——但足以说明,营销话术与实测 token 数正指向相反的方向,而出现在账单上的是实测的那个。
还要注意这个独立指数尚未包含什么。除 Anthropic 之外,没有任何人发布过 OSWorld、Terminal-Bench 或 CursorBench 的复现结果。而 56 是一个综合分数:它完全没有说明其中十项评估里的哪一项造成了与 Sol 的 47 之间的差距。综合分数领先九分,可能掩盖了在你的工作负载所依赖的那一项评估上落后十五分。
它们在哪些方面存在价目表无法体现的差异
价格和指数评分是两条容易比较的维度。真正决定是否迁移的是行为层面的维度,而在这两点上,这两个模型差距不小。

Claude Sonnet 5.5 默认开启自适应思考,并将 high 作为默认强度,同时移除了上一代允许的三项内容:发送 thinking: {"type": "disabled"} 现在会返回 400,必须替换为 between_tools;强制工具使用——tool_choice 设为 "any" 或指定名称的工具——会直接返回 400;并且较旧的 computer_20251124计算机使用工具在 Claude API 和 Google Cloud 上被拒绝,转而采用工具集。思考块现在也与生成它们的模型绑定,因此对话可以从 Claude Sonnet 5 迁移到 Claude Sonnet 5.5 并保留其推理,但无法再带着它迁回。
如果你的智能体循环设置了tool_choice: "any"来强制进行符合 schema 的调用,Claude Sonnet 5.5 会拒绝该请求,直到你改用 auto,并搭配严格工具使用或结构化输出。这是一项真实的迁移工作,而且正是那种会把一行模型 ID 替换变成一下午的事。
GPT-6 Sol 的切换成本性质不同,因为它所取代的模型仍在目录中,并且仍在被调用。GPT-5.6 Sol 并未下架;它在 Artificial Analysis 中被标记为已弃用,定价是新模型的两倍,并且仍在接收流量。OrcaRouter 自己的测量显示,它每周处理约 9500 万个 token,这可以合理反映还有多少集成尚未迁移。迁移到 GPT-6 Sol 是一个你可以稍后再做的定价决策;你不必现在就做。
对一个键运行比较
双供应商对比的实际问题在于,在你真正了解到任何东西之前,通常就得付出两个账户、两条 SDK 路径和两组速率限制的代价。OrcaRouter 的存在就是为了省去这些:一个兼容 OpenAI 的端点、200 多款模型,按供应商标价原样传递、不加价,以及跨供应商的自动故障转移。
这里真正重要的两个模型,如今都能通过它进行路由。GPT-6 Sol 已收录在目录中,定价为 $2 / $10,长上下文档位保持不变,而 Claude Sonnet 5——大多数 Claude API 流量仍在使用的模型,其实测输出速度为每秒 150 个 token,首个 token 时间的 p50 约为五秒——自 6 月 30 日起就已在该平台上,定价与 Anthropic 自家的 $2 / $10 相同。
Claude Sonnet 5.5 本身尚未出现在我们的产品目录中。话虽如此,通往它最诚实的路径是厂商自家的 API,以及 Anthropic 列出的那三家云;而评估它最诚实的方式,就是把它接入一部分你能承受损失的流量。这正是路由层的意义所在:放开一定比例,紧盯失败率,并且把上一个模型留作兜底,而不是当作回滚方案。
哪一个进入生产环境?
依据工作负载的形态来选择,而不是依据综合评分。
Claude Sonnet 5.5 对于长上下文工作、对于已经针对 Anthropic 的 tool-use 和 computer-use 接口编写好的场景,以及对于提示词经常超过 25 万 token 的团队来说,都是更值得买的选择——在那类场景中,固定费率比任何指数差值都更有价值。要接受这次迁移附带一份检查清单:强制工具使用、thinking 开关、顾问工具配对,以及 computer-use 工具变更。
GPT-6 Sol 对于 OpenAI 形态的技术栈而言是更稳妥的延续性选择;如果你的提示词较短、集成也已搭建完毕,它还更省钱。它的优势不在于能力——在综合评测上它是落后的——而在于其前代仍在提供服务,迁移也没有截止期限。
就今天可获得的数字而言,Claude Sonnet 5.5 在独立指数和长上下文经济性这两项一对一对决中胜出,并且在任何已发布的测量目前所能检测到的范围内——除了厂商自家表格的置信度之外——没有任何一项落败。这比发布材料所宣称的说法更窄,而这正是值得据以行动的那一个。
能改变结论的,是对智能体评测再做一次独立运行,以及两个模型在相同任务上公开的每任务 token 消耗数据。在这两者都具备之前,综合指数上领先九个百分点的是运行成本更低的那个模型,而综合指数上领先九个百分点,并不等于在你的实际工作负载上也领先九个百分点。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
