
GPT-5 Codex vs GPT-5.6 Sol:编程专家 vs 吞噬它的旗舰
- google新Google: Gemini 3.8 Flash2026-09-0259智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
2026年7月9日,OpenAI发布GPT-5.6系列时,悄然退役了独立的Codex应用,并将编程智能体模式并入ChatGPT。OpenAI为GPT-5.6 Sol撰写的模型页面读起来就像是从编程专家那里照搬的职位描述——“深度多步推理、大规模软件工程、长周期智能体工作流”。因此,GPT-5 Codex与GPT-5.6 Sol之间的对决并非一场常规的规格之争。这是专家在发问:刚刚吸收了其产品类别的旗舰模型,是否也已让专家变得多余?
简短的回答是:不——但原因比“Codex 仍然很好”更有趣。GPT-5 Codex 仍在 API 上提供服务,输入每百万 token 收费 1.25 美元,输出每百万 token 收费 10 美元:它是一个专门的软件工程代理,针对 CLI、IDE 和 GitHub 自动化进行了优化,并且拥有独立评测的成绩。GPT-5.6 Sol 的输入成本是其四倍,输出成本是其三倍(5 美元 / 30 美元),而且是最新的通用旗舰模型,编码分数更高——但大多是供应商报告的。这个对比真正取决于价格、上下文,以及一个专才与一个擅长编码的通才之间的差别。以下所有内容均标注了来源。
每个模型是什么
GPT-5 Codex 正是其模型页面所描述的那样:“一个专为软件工程和编码工作流优化的 GPT-5 专门版本。”它于 2025 年 9 月发布,是 OpenAI 编码代理背后的 API 模型——那个可以从零开始构建项目、执行功能开发、大规模重构、审查代码,并通过可调节的推理投入旋钮来规划多文件更改的代理。它接受文本和图像输入(用于 UI 工作的截图),拥有 400K token 的上下文窗口、128K token 的输出上限,并且明确面向代理式编码应用:CLI、IDE 扩展、GitHub 和云端任务。
GPT-5.6 Sol 是 GPT-5.6 系列的旗舰层级,于 2026 年 7 月 9 日发布,知识截止日期为 2026 年 2 月。它是 OpenAI 将最困难的通用任务路由到的模型:深度多步推理、大规模软件工程、长周期智能体、计算机使用,以及多智能体"ultra"推理模式。其上下文为 1.05M tokens——是 GPT-5 Codex 的 2.6 倍——并具有相同的 128K 输出上限,支持文本、图像和文件输入。Sol 也运行在 ChatGPT 内部,因此如今 OpenAI 在产品意义上谈论"Codex"时,通常指的是 Sol 执行智能体编码工作。
价格:4倍/3倍的差距会缩小,但永远不会消失
头条数字均按提供商标价计算:GPT-5 Codex 每百万 token 输入 $1.25 / 输出 $10(缓存读取 $0.125);GPT-5.6 Sol 每百万 token 输入 $5 / 输出 $30(缓存读取 $0.50)。即输入价格是前者的四倍,输出价格是前三倍。以一个常规编程日为例,处理一千万 token,输入/输出比例 75/25,GPT-5 Codex 大约收费 $34;GPT-5.6 Sol 大约收费 $112。这一差距并非理论上的。
有两件事缩小了这一差距。首先是缓存:两个模型对缓存输入的定价都远低于非缓存输入,而智能体循环会持续重新读取相同的仓库上下文,因此很大一部分token可以走低价档。其次是效率:OpenAI声称第5.6代完成智能体任务时,输出token比上一代减少约54%。如果Sol完成同样的任务只需要一半的输出token,单任务差距就会从约3.3倍缩小到约2倍——这是实打实的节省,但无法抹平4倍的输入价格差异;而且这一效率声明是OpenAI自行报告的,而非独立测量得出。
Sol还采用了分级输入价格:在OrcaRouter的模型页面上,其$5/$30基础价格适用于最多32K输入token的请求,更大的请求则按$10/$45的高档计费。这就是长上下文税——正是大型代码库agent会发出的那种请求。因此,实际价格比较比标题所示的3-4倍更加依赖工作负载。

上下文以及如何称呼它们
上下文差距是第二个真正的分水岭。400K token 足以覆盖一个相当规模的代码库,而 Codex 作为专精模型,其设计初衷就是在此窗口内高效工作。但 1.05M token 的 Sol 上下文改变了你能交给模型的内容:整个 monorepo、冗长的代理追踪记录、入职维基,外加代码。对于在单次请求中投喂整个仓库的团队而言,更大的窗口意味着“模型能看到相关文件”与“模型能看到相关文件及其所有导入项”之间的差别。同时,这也意味着每个输入 token 是 $1.25 还是 $5 的差别——这正是上下文决策即成本决策的原因。
这两种模型都使用相同的两种 API 形态——OpenAI Chat Completions 和 Responses API——并且都支持工具/函数调用和结构化输出。在 OrcaRouter 上,两者都位于同一个兼容 OpenAI 的端点后面,因此切换它们只需更改模型名称,而无需更改集成方式。
在基准测试出现分歧之处——以及诚实说明
有意思的是,这两个模型几乎没有共用的基准测试。GPT-5 Codex 拥有真正独立的分数:Artificial Analysis 测得它的智能指数为 36.1,编程指数为 38.9,数学指数为 98.7,LiveCodeBench 为 84.0,SWE-Bench Verified 为 74.5%。而 GPT-5.6 Sol 的旗舰数据——Terminal-Bench 2.1 得分 88.8,Artificial Analysis 编程智能体指数在最大推理模式下为 80,Agents' Last Exam 得分 53.6——是 OpenAI 在发布时公布的,尚未有独立评估机构复现。“88.8 对 84.0”并不是一场公平的较量,因为其中一个数字经过审计,另一个只是厂商的说法。客观的总结是:Sol 领先一代,上限明显更高,但这两个模型中唯一有独立实验室验证的编程分数,属于那个更便宜、更老的专业模型。

还有一个{{1}}OpenAI自己都质疑的{{/1}}基准测试。在SWE-Bench Pro上,GPT-5.6 Sol得分64.6%,而Claude Fable 5以80%领先——而且{{2}}OpenAI已公开质疑该基准测试的有效性{{/2}}。在那个基准测试上,值得关注的不是分数,而是一家头部厂商如今把自己的低分归咎于基准测试这一事实。对于编程团队来说,这是一个提醒:在相信任何排行榜({{3}}包括我们的{{/3}})之前,先在你自己的代码库上测试模型。
速度:交通警示
在OrcaRouter的七天遥测数据中,GPT-5.6 Sol在3900万token流量上显示出3.82秒的中位首Token延迟,以及每秒约465个输出Token。GPT-5 Codex的页面仍在“收集”遥测数据——其通过路由器的流量太稀薄,目前还没有可平均的内容。这种稀薄流量本身就是信息:在市场眼中,编码智能体API的工作已经转移到了更新的模型上。这并不意味着GPT-5 Codex缓慢或故障;而是意味着“哪个更快”在有人通过它运行真实流量之前,无法从路由数据中得到答案。
你应该选哪个?
如果……,请选择 GPT-5 Codex
你的工作负载确实是编码形态的:你运行一个智能体来编辑代码、审查拉取请求、重构、编写测试,并在 IDE 或 CLI 环境中工作。你想要专家的专注力、仅需四分之一成本的输入,以及这场对决中唯一经过独立验证的编码评分。如果你想要 OpenAI 的智能体编码器语义——推理强度调节旋钮、工具使用循环——而不必为用不到的通用能力支付旗舰价格,GPT-5 Codex 同样是不二之选。
选择 GPT-5.6 Sol 如果……
如果你的工作将编程与高难度通用推理、长时程智能体、计算机使用或大量文件输入相结合——或者你只是想要一个全能旗舰模型。105万上下文、多智能体超模式、更新的训练,以及ChatGPT和Codex产品集成都更偏向Sol。它的编程数据在纸面上更高,而且在一个供应商信赖的基准测试中,它是OpenAI发布过的最强编程智能体。你要为这种广度付出每token三到四倍的代价;而在Sol真正获胜的任务上,token效率方面的优势缩小了差距。
答案通常是两者兼而有之——按任务路由
由于两者在 OrcaRouter 上均以 0% 加价上线,最强配置根本无需二选一。把编码类流量指向 GPT-5 Codex——这款定价 $1.25 / $10 的专家模型——仅将需要旗舰级广度的任务升级到定价 $5 / $30 的 GPT-5.6 Sol。一个 API 密钥、一个兼容 OpenAI 的端点、路由时的一次模型名更改,以及某个供应商出现故障时段时的自动故障转移。这种转售机制在这里有一个特别的意义:你预算中的 $1.25 / $10 和 $5 / $30 正是供应商的标价,因此未来 OpenAI 的降价会在宣布当天就在我们的端点上生效,而你的路由逻辑无需更改。

这引发的问题
GPT-5.6 Sol 是否取代了 GPT-5 Codex?
在产品中,是的——独立的 Codex 应用在 5.6 发布时已合并进 ChatGPT,Sol 就是其中运行编码智能体模式的引擎。在 API 中,不是:GPT-5 Codex 仍然是一个活跃的、有自身定价的服务模型,许多智能体流水线依旧运行它,因为它专为此而构建且成本低廉。
Sol 的编程真的比 Codex 的更好吗?
关于 OpenAI 发布的数据,是的——Terminal-Bench 2.1 为 88.8,而 Codex 的 LiveCodeBench 为 84.0——但这些是不同的基准,而且 Sol 的数字是供应商报告的,而 Codex 的数字是独立测量的。在你自己的仓库上测试;那才是唯一算数的分数。
为什么还有人会运行 GPT-5 Codex?
价格与适配性。以Sol输入价格的四分之一,一个专用的编码代理流水线无需通用旗舰产品的广度,每百万个令牌就能省下实实在在的费用,而且专业模型的专注意味着更少的提示词调整即可让它专注于编码工作。
这场对决之所以值得思考,是因为OpenAI把答案内置到了自家产品中。该公司花了一年时间销售一款编程专家模型,然后将其并入一个通用旗舰模型——后者在编程方面足以摘取专家模型的桂冠——同时让专家模型仍以远低于旗舰的价格留在API上。这不是花招;而是“我们想要编程代理,但不想为旗舰付费”的价格底线。GPT-5 Codex是便宜、专注、经过独立测量的专家模型。GPT-5.6 Sol是更新、更广泛、更昂贵的旗舰模型,其编程能力声称应由你在自己的工作上验证。大多数生产团队会发现诚实的答案是两者兼用——而且既然两者都在同一个直通端点上,它们之间的路由就是一种配置,而不是一次迁移。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
