
GPT-6 与 DeepSeek V4 Pro:一个你能从任何人那里租用,一个你能带回家
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
只有一件事你可以用 DeepSeek V4 Pro 做,而用 GPT-6 Sol 做不到:把它带回家。DeepSeek V4 Pro 是一款 MIT 许可的专家混合旗舰模型——总参数 1.6 万亿,每个 token 激活 490 亿——于 2026 年 8 月 13 日发布,且其检查点可供下载。GPT-6 Sol 是闭源权重,由 OpenAI 于 2026 年 9 月 22 日推出,并且截至 2026 年 10 月 7 日,它也是 ChatGPT 全球推广中付费层级背后的模型,该推广覆盖超过 12 亿周活跃用户。
这个比较中其余的一切都取决于你看的是哪一把尺子。在价目表上,两者相差四倍。在独立测试套件上产出一个完整答案的实际成本上,两者相差 1.55×。在 Intelligence Index 上,这两行看起来相差十六个点,而按照评估者自己记录在案的方法论,它们根本不能相减。厘清这三个数字中哪一个应当用来指导决策,就是全部工作,而答案会因你是在选择供应商还是选择文件而不同。
每个模型分别是什么,各用一段话说明
GPT-6 Sol 是 OpenAI GPT-6 系列中的中端层级——位于旗舰 GPT-6 Astra 之下、经济型 GPT-6 Luna 之上——拥有 1,050,000 token 的上下文窗口、128,000 token 的输出上限,支持文本、图像和文件输入、原生工具调用、结构化输出,以及可在从低到最高五个级别中选择的推理强度。它是 OpenAI 将 ChatGPT Plus、Pro、Business 和 Enterprise 用户路由到的层级,定价为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元;当提示词超过 272,000 个输入 token 时,长上下文层级会将整个请求重新定价为 4.00 美元和 15.00 美元。
DeepSeek V4 Pro 是一款纯文本旗舰模型,拥有 1,048,576 token 的窗口和 384,000 token 的最大输出量——是 GPT-6 Sol 上限的三倍——并且无论哪个价位都不提供视觉能力。DeepSeek 自家的 API 文档标明,其高峰期价格为每百万输入 token 0.66 美元、每百万输出 token 1.98 美元,非高峰期减半至 0.33 美元和 0.99 美元,缓存命中的非高峰价为 0.022 美元。高峰时段为工作日的 UTC 01:00–04:00 和 06:00–10:00;其余时间,包括周末和中国法定节假日,均属非高峰时段。
这三米
从被引用最多的那个说起,因为它最常被人脱离上下文地引用。Artificial Analysis 在 Intelligence Index v4.3.2 上给 DeepSeek V4 Pro 打出 36.0 分,给 GPT-6 Sol 打出 47.6 分。十一点五分的差距,足以让一场比较就此终结。
它不应该,而且评估方自己也这么说。Artificial Analysis 只将开放权重模型与同一规模档位内的其他开放权重模型比较,分界线是 1500 亿参数;而专有模型则按 3:1 的输入输出混合比例,在某个价格区间内比较。这是两个不同的参照组,产生的是两套不同的评分尺度。同一个表格里相邻两行中的 36 和 47.6 并不是一对一对比,诚实的做法是说明这一点,而不是把两者相减,然后称之为能力。

这两个可比较的仪表给出了更有用的信息:
• 3:1 混合价格——GPT-6 Sol 每 1M 为 $4.00,而 DeepSeek V4 Pro 在高峰费率为 $0.99,非高峰为 $0.50;具体取决于你在何时运行,差距为 4× 到 8×
• 每个已完成索引任务的成本——GPT-6 Sol $1.04,而 DeepSeek V4 Pro $0.67;差距为 1.55×
• 整套测试中生成的输出 token——GPT-6 Sol 76.8M,而 DeepSeek V4 Pro 162.9M,因此这个便宜模型为完成相同工作写出的量是 2.1×
• 最大输出——DeepSeek V4 Pro 384,000 tokens,而 GPT-6 Sol 128,000;上限为 3×
• 多模态输入——GPT-6 Sol 接受文本、图像和文件,而 DeepSeek V4 Pro 仅支持文本
• 权重——DeepSeek V4 Pro 采用 MIT 许可并可下载,而 GPT-6 Sol 为闭源

第四行和第五行解释了第二行。4倍的名义差距在实际工作中缩小到1.55倍,这正是当更便宜的模型同时也是更啰嗦的那个时会发生的情况:在同一评估集上,DeepSeek V4 Pro 输出的 token 数是 GPT-6 Sol 的 2.1 倍。冗长程度是一种永远不会出现在价格页面上的成本乘数,也是这场对比中最被忽视的数字。
开放模型真正胜出之处
有两处,而且两者都是结构性的,而非边缘性的。
输出上限是首要的。384,000 tokens 对 128,000,是三倍差距,它决定着整类整类的工作:在一次调用中生成大型结构化产物、无需串联地撰写长文档、以单一响应完成大规模重构。GPT-6 Sol 无论花多少钱都做不到这些,因为该限制不是计费层级——而是模型的最高上限。
在某一项具体测量上,智能体工具使用排在第二位。DeepSeek V4 Pro 在 τ²-Bench——智能体工具使用评测——上得分 96.2%,这也是 DeepSeek 在自己的宣传卡上主推的数字。它同样是该模型的 OrcaRouter 目录条目中重复出现的数字,而这正是我们自己的读者会看到的说法版本。GPT-6 Sol 在 τ²-Bench 上的可比数字并未公布在同一榜单上,因此应把这一比较视为方向性的:在 DeepSeek 选择作为头条的那一项基准上,开源模型位居该领域榜首,而闭源模型尚未在同一栏中给出数字。
还有“所有权”这一项,它根本算不上什么基准测试。可下载的 MIT 检查点意味着你可以在自己的硬件上运行模型,让请求不经过任何人的网络,对它进行微调,锁定某个版本,并且知道三年后它依然还在。没有厂商能让它停止支持、重新定价,或把它从价目表上撤下。对某一类买家——受监管行业、任何受数据驻留限制的人、任何曾被模型退役坑过的人——这比十一个指数点更值钱。
GPT-6 Sol 胜在何处,而这不仅仅是指数
Terminal-Bench 4.0 是 DeepSeek V4 Pro 成绩单上最不好看的一行:14.1%,而 GPT-6 Sol 是 43.9%。这不是四舍五入的差异,它指向一个真实的特征画像——这个开放模型在多轮工具编排上很强,但在现代编码智能体赖以构成的长时间终端工作方面很弱。如果你的工作负载是一个必须让 shell 会话维持二十分钟的智能体,那么这一项单独的评估比指数综合得分更能预示你的实际体验。
多模态能力是第二点。DeepSeek V4 Pro 是文本输入、文本输出。GPT-6 Sol 能接收图像和文件,而这并不是一个功能选项上的勾选——文档密集型专业工作意味着截图、扫描页面、图表和 PDF,纯文本模型根本无法进入这一领域。
第三项是本周发生的事情。GPT-6 于 10 月 7 日在面向 Plus、Pro、Business 和 Enterprise 的 ChatGPT Chat 标签页上线,Free 和 Go 则从 10 月 8 日起跟进;它带来了一项 OpenAI 称为 Intelligent UI 的能力——这种回答会针对每个问题组合文本、图形、图表、表单和可点击控件,而不是默认用文字段落作答。这是界面层面的能力,而不是 API 功能,并且不会改动你集成代码中的任何一行。它真正改变的,是环境中的默认情况:你团队已在浏览器标签页中打开的那个模型现在就是 GPT-6,而原型开发工作会逐渐偏向无需密钥即可访问的模型。这些是厂商自行报告且尚未复现的说法;OpenAI 还声称,GPT-6 在 Extra High 档位下开始回答的速度与 GPT-5.6 在 Medium 档位下一样快,并且 GPT-6 Instant 在依托搜索的问题上开始回答的时间提前了 44%。
运行一个,还是两个都运行
这种特定组合之所以比大多数组合更容易对冲,原因在于这两个模型都位于同一份目录中。 OrcaRouter 将 GPT-6 Sol 和 DeepSeek V4 Pro——以及 200 多个其他模型——通过一个 OpenAI 兼容端点、一个密钥进行路由,在供应商标价基础上加价 0%。正是这种原样透传,使得高峰/非高峰结构清晰可解,而非神秘莫测:DeepSeek 的非高峰半价是供应商自己的,我们不予改动;而当供应商调价时,这里的变更当天即生效。
这也是高峰窗口决策转化为路由决策的地方。DeepSeek V4 Pro 的非高峰费率是其高峰费率的一半,而高峰窗口是固定的 UTC 时段。可以挪动的批处理任务值得围绕这些时段安排,而对延迟敏感的路径则值得避开它们。当两个模型共用一个密钥时,这种分流就成了一项配置,而不是第二份供应商合同:在非高峰时段将批量和长输出工作路由到 DeepSeek V4 Pro,将多模态和推理密集型流量路由到 GPT-6 Sol,并让自动故障转移应对任意一方的速率限制,而不是等到在生产环境中才发现它。

我实际会做的事
如果你需要图像、文件或前沿推理评分,而你要买的是 API,那么 GPT-6 Sol 就是答案,那 11 个指数点基本无关紧要——多模态这道门槛会在基准测试还没投票之前就先定下结论。如果你需要 384,000 token 的输出、可长期持有的许可证、本地部署,或榜单上最低的每完成一项任务成本,那么 DeepSeek V4 Pro 胜出,而指数差距是别人的同类比较。
我不会做的,是把 36 与 47.6 之间的差距解读为能力差距,并据此买入。而那些可比指标——每项任务 $0.67 对 $1.04,以及在 4× 的整体差距之下藏着的 2.1× 啰嗦程度差异——所讲述的情况比指数表里的那些行要接近得多,而且它们才是最终会出现在账单上的东西。
接下来值得关注的是,DeepSeek 是否会在 V4 Pro 的一次更新中弥合 Terminal-Bench 上的差距,因为这是唯一一项测量中,这个开放模型看起来是真正落后,而不是评分方式不同。至于 GPT-6,它已经不再是一个选择,而成了默认选项,而默认选项是很难被反驳的,即便基准测试显示并非如此。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
