主视觉标题卡写着“GPT-6 vs DeepSeek V4 Pro”,一张标签写着“GPT-6 登陆 ChatGPT,面向所有人 2026-10-07”,两行价格分别写着“GPT-6 Sol $2 / $10”和“DeepSeek V4 Pro $0.66 / $1.98 峰值”,一张标签写着“DeepSeek:MIT 权重,最大输出 384K”,页脚写着“厂商报告项目已在文中标注;指数数值依据 Artificial Analysis。”OrcaRouter 徽标合成于右下角。
Guides & Insights

GPT-6 与 DeepSeek V4 Pro:一个你能从任何人那里租用,一个你能带回家

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

只有一件事你可以用 DeepSeek V4 Pro 做,而用 GPT-6 Sol 做不到:把它带回家。DeepSeek V4 Pro 是一款 MIT 许可的专家混合旗舰模型——总参数 1.6 万亿,每个 token 激活 490 亿——于 2026 年 8 月 13 日发布,且其检查点可供下载。GPT-6 Sol 是闭源权重,由 Ope​nAI 于 2026 年 9 月 22 日推出,并且截至 2026 年 10 月 7 日,它也是 ChatGPT 全球推广中付费层级背后的模型,该推广覆盖超过 12 亿周活跃用户。

这个比较中其余的一切都取决于你看的是哪一把尺子。在价目表上,两者相差四倍。在独立测试套件上产出一个完整答案的实际成本上,两者相差 1.55×。在 Intelligence Index 上,这两行看起来相差十六个点,而按照评估者自己记录在案的方法论,它们根本不能相减。厘清这三个数字中哪一个应当用来指导决策,就是全部工作,而答案会因你是在选择供应商还是选择文件而不同。

每个模型分别是什么,各用一段话说明

GPT-6 Sol 是 OpenAI GPT-6 系列中的中端层级——位于旗舰 GPT-6 Astra 之下、经济型 GPT-6 Luna 之上——拥有 1,050,000 token 的上下文窗口、128,000 token 的输出上限,支持文本、图像和文件输入、原生工具调用、结构化输出,以及可在从低到最高五个级别中选择的推理强度。它是 OpenAI 将 ChatGPT Plus、Pro、Business 和 Enterprise 用户路由到的层级,定价为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元;当提示词超过 272,000 个输入 token 时,长上下文层级会将整个请求重新定价为 4.00 美元和 15.00 美元。

DeepSeek V4 Pro 是一款纯文本旗舰模型,拥有 1,048,576 token 的窗口和 384,000 token 的最大输出量——是 GPT-6 Sol 上限的三倍——并且无论哪个价位都不提供视觉能力。Deep​Seek 自家的 API 文档标明,其高峰期价格为每百万输入 token 0.66 美元、每百万输出 token 1.98 美元,非高峰期减半至 0.33 美元和 0.99 美元,缓存命中的非高峰价为 0.022 美元。高峰时段为工作日的 UTC 01:00–04:00 和 06:00–10:00;其余时间,包括周末和中国法定节假日,均属非高峰时段。

这三米

从被引用最多的那个说起,因为它最常被人脱离上下文地引用。Artificial Analysis 在 Intelligence Index v4.3.2 上给 DeepSeek V4 Pro 打出 36.0 分,给 GPT-6 Sol 打出 47.6 分。十一点五分的差距,足以让一场比较就此终结。

它不应该,而且评估方自己也这么说。Artificial Analysis 只将开放权重模型与同一规模档位内的其他开放权重模型比较,分界线是 1500 亿参数;而专有模型则按 3:1 的输入输出混合比例,在某个价格区间内比较。这是两个不同的参照组,产生的是两套不同的评分尺度。同一个表格里相邻两行中的 36 和 47.6 并不是一对一对比,诚实的做法是说明这一点,而不是把两者相减,然后称之为能力。

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

这两个可比较的仪表给出了更有用的信息:

• 3:1 混合价格——GPT-6 Sol 每 1M 为 $4.00,而 DeepSeek V4 Pro 在高峰费率为 $0.99,非高峰为 $0.50;具体取决于你在何时运行,差距为 4× 到 8×
• 每个已完成索引任务的成本——GPT-6 Sol $1.04,而 DeepSeek V4 Pro $0.67;差距为 1.55×
• 整套测试中生成的输出 token——GPT-6 Sol 76.8M,而 DeepSeek V4 Pro 162.9M,因此这个便宜模型为完成相同工作写出的量是 2.1×
• 最大输出——DeepSeek V4 Pro 384,000 tokens,而 GPT-6 Sol 128,000;上限为 3×
• 多模态输入——GPT-6 Sol 接受文本、图像和文件,而 DeepSeek V4 Pro 仅支持文本
• 权重——DeepSeek V4 Pro 采用 MIT 许可并可下载,而 GPT-6 Sol 为闭源

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

第四行和第五行解释了第二行。4倍的名义差距在实际工作中缩小到1.55倍,这正是当更便宜的模型同时也是更啰嗦的那个时会发生的情况:在同一评估集上,DeepSeek V4 Pro 输出的 token 数是 GPT-6 Sol 的 2.1 倍。冗长程度是一种永远不会出现在价格页面上的成本乘数,也是这场对比中最被忽视的数字。

开放模型真正胜出之处

有两处,而且两者都是结构性的,而非边缘性的。

输出上限是首要的。384,000 tokens 对 128,000,是三倍差距,它决定着整类整类的工作:在一次调用中生成大型结构化产物、无需串联地撰写长文档、以单一响应完成大规模重构。GPT-6 Sol 无论花多少钱都做不到这些,因为该限制不是计费层级——而是模型的最高上限。

在某一项具体测量上,智能体工具使用排在第二位。DeepSeek V4 Pro 在 τ²-Bench——智能体工具使用评测——上得分 96.2%,这也是 DeepSeek 在自己的宣传卡上主推的数字。它同样是该模型的 OrcaRouter 目录条目中重复出现的数字,而这正是我们自己的读者会看到的说法版本。GPT-6 Sol 在 τ²-Bench 上的可比数字并未公布在同一榜单上,因此应把这一比较视为方向性的:在 DeepSeek 选择作为头条的那一项基准上,开源模型位居该领域榜首,而闭源模型尚未在同一栏中给出数字。

还有“所有权”这一项,它根本算不上什么基准测试。可下载的 MIT 检查点意味着你可以在自己的硬件上运行模型,让请求不经过任何人的网络,对它进行微调,锁定某个版本,并且知道三年后它依然还在。没有厂商能让它停止支持、重新定价,或把它从价目表上撤下。对某一类买家——受监管行业、任何受数据驻留限制的人、任何曾被模型退役坑过的人——这比十一个指数点更值钱。

GPT-6 Sol 胜在何处,而这不仅仅是指数

Terminal-Bench 4.0 是 DeepSeek V4 Pro 成绩单上最不好看的一行:14.1%,而 GPT-6 Sol 是 43.9%。这不是四舍五入的差异,它指向一个真实的特征画像——这个开放模型在多轮工具编排上很强,但在现代编码智能体赖以构成的长时间终端工作方面很弱。如果你的工作负载是一个必须让 shell 会话维持二十分钟的智能体,那么这一项单独的评估比指数综合得分更能预示你的实际体验。

多模态能力是第二点。DeepSeek V4 Pro 是文本输入、文本输出。GPT-6 Sol 能接收图像和文件,而这并不是一个功能选项上的勾选——文档密集型专业工作意味着截图、扫描页面、图表和 PDF,纯文本模型根本无法进入这一领域。

第三项是本周发生的事情。GPT-6 于 10 月 7 日在面向 Plus、Pro、Business 和 Enterprise 的 ChatGPT Chat 标签页上线,Free 和 Go 则从 10 月 8 日起跟进;它带来了一项 OpenAI 称为 Intelligent UI 的能力——这种回答会针对每个问题组合文本、图形、图表、表单和可点击控件,而不是默认用文字段落作答。这是界面层面的能力,而不是 API 功能,并且不会改动你集成代码中的任何一行。它真正改变的,是环境中的默认情况:你团队已在浏览器标签页中打开的那个模型现在就是 GPT-6,而原型开发工作会逐渐偏向无需密钥即可访问的模型。这些是厂商自行报告且尚未复现的说法;OpenAI 还声称,GPT-6 在 Extra High 档位下开始回答的速度与 GPT-5.6 在 Medium 档位下一样快,并且 GPT-6 Instant 在依托搜索的问题上开始回答的时间提前了 44%。

运行一个,还是两个都运行

这种特定组合之所以比大多数组合更容易对冲,原因在于这两个模型都位于同一份目录中。 OrcaRouter 将 GPT-6 Sol 和 DeepSeek V4 Pro——以及 200 多个其他模型——通过一个 Ope​nAI 兼容端点、一个密钥进行路由,在供应商标价基础上加价 0%。正是这种原样透传,使得高峰/非高峰结构清晰可解,而非神秘莫测:Dee​pSeek 的非高峰半价是供应商自己的,我们不予改动;而当供应商调价时,这里的变更当天即生效。

这也是高峰窗口决策转化为路由决策的地方。DeepSeek V4 Pro 的非高峰费率是其高峰费率的一半,而高峰窗口是固定的 UTC 时段。可以挪动的批处理任务值得围绕这些时段安排,而对延迟敏感的路径则值得避开它们。当两个模型共用一个密钥时,这种分流就成了一项配置,而不是第二份供应商合同:在非高峰时段将批量和长输出工作路由到 DeepSeek V4 Pro,将多模态和推理密集型流量路由到 GPT-6 Sol,并让自动故障转移应对任意一方的速率限制,而不是等到在生产环境中才发现它。

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

我实际会做的事

如果你需要图像、文件或前沿推理评分,而你要买的是 API,那么 GPT-6 Sol 就是答案,那 11 个指数点基本无关紧要——多模态这道门槛会在基准测试还没投票之前就先定下结论。如果你需要 384,000 token 的输出、可长期持有的许可证、本地部署,或榜单上最低的每完成一项任务成本,那么 DeepSeek V4 Pro 胜出,而指数差距是别人的同类比较。

我不会做的,是把 36 与 47.6 之间的差距解读为能力差距,并据此买入。而那些可比指标——每项任务 $0.67 对 $1.04,以及在 4× 的整体差距之下藏着的 2.1× 啰嗦程度差异——所讲述的情况比指数表里的那些行要接近得多,而且它们才是最终会出现在账单上的东西。

接下来值得关注的是,DeepSeek 是否会在 V4 Pro 的一次更新中弥合 Terminal-Bench 上的差距,因为这是唯一一项测量中,这个开放模型看起来是真正落后,而不是评分方式不同。至于 GPT-6,它已经不再是一个选择,而成了默认选项,而默认选项是很难被反驳的,即便基准测试显示并非如此。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新