一张生成的 hero 卡片,标题为“GPT-6 Sol 对阵 DeepSeek V4 Pro”,主标题为“12 个指数点”,两行文字分别对比“闭源 API 每 100 万为 $2.00/$10.00”与“MIT 开源权重每 100 万为 $1.32/$3.96”,右下角为 OrcaRouter 标志。
Guides & Insights

GPT-6 Sol 对比 DeepSeek V4 Pro:四倍价格换来十二点指数差距

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这是没人会放到发布页上的那笔账。DeepSeek V4 Pro 在 Artificial Analysis 的 Intelligence Index 上得分 36。GPT-6 Sol 得分 48。GPT-6 Sol 每百万输入 token 收费 2.00 美元,每百万输出 token 收费 10.00 美元。DeepSeek V4 Pro 在同一榜单上的价格是 1.32 美元和 3.96 美元——而其自己公布的价目表换算后,大约是 0.42 美元和 0.87 美元。因此,GPT-6 Sol 与 DeepSeek V4 Pro 之间 12 分的差距,是用大约 1.5 到 4 倍的价格买来的,具体取决于你看的是谁的价目表;而更便宜的那一方,才是你能自己下载并运行的模型。

这就是整个决策,而且它确实比记分牌所显示的更接近。DeepSeek V4 Pro 于 2026 年 8 月 13 日发布,是一个 MIT 许可的专家混合模型,总参数 1.6 万亿,每个 token 激活 490 亿。GPT-6 Sol 于 2026 年 9 月 22 日发布,是一个闭源权重的前沿模型,价格是其自身前代的一半。一个是你可以自行托管的商品化产品;另一个是你租用的能力。两者都具备百万 token 上下文窗口。两者都是推理模型。显然,两者都不是错误的购买选择。

决定这件事的数字

先从两家厂商都认同的一点说起:上下文。DeepSeek V4 Pro 拥有 100 万 token 的上下文窗口,最大输出为 38.4 万。GPT-6 Sol 被 Artificial Analysis 列为 87.2 万 token,上限为 105 万,而 OpenAI 其他材料中给出的输出上限为 12.8 万。DeepSeek 给你的输出空间是前者的三倍,输入窗口也与之相当。

而它们中只有一个才有的东西:长上下文重新定价的断崖。GPT-6 Sol 的 2 美元/10 美元在输入 token 低于 272,000 时保持不变。一旦超过这一线,整个请求都会重新定价——输入价格大约翻倍至 4 美元,输出价格则上涨一半至约 15 美元。DeepSeek V4 Pro 没有对应的阶梯;其公布的价格在整个窗口内均适用,并于 8 月 17 日引入了高峰与非高峰时段定价,价格随一天中的时段变化,而非随上下文长度变化。

把这些放在一起看,这种对比在高用量端就反过来了。一个承载 400K token 上下文的 DeepSeek V4 Pro 请求,按其正常费率计费。同样的请求放到 GPT-6 Sol 上,成本大约是标价的两倍。如果你本身的工作负载就是长上下文型的——文档分析、大型代码仓库智能体、长转录文本推理——那么这两个模型之间的实际价格差距,远比 $2 对 $1.32 所暗示的要大得多。

A generated two-column scoreboard titled 'GPT-6 Sol vs DeepSeek V4 Pro — the scoreboard'. Left column GPT-6 Sol: Price $2.00/$10.00, AA Index 48, Weights 'closed', Max output 128K, Terminal-Bench 2.1 'n/a', Context 872K. Right column DeepSeek V4 Pro: Price $1.32/$3.96, AA Index 36, Weights 'MIT', Max output 384K, Terminal-Bench 2.1 87.9, Context 1M. Footer: 'DeepSeek figures per DeepSeek and Artificial Analysis.'

DeepSeek V4 Pro 真正具备竞争力的地方

DeepSeek 的智能体与编程结果并不是预算上的妥协。就厂商公布的数据而言:

• Terminal-Bench 2.1 — DeepSeek V4 Pro 87.9

• Toolathlon-Verified — DeepSeek V4 Pro 74.1

• DeepSWE — DeepSeek V4 Pro 62.7

• SWE-bench Verified — DeepSeek V4 Pro 80.6

• AA Intelligence Index — DeepSeek V4 Pro 36,在 114 个被测模型中排名第 8

• 输出速度 — DeepSeek V4 Pro 67.8 tokens/秒

• 许可证 — MIT,开放权重,可自托管

Index 排名值得再看一眼。三十六分让 DeepSeek V4 Pro 在榜单 114 个模型中位列第八,对于一个权重可下载、采用 MIT 许可的模型来说,这是相当靠前的位置。与 GPT-6 Sol 的差距是真实存在的,但那是"非常优秀"与"前沿"之间的差距,而不是"能用"与"不能用"之间的差距。

MIT 许可证是 GPT-6 Sol 没有对应项的那部分。如果你的约束条件是数据驻留、气隙部署、在高利用率下趋近于零的每 token 成本,或者只是不想让供应商的弃用变成一次迁移事件,那么 DeepSeek V4 Pro 是这两者中唯一能回答这个问题的。GPT-6 Sol 仅提供 API,并且将一直如此。

GPT-6 Sol 在哪里拉开差距

12 个 Index 分在榜单这一端是很大的差距。GPT-6 Sol 在 212 个被测模型中排名第 18,而 DeepSeek 在 114 个中排名第 8;它凭借一组厂商发布、DeepSeek 未提出异议的 agentic 结果达到这一位置:

• AutomationBench — GPT-6 Sol 33.2%,每项任务 $0.27

• 智能体最后考试 — GPT-6 Sol 56.4%

• DeepSWE v1.1 — GPT-6 Sol 68.8%

• OSWorld 2.0 — GPT-6 Sol 60.5%

• 输出速度 — GPT-6 Sol 104.4 tokens/秒,而 DeepSeek V4 Pro 为 67.8

那些是由厂商报告的,而且 OpenAI 运行了自己的评测框架,所以应把它们视为声明,而非测量结果。有两点注意事项值得继续留意。OpenAI 在若干行中使用了已发布的竞争对手分数,而不是重新运行竞争对手的模型;并且其 Agents' Last Exam 图表中 Claude Fable 5.1 的数据点排除了在约 40% 任务上触发的 Opus 5 回退。这两个注意事项都没有直接涉及 DeepSeek 对比,但它们是应对整张表持保留态度的原因。

独立评测比两家厂商的说法都更为审慎。Artificial Analysis 发现,GPT-6 Sol 相较 GPT-5.6 Sol 把每项任务的成本大约减半,同时也带来了一批提升与退步——其中包括在 GDPval-AA v2.1 上的退步。一个以牺牲部分能力换取大幅成本降低的模型,改变的是你负担得起运行什么,而不是把各处的上限都抬高。

GPT-6 Sol 的延迟表现确实是一个实打实的负担。其首 token 时间为 107.18 秒,而榜单中位数是 3.87 秒。这是整个榜单上最慢的首 token,且差距悬殊。DeepSeek V4 Pro 也不是一款快速模型,但它并未达到那种程度,而对于任何交互式界面来说,这种差距只会单向地构成淘汰理由。

开放权重对比租用的前沿

在这个维度上,两个模型并不是真正在竞争。DeepSeek V4 Pro 是一个 1.6T 参数的 MoE,激活参数为 49B,采用 MIT 许可,可下载。这意味着固定成本在规模化时会摊销到几乎为零,部署由你掌控,模型不会在你脚下被弃用。这也意味着你要自己负责服务栈、GPU 账单,以及每一次性能回退。

GPT-6 Sol 是相反的取舍。你永远按 token 付费,无需拥有硬件即可获得前沿能力,而 OpenAI 只需发一篇博客就能改变价格、费率表或可用性——就像它在 9 月 22 日将自己旗舰产品的价格减半那样。你无法锁定任何版本的 GPT-6 Sol。

正确的思考方式不是“哪个更好”,而是“你更愿意承担哪种风险”。供应商风险与运营风险的对立。对于一家没有基础设施团队且流量波动大的初创公司来说,API 显然是正确的选择。对于拥有现有 GPU 容量、合规边界,或工作负载规模使得按 token 定价变得荒谬的组织来说,开放权重仅在经济性上就胜出,而十二个 Index 点数是值得付出的代价。

如果你想不再做出选择

有一种决策版本无需做出承诺。 DeepSeek V4 Pro 已在 OrcaRouter 上按 DeepSeek 的标价提供,采用直通模式,这意味着 DeepSeek 的价格变动——包括高峰和非高峰时段安排——会在我们这边当天得到反映,而不是等到经销商重新谈判之后。截至本文撰写时,GPT-6 Sol 不在我们的目录中;它可通过 OpenAI 自己的 API 访问,因此一条同时覆盖两者的路线意味着 DeepSeek V4 Pro 用一个密钥,而 OpenAI 则采用直接集成。

这种拆分之所以值得,有一个具体原因:这两种模型的失效方式各不相同。开放权重的部署会在你的硬件故障时失效;而 API 则在供应商出问题时失效。跨供应商的自动故障转移,能把它们变成性能下降的一个下午,而不是一次服务中断,而只需修改配置而非代码路径,就能在廉价高吞吐量的模型与昂贵而谨慎的模型之间切换路由——正是这一点让你能够跟随价格曲线,而不是押注于它。

A screenshot of the Artificial Analysis page for GPT-6 Sol (max), showing an Intelligence rank of 18th of 212 models, a Cost rank of 49th and a Verbosity rank of 43rd, input pricing of $2.00 and output of $10.00 per 1M tokens with a 90% cache discount, a cost per Intelligence Index task of $1.06, an 872k-token context window, 77M tokens generated during the index run, and a total of $1,550.08 spent evaluating the model on the Intelligence Index.

谁应该选择哪个

如果你有基础设施、有合规边界,或者面临规模问题,那就选 DeepSeek V4 Pro。它采用 MIT 许可证,在独立榜单的 114 个模型中位列第八,拥有 384K 的输出空间,而且其价目表不存在上下文断崖。对于约束条件是规模化成本或部署控制权的人来说,它就是正确答案,而与 GPT-6 Sol 之间十二个百分点的差距,正是为此付出的代价。

如果你需要前沿能力,且上下文保持在 272K token 以内,就选 GPT-6 Sol。它的得分是 48 比 36,生成 token 的速度快约 50%,而在 $2/$10 的定价下,它是 OpenAI 有史以来最便宜的顶级模型。只是要清楚你买到的是什么:首个 token 要等上一百秒,长上下文档位费率翻倍,而且独立评估显示这款模型是进步与退步并存,而非一次干净的跃升。

而如果答案是"两者皆可,取决于具体请求",那并不是优柔寡断。对于一个两家厂商在六周内相继将各自旗舰价格腰斩、且至今仍在继续下调的市场而言,这才是正确的架构。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the Tools, JSON and Reasoning badges, a 1M-token context with 384K maximum output and text-only input, a 3.56s p50 time to first token, and the description of DeepSeek V4 Pro as a flagship MoE with 1.6T total / 49B active parameters built for top-tier reasoning and agentic tool use.

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新