生成的主视觉标题卡标题为「GPT-6 Luna vs DeepSeek V4 Pro」,副标题为「指数仅差一分。价格却是五倍。其中一个是你可以下载的文件。」,标签显示 Luna 为每 1M $0.10/$0.50,采用闭源权重,V4 Pro 在非高峰时段为 $0.66/$1.98,以 MIT 许可证发布,并且在最大努力下指数得分为 37 对 36,右下角带有 OrcaRouter 标志。
Guides & Insights

GPT-6 Luna 对比 DeepSeek V4 Pro:一个指数点,五倍的价格,以及拥有自己权重的理由

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

下面这个数字本应决定这场对决,却没有:GPT-6 Luna在最高努力水平下,于 Artificial Analysis Intelligence Index 上得分 37。DeepSeek V4 Pro在同一版指数上、同样在最高努力水平下得分 36。两者仅相差一分,而在这样一个综合评分中,一分之差完全落在一次重跑的噪声范围内——而这两款模型的价格却相差约五倍。GPT-6 Luna 标价为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。DeepSeek V4 Pro 0813 在非高峰时段标价为 0.66 美元和 1.98 美元,在其高峰时段则翻倍至 1.32 美元和 3.96 美元。

如果这就是故事的全部,那这篇文章只需一段就能写完,并且会以“使用 GPT-6 Luna”收尾。可事实并非如此,原因就在于一个会让比较彻底反转的维度:DeepSeek V4 Pro 的权重是开放的,而且采用 MIT 许可证。每 token 成本高出五倍的那个模型,才是你被允许下载、修改、微调,并永远在自己的硬件上运行的模型。这并不是价格论证中的一个脚注——对某一类特定买家而言,它就是全部论证;而 9 月 22 日 GPT-6 Luna 的发布让这一点变得更加尖锐,而不是就此了结。

发布了什么,以及何时发布

GPT-6 Luna 是 OpenAI 的小型层级,于 2026 年 9 月 22 日发布,与定价 $2.00/$10.00 的 GPT-6 Sol 一同推出,定位低于定价 $10.00/$50.00 的旗舰级 GPT-6 Astra。OpenAI 将其描述为公司用于专注型、高吞吐量任务的最高效模型。它拥有 1,050,000 token 的上下文窗口,最大输入为 922,000,输出上限为 128,000 token,接受文本和图像,并提供从 none 到 low、medium、high、xhigh 和 max 的推理强度——默认为 medium。

DeepSeek V4 Pro 0813 是 DeepSeek 旗舰级第四代模型的 GA 版本,于 2026 年 8 月 13 日发布,在同一 deepseek-v4-pro 标识符下取代了 4 月的预览版。它是一个纯文本的混合专家模型,总参数量 1.6 万亿、激活参数 490 亿,上下文窗口为 100 万 token,输出上限高达 384,000 token,相当宽裕——是 GPT-6 Luna 的三倍。权重在 API 上线大约半天后以 deepseek-ai/DeepSeek-V4-Pro-0813 之名发布到 Hugging Face:66 个 fp8 分片,无需申请,MIT 许可。我们自己的模型目录页面仍标注着 4 月预览版的日期,而非 8 月的 GA 日期——如果你是从产品页面而非发布说明上读取日期,这一点值得留意。

两者都以推理为先,且都具备长上下文能力。但其中只有一个,是你能够实实在在拿在手里的文件。

说实话,那些费率卡

每个维度一行,每行均包含两侧:

• 每 1M 输入 — GPT-6 Luna $0.10 对比 DeepSeek V4 Pro 非高峰 $0.66 / 高峰 $1.32

• 每 1M 输出 — GPT-6 Luna $0.50,对比 DeepSeek V4 Pro 非高峰 $1.98 / 高峰 $3.96

• 缓存输入 — GPT-6 Luna 每 1M 为 $0.01,相较其自身费率折扣 90%,而 DeepSeek V4 Pro 的缓存折扣为 97%,折扣百分比更深,但基于更高的基准

• 高峰窗口 — GPT-6 Luna 无,全天平稳,而 DeepSeek V4 Pro 在 UTC 01:00-04:00 和 06:00-10:00 之间翻倍

• 长上下文条款——GPT-6 Luna 将输入和缓存翻倍,并在输入超过 272K 时将输出提升 1.5 倍,适用于整个请求;相比之下,DeepSeek V4 Pro 的定价卡上未公布长上下文附加费

• 上下文与输出 — GPT-6 Luna 1,050,000 输入 / 128,000 输出 对比 DeepSeek V4 Pro 1,048,576 输入 / 384,000 输出

• AA 智能指数 — GPT-6 Luna 37(最高推理强度)对比 DeepSeek V4 Pro 36(最高推理强度),同一指数修订版本

• 默认投入程度得分——GPT-6 Luna 在中等档位下为 29,对比 DeepSeek V4 Pro 在其最高设置下为 36,即 Artificial Analysis 所测量的投入程度

• 推理关闭开关 —— GPT-6 Luna 从 none 到 max,而 DeepSeek V4 Pro 仅有 low、high 和 max

• 运行索引的成本 — GPT-6 Luna $122.39 对比 DeepSeek V4 Pro $1,122.27

• 权重 —— GPT-6 Luna 闭源,仅提供 API;DeepSeek V4 Pro 则开源,MIT 许可,可自行部署

• 在 OrcaRouter 上 —— GPT-6 Luna 不在我们的目录中,而 DeepSeek V4 Pro 可按 DeepSeek 的标价路由

A generated single-panel scoreboard card headed 'One index point, five times the price' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; DeepSeek V4 Pro $0.66 in / $1.98 out per 1M off-peak doubling at peak with index 36 at max effort; maximum output Luna 128K tokens against V4 Pro's 384K; long context, Luna doubling its rates above 272K input against V4 Pro carrying no published surcharge clause; weights, Luna closed and API-only against V4 Pro open and MIT licensed; and reasoning off switch, Luna none through max against V4 Pro's low, high and max only. Footer: 'Index figures per Artificial Analysis; prices per OpenAI and DeepSeek.'

把这些行放在一起读,格局就显得很不寻常:闭源模型在除缓存输入之外的每一项按 token 计费上都更便宜,而开源模型则在输出长度、长上下文表现,以及那唯一完全无法按 token 定价的东西上占优。

为什么一分之差不是重点

综合指数上的一分之差,并不是一种你可以据此采取行动的能力差异,而且值得直说:这是文章里最没意思的一个数字。不过,关于它,有两点确实重要。

第一点是,指数修订会发生变化。同一次评测更早的快照显示,DeepSeek V4 Pro 的最大努力得分显著高于我们今天抓取所显示的 36,而 GPT-6 Astra 的数值在一个月内发布的材料中则在 52.8、53 和 54.7 之间漂移。任何依赖滚动指数上两个模型之间精确差距的比较,依赖的都是不会保持稳定的东西。诚实的解读是,这两个模型在各自能力上限上处于同一能力区间,而该指数无法告诉你哪一个更适合你的任务。

第二点是 effort 默认值,而这里的差距是真实存在的。GPT-6 Luna 的 37 是最高 effort 数值。它的默认值是 medium,在该设置下得分为 29。DeepSeek V4 Pro 的 36 也是其最高 effort 数值,而且这也是 Artificial Analysis 测试它时所用的设置。一个部署了 GPT-6 Luna 却什么都不改的团队,实际是在用 29 对 36——一个方向错误的七分差距,也正是那种在生产复盘里会表现为“便宜模型更差”的情况,而真正的问题其实是一个默认值。

开放权重究竟价值几何

价格比较到这里就不再是算术,而变成了一个关于你业务的问题。MIT 许可的权重能为你换来四样东西,而每一样都带着一个永远不会出现在价目表上的价签。

第一点是成本底线。按 token 计费是一种租赁;权重则是资产。如果你的用量大到足以让固定的 GPU 占用成本优于按量计费的账单,那么这两款模型中只有 DeepSeek V4 Pro 才真正提供这种选项。以 GPT-6 Luna 的费率来算,那个盈亏平衡点还很遥远——一美分每百万 token 的缓存输入价格,用租来的算力确实很难打败——但"遥远"和"不可能"是两回事,而且这是一扇单向门:你随时可以从自托管转向 API,却无法反向而行。

第二点是独立于厂商的路线图。GPT-5.6 Luna 的促销价格带有明确的到期时间。GPT-6 Luna 的价格据 OpenAI 说是永久的——但所谓永久,不过是关于某个模型的承诺,而厂商只要推出后继产品,随时都能把它退役。而你自己托管的模型,不可能被人从脚下撤走。对于任何经历过闭源模型强制迁移的人来说,这一点的价值远超 token 成本上的五倍差价。

第三点是数据。如果提示词包含无法离开你的基础设施的内容,那么比较就到此为止,GPT-6 Luna 的成本是多少都无关紧要。

第四点是你可以对它进行微调。GPT-6 Luna 完全无法用于微调——它只有 Chat Completions、Responses 和 Batch,这就是全部。DeepSeek V4 Pro 的权重可以在你自己的数据分布上进行训练,而对于狭窄的高吞吐量任务来说,这往往比任何通用基准分数带来的收益都更大。

与这一切相比,GPT-6 Luna 的理由是:在非高峰时段、按 3:1 的输入输出混合比例计算,它大约便宜五倍,而在 DeepSeek 的高峰时段则接近便宜十倍;其缓存输入费率仅为其本已低廉的输入费率的十分之一;可以要求它完全停止推理;而且它的标价不会一天翻倍两次。对于没有数据驻留限制、没有微调需求、也不愿自行运营推理基础设施的工作负载来说,这是一个直截了当的答案。

迁移规模比价格差距所暗示的要小

在这两者之间切换,与其说是移植,不如说更接近一次配置变更。两者都采用 OpenAI 兼容的聊天补全格式,都具备 1M 级别的上下文窗口,而且出现的故障模式都在意料之中,而非结构性的。

其中有两点值得在你迁移流量之前先标出来。GPT-6 Luna 的长上下文条款就是代价高昂的那一个:一旦跨过 272,000 个输入 token,整个请求就会重新计价为双倍输入与缓存,以及 1.5 倍输出,因此一次 300,000 token 的调用,其成本是同一调用拆成两次时的两倍。DeepSeek V4 Pro 没有这类条款,这意味着对于真正巨大的单次请求,五倍的价格差距并没有看起来那么大,而且在高峰时段调用时还可能反转。而输出上限是硬性约束,而非偏好设置:128,000 token 对 384,000。一条生成长结构化产物的流水线可能根本放不进 GPT-6 Luna,而再大的价格优势也无法弥补这一点。

DeepSeek V4 Pro 已上线 OrcaRouter,价格为 DeepSeek 的标价,并采用透传定价,供应商费率若有变动,我们当天即同步——对于一款费率本就随高峰与非高峰时段浮动的模型而言,这一点尤为重要。截至本文撰写时,GPT-6 Luna 尚未进入我们的目录,需通过 OpenAI 自有 API 访问;因此,若团队想同时使用两者,只需一个用于 DeepSeek V4 Pro 的密钥,再加上其原本用于 OpenAI 的密钥即可。在这样的组合中,自动故障转移正是体现其价值的一环:自托管或第三方的 DeepSeek 端点出现性能下降,正是你希望路由无需部署即可切换的场景。

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

谁应该选哪个

如果以下任一情况属实,请选择 DeepSeek V4 Pro。提示词不能离开你的基础设施。你需要进行微调。你生成的输出超过 128,000 个 token。你的请求通常会超过 272,000 个输入 token。或者你的用量足够大,以至于你宁愿购买 GPU 也不愿租用 token,并且你希望以后能够进行这种切换而无需重写应用程序。

如果以上都不适用,而你的工作负载是高吞吐量、由程序消费且短小,那就选 GPT-6 Luna。分类、抽取、路由、批量摘要、智能体的内层循环。以 $0.10/$0.50 的价格,加上 1 美分的缓存输入费率和 Batch 半价,这笔账毫无悬念;而且在最大 effort 下 1 个点的指数差异不会在你的评测中显现。用 medium 档运行它,对照你自己的测试而非厂商图表,检查 Coding Agent Index 上那 2 个点的回退,并让你的长调用保持在 272,000-token 这条线的正确一侧。

要避免的错误,是把五倍的价格差距当作答案。它只是一个问题的答案——一个 Token 要花多少钱——而对决定你两年后是否还能运行这一工作负载的四个问题,它却只字不提。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the Tools, JSON and Reasoning badges, list pricing of $0.66 input and $1.98 output per 1M tokens, a p50 time to first token of 3.56s, 4033.0M tokens of traffic, and the description of the model as DeepSeek's flagship text-generation model processing up to 1,048,576 tokens of context and generating up to 384,000 tokens of output.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新