DeepSeek V4 Pro 发布日期:已经比 Kimi K3 便宜 14 倍,但还不够智能。
Guides & Insights

DeepSeek V4 Pro 发布日期:已经比 Kimi K3 便宜 14 倍,但还不够智能。

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年7月31日,该公司发布了一条变更日志条目,宣布其廉价模型已击败其昂贵模型。该条目是关于DeepSeek V4 Flash,即284B效率层级;其主要宣称是“智能体能力显著增强,基准测试结果远超V4-Pro-Preview。”V4-Pro-Preview就是DeepSeek V4 Pro——拥有1.6万亿参数的旗舰型号,每个token的成本是Flash的三倍。同一条目以一句话作结:“DeepSeek-V4-Pro的正式发布很快就会到来。”这正是目前流传预测的背景:当真正的V4 Pro降临时,它将是Kimi K3级别,但价格便宜十倍。其中一半已经可以衡量,而且它错在几乎无人预料的方向上。

关于这篇文章是什么、不是什么,先说明一下。这里没有泄露的 system card,没有内部基准,没有日期。流传的预测来自 X 上的 @scaling01 —— “DeepSeek-V4 Pro 应该会是个爆款,大概也是 Kimi-K3 级别,但便宜 10 倍” —— 这是位被广泛关注的行内人的预测,而不是任何有权限者的爆料。把它当作泄露来写,正是那些糟糕的发布日期报道的由来。我们能做到的,是把这句话中两个可验证的部分拆出来,对照已经存在的数字进行核查,因为预览构建已经开放调用三个月了,而且独立实验室对预览版和 Kimi K3 都跑过测试。以下所有内容都按来源标注:公司自己的文档、Artificial Analysis 的测量结果,或者我们自己完成并展示的推算。

DeepSeek 实际上说了什么,以及它没有说什么

已确认的范围比“未发布模型”的说法所暗示的要大。V4 Pro 并非空谈——你现在就可以调用它。尚未发生的是公司自身视为官方的发布。

架构 — 一个总参数量为1.6T、每个token激活49B参数的混合专家模型,已获公司确认,且在Artificial Analysis上同样标注为1600B/49B。

上下文和输出 — 一个 1M-token 的输入窗口(1,048,576),最多可输出 384K token。文本输入,文本输出;不支持图像、音频或视频输入。

许可证与权重 — MIT 许可证,权重发布在 Hugging Face 上。这是一款开放权重的旗舰模型,也正是与 Kimi K3 对比之所以有趣的原因所在。

标价 — 缓存未命中时每百万输入令牌0.435美元,缓存命中时0.003625美元,每百万输出令牌0.87美元,数据来自公司自己的定价页面。

接口——OpenAI 风格的 ChatCompletions 和 Anthropic 格式端点,以及推理努力级别、工具调用和结构化输出。

迄今时间线 — V4 系列于 2026 年 4 月 24 日以预览版形式推出;旧版 deepseek-chatdeepseek-reasoner 模型名称于 2026 年 7 月 24 日退役;Flash 于 2026 年 7 月 31 日获得正式版本;Pro 则没有。

2026年8月6日DeepSeek告知开发者,其计划“在不久的将来”提高DeepSeek API服务的整体定价,且预计涨幅显著,并重申官方V4 Pro版本将随后发布。目前尚未公布新的费率和生效日期。

而那些真正未知的部分,也就是人们搜索的大部分内容:

GA日期——仍未公布。公司正式承诺的全部内容仍然只是“即将公布”。未经证实的媒体报道指向8月中旬的发布窗口——一家媒体提出了8月10日至20日,一家经销商的定价页面于8月3日调整了V4 Pro缓存产品价格,这种模式在历史上通常先于发布出现——但这些都不是公司官方的表态。没有任何日期得到确认。

GA 构建将带来哪些变化——尚未说明。公司尚未说明官方 V4 Pro 是基于相同权重的重新后训练、全新的预训练,还是重新定价。

价格能否挺过去——这个问题尚未得到解答,而且我们下面会谈到一个对此担忧的具体理由。

有一个值得明确指出的更正,因为这个问题的搜索结果已被污染:你会看到一些页面声称 V4 系列已于 2026 年 7 月 20 日实现全面可用(GA)。事实上,在该日期十一天后,该公司自己的变更日志称 V4 Pro 的官方发布仍处于待定状态,并补充说 7 月 31 日的更新“仅升级了 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 以及 APP/WEB 模型均未改变”。当第三方总结与厂商的主要变更日志说法不一致时,以变更日志为准。

价格声明:“便宜10倍”是保守解读

Kimi K3 的标价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,缓存命中价为 0.30 美元。V4 Pro 的标价为每百万输入 0.435 美元、每百万输出 0.87 美元,缓存命中价为 0.003625 美元。把两者放在一起对比,“10x”只是区间的下限,而不是头条数字:

输入 tokens — $3.00 对比 $0.435,所以 V4 Pro 便宜 6.9 倍。这是该说法夸大其词的一个方面。

输出token — 15.00美元对比0.87美元,即便宜17.2倍。输出是推理模型的主要开销所在,因此这一数字最为重要。

70/30的输入输出混合 — 每百万6.60美元,对比0.5655美元,即11.7倍。

Artificial Analysis 的 7:2:1 缓存命中/输入/输出混合 —— 2.31 美元对比 0.18 美元,即 12.8 倍。

缓存输入 — $0.30 对比 $0.003625,大约 83 倍。该公司的缓存读取价格在 Artificial Analysis 追踪的 101 个模型中排名第 4,较其自身的缓存未命中率有 99% 的折扣。

假设性的混合结果存在争议,所以我们来看一个实测数据。Artificial Analysis 发布了在每个模型上运行其完整 Intelligence Index 的实际花费——同样的评测套件、同样的测试框架、真实的 token 数量,而非假设的比率。评估 Kimi K3 花费了 2,437.41 美元。V4 Pro 花费了 176.34 美元。在完全相同的工作负载下,按真实支付的美元计算,差距为 13.8 倍。

为什么这个数字低于17.2x的产出价格比,这一点值得理解,因为这是V4 Pro的廉价优势部分源于自身问题的唯一地方。V4 Pro很啰嗦:它用1.8亿个输出token完成了索引,而Kimi K3用了1.3亿,同类中位数是1亿。因此,它表达同样内容要多花约38%的token,这蚕食了它的每token优势。13.8x这个数字已经把这个因素计入了;17.2x没有。如果你在做预算,用实测的那个数字。

这也是故事中你可以自行验证、不必凭信的部分。因为 OrcaRouter 以 0% 加价直接透传供应商的列表价格,我们 deepseek/deepseek-v4-pro 和 kimi/kimi-k3 模型页面上的每 token 价格就是两家供应商自己的价格——K3 在我们页面上显示 $3.00/$15.00,在 Moonshot 页面上同样显示 $3.00/$15.00——而非暗含价差的转售价格——这意味着上述计算可以在同一张账单上复现,而且如果任一供应商调整价格,变动会在当天落到我们这边,而不是等到合同周期结束之后。

智力论断:13分,而非持平

"Kimi K3 level"是预测中未能经受住当前数据检验的那一半。在Artificial Analysis的Intelligence Index上,截至2026年8月5日,Kimi K3得分为57,DeepSeek V4 Pro(推理模式,最大努力)得分为44——在101个模型中排名第6,这确实是一个相当强的名次,但仍差13分。两者均由同一实验室在同一综合指标上测量,都采用最大推理努力,且都基于100万token的上下文。

供应商的基准测试讲述了一个不同且更为有利的故事,这正是它们需要标注的原因。该公司报告其V4 Pro-Preview在SWE-bench Verified上达到80.6%,在GPQA Diamond上达到90.1%。Moonshot报告其Kimi K3在SWE-bench Verified上为76.8%,在GPQA Diamond上为93.5%。单从数字来看,V4 Pro在编程基准上明显胜出。这两组数据都未经独立复现;它们是由与结果有利害关系的团队在不同测试框架上生成的,而在唯一一个由第三方自己运行两个模型的综合基准中,排名发生了逆转。这就是不信任供应商之间单一基准比较的全部理由。

关于指数数值,有两点需要分别说明。首先,如果你发现较早的文章引用 V4 Pro 为 52 分而非 44 分,它们并没有错——Artificial Analysis 自己在四月发布文章时确实将 V4 Pro (Max) 评为 52 分,并称其为排名第二的开放权重推理模型。指数会经历修订,而每次修订都会改变所有模型的分数。实际上的准则是:只有同一快照下的比较才有意义;四月的 52 分和八月的 57 分不应被放在同一句话里。其次,Artificial Analysis 的页面标注日期为“2026 年 4 月发布”,且未区分预览版与未来的正式版,因此其 44 分是对端点当时所提供内容的一次测量,无论测试发生在何时。

V4 Pro 明显胜过 Kimi K3 的地方,恰恰在于那些与智能无关的维度。它的生成速度达到每秒 66.5 个 token,而 K3 只有 37.6 个,同类别的中位数是 65.9——也就是说 V4 Pro 在同类中接近平均水平,而 Kimi K3 则慢得反常。首 token 延迟为 1.61 秒,对比 K3 的 2.85 秒。对于交互式智能体循环而言,这一差异在每一轮交互中都会被感知到,这也是当前预览版最有力的卖点。

Flash的官方构建告诉了我们关于Pro的什么?

这里是最接近未发布型号真实证据的信息,它来自已经历过该过程的姊妹产品。

公司7月31日的更新日志中指出:“DeepSeek-V4-Flash-0731与DeepSeek-V4-Flash-Preview保持相同的模型架构和规模,仅重新进行了后训练。”权重数量相同、架构相同、价格相同——仅后训练不同。Artificial Analysis对该模型的评分为50分,而此前的Flash版本为40分。综合评分提升10分,完全来自后训练,且每token成本并未增加。该指数上的输出token消耗量也下降了12%,从约2.34亿降至约2.06亿,因此在相同标价下运行成本更低。

将这一先例应用到 Pro 上,算术结果是无法回避的:44 加 10 等于 54。Kimi K3 是 57。即使官方 V4 Pro 复刻了该公司公开演示过的最成功的单一训练后升级,它仍比“Kimi K3 水平”低约三分——而运行成本却约为其十四分之一。这是一个非凡的结果,而且不是预测所预言的结果。

关于这种外推的坦诚告诫——这只是算术,而非预测:284B模型上+10的提升,并不能说明1.6T模型上能获得什么,余量可能更大,也可能小得多。该公司并未表示Pro版本将仅进行后训练。而且该指数是综合性的,三分可能只是同一项基准。尽管如此,仍要计算这个数字的原因在于,它是唯一存在的、经过量化且由供应商确认的先例,而且它比当前预测所依托的依据要充分得多。

那份变更日志中还有一个细节值得特别指出,而不是重复提及:Flash 的智能体评分是在“公司的 Harness 极简模式(即将发布)”下,以 max effort、topp=0.95、temperature=1.0 的设置生成的。生成这些数字的 Harness 尚未公开发布——它于 8 月初进入封闭测试——因此原则上,公司外部的任何人都仍然无法复现这些数字,不是因为它们有误,而是因为该工具不可用。预计 Pro 版本发布时也会带有同样的星号。

可能推翻廉价模型论点的条款

在公司定价文档中,隐藏着一项几乎未包含在V4线路定价中的政策。用公司的话说,API“很快将采用”一种方案,即“高峰时段价格将是常规价格的2倍,适用于所有计费项目。”高峰时段定义为北京时间每日09:00–12:00和14:00–18:00——每天七小时,每天如此。生效日期“以官方公告为准”,截至本文撰写时,该附加费尚未生效。

注意这一方向。该公司历来提供非高峰折扣(适用于V3和R1);而这是一项高峰附加费,加在标准费率之上。如果按所述的倍数生效,V4 Pro的日间价格将变为输入$0.87、输出$1.74,对比格局也将改变:对Kimi K3的11.7倍综合优势降至5.8倍,实测的13.8倍降至6.9倍。依然便宜。但不再是"便宜10倍"了,而且在欧洲或亚洲团队实际工作的时间段,也不再便宜。

{{1}}8月6日,更大的那只靴子落地了。{{/1}}DeepSeek 在其开发者平台上宣布,计划提高 DeepSeek API 服务的整体定价,{{2}}“在不久的将来,预计将大幅上调。”{{/2}}目前尚未公布新价格和生效日期,公司也未说明这次涨价是独立于高峰期计费方案,还是与其同步生效。报道该公司的媒体将此公告解读为官方 V4 Pro 即将发布的信号——毕竟,一款尚未发布的旗舰产品,不会在你即将退出的折扣体系中被激进定价。任何现在基于 V4 Pro 构建成本模型的人,都应该对这两种情况分别建模;而任何看到{{3}}“该公司便宜 14 倍”{{/3}}这类标题的人——{{4}}包括本文在内{{/4}}——都应该明白,它描述的是一份已附带公告到期条件的价目表。这是预测中价格那一半不再成立的最大可能方式,而这与模型本身毫无关系。

你如何知道官方构建版本已经发布

在公司的发货方式中,有一个比日期更重要的细节,而这是一个实实在在的运营隐患。

API 模型 ID 是deepseek-v4-pro。不是deepseek-v4-pro-preview,也不是带日期的构建字符串——尽管公司自己的变更日志将当前构建称为 V4-Pro-Preview,将已发布的 Flash 构建称为 V4-Flash-0731。当 Flash 正式发布时,说明是:“API 调用方式保持不变——只需将模型名称设为 deepseek-v4-flash 即可使用最新版本。”换句话说,固定模型 ID 并不会固定构建版本。同一个字符串悄然开始提供一组不同的权重,其行为有实质性差异,索引得分也高出十分。

所以,对于“V4 Pro 何时发布”这一问题的实际回答是:如果你正在调用deepseek-v4-pro,在生产环境中,你或许可以通过观察自己的输出变化来得知。具体来说,值得关注的事项包括:公司 API 变更日志中出现一个新的带日期条目——Flash 的发布最初就是出现在那里;一个构建后缀,例如V4-Pro-0731出现在该条目文字中,即便可调用的 ID 仍然没有后缀;Artificial Analysis 的 V4 Pro 页面出现重新评分,这将是你获得的第一个独立确认;已公布的价格上调落实为实际费率,因为正式发布(GA)正是价格上调与高峰时段安排落地的自然时机;以及公司的 Responses API,其文档称 deepseek-v4-pro 支持计划于 8 月初推出——该模型从“计划”列表消失并出现在“受支持”列表中,这几乎就是公司所发布的最接近官方发布信号的迹象。另外有两个我们无法确认但依然值得了解的信号:一家经销商的定价页面于 8 月 3 日调整了 V4 Pro 的缓存价格,这种模式在历史上往往先于发布出现;公司的内部评估工具正处于封闭测试阶段,这意味着当它上线时,其厂商基准测试或许终于能够核查。一个与deepseek-v4-pro-202606相似的字符串也曾作为泄露的构建标识符流传;我们无法对照该公司的任何资产对其进行核实,因此在有人能够证实之前,它不应具有任何分量。

你今天应该基于预览版进行构建吗?

对大多数评估这个模型的人来说,发布日期是个错误的问题。预览版可调用、有定价、采用MIT许可证,在智能程度上经独立评测在101款模型中排名第6。真正的问题是即将发布的GA版本会对你现在构建的工作产生什么影响,且答案有两种截然不同的版本。

如果你在能力上要在V4 Pro和Kimi K3之间做选择,目前的证据表明:Kimi K3在综合得分上领先13分,而V4 Pro在速度、延迟和成本上以巨大优势胜出——而且一项待定的后训练升级可能会缩小智能差距,但不会完全弥合。如果你的工作处于硬推理的前沿,这13分就是决定成败的一切,价格反而是干扰项。如果你的工作量大且只是有一定难度,为此支付14倍的价格就难以说得过去了。

如果你已经选定了 V4 Pro,需要管理的风险不是发布日期,而是静默替换:该模型 ID 背后的构建会在你不知情的情况下发生变化,就像 Flash 当初那样,而你的评测应当能够检测到这一点。保留一套可按需重跑的回归测试集,并确保无需改动代码就能触达另一个备用模型。这就是我们当初以那种方式构建故障转移的平凡原因——V4 Pro、V4 Flash 和 Kimi K3 都放在同一个 OrcaRouter 密钥后面,经由一个兼容 OpenAI 的端点提供服务,因此“在三个模型上重跑评测,然后切换流量”只是改配置,而不是走采购流程;一个糟糕的 GA 构建也只是一个路由决策,而非一次事故。当撤销这个选择无需任何成本时,尝试一个未经充分验证的旗舰模型就会容易得多。

人们真正在问的问题

DeepSeek V4 Pro 发布了没有?

两者都对,取决于你指的是什么,这就是搜索结果互相矛盾的原因。该模型自2026年4月24日V4预览版发布以来就可以公开调用,并公布了定价、MIT许可下的开放权重以及独立的基准测试覆盖。但公司自己在2026年7月31日的更新日志中明确指出,V4 Pro API“没有变化”,其正式发布“将很快到来”;8月6日,DeepSeek再次表示官方版本将尽快发布,同时宣布大幅上调API价格。所以:可用,但尚未正式发布。目前尚未确认具体日期;未经证实的消息指向8月中旬,那意味着等待时间不会太长。

官方版本能做到和Kimi K3一样好吗?

就目前唯一的量化先例来看,可能并非如此。Flash 的官方构建仅凭后训练就在 Artificial Analysis 的智能指数上提升了 10 分;V4 Pro 目前为 44 分,Kimi K3 为 57 分,因此同样的提升幅度将使其达到 54 分。这种外推在任一方向上都可能出错——1.6T 参数模型可能拥有与 284B 参数模型不同的提升空间,而且该公司并未表示 Pro 版本将仅包含后训练。但任何今天声称两者持平的人,都是在主张一个没有任何已发表测量数据支持的说法。

为什么DeepSeek的廉价模型目前比其旗舰模型得分更高?

因为这是发布顺序造成的,而不是因为Flash是更好的模型。Flash在7月31日获得了一次训练后升级,使其在该指数上的得分从40提升到50;Pro尚未获得相应升级,因此衡量的仍然是4月份的训练后版本。公司自己也承认了这一点,称Flash-0731的智能体结果“远超V4-Pro-Preview”。这种反转只是未完成发布进程的一个快照,而即将到来的Pro发布恰恰会终结这种情况。

以 $0.435 / $0.87 的价格为基础构建成本模型是否安全?

有条件地成立,且不如一周前可靠。这是该公司当前公布的标价,已反映了相比V4发布时费率的大幅永久下调。但8月6日,DeepSeek宣布计划全面上调API定价,“预计将有显著涨幅”,而新的费率及生效日期尚未公布——此外还有一项已公布但尚未生效的峰时政策,将使所有计费项目在每天七小时内翻倍。请对两种情景进行建模,并注意即便在翻倍情景下,仍比Kimi K3便宜约6倍。

诚实的解读

引发这一切的那项预测只对了一半,而它对的那一半恰恰是人们最难相信的。{{1}}"便宜10倍"{{/1}}的说法还低估了差距:在相同的实测评估工作负载下,{{2}}DeepSeek V4 Pro预览版的成本为176.34美元{{/2}},而{{3}}Kimi K3为2,437.41美元{{/3}};在缓存输入方面,差距不是十倍,而是大约八十倍。{{4}}"达到Kimi K3水平"{{/4}}是尚未实现的部分——独立实验室对两者所做的唯一一项综合评测中,得分为44比57;而即便依据该公司自身的最佳先例进行乐观外推,结果也不过是54。{{5}}

能够改变这一判断的因素是具体且值得关注的。如果官方V4 Pro版本以训练后升级的形式发布,且Artificial Analysis重新评分超过57分,那么这一预测将得到完全验证,本文的核心数字也将过时。如果它伴随着高峰时段附加费或8月6日宣布的涨价一起到来,价格论证的效果将减半,有趣的问题将变成:6倍的折扣是否能弥补13分的差距。如果该公司发布其评估工具——已处于封闭测试阶段——那么目前有利于V4 Pro编程能力的供应商基准将首次变得可核查。在这些情况发生之前,对DeepSeek V4 Pro的准确概括是:它是可下载权重中性价比最高的严肃推理模型,它不是最聪明的那个,而且其供应商已告诉我们它尚未完成。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube