DeepSeek V4 评测:人工智能中最便宜的百万令牌严肃模型?

DeepSeek V4 评测:人工智能中最便宜的百万令牌严肃模型?

作者

Fengya Tian

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek于2026年4月24日发布了V4系列——两个模型,V4-Pro和V4-Flash,在API上上线并第一天开源——并悄然重新设定了严肃AI能力的成本底线。两个模型默认都带有100万token的上下文窗口,都提供思考和非思考模式,旗舰版V4-Pro的最高价格为每百万输出token 0.87美元:这个价格低于市场上所有可比较的100万上下文模型,无论是开源还是闭源。

而七月是决策月。在一份日期为6月29日的通知中,DeepSeek确认V4的正式版本将于2026年7月中旬发布,承诺功能和性能改进——并引入高峰时段定价,在北京商务时段内将费率提高一倍。十天后,即7月24日,旧模型名称 `deepseek-chat` 和 `deepseek-reasoner` 将永久退役。本文综述了V4的实际内容、当前及正式发布后的成本、其优势所在、明显不足之处,以及在截止日期前应采取的应对措施。

快速裁决

如果你……,请考虑DeepSeek V4

- 运行大规模生产工作负载,其中单位成本决定可行性——V4的定价自成一派

- 需要低成本的长上下文:标准1M tokens,每次响应最多384K输出tokens,并提供积极的上下文缓存折扣

- 希望实现即插即用集成——该API同时支持OpenAI ChatCompletions和Anthropic格式,因此现有工具大多可直接使用

- 重视开放权重和自托管选项,尤其是较小的V4-Flash

如果你……请暂缓(或转到别处)

- 运行长时间跨度的自主智能体——在Z.ai发布的跨模型表格上,V4-Pro在马拉松式基准测试上严重落后于GLM-5.2和封闭前沿模型。

- 需要图像输入:V4 仅支持文本

- 依赖全天统一费率——从2026年7月中旬正式发布起,高峰时段费率在北京商务时间段内翻倍(非高峰时段保持当前费率)

什么是DeepSeek V4?

V4是DeepSeek的第四代模型系列,作为两个混合专家模型发布。DeepSeek-V4-Pro是旗舰型号:总参数1.6万亿,每个token激活490亿。DeepSeek-V4-Flash是效率版本:总参数2840亿,激活130亿。两者在DeepSeek官方服务中默认运行1M token的上下文窗口,并且都提供两种模式——思考模式用于难题,非思考模式用于速度——模型ID为deepseek-v4-pro和`deepseek-v4-flash`。

有两个定位细节值得注意。首先,V4以预览版的形式发布,DeepSeek将其视为可投入生产的版本——且根据该公司6月29日的通知,正式版本将于2026年7月中旬发布,并带来“功能优化和性能改进”。其次,它以开源的形式发布,延续了DeepSeek公开释放权重的模式——这使得自托管和微调成为可行方案,实际上对于284B Flash版本比对1.6T Pro版本更具现实意义。

DeepSeek V4 有哪些新功能?

默认提供100万token上下文,而非加价销售。所有官方DeepSeek服务现已将完整的百万token窗口作为标准配置——无需单独的长上下文SKU,也没有额外溢价费率。

巨大的输出余量。这两款模型每轮响应最多支持384K个输出token——是大多数1M上下文竞品的三倍——这对于整个文件的代码生成、长结构化提取和报告编写非常重要。

一个端点上的双模式。适用于困难问题的思考模式,以及用于低成本快速调用的非思考模式,每个请求可切换,而不是每个模型。

两个层级,一个API形态。 Pro 面向能力,Flash 面向容量——相同的上下文、相同的模式、相同的集成。

双API兼容性。V4原生支持OpenAI ChatCompletions和Anthropic API两种格式,因此大多数现有代理工具无需重写即可连接。

定价:实际成本

这是让V4声名远扬的部分。V4-Pro每百万输入tokens收费0.435美元,每百万输出tokens收费0.87美元。 V4-Flash每百万tokens收费0.14美元和0.28美元。重复上下文的缓存命中价格远低于每百万tokens一美分——对于反复读取相同项目状态的智能体循环来说,实际上免费。

作为参照:GLM-5.2(本身被誉为夏季的性价比之选)定价为1.40美元/4.40美元。Claude Sonnet 5定价3美元/15美元,Claude Opus 4.8为5美元/25美元。V4-Pro的输出价格是GLM-5.2的五分之一,约为Opus 4.8的3%。即使V4-Pro在某些正面质量对比中落败——事实也确实如此——这种经济性改变了哪些问题值得向模型提出的决策。

正式版发布将带来一项变化。根据DeepSeek 6月29日的通知,从7月中旬起,所有token价格在高峰时段(北京时间09:00–12:00和14:00–18:00)翻倍,而非高峰时段保持当前费率。即使翻倍后,V4-Pro的高峰输出价格(约每百万个1.74美元)仍低于GLM-5.2的标准费率,但统一价格时代随着预览版结束:如果你的流量在中国工作时间达到高峰,请模拟价格波动——或者安排调度和路由来规避。

评分

以下分数是我们的编辑评估,基于DeepSeek的官方文档和Z.ai发布的跨模型基准表——请将跨供应商数据视为第三方背景信息,而非DeepSeek自身的主张。

- 编码:8/10 — 在日常工程中表现不错;但不是开源权重领域的领先者。

- 代理/工具使用:7/10 — 工具编排扎实,但在马拉松式自主性上表现薄弱。

- 推理能力:8/10 — 在该价位类别中数学和科学成绩出色

- 成本效益:10/10 — 无与伦比

- 上下文与长文档:9/10 — 100万输入,38.4万输出,近乎免费缓存命中

- 速度:8/10 — 精简的活动参数计数,加上一种非思考模式用于快速路径

总体评分:~8.3/10——2026年中期的性价比之王,附带长期视角的星标。

优点

- 重新定义价格曲线的定价:整个系列每百万 Token 0.14–0.87 美元

- 1M上下文标准,384K输出 — 同类中最大的输出上限

基于同一端点的思考与非思考模式,可根据请求切换

- OpenAI 和 Anthropic API 兼容性意味着近乎零的迁移摩擦

开源权重使得自托管和微调仍然可行

缺点

长期代理工作是明显的弱点——在Z.ai公布的表格上,V4-Pro在FrontierSWE上得分29.0,而GLM-5.2达到74.4,Claude Opus 4.8达到75.1。

纯文本:V4 API 中无图像输入

- 高峰时段定价随着七月中旬的正式发布而到来——在北京的商务窗口期间费率翻倍,因此预算不再平稳

- 仍在预览中,直到七月中旬,因此行为可能会随正式版本发生变化。

deepseek-chat和deepseek-reasoner于2026年7月24日的退役迫使老用户按照DeepSeek的时间表进行迁移。

- 对于几乎所有人来说,自托管拥有1.6万亿参数的Pro模型是不切实际的(拥有2840亿参数的Flash才是现实目标)。

DeepSeek V4 如何比较

V4-Pro与V4-Flash对比。相同的上下文、相同的模式、相同的API——区别在于质量与吞吐量,价格相差3倍。合理的默认选择:Flash用于摘要、提取、分类和聊天;Pro用于代码、分析以及任何需要人工审查的内容。

对比GLM-5.2。今夏的开源权重之争,价值上确实势均力敌。GLM-5.2在编码能力上更强——在Z.ai公布的表格中,它于Terminal-Bench 2.1上以81.0比64.0领先V4-Pro,并在长周期任务中占据优势(FrontierSWE上74.4比29.0)——而V4则以3-5倍的低价和3倍的输出上限作为回应。批量处理管线更倾向V4;编码代理则更倾向GLM-5.2。

对抗封闭前沿。Claude Opus 4.8 和 GPT-5.5 在硬性基准测试上仍然是明显更强的模型。但与 Opus 4.8 存在30–60倍的输出价格差距下,V4 并不试图赢得这场较量——它旨在让你的90%流量便宜到不值得送往其他地方。

7月24日截止日期:迁移离开旧名称

如果您的集成仍在使用 `deepseek-chat` 或 `deepseek-reasoner`,这些名称将在2026年7月24日 15:59 UTC之后停止工作。这些名称当前路由到 V4-Flash,这意味着您的流量已经按照 V4 经济模式运行——但在截止日期后,请求将直接失败。迁移本身只需一行代码(`model: "deepseek-v4-pro"` 或 `"deepseek-v4-flash"`),因此实际工作是根据 V4 行为重新测试提示,并逐个端点决定每个工作负载应属于哪个层级——或者在前端放置一个路由器,使下次弃用变成配置更改而非代码更改。

谁应该使用DeepSeek V4?

高产量产品——支持、摘要、提取、分类——V4定价使边际功能变得有利可图

每天填充百万Token窗口并受益于近乎免费的缓存命中的长文档与RAG密集型工作负载

生成长输出的团队:代码库、报告、结构化数据——384K输出是能力上限

注重成本的建造者,他们希望拥有一个功能完善的默认方案,并且乐意将最棘手的10%内容交给其他地方处理。

谁应该另寻他处?

核心工作负载为长期运行的自主智能体的团队——选择GLM-5.2或封闭式旗舰模型是更安全的路径。

视觉依赖型工作流程(V4不采集图像)

任何今天需要合同上的'稳定'标签而非预览版本的人

DeepSeek V4 值得吗?

就这个价格来说,绝对值得——但它是一条通道,而非一种信仰。V4在质量上并未超越最佳开源编程模型(GLM-5.2)或前沿旗舰产品,其长周期智能体(agent)指标也确实很弱。它所做的是,让日常AI工作中占据实际token消耗大头的那部分——总结、提取、草稿和对话轮次——成本几乎降到零。最优模式是:以V4作为成本地板,在其之上铺设升级通道。

最终裁决

DeepSeek V4 已成为每个模型比拼性价比的基准——我们的评分:约 8.3/10。在流量为王时用 Flash,预算有限但质量重要时用 Pro,顶峰级任务则交给更强模型。等 7 月中旬峰值定价落地后重算成本——便宜依然便宜,但不再是固定费率。若你还在使用 deepseek-chat 或 deepseek-reasoner:截止到 7 月 24 日。迁移。

通过 OrcaRouter 使用 DeepSeek V4

三通道策略——V4处理高并发量,更强的开放或封闭模型处理复杂任务,备用方案确保可靠性——这种配置手动运行很痛苦,但通过网关处理则轻而易举。OrcaRouter通过一个兼容OpenAI的端点提供DeepSeek V4、GLM-5.2、Claude、GPT、Gemini及其他200多种模型,按供应商标价收费,零Token加价:智能路由为每个请求选择通道,自动故障转移应对预览期的小问题,按模型的可观测性显示每个通道完成每个任务的实际成本。它还能化解供应商方面的变化,例如7月24日的名称退役或七月中旬的高峰时段定价——当模型名称失效或价格窗口开启时,你只需更新路由规则,而非代码库。

常见问题

DeepSeek V4 现在可用了吗?

是的——V4-Pro和V4-Flash自2026年4月24日起已在DeepSeek API上正式上线,使用模型ID deepseek-v4-pro和deepseek-v4-flash,并提供了开源权重。官方称其为预览版;DeepSeek在6月29日的通知中表示正式版将于2026年7月中旬发布。

DeepSeek的高峰时段定价是什么?

宣布官方发布:自2026年7月中旬起,所有代币价格在北京业务窗口时段(北京时间09:00-12:00和14:00-18:00)翻倍,而非高峰时段维持现有费率。在中国业务时间之外出现高峰的流量——大部分西方工作负载——基本可避免附加费。

deepseek-chat 和 deepseek-reasoner 发生了什么?

它们目前会自动路由到 V4-Flash,但在 2026 年 7 月 24 日(15:59 UTC)之后,这两个名称将完全停用,请求将失败。请在截止日期前明确更新模型参数。

我应该使用V4-Pro还是V4-Flash?

Flash 用于大批量工作,人类从未逐行审查——摘要、提取、分类、聊天。Pro 用于代码、分析和起草,价格大约是 Flash 的三倍,但仍远低于所有同类模型。

DeepSeek V4 比 GLM-5.2 更好吗?

更便宜,但不更好。在Z.ai发布的表格中,GLM-5.2在编码方面明显领先,并在长期智能体任务中占主导地位;V4则以3-5倍更低的价格、384K的输出上限和近乎免费的缓存命中作为反击。许多团队同时使用两者:V4用于大规模任务,GLM-5.2用于编码智能体。

DeepSeek V4 能处理图片吗?

不——V4 API 仅支持文本。将视觉任务(截图、PDF 作为像素、图表)路由到像 Claude 或 Gemini 这样的多模态模型。

我可以自托管DeepSeek V4吗?

权重已开源,但要对规模有现实认识:V4-Pro是1.6T参数的MoE模型——数据中心级别——而284B的V4-Flash才是资源充足团队的实用自托管目标。

V4 是否兼容我现有的 OpenAI 或 Claude 工具?

基本上是——API 原生支持 OpenAI ChatCompletions 和 Anthropic 格式,因此为两者构建的智能体框架和 SDKs 通常只需更改 base-URL 和 model-name 即可连接。

我可以通过OrcaRouter使用DeepSeek V4吗?

是的——DeepSeek 模型在 OrcaRouter 上以提供商列出的价格提供,零加价,与 GLM、Claude、GPT 和 Gemini 并列,因此您可以在一个端点后面运行数量加升级的分流。

准备好让你的代币账单变得平淡无奇了吗?创建你的OrcaRouter账户,将兼容OpenAI的客户端指向一个端点,并将流量路由到DeepSeek V4,同时更强的模型处理高峰——零代币加价,集成经过7月24日可靠性验证。


© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube