DeepSeek V4 Flash 正式发布:详解这款低价、快速、支持智能体的 1M 上下文模型
Guides & Insights

DeepSeek V4 Flash 正式发布:详解这款低价、快速、支持智能体的 1M 上下文模型

作者

jinhao song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek 的效率模型V4 Flash已从预览版升级为官方公开测试版——code>-0731/code> 版本于 2026 年 7 月 31 日发布。架构没有改变(仍然是拥有 2840 亿参数的混合专家模型,支持 100 万 token 的上下文),但额外一轮后训练显著提升了其智能体、编码和工具调用能力,并且现在原生支持 Responses API,针对 Codex 风格的智能体进行了特定适配。本指南将说明 V4 Flash 是什么、此次官方发布实际升级了什么、其(DeepSeek 报告的)基准测试成绩如何、使用成本是多少,以及如何使用——每项数据都标注了来源。

准确性说明:以下发布详情和基准测试分数来自DeepSeek官方API变更日志(日期为2026年7月31日);架构、上下文和定价已与OrcaRouter的模型页面交叉核对;Artificial Analysis的综合指标是独立计算的。DeepSeek报告的基准测试使用其自身的测试框架设置——请将其视为厂商数据,并自行运行评估。规格和价格可能会有变动;构建前请核实。

TL;DR。V4 Flash 是巨头 DeepSeek V4 Pro 的高性价比兄弟产品:284B 参数、13B 激活的 MoE 模型,拥有 1M token 上下文和最高 384K 输出,专为高容量、低延迟的智能体工作而调优。7 月 31 日的官方发布是一次后训练升级——规模不变,智能体和编码能力显著提升——同时还增加了对原生 Responses-API 和 Codex 的支持。DeepSeek 报告了强劲的智能体/编码分数(例如 Terminal-Bench 2.1 82.7、Toolathlon 70.3),成本约为每百万输入/输出 token 0.15/0.29 美元,大约是 V4 Pro 价格的三分之一。只有 Flash API 得到了升级;V4 Pro 和 DeepSeek 应用/网页保持不变。在 OrcaRouter 上,你可以通过一个兼容 OpenAI 的端点以 0% 加价获取它。

关键要点

• 正式发布(构建版本 -0731,2026年7月31日):预览版的后训练升级——相同的架构,更强的智能体、编程和工具使用能力。

• 架构不变:总计284B / 激活13B(MoE),1M-token上下文(1,048,576),最多384K输出,仅文本输入,支持推理、工具和JSON。

• 新增:原生 Responses API 支持以及特定的 Codex 适配;继续支持 OpenAI ChatCompletions 和 Anthropic 风格接口。模型 ID code>deepseek-v4-flash/code>。

• DeepSeek 报告的智能体/编码成绩:Terminal-Bench 2.1 82.7、Toolathlon(已验证)70.3、Cybergym 76.7、DeepSWE 54.4、NL2Repo 54.2、DSBench-FullStack 68.7。

• 非常便宜:大约每百万输入/输出 tokens 为 $0.15 / $0.29,缓存读取约 $0.02(OrcaRouter,0% 加价)——约为 V4 Pro 的 $0.44 / $0.88 的三分之一。只有 Flash API 变了;Pro 和应用/网页版相同。

官方正式版实际升级了什么内容

V4 Flash 最初于 2026 年 4 月 24 日作为预览版亮相。2026 年 7 月 31 日的正式发布版(即code>-0731/code> 构建版本,根据 DeepSeek 的 API 变更日志)明确并非一种新的架构:总参数和激活参数(284B / 13B)以及 1M 上下文均未改变。改变的是后训练——DeepSeek 表示,额外的微调显著提升了核心的智能体(agentic)、编码和工具调用能力。有两个实用的新增功能值得关注:V4 Flash 现在原生支持 Responses API,并专门针对 Codex 风格的编码智能体进行了适配,同时仍然兼容 OpenAI ChatCompletions 和 Anthropic 风格的接口。重要的是,本次发布仅升级了 Flash API;V4 Pro 以及 DeepSeek 应用/网页体验均未改变。对于团队而言,这意味着在相同价格下,智能体工作负载可获得即插即用的改进,且无需迁移。

架构:为吞吐量而设计的小激活MoE

V4 Flash 是一种专家混合(Mixture-of-Experts)模型,总参数约为 2840 亿,但每个 token 仅激活约 130 亿参数。低激活参数数量正是其关键所在:它既保证了推理速度快、成本低,又通过庞大的专家池维持了输出质量。其上下文窗口为完整的 1,048,576 个 token(约 100 万),最大输出长度高达 384K,同时模型支持推理(扩展思维)、工具调用和结构化 JSON。输入仅支持文本。其设计目标——高并发、低延迟、智能体工作——在服务数据中得到了体现:根据 OrcaRouter 的测量,p50 首 token 延迟约为 394 毫秒,输出速度约为每秒 184 个 token。

基准测试:官方数据说明了什么

官方发布版本大力依赖智能体(agentic)和编程(coding)评测,这些评测使用 DeepSeek 自己的测试框架运行(minimal-mode / max-effort 设置)。以下是如何解读这些头条结果——所有数据均由 DeepSeek 报告:

• Terminal-Bench 2.1:82.7 — 在真实终端中执行代理式命令行/软件任务。高分意味着该模型确实能够驱动工具和Shell,而不仅仅是回答问题。

• Toolathlon(已验证):70.3;Automation Bench(公开):25.1 —— 工具使用的广度与可靠性,以及端到端自动化。工具调用的可靠性是智能体成败的关键特质。

• Cybergym:76.7 — 安全/CTF风格的智能体问题求解。

• DeepSWE:54.4,NL2Repo:54.2,DSBench-FullStack:68.7,DSBench-Hard:59.6 —— 软件工程与全栈编码,涵盖从仓库级生成到高难度数据科学任务。DSBench-FullStack(68.7)的强劲表现表明其具备实用的多文件编码能力。

• Agent Last Exam: 25.2 —— 一项刻意设计的高难度智能体推理考验,即便是顶级模型也得分很低;可作为相对信号使用,而非绝对指标。

作为独立参考,Artificial Analysis(2026年6月25日评估,预览版)将 V4 Flash 定位在 AA Coding 约56.2、AA Intelligence 约40.3、AA Math 约50.0——一个偏重编码的通才模型,位于开源模型的中位数之上。官方后训练提升直指智能体/编码这条轴线,因此可以预期新版本恰恰在这些任务上会表现得更强。一如既往,供应商测试环境的数据偏乐观;请在自己的工作负载上验证。

定价:改变预算的数字

在OrcaRouter上,提供商定价以0%加价率传递,V4 Flash每百万输入令牌约0.15美元,每百万输出令牌约0.29美元,缓存读取约0.02美元——而DeepSeek在此次发布中保持了低价(升级不加价)。这大约是DeepSeek V4 Pro的0.44美元/0.88美元的三分之一。实际而言:每月1000万令牌,按70%输入/30%输出拆分,在V4 Flash上运行成本大约为几美元;扩展到10亿令牌,与旗舰版的差距就会变成财务部门会注意到的单项成本。提示缓存可进一步降低成本,适用于具有稳定系统提示的代理和聊天场景,因为缓存输入按约新鲜输入的十分之一计费。以同样低价提供更便宜的代理能力,是本次发布的全部卖点。

V4 Flash 的定位:DeepSeek V4 产品阶梯

DeepSeek的V4产品线是一个阶梯。V4 Pro是旗舰——一个规模大得多的顶级推理与编码模型。V4 Flash是效率层级:激活计算量少得多,价格仅为其一小部分,而且在这次后训练升级之后,具备真正强大的智能体与编码能力。DeepSeek投入资源让Flash成为更好的智能体(Responses API、Codex适配、工具使用基准测试),这一事实告诉你它预期流量会流向哪里:日常的智能体与编码流量放在Flash上,最难的推理保留给Pro。这映照出整个行业的“廉价默认+高级旗舰”模式——也正是为什么按难度路由优于默认使用最大的模型。

三个现实场景

1. 编码代理与Codex风格的工作流程

-0731 构建的原生 Responses-API 与 Codex 支持,再加上其在 Terminal-Bench(82.7)和 DSBench-FullStack(68.7)上的得分,使 V4 Flash 成为自主编码代理的一个强大而廉价的引擎——可用于问题修复、重构、测试生成和多步骤工具使用。

2. 高容量工具使用智能体

快速首token(约394毫秒)、高吞吐量(约184 token/秒)、100万上下文,以及强大的Toolathlon(70.3)可靠性,非常适合大规模调用工具的生产级智能体——涵盖检索、自动化与编排。

3. 低成本长文档处理

完整的 1M token 上下文和 384K 输出能力,可以单次低成本地总结、分析或转换超大规模输入——日志、代码库、长报告。

如何访问 V4 Flash

您可以直接在 DeepSeek 的 API 上调用 V4 Flash(模型 ID 为 code>deepseek-v4-flash/code>;它支持 Responses API、OpenAI ChatCompletions 以及 Anthropic 风格的接口),也可以通过供应商中立的端点来调用。a href="https://www.orcarouter.ai/">OrcaRouter/a> 通过单一 OpenAI 兼容端点(code>deepseek/deepseek-v4-flash/code>)以 0% 加价提供 V4 Flash,同时提供 185+ 种其他模型——因此您可以在同一处将其与 GPT-5.6 LunaGemini 3.6 Flash、GLM-5.2、Qwen 3.8 和 Kimi K3 进行对比测试,并将每个请求路由到对该任务最便宜的模型。由于它兼容 OpenAI,采用 V4 Flash——或弃用它——只是配置变更,而非重新集成。

局限性与坦诚告诫

V4 Flash 是一款效率型模型,而非旗舰模型:在最困难的推理任务上,它落后于 V4 Pro 和西方顶级模型。输入仅支持文本(无原生图像输入)。此处的基准测试分数是 DeepSeek 使用自家评测框架报告的,因此应将具体数字仅视为方向性参考,并预期独立评测的结果会略低一些。此外,如果让推理或智能体循环长时间运行,"cheap per token"并不等于"cheap per task"——应在简单调用上限制推理力度和工具迭代次数。在投入生产流量之前,请先在自己的工作负载上进行验证。

常见问题

DeepSeek V4 Flash 是什么?

DeepSeek V4系列中的效率模型:一个284B/13B激活参数的混合专家模型,支持100万token的上下文,最多384K输出,专为快速、高吞吐量的智能体与编码任务而调优。其官方版本(构建-0731)已于2026年7月31日发布。

官方发布版有什么变化?

架构保持不变;这是一次训练后升级,显著提升了智能体、编码和工具调用能力,并新增了原生Responses-API支持与Codex适配。仅Flash API获得了升级——V4 Pro和应用/网页均保持不变。

V4 Flash 多少钱?

在 OrcaRouter 上,每百万输入 token 约 0.15 美元,每百万输出 token 约 0.29 美元(0% 加价),缓存读取约 0.02 美元——约为 V4 Pro 的 0.44 美元 / 0.88 美元的三分之一。本次发布的价格保持在低位。

V4 Flash 在 agentic 和编程任务方面的表现如何?

DeepSeek 报告了强劲的得分:Terminal-Bench 2.1 82.7、Toolathlon(已验证)70.3、Cybergym 76.7、DeepSWE 54.4、DSBench-FullStack 68.7 —— 全部为厂商测试框架数据,请在自己的任务上自行验证。

V4 Flash 与 V4 Pro 相比如何?

Pro 是面向最困难推理与编码的更大旗舰产品;Flash 是效率层级,价格约为其三分之一,具备强大的智能体/编码能力。将困难任务路由到 Pro,其余全部路由到 Flash。

什么是上下文窗口?

完整的 1,048,576 tokens(约 1M),最高可输出 384K tokens。

V4 Flash 支持多模态吗?

不——输入仅为文本。它支持推理、工具调用和 JSON 输出。

V4 Flash 是否兼容 Responses API 和 Codex?

是的——-0731版本新增了原生Responses-API支持和针对Codex的特定适配,同时还提供了OpenAI ChatCompletions和Anthropic风格的接口。

如何使用V4闪存?

直接通过 DeepSeek 的 API,或通过 OrcaRouter 的 OpenAI 兼容端点(0% 加价,code>deepseek/deepseek-v4-flash/code>),您还可以在竞争模型之间进行比较和路由。

底线

DeepSeek V4 Flash 官方发布延续了廉价、快速的路线,并使其成为更出色的智能体:同样是 284B / 13B 激活参数的 MoE 架构和 1M 上下文,但经过后训练,编码和工具调用能力更强,并原生支持 Responses-API 和 Codex——价格仍保持在约 $0.15 / $0.29。它不是旗舰模型,也不支持多模态,但对于绝大多数智能体、编码和长文档任务而言,它是 2026 年性价比最高的选择之一。可以通过 OrcaRouter 这类 0% 加价、兼容 OpenAI 的端点来试用它,并将少数最难的请求路由到旗舰模型——这种组合在成本上很难被超越。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube