
DeepSeek V4 Flash 正式发布:详解这款低价、快速、支持智能体的 1M 上下文模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
DeepSeek V4 Flash 是 DeepSeek V4 系列中价格较低的一档,独立的评测数据也终于追平了它的表现:在 MathArena 的 AIME 2026 测试集上,它得到 95.83% 的分数,与 DeepSeek V4 Pro 的 96.67% 在统计上没有显著差异,而每个问题的成本大约只有后者的九分之一。官方公开测试版 -0731 于 2026 年 7 月 31 日发布,架构与四月预览版相同——一个 2840 亿参数的混合专家模型、13B 活跃参数、100 万 token 上下文——但额外进行了一轮后训练,显著提升了它的智能体能力、编码能力和工具调用能力,同时还原生支持 Responses-API,并为 Codex 风格的智能体做了专门适配。本指南涵盖这次发布实际改变了什么、厂商与独立评测各自怎么说、把它的思考量算进去后实际成本是多少,以及如何调用它。
准确性说明:以下发布详情和主要智能体评分来自 DeepSeek 官方 API 变更日志(日期为 2026-07-31),属于供应商报告,并在 DeepSeek 自己的测试框架上运行——请将其视为方向性参考,并自行运行评估。文中出现的独立数据均标明了来源:Intelligence Index 及其组成部分来自 Artificial Analysis,AIME 2026 数据来自 MathArena,定价来自 DeepSeek 自己的价目表。若某内容仅基于单一从业者的报告而非已发表的评估,相关句子会注明这一点。规格和价格会变化;构建前请核实。
TL;DR。V4 Flash 是巨型 DeepSeek V4 Pro 的高性价比姊妹模型:284B 参数、13B 激活的 MoE 架构,支持 1M token 上下文和最高 384K 输出,专为高吞吐、低延迟的智能体(agentic)工作负载而调优。7 月 31 日的正式发布是一次后训练升级——尺寸不变,智能体和编码能力显著提升——同时还新增了对原生 Responses-API 和 Codex 的支持。DeepSeek 报告了强劲的智能体/编码得分(例如 Terminal-Bench 2.1 为 82.7,Toolathlon 为 70.3),而 Artificial Analysis 此后将 -0731 版本在其智能指数(Intelligence Index)上评为 50 分:比 4 月预览版高 10 分,比规模大得多的 V4 Pro 高 6 分,与 Gemini 3.6 Flash 持平。其价格约为每百万输入/输出 token 0.15 / 0.29 美元,大约是 V4 Pro 价格的三分之一。只有 Flash API 得到了升级;V4 Pro 和 DeepSeek 应用/网页版保持不变。在 OrcaRouter 上,你可以通过一个兼容 OpenAI 的端点以 0% 加价获得它。
关键要点
• 正式发布(构建版本 -0731,2026年7月31日):预览版的后训练升级——相同的架构,更强的智能体、编程和工具使用能力。
• 架构不变:总计284B / 激活13B(MoE),1M-token上下文(1,048,576),最多384K输出,仅文本输入,支持推理、工具和JSON。
• 新增:原生支持 Responses API,并针对 Codex 进行了专门适配;继续支持 OpenAI ChatCompletions 和 Anthropic 风格的接口。模型 ID deepseek-v4-flash。
• DeepSeek 报告的智能体/编码成绩:Terminal-Bench 2.1 82.7、Toolathlon(已验证)70.3、Cybergym 76.7、DeepSWE 54.4、NL2Repo 54.2、DSBench-FullStack 68.7。
• 非常便宜:每100万输入/输出token约$0.15/$0.29——大约是V4 Pro的$0.44/$0.88的三分之一——而DeepSeek将缓存命中定价为每100万$0.0028,比全新输入低约98%。只有Flash API有所变化;Pro和应用/网页保持不变。
官方正式版实际升级了什么内容
V4 Flash 最初于 2026 年 4 月 24 日以预览版形式亮相。2026 年 7 月 31 日正式发布的版本(-0731 构建版本,据 DeepSeek 的 API 变更日志)明确不是新架构:总参数和激活参数(284B / 13B)以及 1M 上下文均保持不变。变化的是后训练阶段——DeepSeek 称,额外的微调显著提升了核心智能体(agentic)、编码和工具调用能力。有两个实用新增值得关注:V4 Flash 现在原生支持 Responses API,并专门针对 Codex 风格的编码智能体进行了适配,同时仍兼容 OpenAI ChatCompletions 和 Anthropic 风格的接口。重要的是,本次发布仅升级了 Flash API;V4 Pro 和 DeepSeek 应用/网页体验均未变化。对团队而言,这意味着以相同价格即可为智能体工作负载带来即插即用的改进,且无需迁移。

架构:为吞吐量而设计的小激活MoE
V4 Flash 是一种专家混合(Mixture-of-Experts)模型,总参数约为 2840 亿,但每个 token 仅激活约 130 亿参数。低激活参数数量正是其关键所在:它既保证了推理速度快、成本低,又通过庞大的专家池维持了输出质量。其上下文窗口为完整的 1,048,576 个 token(约 100 万),最大输出长度高达 384K,同时模型支持推理(扩展思维)、工具调用和结构化 JSON。输入仅支持文本。其设计目标——高并发、低延迟、智能体工作——在服务数据中得到了体现:根据 OrcaRouter 的测量,p50 首 token 延迟约为 394 毫秒,输出速度约为每秒 184 个 token。
基准测试:官方数据说明了什么
官方发布版本大力依赖智能体(agentic)和编程(coding)评测,这些评测使用 DeepSeek 自己的测试框架运行(minimal-mode / max-effort 设置)。以下是如何解读这些头条结果——所有数据均由 DeepSeek 报告:
• Terminal-Bench 2.1:82.7 — 在真实终端中执行代理式命令行/软件任务。高分意味着该模型确实能够驱动工具和Shell,而不仅仅是回答问题。
• Toolathlon(已验证):70.3;Automation Bench(公开):25.1 —— 工具使用的广度与可靠性,以及端到端自动化。工具调用的可靠性是智能体成败的关键特质。
• Cybergym:76.7 — 安全/CTF风格的智能体问题求解。
• DeepSWE:54.4,NL2Repo:54.2,DSBench-FullStack:68.7,DSBench-Hard:59.6 —— 软件工程与全栈编码,涵盖从仓库级生成到高难度数据科学任务。DSBench-FullStack(68.7)的强劲表现表明其具备实用的多文件编码能力。
• Agent Last Exam: 25.2 —— 一项刻意设计的高难度智能体推理考验,即便是顶级模型也得分很低;可作为相对信号使用,而非绝对指标。
作为独立背景信息,Artificial Analysis现已对-0731版本本身进行了评估,在Artificial Analysis Intelligence Index上给出50分——比它所取代的4月预览版高出10分,比规模大得多的V4 Pro高出6分,并与Gemini 3.6 Flash持平。其分项结果如下:GPQA Diamond 91%、AA-LCR 66%、Humanity's Last Exam 37%、SciCode 50%、τ³-Bench Banking 31%、CritPt 17%,以及GDPval-AA v2上的Elo为1559。其中两项值得再仔细看看。Artificial Analysis测得Terminal-Bench 2.1为79%,而DeepSeek报告的为82.7%——接近,但更低,而供应商测试框架的数字通常会在这个方向上失准。而在AA-Omniscience上,该模型得分-16,且测量到的幻觉率很高,因此“廉价且智能体化”的说法并不适用于无监督的事实召回。这才是更准确地解读这款模型的方式:单位美元的推理能力强,但每次查询的知识能力弱。
竞赛数学:Flash唯一能与Pro匹敌的领域。
关于 V4 Flash 推理能力最有用的独立评测来自 MathArena,它会对每个新发布竞赛的每道题运行每个模型四次,并公布逐题的结果网格。在 AIME 2026 上——两套试卷,30 道题,每套各运行四次——V4 Flash 在最大推理模式下得分 95.83% ±3.58%,而 DeepSeek V4 Pro 为 96.67% ±3.21%。这些置信区间几乎完全重叠:在这个基准上,小模型并没有显著逊于旗舰模型。两者在成本栏上拉开差距。MathArena 显示,V4 Flash 每次运行每道题的成本为 0.009 美元,而 V4 Pro 为 0.082 美元——在同样准确率下便宜约九倍,这一论据比 DeepSeek 自己公告中的任何内容都更有力地支持其效率档位。
有两个注意事项需要一并说明。MathArena 对 DeepSeek 的两个条目都标记了污染警告——这是其对竞赛题目公布后发布的模型所用的标签——因此部分准确率可能来自记忆而非推理。而且 MathArena 测试的版本日期为 2026-04-24,即四月预览版,而非 -0731 构建版。截至本文撰写时,官方发布版尚无独立的 AIME 2026 分数,DeepSeek 自己的模型卡也完全没有公布其数学基准,只有智能体基准。
该网格还显示了天花板所在的位置。榜单上几乎所有模型都能解决AIME 2026的大部分题目;将它们区分开来的问题是第15题。只有两个参赛模型在全部四次运行中都解决了它——GPT-5.5(超高努力)和Claude Opus 4.8(最高)。V4 Flash在那道题上四次得分为零,V4 Pro也是如此,还有GLM-5.2、Gemini 3.6 Flash、Kimi K2.6和Claude Opus 4.7。
最后这一点,正是让2026年8月5日的一份报告值得标注的原因。AI评论者@teortaxesTex发帖称,-0731构建确实解出了AIME 2026第15题,用时约1,006秒,输出约100,000个token,并描述了模型明显开始走捷径,随后放弃捷径、老老实实解题的过程。这是一位从业者的单次运行,不是基准测试结果:它尚未被复现,没有公开排行榜对-0731构建进行评分,孤立的转录文本也不构成评估。可以检查的是内部一致性,而这一点经得起推敲——Artificial Analysis测得该模型的输出速度约为每秒116个token,按此速率计算,1,006秒约合117,000个token,与报告的数量大致相当。10万个token的答案也完全在DeepSeek的预期范围内,因为它建议在高或最大推理强度下允许最多384K个输出token。这两个数字大约是MathArena对该模型测得的平均值(每次回答33,588个输出token,耗时6分50秒)的三倍,这在全集最难的一道题上正是你预期的情况。所以:形态上合理,结果上未经验证,如果它能被复现,那将是相对预览版的真正跃升——预览版在该问题上四次尝试全部失败。
定价:改变预算的数字
在OrcaRouter上,它以0%加价传递提供商定价,V4 Flash大约每百万输入令牌0.15美元,每百万输出令牌0.29美元,而DeepSeek这次升级保持定价不变。这大约是DeepSeek V4 Pro的0.44美元/0.88美元的三分之一。缓存命中比大多数人以为的要便宜:DeepSeek将缓存输入列为每百万0.0028美元,比新鲜输入低约98%,这正是让具有稳定系统提示的代理和聊天保持运行如此便宜的原因。实际来看,每月1000万令牌,按70%输入/30%输出拆分,大约只需几美元;扩展到10亿令牌,与旗舰机型的差距就成了财务部门会注意的预算项目。
不过,对于推理模型来说,费率表只是账单上比较无趣的一半——真正影响预算的是模型选择消耗多少 token。Artificial Analysis 在 V4 Flash 上运行完整的 Intelligence Index,需要大约 2.06 亿个输出 token,大约是其测试模型中位数(约 1 亿)的两倍,并称其速度很快但非常啰嗦。按价格计算,一个 10 万 token 的回答大约花费 3 美分,而 384K 的输出上限使单个回答的费用接近 11 美分。绝对价格确实便宜,但却是简短回复成本的数百倍——这就是为什么推理强度是一个预算杠杆,而不是一个你可以一直调到最大的质量旋钮。Simon Willison 的实操文章从另一个角度说明了同样的问题:在默认设置下,他的测试输出令人失望,而将推理强度调高后,效果显著改善。在把宣传费率当作你的实际成本之前,先计量一下自己的高难度请求。
V4 Flash 的定位:DeepSeek V4 产品阶梯
DeepSeek 的 V4 产品线是一个阶梯。V4 Pro 是旗舰——一个规模大得多的顶级推理与编码模型。V4 Flash 是效率层级:活跃算力少得多,价格只是 Pro 的一小部分,而且经过这次后训练升级,其智能体与编码能力确实很强。DeepSeek 投入资源让 Flash 成为更好的智能体(Responses API、Codex 适配、工具使用基准测试)这一事实,说明了它预期流量会流向哪里。但 AIME 2026 的成绩让那个对 Flash 有利的简洁叙事变得复杂:在竞赛数学上,两个模型处于彼此的误差棒之内,所以“把难题交给 Pro”并不自动正确。诚实地说,Pro 买到的是知识广度和最难的智能体工作,而不是在数学难题上有更大的胜算——这就是为什么根据你自己任务的实际难度进行路由,胜过默认使用最大的模型。

三个现实场景
1. 编码代理与Codex风格的工作流程
-0731 构建的原生 Responses-API 与 Codex 支持,再加上其在 Terminal-Bench(82.7)和 DSBench-FullStack(68.7)上的得分,使 V4 Flash 成为自主编码代理的一个强大而廉价的引擎——可用于问题修复、重构、测试生成和多步骤工具使用。
2. 高容量工具使用智能体
快速首token(约394毫秒)、高吞吐量(约184 token/秒)、100万上下文,以及强大的Toolathlon(70.3)可靠性,非常适合大规模调用工具的生产级智能体——涵盖检索、自动化与编排。
3. 低成本长文档处理
完整的 1M token 上下文和 384K 输出能力,可以单次低成本地总结、分析或转换超大规模输入——日志、代码库、长报告。
如何访问 V4 Flash
您可以直接在 DeepSeek 的 API 上调用 V4 Flash(模型 ID 为 deepseek-v4-flash;它支持 Responses API、OpenAI ChatCompletions 和 Anthropic 风格的接口),也可以通过供应商中立的端点调用。OrcaRouter 通过一个兼容 OpenAI 的端点(deepseek/deepseek-v4-flash)以 0% 加价提供 V4 Flash,同时还提供 200 多个其他模型——因此您可以在同一个地方将其与 GPT-5.6 Luna、Gemini 3.6 Flash、GLM-5.2、Qwen3.8-Max 和 Kimi K3 进行基准对比,并将每个请求路由到成本最低的模型。由于定价是原样传递而非加价,DeepSeek 的价格变动会在发布当天反映到您的账单上。而且由于接口兼容 OpenAI,采用 V4 Flash——或在一周测量后换掉它——只是配置变更,而非重新集成。

局限性与坦诚告诫
V4 Flash 是一款效率型模型,而非旗舰模型,但独立数据让这一界限比“在困难任务上表现更差”更加具体。在 AIME 2026 上,它与 V4 Pro 在置信区间内持平;其明显落后之处在于知识广度——AA-Omniscience 低 16 分、实测幻觉率偏高——以及要求最高的智能体任务。输入仅支持文本,没有原生图像输入。对外宣传的智能体得分是 DeepSeek 在其自有测试框架上报告的,而独立实验室复测的一项数据更低(Artificial Analysis 测得 Terminal-Bench 2.1 为 79%,报告值为 82.7),因此厂商数字只能视为方向性参考。此外,“每 Token 便宜”并不等于“每任务便宜”:该模型输出的冗长程度可观,因此在简单调用中应限制推理力度和工具迭代次数,而非默认开启最大力度。在投入生产流量之前,请先用自己的工作负载进行验证。
常见问题
DeepSeek V4 Flash 是什么?
DeepSeek V4系列中的效率模型:一个284B/13B激活参数的混合专家模型,支持100万token的上下文,最多384K输出,专为快速、高吞吐量的智能体与编码任务而调优。其官方版本(构建-0731)已于2026年7月31日发布。
官方发布版有什么变化?
架构保持不变;这是一次训练后升级,显著提升了智能体、编码和工具调用能力,并新增了原生Responses-API支持与Codex适配。仅Flash API获得了升级——V4 Pro和应用/网页均保持不变。
V4 Flash 多少钱?
在OrcaRouter上,每百万输入代币约0.15美元,每百万输出代币约0.29美元(0%加价)——大约是V4 Pro的0.44美元/0.88美元的三分之一——缓存命中列出的价格为每百万0.0028美元,比全新输入低约98%。本次发布中定价保持稳定。预算时要考虑代币总量和费率:这是一个冗长的推理模型,一个100,000代币的答案大约花费三美分。
V4 Flash 在 agentic 和编程任务方面的表现如何?
DeepSeek 报告了强劲的得分:Terminal-Bench 2.1 82.7、Toolathlon(已验证)70.3、Cybergym 76.7、DeepSWE 54.4、DSBench-FullStack 68.7 —— 全部为厂商测试框架数据,请在自己的任务上自行验证。
V4 Flash 擅长竞赛数学吗?
表现优于其价格所暗示的水平。在 MathArena 的 AIME 2026 测试集上,四月预览版在四轮各 30 道题的测试中得分 95.83%,落在 V4 Pro 96.67% 的置信区间内,而每道题的成本约为其九分之一——不过 MathArena 指出这两款模型可能存在数据污染,且尚未对 -0731 版本进行评分。该模型唯一从未解出的是第 15 题,而这道题只有 GPT-5.5(超高努力模式)和 Claude Opus 4.8(最高设定)能稳定求解。
V4 Flash 与 V4 Pro 相比如何?
Pro 是面向最困难推理与编码的更大旗舰产品;Flash 是效率层级,价格约为其三分之一,具备强大的智能体/编码能力。将困难任务路由到 Pro,其余全部路由到 Flash。
什么是上下文窗口?
完整的 1,048,576 tokens(约 1M),最高可输出 384K tokens。
V4 Flash 支持多模态吗?
不——输入仅为文本。它支持推理、工具调用和 JSON 输出。
V4 Flash 是否兼容 Responses API 和 Codex?
是的——-0731版本新增了原生Responses-API支持和针对Codex的特定适配,同时还提供了OpenAI ChatCompletions和Anthropic风格的接口。
如何使用V4闪存?
直接通过 DeepSeek 的 API,或通过 OrcaRouter 的 OpenAI 兼容端点(0% 加价)(deepseek/deepseek-v4-flash),您还可以在其中比较并路由到不同竞争模型。
底线
DeepSeek V4 Flash 的正式发布保留了廉价、快速的配方,并使其成为一个更好的智能体:同样的 284B / 13B 激活 MoE 和 1M 上下文,经过后训练以增强编码和工具使用能力,原生支持 Responses-API 和 Codex,价格仍为约 $0.15 / $0.29。独立的数字现在支撑了大部分宣传——Artificial Analysis 将 -0731 构建级别与 Gemini 3.6 Flash 在智能上持平,而 MathArena 显示预览构建在 AIME 2026 上匹配 V4 Pro,而每个问题的成本仅为后者的九分之一。低费率并不能买到知识的广度或冗长的豁免权:这个模型的思考令牌预算大约是中等模型的两倍,因此你的每任务账单更多取决于你允许的推理努力,而不是标题价格。通过像 OrcaRouter 这样的 0% 加价、OpenAI 兼容端点运行它,测量你自己的困难请求实际花费,并且只有在测量表明必须时才路由到旗舰模型。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
