
DeepSeek V4.1 Flash:一个顶着点版本号的全新基础模型
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49代码
DeepSeek V4.1 Flash 于 2026 年 9 月 10 日正式发布:开放 MIT 权重、百万级 token 上下文窗口、全新的因果编码器-解码器(Causal Encoder-Decoder)架构,以及一个 5520 亿参数的混合专家(MoE)主干——DeepSeek 自己的模型卡将其归入该公司所称的"新架构家族"。此外,如果那个指出命名问题的追踪者判断无误,这也是 DeepSeek 首次将 .1 版本号用于一个全新基础模型——这个标签通常意味着微调升级,而非推倒重建。而该版本号如今所暗示的旗舰型号 DeepSeek V4.1 Pro,仍然尚未问世。
这种不匹配远不止是命名上的吹毛求疵。任何按版本号比较DeepSeek各代产品的人,都会把“V4 Flash到V4.1 Flash”读作一次补丁升级,并据此分配关注度。但底层架构说明事实并非如此,而公司决定让1.6万亿参数的旗舰模型退役、转而采用Flash模型,则更有力地印证了这一点。

9月10日实际发布的内容
这款既不是泄露版,也不是测试版。9月8日以模型ID deepseek-v4.1-flash-expires-on-0910 开始的为期两天的API测试,其结局正如其后缀所示;今天,正式版本已在DeepSeek的网页应用、移动应用和第一方API上线,权重文件和技术报告也已在Hugging Face上发布,位于deepseek-ai/DeepSeek-V4.1-Flash。
务实的细节比仪式更重要:
• 模型名称 — 调用 deepseek-flash。旧名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 仍被接受,但不再解析为原先的模型:两者均已退役,使用这些名称的请求将由 DeepSeek V4.1 Flash 提供服务,并按 Flash 费率计费。
• 包装盒内有什么——552B 骨干参数、1M-token 上下文窗口、384K 最大输出、JSON 输出、函数调用,以及默认开启的思考模式,提供低、高和最大三档努力设置。
• 许可证 — MIT,包含权重,仓库中带有推理文件夹和独立的编码模块。DeepSeek 明确邀请开源社区构建推理支持,这是标准信号,意味着主流运行时在发布当天即可提供服务,所需时间是几天而非几周。
那个不是小版本更新的 .1
这篇报道的起因是 teortaxesTex(一位匿名但备受关注的 DeepSeek 观察者)在 9 月 10 日帖子中的说法:这是“DeepSeek 首次用 .1 版本号来标记一个全新的基础模型”,V4.1 与 V4 的差异“比 LLaMA 3 与 LLaMA 1 的差异还要大”,而且 DeepSeek“还不觉得这值得称为 V5”——尽管发帖人无法解释原因。
将因果部分视为推断,将结构部分视为可核查的。推断——为什么 DeepSeek 选择 .1 而非 V5——只是一个观察者的解读,仅此而已;公司内部以外没有人解释过这一决定,DeepSeek 自己的材料也从未提及。可核查的部分是架构,而它读起来并不像一次小版本发布。DeepSeek 的更新日志将 V4.1 Flash 描述为“我们新架构系列中体积最小的模型”,这句话用来描述版本号提升很奇怪:版本号提升是扩展现有系列,而不是开创一个系列。
这种模糊性是有实际代价的,而承担代价的是买家,而不是DeepSeek。版本号是开发者最廉价的信号,用来判断“这是新一代产品还是重新调优?它值得我投入多少评估预算?”DeepSeek现在让这个信号在某个方向上变得不可靠——一个开创了架构系列的模型,与一个只是改变了后训练配方的模型,版本号只相差一个小数位。该公司得以把V5这个标记留作后备。每一个做迁移评估的人都要为这种混乱买单。
"新架构"在权重中意味着什么
这份模型卡片异常具体,使得其世代声明无需任何基准测试就能轻松验证。有四点尤为突出。

• 非对称激活——因果编码器-解码器拆分是一个40层Transformer,组织为20层因果编码器后接20层解码器,其中解码器的全局KV缓存由编码器的最终隐藏状态投影而来,而非从每个解码器层自身的状态推导。该设计的要点在于,模型在预填充阶段每个token仅激活8B参数,在解码阶段激活16B参数。输入密集型的智能体工作负载——长文档、长工具调用轨迹——使用模型成本较低的一半;生成则使用成本较高的一半。
• KV cache 压缩,按每 token 计量——DeepSeek-V4.1-Flash 对主 KV 缓存采用 FP4 格式,每 token 占用 890 字节,规格卡显示这一数值约为 DeepSeek V4 Flash 的四分之一。中文报道则更进一步,以第一代 V4 模型为基准,将压缩幅度表述为 437 倍缩减;这一更大的数字是供应商基于不同基准计算得出的,因此应视为宣传说法而非实测数据。
• SWA 有界重放 — 滑动窗口注意力通常迫使你将 KV 状态持久化到 SSD 以重建上下文。该机制改为仅重放最近窗口内的 token 来重建缺失的 SWA KV 状态,从而将持久化 KV 的占用空间削减至 DeepSeek V4 Flash 的约八分之一。
• Compressed Sparse Attention 2 — 每个注意力层以三种静态模式之一运行(Full、Reindex 或 Reuse),跨层共享 KV 和索引器状态;分层稀疏索引器确保更深层的计算成本与上下文长度无关。
将这四点放在一起看,战略图景便清晰可辨:这首先是一种稀疏性和缓存效率优先的架构,其规模设定使得同一结构日后可以扩展。提到“new architecture family”具有实际意义——它是在宣告后面还会有更多。
基准测试:由供应商报告,且尚未被反驳
{{1}}DeepSeek 随发布一同公布了一套基准测试集。{{/1}}{{2}}根据公司自身的数据,V4.1 Flash 在 GPQA Diamond 上得分 90.9,Codeforces 评级为 3471,MathArena Apex 65.6,Terminal-Bench 2.1 为 90.6,DeepSWE v1.1 为 74.2,HLE(使用工具)为 63.9{{/2}}{{3}}——最后一项附带脚注,注明基线 36.8 的数字仅适用于该基准测试的纯文本子集。{{/3}}
如实标注这些数字的本质。它们是供应商自行报告的,发布时没有附随的独立评估,而 DeepSeek 正是用这些数字来为其下架自家旗舰模型辩护——正因如此,它们才是最值得核实的数字。截至9月10日发布时,Artificial Analysis 尚未公布对 DeepSeek V4.1 Flash 的评测数据,Hugging Face 的模型页面也仍保留着该模型“未被任何推理提供商部署”的说明。本次发布的支柱性宣称——即一款 Flash 级模型在性能、成本、速度和总处理时间上全面击败1.6万亿参数旗舰模型——目前只是供应商的一面之词,没有外部审计验证。
另一方面,也有一个诚实的提醒。同一供应商的报告显示,V4.1 Flash 在与 Kimi K3 的 16 项对比中赢了 13 项,与 GLM-5.3 的 13 项对比中赢了 11 项,但在较新的 Terminal-Bench 3.0 和 4.0 任务上以及 ProgramBench 中,仍落后于 GPT-5.6 Sol 和 Claude Opus 5。这是一个连贯的形态——在编码、终端和代理自动化这类该架构擅长的任务上表现最强,在前沿推理任务上较弱——而这正是真正代际跨越应有的形态。
价格,以及值得列入日历的路由交换机。
新定价随发布生效,与之前相同的Flash费率卡,而非降价:在deepseek-flash上,缓存命中的输入价格为非高峰每百万tokens 0.003美元,高峰0.006美元;缓存未命中的输入为0.15美元和0.30美元;输出为0.60美元和1.20美元。高峰价格恰好是非高峰的两倍,适用于工作日的01:00–04:00和06:00–10:00 UTC。
削减反而落在了Pro流量上。DeepSeek V4 Pro的定价为:缓存命中输入$0.022和$0.044,缓存未命中输入$0.66和$1.32,输出$1.98和$3.96——因此,将Pro命名的请求路由到V4.1 Flash,会使它们的输出成本下降约70%,同时,按照DeepSeek的说法,还会提高回答这些请求的能力。

这次重新路由是计划内的,而非假设性的。自2026年9月14日北京时间12:00起,指定deepseek-v4-pro的请求将接入V4.1 Flash,并按Flash价格计费,直至DeepSeek V4.1 Pro发布。如果你的集成硬编码了Pro模型名称,不会出任何问题——你获得的将是另一个模型,输出价格约为原来的三分之一,无需修改代码,也无需关注除变更日志条目以外的任何通知。如果你按能力层级而非模型名称进行路由,那么9月14日就是需要重新测试的日期。
今天调用DeepSeek意味着什么
OrcaRouter 尚未支持 DeepSeek V4.1 Flash——截至今日,deepseek-v4.1-flash 的模型页面仍返回“model not found”,我们宁可直说,也不愿暗示并非如此。由此引出两点。第一,DeepSeek 宣布的重路由属于第一方 API 行为,因此 9 月 14 日的切换发生在 DeepSeek 自己的端点上,无论你通过何种方式访问。第二,如果你今天就想用上新架构,你需要直接调用厂商。
我们路由的是 DeepSeek 产品线的其余部分,共用一个密钥:DeepSeek V4 Flash 和 DeepSeek V4 Pro,以及 200 多个其他模型。其定价为 DeepSeek 提供商列表价格直通,0% 加价——对于此类发布来说,这才是关键所在:当供应商降低费率时,我们这边当天就会生效,而不是在重新定价周期之后。而当 V4.1 Flash 确实上架目录时,上述非高峰半价就是费率本身,而不是我们协商的折扣。
对于这么新的模型,路由论证的关键并不在于价格,而在于你愿意将多少生产路径押注在一个发布仅一周、既没有独立基准测试也没有第三方服务的架构上。将新模型置于一个你可随时切换的层级之后——或用非生产密钥对其进行测试——正是「评估」与「事故」之间的区别。
什么才能解决命名问题
三件事,按照它们会告诉你的信息量升序排列。
对 DeepSeek V4.1 Flash 的独立评估,将在第三方测试框架上检验其架构声明。唯有这样的衡量才能把厂商的数据表变成事实,而这正是最有可能出现的下一条新闻。
DeepSeek V4.1 Pro 将检验这一系列的说法。路由通知将其列为 Pro 至 Flash 窗口的终点,这使其成为整个发布所围绕的核心模型——而它依然是 DeepSeek 确认信息最少的一个:没有模型卡、没有参数量、没有日期、没有权重、没有价格。
还有一个实用但不起眼的问题:DeepSeek是否会再次这样做。如果另一个新的基础模型再次出现.1标签,这就会把异常变成惯例,而惯例是开发者可以围绕来进行规划的。一个模型是特例。只有当形成规律时,这种命名才会以一种有用的方式变得具有误导性。
就目前而言,实际的区分完全取决于你使用的是哪个版本。如果你使用的是 DeepSeek V4 Pro,请在日历上标记9月14日,并在此之前重新运行你的评估,因为那个名字背后的模型正在发生变化,无论你是否要求它改变。如果你使用的是 DeepSeek V4 Flash,你已经在以相同价格被迁移到 DeepSeek 为规模化扩展而构建的架构上。如果你一直在等待 V5,诚实的答案是:DeepSeek 似乎已经发布了这一代产品,却拒绝为它命名——这种事你只能干一次,之后人们就不会再相信这个版本号了。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
