一张用于“DeepSeek V4.1 Flash 对比 DeepSeek V4 Flash”的主标题卡片,副标题为“相同的 Flash 费率卡。重新训练的模型。”,胶囊徽章上标注“发布于 2026 年 9 月 10 日”和“Flash 层级升级”,右下角合成有 OrcaRouter 标志。
Guides & Insights

DeepSeek V4.1 Flash 对比 DeepSeek V4 Flash:相同的 Flash 费率卡,重新训练的模型

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 Flash 从传闻中的继任者变成正式发布的 Flash 模型,这一周时间虽短,却动静不小。9月8日,该模型以模型ID deepseek-v4.1-flash-expires-on-0910 作为为期两天的 API 测试首次亮相——DeepSeek 自己称之为“中间版本”。9月9日,其开放平台表示正式版 DeepSeek V4.1 Flash 将于9月10日左右推出,并称其在能力、成本、速度和端到端时间上“全面超越” DeepSeek V4 Pro。9月10日,发布公告附带了新的 Flash 系列定价表,于北京时间12:00生效,这是 DeepSeek V4 Flash 自8月提价以来从未有过的。无论如何,文本处理主力 DeepSeek V4 Flash 已不再是运行 Flash 工作负载的最新方式,而本文要讲的是,这实际上对您今天正在运行的应用程序意味着什么。

如此早期的比较有失偏颇,在数据出炉之前有必要说明这一点。DeepSeek V4 Flash 有已发布的规格说明卡、DeepSeek-V4-Flash-0731 更新背后一个月的生产流量、开放权重,以及来自 Artificial Analysis 的独立测量数据。DeepSeek V4.1 Flash 只有官方公告和两天的社区速度测试,尚未发布规格卡,也没有技术报告或第三方评分。厂商声明在下文标注为厂商声明;社区数据则标注为社区实测。

Flash 层级刚刚重置——三项变更,为期一周

自7月31日更新以来,DeepSeek V4 Flash——这款拥有2840亿参数、其中130亿激活参数的混合专家(MoE)模型——一直是大部分生产环境文本流量的明智默认选择,兼具低成本与高吞吐。三天内三项公告,令其根基为之动摇:

• 9月8日——DeepSeek向所有API账户开放了V4.1 Flash的限时测试版,并发请求上限为20次,计划于9月10日结束,所用模型名称本身也带有到期日期。

• 9月9日——开放平台宣布,DeepSeek V4.1 Flash 将于9月10日左右正式发布,并描述了一种原生支持多模态的新模型结构,声称其在性能、成本、速度和总完成时间方面均优于 DeepSeek V4 Pro。

9月10日——正式发布带来了一份新的Flash系列价格表,自北京时间12:00起生效,下调了DeepSeek V4 Flash自8月17日涨价以来所收取的费率,那次涨价曾引发开发者的强烈批评。

最后一项值得单独说明,因为它是一次真正意义上的降价,实属罕见。在新价格表中,非高峰时段缓存命中的输入价格从每百万 token ¥0.05 降至 ¥0.02,降幅达 60%;缓存未命中的输入价格则从 ¥1.5 降至 ¥1,输出价格从 ¥4.5 降至 ¥4。高峰时段的费率为非高峰时段的两倍。以美元整数计算,非高峰时段每百万 token 的缓存命中输入约为 $0.003,缓存未命中输入约为 $0.14,输出约为 $0.56,高峰时段则翻倍。八月涨价与此次降价之间相隔的 24 天并非排期上的巧合;此次价格重置是 V4.1 Flash 发布的一部分。

同级不同款

最直观的解读是,V4.1 Flash 就是把 V4 Flash 的速度档位调高了一档。事实并非如此。0731 刷新版本是在现有 DeepSeek V4 Flash 基础上进行的后训练更新——架构相同,284B 总参数 / 13B 激活参数的专家混合(MoE)布局也相同。DeepSeek 对 V4.1 Flash 的描述指向了更大的变化:一种新的模型结构,多家媒体将其解读为一次全新的预训练,而非微调。这一区别很重要,因为重新训练的模型不会像刷新版本那样继承旧模型的行为——即便能力水平不变,提示词处理、工具调用和输出风格也可能全部发生变化。

• 架构 — DeepSeek V4.1 Flash:新的模型结构,DeepSeek 称之为原生支持多模态输入的全新构建。DeepSeek V4 Flash:V4-Flash-0731 后训练刷新版,基于总参数量 284B / 激活参数量 13B 的 MoE。

• 输入 — V4.1 Flash 在基础模型中原生支持文本和图像输入;DeepSeek V4 Flash 仅支持文本,图像需要单独的附加构建 DeepSeek-V4-Flash-Vision-Exp。

上下文与输出——DeepSeek V4 Flash 公布拥有 1M 上下文和 384K 最大输出;DeepSeek 的发布材料称 V4.1 Flash 保留了百万 token 级别的上下文窗口,但尚未发布正式模型卡。

• 并发性 — DeepSeek V4 Flash 列出了 2,500 并发上限;V4.1 Flash 测试版上限为 20,且截至撰写本文时,DeepSeek 对发布版所声称的{{2}}高并发{{/2}}尚未有公布的数字作为支撑。{{1}}{{/1}}

• 权重 — DeepSeek V4 Flash 在 MIT 许可证下开放权重;V4.1 Flash 尚未公布任何相关信息。

• 独立定位 — DeepSeek V4 Flash 已由 Artificial Analysis 进行评测;DeepSeek V4.1 Flash 尚无第三方评分。

{{1}}即使在纯文本对比中,文本与多模态这一要点也值得额外多说一句,因为它决定了 V4.1 Flash 的目标用户是谁。{{/1}} {{2}}如果你的流水线此前分别使用 DeepSeek V4 Flash 处理文本、使用 DeepSeek-V4-Flash-Vision-Exp 处理图像,那么 V4.1 Flash 是首个在一个模型中同时覆盖这两条路径的 DeepSeek 版本——只需维护一个端点,无需在旁边额外挂接编码器。{{/2}}

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

它们真正的不同之处在于:吞吐量以及完成一项任务的成本

在同等价格下,这两款模型的区别体现在速度上,而速度正是数据差异最显著的地方。根据 Artificial Analysis 的测量,DeepSeek V4 Flash 0731 在 DeepSeek 自家 API 上的输出速度约为每秒 120–140 个 token,具体取决于配置和测量窗口。V4.1 Flash 首日测试者报告称,根据任务不同,持续生成速度约为每秒 280 到 500 个 token,在低并发运行时峰值可超过每秒 500 个 token;较高的数字来自社区测量,而非厂商发布,而且每秒 token 数从来不是模型的固有属性。尽管如此,所有首日报告的方向都是一致的,DeepSeek 自身关于生成更快、总完成时间更短的表述也指向同一方向。

这种速度差距改变了经济性,即使两个模型采用相同的费率标准,因为你按 token 付费,而 token 到达得更快。在 V4 Flash 上需要一分钟的长上下文检索或代码生成任务,在 V4.1 Flash 上以相同的每 token 价格可以在极短的时间内完成——首批测试者中有几位报告称,恰恰是在这些任务类别上,端到端速度快了五到六倍。测试版早期那些“花钱更快”的抱怨是同一枚硬币的另一面:在每 token 价格不变的情况下,生成 token 速度快两到三倍的模型,每分钟消耗余额的速度也更快。每个任务的实际账单是否真的下降,取决于新模型是否用更少的 token 和更少的重试次数完成工作,而这恰恰是还没有人能证明的。

在价格卡上,这两个模型并排摆放。在9月10日的价目表上,非高峰时段每百万token:缓存命中的输入为¥0.02,缓存未命中的输入为¥1,输出为¥4,高峰时段价格翻倍。在降价之前,Flash档位的相同价目表为:¥0.05、¥1.5和¥4.5。对于缓存密集型工作负载,降价的亮点在于:¥0.02对比¥0.05,是在构成自动补全或智能体循环输入流大部分的那种token上降低了60%。对于缓存未命中的新摄取作业,节省的成本接近三分之一。所有这些都不会让V4.1 Flash每个token的价格比V4 Flash更便宜——它们共用同一价格卡——但该架构更高的吞吐量是差异点,而且无需额外成本。

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

这些收据是用于 V4 Flash 的;这些索赔是用于 V4.1 Flash 的。

关于这场对决,目前最重要的一项基准事实是:新模型没有任何基准测试数据。DeepSeek V4.1 Flash 的头条宣称——即它在能力、成本和速度上全面超越 DeepSeek V4 Pro——只是厂商自报,尚未得到复现验证。没有公布参数数量、评估表或技术报告,截至撰稿时 Artificial Analysis 也尚未对其进行评测。面对一个上一代旗舰发布时曾接受独立审视的模型家族,“相信我们,它击败了 Pro”这种说法,读者应保持警惕,直到第三方对其进行验证为止。

相比之下,DeepSeek V4 Flash 有着真实的业绩记录。Artificial Analysis 将 0731 推理版本列为其同类模型中的领先者,评分远高于同类开放权重模型的中位数,并测得其在 DeepSeek 自家 API 上的输出吞吐量处于上文引用的每秒约 120–140 token 区间。这些是 V4.1 Flash 自身评分公布时将与之对比的数字,它们设定的标准比“快速便宜的 Flash”这个标签所暗示的要高。新版本所取代的模型并不弱;它是一个真正强大的开放权重主力模型。这正是让这次升级决策具有实质性意义而非流于形式的原因。

路由正在承担繁重的工作——在DeepSeek内部,也在为你服务。

这次发布中报道最少的一点是,DeepSeek 正在其自身模型之间路由流量。其公告说得很明确:从 V4.1 Flash 上线到 V4.1 Pro 发布之前,所有指向 deepseek-v4-pro 的 API 请求都将由 DeepSeek V4.1 Flash 提供服务,并按 Flash 档位价格计费。V4 Pro 调用者无需更改一行代码,即可获得新架构,且每 token 成本降至原来的一小部分。请注意哪些请求不会被路由:deepseek-v4-flash 调用。旧版 Flash 模型会继续为仍指向它的用户提供服务,这正是本次对比存在的原因——如果你在使用 V4 Pro,切换会自动为你完成;如果你在使用 V4 Flash,则需要你自己做出决定。

一家供应商悄然决定用更便宜的模型来承接原本面向其旗舰模型的调用,这是对 V4.1 Flash 的有力背书——而这也是路由层在跨供应商时所应用的同一逻辑。这正是 OrcaRouter 这类平台所填补的空白:一个 API 接入 200+ 模型,供应商挂牌价以 0% 加价直接透传,因此 DeepSeek 9 月 10 日的 Flash 降价当天就在我们这边生效。OrcaRouter 上的 DeepSeek V4 Flash仍然可以像你运行的所有其他模型一样使用同一个密钥调用,这让上线当天即安全采用新模型的做法变得真正划算:将一部分流量指向 DeepSeek 官方 API 上的 DeepSeek V4.1 Flash,在同一路由规则中将 DeepSeek V4 Flash 保留为自动回退,让故障转移为边缘情况兜底,同时让新架构凭实力证明自己。

DeepSeek V4.1 Flash 对比 DeepSeek V4 Flash:你应该调用哪个?

如果诚实的答案是所有人都适用同一种型号,那就不会有这篇文章了。这两者现在适用于不同的风险特征,而且界限异常分明。

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

如果你今天要启动新的 Flash 工作负载,如果延迟和吞吐量是决定性约束,如果你希望在不维护第二个模型的情况下获得图像输入,或者你愿意让 DeepSeek 自身的路由机制来化解 Pro 层级主张的风险——那就迁移到 DeepSeek V4.1 Flash。该模型以 deepseek-v4.1-flash 的名称在 DeepSeek 第一方 API 上提供,定价与其所取代的模型同属 Flash 价格档位,而且上线首日的每一条信号都表明它明显更快。

如果你以公布的 2,500 并发上限承载生产流量,如果你依赖其开放权重进行自托管或满足合规要求,或者如果你的提示词、评估和工具调用逻辑是针对 0731 行为调优的,无法在第一天就适应重新训练模型的各种差异,那么请继续使用 DeepSeek V4 Flash。一次全新的预训练运行带来的是行为变化,而不仅仅是速度变化;0731 版本才是拥有一个月实打实验证记录的版本。

对大多数团队而言,稳妥的默认选择是折中路线:将 DeepSeek V4.1 Flash 作为新工作负载的默认选项,将 DeepSeek V4 Flash 保留为创收工作负载的故障转移方案,并让第一份独立评分卡——加上已发布的规格卡和并发数——来平息任何为期两天的测试版都无法定论的争论。Flash 层级刚刚获得了新引擎;旧引擎并未过时,它正是基准。

好奇当 DeepSeek 以 Flash 价格将 Pro 级流量路由到 V4.1 Flash 时,流量会是什么样子?OrcaRouter 上的 DeepSeek V4 Pro — 两者使用同一个密钥,按 DeepSeek 的标价计费。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新