
DeepSeek V4.1 Flash 开启为期两天的 API 测试版:新架构、原生多模态与专业级雄心
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
DeepSeek V4.1 Flash 出现在 DeepSeek 惯于在正式宣布之前测试新东西的地方:正式 API 环境中,而且它的模型 ID 本身就带着到期日期。这个 ID——deepseek-v4.1-flash-expires-on-0910——于 2026 年 9 月 8 日开始提供服务,此前 DeepSeek 团队已在官方社区群中发布了“中间版本”内部测试;末尾的 0910 就是整个事件的缩影。这是一个被投放到真实 API 环境中的构建版本,用于有限测试,按计划将在 9 月 10 日前后下线,之后才是爆料者所称“很快”就会发布的官方公告。这并非正式发布:没有模型卡,没有技术报告,没有更新日志条目,而且截至今晚,DeepSeek 公开的 Models & Pricing 页面仍然只列出 DeepSeek V4 Flash、DeepSeek V4 Pro 和 DeepSeek-V4-Flash-Vision-Exp。
下文所有内容都应带着那个星号来读。这里的官方渠道是一份社群公告及随附的反馈表单,而非发布说明。以下内容汇集了该公告、中文媒体在公告发布数小时内的报道,以及开发者用自己的密钥指向该端点后取得的首日测量数据——其中厂商的说法与社群的数据均已按各自性质明确标注。
今天到底发生了什么
北京时间9月8日15:00左右,DeepSeek团队向其官方社区群表示,在最终版本发布之前,正在真实API环境中对一个中间版本——在中文里称为“中间版本”,也就是介于中间的检查点——进行有限测试。任何拥有DeepSeek API密钥的人都可以调用它:保留你现有的base URL和密钥,将模型名称设置为deepseek-v4.1-flash-expires-on-0910。这就是访问的全部详情——没有单独的端点,没有候补名单,也没有新的控制台。
实际的运行空间相当有限。后缀编码了计划:测试版本“将于9月10日自动过期并下线”,大约只有两天的运行时间。每个账户被限制为20个并发请求——而DeepSeek为其deepseek-v4-flash公布的并发限制为2,500——这强烈暗示了其意图:这是用于功能测试和评估,而非承载生产流量。
• 它是什么——放置在实时 API 中的一个“中间版本”检查点,用于在正式构建之前进行短期测试。
• 运行位置 — DeepSeek 自己的 API;基础 URL 和密钥不变,模型名称更换为 deepseek-v4.1-flash-expires-on-0910。
• 多久——名称显示到期时间为0910;该测试预计将在9月10日左右下线。
• 谁可以调用它——任何拥有DeepSeek密钥的账户,每个账户20个并发请求。

测试版收费明细:DeepSeek V4 Flash 费率卡
DeepSeek 表示,该测试的计费费率与 deepseek-v4-flash 相同,适用该模型当前的费率表。自 2026 年 8 月 16 日重新定价以来,DeepSeek 实行高峰/非高峰定价;具体数字以 Flash 层级的官方数据为准:
• 输入,缓存命中 — 非高峰时段每100万token $0.007,高峰时段 $0.014
• 输入,缓存未命中 — 非高峰时段每100万tokens $0.22,高峰时段 $0.44
• 输出 — 非高峰时段每1M tokens $0.66,高峰时段$1.32
• 高峰时段 — 周一至周五 01:00–04:00 和 06:00–10:00 UTC;其他所有时段为低谷时段,费率为高峰时段的一半

注意没有改变的是什么:每 token 的价格。因此,DeepSeek 称 V4.1 Flash“成本更低”是一种效率层面的说法,而非降价——这一点,几位上线首日的测试者是以昂贵的方式体会到的:他们眼看着一段五分钟的会话从余额中扣除的金额,明显高于在 DeepSeek V4 Flash 上消耗相同实际时间所需扣除的金额,因为这个模型消耗 token 的速度要快得多。每项任务的成本是否真的下降,取决于它能否用更少的 token 和更少的重试来完成工作;仅凭两天的速度测试,任何人都无从判断。
“新架构、原生多模态”意味着什么——截至目前,尚未得到验证。
DeepSeek官方对V4.1 Flash的描述涵盖四项主张:新模型结构、原生多模态支持、更强能力,以及更快的生成速度。其中,架构主张格外突出,因为它打破了既有模式。此前的版本更新——DeepSeek V4 Flash 0731——是一次后训练更新,架构和规模均与其预览版保持一致;而DeepSeek此次的措辞指向了结构性变化,多家媒体将其解读为模型经过重新预训练而非微调。除此之外,其余皆为推断。社区关于其改动注意力机制、调整专家网络或集成视觉模块的猜测,恰恰就是——猜测。目前没有公布参数数量、上下文窗口数值或基准测试表格,也没有发布技术报告。
“native multimodal”这一措辞之所以重要,有其具体原因。DeepSeek-V4-Flash-Vision-Exp 于 8 月 21 日发布,自 8 月 31 日起开放权重,它是在 DeepSeek V4 Flash 文本底座上加装了一个视觉编码器——DeepSeek 自己的资料也将这一组合描述为“文本模型+外部视觉通路”。V4.1 Flash 则被描述为从底层起即为多模态,图像与文本输入由基础模型本身处理。这原则上确实是真正的架构差异,但模态规格尚未公布:测试者实际运行的是文本加图像的输入,因此在模型卡发布之前,读者只能在“文本+图像”这一意义上将“multimodal”视为“已确认”。至于计划中是否包含更广泛的输入集合,截至本文撰写之时,仍是未知,而非已确认。
速度是头条 — 而这是一项社区衡量标准。
首日流传的数字是,长文本生成中每秒大约420个输出token,个别运行的速度峰值据报超过500 token/s。一个广为分享的测试在不到三分钟内生成了超过71,000个token。这一切都不是官方的:这些是开发者针对beta端点在不受控条件下测出的数据,DeepSeek也没有发布自己的速度基准。作为参照,Artificial Analysis 测得的公开 DeepSeek V4 Flash 0731 端点速度约为128 token/s,因此这些早期报告指向原始吞吐量大约三倍以上的跃升——但通常要提醒的是,吞吐量取决于输入长度、并发数和服务器状况。
与DeepSeek-V4-Flash-Vision-Exp的端到端对比是差距最明显的地方,因为它们是在同一任务上背靠背进行测量的。测试人员报告,在SVG代码生成任务上端到端速度大约快6倍,在49k token的长上下文检索上大约快5.2倍,在大规模SQL生成与优化任务上约快5倍,在算法问题上快4.6倍,在异步重构任务上快3.9倍。请将这些视为参考性数据,而非精确值:同任务的端到端数字综合了思考时间、首token延迟和生成速度,而且它们来自个别测试人员,而非受控测试套件。值得关注的是所有结果中一致的趋势方向,而不是任何单一的倍率。
beta 版核心的问题
最具战略性的细节隐藏在DeepSeek随测试附带的反馈表单中。除了关于智能体框架和真实场景的问题外,它还直接询问测试者:DeepSeek V4.1 Flash中间版本“能否完全替代在线的DeepSeek V4 Pro”。对一家公司来说,向用户提出这样一个问题非同寻常,因为DeepSeek V4 Pro的定价比Flash高出整整三个价格档位:按当前官方价格,Pro模型在非高峰时段每100万输入token(缓存未命中)收费0.66美元,每100万输出token收费1.98美元;而DeepSeek V4 Flash分别为0.22美元和0.66美元——每一行都是整整3倍。如果一个Flash档次的模型真的能以Flash级价格接近Pro级能力,那么对大量用户而言,这个问题便有了不言自明的答案,而DeepSeek对此心知肚明。
结合“新结构”的措辞来读,这份问卷暗示V4.1 Flash是某种比单点刷新更大的布局中的第一个可见步骤——即重新定位Flash产品线,以压缩与旗舰机型的差距,正如DeepSeek一再使用更便宜、更快的模型来重置市场对某个价格档位所能买到什么的预期。这一切都没有基准测试来证实;它只是对一个只有两句话的问题所作的战略性解读。但这是DeepSeek一整天来关于V4.1 Flash所说的最有趣的内容。
在哪里试用,与此同时生产环境该运行什么?
在测试窗口期内,唯一能访问V4.1 Flash的途径就是DeepSeek自己的API——没有第三方托管这个两天后就会过期的构建版本,任何人也不应该将生产链路接到一个计划停止响应的模型ID上。接下来两天的合理用途是评估:运行你有代表性的工作负载、衡量质量和真实的token成本,并把你看到的每一个速度数字都当作传闻对待,直到正式版本随模型卡一起发布。
对于必须持续正常工作的流量,公开的 DeepSeek 系列保持不变,而这正是路由层体现自身价值之处。在 OrcaRouter 上,DeepSeek V4 Flash、DeepSeek V4 Pro 和 DeepSeek-V4-Flash-Vision-Exp 均可通过同一个 API 访问,按 DeepSeek 官方标价透传,零加价——因此,八月降价从落地当天起就在我们这边生效,而不是等哪个利润率表格终于处理到它才生效。当正式的 V4.1 Flash 最终向服务商推出时,同样的配置便是一种低切换成本的采用方式:把一部分流量交给新模型,将 DeepSeek V4 Flash 或 V4 Pro 保留为自动故障转移,由路由 DSL 决定哪些调用值得尝试尚未验证的新模型,哪些应继续留在主力模型上。你不必把生产路径押在一个两天的 beta 版上,才能知道它到底行不行。

开放性问题
• 正式发布是什么时候?标记出该模型的信号称,发布公告预计“很快”就会到来;测试版仅持续了两天,表明 DeepSeek 并不打算让世界等太久。
• 最终构建与这个一致吗?追踪 DeepSeek 测试周期的独立测试人员指出,该公司似乎同时在运行多个候选构建,而早期测试中速度最快的候选并不总是最终发布的那一个——因此,今天的速度数据可能无法代表 GA 模型。
• 规格参数是什么?参数量、架构细节、上下文长度以及完整的输入模态列表均未公开,而这些正是一篇真正的评测首先需要的内容。
• 价格是否保持不变?"更低成本"能否经得起真实工作负载的检验?该测试版按 DeepSeek V4 Flash 的费率计费;正式发布可能带来新的费率表,而每项任务的成本尚未被测算。
• 它真能胜任 Pro 级别的任务吗?问卷抛出了这个问题,但只有对智能体与推理套件的独立评估——也就是当今划定 Flash 与 Pro 级别差异的基准——才能给出答案。
如果你有 DeepSeek 密钥,重点就在于这两天的倒计时:赶在 deepseek-v4.1-flash-expires-on-0910 消失之前调用它,运行你自己的工作负载,并把数字归入"社区实测,条件各异"的门类。至于其他人,值得关注的是发布公告,以及它背后的问题——DeepSeek 最便宜的层级是否刚刚开始瞄准它最昂贵的层级。
趁这两天的测试版还没完全理顺,你现在便能真正运行的稳定版 Flash 模型,只需一次 API 调用:OrcaRouter 上的 DeepSeek V4 Flash——按 DeepSeek 官方标价直通,0% 加价。
以及beta问卷一直要求测试者将V4.1 Flash与之对比的旗舰模型:OrcaRouter上的DeepSeek V4 Pro。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
