一个用于'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash'的主标题卡片,副标题为'同价,一个看得见',左侧为眼睛线条图标,右侧为文本文档线条图标,由一条细中性分隔线隔开,右下角为OrcaRouter标志。
Guides & Insights

DeepSeek V4 Flash Vision (Exp) 对比 DeepSeek V4 Flash:同价,一个有视觉

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4 Flash Vision (Exp) 和 DeepSeek V4 Flash 本质上是同一个模型,唯一的区别就是全部关键所在:视觉模型能读取图像,而文本模型不能。今天(2026年8月21日),DeepSeek V4 Flash Vision (Exp) 作为实验版本正式发布,其文本大脑与 DeepSeek V4 Flash 毫无二致——相同的 1M token 上下文窗口、相同的 384K 最大输出、相同的 token 价格——并新增了图像输入能力,这重新调整了它在智能体基准测试中的得分,而文本模型在这些测试中悄无声息地落败。唯一真正的问题是,"实验版"这个标签让人付出的代价是否大于它带来的好处。

这两个模型

DeepSeek V4 Flash 是该公司官方的性价比主力模型:一款混合专家(Mixture-of-Experts)模型,总参数约 2840 亿,激活参数约 130 亿,纯文本,针对高并发的日常负载进行了优化,在供应商 API 上提供每秒 2500 token 的并发预算。DeepSeek V4 Flash Vision (Exp) 属于同一权重系列,前面加装了视觉编码器,计费方式相同,并标注为实验性。眼睛以下的部分完全共享。

• 参数 — Vision-Exp: 总计 284B / 激活 MoE 13B,对比 V4-Flash: 总计 284B / 激活 MoE 13B(同一系列)

• 输入 — Vision-Exp:文本 + 图片(JPEG、PNG、GIF、WebP)vs V4-Flash:仅文本

• 上下文 — Vision-Exp: 1M tokens 对比 V4-Flash: 1M tokens

• 最大输出 — Vision-Exp: 384K tokens,V4-Flash: 384K tokens

• 思考模式 — 两者均支持思考和非思考

• API 格式 — 两者:Chat Completions、Messages、Responses

• 价格 — 相同(两者均按 V4-Flash 的峰/谷 token 费率计费)

• 状态 — Vision-Exp: 实验性,暂无 GA 日期;V4-Flash: 正式发布 (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

以远见改变比分

在纯文本方面,Deep​Seek 表示两者不相上下,这没什么可怀疑的——视觉模型正是基于相同的文本能力构建的。差异体现在包含截图、图表和 UI 图像的智能体基准测试中,纯文本模型在这些测试中会完全忽略多模态内容。以下所有数据均来自今天发布说明中的厂商报告,并非独立复现:

• ApexBench Pass@1 — Vision-Exp 36.5 对比 V4-Flash 26.2

• 智能体最后考试 — Vision-Exp 27.3 对比 V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 对比 V4-Flash 82.7

• NL2Repo —— Vision-Exp 57.7 对比 V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 对比 V4-Flash 54.4

• Chartography — Vision-Exp 64.3(V4-Flash 无法尝试)

• ZeroBench Pass@5 — Vision-Exp 35.0(V4-Flash 无法尝试)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

最大的单项提升来自 ApexBench:加入视觉能力后,分数从 26.2 跃升至 36.5——这十分的增长不是因为模型思考得更费力,而是它终于能够读取任务本身。对于一个通过屏幕操作的智能体——浏览器、桌面、带渲染输出的终端——纯文本模型恰恰是在承载信息的那部分任务上处于盲飞状态。

价格问题只有一个答案。

价格上没有区别,这正是比较结果会毫无悬念地倒向某一方的关键所在。DeepSeek V4 Flash Vision(Exp)的计费费率与 DeepSeek V4 Flash 完全相同,后者自2026年8月16日起采用高峰期/非高峰期定价:

• 输入,缓存未命中 — 非高峰时段每100万token 0.22美元,高峰时段0.44美元(两种模型)

• 输入,缓存命中 — 非高峰时段每 1M tokens $0.007,高峰时段 $0.014(两种模型)

• 输出 — 非高峰时段每100万token 0.66美元,高峰时段1.32美元(两个模型均适用)

• 高峰时段 — UTC 时间 01:00–04:00 和 06:00–10:00,两种模型均适用

视觉功能带来的唯一额外成本就是图像本身:每张图像最多被分词为384个token,因此一张截图在非高峰期的成本约为0.0085美分。即使是一个重度依赖视觉的代理,每次运行读取50张图像,输入成本也不到1美分。为了省钱而选择文本模型,无异于捡了芝麻丢了西瓜——这笔节省并不真实。

何时选择哪一个

如果您的流水线有可能接收图像,请选择 DeepSeek V4 Flash Vision (Exp)。UI 测试和基于截图的 QA 代理、需要读取当前页面的网页浏览代理、图表提取、文档截图、从用户屏幕捕获错误信息——在所有这些场景中,视觉模型在同等价格下都是严格更优的模型。据供应商称,文本质量没有任何损失,因此不使用它的唯一理由是稳定性。

选择 DeepSeek V4 Flash 的条件是:您的流量纯为文本,且不会发生任何变化。对于代码补全、检索和纯文本代理循环,两个模型在文本上的得分相同,而正式版按定义是更稳妥的选择。如果您已经在使用 V4-Flash,并且从不发送图像,那么没有理由切换——也没有理由不在路由配置中保留该选项。

唯一真正的区别:实验状态

眼睛以上的部分完全相同;视觉的成本可以忽略不计;基准测试更青睐视觉模型。唯一能让你在生产环境中合理继续使用 DeepSeek V4 Flash 的因素是,视觉模型仍处于实验阶段。DeepSeek 为其贴上了实验性标签,未给出 GA 日期,并表示不建议用于生产环境。它背后的文本大脑已得到验证,但视觉路径是全新的,而实验性的 API 接口恰恰是你不希望在凌晨两点遭遇静默故障的地方。

这是唯一一个规格无法定论、而路由器会改变答案的地方。在 OrcaRouter 上,两个模型——deepseek/deepseek-v4-flash-vision-exp 和 deepseek/deepseek-v4-flash——都已上线,共用一个 API 密钥,按供应商标价直通,零加价。由于同一平台负责两者的路由,你可以在视觉模型值得发挥作用的调用上采用它,而将其他调用固定到官方发布版;自动故障转移确保实验性的小故障永远不会拖垮整个流水线。这样,需要 ApexBench 提升的调用获得那十分的增益,不需要的调用则享有官方发布版的稳定性,而且无需第二份合同或第二条代码路径。

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

底线

如果你的工作负载能接收图像,DeepSeek V4 Flash Vision (Exp) 在每个关键维度上都胜过 DeepSeek V4 Flash,唯一落后的维度是实验状态——而这一点是可以通过工程手段绕开的。如果你的工作负载是纯文本,两者的输出能力相当,正式版则在稳定性上胜出。二者其实算不上真正的竞争对手——视觉模型就是在文本模型基础上解锁了一项技能,且不额外收费。唯一值得做的决定,是你愿意将多少流量指向实验性 API;这是路由决策,而非模型决策。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube