
DeepSeek V4 Flash Vision (Exp) 对比 DeepSeek V4 Flash:同价,一个有视觉
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
DeepSeek V4 Flash Vision (Exp) 和 DeepSeek V4 Flash 本质上是同一个模型,唯一的区别就是全部关键所在:视觉模型能读取图像,而文本模型不能。今天(2026年8月21日),DeepSeek V4 Flash Vision (Exp) 作为实验版本正式发布,其文本大脑与 DeepSeek V4 Flash 毫无二致——相同的 1M token 上下文窗口、相同的 384K 最大输出、相同的 token 价格——并新增了图像输入能力,这重新调整了它在智能体基准测试中的得分,而文本模型在这些测试中悄无声息地落败。唯一真正的问题是,"实验版"这个标签让人付出的代价是否大于它带来的好处。
这两个模型
DeepSeek V4 Flash 是该公司官方的性价比主力模型:一款混合专家(Mixture-of-Experts)模型,总参数约 2840 亿,激活参数约 130 亿,纯文本,针对高并发的日常负载进行了优化,在供应商 API 上提供每秒 2500 token 的并发预算。DeepSeek V4 Flash Vision (Exp) 属于同一权重系列,前面加装了视觉编码器,计费方式相同,并标注为实验性。眼睛以下的部分完全共享。
• 参数 — Vision-Exp: 总计 284B / 激活 MoE 13B,对比 V4-Flash: 总计 284B / 激活 MoE 13B(同一系列)
• 输入 — Vision-Exp:文本 + 图片(JPEG、PNG、GIF、WebP)vs V4-Flash:仅文本
• 上下文 — Vision-Exp: 1M tokens 对比 V4-Flash: 1M tokens
• 最大输出 — Vision-Exp: 384K tokens,V4-Flash: 384K tokens
• 思考模式 — 两者均支持思考和非思考
• API 格式 — 两者:Chat Completions、Messages、Responses
• 价格 — 相同(两者均按 V4-Flash 的峰/谷 token 费率计费)
• 状态 — Vision-Exp: 实验性,暂无 GA 日期;V4-Flash: 正式发布 (V4-Flash-0731)

以远见改变比分
在纯文本方面,DeepSeek 表示两者不相上下,这没什么可怀疑的——视觉模型正是基于相同的文本能力构建的。差异体现在包含截图、图表和 UI 图像的智能体基准测试中,纯文本模型在这些测试中会完全忽略多模态内容。以下所有数据均来自今天发布说明中的厂商报告,并非独立复现:
• ApexBench Pass@1 — Vision-Exp 36.5 对比 V4-Flash 26.2
• 智能体最后考试 — Vision-Exp 27.3 对比 V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 对比 V4-Flash 82.7
• NL2Repo —— Vision-Exp 57.7 对比 V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 对比 V4-Flash 54.4
• Chartography — Vision-Exp 64.3(V4-Flash 无法尝试)
• ZeroBench Pass@5 — Vision-Exp 35.0(V4-Flash 无法尝试)

最大的单项提升来自 ApexBench:加入视觉能力后,分数从 26.2 跃升至 36.5——这十分的增长不是因为模型思考得更费力,而是它终于能够读取任务本身。对于一个通过屏幕操作的智能体——浏览器、桌面、带渲染输出的终端——纯文本模型恰恰是在承载信息的那部分任务上处于盲飞状态。
价格问题只有一个答案。
价格上没有区别,这正是比较结果会毫无悬念地倒向某一方的关键所在。DeepSeek V4 Flash Vision(Exp)的计费费率与 DeepSeek V4 Flash 完全相同,后者自2026年8月16日起采用高峰期/非高峰期定价:
• 输入,缓存未命中 — 非高峰时段每100万token 0.22美元,高峰时段0.44美元(两种模型)
• 输入,缓存命中 — 非高峰时段每 1M tokens $0.007,高峰时段 $0.014(两种模型)
• 输出 — 非高峰时段每100万token 0.66美元,高峰时段1.32美元(两个模型均适用)
• 高峰时段 — UTC 时间 01:00–04:00 和 06:00–10:00,两种模型均适用
视觉功能带来的唯一额外成本就是图像本身:每张图像最多被分词为384个token,因此一张截图在非高峰期的成本约为0.0085美分。即使是一个重度依赖视觉的代理,每次运行读取50张图像,输入成本也不到1美分。为了省钱而选择文本模型,无异于捡了芝麻丢了西瓜——这笔节省并不真实。
何时选择哪一个
如果您的流水线有可能接收图像,请选择 DeepSeek V4 Flash Vision (Exp)。UI 测试和基于截图的 QA 代理、需要读取当前页面的网页浏览代理、图表提取、文档截图、从用户屏幕捕获错误信息——在所有这些场景中,视觉模型在同等价格下都是严格更优的模型。据供应商称,文本质量没有任何损失,因此不使用它的唯一理由是稳定性。
选择 DeepSeek V4 Flash 的条件是:您的流量纯为文本,且不会发生任何变化。对于代码补全、检索和纯文本代理循环,两个模型在文本上的得分相同,而正式版按定义是更稳妥的选择。如果您已经在使用 V4-Flash,并且从不发送图像,那么没有理由切换——也没有理由不在路由配置中保留该选项。
唯一真正的区别:实验状态
眼睛以上的部分完全相同;视觉的成本可以忽略不计;基准测试更青睐视觉模型。唯一能让你在生产环境中合理继续使用 DeepSeek V4 Flash 的因素是,视觉模型仍处于实验阶段。DeepSeek 为其贴上了实验性标签,未给出 GA 日期,并表示不建议用于生产环境。它背后的文本大脑已得到验证,但视觉路径是全新的,而实验性的 API 接口恰恰是你不希望在凌晨两点遭遇静默故障的地方。
这是唯一一个规格无法定论、而路由器会改变答案的地方。在 OrcaRouter 上,两个模型——deepseek/deepseek-v4-flash-vision-exp 和 deepseek/deepseek-v4-flash——都已上线,共用一个 API 密钥,按供应商标价直通,零加价。由于同一平台负责两者的路由,你可以在视觉模型值得发挥作用的调用上采用它,而将其他调用固定到官方发布版;自动故障转移确保实验性的小故障永远不会拖垮整个流水线。这样,需要 ApexBench 提升的调用获得那十分的增益,不需要的调用则享有官方发布版的稳定性,而且无需第二份合同或第二条代码路径。

底线
如果你的工作负载能接收图像,DeepSeek V4 Flash Vision (Exp) 在每个关键维度上都胜过 DeepSeek V4 Flash,唯一落后的维度是实验状态——而这一点是可以通过工程手段绕开的。如果你的工作负载是纯文本,两者的输出能力相当,正式版则在稳定性上胜出。二者其实算不上真正的竞争对手——视觉模型就是在文本模型基础上解锁了一项技能,且不额外收费。唯一值得做的决定,是你愿意将多少流量指向实验性 API;这是路由决策,而非模型决策。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
