
DeepSeek V4 Flash Vision (Exp) 已在 API 上线:价格与 V4-Flash 相同,现在具备视觉能力
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
DeepSeek V4 Flash Vision (Exp) 于今天(2026年8月21日)在 DeepSeek API 平台上正式上线,而公告中最重要的数字不是基准测试分数——而是价格:这个实验性视觉模型按照与 DeepSeek V4 Flash 完全相同的 token 费率计费,后者是纯文本的主力模型,而该视觉模型在纯文本能力上与它完全匹敌。这标志着 DeepSeek 自有 API 首次支持图像输入,也意味着运行 1M 上下文智能体的最便宜方式现在免费升级为多模态。
实际发布的内容
DeepSeek V4 Flash Vision (Exp) 是一个实验性多模态模型,通过模型 ID deepseek-v4-flash-vision-exp 进行访问。它接收文本和图像输入,并生成文本输出,支持 100 万 token 的上下文窗口,最大输出 384K token,同时支持思考模式和非思考模式。它支持 Chat Completions 格式、Anthropic 风格的 Messages 以及 Responses 格式,这三者是代理框架无需自定义适配器即可接入该模型所需的三件套。
在图像输入方面,DeepSeek 接受 JPEG、PNG、GIF 和 WebP,可通过三种方式传递:内联 base64、外部 URL,或通过新的 Files API 上传文件。目前尚不支持视频或音频输入——这里的“视觉”仅限静态图像。

DeepSeek 在发布说明中的自我定位:纯文本能力——智能体、推理、世界知识——与官方 DeepSeek V4 Flash 版本持平,而多模态智能体能力则实现大幅跃升,接近 Opus-4.8。这是厂商说法,尚未被复现验证,但值得仔细阅读,因为其背后的基准测试细节比那句标题更有意思。
为什么基准测试的提升比看起来更大
以下所有数据均为DeepSeek于今日发布说明中自行公布的数据,未经独立核实。在嵌入截图和图像的智能体基准测试中,纯文本版DeepSeek V4 Flash并不读取这些内容——它只是忽略任务中的多模态部分。DeepSeek V4 Flash Vision (Exp)则会真正查看图像,这正是两者差异如此之大的原因:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2(Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 对比 V4-Flash 25.2(Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 对比 V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 对比 V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 对比 V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3(纯文本版 V4-Flash 无法尝试此任务)
• ZeroBench Pass@5 — Vision-Exp 35.0(纯文本版 V4-Flash 无法尝试)

这两个数字值得再看一眼。在 Agents' Last Exam 上,Vision-Exp(27.3)以微弱优势胜过 Opus-4.8(25.7);在 DeepSWE 上,它也击败了 Opus-4.8(59.3 对 58.0)。"接近 Opus-4.8"的说法正是建立在这上面——不是某一个标志性结果,而是一系列 agentic 基准测试:在这些测试中,"看得见屏幕"弥补了与前沿多模态模型之间的大部分差距,同时价格却低了大约一个数量级。
一张图片的成本,精确到小数点
图像按 token 计费——每张最高 384 token——然后按与 DeepSeek V4 Flash 相同的每 token 费率收费。由于 DeepSeek 于 2026 年 8 月 16 日将所有模型改为峰值/非峰值定价,具体数字取决于您调用时的时间:
• 输入,缓存未命中 — 非高峰时段每100万tokens $0.22,高峰时段 $0.44
• 输入,缓存命中 — 非高峰时段每100万token $0.007,高峰时段 $0.014
• 输出 — 非高峰时段每1M tokens $0.66,高峰时段$1.32
• 高峰时段 — 01:00–04:00 和 06:00–10:00 UTC(其余时段均为非高峰时段)
算一下这笔账,视觉成本就几乎可以忽略不计。一张图像按 384 token 上限计算,作为输入,在非高峰时段约为 0.0085 美分,高峰时段约为 0.017 美分。一个智能体在单次运行中读取 50 张截图,增加的输入 token 也只有大约半美分——甚至还没到模型写出第一个输出 token 的时候。DeepSeek 还会在推理前限制分辨率:低细节模式会调整为 512×512,高细节/原始模式会预先缩放图像(小图放大到约 384×384,大图缩小到约 800×800),因此高分辨率原图绝不会以原始像素数被送入模型。
配角:免费的 Files API 和 Harness 0.1.1
与模型一同提供了两项基础设施组件。Files API 现已上线且免费:图像只需上传一次,即可通过 file_id 引用,并在多次请求间复用,无需重新发送字节数据——这对于在多个轮次中将页面保留在上下文中的浏览代理来说意义重大。同日发布的 DeepSeek Harness 0.1.1 开箱即可支持该新模型,因此用于基准测试和驱动 DeepSeek 智能体工作负载的 Harness 可以立即以它为目标。
直白而言的生产注意事项
这是一个实验性模型。DeepSeek 明确将其标注为实验性模型,尚未公布正式发布(GA)日期,并建议不要直接在生产环境中运行;其公布的计划是根据反馈进行迭代,之后再发布稳定版本。实际结果是,文本大脑已得到验证——它与驱动 V4-Flash 的权重体系同源——但视觉路径是新代码,DeepSeek 以外还没有人在大规模场景下对其进行过压力测试。
这正是路由层证明自身价值的情形。在 OrcaRouter 上,deepseek/deepseek-v4-flash-vision-exp 与 deepseek/deepseek-v4-flash 同时在一个 API 后面上线,按 DeepSeek 的标价原价透传,零加价。你可以把包含图片的流量指向该实验模型,并在同一配置中设置自动故障转移:一旦它出错或超时,就立即切换到备用模型——这大大化解了“新代码”问题的风险。路由 DSL 还让你只把真正包含图片的调用发送给视觉模型,同时把纯文本流量保留在 DeepSeek V4 Flash 上,从而在有基准提升的地方获得收益,在没有提升的地方不额外花费一分钱。

接下来看什么
{{1}}对于一个实验性发布来说,这些开放性问题都是老生常谈。DeepSeek V4 Flash Vision(Exp)何时达到GA,价格能否保持不变?{{/1}}{{2}}视频或音频输入是否会随之而来——目前该模型仅支持静态图像,这使得大型多模态前沿模型在动态媒体领域尚无对手。{{/2}}{{3}}独立评估(首次第三方在ApexBench或Terminal-Bench上运行)能否复现已公布的数据?{{/3}}{{4}}有趣的是,即使每项基准分数都下滑,有一个已经具备成本效益的主张——以文本价格获得视觉能力——是一个定价事实,而非基准声明,这并不需要复现。{{/4}}
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
