一张 DeepSeek-V4-Flash-Vision-Exp 的英雄标题卡,副标题为“价格与 V4-Flash 相同,现在看得见了”,配有一个眼睛与价格标签结合的线性图标、一个小型圆角徽章(上面写着“EXPERIMENTAL • API • 2026-08-21”),以及位于右下角的 OrcaRouter 标志。
Guides & Insights

DeepSeek V4 Flash Vision (Exp) 已在 API 上线:价格与 V4-Flash 相同,现在具备视觉能力

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4 Flash Vision (Exp) 于今天(2026年8月21日)在 Deep​Seek API 平台上正式上线,而公告中最重要的数字不是基准测试分数——而是价格:这个实验性视觉模型按照与 DeepSeek V4 Flash 完全相同的 token 费率计费,后者是纯文本的主力模型,而该视觉模型在纯文本能力上与它完全匹敌。这标志着 Deep​Seek 自有 API 首次支持图像输入,也意味着运行 1M 上下文智能体的最便宜方式现在免费升级为多模态。

实际发布的内容

DeepSeek V4 Flash Vision (Exp) 是一个实验性多模态模型,通过模型 ID deepseek-v4-flash-vision-exp 进行访问。它接收文本和图像输入,并生成文本输出,支持 100 万 token 的上下文窗口,最大输出 384K token,同时支持思考模式和非思考模式。它支持 Chat Completions 格式、Anthropic 风格的 Messages 以及 Responses 格式,这三者是代理框架无需自定义适配器即可接入该模型所需的三件套。

在图像输入方面,DeepSeek 接受 JPEG、PNG、GIF 和 WebP,可通过三种方式传递:内联 base64、外部 URL,或通过新的 Files API 上传文件。目前尚不支持视频或音频输入——这里的“视觉”仅限静态图像。

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

DeepSeek 在发布说明中的自我定位:纯文本能力——智能体、推理、世界知识——与官方 DeepSeek V4 Flash 版本持平,而多模态智能体能力则实现大幅跃升,接近 Opus-4.8。这是厂商说法,尚未被复现验证,但值得仔细阅读,因为其背后的基准测试细节比那句标题更有意思。

为什么基准测试的提升比看起来更大

以下所有数据均为Deep​Seek于今日发布说明中自行公布的数据,未经独立核实。在嵌入截图和图像的智能体基准测试中,纯文本版DeepSeek V4 Flash并不读取这些内容——它只是忽略任务中的多模态部分。DeepSeek V4 Flash Vision (Exp)则会真正查看图像,这正是两者差异如此之大的原因:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2(Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 对比 V4-Flash 25.2(Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 对比 V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 对比 V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 对比 V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3(纯文本版 V4-Flash 无法尝试此任务)

• ZeroBench Pass@5 — Vision-Exp 35.0(纯文本版 V4-Flash 无法尝试)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

这两个数字值得再看一眼。在 Agents' Last Exam 上,Vision-Exp(27.3)以微弱优势胜过 Opus-4.8(25.7);在 DeepSWE 上,它也击败了 Opus-4.8(59.3 对 58.0)。"接近 Opus-4.8"的说法正是建立在这上面——不是某一个标志性结果,而是一系列 agentic 基准测试:在这些测试中,"看得见屏幕"弥补了与前沿多模态模型之间的大部分差距,同时价格却低了大约一个数量级。

一张图片的成本,精确到小数点

图像按 token 计费——每张最高 384 token——然后按与 DeepSeek V4 Flash 相同的每 token 费率收费。由于 DeepSeek 于 2026 年 8 月 16 日将所有模型改为峰值/非峰值定价,具体数字取决于您调用时的时间:

• 输入,缓存未命中 — 非高峰时段每100万tokens $0.22,高峰时段 $0.44

• 输入,缓存命中 — 非高峰时段每100万token $0.007,高峰时段 $0.014

• 输出 — 非高峰时段每1M tokens $0.66,高峰时段$1.32

• 高峰时段 — 01:00–04:00 和 06:00–10:00 UTC(其余时段均为非高峰时段)

算一下这笔账,视觉成本就几乎可以忽略不计。一张图像按 384 token 上限计算,作为输入,在非高峰时段约为 0.0085 美分,高峰时段约为 0.017 美分。一个智能体在单次运行中读取 50 张截图,增加的输入 token 也只有大约半美分——甚至还没到模型写出第一个输出 token 的时候。Deep​Seek 还会在推理前限制分辨率:低细节模式会调整为 512×512,高细节/原始模式会预先缩放图像(小图放大到约 384×384,大图缩小到约 800×800),因此高分辨率原图绝不会以原始像素数被送入模型。

配角:免费的 Files API 和 Harness 0.1.1

与模型一同提供了两项基础设施组件。Files API 现已上线且免费:图像只需上传一次,即可通过 file_id 引用,并在多次请求间复用,无需重新发送字节数据——这对于在多个轮次中将页面保留在上下文中的浏览代理来说意义重大。同日发布的 Deep​Seek Harness 0.1.1 开箱即可支持该新模型,因此用于基准测试和驱动 Deep​Seek 智能体工作负载的 Harness 可以立即以它为目标。

直白而言的生产注意事项

这是一个实验性模型。Deep​Seek 明确将其标注为实验性模型,尚未公布正式发布(GA)日期,并建议不要直接在生产环境中运行;其公布的计划是根据反馈进行迭代,之后再发布稳定版本。实际结果是,文本大脑已得到验证——它与驱动 V4-Flash 的权重体系同源——但视觉路径是新代码,Deep​Seek 以外还没有人在大规模场景下对其进行过压力测试。

这正是路由层证明自身价值的情形。在 OrcaRouter 上,deepseek/deepseek-v4-flash-vision-exp 与 deepseek/deepseek-v4-flash 同时在一个 API 后面上线,按 Deep​Seek 的标价原价透传,零加价。你可以把包含图片的流量指向该实验模型,并在同一配置中设置自动故障转移:一旦它出错或超时,就立即切换到备用模型——这大大化解了“新代码”问题的风险。路由 DSL 还让你只把真正包含图片的调用发送给视觉模型,同时把纯文本流量保留在 DeepSeek V4 Flash 上,从而在有基准提升的地方获得收益,在没有提升的地方不额外花费一分钱。

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

接下来看什么

{{1}}对于一个实验性发布来说,这些开放性问题都是老生常谈。DeepSeek V4 Flash Vision(Exp)何时达到GA,价格能否保持不变?{{/1}}{{2}}视频或音频输入是否会随之而来——目前该模型仅支持静态图像,这使得大型多模态前沿模型在动态媒体领域尚无对手。{{/2}}{{3}}独立评估(首次第三方在ApexBench或Terminal-Bench上运行)能否复现已公布的数据?{{/3}}{{4}}有趣的是,即使每项基准分数都下滑,有一个已经具备成本效益的主张——以文本价格获得视觉能力——是一个定价事实,而非基准声明,这并不需要复现。{{/4}}

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube