一张标题卡对比 Ling-3.0-flash-VL 与 DeepSeek V4 Flash Vision Exp,显示 Ling 总参数 124B、激活参数 5.5B,上下文窗口 262K;而 DeepSeek V4 Flash Vision Exp 约为 305B 参数,上下文窗口 100 万 token,最大输出 384K。页脚注明:Ling 的指数依据 Artificial Analysis,DeepSeek 的数据为厂商报告。
Guides & Insights

Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp:开放视觉的两种押注

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.0-flash-VLDeepSeek V4 Flash Vision Exp是这一权重级别中团队如今能够切实下载并部署的两个开放权重视觉模型,而打造它们的人对视觉究竟为何物各执一词。Ling-3.0-flash-VL 来自蚂蚁集团的 inclusionAI 实验室,每个 token 激活其 124B 参数中的约 5.5B,并把视觉视为要在反馈回路内部加以运用的东西——生成、渲染、观察、纠正——且以尽可能低的推理成本完成。DeepSeek V4 Flash Vision Exp 是 DeepSeek 的首款多模态模型,将 1M token 的上下文窗口与 384K token 的最大输出搭配在一起,把视觉视为智能体在完成一项长任务途中所读取的又一种输入。一个的优化目标,是思考起来成本能有多低。另一个的优化目标,则是思考之余能容纳多少。

真正应该左右选择的,是那一点差异,而不是基准测试分数的差距。这两个模型没有可供比较的共同评估协议,而且其中只有一个有独立评分。接下来是对这场对比的坦诚呈现:架构上的押注、真正存在差异的规格、基准测试情况(包括它为何单薄)、各自成本,以及哪一款更适合哪类任务——还有我们明确说明这两者中哪一个在我们的产品目录中的部分。

这两个赌注,准确表述

Ling 这一侧押注的是把激活稀疏性作为首要的成本杠杆。Ling-3.0-flash-VL 是一个总参数量为 124B 的稀疏混合专家模型——模型卡显示约为 124.8B,而 SGLang cookbook 描述为 5.1B 激活参数,模型卡上写的则约为 5.5B——它运行一个 42 层的混合主干,以 5:1 的比例交替使用 Kimi Delta Attention 与门控 MLA 块。一个任意分辨率的视觉编码器和一个两层 MLP 投影器为该主干提供输入,VideoRoPE 负责处理空间与时间位置,使视频帧以连贯的顺序落位。其架构上的结果是,该模型每 token 的运行成本仅为稠密 124B 模型的一小部分,而这正是它出现在智能与激活参数量前沿上的全部原因。

DeepSeek 这一侧押注的是上下文与智能体持久力。DeepSeek V4 Flash Vision Exp 采用 DeepSeek-V4-Flash 的文本架构,加入视觉编码器和对齐器,然后继续训练——有消息来源称结果约为 305B 参数,而 DeepSeek 尚未详细确认。它具备 1,048,576 个 token 的上下文窗口和 384,000 个 token 的最大输出,支持 JSON 输出、工具调用、Responses API、Anthropic API 以及对话前缀续写,而且 DeepSeek 已明确表示这不是一个视觉问答模型。它是面向智能体的感知:读取网页截图、软件界面和图表,然后继续进入工具调用。图像会转换为 token 并据此计费,每张图像上限为 384 个 token。

把这两段合起来读,决策的轮廓就浮现了。如果你的工作负载是“看看这个,决定点什么,行动,再看一次”,Ling 的活跃参数数量正是让这个循环成本可承受的原因,而它的视觉反馈设计也正是为此而设。如果你的工作负载是“读完这份带图表的 400 页文档并一直读下去”,DeepSeek 的上下文窗口就是关键特性,Ling 这边没有任何东西能与之竞争。

为什么基准比较比看起来更单薄

这是大多数对比都会略过的一节,而略过它,得到的只是一张毫无意义的数字表格。以下是证据的真实状况。

Ling-3.0-flash-VL 有一项独立测量结果:在 Artificial Analysis Intelligence Index v4.3 上得 25 分,在其规模类别中 64 个模型里排名第 2,而该类别中位数为 8。厂商的卡片另行声称在 Intelligence Index protocol v4.1.1 上达到 42 分,但这是一个已退役的评测标准,不具可比性——应将该 42 分视为未经复现。

DeepSeek V4 Flash Vision Exp根本没有 Artificial Analysis 页面。为它发布的每一个数字都来自 DeepSeek 自己,出自发布公告,而且其中好几个明确是相对于 Opus-4.8,而不是相对于某个固定协议。这并不是在批评这些数字;而是在说明你能用它们做什么。你无法把一个由独立机构评分的模型和一个仅由厂商评分的模型放进同一栏里然后宣布谁胜出,任何这样做的页面都是在凭空制造结果。

正当的做法是将每个模型与其自身报告的成绩进行比较,并附上来源出处:

• Ling-3.0-flash-VL,独立评测 — 在 v4.3 上智能指数为 25,同类 64 个模型中排名第 2,同类中位数为 8,数据来自 Artificial Analysisbr /> • Ling-3.0-flash-VL,厂商 — 在已停用的 v4.1.1 协议上为 42,并在 Image-to-WebDev Arena 中以 "linthium" 身份取得 1,441,对手 GPT-5.4 为 1,440;两者均为厂商报告,且该竞技场的差距在 Elo 噪声范围内br /> • DeepSeek V4 Flash Vision Exp,厂商 — Terminal Bench 2.1 为 83.9;DeepSWE 为 59.3,对手 Opus-4.8 为 58.0;Agents' Last Exam 为 27.3,对手 Opus-4.8 为 25.7;Toolathlon-Verified 为 75.9;Cybergym 为 75.3;Chartography 为 64.3;NL2Repo 为 57.7;DSBench-Hard 为 63.6;ZeroBench Pass@5 为 35.0;ApexBench Pass@1 为 36.5;AutomationBench 为 25.7br /> • DeepSeek V4 Flash Vision Exp,独立评测 — 未发布任何结果

注意 DeepSeek 那份清单主要由什么构成:智能体和软件工程评测,而非视觉评测。DeepSeek 自己的说法是,在纯文本任务上,该视觉模型与官方 DeepSeek-V4-Flash 持平,没有性能回退;提升主要体现在多模态智能体基准上——但 DeepSeek 将这一结果描述为接近 Opus-4.8,而非超越它,并承认在结构化数据科学与代码任务 NL2Repo 和 DSBench-Hard 上存在大约十分的差距。这是一组异常谨慎的说法,它表明这款模型被推销为对现有智能体技术栈的感知升级,而不是一个新的天花板。

A two-column comparison scoreboard for Ling-3.0-flash-VL and DeepSeek V4 Flash Vision Exp across six shared dimensions: Intelligence Index 25 on v4.3 versus none published, active parameters 5.5B versus undisclosed, context window 262K versus 1M tokens, max output tens of thousands versus 384K, license MIT versus MIT, and independent score yes versus none, with a footer noting the Ling figure is per Artificial Analysis and all DeepSeek figures are vendor-reported.

真正出现分歧的规格

两份规格表的大部分内容都一致:两者都在 MIT 许可下开放权重,都接受文本和图像输入并返回文本,都提供 BF16 权重以及量化版本,都已发布服务部署方案,并且都以某种形式支持视频。分歧集中在四个地方。

• 参数 — Ling-3.0-flash-VL 总计 124B,每个 token 激活约 5.5B;据报道 DeepSeek V4 Flash Vision Exp 约为 305B,但未公布激活参数量br /> • 上下文窗口 — 据 Artificial Analysis 测量,Ling-3.0-flash-VL 为 262K token,而其自家模型卡标注为 256K;DeepSeek V4 Flash Vision Exp 原生支持 1,048,576 tokenbr /> • 最大输出 — Ling-3.0-flash-VL 短得多,仅为数万 token 量级;DeepSeek V4 Flash Vision Exp 可达 384,000br /> • 图像处理 — Ling-3.0-flash-VL 每次请求最多接受 40 张图像,每张最高 16,384 × 784 像素,仅支持 base64;DeepSeek V4 Flash Vision Exp 支持 base64、外部 URL 或 Files API 引用,并将每张图像的图像成本上限设为 384 tokenbr /> • 激活参数 — Ling-3.0-flash-VL 每个 token 激活约 5.5B;DeepSeek V4 Flash Vision Exp 未公布激活参数量

图像处理这一行往往最容易被低估。每张图片 384 个 token 的硬性上限,意味着密集图表或整页截图会被压缩到与缩略图大致相同的预算——成本低,但会以对细粒度阅读任务有影响的方式造成信息损失。Ling 的做法则相反:每张图片的像素预算非常大,仅使用 base64 传输,因此请求负载重得多。哪个更好完全取决于你的图片是需要精确读取的文档照片,还是需要大致理解的 UI 截图。

第二个被低估的行是最大输出。Ling-3.0-flash-VL 数万 token 的上限对于“先描述再纠正”的循环来说够用,但对任何想要输出大型产物的事情都构成限制——一个很长的生成文件、一次完整的文档重写、一份数千行的 diff。Deep​Seek 之所以有 384K 输出,正是因为其预期工作负载最终会落到一个大型工具调用结果或生成产物上。如果你的流水线期望模型交回很长的内容,那么在任何基准测试之前,仅凭这一行就已决定了胜负。

价格,以及免费与未定价之间的区别

DeepSeek V4 Flash Vision Exp 在我们的目录中有一个确切的数字:每 100 万输入 token 0.24 美元,每 100 万输出 token 0.73 美元,上下文窗口为 1,048,576 个 token,最大输出为 384,000 个 token,可通过deepseek/deepseek-v4-flash-vision-exp访问。这是已公布的价格,计费方式与文本版 V4-Flash 相同,图像最多按每张 384 个 token 折算。这是一个可以放进电子表格里的价格。

Ling-3.0-flash-VL 并没有这样一个价格。Artificial Analysis 页面将其列为每 100 万输入 token 为 $0.00,每 100 万输出 token 为 $0.00,而同类产品的中位数分别为 $0.14 和 $0.40——但这反映的是蚂蚁 Ling Studio 上运行的免费试用,并非资费标准。蚂蚁的多模态文档并未公布该视觉模型的每 token 价格,因此无从核实这个零值。纯文本的同类模型 Ling-3.0-flash 的标价约为每 100 万输入 token $0.075、每 100 万输出 token $0.22,而蚂蚁面向特定领域的 Ling 系列发布时均以免 API 形式推出,这暗示其最终形态可能类似——但暗示并不等于价格。

把两者老老实实并排放在一起,成本对比就是:一个模型有明确的费率,另一个只有一段促销窗口期和一个看似合理的猜测。任何断言 Ling-3.0-flash-VL 比 DeepSeek V4 Flash Vision Exp 便宜的人,都是在拿免费试用价对比标价。站得住脚的说法是:一旦正式定价,Ling-3.0-flash-VL 每 token 很可能更便宜,因为 5.5B 激活参数是一种结构性优势,任何费率调整都抹不掉——但有个前提:Ling-3.0-flash-VL 的啰嗦会侵蚀这一优势。Artificial Analysis 记录到它在 Intelligence Index 上消耗了 160M 输出 token,在 64 个模型中排名第 8,而中位数为 84M,并被标注为“非常啰嗦”。你按输出的 token 付费,所以一个为了得出同样答案而多说近一倍话的模型,会把稀疏激活赢得的一部分优势又还回去。

哪个,为什么

一个诚实的决策树会在划分其他任何因素之前,先按上下文和输出长度来划分,因为这两个维度正是两种模型无法相互替代的地方。

选择 DeepSeek V4 Flash Vision Exp当你的任务耗时较长且最终以成果物收尾时选用:包含图表的多达数百页文档、从头到尾通读的代码库、需要输出大量结果的智能体循环、希望按 URL 或 Files API 引用而非 base64 提交图像的工作负载,以及需要使用 Responses API、前缀续写,或可据以制定预算的公开每 token 费率的流水线。它也是两者中唯一一个供应商声称在文本任务上与其自家文本模型持平的模型,如果你要用一个模型替代技术栈中的两个模型,这一点很重要。

选择Ling-3.0-flash-VL当你的约束瓶颈是每次调用成本,且你的循环很短时:GUI 自动化、重复的截图检查、带渲染与校正循环的前端生成、医学或金融文档抽查——这些场景需要较高的单图分辨率,并且你可以接受较小的输出。5.5B 激活参数量是选择它的理由,MIT 许可证是它可以安全自托管的理由,而视觉反馈循环设计正是针对观察—行动—验证—纠正这一模式。请注意,你选择的是一款尚未定价的模型,有免费入口路径,且对后续安排没有任何承诺。

而如果你真正需要的,是一个能胜任读图、又不走任何极端的模型——既没有 5.5B 稀疏技巧,也没有百万 token 窗口——那么这两者都不是那个有意思的答案,普通的中端视觉模型会比这两种专用方案更好、更便宜地为你服务。

运行它们,以及说实话,我们适合哪里

DeepSeek V4 Flash Vision Exp 已上架我们的目录你可以通过 OrcaRouter 的 OpenAI 兼容端点调用它,模型字符串为 deepseek/deepseek-v4-flash-vision-exp,使用与你其他一切相同的密钥,按公布的 $0.24/$0.73 费率计费,且不额外加价——提供商标价直接透传,所以如果 DeepSeek 下调费率,你当天就能享受到,而不是等到下一次合同续约。如果你是第一次把视觉模型放入生产路径,那么在路由层上,这是两者中更稳妥的起点,因为你可以配置回退链,让提供商错误在响应开始前重试另一条路由。没人希望自己的第一次生产视觉调用,成为教会自己单提供商故障的那一次。

The OrcaRouter model page for DeepSeek V4 Flash Vision (Exp) showing a $0.24 per 1M input and $0.73 per 1M output token price, a 1,048,576-token context window, a 384,000-token maximum output, p50 time to first token of 1.31 seconds, the deepseek/deepseek-v4-flash-vision-exp model identifier, and Python and cURL code samples against https://api.orcarouter.ai/v1.

Ling-3.0-flash-VL 并不在我们的产品目录中,我们也不会作出任何相反的暗示。它可以通过 Ant 自家的平台访问,该平台提供了兼容 OpenAI 的端点和兼容 Anthropic 的端点;也可以通过 Ling Studio 上的免费试用访问;还可以通过 Hugging Face 上的开放权重访问,你可以用已发布的 SGLang 配方或 Ant 自家的 vLLM 分支自行部署。在那条路子上投入之前,有一件事需要核实:Ant 的 API 示例使用的标识符是 Ling-3.0-flash-VL-rc1,一个候选发布版本的标记,而所提供的检查点是否与开放权重一致,目前尚无公开定论。如果你打算针对托管 API 做基准测试,并期望这些数字能迁移到自托管的 BF16 部署上,请先验证这个假设。

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3, a class rank of #2 of 64, 124B total and 5.5B active parameters, 142.9 output tokens per second, and a listed price of $0.00 per 1M tokens in and out reflecting free trial access.

经得起审视的总结是:它们并不是同一个问题的两种竞争性答案。DeepSeek V4 Flash Vision Exp 是面向智能体的长上下文感知层,有公开定价,还有一份偏向智能体式评估的厂商自报基准表。Ling-3.0-flash-VL 则是一个服务成本低廉的视觉模型,只有一个真正独立的评分、一个未定价的免费层级,并且其设计面向短校正循环。让你的工作负载形态与模型形态相匹配;而榜单上只有其中一个拥有独立评分这一事实,应当影响你给另一个的营销宣传赋予多大权重。

同一个密钥即可访问目录中的其余内容,你还可以浏览完整的模型目录,看看同一个 OpenAI 兼容端点背后还提供哪些模型。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新