Ling-3.0-flash-VL 的标题卡,概述该模型为来自蚂蚁集团 inclusionAI 实验室的 124B 参数、5.5B 激活的原生多模态混合专家模型,于 2026 年 9 月根据 MIT 许可证发布,在 Artificial Analysis Intelligence Index v4.3 上得分 25,输出速度达每秒 142.9 个 token。
Guides & Insights

Ling-3.0-flash-VL:蚂蚁的55亿激活参数视觉模型以25分登上智能指数榜

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.0-flash-VL 现在有了一个并非蚂蚁集团任何人录入的基准分数,而这本身就是新闻。蚂蚁 inclusionAI 实验室推出的首个原生多模态模型,在 Artificial Analysis 智能指数上得分 25——这是一次独立评测,采用当前的 v4.3 量表,并与一个列出其速度、延迟和价格的模型页面一同发布。它出现在厂商自家模型卡声称在同一指数上取得42分的三周之后,而对读者来说,面对这两个数字最有用的做法,就是理解它们为何并不矛盾:蚂蚁依据的是智能指数协议 v4.1.1,Artificial Analysis 依据的是 v4.3,而这是两把由不同评测集构建的、不同的尺子。与其说厂商的数字是在与第三方接触后没能站住脚,不如说它是在一个该数字写下时还不存在的量表上被重新测量了。

评分背后的模型是一个稀疏混合专家模型,总参数量为 124B,每个 token 大约激活 5.5B,以 MIT 许可证发布,提供 BF16 和 FP8 权重,接受文本、图像和视频输入并返回文本。这个激活参数量就是它的全部论据。以 5.5B 的激活量,Ling-3.0-flash-VL 正处于开放模型中最引人注目的那条曲线上——智能前沿是以激活参数量而非总规模来绘制的——它之所以在那里,是因为它每单位推理算力能完成相当多的工作,而不是因为它体量巨大。

本文涵盖实际交付了什么以及何时交付,独立测评怎么说,为什么 Pareto 的说法比大多数更站得住脚,这个模型的成本是多少,以及你实际上可以在哪里调用它。简短版本,给只想知道这些的人:Ling-3.0-flash-VL 是真实存在的,开放权重,推理服务成本异常低,在其规模级别中可测量地高于平均水平,并且明显比原始得分所暗示的更冗长、交付更慢。其厂商声称的 42 从未被独立复现,也无法与现在榜单上的 25 相提并论。

实际交付了什么,以及那条不断被抹平的时间线

关于此次发布的报道往往把几个独立事件压缩成一个上线日期,而这些日期很重要,因为它们解释了为什么早期的文章所描述的模型,Ant 之外的人根本没法评测。Hugging Face 仓库 inclusionAI/Ling-3.0-flash-VL创建于 2026 年 9 月 4 日——64 个分片的 BF16 权重、MIT 许可证、面向 bailing_moe_v3_vl架构的自定义代码栈,而且有几天几乎无人下载。FP8 量化随后于 9 月 8 日推出,64 个分片约 126 GB,其中视觉塔的精度高于专家权重。Artificial Analysis 将该版本列为 2026 年 9 月 10 日,这是它自己页面所锚定的日期,而带有该评分的模型页面大约也在那时上线。

所以,“2026年9月发布”准确但无用。实际时间线是:4日发布权重,8日推出第二种精度格式,10日完成独立测量。这一点之所以重要,是因为对大多数团队来说,一个磁盘上有权重、却没有托管端点、也没有第三方评分的模型,还不算是可以评估的对象——它只是一个你得为其准备资源的下载文件。Ling-3.0-flash-VL 在 API 和独立评分同时存在时,才跨过了这条线。

服务支持是与权重一同到来的,而不是在权重之后才出现。Ant 发布了 SGLang 部署指南,并为该架构维护着一个经 Ling 调优的 vLLM 分支,而这在开源发布中通常是会滞后数周的部分。这一次,它没有滞后。

板上的数字,以及卡片上的那个数字

以下是来自 Artificial Analysis 的独立评估,这是目前对该模型唯一存在的第三方测量:

• Intelligence Index — 25 基于 v4.3,在其规模级别中 64 个里排名第 2,同级中位数为 8br /> • 总参数 — 124Bbr /> • 激活参数 — 每 token 5.5Bbr /> • 输出速度 — 142.9 token/秒,64 个中排名第 10,同类中位数为 105.1br /> • 首 token 时间 — 2.21 秒,同类中位数为 2.29br /> • 上下文窗口 — 根据 Artificial Analysis 测量为 262K token,而模型卡自身声明为 256Kbr /> • 许可证 — MIT,开放权重

而这就是它常常被并列印出的厂商数字:在 Artificial Analysis 智能指数协议 v4.1.1 上取得 42 分,比纯文本版 Ling-3.0-flash在同一协议上的得分高出 4 分。这一说法出现在模型卡中,没有公开的评测记录,也不是 Artificial Analysis 所报告的那个数字。有两件事同时成立:这个 42 无法复现,但它也不构成任何不诚实的证据,因为 v4.1.1 和 v4.3 测量的并不是同一个东西。Artificial Analysis 于 2026 年 9 月重新表述了其指数,并对整个榜单重新评分;v4.3 纳入了十项评测,包括 AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0 和 Humanity's Last Exam。任何仍在未注明版本的情况下把 42 和 25 并列引用的文章,都是在比较两种不同的测试,却称之为下滑。

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

除了核心得分之外,值得指出的细节是冗长程度。Artificial Analysis 记录到 Ling-3.0-flash-VL 花费 1.6 亿个输出 token 完成 Intelligence Index,在 64 个模型中排名第 8,而中位数为 8400 万,并将其标记为“非常冗长”。对于一个以通过较小激活参数量实现廉价推理为卖点的模型来说,这直接与卖点相悖。你按 token 付费,而不是按参数付费。一个激活 5.5B、但在回答相同问题时输出接近中位数两倍 token 数量的模型,会在付费时交还一部分这种结构性优势——而这正是按 token 计价表所掩盖、按任务成本衡量所揭示的那类相互作用。

帕累托论断,稍加压力

Ling-3.0-flash-VL 位于智能与激活参数帕累托前沿这一说法,不同寻常地并非仅仅被独立数据所容许,而是得到了独立数据的支持。该指数上的同类中位数为 8;Ling-3.0-flash-VL 得分为 25;而且它是在每个 token 仅激活 5.5B 参数的情况下做到这一点的。对于受可服务吞吐量这一硬约束的团队——单加速器、固定请求预算、边缘部署——这个比值就是决策的全部依据,而这是一个真正强劲的表现。

有两个注意事项让它无法成为一次毫无争议的胜利。第一是参数数量上的出入:模型卡上写的是约 5.5B 活跃参数,而 SGLang 手册描述的则是 5.1B 活跃参数的模型。两者都是 Ant 文档,差异很小,而且它略微改变了曲线的形状,而不是方向。第二是,“前沿”是一种相对说法,所涉及的是一个每周都在变化的领域。在给定规模下成为每活跃参数智能最高的模型,这个位置你只能保持到该区间内下一个模型发布为止,而这个区间很拥挤。

厂商自己的头条演示——即 Ling-3.0-flash-VL 以“linthium”这个用户名参加 Image-to-WebDev Arena,得分 1,441,相比之下 GPT-5.4 的 1,440——应被解读为吸引眼球之举,而非一项结果。一分之差落在竞技场 Elo 的噪声范围内,而且这是厂商自行报告的,并不是那种能决定任何事情的差距。其背后的能力主张比这个数字更有意思:该模型是为视觉反馈回路而构建的,它从布局生成前端代码,渲染自己的输出,查看渲染结果并进行修正——观察、行动、验证、修正,而不是只生成一次描述就停下。

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

它的代价是什么,这一点比看上去更不明确

Artificial Analysis 页面将 Ling-3.0-flash-VL 列为每 100 万输入 token 为 $0.00、每 100 万输出 token 为 $0.00,而同类中位数分别为 $0.14 和 $0.40。那不是价格,而是价格的表象。Artificial Analysis 对其能看到的端点进行定价,而它能看到的这个端点是免费的——该模型正在 Ant 的 Ling Studio 上作为免费试用运行,免费促销访问正是该列表所反映的内容。Ant 自己的多模态文档根本没有公布该视觉模型的每 token 定价,因此没有厂商价目表可用于核验这个零。为便于理解量级,纯文本的同门模型 Ling-3.0-flash 标价约为每 100 万输入 token $0.075、每 100 万输出 token $0.22,而 Ant 的领域专用 Ling 变体也以免费 API 形式推出。

要把这个"零"当作测试窗口,而不是资费。新发布模型上的免费额度是一种获客手段,而诚实的规划假设是:Ling-3.0-flash-VL 最终会带上与其文本版同门模型相近的价格。还有一个现实存在的模糊之处,即便付费端点上线也不会消解:蚂蚁自家的 API 示例使用的模型标识符是 Ling-3.0-flash-VL-rc1,这是一个候选发布标记,而实际提供服务的检查点是否与 9 月 4 日公开的权重逐字节一致,目前仍不清楚。如果你正在用托管 API 对自己的提示词做基准测试,并指望结果能迁移到自托管的 BF16 构建上,那么在以此为基础做任何事之前,这个假设你应当先验证一下。

成本图景会因你站在哪一边而反转。对于已经有加速器的团队来说,约 126 GB 的 FP8 版本能装进一个八路 80GB 级节点,而 5.5B 的活跃参数数量意味着你为该节点的摊销成本买单,换来的却是极小的每 token 计算开销——这个模型最便宜的版本,就是你自己提供服务的那一版。对于没有加速器的团队来说,问题在于付费端点能否在免费层关闭之前就位。

在你可以真正称之为它的地方,包括我们说“不”的那部分

Ling-3.0-flash-VL 可通过 Ant 自家的平台访问——一个位于api.ant-ling.com/v1/chat/completionsOpenAI 兼容端点,以及与之并列的 Anthropic 兼容端点——此外还有 Ling Studio 上的免费试用,以及可自行部署的开放权重。独立网关也已开始收录它,而这确实是在无需任何部署配置的情况下试用它最快的方式。

值得直说的是,OrcaRouter 目前并不提供 Ling-3.0-flash-VL 的路由。它不在我们的模型目录中,因此你在这里读到的任何关于通过我们调用它的内容都将是虚构的,而我们宁愿你一开始就知道这一点。我们确实提供路由的,是与其最直接可比的视觉模型:DeepSeek V4 Flash Vision Exp,这是 DeepSeek 的实验性多模态版本,已在我们目录上线,具有 1M token 上下文窗口和公开费率。如果你实际需要的,是一个位于 OpenAI 兼容端点之后、能力出色的视觉模型——配置了故障转移链,以便提供商出现小故障时能在你的响应开始前重试,并且提供商列表定价原样传递、不额外加价,因此供应商价格变化在生效当天就能传达给你——那么在 Ling-3.0-flash-VL 仍未上目录期间,这就是应该首先尝试的模型。

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

接下来值得关注的事项

三件事将决定这次发布在六个月后是否仍显得意义重大。第一是第二次独立运行:来自单一评估方的一个分数只是一个数据点,真正有意思的问题是,Ling-3.0-flash-VL 在“智能—活跃参数”曲线上的位置,能否在另一套评测框架下依然成立。第二是真实定价。在 Ant 公布该视觉模型的价目表之前,任何涉及它的成本比较都只是披着数字外衣的估算,而免费层正在承担原本应由价格承担的职能。第三是 FP8 的质量差异——在那次构建中,视觉塔被刻意保持在比专家权重更高的精度上,而量化版本在细粒度视觉任务上能否与 BF16 媲美,正是那种只有在人们将其投入生产运行、而非仅仅做基准测试时才会浮现的问题。

今天能得到的结论,比发布报道所暗示的更有限,也比单看分数更有用。Ling-3.0-flash-VL 是一个真实存在的、以 MIT 许可证授权、可自行部署的视觉模型,它在 124B 参数中只激活一小部分,在当前一个独立指数上得分为 25,而同类中位数为 8,并且又因冗长而把其中一部分优势还了回去。这是一个形态诚实的优秀模型。卡片上的 42 是来自一把已不复存在的尺子的数字。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新