这是一张对比“Ling-3.0-flash-VL vs Ling 3.0 Flash”的主视觉标题卡片,副标题为“一颗124B大脑,如今拥有双眼”。标题上方是两个扁平线形图标——左侧为文本文档,右侧为眼睛叠加在相框上;副标题下方是两个由细分隔线隔开的标签:“相同的混合线性MoE主干”和“一个新增原生图像与视频输入”。画面中不出现任何数字或价格。OrcaRouter标志合成在右下角。
Guides & Insights

Ling-3.0-flash-VL 对比 Ling 3.0 Flash:同一个124B大脑,如今有了眼睛

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.0-flash-VL 和 Ling 3.0 Flash 并非竞争对手;如果将这两者放在一起解读为一场模型对决,你会得出错误的结论。Ling-3.0-flash-VL 是蚂蚁集团 inclusionAI 实验室本周发布的视觉-语言检查点——其权重自 2026 年 9 月 4 日起以 MIT 许可证托管于 Hugging Face——它直接基于 Ling 3.0 Flash 构建,后者是该实验室自 7 月底以来支撑其快速档位的 124B 参数开放权重文本模型。两者共享相同的混合线性 MoE 设计、相同的稀疏激活经济性、相同的 256K 上下文服务方案,以及相同的 MIT 许可证。VL 检查点新增的,正是文本模型从未具备的那一项能力:原生图像与视频输入,经由 ViT 编码器、两层 MLP 投影器以及 VideoRoPE 时间编码实现。因此,这种比较最终归结为一个实际的问题——如果你的工作负载从来不需要看图片,那么,这个长了“眼睛”的模型是否值得你切换过去?

这个问题之所以值得提出,是因为 inclusionAI 并未将 Ling-3.0-flash-VL 界定为独立产品线。其模型卡称其为“我们的下一代原生多模态模型”,基于 Ling-3.0-flash 构建,继承了该模型的语言、推理和长上下文能力,并通过视觉能力加以扩展——这种视觉参与理解、推理、行动和验证的完整回路,而非作为附加式输入。对于一个早期旗舰发布明确为纯文本的模型家族而言,这是一个真正的转变,也改变了文本与工具团队应当统一基于哪个检查点。

两个检查点,一个骨干

Ling 3.0 Flash 是本次对比中的对手方,也是两者中更为成熟的那个。它于 2026 年 7 月下旬发布,并于 8 月 7 日以 MIT 许可证开源,是一个混合线性混合专家(hybrid-linear mixture-of-experts)模型,总参数达 1240 亿,每个 token 激活约 51 亿参数——35 个 KDA 层与 7 个 Gated MLA 层以 5:1 的比例堆叠,512 个路由专家中激活 8 个,原生上下文为 256K,服务长度可达 262,144 个 token。它仅支持文本,支持工具调用,通过聊天模板默认启用思考,且相对于其规模而言,成本低得不同寻常。它也是两者中有据可查的一方:Artificial Analysis 将其列入实时排行榜,在同类 63 个模型中排名第一,并测得其在供应商 API 上的输出速度约为每秒 313 个 token。

Ling-3.0-flash-VL 保留了这一架构,并在其之上新增了一个视觉栈。模型卡描述了一个 ViT 视觉编码器:其视觉特征通过两层 MLP 投影器对齐到文本空间中;同时,VideoRoPE 对空间位置和时间顺序进行编码,使模型能够完成事件定位和长视频推理。骨干网络依然是 5:1 的 KDA-to-MLA 混合架构,只是这一次总参数量为 124B,每 token 仅激活 5.5B 参数,主干包含 42 层。输入支持文本、图像和视频,输出为文本。上下文长度标称最高可达 1M token,推荐的 SGLang 方案通过 YaRN 缩放可提供 256K 上下文。与纯文本版一样,该模型默认开启思考模式(可通过 chat_template_kwargs 按单次请求关闭),并可在 SGLang 或 inclusionAI 定制的 vLLM 分支下运行。BF16 版本在磁盘上约占用 250 GB,分布于 64 个 safetensor 分片中——与纯文本模型权重同属四分之一 TB 的体量级别。

它有多新?截至撰写本文时,VL 仓库的下载量只有几十次,其模型卡仍在更新中,Artificial Analysis 尚未将其收录。下文所有未明确注明出自 Artificial Analysis 的内容,均为 inclusionAI 自身的报告。

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

记分牌

这里的不对称不是质量——而是模态。六个维度概括了这一决策:

智能(供应商卡片,AA Index v4.1.1)——Ling-3.0-flash-VL:42,由供应商报告。Ling 3.0 Flash:38,这是该卡片引用的早期指数值。

AA 今日实时榜单(v4.3) — Ling-3.0-flash-VL:尚未列出。Ling 3.0 Flash:预计为 25,在其类别中排名第一(共 63 个)。

输入 — Ling-3.0-flash-VL:文本、图像和视频。Ling 3.0 Flash:仅文本。

上下文——两者都声称最高支持 1M tokens;但目前实际提供的均为 256K(262,144)。

价格 — Ling-3.0-flash-VL:尚无标价;仅有 MIT 开源权重。Ling 3.0 Flash:在厂商第一方 API 上,约 $0.07/100 万输入 tokens,$0.22/100 万输出 tokens。

适用场景——Ling-3.0-flash-VL:文档、截图、图表、视频和 GUI 操作智能体。Ling 3.0 Flash:文本密集型工具调用与长程智能体流水线。

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

文本模型无法进入的记分牌

这才是两者真正分歧的所在,而且这种分歧是结构性的,而非竞争性的:在图像和视频基准测试中,纯文本的 Ling 3.0 Flash 完全没有成绩记录,因为它无法接受这类输入。Ling-3.0-flash-VL 自己的图表——inclusionAI 的评估,未经复现,部分在内部运行,部分按官方测试设置调用竞争对手的 API 运行——在模型卡强调的三个类别中都列出了数据。在复杂图像理解方面,MMMU-Pro 为 79.0,MathVision 为 84.87;而 Humanity's Last Exam-Multimodal 上只有低得多的 19.88,反映出这一测试集对所有人来说都颇具难度。在文档与图表任务上它表现强劲:OmniDocBench1.5 为 91.35,CharXiv_RQ 为 81.30。而在让本次发布颇具看点的智能体多模态测试套件上——ClawEval-MM 为 59.9,WebVoyager 为 90.83,Vision2Web 为 57.69——它被要求读取界面并据此采取行动,这正是纯文本模型无法承担的 GUI 智能体工作。

将这些内容放在语境中去读,一幅连贯的图景便会浮现:这不是一个旨在通过图像赢得冷门知识问答的模型,而是一个旨在把像素转化为行动的模型——读取版面布局、跟随图表、操作页面。在该供应商自己的图表上,它在 OmniDocBench、WebVoyager 和 ClawEval-MM 三项测试中领先于三方对比阵容(采用高推理强度的 Qwen3.8-27BGemini 3.5 Flash-LiteKimi-K2.6),而在 MathVision、HLE-MM 这类高难度知识与推理测试集上则落后。在独立实验室证实之前,这些数字都应被视作 inclusionAI 的单方面宣称——但调校的方向清晰而一贯。

唯一值得争论的数字:42 vs 38

最能促使纯文本团队转用(新模型)的主张,正是标题中的这一项:{{1}}inclusionAI 报告称,Ling-3.0-flash-VL 在 Artificial Analysis Intelligence Index(v4.1.1)上得分为 42,比同一指数版本下该机构给 Ling 3.0 Flash 的 38 分高出 4 分。{{/1}}请注意该指数衡量的对象:其 v4.1.1 综合评分基于文本与智能体测试套件——{{2}}GDPval、Terminal-Bench、SciCode、GPQA Diamond、Humanity's Last Exam 等类似基准,全都不属于图像任务。{{/2}}因此,该厂商的意思是:在共享骨干中加入视觉训练让模型的文本侧智能提升了 4 分,而不仅仅是让模型现在能描述图片。这是一个惊人且完全合理的说法——多模态指令微调通常都会提升文本能力。

两个数据来源方面的告诫有助于正确看待这个数字。首先,38 是较早一代索引版本的数值:Artificial Analysis 此后已将其实时榜单迁移到更新的索引版本(v4.3),在该版本中,它目前将 Ling 3.0 Flash 的估值列为 25,同时仍将其排在同类 63 款模型的首位。该厂商那组 42 对 38 的数字基于较旧的标尺,因此不应被解读为“比 AA 如今对该文本模型的评分高出四分”。其次,42 是 inclusionAI 自己给出的数据,针对的是 Artificial Analysis 尚未收录的模型,而且 inclusionAI 尚未公布 VL 检查点在各个文本套件(SWE-Bench、Terminal-Bench)上的结果——这些套件正是其自身文本模型图表所分列的。四分恰好是你在仅依据这一结果去迁移纯文本流水线之前,应当能够复现的增益幅度。

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

价格:一个有标价,另一个没有

当前的成本比较中只有一个价格。Ling 3.0 Flash如今即可在供应商的第一方API上调用,输入每100万token约0.07美元,输出每100万token约0.22美元——这是厂商设定价格,并已在Artificial Analysis的列表中得到确认——缓存输入更便宜,且其发布期折扣已经结束。Ling-3.0-flash-VL目前在任何地方都没有公布API价格;你还无法按token为其付费。如果你想在本周就用上它,只能自行部署:MIT许可证权重,BF16格式约250GB,硬件要求与文本模型原本所需一致——4×141GB GPU(H20-3e或H200),或张量并行度为4的4-GPU Blackwell节点,或TP8下的8×80GB H100/H800。

这重新定义了纯文本团队的经济性考量。如果你是按token购买,$0.07/$0.22的文本模型既便宜又成熟可靠。如果你已经在自托管124B文本模型,VL检查点并不是第二次基础设施采购——它只是同一类机器上额外的约250 GB权重,只有真正消耗像素的工作负载才值得为此买单。带视觉的模型,只有当视觉真正介入流程时,才能体现出它的价值。

谁应该选择哪个

纯文本与高并发——请继续使用 Ling 3.0 Flash。您获得的是经过验证、已列入 AA 级别的模型,真实按 token 计费的价格,以及成熟的工具调用能力。VL 模型四个百分点的指标提升尚未被复现,其文本侧吞吐量也未经验证;目前没有证据表明它是更好的文本模型,只有一句“它是”的说法而已。

视觉进入循环——文档、截图、图表、照片、视频帧,或你的智能体需要读取并点击的UI——Ling-3.0-flash-VL是显而易见的选择,因为它正是在你已经熟悉的推理主干之上加入了视觉栈,而不是一个需要你从头重新评估的独立多模态模型。

混合流量,未定——低风险的做法是让两者都保持可用,并按请求路由,而不是围绕其中某一个重构架构。这正是模型网关存在的意义:一个 API 覆盖 200 多个模型,供应商标价以 0% 加价原样传递,并且在供应商性能下降时自动故障转移。两个 Ling 检查点目前都还没有接入 OrcaRouter 端点——文本模型的价格是供应商自己的定价,VL 模型则完全没有托管价格——但当 VL 模型获得托管价格后,将一部分流量迁移到它上面并测量效果,只是一次配置变更,而不是一个集成项目。

还缺少什么

• 在当前的 {{2}}Artificial Analysis Intelligence Index{{/2}} 上对 {{1}}Ling-3.0-flash-VL{{/1}} 进行了一次独立运行——42 是 {{3}}inclusionAI{{/3}} 对旧版指数的说法。

• VL模型的任何托管API价格,都是随意采用的最大阻碍。

• 为VL检查点发布了纯文本划分(SWE-Bench Pro、Terminal-Bench 2.1),以便以文本为主的团队可以验证视觉栈并未使其付出任何代价。

• 图像负载下 VL 的端到端延迟或吞吐量指标——只测量文本模型的速度,不测量视觉模型的速度。

• 对视觉基准图表的中立确认;其中部分运行使用了 inclusionAI 自家的测试框架,且至少一项内部基准计划于稍后发布。

裁决

这不是一场模型质量竞赛;而是一次模态决策,附带四点主张。如果你的输入是文本,继续用 Ling 3.0 Flash——它更便宜、已列入 AA 名单、表现稳定,而 VL 模型相对于它的优势,目前不过是旧版指数标尺上的一组厂商数据。如果你的工作负载始于屏幕——文档页面、截图、图表、视频帧、你的智能体必须操作的 GUI——那么 Ling-3.0-flash-VL 就是你已熟悉的同一个 124B 大脑,如今具备了视觉能力,这是一周前 Ling 快速档中并不存在的全新选项。在视觉确实不可或缺之处采用它;在依据它迁移任何内容之前,先验证那 42 项指标;并且在该选型层保持可回退,直到独立的评分和公开报价出台。