
Ling-3.0-flash-VL:蚂蚁在快速Ling系列中推出多模态模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
2026年9月4日,蚂蚁集团的inclusionAI实验室在Hugging Face上发布了采用MIT许可证的Ling-3.0-flash-VL权重,{{1}}并于同一天{{/1}}{{2}}更新了蚂蚁Ling平台开发者文档以保持一致{{/2}}。Ling-3.0-flash-VL是Ling-3.0-flash系列中首个具备视觉能力的检查点:{{3}}它沿用了约1240亿参数的稀疏混合专家骨干架构{{/3}}——正是这一架构让纯文本版Ling-3.0-flash成为夏末最受关注的廉价推理模型之一——{{4}}如今它不仅能处理文本,还能读取图像和短视频片段{{/4}}。{{5}}FP8量化版本于9月8日跟进发布{{/6}},即本文撰写当天早晨{{/5}}。因此,在四天内,该发布便具备了读者可以实际使用的三个层面——开放权重、蚂蚁Ling平台上的官方API,以及供应商报告的Artificial Analysis Intelligence Index协议4.1.1版本得分42{{7}},这一分数比纯文本姊妹模型独立测得的38分高出4分{{/7}}。{{8}}它尚未获得的则是一份正式的发布公告{{/9}}:Hugging Face模型卡和开发者教程就是全部发布内容,{{10}}这也是本文区分"供应商声称"与"外部可验证事实"的原因{{/10}}。
此次发布之所以重要,在于它改变了 Ant 的产品版图。到 2026 年年中为止,Ant 模型组合中的多模态能力一直独立存在于 Ming 产品线之中;而 Ling-3.0-flash——本博客此前的文本模型专文也是这么定位的——则被定为一个面向智能体、编程与深度研究的快速文本及工具层级。Ling-3.0-flash-VL 打破了这条边界:它把视觉信息引入一个建立在异常小的激活参数规模和长时间智能体运行之上的推理模型,并同时以三种途径将成果交付到开发者手中。因此,这与早前那些面向特定领域调优的变体(Ling-3.0-flash-Fin、Ling-3.0-flash-Sante)是截然不同的决策——后两者以不附带权重的免费 API 形式发布。而这一次是开源的,运行在 Ant 的付费平台上,并且发布时日尚短,厂商之外还没有人发表过独立的运行评测。最后这一点才是本文中最重要的事实。
发布了什么,以及何时发布
下面的每个日期都可以从代码仓库和文档中查证;其中没有任何内容依赖于一份并不存在的新闻稿。
• 9月4日——Hugging Face 仓库 inclusionAI/Ling-3.0-flash-VL 创建于 15:24 UTC,包含 64 个 bf16 权重分片、一套用于bailing_moe_v3_vl架构的完整自定义代码栈、默认启用思考的聊天模板,以及 MIT 许可证。截至撰写本文时,下载量只有几十次:这是一个只有持续关注仓库动态的人才会在第一天就发现的发布。
• 9月4日 — 蚂蚁集团的Ling平台开发者门户新增了多模态理解教程,介绍官方API上的该模型(页面自身的“最后更新”时间戳显示为2026年9月4日)。中国开发者媒体于次日报道了这一能力,将其描述为面向视觉问答和内容分析的图像与短视频理解功能。
• 从9月5日起——服务和部署支持迅速出现:针对该模型的SGLang部署手册、由inclusionAI组织维护的自定义vLLM分支,以及一个自带权重(bring-your-own-weights)的部署库列表,其中包含现成的chat-completions端点。这些是运行时和基础设施,而非公告,但它们说明该模型是为部署服务而构建的,而不仅仅是为了发布。
• 9月8日——FP8量化版{{1}}inclusionAI/Ling-3.0-flash-VL-fp8{{/1}}上线(64个分片,约126 GB),其中视觉塔刻意保持较高精度,而MoE权重则压缩为FP8 E4M3。对于使用较少或较小GPU进行自托管的用户,这将是大多数人实际会下载的检查点。

上面的卡片是本次发布中最接近发布公告的内容——模型描述、架构、SGLang 和 vLLM 配方的链接,而且我们在其他任何地方都找不到公告。请注意一个值得事先指出的不一致之处:模型卡片称"每个 token 仅激活 5.5B 参数",而围绕同一发布编写的 SGLang cookbook 描述的却是"5.1B 活跃"模型。对于一个全新的 checkpoint,这种差异很可能是视觉塔(vision-tower)统计口径的问题,而非两个不同的模型,但这正是那种应该标注为"尚未确定"而不是一笔带过的细节。
一个激活5.5B的124B模型——现在有了眼睛
Ling-3.0-flash-VL延续了其文本版Ling-3.0-flash的标志性混合稀疏MoE设计。模型卡描述了一个42层的主干网络,其中Kimi-Delta-Attention层与Gated-MLA层以5:1的比例交替——与Ling-3.0-flash的结构节奏相同——总参数量约为1248亿,每个token仅激活其中一小部分。新增的是感知栈:ViT视觉编码器提取的视觉特征经两层MLP投影器送入语言主干网络;VideoRoPE则同时编码空间和时间位置,使视频帧在输入时带有模型可推理的顺序。输入为文本、图像和视频,输出为文本。
• 参数 — 总计124B,每个token激活约5.5B(依据供应商卡片,见上文关于统计口径的说明)。
• 背景 — 宣传中号称“高达100万token”;但现有的部署方案通过YaRN RoPE缩放实际支持的是256K。在有人发布经过验证的更长的运行结果之前,这才是规划时应依据的务实可靠数字。
• 思考:推理默认通过聊天模板开启;官方 API 示例与服务配方均展示了为延迟敏感型调用按请求传入的 enable_thinking: false 开关。
• 许可证——MIT,两种精度格式均适用,无附加条款。这与使文本模型八月开源备受关注的同一份干净许可证相同,也正是自托管是现实选择而非灰色地带的全部原因。
设计意图与规格表同等重要。蚂蚁将 Ling-3.0-flash-VL 定位为一款“将视觉信息带入理解、推理、行动与验证的完整过程”的模型——这是智能体工作负载的语言,而非图像描述。一个能观看30秒屏幕录制、在上下文中维持长程工具调用会话、并将激活参数量保持在近5B水平的模型,瞄准的正是计算机使用与短视频场景智能体。这与针对单图问答优化的视觉语言模型是截然不同的产品,下文每一项基准测试都应放在这一框架下解读。
官方 API 实际接受什么
Ant Ling 平台教程介绍了 Ling-3.0-flash-VL 的两种 API 形态:一个 OpenAI 兼容端点位于 api.ant-ling.com/v1/chat/completions,另一个 Anthropic 兼容端点位于 api.ant-ling.com/anthropic/v1/messages。在基于它进行开发之前,这些限制值得了解:
• 图像 — 仅支持 JPEG 和 PNG,仅限 base64 编码,每次请求最多 40 张图像,每张图像尺寸不超过 16,384 × 784 像素,每个 base64 字符串不超过 32 MB。与 OpenAI 兼容的 image_url.detail 参数会被忽略;引擎会在内部自行决定分辨率。
• 视频 — MP4、MOV 或 WMV,每个请求仅限一个片段,时长不超过30秒,按固定的每秒2帧采样,最多32帧,base64编码后大小不超过32 MB。视频仅适用于兼容OpenAI的端点;兼容Anthropic的端点支持文本和图像,但不支持视频。
• 模型标识符——教程中的 curl 示例将模型称为 Ling-3.0-flash-VL-rc1,而不是 Ling-3.0-flash-VL。这个 -rc1 后缀是一个发布候选标记,也是一个真正的悬而未决的问题:文档中没有任何地方说明平台提供的是哪一套权重,也没有说明 API 检查点是否与 9 月 4 日的开放权重构建版本一致。如果你正在对照开放权重来评估 API,这就是你首先要测试的内容,而不是一个可以想当然的假设。

上述页面即输入约束所在之处——图像与视频格式、单次请求上限以及两种端点形态。也是在此页面上确认该模型为一项实际运行的商业 API 产品,而非仅在文档中存在的占位空壳。
这些数字——以及报告它们的人

卡片上最显眼的数字是 42,依据的是 Artificial Analysis Intelligence Index 协议 4.1.1 版本。Ant 称这一成绩比纯文本的 Ling-3.0-flash 的 38 分高出 4 分。这句话中的区别至关重要。38 是 Artificial Analysis 的测量结果——独立运行、发布在其排行榜上,并被业界对文本模型的报道广泛引用。42 则是 Ant 自家模型卡上的说法,是依据某套 AA 指数协议得出的,但尚未被 Artificial Analysis 收录;截至本文写作时,Artificial Analysis 还没有 Ling-3.0-flash-VL 的页面。除 Ant 之外,还没有人运行过这个检查点。因此,请把 42 视为来自同一家厂商的数字——这家厂商曾给出文本模型真实的 38 分——这值得一看,但不应作为既定数字加以引用。
发布中的其他内容均为定性或方法论层面的描述。模型卡借助“理解、推理、行动”能力图表来刻画该模型,并提及了在 AA 式协议下运行的智能体 Terminal-Bench 评估,但未公布我们可在此复现的数值文本结果;部署手册列出了与特定服务配置挂钩的准确率数据(MMMU-Pro、GSM8K),值得一读,但这些属于基础设施层面的度量,而非独立评测。坦诚而言,结论很简单:这是一个看似合理、服务成本低、具备视觉能力的推理模型,但目前尚无公开的独立评测榜单。
费用是多少,家族史又揭示了什么
蚂蚁的多模态教程并未列出 Ling-3.0-flash-VL 的按 token 价格,因此这里的所有内容都是推测,并已如实标注。有用的锚点是同一平台上的文本版兄弟模型:Ling-3.0-flash 的第一方目录价格约为每 100 万输入 token 0.075 美元、每 100 万输出 token 0.22 美元,缓存读取便宜约 80%;而中国区控制台在早鸟 75% 折扣(该折扣已于 8 月 31 日结束)后以人民币计价(每 100 万 token 输入 ¥0.40 / 输出 ¥1.20)。一个 124B-A5.5B 的多模态模型比 124B-A5.1B 的文本模型服务成本更高——视觉塔是稠密的,并且每个图像 token 都要运行——因此价格落在该区间或略高于该区间是合理的先验判断。家族历史也有另一面:Fin 和 Sante 领域变体以免费 API 形式推出,说明蚂蚁已经展现出会用零价格来培育它想让市场采用的 Ling 变体。VL 究竟走上付费文本模型的价格区间,还是沿用免费变体模式,目前确实尚未公开。
对于自托管路线,由于文件是公开的,这些数字是具体的。bf16 版本的下载量约为 250 GB,分布于 64 个分片——除了最大的单节点之外,任何设备都需要多 GPU 方案——而 FP8 版本(约 126 GB,视觉塔仍保留 bf16)则可以轻松放入配备 8 × 80 GB 级加速器的节点,是大多数团队实际会运行的版本。服务手册中确实提供了吞吐量数据,但这些数据带有供应商倾向;请记住常见的提醒:实际 token/s 取决于你的硬件和你的批次。
路由层适合的位置——说真的
在该模型刚发布时,我们检查过的所有主流第三方模型网关都还没有列出 Ling-3.0-flash-VL;本博客所属的路由平台 OrcaRouter 也不提供它。本文中没有任何内容应被理解为它已经可以获得。这是一个才发布四天的模型的真实状态,值得直说:读者今天真正能做的选择恰好只有两个——调用 Ant 的官方 API,或者自行托管 MIT 权重。路由角度是下一步才会发生的事情。一旦这一类的模型进入第三方服务,透传路由的经济性就是会倾向于使用它来评估的理由:提供商标价按 0% 加价原样转发,所以供应商降价(或像 Fin 和 Sante 发布时的那种免费试用实验)会与公告同日生效;自动故障转移则允许你把一个真实负载指向一个面世几天的开放模型,而不必把技术栈押注在单一供应商的可用性或单个检查点的行为上。对于一个六周内已经重新定价过一次、并分裂成四个变体的模型家族来说,这不是假设——而是每次 Ant 有变动就手动重测,与通过一个 API 一次性重测之间的区别。
看什么
这次发布还很新,所以现阶段有明显参考价值的信号主要是任何人都能运行的检查项。第一,Artificial Analysis(或其他独立实验室)是否会把 Ling-3.0-flash-VL 列入榜单,并确认或修正 42 这个数字——这一个数据点就足以区分它是“该系列最强模型”还是“又一个厂商数字”。第二,官方 API 上的 -rc1 标识是否对应 9 月 4 日的开放权重;如果不对应,API 与自托管路径就是两个不同的模型,你读到的每篇对比都必须说明它用的是哪一个。第三,定价:Ling 平台是否会公布 VL 的费率,以及这个费率是沿用文本模型的付费档位,还是采用 Fin/Sante 那种免费 API 的策略。第四,FP8 检查点在真实服务中能否保持模型卡上标注的准确率——视觉塔保留 bf16 是个好迹象,但“量化视觉”的说法需要用一次实际运行来验证,而不是看配置就下结论。第五,产品版图问题:视觉能力既然已经并入快速的 Ling 产品线,接下来就要观察 Ant 是把 Ming 继续作为独立的多模态品牌,还是让两者走向融合。
对开发者来说,近期的答案很短。如果你想在今天基于它构建,官方API是零基础设施路径,FP8权重是自托管路径,两者本周都已就绪。如果你想基于42这个数字构建,那就等Ant之外的人复现它。关于Ling-3.0-flash-VL,一切真正有用的东西——MIT权重、合理的架构、激进的价格与激活比设计,以及值得认真对待的供应商评分——都已就位;而一切能让它成为安全默认选项的东西,仍然悬而未决。
