Ling-3.0-flash:我们现在所了解的蚂蚁集团开放权重快速层MoE
Guides & Insights

Ling-3.0-flash:我们现在所了解的蚂蚁集团开放权重快速层MoE

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

蚂蚁集团的 InclusionAI 实验室正式发布了 Ling-3.0-flash——2026 年 7 月 24 日宣布,8 月 7 日以 MIT 许可证开源——与我们在 7 月发布的预览相比,情况已大不相同。这是一款原生混合推理的混合专家模型,总参数量为 124B,每个 token 仅激活 5.1B 参数,定位为 Ling 系列中快速且经济的档位。改变一切的两个数字:Artificial Analysis 现在将其在智能指数上的评分定为 38 分(比上一代快速档位 Ling-2.6-flash 高出 24 分),并将其置于开放权重模型在智能度与总参数量之间的帕累托前沿。权重已在 Hugging Face 和 ModelScope 上线。

当我们最初在7月24日报道该模型时,诚实的总结是:仅提供API,没有权重,没有许可证声明,没有独立基准测试。这四点现在都已过时。Ant于8月7日在MIT许可下开源了权重,Artificial Analysis此后也发布了完整的独立评估。本次更新相应地修订了最初的简报——主导7月帖子的“未经证实”标签现在适用于范围小得多的主张,主要是Ant的峰值速度数据,而非整个模型。

TL;DR。Ling-3.0-flash 是蚂蚁集团快速档的开源权重 MoE 模型:总参数 124B / 激活参数 5.1B,采用 MIT 许可证,原生上下文 256K(服务时为 262K)。Artificial Analysis 给出的智能指数为 38——较上一代 Ling-2.6-flash 提升 24 分,处于开源权重模型“智能 vs 总参数”的帕累托前沿——实测输出约 368 tokens/秒。权重已以 MIT 许可证发布在 Hugging Face 和 ModelScope 上。以下仍为厂商专属数据:宣称的 1,100+ tokens/秒峰值吞吐量、低于 100ms 的首 token 延迟,以及模型卡中的基准测试表。官方 API 定价为每 1M token 输入 $0.075 / 输出 $0.22(缓存命中降价 80%);发布时的免费额度已于 8 月 3 日结束。

关键要点

• 这是快速/廉价档位,而非旗舰型号。 上一代的1万亿参数旗舰仍是InclusionAI最大的模型;Ling-3.0-flash是更小、更快的姊妹模型,面向高吞吐量文本和工具调用。

• 权重现在在 MIT 许可下开放。 这些权重于8月7日以 MIT 许可证发布在 Hugging Face(inclusionAI/Ling-3.0-flash)和 ModelScope 上——这与7月“仅限API”的情况截然相反。

• 它终于有了一个独立的评分。Artificial Analysis 测得的智能指数为38,比 Ling-2.6-flash 高出24,并将该模型置于开放权重的帕累托前沿上,即在智能与总参数的权衡中。

• 速度目前已部分得到实测。 AA 输出速率实测约为 368 tokens/秒,首 token 延迟约 1.98 秒;Ant 宣称的 1,100+ tokens/秒峰值数据仍仅为厂商自报。

• 定价已确定,免费发布期已结束。 第一方API的价格为:每100万个token输入$0.075 / 输出$0.22,并享受80%的缓存命中折扣;发布免费额度已于8月3日结束。

• 它是三模型系列中的一员。InclusionAI 将其产品线分为 Ling(通用文本和工具 MoE,即本模型)、Ring(推理)和 Ming(多模态)。

关于如何阅读本更新的说明:这是对7月24日预览版的修订,撰写于权重开放、首批独立评分出现之后。下文的每项规格、基准测试和价格均标注了来源。在Ant Group是唯一来源之处——峰值速度声明和模型卡基准测试表——我们会明确说明。对于Artificial Analysis独立测量的内容,我们会加以引用。

我们实际所知

该架构现已完整记录在模型卡上。Ling-3.0-flash 采用原生混合线性注意力栈——Kimi Delta Attention (KDA) 与 Gated MLA 层以 5:1 比例交替(35 个 KDA + 7 个 MLA),并带有 KDA 细粒度对角门控——构建于 1/64 稀疏 MoE(512 个路由专家,每个 token 激活 8 个)之上。正因如此,其总参数达 124B,而激活参数仅 5.1B。上下文窗口原生为 256K,推理方案中以 262,144 个 token 提供服务,Ant 声称该架构可扩展至 1M。最大输出长度未公开。该模型为纯文本模型,支持工具调用;多模态输入则位于独立的 Ming 产品线中。

实验室发布了两种权重格式——BF16(约255GB)和FP8(约128GB)——社区量化变体也已链接在模型卡中。实验室自身的部署方案面向SGLang和vLLM。

可用性:开放权重,遵循MIT许可

8月7日,蚂蚁集团InclusionAI团队在Hugging Face(inclusionAI/Ling-3.0-flash)和ModelScope上以MIT许可证开源了模型权重。这是一个宽松且可商用的许可证——与Ling 2.0和Ling 2.6发布时使用的许可证相同——意味着你可以自行托管、微调和部署Ling-3.0-flash,而不必通过API租用。该模型也可以通过蚂蚁集团自己的开发者API及多个第三方平台调用。对于这个价位的快速级模型,更有意思的问题在于:是自行托管(FP8版本运行约需128GB显存),还是继续使用API。

独立评分:AA智能指数为38

与七月的帖子相比,最大的变化在于独立的评测数字已经出现。Artificial Analysis 为 Ling-3.0-flash 建立了一个页面,测得其在智能指数上为 38 分——比上一代快速档模型 Ling-2.6-flash(14 分)高出 24 分,并且与 MiMo-V2.5 和 Qwen 3.6 27B 持平,而激活的参数仅为它们的一小部分。Artificial Analysis 还将该模型置于开放权重模型按智能与总参数对比的帕累托前沿上:没有任何总参数更少的开放权重模型得分更高。AA 上 flash 档开放权重模型的领跑者 DeepSeek V4 Flash 的得分仍然更高(在最大推理强度下指数为 52)。

智能体和长上下文方面的结果在方向上也表现强劲。在AA的τ3-Bench银行测试套件中,Ling-3.0-flash得分27%,在flash级开放权重模型中位居第二,仅次于DeepSeek V4 Flash(39%)。在GDPval-AA v2上,它的Elo达到1108,高于Ling-2.6-flash的545。蚂蚁在10,000多个交互环境中训练了该模型(据厂商报告),并将其定位为智能体工作流的执行节点——快速、廉价且用完即弃,而繁重的推理则留给更大的旗舰模型。

关于来源的一个注意事项:Ant 的模型卡上的基准测试表——SWE-Bench Pro 56.6、SWE-bench Multilingual 72.4、MathArena AIME 2026 93.2、HLE 22.7——是厂商报告的,尚未被独立复现。请将其视为实验室自身的声明,与下方的峰值速度数据归为一类。

速度:先测量,再宣称

关于速度,现在有两个不同的说法。独立地,Artificial Analysis 测量到第一方 API 上约 368 tokens/秒 的输出速度和约 1.98 秒的首令牌时间——对于 5.1B 激活参数的 MoE 来说确实很快,足以让该模型在速度方面跻身同类前列。另外,Ant Group 声称在指定的 GPU 配置下平均输出速率超过 1,100 tokens/秒,首令牌时间低于 100 毫秒,并使用了基于 SGLang HiCache 和 Mooncake 构建的集群级分层缓存层。第二组数字仅来自厂商——是在 Ant 控制的硬件和批次配置上测得的,没有公开的独立复测结果。做规划时,请使用 AA 的数据;把 1,100+ tok/s 视为营销上限,需要在自己的负载上验证。

价格:便宜,而且促销已经结束了。

Artificial Analysis 列出的第一方 API 价格为每百万输入 tokens 0.075 美元、每百万输出 0.22 美元,缓存命中价格为 0.015 美元(−80%)——均为供应商设定的定价。发布时的免费套餐(每天 50 万免费 tokens,免费 API 访问)已于 8 月 3 日结束,Ant 在其 Ling Studio 上推出了限时 75% 折扣活动,持续至 2026 年 8 月 31 日,之后将适用列表定价。即使在完全按列表价计算时,0.075/0.22 美元的价格也使 Ling-3.0-flash 在 Index 为 38 的模型中稳居低价档位。

在如此低的价格下,切换成本比每个 token 的价格更重要。OrcaRouter 的存在就是为了让这种切换变得廉价:一个 API 即可访问 200+ 个模型,提供商标价以 0% 加价直接透传,并支持跨提供商自动故障转移——因此,当像这样的新开放模型在纸面上看起来不错时,你无需再签第二份合同,就能用真实工作负载测试它;如果它在某个特定任务上表现不佳,还可以在同一个密钥下回退到另一个模型。

凌/林/明家族

Ling-3.0-flash 并非孤立存在——InclusionAI 将其发布的产品划分为三个命名的系列,每个系列针对不同的任务。Ling 是面向日常文本生成和工具调用的通用 MoE 系列,Ling-3.0-flash 位于该系列快速/廉价的一端,比上一代的 1T 参数旗舰型号低一个档次。Ring 是专注于推理的系列,专为多步思维链而构建。Ming 是多模态系列。如果你的任务需要更重的推理或图像输入,合适的 InclusionAI 模型可能不是 Ling-3.0-flash——它专为文本与工具赛道中的高吞吐量和速度而设计。

适用人群:三种场景

1. 高吞吐量、延迟敏感的文本或工具调用流水线

这是该模型的主场。凭借38的独立指数、MIT许可证,以及实测约368 tok/s的速度,“快速档”的押注如今已可验证,而非停留在假设层面——你可以将自己的评估集拿来跑一遍,或者拉取权重自行托管。只是在你自己的工作负载上实测之前,不要围绕供应商宣称的1,100+ tok/s上限来构建方案。

2. 希望在有限预算下获得长上下文的团队

{{1}}拥有 256K 原生上下文(实际提供 262K),并宣称具备扩展到 1M 的路径,在 $0.075/$0.22 的定价下,对于检索密集或文档处理类工作而言是一个颇具吸引力的组合。{{/1}} {{2}}模型卡中的长上下文数据由供应商自行报告,因此应将其与成熟的长上下文方案一并列入候选名单,并在采用前使用您自己的语料库进行验证。{{/2}}

3. 关注中国MoE格局及InclusionAI发展路线的观察者

七月的问题——InclusionAI 是否会保持开放?——现在有了答案:是的,采用 MIT 许可,而且速度很快。Ling-3.0-flash 以 5.1B 激活参数登上 AA 帕累托前沿,这对任何关注中国实验室如何以效率而非原始参数数量展开竞争的人来说,都是一个值得参考的数据点。

还有什么尚未验证?

既然大的缺口已经补上,这里简短列几点。供应商对峰值速度的声称(1,100+ tok/s,sub-100ms TTFT)没有独立的重新测量。模型卡上的基准测试表是供应商自行报告的。FP4/INT4 变体和单 DGX-Spark 部署路径是供应商自行陈述的。在知识方面,AA 的 Omniscience Index 显示,较前一代的改进主要来自弃答——幻觉率下降(97% → 44%),而准确率仅小幅上升(16% → 18%)——所以不要把该指数的头条跃升误认为全面的知识飞跃。

何时不应使用

多模态工作请跳过Ling-3.0-flash——那是Ming的路线。需要重型推理旗舰而非快速执行器的话,同样请跳过——那是Ring的赛道。如果计划自行部署,请为实际硬件留足预算:BF16约255GB,FP8约128GB。若某条声明对你很重要,请务必核实——在独立实验室复测之前,峰值速度和长上下文的数据皆出自Ant。

常见问题

Ling-3.0-flash 的权重是开放的吗?

是的。权重已于8月7日以MIT许可证开源,发布在Hugging Face(inclusionAI/Ling-3.0-flash)和ModelScope上。这是一个宽松且可商业使用的许可证——与Ling 2.0和Ling 2.6发布时所用的许可证相同。

Ling-3.0-flash 在基准测试中的表现如何?

Artificial Analysis 测得的智能指数为 38,较 Ling-2.6-flash 提升 24 分,并将该模型置于以智能与总参数对比的开放权重帕累托前沿上。Ant 模型卡上的基准测试表(例如 SWE-Bench Pro 56.6)为厂商自行报告,尚未被独立复现。

它到底有多快?

Artificial Analysis 在第一方 API 上测得大约 368 tokens/秒的输出速度,首 token 延迟约 1.98 秒。Ant 声称在指定 GPU 配置下峰值吞吐量可达 1,100+ tokens/秒,TTFT 低于 100 毫秒——这些是供应商数据,未经独立复测。

Ling-3.0-flash 的价格是多少?

AA将第一方API定价为每100万输入token $0.075、每100万输出token $0.22,并提供80%的缓存命中折扣。发布时的免费套餐已于8月3日结束,Ling Studio的临时75%折扣期将持续至2026年8月31日。

上下文窗口有多大?

原生256K,以262,144个token提供服务;Ant声称该架构可扩展至1M。最大输出长度未披露。

Ling、Ring 和 Ming 之间有什么区别?

Ling 是 InclusionAI 的通用文本与工具调用 MoE 系列,Ling-3.0-flash 位于其快速/低成本的一端。Ring 是专注于推理的系列。Ming 处理多模态任务。它们是针对不同任务的独立家族,而非同一模型的层级。

Ling-3.0-flash 和之前的 1T 旗舰版是一样的吗?

不。Ling-3.0-flash 是更新、更小的快速档版本(总参数124B / 激活参数5.1B)。上一代的1T参数旗舰仍然是更大的模型。

我今天应该在生产环境中使用Ling-3.0-flash吗?

相比七月份,现在更站得住脚了,因为有了独立的评分和MIT许可证。先运行你自己的评估集,针对你的工作负载验证供应商的速度声称,然后在API和自托管之间做决定(FP8运行大约需要128GB)。其余仅由供应商提供的数据范围足够狭窄,可以围绕它们进行规划。

底线

{{1}}Ling-3.0-flash{{/1}}在两周内从“规格表和厂商声明”进阶为“开放权重、独立评分”。在5.1B激活参数下取得{{2}}AA Intelligence Index 38分{{/2}}——处于开放权重帕累托前沿,MIT许可,定价$0.075/$0.22——使其成为目前可选的最高效的开放权重模型之一,而且是你真正能自行运行的模型。需要警惕的地方比以前更少了:峰值速度和模型卡数据仍出自蚂蚁集团,有待独立实验室复现。以这个价格承接大规模文本和工具调用,它已赢得一次真正的评测机会。