Ling-3.0-flash: 关于蚂蚁集团新型快层级MoE我们实际知道的(以及我们不知道的)
Guides & Insights

Ling-3.0-flash: 关于蚂蚁集团新型快层级MoE我们实际知道的(以及我们不知道的)

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

蚂蚁集团旗下的InclusionAI实验室于2026年7月23日左右发布了Ling-3.0-flash——这意味着截至本文撰写时,它仅问世数日。这是一款混合专家(MoE)语言模型,总参数量达124B,每个token约激活5.1B参数(稀疏率约为24:1),专为文本生成和工具调用而设计。它被定位为Ling家族中快速、廉价的产品层级;旗舰地位仍属于规模大得多的Ling-2.6-1T(总参数量1T / 激活参数63B)。目前仅通过API提供访问——可通过蚂蚁集团自家的开发者门户、OpenRouter上的inclusionai/ling-3.0-flash以及ZenMux使用。

这就是已确认的全貌,有必要坦诚说明为什么这份简报读起来比典型的模型评述更为谨慎。没有 Hugging Face 权重,没有 Ling-V3 的 GitHub 仓库,也没有清晰的许可声明 —— 这与 Ling 2.0 和 Ling 2.6 相比是一个真正的变化,两者都以 MIT 许可下作为开放权重发布。同样也没有任何形式的独立基准数据:Artificial Analysis,这个最常被引用的针对此类模型的第三方评估机构,还没有为其设立页面。目前流传的每一条性能和速度数据都直接源自蚂蚁集团本身。

太长不看.Ling-3.0-flash 是蚂蚁集团 InclusionAI 推出的 MoE 模型,拥有 124B 参数,5.1B 激活参数,最近几天内发布,仅提供 API 接口,没有 Hugging Face 权重,且许可证未确认。供应商宣称——峰值吞吐量 1000 tokens/秒,首 Token 延迟低于 100 毫秒——尚未经过独立验证,也没有此特定模型的 Artificial Analysis 评分。上一代 Ling-2.6-flash 在 Artificial Analysis Intelligence Index 中仅得 14 分(Ling-2.6-1T 得 26 分),这是有用的参考,但不能替代 3.0-flash 的真实能力。定价(输入 ¥0.40/百万 token,输出 ¥1.20/百万 token,目前在发布周免费,每日 50 万免费 token)明确是促销价,很可能会调整。所有内容请视为预览,而非最终定论。

关键要点

这是快速/廉价层级,不是旗舰产品。Ling-2.6-1T仍然是InclusionAI最大的模型;Ling-3.0-flash是一个更小、更便宜、更快的兄弟模型,面向高容量使用。

尚无独立的基准测试。人工智能分析平台尚未收录Ling-3.0-flash页面。目前公开数据仅有蚂蚁集团自身提供,且其文档中至今未显示该模型的任何基准测试表。

速度声明仅由供应商自行提出。峰值每秒1000个令牌及低于100毫秒的首令牌输出时间均来自蚂蚁集团,且尚无第三方吞吐量测试对这两项数据进行验证。

没有开放权重,许可证未确认。 没有Hugging Face仓库,也没有GitHub Ling-V3项目。之前的Ling版本采用MIT许可证;3.0-flash是否会沿用此许可证尚不明确。

定价是发布周的促销活动。目前,Ant平台上每100万Tokens的0.40/1.20元费用已被免除,同时每天提供50万免费tokens,并免费在OpenRouter上列出——促销结束后,这些优惠均不应被视为仍然有效。

它是三模型家族中的一员。InclusionAI 将其产品线分为 Ling(通用 MoE,即本模型)、Ring(专注推理)和 Ming(多模态)。

关于如何阅读本简报的说明:下面的每个规格、基准和价格都标注了来源。如果蚂蚁集团是唯一来源,我们会明确说明并相应地进行保留。如果前一代Ling模型有独立评分,我们会引用它们作为背景信息——而不是作为Ling-3.0-flash本身数据的替代,因为后者目前尚未存在。一旦独立测试跟上,这可能需要后续更新。

我们实际所知

从架构上看,Ling-3.0-flash 是一个稀疏 MoE 模型:总参数量为 1240 亿,单个 token 上激活约 51 亿参数,这使得它相比总规模运行成本更低、速度更快。根据蚂蚁集团官方文档,上下文窗口为 25.6 万 token,厂商声称可扩展至 100 万;OpenRouter 的列表显示 262,144 token,与 25.6 万的数字一致。我们未找到最大输出长度的任何披露信息。该模型支持标准文本生成和工具调用,但未提及任何多模态输入或输出——该能力归属于独立的 Ming 系列。

关于可用性,情况是仅提供API,并且在我们发现的三个途径中保持一致:蚂蚁集团自己的开发者平台、OpenRouter(列为inclusionai/ling-3.0-flash)和ZenMux。这些都没有提供可下载的权重。没有名为“Ling-V3”项目的GitHub组织页面,蚂蚁的文档也没有说明这个特定模型的许可证——这是一个有意义的差距,因为Ling 2.0和Ling 2.6都是以MIT许可证发布的开源权重。在InclusionAI澄清之前,不要假设Ling-3.0-flash最终会开源,也不要假设它不会。

差距:未经验证的

最大的差距在于基准测试。截至撰写本文时,Artificial Analysis——这个通常被引用来评估此类模型的独立评测机构——没有针对Ling-3.0-flash的页面;通常承载该页面的URL模式返回了404错误。这意味着目前没有第三方推理、编码或数学得分可用于该模型,无论是来自Artificial Analysis还是我们能找到的任何其他独立评测机构。蚂蚁集团自身的文档加重了这一问题:它根本没有发布3.0-flash的基准测试表,无论是自家还是其他来源,这对于模型发布版本来说是不寻常的,本身就值得注意。

作为大致背景,上一代Ling模型确实有独立的评分。Ling-2.6-flash 在 Artificial Analysis 智能指数上得分为14,而更大的 Ling-2.6-1T 得分为26——两者均远落后于当时 Artificial Analysis 追踪的领先开源模型。蚂蚁集团自家厂商数据显示,Ling-2.6-flash 在 SWE-bench Verified 上声称达到61.2%,在 AIME2026 上为73.85%。这些数字不应直接套用到 Ling-3.0-flash 上;新一代架构的模型可能向任一方向发展,在独立评估方实际运行之前,任何关于 3.0-flash 的能力宣称都只是披着事实外衣的猜测。

供应商速度声称:纸面上快速,实际上未经验证

蚂蚁集团对Ling-3.0-flash的宣传重点并非推理质量,而是原始速度。该供应商声称峰值吞吐量达到每秒1000个token,且首token延迟低于100毫秒,若经证实,这两项指标确实算得上快速。但“若经证实”这句话中的信息量不容忽视:这些数据完全来自蚂蚁集团自身的资料,是在其控制且未完全披露的条件下测量得出的(硬件、批次大小、提示长度和负载均会显著影响吞吐量数字)。尚无独立实验室公开发布复测结果。在蚂蚁之外有人进行可比测试之前,请将1000 tok/s和低于100ms的TTFT视为营销数据,值得对照自身工作负载进行验证,而非既定事实。

定价,以及它为何是个不断变化的目标

在蚂蚁集团自家平台上,Ling-3.0-flash 的标价为每100万个输入代币¥0.40,每100万个输出代币¥1.20——这种设计上很便宜,与其作为快速/廉价层级的定位相符。但这个标价实际上并不是任何人当前支付的价格:蚂蚁正在推出免费发布周促销活动,另外还在其平台上每天提供50万免费代币。OpenRouter 的列表显示一个 ling-3.0-flash:free 变体,价格为 $0/$0。这些都不应被误认为是稳定的价格。发布促销会过期,免费层级会设上限,而 ¥0.40/¥1.20 这些数字本身也可能在获得实际使用数据后发生变化。如果你计划围绕这个模型进行生产支出,请按标价预算,而不是促销价,并在承诺前重新检查。

凌/林/明家族

Ling-3.0-flash 并非独立存在——InclusionAI 将其发布划分为三个命名的系列,每个系列针对不同的任务。Ling 是通用型 MoE 系列,覆盖日常文本生成和工具调用;Ling-3.0-flash 位于该系列的快速/廉价端,而 Ling-2.6-1T 仍是更大的旗舰型号。Ring 是 InclusionAI 专注推理的系列,专为依赖多步思维链而非原始吞吐量的任务而构建。Ming 是多模态系列,处理图像及其他 Ling 本身不涉及的非文本模态。如果你的任务需要更重的推理或多模态输入,合适的 InclusionAI 模型很可能不是 Ling-3.0-flash——它专为文本和工具通道中的高并发和速度而设计,而非涉足另外两个系列的领域。

适用对象:三种场景

{{1}}高容量、对延迟敏感的文本或工具调用管道——作为试点,而非承诺{{/1}}

如果你的工作负载主要受吞吐量敏感的文本生成或工具调用主导——例如聊天、轻量级Agent、高频API调用——那么Ling-3.0-flash的定位(小活跃参数数量、声称低于100毫秒的TTFT、近乎免费的发布定价)使其值得进行试点。关键在于,“值得试点”与“值得将生产流量切换过去”是两回事。在没有独立基准测试数据的情况下,你现在就是基准:在将其用于任何面向客户的任务之前,先用自己的评估集对其进行测试,并且不要基于当前的促销定价来构建成本模型。

2. 预算有限但需要长上下文的团队

256K上下文窗口(供应商声称可扩展至1M)以真正低廉的标价,对于检索密集型或文档处理用例来说是一个有吸引力的组合,前提是该模型在该上下文长度上的实际推理质量能够保持——然而,同样,没有独立来源对此进行过测试。这是一个合理的候选,可以与已有的廉价长上下文选项一起列入候选名单,但它应与其并列评估,而不是仅凭Ant的规格表就采用。

3. 观察者追踪中国的MoE格局与InclusionAI路线图

对于追踪中文开放和半开放模型实验室竞争格局(而非在生产环境中部署任何单一模型)的团队而言,Ling-3.0-flash是一个有用的数据点:它表明InclusionAI正在快速迭代其快速层级,可能暂时从开放权重后退,并继续押注三大家族结构(Ling/Ring/Ming)而非单一通用模型。值得收藏,并在基准测试和许可证明确后重新审视。

何时不应使用

跳过Ling-3.0-flash用于任何需要引用经过验证的能力声明的场景——目前没有独立的基准可供参考,因此任何关于其推理、编码或数学能力的说法都是不可证伪的。如果你需要开放权重用于自托管、微调或合规性要求,也应跳过它;模型本身没有任何开放权重可用,而且这个特定模型的许可证甚至尚未声明,更不用说确认为宽松许可了。在多模态任务中也要跳过它——那是Ming系列的工作,而非Ling的职责。此外,要谨慎基于当前定价构建成本模型:免费发布周、每日50万免费token以及免费OpenRouter层级都是促销性质,而很可能恢复的¥0.40/¥1.20标价本身尚未经过实际使用模式的检验。

常见问题

Ling-3.0-flash 的权重是开放的吗?

目前还没有。截至目前,没有Hugging Face仓库,也没有GitHub上的Ling-V3项目。之前的Ling版本(2.0和2.6)是以MIT许可证开放权重发布的,但没有任何信息确认Ling-3.0-flash会遵循这一模式——也不会确认它不会。

Ling-3.0-flash 在基准测试中的表现如何?

目前还没有针对它的独立基准测试——Artificial Analysis 没有该模型的页面。蚂蚁集团自己的文档也未发布该模型的基准表。粗略历史背景:前代 Ling-2.6-flash 在 Artificial Analysis Intelligence Index 上得分为 14,Ling-2.6-1T 得分为 26,但这两个数字都不应假定适用于这一代新模型。

它到底有多快?

Ant Group声称峰值吞吐量达到1000 tokens/秒,首令牌时间低于100毫秒。这两项都是供应商独有的数据,目前没有独立的第三方重新测量结果公布。请将其视为需要在您自己的工作负载上验证的声明,而非确认的性能。

Ling-3.0-flash 的价格是多少?

蚂蚁平台的标准定价为每100万输入令牌¥0.40,每100万输出令牌¥1.20,但目前在发布周促销期间免费使用,每天还可享受50万免费令牌。OpenRouter也列出了一个免费版本。请注意,这些促销条款可能会发生变化。

上下文窗口有多大?

根据蚂蚁集团的文档,令牌数为256K,供应商声称可扩展到1M。OpenRouter的列表显示为262,144个令牌,与256K的数字一致。最大输出长度未披露。

Ling、Ring和Ming有什么区别?

Ling 是 InclusionAI 的通用文本与工具调用 MoE 模型系列,Ling-3.0-flash 处于该系列的快速/廉价端。Ring 是专注推理的模型系列。Ming 则处理多模态任务。它们是针对不同用途构建的独立模型家族,而非同一模型的不同层级。

Ling-3.0-flash 和 Ling-2.6-1T 是同一个吗?

型号 Ling-2.6-1T 是 InclusionAI 的更大旗舰模型(总计1T参数 / 630亿活跃参数),并且仍然是一个独立的、更大的模型。Ling-3.0-flash(总计1240亿参数 / 约51亿活跃参数)是更新、更小、更快速的系列版本。

我今天应该在生产环境中使用Ling-3.0-flash吗?

只有在进行过自己的评估之后才应如此。在缺乏独立基准测试、许可证未经确认、且定价目前属于促销阶段的情况下,将其用于试点是合理的,但若没有自己的测试,也未制定促销条款结束后的应对计划,就将生产关键型或合规敏感型的工作负载交由其处理,则还为时过早。

底线

Ling-3.0-flash 是一个真正值得追踪的新版本——一个 124B/5.1B 激活的 MoE 模型,直指快速、廉价、高容量的文本和工具调用任务,出自一家此前已发布过可靠模型的实验室。但目前它只是一份规格表和一套供应商声明,而非经过验证的产品:没有独立基准测试、没有开放权重、没有确认的许可证,且定价明确为促销价。这并非否定它的理由——而是建议谨慎试用、直接验证那些对你至关重要的声明,并在 Artificial Analysis 或其他独立评估机构发布真实数据后,重新审视这篇简介。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube