生成了一张题为“Ling-3.1-flash vs Ling-3.0-flash”的编辑主视觉卡片,副标题为“其中一个今天就能下载。另一个只是新闻稿里的一句话。”两栏对比:“Ling-3.1-flash(已宣布)”列出“~560B 总量 / ~25B 激活”、“最高 1M token 上下文”和“无权重,无许可证”;“Ling-3.0-flash(已发布)”列出“124B 总量 / 5.1B 激活”、“262,144 token 服务上下文”和“Hugging Face 上以 MIT 许可发布的权重”。
Guides & Insights

Ling-3.1-flash 对比 Ling-3.0-flash:百万级 Token 上下文窗口与 4.5 倍参数规模究竟改变了什么

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

蚂蚁集团的 Ling 家族新增了一个快速层级,而这一次,它才只有一句话的资历。Ling-3.1-flash 于 2026 年 9 月 30 日发布——总参数约 5600 亿,每个 token 激活约 250 亿,上下文窗口号称最高可达 100 万 token,还附了一句套话:“我们计划很快开源该模型。”它在快速产品线顶端所取代的模型 Ling-3.0-flash,从任何意义上说都是截然不同的物种:总参数 1240 亿,每个 token 激活 51 亿,服务上下文 262,144 token,自 8 月 7 日起在 Hugging Face 上以 MIT 许可证发布权重,Artificial Analysis Intelligence Index 独立评分为 20。其中一个模型你今天就能下载,另一个你只能读到相关介绍。将它们进行比较确实有用,但前提是,比较要从这里开始。

标题里的算术很简单,也略有误导性。Ling-3.1-flash 的总参数量约为 Ling-3.0-flash 的 4.5 倍,活跃参数量约为 4.9 倍——每 token 为 25B 对 5.1B。粗略一看会说:“模型大得多,因此也聪明得多。”更仔细的解读则是,Ant 在扩展模型体量的同时大致保持了稀疏比例,而这带来的是容量,未必是逐 token 的推理深度:一个模型若在每个 token 中路由其 560B 中的 25B,那它每 token 所做的工作要多于一个只路由 5.1B 的模型,但它也要为此付出大约五倍于前者的每 token 计算量。这笔权衡最终落在何处,完全取决于 Ant 的架构能否高效处理这些额外参数——而这是公告没有回答的问题。

这两个模型,并排

把已公布的事实彼此并列摆在一起,各代际便能清晰地分开。下面每一行列出的,是 Ant 或独立评估方实际已公布的内容;某个数字之所以缺失,是因为没有任何人公布过它。

• 总参数量 — Ling-3.1-flash:~560B(厂商)。Ling-3.0-flash:124B(模型卡)。

• 每 token 激活参数量 — Ling-3.1-flash:约 25B(厂商)。Ling-3.0-flash:5.1B(模型卡)。

• 上下文窗口 — Ling-3.1-flash:最高 1M token(厂商数据)。Ling-3.0-flash:原生 256K,实际以 262,144 提供服务(模型卡与推理配方)。

• 权重与许可证 — Ling-3.1-flash:未发布;无代码库,无许可证(已于 2026 年 9 月 30 日及 2026 年 10 月 1 日再次核查)。Ling-3.0-flash:MIT,自 2026 年 8 月 7 日起以 inclusionAI/Ling-3.0-flash 为名发布于 Hugging Face,并发布于 ModelScope。

• 权重格式 — Ling-3.1-flash:无可用。Ling-3.0-flash:来自实验室的 BF16(约 255GB)和 FP8(约 128GB),以及社区量化版本。

• 基准测试来源 — Ling-3.1-flash:完全由厂商自行报告,没有公开的测试框架,也没有可供重新运行的权重。Ling-3.0-flash:由 Artificial Analysis 独立评分,在 Intelligence Index 上得分为 20,并同时公布了实测输出速度和 token 生成量。

• 可用性 — Ling-3.1-flash:仅限 Ant 自家的 Ling Studio 产品。Ling-3.0-flash:可自托管,并可通过 Ant 的开发者 API 调用。

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

额外容量可能是用来做什么的

Ant 自己对 Ling-3.1-flash 的一句描述,是本次发布中最有信息量的内容。Ling Studio 应用将其宣传为“通用智能体、搜索、日常办公以及软件/代码开发”——这是一种办公工作和智能体导向的定位,而非推理基准导向的定位。这与该系列的划分方式一致:Ling 是通用文本与工具产品线,Ring 是推理产品线,Ming 负责多模态。Ling-3.0-flash 在上一代中占据了同样的位置,而且它明确属于快速、廉价的一档,而不是旗舰。

从这个角度来理解这次规模扩展,就说得通了。智能体与工具调用类工作负载漫长、重复且极度消耗上下文:单个智能体循环在采取行动之前,就可能烧掉数万个 token 的累积工具输出,因此 100 万 token 的窗口是功能性要求,而不是规格表上的装饰性噱头。在保持较大活跃参数占比的同时扩展总参数量,正是为一个仍须足够快、能置身于循环之中的模型增添世界知识与指令遵循深度的方式。Ant 在这里打造的并不是一个更慢、更聪明的旗舰;它打造的是一个更大的快速层级。

反方论点是成本,而这是同一套算术从另一个方向得出的结果。额外的容量在推理时并非免费——它要按每个 token 付费,而 Ant 根本没有公布 Ling-3.1-flash 的任何价格:没有 API 费率卡,没有缓存折扣,也没有任何能与上一代列出的每百万 token $0.075/$0.22 相提并论的东西。那个本可决定这场比较的数字缺失了,而它就是缺失的。

基准测试,以及谁运行了它们

Ling-3.1-flash 带着三项孤立来看都显得很强的分数发布:在 GDPVal-AA v2.1 上为 1,673 Elo,在 FrontierSWE 上为 75.16,在 HealthBench Professional 上为 65.35。这三项都是 Ant 自己的数字,取自其发布公告,且没有一项被外部实验室复现。实际后果是,它们可以与其他厂商的数字比较,但不能与独立数字比较——而 Artificial Analysis 给 Ling-3.0-flash 的 20 分 Intelligence Index 是一个不同量表上的独立数字,因此把两者并列,就是在拿一个测量结果与一项宣称作比较。截至撰写本文时,Artificial Analysis 上还没有 Ling-3.1-flash 的页面。

蚂蚁自家图表上的一处脚注,本身就值得单独点出。该卡片写明,HealthBench Professional 的结果是在“AQ 环境”中评估的,而 Ling-3.1-flash 的医疗健康能力目前只能在 AQ 中体验。没有任何公开文档解释 AQ 究竟是什么。一个带着未具名环境限定语的招牌分数,即便权重已经存在,也不是外部团队能够复现的。

这周到底该用哪一个

关于代际选择的问题,答案取决于你今天需要什么;而对几乎所有人来说,眼下的答案并不是更新的那款型号。

如果你本周就需要运行些什么,Ling-3.0-flash 是两者中唯一以可用形式存在的那个:可自行托管的 MIT 权重;若想占用空间更小,还有 FP8;第一方 API 定价已公布;以及一个能让你知道自己得到什么的独立评分。它在同层级中确实是一款好模型——独立评估把它放在了开放权重模型在智能与总参数对比上的帕累托前沿,并对其速度给予高度评价,但同时也附带一个提醒:它异常冗长,在评估过程中生成了约 2.6 亿个 token,而中位数接近 1 亿。

如果你在为未来六个月做规划,Ling-3.1-flash 是前进方向,但还不是一个组件。在它成为一个组件之前,需要关注的具体事项有:权重是否真的开放,以及依据什么许可证;所提供的窗口是否真的是 1M,还是对更短原生上下文的扩展;每百万 token 成本是多少;以及是否有独立实验室在 FrontierSWE 上复现 75.16。其中任何一项落地,都会成为重新运行比较的理由。目前一项都没有落地。

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

这在路由栈中的位置

目前我们的目录里没有任何一款 Ling 模型——Ling-3.0-flash、Ling-3.0-flash-VL 和 Ling-3.1-flash 全都返回 not-found,对照 OrcaRouter 的模型 API,所以对于“我能不能通过你们调用它”这个问题,诚实的答案是:目前不能。在像本周这样的一周里,路由层真正擅长的是问题的另一半:那些你会用来对候选模型做基准测试的模型。Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 都是以提供商标价、零加价提供的实时路由,而一个能用单个密钥将它们挂在其后、并具备自动故障转移的路由器,正是让你无需维护四套集成,也能让评估框架始终对准一个不断变化的目标的办法。等到 Ling-3.1-flash 的权重落地、许可证也清晰可读时,这个决策的形态同样如此:新增一个端点,而不是重建整个技术栈。

代际总结很短。Ling-3.0-flash 是一款已发布、经过独立评分、采用宽松许可证的模型,如今即可自托管。Ling-3.1-flash 则是一个规模更大、上下文更长、运行成本更高的承诺,而 Ant 尚未以任何开发者可用的形式交付它。把后者当作前者的升级,正是这次发布容易让人犯的错误,而数字目前还不支持这一点。

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".