生成的编辑主视觉卡片,标题为“Ling-3.1-flash:已宣布,但未开放”,副标题为“总参数量约 560B · 每 token 激活约 25B · 上下文最长 1M”。三张带标签的卡片分别写着“权重:尚未发布”、“基准测试:仅厂商自报”和“无许可证 · 无模型卡 · 无下载”。
Guides & Insights

Ling-3.1-flash 已宣布,但未开源:约 5600 亿参数、100 万 Token 上下文,以及一张只有 Ant 跑过的图表

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ant Group 的 Ling 团队于 2026 年 9 月 30 日公布了其下一代快速层级模型的各项数字,同时又表示你还不能获得它。根据 Ant Group 从其自己的 @AntLingAGI 账号发布的模型公告,Ling-3.1-flash 是一个约 5600 亿参数的专家混合模型,每个 token 激活约 250 亿参数,并具有最高 100 万个 token 的上下文窗口。定义此次发布的是紧随规格之后的那句话:“我们计划很快开源该模型。”截至今天,Hugging Face 上没有 Ling-3.1-flash 仓库,没有许可证,没有可下载的权重文件,也没有来自 Ant Group 之外任何人的评估。存在的只有一张基准测试图表、一个已上线的产品界面,以及一个承诺。

这一区别就是事情的全部,而且值得直言不讳,因为最先触达大多数人的那套说法——来自中国的500B级开放权重发布,性能逼近前沿——描述的是一件尚未发生的事。Ling-3.1-flash 并不是一次开放发布,而是一次已宣布的发布。两者相去甚远,而它们之间的落差,恰恰是读者可能栽跟头的地方:如果你围绕尚不存在的开放权重去规划容量、为试点做预算,或撰写采购备忘,那你就是在对着一份新闻稿做规划。

该公告实际包含的内容

这篇帖子很短,其中的数字也很具体。Ant 表示,总参数量约为 5600 亿,而每个 token 的激活参数约为 250 亿,比例接近 1:22,比它所接替的 Ling-3.0-flash 一代参数密度略高——该模型的总参数量为 124B,激活参数量为 5.1B,约为 1:24,而规模还不到新模型的四分之一。上下文被引述为“最高 100 万 tokens”,是 Ling-3.0-flash 系列目前提供的 262,144 token 窗口的四倍。还附带了三个关键得分:在 GDPVal-AA v2.1 上为 1,673 Elo,在 FrontierSWE 上为 75.16,在 HealthBench Professional 上为 65.35。

那些数字中的每一个都是由厂商报告的、第一方提供的,并且没有以任何第三方能够重新运行的形式公布。既没有评测工具链,也没有提示集,没有运行配置,也没有随机种子——而且更根本的是,没有可供运行它们的权重。如果 Ant 的数字是对的,该模型就处于中国开源模型发布的第一梯队;而目前没有办法查明它们是否正确。

图表,以及其中暗含的警告

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

Ant 发布了 Ling-3.1-flash,同时附上一张多面板基准测试卡,将其置于一众前沿与准前沿模型之列:GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM 家族的两个条目,以及 DeepSeek-V4.1-Flash。在各面板中,Ling 的柱条在智能体与编程类指标上位居或接近榜首,在多轮对话和特定领域指标上则处于中游。就按它的本来面目来读——这是厂商自选的一组任务,取自一个涵盖通用智能体工作、编程、银行领域任务和医疗健康的测试套件——而它看起来是一张颇为可信的卡片。

不过,看看上面有谁,有一点很突出。Ant 选择的前沿对标模型是 GPT-5.6 Sol 和 Claude Opus 5。这两个模型现在都落后了一代。Opus 5.5 和 GPT-6 Sol 都在 2026 年 9 月 22 日同一天上线,如今也都可以路由调用。Ant 没有放进这张模型卡的最新模型,恰恰是读者最希望拿来衡量它的那些——这正是该发布首批评论中出现的相同抱怨:希望一个十月问世的模型,被拿来对标十月的前沿,而不是七月的前沿。这并不是贬低该模型,它很可能经得起检验。这倒让人有理由把这张模型卡视为方向性主张,而非最终裁决,也让人注意到,Ant 选择的比较与其说美化了结果,不如说让它显得过时。

在你能触摸到它的地方,以及一个未加解释的脚注

如今,Ling-3.1-flash 面向用户运行的地方只有一个:蚂蚁自家的产品。ling.tbox.cn 上的 Ling Studio 界面在其模型选择器中列出了 Ling-3.1-flash,而该应用对这款模型自身的描述比基准测试卡上的更宽泛——它将其推介为“通用型智能体、搜索、日常办公以及软件/代码开发”,这正是这一档位常见的定位:不是家族中推理能力最强的那个,而是那个旨在被频繁、低成本调用的模型。

那个表面也承载着此次发布最尴尬的细节。基准测试卡自己的脚注称,HealthBench Professional——公告文本中三个数字之一的 65.35——是“在 AQ 环境中评估的”,并补充说 Ling-3.1-flash 的医疗健康能力“目前只能在 AQ 中体验”。卡片上没有任何内容解释 AQ 是什么,我们也找不到任何公开文档来定义它。一个附带环境限定条件的醒目分数,而该环境却未具名,这不是可复现的结果;它只是一个旁边摆着数字的产品演示。

什么是可知的,什么是不可知的

读者今天能对这个版本做的最有用的事,就是把它归入那两类。

现在可知的是:厂商公布的参数、激活参数量以及上下文窗口;三项厂商基准测试;该模型存在于 Ant 自家产品中;Ant 所选的对比集合;尚未发布任何权重、许可证或模型卡这一事实;以及曾独立评分上一代的 Artificial Analysis 没有 Ling-3.1-flash 页面这一事实。截至本文撰写时,那个让 Ling-3.0-flash 的 20 分 Intelligence Index 数值变得可读的独立评分流程,完全没有发布任何关于 3.1 的内容。

目前尚不可知:权重是否真的会开放,以及以何种许可证开放;其架构是 Ling-3.0 混合技术栈的放大版,还是某种全新的东西;如果该模型有 API 定价的话,通过 Ant 的 API 调用它要花多少钱;它在长上下文中的实际表现如何,而不是窗口规格是如何规定的;以及当非 Ant 方运行相同任务时,基准测试中的差距是否依然成立。每一个问题,都是已发布模型在发布第一天就能回答、而仅被宣布的模型只能在某个尚未排定的日子才能回答的问题。

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

如何解读这样的一天

这种模式如今已经普遍到可以命名了。一家有着出色往绩的中国实验室放出模型卡和基准图表,数字落在前沿附近,社区对这些数字作出反应,而权重会在数周后到来——或者不会。Ling-3.0-flash 今年夏天正是照此上演,而它最终如何收场值得记住:Ant 于 2026 年 7 月 24 日将其发布为一款仅提供 API 的模型,没有许可证声明,也没有独立基准测试,而 MIT 许可下的权重直到 8 月 7 日才出现在 Hugging Face 上,距离公告发布已过去两周。Ling-3.1-flash 在第一天就处于这条轨迹中的对应位置,额外不同之处在于,这一次开源的承诺在公告中是明确写出的,而不是推断出来的。

Ant 选作对比对象的那些模型,没有一个以本文主角的身份出现在我们的目录中——Ling-3.1-flash、Ling-3.0-flash 和 Ling-3.0-flash-VL 在今天的 OrcaRouter 目录上全部返回 not-found,这一点我们不打算假装不是如此。但那张图上的同类模型里有三个现在就能路由调用:Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 都只需一个密钥,按提供商标价、零加价,并在彼此之间自动故障转移。在这样的一周里,这比听起来更重要,因为对一款刚宣布的模型,诚实的做法就是跑一遍 Ant 所邀请的那种对比——去跟真正能调用到的模型比——趁对比对象还只是一张图的时候。

当权重落地时,真正有用的问题不会是 Ling-3.1-flash 是否在某一个 Elo 评分上击败了 Opus 5。而会是:一个约 560B 参数、约 25B 激活的 MoE,能否以让这种稀疏性物有所值的价格,承载 1M token 的上下文;以及它的许可证是否足够宽松,允许自托管。这两个问题正是公告没有回答的,而它们也是唯一会决定它究竟成为人们在其上构建的模型,还是某人下一份演示文稿里的一页幻灯片的问题。眼下:名字是真的,数字只有 Ant 自己给出,而权重仍然只是一句话。

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".