
Ling-3.1-flash 已宣布,但未开源:约 5600 亿参数、100 万 Token 上下文,以及一张只有 Ant 跑过的图表
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 262 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
Ant Group 的 Ling 团队于 2026 年 9 月 30 日公布了其下一代快速层级模型的各项数字,同时又表示你还不能获得它。根据 Ant Group 从其自己的 @AntLingAGI 账号发布的模型公告,Ling-3.1-flash 是一个约 5600 亿参数的专家混合模型,每个 token 激活约 250 亿参数,并具有最高 100 万个 token 的上下文窗口。定义此次发布的是紧随规格之后的那句话:“我们计划很快开源该模型。”截至今天,Hugging Face 上没有 Ling-3.1-flash 仓库,没有许可证,没有可下载的权重文件,也没有来自 Ant Group 之外任何人的评估。存在的只有一张基准测试图表、一个已上线的产品界面,以及一个承诺。
这一区别就是事情的全部,而且值得直言不讳,因为最先触达大多数人的那套说法——来自中国的500B级开放权重发布,性能逼近前沿——描述的是一件尚未发生的事。Ling-3.1-flash 并不是一次开放发布,而是一次已宣布的发布。两者相去甚远,而它们之间的落差,恰恰是读者可能栽跟头的地方:如果你围绕尚不存在的开放权重去规划容量、为试点做预算,或撰写采购备忘,那你就是在对着一份新闻稿做规划。
该公告实际包含的内容
这篇帖子很短,其中的数字也很具体。Ant 表示,总参数量约为 5600 亿,而每个 token 的激活参数约为 250 亿,比例接近 1:22,比它所接替的 Ling-3.0-flash 一代参数密度略高——该模型的总参数量为 124B,激活参数量为 5.1B,约为 1:24,而规模还不到新模型的四分之一。上下文被引述为“最高 100 万 tokens”,是 Ling-3.0-flash 系列目前提供的 262,144 token 窗口的四倍。还附带了三个关键得分:在 GDPVal-AA v2.1 上为 1,673 Elo,在 FrontierSWE 上为 75.16,在 HealthBench Professional 上为 65.35。
那些数字中的每一个都是由厂商报告的、第一方提供的,并且没有以任何第三方能够重新运行的形式公布。既没有评测工具链,也没有提示集,没有运行配置,也没有随机种子——而且更根本的是,没有可供运行它们的权重。如果 Ant 的数字是对的,该模型就处于中国开源模型发布的第一梯队;而目前没有办法查明它们是否正确。
图表,以及其中暗含的警告

Ant 发布了 Ling-3.1-flash,同时附上一张多面板基准测试卡,将其置于一众前沿与准前沿模型之列:GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM 家族的两个条目,以及 DeepSeek-V4.1-Flash。在各面板中,Ling 的柱条在智能体与编程类指标上位居或接近榜首,在多轮对话和特定领域指标上则处于中游。就按它的本来面目来读——这是厂商自选的一组任务,取自一个涵盖通用智能体工作、编程、银行领域任务和医疗健康的测试套件——而它看起来是一张颇为可信的卡片。
不过,看看上面有谁,有一点很突出。Ant 选择的前沿对标模型是 GPT-5.6 Sol 和 Claude Opus 5。这两个模型现在都落后了一代。Opus 5.5 和 GPT-6 Sol 都在 2026 年 9 月 22 日同一天上线,如今也都可以路由调用。Ant 没有放进这张模型卡的最新模型,恰恰是读者最希望拿来衡量它的那些——这正是该发布首批评论中出现的相同抱怨:希望一个十月问世的模型,被拿来对标十月的前沿,而不是七月的前沿。这并不是贬低该模型,它很可能经得起检验。这倒让人有理由把这张模型卡视为方向性主张,而非最终裁决,也让人注意到,Ant 选择的比较与其说美化了结果,不如说让它显得过时。
在你能触摸到它的地方,以及一个未加解释的脚注
如今,Ling-3.1-flash 面向用户运行的地方只有一个:蚂蚁自家的产品。ling.tbox.cn 上的 Ling Studio 界面在其模型选择器中列出了 Ling-3.1-flash,而该应用对这款模型自身的描述比基准测试卡上的更宽泛——它将其推介为“通用型智能体、搜索、日常办公以及软件/代码开发”,这正是这一档位常见的定位:不是家族中推理能力最强的那个,而是那个旨在被频繁、低成本调用的模型。
那个表面也承载着此次发布最尴尬的细节。基准测试卡自己的脚注称,HealthBench Professional——公告文本中三个数字之一的 65.35——是“在 AQ 环境中评估的”,并补充说 Ling-3.1-flash 的医疗健康能力“目前只能在 AQ 中体验”。卡片上没有任何内容解释 AQ 是什么,我们也找不到任何公开文档来定义它。一个附带环境限定条件的醒目分数,而该环境却未具名,这不是可复现的结果;它只是一个旁边摆着数字的产品演示。
什么是可知的,什么是不可知的
读者今天能对这个版本做的最有用的事,就是把它归入那两类。
现在可知的是:厂商公布的参数、激活参数量以及上下文窗口;三项厂商基准测试;该模型存在于 Ant 自家产品中;Ant 所选的对比集合;尚未发布任何权重、许可证或模型卡这一事实;以及曾独立评分上一代的 Artificial Analysis 没有 Ling-3.1-flash 页面这一事实。截至本文撰写时,那个让 Ling-3.0-flash 的 20 分 Intelligence Index 数值变得可读的独立评分流程,完全没有发布任何关于 3.1 的内容。
目前尚不可知:权重是否真的会开放,以及以何种许可证开放;其架构是 Ling-3.0 混合技术栈的放大版,还是某种全新的东西;如果该模型有 API 定价的话,通过 Ant 的 API 调用它要花多少钱;它在长上下文中的实际表现如何,而不是窗口规格是如何规定的;以及当非 Ant 方运行相同任务时,基准测试中的差距是否依然成立。每一个问题,都是已发布模型在发布第一天就能回答、而仅被宣布的模型只能在某个尚未排定的日子才能回答的问题。

如何解读这样的一天
这种模式如今已经普遍到可以命名了。一家有着出色往绩的中国实验室放出模型卡和基准图表,数字落在前沿附近,社区对这些数字作出反应,而权重会在数周后到来——或者不会。Ling-3.0-flash 今年夏天正是照此上演,而它最终如何收场值得记住:Ant 于 2026 年 7 月 24 日将其发布为一款仅提供 API 的模型,没有许可证声明,也没有独立基准测试,而 MIT 许可下的权重直到 8 月 7 日才出现在 Hugging Face 上,距离公告发布已过去两周。Ling-3.1-flash 在第一天就处于这条轨迹中的对应位置,额外不同之处在于,这一次开源的承诺在公告中是明确写出的,而不是推断出来的。
Ant 选作对比对象的那些模型,没有一个以本文主角的身份出现在我们的目录中——Ling-3.1-flash、Ling-3.0-flash 和 Ling-3.0-flash-VL 在今天的 OrcaRouter 目录上全部返回 not-found,这一点我们不打算假装不是如此。但那张图上的同类模型里有三个现在就能路由调用:Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 都只需一个密钥,按提供商标价、零加价,并在彼此之间自动故障转移。在这样的一周里,这比听起来更重要,因为对一款刚宣布的模型,诚实的做法就是跑一遍 Ant 所邀请的那种对比——去跟真正能调用到的模型比——趁对比对象还只是一张图的时候。
当权重落地时,真正有用的问题不会是 Ling-3.1-flash 是否在某一个 Elo 评分上击败了 Opus 5。而会是:一个约 560B 参数、约 25B 激活的 MoE,能否以让这种稀疏性物有所值的价格,承载 1M token 的上下文;以及它的许可证是否足够宽松,允许自托管。这两个问题正是公告没有回答的,而它们也是唯一会决定它究竟成为人们在其上构建的模型,还是某人下一份演示文稿里的一页幻灯片的问题。眼下:名字是真的,数字只有 Ant 自己给出,而权重仍然只是一句话。

