“Ling-3.1-flash 在 AA Intelligence Index 上达到 41”的主视觉标题卡,副标题为“来自蚂蚁集团的 560B 总参数 / 25B 激活参数 MoE”。一张大号圆角卡片上写着数字“41”,并配有标签“Artificial Analysis Intelligence Index v4.3.2”;下方第二张小卡片上写着“对比 20”,标签为“Ling-3.0-flash”。页脚一行文字为“指数数据由 Artificial Analysis 独立测量;模型发布于 2026-10-01。”OrcaRouter 标志合成于右下角。
Guides & Insights

Ling-3.1-flash在Artificial Analysis智能指数中得分41:560B MoE性能达到前代两倍

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash,蚂蚁集团的5600亿参数混合专家模型,如今带有一个并非其自家实验室写下的数字:在Artificial Analysis Intelligence Index上拿到41分。该指数由独立评估机构运行,使用该评估机构掌控的硬件,针对固定测试套件进行——它使该模型比其直接前代Ling-3.0-flash高出21分,而后者在同一指数上仍为20分。蚂蚁于2026年9月底宣布Ling-3.1-flash,Artificial Analysis将发布时间定为10月1日,而它比那个被它分数翻倍的模型年轻三个月。

那个差距才是关键。在一个由十种不同评估构成的基准测试上出现 21 分的变动,不是厂商图表能伪造出来的东西,也不是这个博客两周前写得出来的东西——当时对 Ling-2.1-flash 唯一存在的测量,是 Ant 自己的基准测试卡:GDPval-AA v2.1 上 1,673 Elo,FrontierSWE 上 75.16,HealthBench Professional 上 65.35。那些数字是真实实验室提出的真实主张,但未被复现。41 则性质不同。它是本次发布中第一个第三方可以据以问责的数字。

41 实际上衡量的是什么

Artificial Analysis Intelligence Index v4.3.2 是十项评估的加权综合:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。孤立地看待综合指数是错误的,因此各项评估的细分行比总体数字更重要:

• GDPval-AA — Ling-3.1-flash 为 1,621.75,而 Ling-3.0-flash 为 948.35。这是该组中最大的单次跃升,也是指数变动所主要依赖的一项。

• GDP.pdf — 0.100 全部通过,高于 0.054。绝对值仍然偏低,但几乎翻了一番。

• AA-LCR v1.1 长上下文推理——0.83,而前代为 0.73,与 DeepSeek V4.1 Flash(Max)的 0.84 持平。

• SciCode — 0.541 对比 0.420。这是编码科学能力的提升,而非聊天质量的提升。

• CritPt 物理推理 — 0.180,相比之前的 0.017。在较小基数上达到前代的十倍。

• AA-Omniscience——+2.22,而 Ling-3.0-flash 为 −17.88。这一项将在下文中讨论,因为它与主要结论相悖。

Ling-3.0-flash 在这些行上并非只是输给了 Ling-3.1-flash;它在其中两行上彻底崩了。它在 AutomationBench-AA 上得分 0.032,在 Terminal-Bench 4.0 上则恰好为 0.000。41 这个数字正应放在这一背景下解读——其前代是一个高效、廉价、开放权重的模型,基本上完全不具备智能体终端能力。

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

收益来自哪里:智能体工作,而非对话

将 Ling-3.1-flash 的指数贡献与它最常被并列比较的两款 Flash 级模型进行对比,一个被总体数据所掩盖的模式便显现出来。DeepSeek V4.1 Flash(Max)在同一指数上得到 39 分,GLM 5.3 Flash 得到 42 分,因此三者都落在三个点的区间内。但它们抵达这一位置的路径各不相同。

• 智能体终端任务 —— Ling-3.1-flash 在 Terminal-Bench 4.0 上得分 0.333,DeepSeek V4.1 Flash(Max)0.268,GLM 5.3 Flash 0.328。

• 智能体真实世界工作 — Ling-3.1-flash 在 GDPval-AA 上获得 1,621.75 Elo,DeepSeek V4.1 Flash(Max)1,600,GLM 5.3 Flash 1,646.86。

• AutomationBench-AA — Ling-3.1-flash 0.617,DeepSeek V4.1 Flash (Max) 0.689,GLM 5.3 Flash 0.604。

• 编程科学 — Ling-3.1-flash 在 SciCode 上得分 0.541,DeepSeek V4.1 Flash (Max) 0.519,GLM 5.3 Flash 0.516。

狭义解读是,Ling-3.1-flash 在智能体基准测试上具备竞争力,在 SciCode 上略有领先。更有用的解读是:在大多数人说到“它能否驱动工具循环”时所指的两项智能体终端指标上,它是三者中最强的——而在知识可靠性指标上,它落后于另外两者。这是一种具体的形状,而非全面胜出,值得在有人仅凭那个指数数字就为一个工作负载买单之前把它点明。

伴随更大模型而来的账单

Ling-3.0-flash 在蚂蚁自己的 API 上定价为每百万输入 token 0.07 美元、每百万输出 token 0.22 美元,并且是以 MIT 许可证开放权重。Ling-3.1-flash 目前这两者都还不具备。Artificial Analysis 记录其运行成本为每百万输入 0.30 美元、每百万输出 0.90 美元——缓存命中价格为 0.06 美元,较输入价格优惠 80%——并以 InclusionAI 自己的 API 作为服务提供商进行衡量。相比它所取代的模型,输入价格大约是后者的四倍,换来的是 21 点的指数提升。

这笔交易是否划算完全取决于工作负载,而指数本身就能为它定价:按这些费率,对 Ling-3.1-flash 运行全部十项 Intelligence Index 评估大约需要 960 美元,而 DeepSeek V4.1 Flash (Max) 约为 477 美元,GLM 5.3 Flash 为 280 美元。原因不只是费率表。Ling-3.1-flash 是一个话非常多的话痨型推理模型——它在跑完指数时消耗了 2.2 亿个输出 token,远高于其价格档位的中位数;其评估运行平均每个任务约 357 秒,而 DeepSeek V4.1 Flash (Max) 为 285 秒,GLM 5.3 Flash 为 979 秒。按单个任务计算,Ling-3.1-flash 的成本约为 0.99 美元,而 DeepSeek 为 0.27 美元,GLM 5.3 Flash 为 0.25 美元。

从41上,这些全都看不见,却一样不落地全都会落到账单上。一个模型可以赢下一个指数,却输掉一份预算。

与标题相矛盾的两个数字

首先是知识可靠性。Ling-3.1-flash 在 AA-Omniscience 上得分 +2.22,该基准衡量模型是否知道自己知道什么:正确答案得分,幻觉扣分,而拒答不得分也不扣分。其准确率为 29.1%,幻觉率为 37.9%。与同系列模型相比,这是该组中最弱的画像——GLM 5.3 Flash 得分 +7.47,幻觉率为 27.6%;DeepSeek V4.1 Flash (Max) 得分 −5.30,在已作答问题中的幻觉率高达惊人的 96.5%。综合评分奖励的是 Ling-3.1-flash 所展现的能力,而非其展现能力的可靠性;而一个会虚构其断言内容三分之一的模型,在生产环境中需要围绕它配备检索。

第二点是上下文。Artificial Analysis 将 Ling-3.1-flash 列为具有 1,000,000 token 上下文窗口。Ant 自己的发布材料也提到目标是 1M。但 Ant 的开发者文档逐一列出了该系列各模型的窗口,其中给 Ling-3.0-flash 的是原生 256K、可扩展至 1M,而且尚未为 Ling-3.1-flash 提供任何条目。那个确实被测量到的独特长上下文项目——AA-LCR 为 0.83——是长上下文推理得分,而不是实际服务窗口的测量值。将 1M 视为宣称的上限,并在围绕它进行设计之前,用你自己的长上下文请求验证实际交付的窗口。

它在规格表上的表现如何

逐维度的全貌,主语在前,每行:

• 总参数量 — Ling-3.1-flash 560B 对比 DeepSeek V4.1 Flash (Max) 552B 对比 GLM 5.3 Flash 320B。

• 每 token 激活参数量 —— Ling-3.1-flash 25B 对比 DeepSeek V4.1 Flash (Max) 16B 对比 GLM 5.3 Flash 18B。Ling-3.1-flash 激活的参数量最多,这也是其推理服务成本处于当前水平的原因之一。

• 权重与许可 — Ling-3.1-flash 未公开(专有,无许可文本),而 DeepSeek V4.1 Flash(Max)以 MIT 许可开源,GLM 5.3 Flash 以 MIT 许可开源。

• 宣称的上下文 —— Ling-3.1-flash 1M 对比 DeepSeek V4.1 Flash (Max) 1M 对比 GLM 5.3 Flash 1M。三者都声称同样的上限;但其中只有两个提供了可下载的检查点,让你能据此验证。

• 模态——Ling-3.1-flash 为文本输入、文本输出,而 DeepSeek V4.1 Flash (Max) 支持文本和图像输入,GLM 5.3 Flash 则支持文本、图像和视频输入。这是 Ling-3.1-flash 唯一明显落后的一项,任何基准测试成绩都无法弥补这一点。

• 供应商 API 上的价格 — Ling-3.1-flash 每百万输入 / 输出 $0.30 / $0.90,对比 DeepSeek V4.1 Flash (Max) $0.30 / $1.20,对比 GLM 5.3 Flash $0.15 / $0.50。

• 指数得分 —— 41 对 39 对 42。在三方对比中,三分之差并不能构成排名;这只是一场平局,而打破平局的是读者的工作负载碰巧更接近哪一项评估。

在哪里可以呼叫它

Ling-3.1-flash 目前不在 OrcaRouter 目录中——我们通过公共模型 API 查询 InclusionAI 旗下的该模型,返回的是未找到,我们不会暗示并非如此。它目前运行在蚂蚁自有 API 以及承载该版本的第三方平台上,这才是其可用范围的如实情况。对于比较上述三款模型的人来说,值得注意的是,另外两款现在就可路由:DeepSeek V4.1 Flash 和 GLM 5.3 Flash 都已按各自提供商的标价出现在 OrcaRouter 目录中,零加价,只需一个 API 密钥,并可在两者之间自动故障转移。如果上面的比较表明你的工作负载更看重知识可靠性,而不是智能体终端任务,那么 GLM 5.3 Flash 就是值得一试的那款——而且你可以在同一个密钥上让它与 DeepSeek V4.1 Flash 对比试用,无需第二份合同,也无需新增一行客户端代码。

41 改变了什么,又没有改变什么

它改变的是这次发布的地位。Ling-3.1-flash 不再是一份附带着厂商图表的规格说明;它是一个拥有独立实测定位的模型,而这个定位相比 Ling-3.0-flash 在智能体能力上是一次真正的代际跃升——这种跨越源自设计上的改变,而非在同一套配方上堆砌更多算力。它没有改变的,是采购层面的任何事。权重依然闭源,许可条款依然未成文,模态依然仅限文本,而价格约为前代的四倍,换来的增益却集中在智能体与终端任务上。

如果你的工作是智能体循环、工具驱动和长工具链,那么41是迄今为止围绕该模型发布的最有意义的数字,趁着可用性仍在扩展,它值得认真一看。如果你的工作是多模态、知识关键型问答,或预算敏感的高吞吐量推理,那么41触及不到你的问题——而GLM 5.3 Flash已经可路由、已经以MIT协议开源,输出价格还只有一半,是这三者中定位更合适的模型。该指数告诉你Ling-3.1-flash处于什么位置。它不会告诉你你是否该在意,而这个问题由你正在构建的东西来回答。

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新