
Ling-3.1-flash在Artificial Analysis智能指数中得分41:560B MoE性能达到前代两倍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Ling-3.1-flash,蚂蚁集团的5600亿参数混合专家模型,如今带有一个并非其自家实验室写下的数字:在Artificial Analysis Intelligence Index上拿到41分。该指数由独立评估机构运行,使用该评估机构掌控的硬件,针对固定测试套件进行——它使该模型比其直接前代Ling-3.0-flash高出21分,而后者在同一指数上仍为20分。蚂蚁于2026年9月底宣布Ling-3.1-flash,Artificial Analysis将发布时间定为10月1日,而它比那个被它分数翻倍的模型年轻三个月。
那个差距才是关键。在一个由十种不同评估构成的基准测试上出现 21 分的变动,不是厂商图表能伪造出来的东西,也不是这个博客两周前写得出来的东西——当时对 Ling-2.1-flash 唯一存在的测量,是 Ant 自己的基准测试卡:GDPval-AA v2.1 上 1,673 Elo,FrontierSWE 上 75.16,HealthBench Professional 上 65.35。那些数字是真实实验室提出的真实主张,但未被复现。41 则性质不同。它是本次发布中第一个第三方可以据以问责的数字。
41 实际上衡量的是什么
Artificial Analysis Intelligence Index v4.3.2 是十项评估的加权综合:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。孤立地看待综合指数是错误的,因此各项评估的细分行比总体数字更重要:
• GDPval-AA — Ling-3.1-flash 为 1,621.75,而 Ling-3.0-flash 为 948.35。这是该组中最大的单次跃升,也是指数变动所主要依赖的一项。
• GDP.pdf — 0.100 全部通过,高于 0.054。绝对值仍然偏低,但几乎翻了一番。
• AA-LCR v1.1 长上下文推理——0.83,而前代为 0.73,与 DeepSeek V4.1 Flash(Max)的 0.84 持平。
• SciCode — 0.541 对比 0.420。这是编码科学能力的提升,而非聊天质量的提升。
• CritPt 物理推理 — 0.180,相比之前的 0.017。在较小基数上达到前代的十倍。
• AA-Omniscience——+2.22,而 Ling-3.0-flash 为 −17.88。这一项将在下文中讨论,因为它与主要结论相悖。
Ling-3.0-flash 在这些行上并非只是输给了 Ling-3.1-flash;它在其中两行上彻底崩了。它在 AutomationBench-AA 上得分 0.032,在 Terminal-Bench 4.0 上则恰好为 0.000。41 这个数字正应放在这一背景下解读——其前代是一个高效、廉价、开放权重的模型,基本上完全不具备智能体终端能力。

收益来自哪里:智能体工作,而非对话
将 Ling-3.1-flash 的指数贡献与它最常被并列比较的两款 Flash 级模型进行对比,一个被总体数据所掩盖的模式便显现出来。DeepSeek V4.1 Flash(Max)在同一指数上得到 39 分,GLM 5.3 Flash 得到 42 分,因此三者都落在三个点的区间内。但它们抵达这一位置的路径各不相同。
• 智能体终端任务 —— Ling-3.1-flash 在 Terminal-Bench 4.0 上得分 0.333,DeepSeek V4.1 Flash(Max)0.268,GLM 5.3 Flash 0.328。
• 智能体真实世界工作 — Ling-3.1-flash 在 GDPval-AA 上获得 1,621.75 Elo,DeepSeek V4.1 Flash(Max)1,600,GLM 5.3 Flash 1,646.86。
• AutomationBench-AA — Ling-3.1-flash 0.617,DeepSeek V4.1 Flash (Max) 0.689,GLM 5.3 Flash 0.604。
• 编程科学 — Ling-3.1-flash 在 SciCode 上得分 0.541,DeepSeek V4.1 Flash (Max) 0.519,GLM 5.3 Flash 0.516。
狭义解读是,Ling-3.1-flash 在智能体基准测试上具备竞争力,在 SciCode 上略有领先。更有用的解读是:在大多数人说到“它能否驱动工具循环”时所指的两项智能体终端指标上,它是三者中最强的——而在知识可靠性指标上,它落后于另外两者。这是一种具体的形状,而非全面胜出,值得在有人仅凭那个指数数字就为一个工作负载买单之前把它点明。
伴随更大模型而来的账单
Ling-3.0-flash 在蚂蚁自己的 API 上定价为每百万输入 token 0.07 美元、每百万输出 token 0.22 美元,并且是以 MIT 许可证开放权重。Ling-3.1-flash 目前这两者都还不具备。Artificial Analysis 记录其运行成本为每百万输入 0.30 美元、每百万输出 0.90 美元——缓存命中价格为 0.06 美元,较输入价格优惠 80%——并以 InclusionAI 自己的 API 作为服务提供商进行衡量。相比它所取代的模型,输入价格大约是后者的四倍,换来的是 21 点的指数提升。
这笔交易是否划算完全取决于工作负载,而指数本身就能为它定价:按这些费率,对 Ling-3.1-flash 运行全部十项 Intelligence Index 评估大约需要 960 美元,而 DeepSeek V4.1 Flash (Max) 约为 477 美元,GLM 5.3 Flash 为 280 美元。原因不只是费率表。Ling-3.1-flash 是一个话非常多的话痨型推理模型——它在跑完指数时消耗了 2.2 亿个输出 token,远高于其价格档位的中位数;其评估运行平均每个任务约 357 秒,而 DeepSeek V4.1 Flash (Max) 为 285 秒,GLM 5.3 Flash 为 979 秒。按单个任务计算,Ling-3.1-flash 的成本约为 0.99 美元,而 DeepSeek 为 0.27 美元,GLM 5.3 Flash 为 0.25 美元。
从41上,这些全都看不见,却一样不落地全都会落到账单上。一个模型可以赢下一个指数,却输掉一份预算。
与标题相矛盾的两个数字
首先是知识可靠性。Ling-3.1-flash 在 AA-Omniscience 上得分 +2.22,该基准衡量模型是否知道自己知道什么:正确答案得分,幻觉扣分,而拒答不得分也不扣分。其准确率为 29.1%,幻觉率为 37.9%。与同系列模型相比,这是该组中最弱的画像——GLM 5.3 Flash 得分 +7.47,幻觉率为 27.6%;DeepSeek V4.1 Flash (Max) 得分 −5.30,在已作答问题中的幻觉率高达惊人的 96.5%。综合评分奖励的是 Ling-3.1-flash 所展现的能力,而非其展现能力的可靠性;而一个会虚构其断言内容三分之一的模型,在生产环境中需要围绕它配备检索。
第二点是上下文。Artificial Analysis 将 Ling-3.1-flash 列为具有 1,000,000 token 上下文窗口。Ant 自己的发布材料也提到目标是 1M。但 Ant 的开发者文档逐一列出了该系列各模型的窗口,其中给 Ling-3.0-flash 的是原生 256K、可扩展至 1M,而且尚未为 Ling-3.1-flash 提供任何条目。那个确实被测量到的独特长上下文项目——AA-LCR 为 0.83——是长上下文推理得分,而不是实际服务窗口的测量值。将 1M 视为宣称的上限,并在围绕它进行设计之前,用你自己的长上下文请求验证实际交付的窗口。
它在规格表上的表现如何
逐维度的全貌,主语在前,每行:
• 总参数量 — Ling-3.1-flash 560B 对比 DeepSeek V4.1 Flash (Max) 552B 对比 GLM 5.3 Flash 320B。
• 每 token 激活参数量 —— Ling-3.1-flash 25B 对比 DeepSeek V4.1 Flash (Max) 16B 对比 GLM 5.3 Flash 18B。Ling-3.1-flash 激活的参数量最多,这也是其推理服务成本处于当前水平的原因之一。
• 权重与许可 — Ling-3.1-flash 未公开(专有,无许可文本),而 DeepSeek V4.1 Flash(Max)以 MIT 许可开源,GLM 5.3 Flash 以 MIT 许可开源。
• 宣称的上下文 —— Ling-3.1-flash 1M 对比 DeepSeek V4.1 Flash (Max) 1M 对比 GLM 5.3 Flash 1M。三者都声称同样的上限;但其中只有两个提供了可下载的检查点,让你能据此验证。
• 模态——Ling-3.1-flash 为文本输入、文本输出,而 DeepSeek V4.1 Flash (Max) 支持文本和图像输入,GLM 5.3 Flash 则支持文本、图像和视频输入。这是 Ling-3.1-flash 唯一明显落后的一项,任何基准测试成绩都无法弥补这一点。
• 供应商 API 上的价格 — Ling-3.1-flash 每百万输入 / 输出 $0.30 / $0.90,对比 DeepSeek V4.1 Flash (Max) $0.30 / $1.20,对比 GLM 5.3 Flash $0.15 / $0.50。
• 指数得分 —— 41 对 39 对 42。在三方对比中,三分之差并不能构成排名;这只是一场平局,而打破平局的是读者的工作负载碰巧更接近哪一项评估。
在哪里可以呼叫它
Ling-3.1-flash 目前不在 OrcaRouter 目录中——我们通过公共模型 API 查询 InclusionAI 旗下的该模型,返回的是未找到,我们不会暗示并非如此。它目前运行在蚂蚁自有 API 以及承载该版本的第三方平台上,这才是其可用范围的如实情况。对于比较上述三款模型的人来说,值得注意的是,另外两款现在就可路由:DeepSeek V4.1 Flash 和 GLM 5.3 Flash 都已按各自提供商的标价出现在 OrcaRouter 目录中,零加价,只需一个 API 密钥,并可在两者之间自动故障转移。如果上面的比较表明你的工作负载更看重知识可靠性,而不是智能体终端任务,那么 GLM 5.3 Flash 就是值得一试的那款——而且你可以在同一个密钥上让它与 DeepSeek V4.1 Flash 对比试用,无需第二份合同,也无需新增一行客户端代码。
41 改变了什么,又没有改变什么
它改变的是这次发布的地位。Ling-3.1-flash 不再是一份附带着厂商图表的规格说明;它是一个拥有独立实测定位的模型,而这个定位相比 Ling-3.0-flash 在智能体能力上是一次真正的代际跃升——这种跨越源自设计上的改变,而非在同一套配方上堆砌更多算力。它没有改变的,是采购层面的任何事。权重依然闭源,许可条款依然未成文,模态依然仅限文本,而价格约为前代的四倍,换来的增益却集中在智能体与终端任务上。
如果你的工作是智能体循环、工具驱动和长工具链,那么41是迄今为止围绕该模型发布的最有意义的数字,趁着可用性仍在扩展,它值得认真一看。如果你的工作是多模态、知识关键型问答,或预算敏感的高吞吐量推理,那么41触及不到你的问题——而GLM 5.3 Flash已经可路由、已经以MIT协议开源,输出价格还只有一半,是这三者中定位更合适的模型。该指数告诉你Ling-3.1-flash处于什么位置。它不会告诉你你是否该在意,而这个问题由你正在构建的东西来回答。


本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
