用於「Ling-3.1-flash 在 AA Intelligence Index 上達到 41 分」的主視覺標題卡,副標為「來自螞蟻集團的 560B 總參數 / 25B 活化參數 MoE」。一張大型圓角卡片載有數字「41」,標籤為「Artificial Analysis Intelligence Index v4.3.2」;其下方第二張小卡片寫著「vs 20」,標籤為「Ling-3.0-flash」。頁腳一行寫著「指數數據由 Artificial Analysis 獨立測量;模型發布於 2026-10-01。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Ling-3.1-flash 在 Artificial Analysis Intelligence Index 上達到 41 分:560B MoE 是其前代的兩倍

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash 是螞蟻集團的 5600 億參數混合專家模型,如今帶著一個不是自家實驗室寫下的數字:在 Artificial Analysis Intelligence Index 上拿下 41 分。該指數由獨立評測機構運行,使用該評測機構掌控的硬體,並以固定測試套件進行評估——它讓這個模型比自身的直接前代 Ling-3.0-flash 高出 21 分,而後者在同一指數上仍為 20 分。螞蟻集團於 2026 年 9 月底宣布推出 Ling-3.1-flash,Artificial Analysis 則將發布日期定為 10 月 1 日,而它比它所倍翻的模型年輕三個月。

那個落差才是重點。在一個由十種不同評估共同構成的綜合指標上出現 21 分的變動,不是廠商圖表能捏造的那種東西,也不是本部落格兩週前寫得出來的那種東西;當時對 Ling-3.1-flash 唯一存在的量測,是 Ant 自家的基準測試卡:GDPval-AA v2.1 上 1,673 Elo、FrontierSWE 上 75.16、HealthBench Professional 上 65.35。那些數字是一家真實實驗室提出的真實宣稱,但未經重現。41 則性質不同。它是本次發布中第一個能由第三方據以查核的數字。

41 究竟實際衡量的是什麼

Artificial Analysis Intelligence Index v4.3.2 是一項由十項評估構成的加權綜合指標:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。單獨解讀一項綜合指標是錯誤的,因此各項評估的逐列資料比總體標題數字更重要:

• GDPval-AA — Ling-3.1-flash 為 1,621.75,Ling-3.0-flash 則為 948.35。這是整組中最大的單一躍升,也是指數變動主要所倚賴的一項。

• GDP.pdf — 0.100 全部通過,較 0.054 上升。以絕對值而言仍然偏低,但已接近翻倍。

• AA-LCR v1.1 長上下文推理 —— 相較於前代的 0.73,達到 0.83,並與DeepSeek V4.1 Flash(Max)的 0.84 不相上下。

• SciCode — 0.541 對比 0.420。這是程式科學上的增益,而非聊天品質上的增益。

• CritPt 物理推理 — 0.180,而先前為 0.017。在小基數上達到前身的十倍。

• AA-Omniscience — +2.22,相較於 Ling-3.0-flash 的 −17.88。這一點將於下方討論,因為它與主要結論相悖。

Ling-3.0-flash 在這些列上不僅僅是輸給 Ling-3.1-flash;它在其中兩列徹底崩潰。它在 AutomationBench-AA 上得分 0.032,在 Terminal-Bench 4.0 上則恰好是 0.000。這正是解讀那個 41 時所處的背景——前代是一款高效、便宜、開放權重的模型,基本上完全不具備代理式終端機能力。

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

收益從何而來:代理式工作,而非對話

將 Ling-3.1-flash 的指數貢獻,與它最常被並列比較的兩個 Flash 層級模型相比,就會浮現出一種被彙總數據掩蓋的模式。DeepSeek V4.1 Flash (Max) 在同一指數上拿下 39 分,GLM 5.3 Flash 拿下 42 分,因此三者都落在三分區間之內。但三者是從不同位置抵達那裡的。

• 代理式終端機工作 — Ling-3.1-flash 在 Terminal-Bench 4.0 上為 0.333,DeepSeek V4.1 Flash (Max) 為 0.268,GLM 5.3 Flash 為 0.328。

• 代理式真實世界工作 — Ling-3.1-flash 在 GDPval-AA 上取得 1,621.75 Elo,DeepSeek V4.1 Flash(Max)1,600,GLM 5.3 Flash 1,646.86。

• AutomationBench-AA — Ling-3.1-flash 0.617,DeepSeek V4.1 Flash (Max) 0.689,GLM 5.3 Flash 0.604。

• 程式設計科學 — Ling-3.1-flash 在 SciCode 上得分 0.541,DeepSeek V4.1 Flash (Max) 0.519,GLM 5.3 Flash 0.516。

狹義的解讀是,Ling-3.1-flash 在代理式基準測試上具有競爭力,並且在 SciCode 上略微領先。有用的解讀是,在大多數人所說的「它能否驅動工具迴圈」時所指的兩項代理式終端指標上,它是三者中最強的——而在知識可靠性指標上,它則落後於另外兩者。這是一種特定的形態,而非全面的勝利,而且在任何人僅憑指數數字就購買工作負載之前,值得把這一點說清楚。

隨著更大模型而來的帳單

Ling-3.0-flash 在 Ant 自家 API 上的定價為每百萬輸入 token 0.07 美元、每百萬輸出 token 0.22 美元,而且是以 MIT 授權的開放權重。Ling-3.1-flash 目前則兩者皆非。Artificial Analysis 將其運行成本記錄為每百萬輸入 0.30 美元、每百萬輸出 0.90 美元——快取命中費率為 0.06 美元,相當於輸入價格的 80% 折扣——並以 InclusionAI 自家 API 作為服務供應商來衡量。相較於它所取代的模型,輸入價格大約是四倍,換來的是指數 21 點的提升。

這項取捨是否划算,完全取決於工作負載,而這個索引本身就能為它定價:以那些費率計算,對 Ling-3.1-flash 執行全部十項 Intelligence Index 評估,約需花費 $960;相較之下,DeepSeek V4.1 Flash (Max) 約為 $477,GLM 5.3 Flash 約為 $280。原因不僅在於價目表。Ling-3.1-flash 是非常多話的推理模型——它在跑完整個索引時燒掉了 2.2 億個輸出 token,遠高於其價格級距的中位數;而且它的評估執行每項任務平均約需 357 秒,相較之下 DeepSeek V4.1 Flash (Max) 為 285 秒,GLM 5.3 Flash 為 979 秒。以每項任務計算,Ling-3.1-flash 約花費 $0.99,而 DeepSeek 為 $0.27,GLM 5.3 Flash 為 $0.25。

這些從 41 都看不見,但全都會算在發票上。一個模型可以在指數上勝出,卻在預算上落敗。

與標題唱反調的兩個數字

第一項是知識可靠性。Ling-3.1-flash 在 AA-Omniscience 上得分 +2.22,該評測衡量的是模型是否知道自己知道什麼:答對得分,幻覺扣分,拒答則不計分。其準確率為 29.1%,幻覺率為 37.9%。與同系列夥伴並列來看,這是該組中最弱的表現——GLM 5.3 Flash 得分 +7.47,幻覺率 27.6%;而 DeepSeek V4.1 Flash (Max) 得分 −5.30,在已作答問題中的幻覺率更高達驚人的 96.5%。這項綜合評分獎勵的是 Ling-3.1-flash 所展現的能力,而非它展現該能力的可靠程度;一個所斷言內容有三分之一是憑空捏造的模型,在正式環境中需要搭配檢索機制。

第二個是上下文。Artificial Analysis 將 Ling-3.1-flash 列為具有 1,000,000 個詞元的上下文視窗。Ant 自家的發布資料也將 1M 列為目標。但 Ant 的開發者文件逐一列出該系列各模型的視窗,其中 Ling-3.0-flash 的原生視窗為 256K、可延伸至 1M,且尚未收錄 Ling-3.1-flash 的任何條目。確實有被測到的那個獨特長上下文項目——AA-LCR 為 0.83——是長上下文推理分數,而非實際服務視窗的測量值。請將 1M 視為宣稱的上限,並在以此為設計依據之前,用你自己的長上下文請求驗證實際提供的視窗。

它在規格表上的表現如何

逐維度的概況,主體在前,每行:

• 總參數量 — Ling-3.1-flash 560B 對比 DeepSeek V4.1 Flash (Max) 552B 對比 GLM 5.3 Flash 320B。

• 每個 token 的啟用參數 — Ling-3.1-flash 25B 對比 DeepSeek V4.1 Flash (Max) 16B 對比 GLM 5.3 Flash 18B。Ling-3.1-flash 啟用得最多,這也是其服務成本會落在目前這個水準的原因之一。

• 權重與授權條款 —— Ling-3.1-flash 未公開發布(專有,無授權條款文字),對比 DeepSeek V4.1 Flash(Max)以 MIT 授權開放,對比 GLM 5.3 Flash 以 MIT 授權開放。

• 標稱上下文長度 — Ling-3.1-flash 1M 對比 DeepSeek V4.1 Flash (Max) 1M 對比 GLM 5.3 Flash 1M。三者都宣稱同樣的上限;但其中只有兩家提供可下載的檢查點,讓你能實際驗證。

• 模態 — Ling-3.1-flash 為文字輸入、文字輸出,而 DeepSeek V4.1 Flash (Max) 為文字與圖像輸入,GLM 5.3 Flash 則為文字、圖像與影片輸入。這是 Ling-3.1-flash 唯一明顯落後的面向,且沒有任何基準測試項目能彌補這一點。

• 供應商 API 定價 — Ling-3.1-flash 每百萬輸入/輸出為 $0.30/$0.90,對比 DeepSeek V4.1 Flash (Max) 的 $0.30/$1.20,以及 GLM 5.3 Flash 的 $0.15/$0.50。

• 索引分數 — 41 對 39 對 42。在三方比較中,三分的差距並不構成排名;這是一場平手,其勝負取決於讀者的工作負載恰好與哪一項評估更為相似。

你可以稱呼它的地方

Ling-3.1-flash 目前並不在 OrcaRouter 的型錄上——向我們公開的模型 API 查詢 InclusionAI 旗下的這款模型會回傳找不到,而我們不會暗示其他情況。它目前運行於螞蟻自家的 API,以及搭載該發布版本的第三方平台上,這才是其可用範圍的誠實描述。對於任何比較上述三款模型的人來說,值得注意的是,另外兩款現在都可路由:DeepSeek V4.1 Flash 與 GLM 5.3 Flash 都以各自供應商的定價並列於 OrcaRouter 的型錄上,零加成,共用單一 API 金鑰,並在兩者之間自動容錯轉移。如果上述比較顯示你的工作負載更看重知識可靠性,而非代理式終端機作業,那麼 GLM 5.3 Flash 就是值得一試的那一款——而且你可以在同一把金鑰上拿它與 DeepSeek V4.1 Flash 對照測試,無須第二份合約,也不必寫一行新的用戶端程式碼。

第41號改變了什麼,又沒有改變什麼

它改變的是這次發布的定位。Ling-3.1-flash 不再只是一份附著廠商圖表的規格書;它是一個擁有獨立實測定位的模型,而這個定位相較於 Ling-3.0-flash,在代理能力上是貨真價實的跨世代躍進——那種源自設計變革、而非在同一套配方上堆疊更多算力的躍進。它沒有改變的,則是採購層面的任何事。權重依然封閉,授權條款依然未成文,模態依然僅限文字,而價格約為前代的四倍,換來的增益卻集中在代理與終端任務上。

如果你的工作是代理迴圈、工具驅動與長工具鏈,那麼 41 是迄今針對這個模型所公布、最有意義的數字,值得趁著可用性仍在擴展之際認真審視。如果你的工作是多模態、或是對知識準確性至關重要的問答,或是對預算敏感的高流量推論,那麼 41 觸及不到你的問題——而 GLM 5.3 Flash 已經可以路由、也已在 MIT 授權下開放,輸出價格只要一半,是三者之中定位更有利的模型。這份指數告訴你 Ling-3.1-flash 位居何處。它不會告訴你該不該在意,而這個問題的答案取決於你正在打造什麼。

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新