
Ling-3.1-flash 在 Artificial Analysis Intelligence Index 上達到 41 分:560B MoE 是其前代的兩倍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Ling-3.1-flash 是螞蟻集團的 5600 億參數混合專家模型,如今帶著一個不是自家實驗室寫下的數字:在 Artificial Analysis Intelligence Index 上拿下 41 分。該指數由獨立評測機構運行,使用該評測機構掌控的硬體,並以固定測試套件進行評估——它讓這個模型比自身的直接前代 Ling-3.0-flash 高出 21 分,而後者在同一指數上仍為 20 分。螞蟻集團於 2026 年 9 月底宣布推出 Ling-3.1-flash,Artificial Analysis 則將發布日期定為 10 月 1 日,而它比它所倍翻的模型年輕三個月。
那個落差才是重點。在一個由十種不同評估共同構成的綜合指標上出現 21 分的變動,不是廠商圖表能捏造的那種東西,也不是本部落格兩週前寫得出來的那種東西;當時對 Ling-3.1-flash 唯一存在的量測,是 Ant 自家的基準測試卡:GDPval-AA v2.1 上 1,673 Elo、FrontierSWE 上 75.16、HealthBench Professional 上 65.35。那些數字是一家真實實驗室提出的真實宣稱,但未經重現。41 則性質不同。它是本次發布中第一個能由第三方據以查核的數字。
41 究竟實際衡量的是什麼
Artificial Analysis Intelligence Index v4.3.2 是一項由十項評估構成的加權綜合指標:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。單獨解讀一項綜合指標是錯誤的,因此各項評估的逐列資料比總體標題數字更重要:
• GDPval-AA — Ling-3.1-flash 為 1,621.75,Ling-3.0-flash 則為 948.35。這是整組中最大的單一躍升,也是指數變動主要所倚賴的一項。
• GDP.pdf — 0.100 全部通過,較 0.054 上升。以絕對值而言仍然偏低,但已接近翻倍。
• AA-LCR v1.1 長上下文推理 —— 相較於前代的 0.73,達到 0.83,並與DeepSeek V4.1 Flash(Max)的 0.84 不相上下。
• SciCode — 0.541 對比 0.420。這是程式科學上的增益,而非聊天品質上的增益。
• CritPt 物理推理 — 0.180,而先前為 0.017。在小基數上達到前身的十倍。
• AA-Omniscience — +2.22,相較於 Ling-3.0-flash 的 −17.88。這一點將於下方討論,因為它與主要結論相悖。
Ling-3.0-flash 在這些列上不僅僅是輸給 Ling-3.1-flash;它在其中兩列徹底崩潰。它在 AutomationBench-AA 上得分 0.032,在 Terminal-Bench 4.0 上則恰好是 0.000。這正是解讀那個 41 時所處的背景——前代是一款高效、便宜、開放權重的模型,基本上完全不具備代理式終端機能力。

收益從何而來:代理式工作,而非對話
將 Ling-3.1-flash 的指數貢獻,與它最常被並列比較的兩個 Flash 層級模型相比,就會浮現出一種被彙總數據掩蓋的模式。DeepSeek V4.1 Flash (Max) 在同一指數上拿下 39 分,GLM 5.3 Flash 拿下 42 分,因此三者都落在三分區間之內。但三者是從不同位置抵達那裡的。
• 代理式終端機工作 — Ling-3.1-flash 在 Terminal-Bench 4.0 上為 0.333,DeepSeek V4.1 Flash (Max) 為 0.268,GLM 5.3 Flash 為 0.328。
• 代理式真實世界工作 — Ling-3.1-flash 在 GDPval-AA 上取得 1,621.75 Elo,DeepSeek V4.1 Flash(Max)1,600,GLM 5.3 Flash 1,646.86。
• AutomationBench-AA — Ling-3.1-flash 0.617,DeepSeek V4.1 Flash (Max) 0.689,GLM 5.3 Flash 0.604。
• 程式設計科學 — Ling-3.1-flash 在 SciCode 上得分 0.541,DeepSeek V4.1 Flash (Max) 0.519,GLM 5.3 Flash 0.516。
狹義的解讀是,Ling-3.1-flash 在代理式基準測試上具有競爭力,並且在 SciCode 上略微領先。有用的解讀是,在大多數人所說的「它能否驅動工具迴圈」時所指的兩項代理式終端指標上,它是三者中最強的——而在知識可靠性指標上,它則落後於另外兩者。這是一種特定的形態,而非全面的勝利,而且在任何人僅憑指數數字就購買工作負載之前,值得把這一點說清楚。
隨著更大模型而來的帳單
Ling-3.0-flash 在 Ant 自家 API 上的定價為每百萬輸入 token 0.07 美元、每百萬輸出 token 0.22 美元,而且是以 MIT 授權的開放權重。Ling-3.1-flash 目前則兩者皆非。Artificial Analysis 將其運行成本記錄為每百萬輸入 0.30 美元、每百萬輸出 0.90 美元——快取命中費率為 0.06 美元,相當於輸入價格的 80% 折扣——並以 InclusionAI 自家 API 作為服務供應商來衡量。相較於它所取代的模型,輸入價格大約是四倍,換來的是指數 21 點的提升。
這項取捨是否划算,完全取決於工作負載,而這個索引本身就能為它定價:以那些費率計算,對 Ling-3.1-flash 執行全部十項 Intelligence Index 評估,約需花費 $960;相較之下,DeepSeek V4.1 Flash (Max) 約為 $477,GLM 5.3 Flash 約為 $280。原因不僅在於價目表。Ling-3.1-flash 是非常多話的推理模型——它在跑完整個索引時燒掉了 2.2 億個輸出 token,遠高於其價格級距的中位數;而且它的評估執行每項任務平均約需 357 秒,相較之下 DeepSeek V4.1 Flash (Max) 為 285 秒,GLM 5.3 Flash 為 979 秒。以每項任務計算,Ling-3.1-flash 約花費 $0.99,而 DeepSeek 為 $0.27,GLM 5.3 Flash 為 $0.25。
這些從 41 都看不見,但全都會算在發票上。一個模型可以在指數上勝出,卻在預算上落敗。
與標題唱反調的兩個數字
第一項是知識可靠性。Ling-3.1-flash 在 AA-Omniscience 上得分 +2.22,該評測衡量的是模型是否知道自己知道什麼:答對得分,幻覺扣分,拒答則不計分。其準確率為 29.1%,幻覺率為 37.9%。與同系列夥伴並列來看,這是該組中最弱的表現——GLM 5.3 Flash 得分 +7.47,幻覺率 27.6%;而 DeepSeek V4.1 Flash (Max) 得分 −5.30,在已作答問題中的幻覺率更高達驚人的 96.5%。這項綜合評分獎勵的是 Ling-3.1-flash 所展現的能力,而非它展現該能力的可靠程度;一個所斷言內容有三分之一是憑空捏造的模型,在正式環境中需要搭配檢索機制。
第二個是上下文。Artificial Analysis 將 Ling-3.1-flash 列為具有 1,000,000 個詞元的上下文視窗。Ant 自家的發布資料也將 1M 列為目標。但 Ant 的開發者文件逐一列出該系列各模型的視窗,其中 Ling-3.0-flash 的原生視窗為 256K、可延伸至 1M,且尚未收錄 Ling-3.1-flash 的任何條目。確實有被測到的那個獨特長上下文項目——AA-LCR 為 0.83——是長上下文推理分數,而非實際服務視窗的測量值。請將 1M 視為宣稱的上限,並在以此為設計依據之前,用你自己的長上下文請求驗證實際提供的視窗。
它在規格表上的表現如何
逐維度的概況,主體在前,每行:
• 總參數量 — Ling-3.1-flash 560B 對比 DeepSeek V4.1 Flash (Max) 552B 對比 GLM 5.3 Flash 320B。
• 每個 token 的啟用參數 — Ling-3.1-flash 25B 對比 DeepSeek V4.1 Flash (Max) 16B 對比 GLM 5.3 Flash 18B。Ling-3.1-flash 啟用得最多,這也是其服務成本會落在目前這個水準的原因之一。
• 權重與授權條款 —— Ling-3.1-flash 未公開發布(專有,無授權條款文字),對比 DeepSeek V4.1 Flash(Max)以 MIT 授權開放,對比 GLM 5.3 Flash 以 MIT 授權開放。
• 標稱上下文長度 — Ling-3.1-flash 1M 對比 DeepSeek V4.1 Flash (Max) 1M 對比 GLM 5.3 Flash 1M。三者都宣稱同樣的上限;但其中只有兩家提供可下載的檢查點,讓你能實際驗證。
• 模態 — Ling-3.1-flash 為文字輸入、文字輸出,而 DeepSeek V4.1 Flash (Max) 為文字與圖像輸入,GLM 5.3 Flash 則為文字、圖像與影片輸入。這是 Ling-3.1-flash 唯一明顯落後的面向,且沒有任何基準測試項目能彌補這一點。
• 供應商 API 定價 — Ling-3.1-flash 每百萬輸入/輸出為 $0.30/$0.90,對比 DeepSeek V4.1 Flash (Max) 的 $0.30/$1.20,以及 GLM 5.3 Flash 的 $0.15/$0.50。
• 索引分數 — 41 對 39 對 42。在三方比較中,三分的差距並不構成排名;這是一場平手,其勝負取決於讀者的工作負載恰好與哪一項評估更為相似。
你可以稱呼它的地方
Ling-3.1-flash 目前並不在 OrcaRouter 的型錄上——向我們公開的模型 API 查詢 InclusionAI 旗下的這款模型會回傳找不到,而我們不會暗示其他情況。它目前運行於螞蟻自家的 API,以及搭載該發布版本的第三方平台上,這才是其可用範圍的誠實描述。對於任何比較上述三款模型的人來說,值得注意的是,另外兩款現在都可路由:DeepSeek V4.1 Flash 與 GLM 5.3 Flash 都以各自供應商的定價並列於 OrcaRouter 的型錄上,零加成,共用單一 API 金鑰,並在兩者之間自動容錯轉移。如果上述比較顯示你的工作負載更看重知識可靠性,而非代理式終端機作業,那麼 GLM 5.3 Flash 就是值得一試的那一款——而且你可以在同一把金鑰上拿它與 DeepSeek V4.1 Flash 對照測試,無須第二份合約,也不必寫一行新的用戶端程式碼。
第41號改變了什麼,又沒有改變什麼
它改變的是這次發布的定位。Ling-3.1-flash 不再只是一份附著廠商圖表的規格書;它是一個擁有獨立實測定位的模型,而這個定位相較於 Ling-3.0-flash,在代理能力上是貨真價實的跨世代躍進——那種源自設計變革、而非在同一套配方上堆疊更多算力的躍進。它沒有改變的,則是採購層面的任何事。權重依然封閉,授權條款依然未成文,模態依然僅限文字,而價格約為前代的四倍,換來的增益卻集中在代理與終端任務上。
如果你的工作是代理迴圈、工具驅動與長工具鏈,那麼 41 是迄今針對這個模型所公布、最有意義的數字,值得趁著可用性仍在擴展之際認真審視。如果你的工作是多模態、或是對知識準確性至關重要的問答,或是對預算敏感的高流量推論,那麼 41 觸及不到你的問題——而 GLM 5.3 Flash 已經可以路由、也已在 MIT 授權下開放,輸出價格只要一半,是三者之中定位更有利的模型。這份指數告訴你 Ling-3.1-flash 位居何處。它不會告訴你該不該在意,而這個問題的答案取決於你正在打造什麼。


本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
