已生成的編輯精選主視覺卡片,標題為「Ling-3.1-flash vs Ling-3.0-flash」,副標題為「一款今天就能下載。另一款只是新聞稿裡的一句話。」兩個比較欄:「Ling-3.1-flash(已公布)」列出「總計約 560B/活躍約 25B」、「最高 1M token 上下文」以及「沒有權重,沒有授權條款」;「Ling-3.0-flash(已推出)」列出「總計 124B/活躍 5.1B」、「服務上下文 262,144 token」以及「Hugging Face 上的 MIT 授權權重」。
Guides & Insights

Ling-3.1-flash 對比 Ling-3.0-flash:100 萬 Token 上下文視窗與 4.5 倍參數究竟帶來了什麼實質改變

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

螞蟻集團的 Ling 系列迎來了新的快速層級,而這回它只誕生於一句話。Ling-3.1-flash 於 2026 年 9 月 30 日發布——總參數約 5,600 億,每個 token 約啟用 250 億,脈絡視窗號稱最高達 100 萬個 token,並附上一句老套的說詞:「我們計劃在近期開源此模型。」它在快速產品線中取代的頂尖模型 Ling-3.0-flash,在各個層面都是截然不同的物種:總參數 1,240 億,每個 token 啟用 51 億,服務脈絡為 262,144 個 token,自 8 月 7 日起在 Hugging Face 上以 MIT 授權釋出權重,且在 Artificial Analysis 智慧指數中獨立取得 20 分。這兩款模型中,有一款你今天就能下載,另一款你只能讀到相關報導。拿它們來比較確實很有意義,但前提是比較得從這裡開始。

標題上的算術很簡單,也略帶誤導。Ling-3.1-flash 的總參數量約為 Ling-3.0-flash 的 4.5 倍,活躍參數量約為 4.9 倍——換算下來,每個詞元分別是 25B 對上 5.1B。隨意解讀會說:「模型大得多,所以聰明得多。」更審慎的解讀則是:Ant 在擴充模型本體的同時,大致維持了稀疏比例,而這換來的是容量,未必是每個詞元的推理深度:一個模型若在每個詞元中只從其 560B 裡路由 25B,確實在每個詞元上做的工作比只路由 5.1B 的模型更多,但它同時也為此付出約五倍的每詞元運算量。這個取捨最終落在哪裡,完全取決於 Ant 的架構能否有效處理多出來的參數——而這正是該公告沒有回答的問題。

兩個模型並列展示

把已公布的事實並列在一起,各世代就能清楚地分開。以下每一行陳述的,是 Ant 或獨立評估者實際已公布的內容;某個數字若有缺漏,那是因為沒有人公布過它。

• 總參數量 — Ling-3.1-flash:約 560B(廠商)。Ling-3.0-flash:124B(模型卡)。

• 每個 token 的活躍參數 — Ling-3.1-flash:約 25B(廠商)。Ling-3.0-flash:5.1B(模型卡)。

• 上下文視窗 — Ling-3.1-flash:最高 1M tokens(廠商)。Ling-3.0-flash:原生 256K,以 262,144 提供(模型卡與推論配方)。

• 權重與授權 — Ling-3.1-flash:尚未發布;沒有儲存庫,也沒有授權條款(曾於 2026 年 9 月 30 日及 10 月 1 日再次檢查)。Ling-3.0-flash:MIT,自 2026 年 8 月 7 日起在 Hugging Face 上以 inclusionAI/Ling-3.0-flash 的名稱發布,並在 ModelScope 上架。

• 權重格式 — Ling-3.1-flash:無可用。Ling-3.0-flash:來自實驗室的 BF16(約 255GB)與 FP8(約 128GB),以及社群量化版本。

• 基準測試來源 — Ling-3.1-flash:完全由廠商自行報告,沒有公開測試框架,也沒有權重可供重新執行。Ling-3.0-flash:由 Artificial Analysis 獨立評分,智力指數為 20,並同時公布實測輸出速度與 token 生成量。

• 可用性 — Ling-3.1-flash:僅限 Ant 自家的 Ling Studio 產品。Ling-3.0-flash:可自行託管,並可透過 Ant 的開發者 API 呼叫。

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

這些額外產能大概是做什麼用的

Ant 自己對 Ling-3.1-flash 的一句描述,是這次發布中最有資訊量的內容。Ling Studio 應用程式將它定位為「通用型代理、搜尋、例行辦公工作,以及軟體/程式碼開發」——這是辦公工作與代理式的框架,而非推理基準測試的框架。這與該系列的組織方式相符:Ling 是通用型文字與工具產品線,Ring 是推理產品線,Ming 則負責多模態。Ling-3.0-flash 早一個世代占據了相同的位置,而且它明確屬於快速、廉價的層級,而非旗艦。

從這個角度來看這次的規模擴展,就說得通了。代理式與工具呼叫的工作負載很長、重複性高,而且極度需要上下文:單一代理迴圈在採取行動之前,就可能耗掉數萬個 token 的累積工具輸出,因此 100 萬 token 的上下文窗口是功能上的必要條件,而不是規格表上的花俏點綴。在保持高比例活躍參數的同時擴展總參數量,正是為一個仍必須快到能待在迴圈裡的模型,增添世界知識與指令遵循深度的方式。Ant 在這裡打造的不是更慢、更聰明的旗艦;而是更大的快速層級。

反駁論點是成本,而這是同一套算術從相反方向推導出來的結果。額外容量在推論時並非免費——每一個 token 都要為此付費,而 Ant 完全沒有公布 Ling-3.1-flash 的價格:沒有 API 費率表,沒有快取折扣,也沒有任何可與前一代所列每百萬 token 0.075 美元/0.22 美元相比的資訊。那正是能決定這項比較的缺失數字,而它確實付之闕如。

基準測試,以及是誰執行的

Ling-3.1-flash 帶著三項單看很亮眼的成績登場:在 GDPVal-AA v2.1 上取得 1,673 Elo、在 FrontierSWE 上取得 75.16,以及在 HealthBench Professional 上取得 65.35。這三項全都是 Ant 自家提供的數據,取自發布公告,且沒有任何一項由外部實驗室重現。實際後果是,它們可以拿來與其他廠商的數字相比,卻不能與獨立數字相比——而 Artificial Analysis 給 Ling-3.0-flash 的 20 分 Intelligence Index 是不同量尺上的獨立數字,所以把兩者並列,等於是把一項測量值拿來跟一項宣稱相比。撰寫本文時,Artificial Analysis 上沒有 Ling-3.1-flash 的頁面。

Ant 自家圖表上的一則註腳,本身就值得特別指出。該卡指出,HealthBench Professional 的結果是在「AQ 環境」中評估的,而 Ling-3.1-flash 的醫療照護能力目前只能在 AQ 中體驗。沒有任何公開文件說明 AQ 是什麼。一個帶有未具名環境限定條件的頭條分數,並非外部團隊所能重現,即使權重已經存在也一樣。

這週到底該用哪一個

關於世代選擇的問題,會因你當下的需求而有不同答案;而對幾乎所有人來說,現在的最佳選擇都不是較新的型號。

如果你這週就需要能跑起來的東西,Ling-3.0-flash 是這兩者中唯一以可用形式存在的:你可以自行託管的 MIT 權重、想要更小佔用空間時可用的 FP8、已公布的第一方 API 定價,以及一份能告訴你實際會得到什麼的獨立評分。它在所屬級別中是真正優秀的模型——該獨立評估將它列入開放權重(open-weights)在智力相對於總參數量上的帕雷托前沿,並高度評價其速度,但附帶一點:它異常冗長,在受評估過程中生成了約 2.6 億個 token,而中位數接近 1 億。

如果你正在規劃未來六個月,Ling-3.1-flash 是發展方向,而還不是一個元件。在它成為元件之前,值得留意的具體事項包括:權重是否真的開放,以及依何種授權條款;服務視窗是否真的是 1M,還是較短原生上下文的延伸;每百萬 token 的成本是多少;以及是否有獨立實驗室重現 FrontierSWE 上的 75.16。上述任何一項成真,都會是重新執行這項比較的理由。目前一項都還沒成真。

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

這在路由堆疊中的定位

今天我們的目錄上沒有任何一款 Ling 模型——Ling-3.0-flash、Ling-3.0-flash-VL 和 Ling-3.1-flash 全都回傳找不到 (以 OrcaRouter 模型 API 而言),所以對於「我可以透過你們呼叫它嗎」這個問題,誠實的答案是:目前不行。在像本週這樣的一週裡,路由層真正好用之處在於問題的另一半:你會拿來對候選模型做基準測試的那些模型。Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 全都是以供應商定價、零加價的現行路由,而用一把金鑰把它們託管在背後、並具備自動容錯移轉的路由器,正是讓評估工具鏈持續對準一個不斷移動的目標、又不必維護四套整合的方式。等到 Ling-3.1-flash 的權重上線、授權條款也清楚可讀時,決策的樣貌也是如此:新增一個端點,而不是重建整套技術堆疊。

世代摘要很短。Ling-3.0-flash 是一款已推出、經獨立評分、採寬鬆授權,且現今即可自我託管的模型。Ling-3.1-flash 則是更大、上下文更長、執行成本更高的承諾,Ant 尚未以任何開發者可用的形式兌現。把後者視為前者的升級,正是這次發布所招致的錯誤,而目前的數字也還不支持這種說法。

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".