
Ling-3.1-flash 對比 Ling-3.0-flash:100 萬 Token 上下文視窗與 4.5 倍參數究竟帶來了什麼實質改變
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 262 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
螞蟻集團的 Ling 系列迎來了新的快速層級,而這回它只誕生於一句話。Ling-3.1-flash 於 2026 年 9 月 30 日發布——總參數約 5,600 億,每個 token 約啟用 250 億,脈絡視窗號稱最高達 100 萬個 token,並附上一句老套的說詞:「我們計劃在近期開源此模型。」它在快速產品線中取代的頂尖模型 Ling-3.0-flash,在各個層面都是截然不同的物種:總參數 1,240 億,每個 token 啟用 51 億,服務脈絡為 262,144 個 token,自 8 月 7 日起在 Hugging Face 上以 MIT 授權釋出權重,且在 Artificial Analysis 智慧指數中獨立取得 20 分。這兩款模型中,有一款你今天就能下載,另一款你只能讀到相關報導。拿它們來比較確實很有意義,但前提是比較得從這裡開始。
標題上的算術很簡單,也略帶誤導。Ling-3.1-flash 的總參數量約為 Ling-3.0-flash 的 4.5 倍,活躍參數量約為 4.9 倍——換算下來,每個詞元分別是 25B 對上 5.1B。隨意解讀會說:「模型大得多,所以聰明得多。」更審慎的解讀則是:Ant 在擴充模型本體的同時,大致維持了稀疏比例,而這換來的是容量,未必是每個詞元的推理深度:一個模型若在每個詞元中只從其 560B 裡路由 25B,確實在每個詞元上做的工作比只路由 5.1B 的模型更多,但它同時也為此付出約五倍的每詞元運算量。這個取捨最終落在哪裡,完全取決於 Ant 的架構能否有效處理多出來的參數——而這正是該公告沒有回答的問題。
兩個模型並列展示
把已公布的事實並列在一起,各世代就能清楚地分開。以下每一行陳述的,是 Ant 或獨立評估者實際已公布的內容;某個數字若有缺漏,那是因為沒有人公布過它。
• 總參數量 — Ling-3.1-flash:約 560B(廠商)。Ling-3.0-flash:124B(模型卡)。
• 每個 token 的活躍參數 — Ling-3.1-flash:約 25B(廠商)。Ling-3.0-flash:5.1B(模型卡)。
• 上下文視窗 — Ling-3.1-flash:最高 1M tokens(廠商)。Ling-3.0-flash:原生 256K,以 262,144 提供(模型卡與推論配方)。
• 權重與授權 — Ling-3.1-flash:尚未發布;沒有儲存庫,也沒有授權條款(曾於 2026 年 9 月 30 日及 10 月 1 日再次檢查)。Ling-3.0-flash:MIT,自 2026 年 8 月 7 日起在 Hugging Face 上以 inclusionAI/Ling-3.0-flash 的名稱發布,並在 ModelScope 上架。
• 權重格式 — Ling-3.1-flash:無可用。Ling-3.0-flash:來自實驗室的 BF16(約 255GB)與 FP8(約 128GB),以及社群量化版本。
• 基準測試來源 — Ling-3.1-flash:完全由廠商自行報告,沒有公開測試框架,也沒有權重可供重新執行。Ling-3.0-flash:由 Artificial Analysis 獨立評分,智力指數為 20,並同時公布實測輸出速度與 token 生成量。
• 可用性 — Ling-3.1-flash:僅限 Ant 自家的 Ling Studio 產品。Ling-3.0-flash:可自行託管,並可透過 Ant 的開發者 API 呼叫。

這些額外產能大概是做什麼用的
Ant 自己對 Ling-3.1-flash 的一句描述,是這次發布中最有資訊量的內容。Ling Studio 應用程式將它定位為「通用型代理、搜尋、例行辦公工作,以及軟體/程式碼開發」——這是辦公工作與代理式的框架,而非推理基準測試的框架。這與該系列的組織方式相符:Ling 是通用型文字與工具產品線,Ring 是推理產品線,Ming 則負責多模態。Ling-3.0-flash 早一個世代占據了相同的位置,而且它明確屬於快速、廉價的層級,而非旗艦。
從這個角度來看這次的規模擴展,就說得通了。代理式與工具呼叫的工作負載很長、重複性高,而且極度需要上下文:單一代理迴圈在採取行動之前,就可能耗掉數萬個 token 的累積工具輸出,因此 100 萬 token 的上下文窗口是功能上的必要條件,而不是規格表上的花俏點綴。在保持高比例活躍參數的同時擴展總參數量,正是為一個仍必須快到能待在迴圈裡的模型,增添世界知識與指令遵循深度的方式。Ant 在這裡打造的不是更慢、更聰明的旗艦;而是更大的快速層級。
反駁論點是成本,而這是同一套算術從相反方向推導出來的結果。額外容量在推論時並非免費——每一個 token 都要為此付費,而 Ant 完全沒有公布 Ling-3.1-flash 的價格:沒有 API 費率表,沒有快取折扣,也沒有任何可與前一代所列每百萬 token 0.075 美元/0.22 美元相比的資訊。那正是能決定這項比較的缺失數字,而它確實付之闕如。
基準測試,以及是誰執行的
Ling-3.1-flash 帶著三項單看很亮眼的成績登場:在 GDPVal-AA v2.1 上取得 1,673 Elo、在 FrontierSWE 上取得 75.16,以及在 HealthBench Professional 上取得 65.35。這三項全都是 Ant 自家提供的數據,取自發布公告,且沒有任何一項由外部實驗室重現。實際後果是,它們可以拿來與其他廠商的數字相比,卻不能與獨立數字相比——而 Artificial Analysis 給 Ling-3.0-flash 的 20 分 Intelligence Index 是不同量尺上的獨立數字,所以把兩者並列,等於是把一項測量值拿來跟一項宣稱相比。撰寫本文時,Artificial Analysis 上沒有 Ling-3.1-flash 的頁面。
Ant 自家圖表上的一則註腳,本身就值得特別指出。該卡指出,HealthBench Professional 的結果是在「AQ 環境」中評估的,而 Ling-3.1-flash 的醫療照護能力目前只能在 AQ 中體驗。沒有任何公開文件說明 AQ 是什麼。一個帶有未具名環境限定條件的頭條分數,並非外部團隊所能重現,即使權重已經存在也一樣。
這週到底該用哪一個
關於世代選擇的問題,會因你當下的需求而有不同答案;而對幾乎所有人來說,現在的最佳選擇都不是較新的型號。
如果你這週就需要能跑起來的東西,Ling-3.0-flash 是這兩者中唯一以可用形式存在的:你可以自行託管的 MIT 權重、想要更小佔用空間時可用的 FP8、已公布的第一方 API 定價,以及一份能告訴你實際會得到什麼的獨立評分。它在所屬級別中是真正優秀的模型——該獨立評估將它列入開放權重(open-weights)在智力相對於總參數量上的帕雷托前沿,並高度評價其速度,但附帶一點:它異常冗長,在受評估過程中生成了約 2.6 億個 token,而中位數接近 1 億。
如果你正在規劃未來六個月,Ling-3.1-flash 是發展方向,而還不是一個元件。在它成為元件之前,值得留意的具體事項包括:權重是否真的開放,以及依何種授權條款;服務視窗是否真的是 1M,還是較短原生上下文的延伸;每百萬 token 的成本是多少;以及是否有獨立實驗室重現 FrontierSWE 上的 75.16。上述任何一項成真,都會是重新執行這項比較的理由。目前一項都還沒成真。

這在路由堆疊中的定位
今天我們的目錄上沒有任何一款 Ling 模型——Ling-3.0-flash、Ling-3.0-flash-VL 和 Ling-3.1-flash 全都回傳找不到 (以 OrcaRouter 模型 API 而言),所以對於「我可以透過你們呼叫它嗎」這個問題,誠實的答案是:目前不行。在像本週這樣的一週裡,路由層真正好用之處在於問題的另一半:你會拿來對候選模型做基準測試的那些模型。Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 全都是以供應商定價、零加價的現行路由,而用一把金鑰把它們託管在背後、並具備自動容錯移轉的路由器,正是讓評估工具鏈持續對準一個不斷移動的目標、又不必維護四套整合的方式。等到 Ling-3.1-flash 的權重上線、授權條款也清楚可讀時,決策的樣貌也是如此:新增一個端點,而不是重建整套技術堆疊。
世代摘要很短。Ling-3.0-flash 是一款已推出、經獨立評分、採寬鬆授權,且現今即可自我託管的模型。Ling-3.1-flash 則是更大、上下文更長、執行成本更高的承諾,Ant 尚未以任何開發者可用的形式兌現。把後者視為前者的升級,正是這次發布所招致的錯誤,而目前的數字也還不支持這種說法。

