產生的編輯主視覺卡片,標題為「Ling-3.1-flash:已宣布,但未開放」,副標題為「總參數約 560B · 每個 token 啟用約 25B · 上下文最高 1M」。三張標示卡片分別寫著「權重:尚未釋出」、「基準測試:僅由廠商自行公布」,以及「無授權 · 無模型卡 · 無下載」。
Guides & Insights

Ling-3.1-flash 僅宣布、並非開放:約 560B 參數、1M 詞元上下文,以及一張只有 Ant 跑過的圖表

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

螞蟻集團的 Ling 團隊於 2026 年 9 月 30 日公布了其下一代快速層級模型的數字,同時表示你還無法取得它。根據螞蟻集團從自家 @AntLingAGI 帳號發布的模型公告,Ling-3.1-flash 是一個約 5,600 億參數的混合專家模型,每個 token 啟動約 250 億個參數,並具備最多 100 萬個 token 的上下文視窗。定義這次發布的一句話,就是緊接在規格之後的那句:「我們計畫很快將該模型開源。」截至今天,Hugging Face 上沒有 Ling-3.1-flash 的儲存庫,沒有授權條款,沒有可下載的權重檔案,也沒有來自螞蟻集團外部任何人的評估。存在的只有一張基準測試圖表、一個已上線的產品介面,以及一個承諾。

那個區別就是全貌,而且值得把話說白,因為大多數人最先接觸到的說法——來自中國、規模達 500B 級別、表現逼近前沿的開放權重釋出——描述的是尚未發生的事。Ling-3.1-flash 並不是開放釋出,而是僅止於宣布。兩者相差甚遠,而它們之間的落差,正是讀者可能踩雷的地方:如果你圍繞著還不存在的開放權重來規劃容量、為試點編列預算,或撰寫採購備忘錄,那你就是在對著一份新聞稿做規劃。

這則公告實際包含的內容

這篇貼文很短,其中的數字也很具體。Ant 表示,總參數量約為 5,600 億,對比每個 token 約 250 億的活躍參數,比例接近 1 比 22,只比它所接替的 Ling-3.0-flash 世代稍微更密集——該模型的總參數為 124B,活躍參數為 5.1B,約 1 比 24,而本體規模不到四分之一。上下文引述為「最高 1M tokens」,是 Ling-3.0-flash 系列目前提供 262,144-token 視窗的四倍。文中附上三項主要成績:GDPVal-AA v2.1 的 1,673 Elo、FrontierSWE 的 75.16,以及 HealthBench Professional 的 65.35。

那些數字每一項都是廠商自行回報、第一方資料,且未以任何第三方能重新執行的形式公開。沒有評估框架、沒有提示集、沒有執行設定,也沒有隨機種子——更根本的是,沒有權重可供實際運行。如果 Ant 的數字正確,該模型位居中國開放模型發布的頂尖之列;但目前無法得知這些數字是否正確。

這張圖表,以及其中內含的但書

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

Ant 在發布 Ling-3.1-flash 的同時,也釋出了一張多面版基準測試卡,將它置於一眾前沿與準前沿模型之中:GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM 家族的兩款模型,以及 DeepSeek-V4.1-Flash。在各面版中,Ling 的長條在代理式與程式編寫指標上位居或接近榜首,而在多輪對話與特定領域指標上則落在中段。就照它原本的樣子解讀——這是廠商自行挑選的任務,取自一套涵蓋通用代理工作、程式編寫、銀行領域任務與醫療照護的測試組合——而它看起來確實是一張可信的成績卡。

不過,看看名單上有誰,有一點格外引人注目。Ant 選擇的前沿同儕是 GPT-5.6 Sol 和 Claude Opus 5。這兩款模型如今都已落後一個世代。Opus 5.5 和 GPT-6 Sol 都在 2026 年 9 月 22 日同一天上線,而且兩者今天都可供路由使用。Ant 沒放上卡的最新模型,恰恰是讀者會想拿來與它較量的那些,這也正是該發布首波評論中出現的相同抱怨——希望一款十月推出的模型,是拿十月的 前沿來做基準測試,而不是拿七月的。這不是在貶低這款模型,它很可能依然站得住腳。這是把該卡視為方向性主張、而非定論的理由,也值得注意:Ant 所選的比較與其說美化了結果,不如說凸顯了它的過時。

你能觸摸到它的地方,以及一則未解釋的註腳

目前,能讓使用者實際用到 Ling-3.1-flash 的地方只有一個:螞蟻自家的產品。ling.tbox.cn 上的 Ling Studio 介面在其模型選擇器中列出了 Ling-3.1-flash,而該應用程式本身對這個模型的描述比基準測試卡更廣泛——它將它主打為「通用型代理、搜尋、例行辦公事務,以及軟體/程式碼開發」,這是這個層級常見的定位:並非家族中推理能力最深的模型,而是那個被設計來頻繁且低成本呼叫的模型。

那個表面也帶有這次發布最尷尬的細節。評測卡自己的註腳寫著,HealthBench Professional——也就是公告文本中三個數字之一的 65.35——是在「AQ 環境中評估」的,並補充說 Ling-3.1-flash 的醫療保健能力「目前只能在 AQ 中體驗」。卡上沒有任何內容解釋 AQ 是什麼,而我們能找到的公開文件也沒有為它下定義。一個附帶環境限定詞的頭條分數,若那個環境未具名,就不是可重現的結果;它只是一場旁邊擺著數字的產品展示。

什麼是可知的,什麼不是

把這份發行版本歸入這兩個類別,是讀者今天能做的最有用的事。

目前可知:廠商所述的參數、活躍參數數量與上下文視窗;三項廠商基準測試;該模型存在於 Ant 自家產品中;Ant 所選的比較組;尚未公布任何權重、授權條款或模型卡;以及曾獨立評分前一代的 Artificial Analysis 並沒有 Ling-3.1-flash 頁面。截至本文撰寫時,讓 Ling-3.0-flash 的 20 分 Intelligence Index 數字得以解讀的獨立評分流程,完全尚未發布任何關於 3.1 的內容。

現在無法得知:權重是否真的會開放,以及會在哪種授權條款下開放;架構是 Ling-3.0 混合堆疊的放大版,還是全新的東西;透過 Ant 的 API 使用這個模型要花多少錢——如果它真的有 API 定價的話;它在實務上遇到長上下文時的行為如何,而不是只看上下文視窗在規格上怎麼定義;以及當不是 Ant 的人執行相同任務時,那些基準測試差距是否依然成立。這些問題,已發布的模型會在第一天就給出答案,而僅被宣布的模型則會在某个尚未排定的未來某一天才會給出答案。

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

如何解讀這樣的一天

這套模式如今已常見到了足以命名。一家戰績彪炳的中國實驗室發布一份模型卡與一張基準測試圖表,數字落在前沿附近,社群對這些數字做出反應,而權重會在數週後到來——或者不會。Ling-3.0-flash 今年夏天正是照著這套劇本走,而它最後如何收場值得記住:Ant 於 2026 年 7 月 24 日宣布它為僅提供 API 的模型,既無授權聲明,也無獨立基準測試,而以 MIT 授權釋出的權重直到 8 月 7 日才出現在 Hugging Face 上,也就是宣布的兩週之後。Ling-3.1-flash 在第一天就處於這段歷程中的對應位置,額外的差別在於:這回開源的承諾在公告中是明講的,而非推論而得的。

Ant 挑選作為比較對象的模型,沒有一個以文章主角的身分出現在我們的目錄上——Ling-3.1-flash、Ling-3.0-flash 和 Ling-3.0-flash-VL 在今天的 OrcaRouter 目錄中全都查無此項,我們不會佯裝並非如此。但那張圖表上的同儕模型有三個現在就能路由:Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 全都只要一組金鑰即可取用,以供應商定價、零加成提供,且彼此之間具備自動容錯移轉。在像本週這樣的一週裡,這一點比聽起來更重要,因為評估一個剛發布的模型,最誠實的方式就是進行 Ant 所邀請的那場比較——拿你可以實際呼叫的模型來比——趁著被比較的對象還只是一張圖表的時候。

當權重正式釋出時,真正有用的問題不會是 Ling-3.1-flash 是否在某一項 Elo 評分上擊敗 Opus 5。而會是:一個約 560B、約 25B 活躍參數的 MoE,能否以讓稀疏性划得來的價格撐住 1M token 的上下文,以及授權是否寬鬆到足以自行託管。這兩個問題是那則公告沒有回答的,而它們也是唯一能決定這會成為人們在其上打造的模型,還是某人下一份簡報裡的一張投影片。目前為止:名字是真的,數字只有 Ant 自己說的,而權重仍只是一句話。

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".