Ling-3.0-flash:我們目前所知關於螞蟻集團開放權重快速層級 MoE
Guides & Insights

Ling-3.0-flash:我們目前所知關於螞蟻集團開放權重快速層級 MoE

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

螞蟻集團的 InclusionAI 實驗室正式發布了 Ling-3.0-flash——於 2026 年 7 月 24 日宣布,並於 8 月 7 日以 MIT 授權開源——而自我們 7 月在這裡發布的預覽以來,情況已經大不相同。這是一個原生混合推理的專家混合模型,總參數 124B,每個 token 僅啟用 5.1B,作為 Ling 系列中快速且廉價的等級而構建。改變一切的兩個數字:Artificial Analysis 現在在 Intelligence Index 上給予它 38 分(比上一代快速等級 Ling-2.6-flash 高出 24 分),並將其置於開放權重的智慧 vs 總參數 Pareto 前沿。權重已在 Hugging Face 和 ModelScope 上線。

當我們在7月24日首次報導這款模型時,誠實的總結是:僅提供API、沒有權重、沒有授權聲明、沒有獨立基準測試。這四項陳述如今都已過時。螞蟻集團於8月7日在MIT許可下開源了權重,Artificial Analysis此後也發布了完整的獨立評測。本次更新相應地修訂了原始簡報——7月文章中佔主導地位的「未經驗證」標籤,如今僅適用於範圍小得多的主張,主要是螞蟻集團的峰值速度數據,而非整個模型。

摘要。Ling-3.0-flash 是螞蟻集團(Ant Group)快速級別的開放權重 MoE 模型:總參數 124B / 啟用參數 5.1B,MIT 授權,原生上下文長度 256K(服務時為 262K)。Artificial Analysis 給出的智慧指數(Intelligence Index)為 38——比上一代 Ling-2.6-flash 高出 24 分,且位於開放權重模型的智慧與總參數 Pareto 前緣上——測得輸出速度約 368 tokens/sec。權重以 MIT 授權發布於 Hugging Face 和 ModelScope。以下仍為廠商獨家宣稱:1,100+ tokens/sec 的峰值吞吐量、低於 100ms 的首個 token 延遲數據,以及模型卡上的基準測試表。第一方 API 定價為每 1M tokens 輸入 $0.075 / 輸出 $0.22(快取命中時降價 80%);上線時的免費方案已於 8 月 3 日結束。

關鍵要點

• 這是快速/便宜的等級,而非旗艦款。 前一代的 1T 參數旗艦仍是 InclusionAI 最大的模型;Ling-3.0-flash 是體積更小、速度更快的兄弟模型,專為高流量文字與工具呼叫所設計。

• 權重現在以 MIT 授權開放。 這些權重於 8 月 7 日以 MIT 授權上架到 Hugging Face(inclusionAI/Ling-3.0-flash)和 ModelScope —— 這與七月「僅限 API」的局面相反。

• 它終於有了獨立的評分。Artificial Analysis 衡量其智能指數為 38,比 Ling-2.6-flash 高出 24,並將該模型置於開放權重的帕累托前沿,即智能與總參數的權衡。

• 速度目前已部分經實測。AA 的輸出速率約為每秒 368 個 tokens,首個 token 生成時間約 1.98 秒;Ant 對外宣稱的每秒 1,100+ tokens 峰值數據,仍僅為廠商提供的數據。

• 定價已確定,免費推出期間已結束。 第一方 API 的價格為每 1M tokens 輸入 $0.075 / 輸出 $0.22,並提供 80% 的快取命中折扣;推出時提供的免費方案已於 8 月 3 日結束。

• 這是三款模型系列中的一款。InclusionAI 將產品線分為 Ling(通用文字與工具 MoE,即本模型)、Ring(推理)和 Ming(多模態)。

關於如何閱讀本更新的說明:這是對7月24日預覽版的修訂,撰寫於權重開放及首批獨立評分出爐之後。以下每項規格、基準測試與價格均按來源標註。凡Ant Group為唯一來源之處——即峰值速度宣稱與模型卡基準測試表——我們會明確說明。凡Artificial Analysis獨立測量之處,我們均加以引述。

我們實際上所知

該架構現已完整記載於模型卡上。Ling-3.0-flash 採用原生混合線性注意力堆疊——Kimi Delta Attention (KDA) 與 Gated MLA 層以 5:1 的比例交替(35 層 KDA + 7 層 MLA),並搭配 KDA 細粒度對角門控——疊加在 1/64 稀疏 MoE(512 個路由專家,每個 token 啟動 8 個)之上。這正是它以僅 5.1B 活躍參數達到 124B 總參數的方式。上下文視窗原生為 256K,在推論配置中以 262,144 個 token 提供服務,Ant 宣稱該架構可擴展至 1M。最大輸出長度未公開。該模型為純文字模型,支援工具呼叫;多模態輸入則屬於獨立的 Ming 產品線。

實驗室發布了兩種權重格式——BF16(約255GB)與FP8(約128GB)——且社群量化變體已於模型卡上提供連結。實驗室自身的部署配方以 SGLang 和 vLLM 為目標。

可用性:採用 MIT 授權的開放權重

8月7日,螞蟻集團的InclusionAI團隊在Hugging Face(inclusionAI/Ling-3.0-flash)與ModelScope上以MIT授權開源了模型權重。這是一個寬鬆、可商用的授權——與Ling 2.0和Ling 2.6釋出時所用相同——代表你可以自行託管、微調並部署Ling-3.0-flash,而不必透過API租用。該模型也可透過螞蟻自家開發者API及多個第三方平台呼叫。以這個價格的快速級模型而言,更有趣的問題在於:要自行託管(FP8約需128GB記憶體),還是繼續使用API。

獨立評分:AA智力指數為38

相較於七月發布的文章,最大變化在於現在有了獨立的分數。Artificial Analysis 已為 Ling-3.0-flash 建立頁面,並在 Intelligence Index 上評為 38 分——比上一代快速等級 Ling-2.6-flash(14 分)高出 24 分,且與 MiMo-V2.5 和 Qwen 3.6 27B 持平,而僅啟動其一小部分的參數量。Artificial Analysis 也將該模型放在開放權重模型中「智慧程度 vs. 總參數量」的帕累托前沿上:沒有任何總參數量更少的開放權重模型得到更高分數。AA 上快速等級開放權重的領先者 DeepSeek V4 Flash 仍然得到更高分數(在最大推理強度下為 Index 52)。

代理式與長上下文方面的結果同樣方向性強勁。在 AA 的 τ3-Bench Banking 測試集中,Ling-3.0-flash 得分 27%,在快閃級開放權重模型中位居第二,僅次於 DeepSeek V4 Flash(39%)。在 GDPval-AA v2 上,其 Elo 達到 1108,高於 Ling-2.6-flash 的 545。Ant 在 10,000+ 個互動環境中訓練該模型(供應商自報數據),並將其定位為代理工作流程的執行節點——快速、便宜、可隨手丟棄,繁重的推理工作則交由更大的旗艦模型處理。

關於來源有一項提醒:Ant 模型卡上的基準測試表——SWE-Bench Pro 56.6、SWE-bench Multilingual 72.4、MathArena AIME 2026 93.2、HLE 22.7——為供應商自行報告,尚未經獨立重現。請將其視為該實驗室自己的宣稱,與下方峰值速度數據歸為同一類別。

速度:先測量,再宣稱

速度的故事現在分成了兩種不同版本。獨立機構 Artificial Analysis 在第一方 API 上測得約 368 tokens/sec 的輸出速度,以及約 1.98 秒的首個 token 延遲——對一個啟用 5.1B 參數的 MoE 模型來說確實很快,足以讓該模型在速度上名列前茅。另外,螞蟻集團宣稱在特定 GPU 配置下平均輸出速率超過 1,100 tokens/sec,且藉由基於 SGLang HiCache 和 Mooncake 建置的叢集級階層式快取層,首個 token 延遲低於 100ms。第二組數字僅來自廠商——是在螞蟻集團控制的硬體與批次設定下測量,且未發表任何獨立重跑結果。規劃時請採用 AA 的數據;將 1,100+ tok/s 視為行銷上的上限,並在自己的工作負載上驗證。

定價:便宜,而且促銷已經結束了

Artificial Analysis 列出第一方 API 的價格為每100萬個輸入 token 0.075美元、每100萬個輸出 token 0.22美元,快取命中為0.015美元(−80%)——皆為供應商自行制定的定價。發布時的免費方案(每天500k個免費 token、免費API存取)已於8月3日結束,Ant 並在 Ling Studio 推行為期至2026年8月31日的臨時75%折扣,之後將適用牌價。即使按全額牌價,$0.075/$0.22 也使 Ling-3.0-flash 穩居低價檔,對一個 Index 為38的模型來說更是如此。

在如此低的價格下,轉換成本比每個 token 的價格更為重要。OrcaRouter 的存在就是為了讓這種切換變得很便宜:一個 API 就能存取超過 200 種模型、供應商定價以 0% 加成原價轉交,並在供應商之間自動容錯切換——因此,當像這樣的新開放模型在紙上看起來很理想時,你無需再簽一份合約,就能用真實工作負載來測試它;如果它在某項特定任務上表現不達標,你可以在同一個 API 金鑰底下回退到另一個模型。

凌 / 林 / 明家族

Ling-3.0-flash 並非孤立存在——InclusionAI 將其產品分為三個命名的系列,每個系列針對不同的任務。Ling 是通用型 MoE 系列,用於日常文字生成與工具呼叫,而 Ling-3.0-flash 位於其快速/低成本的一端,比上一代 1T 參數的旗艦模型低一個等級。Ring 是專注於推理的系列,專為多步驟思維鏈而打造。Ming 是多模態系列。如果你的任務需要更重的推理或圖像輸入,正確的 InclusionAI 模型很可能不是 Ling-3.0-flash——它是為了在文字與工具的範疇內實現高容量與速度而設計的。

適用對象:三種情境

1. 高吞吐量、延遲敏感的文字或工具呼叫管線

這是該模型的擅長領域。憑藉獨立指數38、MIT授權,以及實測約368 tok/s的表現,快速等級的押注如今已可測試而非僅止於假設——你可以將自己的評估集丟進去跑,或下載權重自行託管。只是別急著以供應商宣稱的每秒1,100+ token上限為依據來建構系統,除非你已在自身工作負載上實際量測過。

2. 想要在預算內獲得長上下文的團隊

256K 原生上下文(提供 262K),並宣稱可擴展至 1M,定價為 $0.075/$0.22,對於檢索密集或文件處理類工作而言是相當吸引人的組合。模型卡上的長上下文數據為供應商自行回報,因此在投入之前,應將其與成熟的長上下文選項並列評估,並用自己的語料庫進行驗證。

3. 觀察者追蹤中國的 MoE 格局與 InclusionAI 路線圖

七月的問題——InclusionAI 是否會保持開放?——如今有了答案:會,MIT 授權,而且很快。Ling-3.0-flash 以 5.1B 活躍參數登上 AA 帕累托前沿,對任何關注中國實驗室如何以效率(而非原始參數數量)競爭的人來說,都是一個值得參考的數據點。

還有什麼尚未驗證

簡短清單,既然重大缺口已補上。供應商的峰值速度宣稱(1,100+ tok/s、sub-100ms TTFT)沒有獨立的重新實測。模型卡上的基準測試表格為供應商自行申報。FP4/INT4 變體以及單一 DGX-Spark 部署路徑皆為供應商單方面說法。至於知識層面,AA 的 Omniscience Index 顯示,相較於前一代的進步主要來自棄答——幻覺率從 97% 降至 44%,而準確率僅從 16% 微升至 18%——所以別把該指數的標題式跳升誤認為全面性的知識躍進。

何時不應使用

多模態工作請跳過 Ling-3.0-flash——那是 Ming 這條產品線的事。如果你需要的是重型推理旗艦而非快速執行者,也請跳過它——那是 Ring 的賽道。若計畫自行部署,請為真實硬體需求做好預算:BF16 大約 255GB,FP8 大約 128GB。而如果某項宣稱對你很重要,請務必核實——在獨立實驗室重新驗證之前,峰值速度和長上下文的數字都只是 Ant 單方面提供的。

常見問題

Ling-3.0-flash 是開放權重的嗎?

是的。這些權重已於8月7日在MIT許可證下開源,發布於Hugging Face(inclusionAI/Ling-3.0-flash)和ModelScope。這是一個寬鬆且可商用化的許可證——與Ling 2.0和Ling 2.6發布時所使用的許可證相同。

Ling-3.0-flash 在基準測試上的表現如何?

Artificial Analysis 測得的智慧指數為 38,較 Ling-2.6-flash 高出 24 分,並將該模型置於開放權重模型智慧與總參數量之比的帕累托前沿。Ant 模型卡上的基準測試表(例如 SWE-Bench Pro 56.6)為廠商回報的數據,尚未經獨立複現。

它到底有多快?

{{1}}Artificial Analysis 在官方 API 上測得約 368 tokens/sec 的輸出速度,以及約 1.98 秒的 time-to-first-token。{{/1}} {{2}}Ant 聲稱在指定的 GPU 配置下可達 1,100+ tokens/sec 的峰值吞吐量,以及低於 100ms 的 TTFT——這些是廠商提供的數據,未經獨立重新測量。{{/2}}

Ling-3.0-flash 的價格是多少?

AA 將第一方 API 定價為每 1M 輸入代幣 0.075 美元、每 1M 輸出代幣 0.22 美元,並提供 80% 的快取命中折扣。推出時的免費方案已於 8 月 3 日結束,而 Ling Studio 的限時 75% 折扣將持續至 2026 年 8 月 31 日。

上下文視窗有多大?

原生 256K,提供 262,144 個 token;Ant 聲稱此架構可擴展至 1M。最大輸出長度未公開。

Ling、Ring 和 Ming 之間有什麼不同?

Ling 是 InclusionAI 的通用文字與工具呼叫 MoE 系列,而 Ling-3.0-flash 定位於其中快速且低成本的一端。Ring 是專注於推理的系列。Ming 則負責多模態任務。它們是針對不同任務的獨立系列,而非同一模型的不同等級。

Ling-3.0-flash 是否與之前的 1T 旗艦相同?

不。Ling-3.0-flash是更新、更小的快速層級版本(總參數量124B/啟用參數量5.1B)。上一代的1T參數旗艦模型仍然是更大的那個。

我應該在生產環境中使用Ling-3.0-flash嗎?

比七月時更站得住腳,因為現在有了獨立評分和MIT授權。先運行你自己的評估集,根據你的工作負載驗證供應商的速度聲稱,然後在API和自托管之間做決定(FP8運行約需128GB)。其餘僅由供應商提供的數字範圍夠窄,足以進行規劃。

底線

Ling-3.0-flash 在兩週內從「規格表與廠商宣稱」躍升至「開放權重且經獨立評測」。AA Intelligence Index 38 分、5.1B 活躍參數——位居開放權重帕累托前沿、MIT 授權、定價 $0.075/$0.22——使其成為目前最值得關注的高效開放權重模型之一,而且是你實際上能自行運行的模型。相較以往,相關保留事項已縮小:峰值速度與模型卡數據仍出自螞蟻集團,須待獨立實驗室重現驗證。以這個價格定位而言,對於大量文本處理與工具調用場景,它已贏得一次真正的評測機會。