
Ling-3.0-flash:關於螞蟻集團新的快速層級MoE我們實際知道的事(以及我們不知道的)
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百萬 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 199 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1651智能71程式
- kimiMoonshotAI: Kimi K32026-07-1557智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grokxAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
螞蟻集團的InclusionAI實驗室於2026年7月23日左右開源了Ling-3.0-flash——截至本簡報,該模型剛剛發布數日。這是一個混合專家(MoE)語言模型,總參數達1240億,每次推論約有51億活躍參數(稀疏比約24:1),專為文字生成與工具呼叫而設計。它被定位為Ling系列中快速且成本的層級;旗艦位置仍屬於規模大得多的Ling-2.6-1T(總參數1兆 / 活躍參數630億)。目前僅可通過API存取——途徑包括螞蟻自家的開發者入口網站、OpenRouter上的inclusionai/ling-3.0-flash,以及ZenMux。
這就是目前確認的全貌,而坦誠說明為何這篇簡報讀起來比典型的模型評測文章更謹慎,是值得的。目前沒有 Hugging Face 權重、沒有 Ling-V3 的 GitHub 儲存庫,也沒有明確的授權聲明——這與 Ling 2.0 和 Ling 2.6 截然不同,後兩者皆以 MIT 授權的開放權重形式發布。此外,也完全沒有任何獨立的基準測試數據:Artificial Analysis——這類模型最常被引用的第三方評估者——尚未有它的專頁。目前流傳的每一項效能與速度數據都源自螞蟻集團本身。
TL;DR. Ling-3.0-flash是蚂蚁集团InclusionAI推出的一款124B/5.1B活跃参数的MoE模型,于最近几天发布,仅提供API接口,无Hugging Face权重,且许可证未确认。厂商声称——峰值吞吐量1000 tokens/sec,首令牌时间低于100ms——尚未获得独立验证,且该特定模型没有Artificial Analysis评分。前代Ling-2.6-flash的Artificial Analysis智能指数仅为14(Ling-2.6-1T为26),这提供了有用的背景信息,但不能替代3.0-flash的实际能力。定价(输入每100万tokens ¥0.40,输出每100万tokens ¥1.20,目前在发布周内免费,每天提供50万免费tokens)明显是促销价格,可能会变动。请将此处所有内容视为预览,而非定论。
關鍵要點
• 它是快速/廉價層級,而非旗艦產品。Ling-2.6-1T 仍然是 InclusionAI 最大的模型;Ling-3.0-flash 是更小、更便宜、更快的同系列模型,專為高用量場景打造。
• 不存在獨立的基準測試。 Artificial Analysis 沒有 Ling-3.0-flash 的頁面。唯一公開的數字是 Ant Group 自己的,而 Ant 的文件目前完全沒有顯示該模型的基準測試表。
• 速度聲明僅為供應商自身所稱。每秒1000個token的峰值和低於100毫秒的首個token時間均來自螞蟻集團,沒有任何第三方吞吐量測試來確認這兩個數字。
• 沒有開放權重,授權未確認。 沒有 Hugging Face 儲存庫和 GitHub Ling-V3 專案。先前的 Ling 版本是 MIT 授權;3.0-flash 是否會跟進尚不清楚。
• 定價為上市首週促銷活動。Ant平台上的¥0.40/¥1.20每1M tokens目前豁免,每天免費500k個token以及免費的OpenRouter列表 — 這些在促銷結束後均不應被視為有效。
• 它是一個三模型系列中的一員。 InclusionAI 將其產品線分為 Ling(通用型MoE,此模型)、Ring(專注推理)和 Ming(多模態)。
關於如何閱讀此簡報的說明:以下每項規格、基準測試和價格均標明來源。當螞蟻集團是唯一來源時,我們會直言不諱並相應地保留態度。當前代Ling模型有獨立評分時,我們會引用它們作為背景——而非作為Ling-3.0-flash本身數據的替代,因為該數據尚不存在。一旦獨立測試趕上進度,這很可能需要後續跟進。
我們實際上所知
在架構上,Ling-3.0-flash 是一個稀疏的 MoE 模型:總共有 124B 個參數,對於任何給定的 token,大約有 5.1B 個活躍,這使得它相對於其總大小來說運行便宜且快速。根據螞蟻集團自己的文件,上下文視窗為 256K 個 token,供應商聲稱可擴展到 1M;OpenRouter 的列表顯示 262,144 個 token,這與 256K 的數字相符。最大輸出長度在我們能找到的任何地方都沒有公開。該模型支援標準文字生成和工具呼叫,但沒有提到多模態輸入或輸出——該功能屬於獨立的 Ming 系列。
在可用性方面,目前僅限API且與我們找到的三個途徑一致:螞蟻集團自家開發者平台、OpenRouter(標示為 inclusionai/ling-3.0-flash)以及 ZenMux。這些途徑均未提供可下載的權重。GitHub 上沒有「Ling-V3」專案的組織頁面,螞蟻集團的文件也未針對此特定模型說明授權條款——這是個重要的缺口,因為 Ling 2.0 與 Ling 2.6 均以 MIT 授權釋出開放權重。在 InclusionAI 釐清之前,請勿假定 Ling-3.0-flash 最終會開放,也請勿假定它不會開放。

差距:尚未驗證的內容
最大的差距在於基準測試。撰寫本文時,Artificial Analysis——這類模型最常引用的獨立評測機構——尚未為 Ling-3.0-flash 設立專頁;正常情況下顯示該模型的網址模式回傳 404。這意味著目前沒有任何來自 Artificial Analysis 或其他我們能找到的獨立評測機構針對此模型的第三方推理、編碼或數學評分。Ant 自身的文件更雪上加霜:它完全沒有為 3.0-flash 發佈任何基準測試表,無論是供應商提供的還是其他來源,這在模型發佈中並不常見,且本身值得特別標註。
為了提供粗略的背景資訊,前一代的 Ling 模型確實有獨立的評分。Ling-2.6-flash 在 Artificial Analysis 智慧指數上獲得 14 分,而較大的 Ling-2.6-1T 則獲得 26 分——兩者都遠落後於 Artificial Analysis 當時追蹤的領先開源權重模型。螞蟻集團自身針對 Ling-2.6-flash 的廠商數據宣稱其在 SWE-bench Verified 上達到 61.2%,在 AIME2026 上達到 73.85%。這些數字都不應直接套用到 Ling-3.0-flash 上;架構全新的新一代產品可能往任一方向發展,而在獨立評估機構實際測試之前,任何針對 3.0-flash 的能力聲稱都只是披著事實外衣的猜測。
廠商的速度宣稱:紙上很快,但未經實際驗證。
螞蟻集團為 Ling-3.0-flash 主打的核心賣點並非推理品質,而是原始速度。該供應商宣稱峰值吞吐量達每秒 1000 個 token,且首次 token 延遲低於 100 毫秒——若經證實,兩項數據確實稱得上快速。但「若經證實」這幾個字在此句中分量極重:這些數字完全來自螞蟻集團自己的資料,是在螞蟻控制且未完全公開的條件下測量(硬體、批次大小、提示長度與負載皆會顯著影響吞吐量)。目前尚無獨立實驗室發表過重新測量的結果。在螞蟻以外的人執行可比對的測試之前,請將 1000 tok/s 與低於 100 毫秒的 TTFT 視為值得依自身工作負載驗證的行銷數字,而非定論。

定價,以及為何它是個不斷變動的目標
在螞蟻集團自家的平台上,Ling-3.0-flash 的定價為每 100 萬輸入代幣 ¥0.40,每 100 萬輸出代幣 ¥1.20——這樣的設計使其價格低廉,與其作為快速/廉價層級的定位一致。但這個標價實際上並非任何人目前支付的價格:螞蟻正在進行免費的發布首週促銷活動,並另外在其平台上每天提供 50 萬免費代幣。OpenRouter 的列表顯示一個 ling-3.0-flash:free 變體,價格為 $0/$0。這一切都不應被誤認為是穩定的價格。發布促銷會到期,免費層級會被設定上限,而 ¥0.40/¥1.20 的數字本身也可能在實際使用數據進來後發生變動。如果您計劃圍繞此模型進行生產支出,請按標價(而非促銷價)制定預算,並在承諾之前重新確認。
凌 / 林 / 明家族
Ling-3.0-flash 並非孤立存在——InclusionAI 將其發行版劃分為三個命名系列,每個系列針對不同的任務。Ling 是通用型 MoE 系列,涵蓋日常文字生成與工具呼叫;Ling-3.0-flash 位於該系列中快速/廉價的一端,而 Ling-2.6-1T 仍是較大的旗艦產品。Ring 是 InclusionAI 專注於推理的系列,專為依賴多步驟思維鏈而非原始吞吐量的任務而構建。Ming 是多模態系列,處理 Ling 本身不涉及的圖像及其他非文字模態。如果你的任務需要更重的推理或多模態輸入,合適的 InclusionAI 模型可能不是 Ling-3.0-flash——它專為文字與工具通道內的容量與速度而設計,而非延伸到另外兩個系列的領域。
適用對象:三種情境
1. 高流量、延遲敏感的文本或工具調用管道——作為試行,而非承諾
如果你的工作負載主要由吞吐量敏感的文本生成或工具呼叫主導——例如聊天、輕量級代理、高頻 API 呼叫——那麼 Ling-3.0-flash 的定位(較小的活躍參數數量、號稱低於 100 毫秒的 TTFT、近乎免費的推出定價)使其值得進行試點。問題在於,「值得試點」與「值得將生產流量切換過去」是兩回事。在沒有任何獨立基準數據的情況下,你現在就是基準:在信任它處理任何面向客戶的任務之前,先用你自己的評估集進行測試,也別根據目前的促銷定價來建立成本模型。
2. 需要長上下文但預算有限的團隊
一個256K上下文窗口(且廠商聲稱可擴展至1M),搭配真正低廉的定價,對於需要大量檢索或文件處理的使用場景來說,確實是極具吸引力的組合——前提是模型在該上下文長度下能維持實際推理品質,而這一點再次強調,尚未有獨立來源測試過。這是一個值得與既有低價長上下文選項一同列入短名單的合理候選,但應與它們並排評估,而非僅憑螞蟻集團規格表上的優勢就予以採用。
3. 觀察者追蹤中國的MoE領域以及InclusionAI路線圖
對於那些追蹤中國開放和半開放模型實驗室競爭格局而非在生產中部署單一模型的團隊而言,Ling-3.0-flash 是一個有用的數據點:它表明 InclusionAI 在其快速層級上快速迭代,可能從開放權重(至少目前)退後,並繼續押注於三個家族結構(Ling/Ring/Ming)而非一個通用模型。一旦基準和許可證清晰度到來,值得書籤並重新審視。
何時不應使用
跳過 Ling-3.0-flash 在需要引用已驗證能力宣稱的任何情況下——沒有獨立的基準可參考,因此目前任何關於其推理、編碼或數學能力的陳述都是不可證偽的。如果你需要開放權重以自行託管、微調或合規原因,也請跳過它;目前沒有這類權重可用,而且這個特定模型的授權條款甚至尚未公布,更遑論確認其為寬鬆許可。跳過它進行多模態任務——那是 Ming 系列的工作,不是 Ling 的。同時,在根據當前定價建立成本模型時要謹慎:免費發布週、每天 50 萬免費代幣以及 OpenRouter 的免費層級都是促銷活動,而它很可能恢復的 ¥0.40/¥1.20 牌價本身尚未經過真實使用情境的測試。
常見問題
Ling-3.0-flash 是開放權重的嗎?
目前還沒有。截至撰寫本文時,沒有 Hugging Face 儲存庫,也沒有 GitHub Ling-V3 專案。之前的 Ling 世代(2.0 和 2.6)以 MIT 授權開放權重發布,但沒有任何確認 Ling-3.0-flash 會遵循該模式——或不遵循。
Ling-3.0-flash 在基準測試上的表現如何?
目前還沒有針對它的獨立基準測試——Artificial Analysis 尚未為此模型建立專屬頁面。螞蟻集團(Ant Group)的官方文件中也沒有公佈其基準測試表格。粗略對照歷史數據,前一代的 Ling-2.6-flash 在 Artificial Analysis Intelligence Index 中得分為 14,而 Ling-2.6-1T 得分為 26,但這兩個數值都不應被視為會沿用至這一代新產品。
它到底有多快?
螞蟻集團聲稱達到每秒1000個token的峰值吞吐量和低於100毫秒的首個token生成時間。兩者均為供應商單方面提供的數據,目前尚無獨立重測結果發布。請將其視為有待在自身工作負載中驗證的宣稱,而非已確認的性能表現。
Ling-3.0-flash 的價格是多少?
Ant's Platform(蚂蚁平台)的列表价格为每100万输入tokens ¥0.40,每100万输出tokens ¥1.20,但在发布周推广期间目前免费,同时提供每日50万免费tokens。OpenRouter也列出了一个免费变体。这些推广条款预计会发生变化。
上下文視窗有多大?
根據Ant的文件,256K tokens,供應商聲稱可擴展至1M。OpenRouter的列表顯示262,144 tokens,與256K的數字一致。最大輸出長度未公開。
Ling、Ring和Ming之間有什麼區別?
Ling 是 InclusionAI 的通用文字與工具呼叫 MoE 產品線,而 Ling-3.0-flash 位於其快速/低成本一端。Ring 是專注推理的產品線。Ming 負責多模態任務。它們是針對不同用途建構的獨立模型系列,而非同一模型的不同層級。
Ling-3.0-flash 和 Ling-2.6-1T 相同嗎?
No. Ling-2.6-1T 是 InclusionAI 較大的旗艦模型(總參數1T / 活躍參數63B),仍然是一個獨立且更大的模型。Ling-3.0-flash(總參數124B / 活躍參數約5.1B)則是更新、更小、速度更快的版本。
我應該在生產環境中使用Ling-3.0-flash嗎?
只有在運行你自己的評估之後。由於缺乏獨立基準測試、未經確認的授權,以及目前屬於促銷階段定價,將其用於試點是合理的,但若不經過自行測試,且未規劃好促銷條款結束後的應對方案,就貿然將生產關鍵或合規敏感的工作負載託付給它,則為時過早。
底線
Ling-3.0-flash 是一個真正值得關注的新版本——一個參數為 124B/5.1B 活躍的 MoE 模型,專注於快速、低成本、高容量的文字處理與工具呼叫任務,來自一個先前已推出過可信模型的實驗室。但目前它只是一張規格表和一套供應商聲明,並非經過驗證的產品:沒有獨立基準測試、沒有開放權重、沒有確認的授權,且定價明確為促銷性質。這不是否定它的理由——而是謹慎試用、直接驗證對你重要的聲明,並在 Artificial Analysis 或其他獨立評估機構發布真實數據後重新審視這篇簡介的理由。

