一則為新聞文章《LLaDA2.2-mini — 新聞》自製的標題卡:副標題為「一款擴散式語言模型代理,於 2026 年 9 月 5 日低調發布」;藥丸形徽章為「16B MoE / 1.4B 活躍參數」「128K 上下文」「Apache-2.0」;頁尾為「從儲存庫可知的內容,以及尚未證實的部分」;並在右下角合成 OrcaRouter 標誌。
Guides & Insights

LLaDA2.2-mini:Ant inclusionAI的擴散代理權重於9月5日悄然現身

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

「2026 年 9 月 5 日 05:16 UTC,一個名為 inclusionAI/LLaDA2.2-mini 的 Hugging Face 儲存庫誕生了;截至撰寫本文時,這幾乎就是這次發布的全部故事:權重已上線、模型卡已寫好,而供應商——即 LLaDA 擴散模型產品線背後的 Ant Group(螞蟻集團)實驗室 inclusionAI——至今隻字未提。沒有發布貼文、沒有社群宣傳、沒有出現在 inclusionAI/LLaDA2.X 的 GitHub README 模型表中,該表目前仍只有較大的 LLaDA2.2-flash 孤單列在上面。儲存庫出現二十四小時後,其下載計數器仍顯示為零。這是一篇關於 LLaDA2.2-mini 的「迄今已知資訊」整理。這種格式所要求的嚴謹在此相當重要,因為幾乎每個與該模型相關的有趣數字,都是 inclusionAI 自行打在自家模型卡上的數字。本文將此次發布中可獨立驗證的事實與廠商自行申報的資訊分開,並直接點出尚待解答的疑問,而非含糊帶過。

簡短版本,給只想知道大概輪廓的人:LLaDA2.2-mini 是 inclusionAI 於 2026 年 7 月發布的 LLaDA2.2-flash 擴散語言模型的小型姊妹模型。它現在以 160 億參數的混合專家(mixture-of-experts)檢查點形式提供,每個 token 只啟動 14 億參數,支援 128K 上下文,並經過訓練以執行代理型工作——工具呼叫、多輪修正——使用一個能在生成途中插入和刪除 token 的擴散解碼器。它採用 Apache-2.0 授權。而且由於這些權重才剛發布一天、背後沒有伴隨任何公告,因此常見的配套設施都還不存在:沒有獨立評測、找不到任何託管 API,也沒有模型卡本身建議以外的服務指南。你今天能驗證的,就是 inclusionAI 選擇公布的架構、授權與數字。

發布是一個儲存庫,而非一個事件。

先從不需要信任任何人就能查證的事開始。Hugging Face API 記錄顯示 inclusionAI/LLaDA2.2-mini 創建於 2026 年 9 月 5 日,並於同日最後修改。它採用 Apache-2.0 授權,使用含 bf16 張量的 safetensors 格式,配有聊天模板,且需要trust_remote_code,因為其擴散架構是以自訂建模程式碼的形式提供。該 repo 的姊妹專案 inclusionAI/LLaDA2.2-flash 創建於 2026 年 7 月 16 日,在之後數週內累積了數千次下載和數十個讚,並已公開宣佈。而 mini 既無公開公告,也未獲採用——上線第一天僅有個位數的讚,下載次數則完全為零。

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

到目前為止,mini 所獲得的第三方關注只有一個彙整頁面,它在 repo 出現後幾小時內就重新發布了 model card;那只是 model card 的鏡像,並非獨立來源,而且它不包含任何 repo 本身未提供的資訊。這就是截至 9 月 6 日的全部公開記錄。對於要決定是否關注的讀者來說,關鍵的脈絡是:inclusionAI 已在同一個星期內兩度靜靜地發布 diffusion 權重——此模型在 9 月 5 日,而 LLaDA-Image 生成檢查點在前一天——因此,靜靜地發布 repo 看起來是這個實驗室既定的發布模式,而非意外。這個模式本身並不能告訴我們是否會有正式公告。

LLaDA2.2-mini 實際上是什麼

架構是這個模型最有趣的地方,而卡片上已有完整描述。LLaDA2.2-mini 是一個建立在 LLaDA2.0-mini 骨幹之上的混合專家擴散語言模型。擴散語言模型顛覆了常見的生成迴圈:有別於自迴歸模型一次預測一個下一個 token,擴散 LLM 是從一塊遮罩或含雜訊的 token 開始,並行地精煉整塊 token,透過去噪逐步趨向一個連貫的序列。LLaDA2.2 的生成加入了 inclusionAI 所稱的 Levenshtein 編輯:兩個控制 token——DELETE 和 INSERT——讓解碼器除了改變內容之外,還能改變它正在產生之序列的長度與結構——移除它已經寫出的多餘片段,或開啟一個插入點,讓新的上下文(例如工具結果)得以放入。這就是該系列模型用來讓擴散解碼能在多輪、使用工具的迴圈中運作的機制;在這種情境下,自迴歸模型只需等待下一個使用者回合,而區塊擴散模型則必須修改它已經生成的內容。

相關規格皆直接來自規格卡:總參數 160 億(不含嵌入層),透過 256 位專家組成的 MoE,每 token 啟用 14 億參數,每次路由 8 位專家;共 20 層、16 個注意力頭、4 個 KV 頭;詞彙量達 157,184 個 token;採用旋轉位置嵌入;並支援 128K 上下文視窗。一種名為 Block Routing 的技術會在擴散區塊層級限制哪些專家被觸發,這正是該模型能在單張消費級 GPU 上維持 128K 上下文可行性的關鍵。規格卡將它定位為需要 24GB 以上顯示卡的模型,並建議以 SGLang 作為長上下文代理型工作負載的服務後端。

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

以上是該版本在家族時間軸中的定位——也就是讓「LLaDA2.2-mini」得以被理解的譜系。LLaDA2.0 於 2025 年 11 月成為首個擴展至一千億參數的擴散語言模型;LLaDA2.1 於 2026 年 2 月加入了 token 編輯功能,以加速文字擴散;2026 年 7 月的 LLaDA2.2 世代,與 LLaDA2.2-flash 及其技術報告一同發布,將整個系列指向了智能體。mini 是該世代中直到現在仍停留在承諾階段的那一塊:關於 7 月發布的報導已提到一個更輕量的 16B flash 變體,用於更經濟的部署,但獨立的權重直到 9 月 5 日才真正落地。

卡片上的數字,標示出它們分別代表什麼

模型卡上的基準測試表是 inclusionAI 自家的結果,是在權重上線當天公布的,至今沒有任何獨立實驗室複現過其中任何數據——Artificial Analysis 沒有收錄 LLaDA2.2-mini,我們也找不到任何第三方跑分。請把這些數字視為廠商帶有方向性的宣稱,而非實測事實。在這個前提下,模型卡講述的故事是一致的:LLaDA2.2-mini 是 agentic 與長上下文方面的專家,而它是靠犧牲一些通用基準分數換來這些能力的。

• 智能體平均 — 59.00,來自 τ²-Bench 57.50、Claw-Eval 57.16 與 PinchBench 62.33(供應商回報)。

• 函式呼叫 — 在 BFCL v4 上為 47.68,較 LLaDA2.0-mini 的 25.05 與 LLaDA2.1-mini 的 28.44 有所提升;在較舊的 BFCL v3 上則為 69.02。

• 長上下文 — 在 LongBench v2 上獲得 34.99 分,是先前 mini 版本所取得的 15.51 與 12.13 兩倍以上,這就是 128K 視窗所帶來的具體成果。

• 一般 — 綜合平均 46.47,其中 AIME 2026 為 35.05,OlympiadBench 61.11,LiveCodeBench v6 28.14,GPQA-Diamond 44.41,IFBench 24.93 — 其中幾項略低於先前的 mini 版本,明顯是將訓練預算投入代理行為(agentic behavior)所付出的可見代價。

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

最後這點值得細想,因為這正是團隊選擇此模型,而不是選擇紙面上更強的通用模型的誠實理由。LLaDA2.2-mini 並不宣稱自己是數學或指令遵循方面最好的小型模型;它宣稱的是,它擅長擴散模型以往一直不擅長的事——持續、多輪、使用工具的工作——同時把有效參數數量壓低到在單張 GPU 上仍有實際意義的程度。BFCL v4 的躍升與 LongBench v2 的躍升,就是在這張規格表大體可信的前提下,能經得起獨立評測的數字。

執行它,以及缺失的鷹架。

理論上,執行 LLaDA2.2-mini 的步驟相當直接,因為此版本原生支援 Transformers:模型卡顯示可使用 AutoModelForCausalLMtrust_remote_code=True 在 transformers ≥ 5.2.0 上載入,接著以擴散專用參數呼叫 generate——區塊長度 32 與溫度 0.0 是建議的預設值,且模型卡建議多數查詢使用 32,768 token 的輸出長度。針對 agentic(代理式)長上下文服務,它指向 SGLang;中國大陸使用者則可使用 ModelScope 鏡像。目前尚不存在的是周邊生態系:任何我們能查證的供應商皆未提供託管 API,也找不到任何 GGUF 建置,而框架支援仍在演進中——社群針對 llama.cpp 的 LLaDA2 架構開發是最近的事,因此量化(quantization)支援仍然薄弱。

這種組合——一種真正全新的解碼範式,才剛出現一天、且僅限自架——正是路由層足以證明自身價值、又不必假裝新模型已可上線生產的情境。負責任地試用 LLaDA2.2-mini 的方法,是讓你在測試路徑上自行運行,而生產環境繼續留在成熟模型上;這正是 OrcaRouter 的配置用途:以供應商列表價格、0% 加成,透過單一 API 串接 200 多個模型;自動故障轉移使才一天大的檢查點即使停滯,也不會拖垮工作流程;路由 DSL 則能在單一金鑰背後,將自架的擴散呼叫與託管式自迴歸模型組合編排。當——如果——有供應商將 LLaDA2.2-mini 上架,同樣的直通計價也適用,你看到的價格就是供應商自己的價格。在那之前,誠實的可用性說法是:請從 Hugging Face 或 ModelScope 下載 Apache-2.0 權重,然後自行運行。

接下來要看什麼

要把這個「到目前為止已知的一切」變成一個真正的故事,需要三件事,但這三件事今天全都缺席。首先,要有官方公告:如果 LLaDA2.2-flash 的模式成立,那麼在 repo 靜默發布之後,可能會有發布文章以及技術報告的相關報導出現,而且很可能會補充技術卡上省略的訓練細節。其次,要有獨立實測:agentic 平均 59.00 分與 BFCL v4 的 47.68 分是最值得重現的宣稱,因為 agentic 基準正是評估框架的選擇對分數影響最大的地方。第三,要有服務部署的成熟度:SGLang 服務指南、vLLM 的路徑,以及社群製作的量化版本,能告訴你 1.4B-active 的資源佔用在實際營運上是否真的如規格表所暗示的那麼便宜。這些在 9 月 6 日都還不存在。權重是真的,授權是寬鬆的,而這個架構確實是執行智慧體的另一種方式——但證明它是個智慧體,目前仍只是一家廠商的卡片。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube