
LLaDA2.2-mini:Ant inclusionAI的擴散代理權重於9月5日悄然現身
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
「2026 年 9 月 5 日 05:16 UTC,一個名為 inclusionAI/LLaDA2.2-mini 的 Hugging Face 儲存庫誕生了;截至撰寫本文時,這幾乎就是這次發布的全部故事:權重已上線、模型卡已寫好,而供應商——即 LLaDA 擴散模型產品線背後的 Ant Group(螞蟻集團)實驗室 inclusionAI——至今隻字未提。沒有發布貼文、沒有社群宣傳、沒有出現在 inclusionAI/LLaDA2.X 的 GitHub README 模型表中,該表目前仍只有較大的 LLaDA2.2-flash 孤單列在上面。儲存庫出現二十四小時後,其下載計數器仍顯示為零。這是一篇關於 LLaDA2.2-mini 的「迄今已知資訊」整理。這種格式所要求的嚴謹在此相當重要,因為幾乎每個與該模型相關的有趣數字,都是 inclusionAI 自行打在自家模型卡上的數字。本文將此次發布中可獨立驗證的事實與廠商自行申報的資訊分開,並直接點出尚待解答的疑問,而非含糊帶過。
簡短版本,給只想知道大概輪廓的人:LLaDA2.2-mini 是 inclusionAI 於 2026 年 7 月發布的 LLaDA2.2-flash 擴散語言模型的小型姊妹模型。它現在以 160 億參數的混合專家(mixture-of-experts)檢查點形式提供,每個 token 只啟動 14 億參數,支援 128K 上下文,並經過訓練以執行代理型工作——工具呼叫、多輪修正——使用一個能在生成途中插入和刪除 token 的擴散解碼器。它採用 Apache-2.0 授權。而且由於這些權重才剛發布一天、背後沒有伴隨任何公告,因此常見的配套設施都還不存在:沒有獨立評測、找不到任何託管 API,也沒有模型卡本身建議以外的服務指南。你今天能驗證的,就是 inclusionAI 選擇公布的架構、授權與數字。
發布是一個儲存庫,而非一個事件。
先從不需要信任任何人就能查證的事開始。Hugging Face API 記錄顯示 inclusionAI/LLaDA2.2-mini 創建於 2026 年 9 月 5 日,並於同日最後修改。它採用 Apache-2.0 授權,使用含 bf16 張量的 safetensors 格式,配有聊天模板,且需要trust_remote_code,因為其擴散架構是以自訂建模程式碼的形式提供。該 repo 的姊妹專案 inclusionAI/LLaDA2.2-flash 創建於 2026 年 7 月 16 日,在之後數週內累積了數千次下載和數十個讚,並已公開宣佈。而 mini 既無公開公告,也未獲採用——上線第一天僅有個位數的讚,下載次數則完全為零。

到目前為止,mini 所獲得的第三方關注只有一個彙整頁面,它在 repo 出現後幾小時內就重新發布了 model card;那只是 model card 的鏡像,並非獨立來源,而且它不包含任何 repo 本身未提供的資訊。這就是截至 9 月 6 日的全部公開記錄。對於要決定是否關注的讀者來說,關鍵的脈絡是:inclusionAI 已在同一個星期內兩度靜靜地發布 diffusion 權重——此模型在 9 月 5 日,而 LLaDA-Image 生成檢查點在前一天——因此,靜靜地發布 repo 看起來是這個實驗室既定的發布模式,而非意外。這個模式本身並不能告訴我們是否會有正式公告。
LLaDA2.2-mini 實際上是什麼
架構是這個模型最有趣的地方,而卡片上已有完整描述。LLaDA2.2-mini 是一個建立在 LLaDA2.0-mini 骨幹之上的混合專家擴散語言模型。擴散語言模型顛覆了常見的生成迴圈:有別於自迴歸模型一次預測一個下一個 token,擴散 LLM 是從一塊遮罩或含雜訊的 token 開始,並行地精煉整塊 token,透過去噪逐步趨向一個連貫的序列。LLaDA2.2 的生成加入了 inclusionAI 所稱的 Levenshtein 編輯:兩個控制 token——DELETE 和 INSERT——讓解碼器除了改變內容之外,還能改變它正在產生之序列的長度與結構——移除它已經寫出的多餘片段,或開啟一個插入點,讓新的上下文(例如工具結果)得以放入。這就是該系列模型用來讓擴散解碼能在多輪、使用工具的迴圈中運作的機制;在這種情境下,自迴歸模型只需等待下一個使用者回合,而區塊擴散模型則必須修改它已經生成的內容。
相關規格皆直接來自規格卡:總參數 160 億(不含嵌入層),透過 256 位專家組成的 MoE,每 token 啟用 14 億參數,每次路由 8 位專家;共 20 層、16 個注意力頭、4 個 KV 頭;詞彙量達 157,184 個 token;採用旋轉位置嵌入;並支援 128K 上下文視窗。一種名為 Block Routing 的技術會在擴散區塊層級限制哪些專家被觸發,這正是該模型能在單張消費級 GPU 上維持 128K 上下文可行性的關鍵。規格卡將它定位為需要 24GB 以上顯示卡的模型,並建議以 SGLang 作為長上下文代理型工作負載的服務後端。

以上是該版本在家族時間軸中的定位——也就是讓「LLaDA2.2-mini」得以被理解的譜系。LLaDA2.0 於 2025 年 11 月成為首個擴展至一千億參數的擴散語言模型;LLaDA2.1 於 2026 年 2 月加入了 token 編輯功能,以加速文字擴散;2026 年 7 月的 LLaDA2.2 世代,與 LLaDA2.2-flash 及其技術報告一同發布,將整個系列指向了智能體。mini 是該世代中直到現在仍停留在承諾階段的那一塊:關於 7 月發布的報導已提到一個更輕量的 16B flash 變體,用於更經濟的部署,但獨立的權重直到 9 月 5 日才真正落地。
卡片上的數字,標示出它們分別代表什麼
模型卡上的基準測試表是 inclusionAI 自家的結果,是在權重上線當天公布的,至今沒有任何獨立實驗室複現過其中任何數據——Artificial Analysis 沒有收錄 LLaDA2.2-mini,我們也找不到任何第三方跑分。請把這些數字視為廠商帶有方向性的宣稱,而非實測事實。在這個前提下,模型卡講述的故事是一致的:LLaDA2.2-mini 是 agentic 與長上下文方面的專家,而它是靠犧牲一些通用基準分數換來這些能力的。
• 智能體平均 — 59.00,來自 τ²-Bench 57.50、Claw-Eval 57.16 與 PinchBench 62.33(供應商回報)。
• 函式呼叫 — 在 BFCL v4 上為 47.68,較 LLaDA2.0-mini 的 25.05 與 LLaDA2.1-mini 的 28.44 有所提升;在較舊的 BFCL v3 上則為 69.02。
• 長上下文 — 在 LongBench v2 上獲得 34.99 分,是先前 mini 版本所取得的 15.51 與 12.13 兩倍以上,這就是 128K 視窗所帶來的具體成果。
• 一般 — 綜合平均 46.47,其中 AIME 2026 為 35.05,OlympiadBench 61.11,LiveCodeBench v6 28.14,GPQA-Diamond 44.41,IFBench 24.93 — 其中幾項略低於先前的 mini 版本,明顯是將訓練預算投入代理行為(agentic behavior)所付出的可見代價。

最後這點值得細想,因為這正是團隊選擇此模型,而不是選擇紙面上更強的通用模型的誠實理由。LLaDA2.2-mini 並不宣稱自己是數學或指令遵循方面最好的小型模型;它宣稱的是,它擅長擴散模型以往一直不擅長的事——持續、多輪、使用工具的工作——同時把有效參數數量壓低到在單張 GPU 上仍有實際意義的程度。BFCL v4 的躍升與 LongBench v2 的躍升,就是在這張規格表大體可信的前提下,能經得起獨立評測的數字。
執行它,以及缺失的鷹架。
理論上,執行 LLaDA2.2-mini 的步驟相當直接,因為此版本原生支援 Transformers:模型卡顯示可使用 AutoModelForCausalLM 與 trust_remote_code=True 在 transformers ≥ 5.2.0 上載入,接著以擴散專用參數呼叫 generate——區塊長度 32 與溫度 0.0 是建議的預設值,且模型卡建議多數查詢使用 32,768 token 的輸出長度。針對 agentic(代理式)長上下文服務,它指向 SGLang;中國大陸使用者則可使用 ModelScope 鏡像。目前尚不存在的是周邊生態系:任何我們能查證的供應商皆未提供託管 API,也找不到任何 GGUF 建置,而框架支援仍在演進中——社群針對 llama.cpp 的 LLaDA2 架構開發是最近的事,因此量化(quantization)支援仍然薄弱。
這種組合——一種真正全新的解碼範式,才剛出現一天、且僅限自架——正是路由層足以證明自身價值、又不必假裝新模型已可上線生產的情境。負責任地試用 LLaDA2.2-mini 的方法,是讓你在測試路徑上自行運行,而生產環境繼續留在成熟模型上;這正是 OrcaRouter 的配置用途:以供應商列表價格、0% 加成,透過單一 API 串接 200 多個模型;自動故障轉移使才一天大的檢查點即使停滯,也不會拖垮工作流程;路由 DSL 則能在單一金鑰背後,將自架的擴散呼叫與託管式自迴歸模型組合編排。當——如果——有供應商將 LLaDA2.2-mini 上架,同樣的直通計價也適用,你看到的價格就是供應商自己的價格。在那之前,誠實的可用性說法是:請從 Hugging Face 或 ModelScope 下載 Apache-2.0 權重,然後自行運行。
接下來要看什麼
要把這個「到目前為止已知的一切」變成一個真正的故事,需要三件事,但這三件事今天全都缺席。首先,要有官方公告:如果 LLaDA2.2-flash 的模式成立,那麼在 repo 靜默發布之後,可能會有發布文章以及技術報告的相關報導出現,而且很可能會補充技術卡上省略的訓練細節。其次,要有獨立實測:agentic 平均 59.00 分與 BFCL v4 的 47.68 分是最值得重現的宣稱,因為 agentic 基準正是評估框架的選擇對分數影響最大的地方。第三,要有服務部署的成熟度:SGLang 服務指南、vLLM 的路徑,以及社群製作的量化版本,能告訴你 1.4B-active 的資源佔用在實際營運上是否真的如規格表所暗示的那麼便宜。這些在 9 月 6 日都還不存在。權重是真的,授權是寬鬆的,而這個架構確實是執行智慧體的另一種方式——但證明它是個好智慧體,目前仍只是一家廠商的卡片。
