
LLaDA-Image-Turbo:蚂蚁集团悄然发布4步开源图像生成器
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1542智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
2026年9月4日,螞蟻集團的開源實驗室 inclusionAI 在 Hugging Face 上發布了 LLaDA-Image-Turbo 和 LLaDA-Image 的權重,沒有發布文章,沒有新聞稿,而且——截至本文撰寫時——在它所建立的四個儲存庫中也都沒有宣告任何授權條款。LLaDA-Image-Turbo 是這次發布中的快速成員:這是一個蒸餾檢查點,模型卡說明它只需四個取樣步驟就能將提示詞或編輯指令轉換成 1024×1024 的圖像,相較之下,它所從中蒸餾而來的 LLaDA-Image Base 模型則需要五十步。讓這場悄無聲息的發布值得一讀的,是模型卡中一行由廠商自行回報的內容——在 Qwen-Image-Bench 上達到開源模型中的最先進水準——而讓它難以據以行動的,則是圍繞那行內容、這次發布尚未說明的種種細節。
這是一份第一天報告,不是評測。檢查點真實存在且可下載,基於 Diffusers 的推論程式碼可直接從克隆下來的儲存庫執行,輔助論文《LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes》也已於 2026 年 9 月 3 日上傳至 arXiv。但目前沒有 inclusionAI 或 Ant Group 的公告可供對照;截至撰寫本文時,LLaDA-Image-Turbo 儲存庫僅顯示兩個下載次數——從一切可見的指標來看,實驗室以外的任何人都還沒有真正執行過它。以下內容據此分為幾個部分:儲存庫實際包含了什麼、論文宣稱了什麼,以及在 LLaDA-Image-Turbo 成為生產團隊該押注的項目之前,必須先發生哪些事情。
實際發佈的內容
2026年9月4日凌晨(UTC),四個 checkpoint 在 Hugging Face 上線,歸屬於 inclusionAI 組織:LLaDA-Image(BF16 的五十步 Base 模型)、LLaDA-Image-FP8、LLaDA-Image-Turbo(蒸餾快速 checkpoint,BF16)以及 LLaDA-Image-Turbo-FP8。模型卡上的新聞行(日期為 2026-09-04)即為全部正式公告:「我們發布了 LLaDA-Image Base 和 Turbo checkpoints,並附上推理程式碼。」同一組織下的 GitHub 儲存庫包含推理程式碼,而 arXiv 報告則在前一天出現。
這些儲存庫不是空殼。每個 Turbo 儲存庫都包含完整的 Diffusers 管線——一個分片的擴散 Transformer 生成器、一個 SigVQ 影像 tokenizer、一個 query-former 連接器、一個排程器,以及一個九分片文字編碼器——所以這裡所說的「模型」不是一個佔位名稱,而是數十 GB 可執行的權重。該系列被描述為一個 60 億參數的影像生成與編輯模型;嚴格來說,60 億這個數字是指從頭訓練的擴散 Transformer 主幹,而來自該實驗室 LLaDA2 系列的一個凍結擴散語言模型模組(即九分片文字編碼器)則在上層增添了理解能力。

為什麼四步驟的部分是標題?
對於影像擴散模型而言,成本主要來自取樣步數。每一步都等於對網路做一次完整的前向傳遞,因此在考量解析度、批次大小、硬體等其他因素之前,五十步模型與四步模型之間的差異,就已使每張影像的運算量相差約一個數量級。這正是本次發佈中「Turbo」系列的核心意義。inclusionAI 以稱為 Twin-DMD 的技術,將 LLaDA-Image 蒸餾為 LLaDA-Image-Turbo;蒸餾後的檢查點只需二至四步即可執行,官方建議四步,引導尺度為 1.0,而 Base 模型則為 5.0。相同的 pipeline 物件、相同的提示詞、相同的 1024×1024 輸出——但去噪步驟只剩一小部分。
這裡對蒸餾影像模型存在標準的疑慮,而在這個案例中比平常更為明顯:蒸餾是以些許保真度換取速度,而 inclusionAI 完全沒有公布 LLaDA-Image-Turbo 的任何基準數據。模型卡中的 Qwen-Image-Bench 分數屬於五十步的 Base 檢查點。因此,LLaDA-Image-Turbo 在四步與 LLaDA-Image 在五十步之間的實際品質差距,既沒有供應商的量化數據,也尚未經其他任何人測試——這使得「Turbo」成為一項你只能透過實際運行才能驗證的速度宣稱。
一個同時負責生成與編輯的檢查點
此系列在架構上的賭注是統一化:單一一組權重同時處理文生圖、VQ 條件式生成、參考圖像編輯,以及中英文文字渲染——沒有獨立的編輯骨幹,這正是此次釋出中「編輯」那一半並未以獨立模型形式推出的原因。在編輯模式下,參考圖像會繞過語言模組,直接注入擴散模型,而語言模組僅處理指令;模型卡聲稱能在精確的視覺變更下忠實保留內容,同時實現照片級真實的生成效果,以及兩種語言中乾淨排版文字。
有兩個技術細節即便在第一天也值得記下。生成器是一個從零開始訓練的 6B 擴散 Transformer,採用無參數 RMSNorm 與 Muon 優化器——這些是論文詳實交代而非輕輕帶過的細節。而論文中的訓練敘事,是對常見圖像-文字配方的一次刻意反轉:先以純圖像的預訓練與中期訓練建立強大的視覺先驗,隨後實驗室才引入成對語言監督與聯合生成-編輯訓練。這樣的順序——加上論文標題中的「Fully Open Training Recipes」——正是研究上的亮點。值得注意的是,論文表述與 Hugging Face 發布計畫之間存在落差:權重與推論程式碼已勾選完成,訓練程式碼卻仍標示為「coming soon」。

解讀 53.53 / 53.38 的說法
會被廣為流傳的數字是基準線:在 Qwen-Image-Bench(一個分設英文與中文軌道的文生圖基準)上,inclusionAI 報告 LLaDA-Image 在英文軌道整體得分 53.53、中文軌道得分 53.38,並稱這在兩條軌道上都是開源模型的新 state-of-the-art。若精確地讀它,就會浮現三個限制。該數字是廠商自行回報的,出自實驗室自己的評估,而且尚未被任何地方複現。它屬於五十步版本的 LLaDA-Image Base 模型,而不是 LLaDA-Image-Turbo——後者才是這次發布名義上的重點 checkpoint。再者,「開源 state-of-the-art」是一個每個月都會變動的類別;它宣稱的是模型在開源同儕之間的相對位置,而不是在閉源前沿面前的相對位置。
這張圖表真正告訴你的是,這個模型家族為何存在。一個中英雙語的文字轉圖像與編輯模型,在開放基準測試的兩條賽道上都名列前茅,擺明了就是瞄準快速演進的開放圖像模型市場——正是 Qwen-Image 家族檢查點,以及絡繹不絕的其他開放權重,一直在這個領域引領步伐。如果 LLaDA-Image-Turbo 能以四步生成重現基礎模型的大部分品質,它就會躋身運行成本最低、且背後有可信品質背書的開放圖像模型之列。這句話的關鍵,全在「如果」二字。
那些讓安靜的船艦無法啟航的間隙
• 一則公告。模型卡上 2026-09-04 那一行是廠商唯一的表態。沒有 inclusionAI 的部落格文章、沒有 Ant Group 的新聞稿、沒有社群貼文,除了聚合器之外也沒有任何媒體報導——這本身就是一個值得正視而非粉飾的信號。
• 授權。四個 Hugging Face 儲存庫皆未帶有授權標籤,GitHub 儲存庫也沒有 LICENSE 檔案——只有一份 LEGAL.md 雙語說明,指稱程式碼中的中文註解優先於翻譯後的註解。在未宣告授權的情況下,你無法假定自己對這些權重擁有商業使用權利,無論論文標題聽起來多「開放」。對任何商業用途而言,這是第一個問題,而目前尚無答案。
• Turbo 數據。針對 LLaDA-Image-Turbo,目前尚未公佈任何基準測試、延遲或品質數據。上方的記分板是基礎模型的;蒸餾檢查點是一項未經量化的宣稱,有待供應商或獨立運行填入數據。
• 獨立驗證與託管存取。下載數與按讚數都只在個位數,沒有獨立的複現結果,而且我們能找到的任何推論供應商——包括 OrcaRouter——都尚未提供此模型的服務。目前它只是 Hugging Face 上的權重,除此之外什麼也不是。
該拿一艘一天的安靜船怎麼辦?
如果您是研究者或自行架設(self-host)環境的團隊,這是本週值得 clone 下來執行的版本:開放權重、單一 Diffusers 管線、BF16 與 FP8 兩種變體可在記憶體與品質之間取捨,還有一篇論文,早在訓練程式碼正式釋出之前,就先說明瞭它是如何被訓練的。如果您的用途屬於商業性質,授權上的落差必須優先考量——一個只需四步的影像模型,就算品質宣稱再怎麼有說服力,也不值得冒法律風險;負責任的做法是先在自己的 GPU 上評估,等授權條款明確之後,再讓它接近任何產品。
有四件事能讓這艘沉寂的船艦變成值得打造的發射平台,但截至2026年9月4日,沒有一件發生:
• 來自 inclusionAI 或 Ant Group 的真實公告,需指明該系列名稱及其條款。
• 在儲存庫上宣告授權 — Apache-2.0 能符合實驗室更廣泛的開放權重做法,並排除商業使用的障礙。
• 已發布的 LLaDA-Image-Turbo 分數,或對 Base 模型在 Qwen-Image-Bench 結果的獨立重現。
• 由託管供應商採用後,模型才開始有每張圖片的定價,並成為路由 API 能在單次呼叫中直接提供給你的東西。

當那最後的信號觸發——如果真的觸發——定價的計算很簡單:供應商設定標價,而一個路由 API 以 0% 加價率直接傳遞供應商的標價,正是讓該價格當天就在您這端維持有效的原因,無需重新談判,也無需第二份合約。但對 LLaDA-Image-Turbo 而言,那一天尚未到來,這篇文章中的任何內容都不應被解讀成那一天已經降臨。如今,誠實的總結很短:一個嚴肅的實驗室悄悄地推出了一個嚴肅的開源圖像模型,帶有真實的品質宣稱,以及數個懸而未決的問題;而要找出該宣稱的哪些部分經得起現實考驗,最快的方法就是親自執行這四個步驟的檢查點。
