文章〈LLaDA-Image-Turbo — 安靜出貨〉的標題卡片,附帶一個藍色徽章寫著「已出貨 — 未公告」,副標題為「螞蟻集團的 inclusionAI 於 2026 年 9 月 4 日釋出權重。沒有發布文章,也還沒有授權條款。」三個標籤分別為「實驗室:inclusionAI(螞蟻集團)」、「發布日期:2026 年 9 月 4 日」及「取樣:4 步」,以及兩張並排卡片——一張藍色邊框卡片,標題為「已出貨內容」,內文為「LLaDA-Image Base + LLaDA-Image-Turbo,BF16 與 FP8,位於 Hugging Face」;另一張白色卡片,標題為「缺少的內容」,內文為「沒有公告、沒有授權、尚無 Turbo 基準測試」。右下角合成有 OrcaRouter 標誌。
Guides & Insights

LLaDA-Image-Turbo:蚂蚁集团悄然发布4步开源图像生成器

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月4日,螞蟻集團的開源實驗室 inclusionAI 在 Hugging Face 上發布了 LLaDA-Image-Turbo 和 LLaDA-Image 的權重,沒有發布文章,沒有新聞稿,而且——截至本文撰寫時——在它所建立的四個儲存庫中也都沒有宣告任何授權條款。LLaDA-Image-Turbo 是這次發布中的快速成員:這是一個蒸餾檢查點,模型卡說明它只需四個取樣步驟就能將提示詞或編輯指令轉換成 1024×1024 的圖像,相較之下,它所從中蒸餾而來的 LLaDA-Image Base 模型則需要五十步。讓這場悄無聲息的發布值得一讀的,是模型卡中一行由廠商自行回報的內容——在 Qwen-Image-Bench 上達到開源模型中的最先進水準——而讓它難以據以行動的,則是圍繞那行內容、這次發布尚未說明的種種細節。

這是一份第一天報告,不是評測。檢查點真實存在且可下載,基於 Diffusers 的推論程式碼可直接從克隆下來的儲存庫執行,輔助論文《LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes》也已於 2026 年 9 月 3 日上傳至 arXiv。但目前沒有 inclusionAI 或 Ant Group 的公告可供對照;截至撰寫本文時,LLaDA-Image-Turbo 儲存庫僅顯示兩個下載次數——從一切可見的指標來看,實驗室以外的任何人都還沒有真正執行過它。以下內容據此分為幾個部分:儲存庫實際包含了什麼、論文宣稱了什麼,以及在 LLaDA-Image-Turbo 成為生產團隊該押注的項目之前,必須先發生哪些事情。

實際發佈的內容

2026年9月4日凌晨(UTC),四個 checkpoint 在 Hugging Face 上線,歸屬於 inclusionAI 組織:LLaDA-Image(BF16 的五十步 Base 模型)、LLaDA-Image-FP8、LLaDA-Image-Turbo(蒸餾快速 checkpoint,BF16)以及 LLaDA-Image-Turbo-FP8。模型卡上的新聞行(日期為 2026-09-04)即為全部正式公告:「我們發布了 LLaDA-Image Base 和 Turbo checkpoints,並附上推理程式碼。」同一組織下的 GitHub 儲存庫包含推理程式碼,而 arXiv 報告則在前一天出現。

這些儲存庫不是空殼。每個 Turbo 儲存庫都包含完整的 Diffusers 管線——一個分片的擴散 Transformer 生成器、一個 SigVQ 影像 tokenizer、一個 query-former 連接器、一個排程器,以及一個九分片文字編碼器——所以這裡所說的「模型」不是一個佔位名稱,而是數十 GB 可執行的權重。該系列被描述為一個 60 億參數的影像生成與編輯模型;嚴格來說,60 億這個數字是指從頭訓練的擴散 Transformer 主幹,而來自該實驗室 LLaDA2 系列的一個凍結擴散語言模型模組(即九分片文字編碼器)則在上層增添了理解能力。

A screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo (captured September 4, 2026), showing the model name, the inclusionAI organization, the tags for text-to-image, Diffusers, Safetensors, English and Chinese, and a right-hand sidebar reading 7B params, BF16, and 'This model isn't served by any Inference Providers' — with the start of the LLaDA-Image model card below.

為什麼四步驟的部分是標題?

對於影像擴散模型而言,成本主要來自取樣步數。每一步都等於對網路做一次完整的前向傳遞,因此在考量解析度、批次大小、硬體等其他因素之前,五十步模型與四步模型之間的差異,就已使每張影像的運算量相差約一個數量級。這正是本次發佈中「Turbo」系列的核心意義。inclusionAI 以稱為 Twin-DMD 的技術,將 LLaDA-Image 蒸餾為 LLaDA-Image-Turbo;蒸餾後的檢查點只需二至四步即可執行,官方建議四步,引導尺度為 1.0,而 Base 模型則為 5.0。相同的 pipeline 物件、相同的提示詞、相同的 1024×1024 輸出——但去噪步驟只剩一小部分。

這裡對蒸餾影像模型存在標準的疑慮,而在這個案例中比平常更為明顯:蒸餾是以些許保真度換取速度,而 inclusionAI 完全沒有公布 LLaDA-Image-Turbo 的任何基準數據。模型卡中的 Qwen-Image-Bench 分數屬於五十步的 Base 檢查點。因此,LLaDA-Image-Turbo 在四步與 LLaDA-Image 在五十步之間的實際品質差距,既沒有供應商的量化數據,也尚未經其他任何人測試——這使得「Turbo」成為一項你只能透過實際運行才能驗證的速度宣稱。

一個同時負責生成與編輯的檢查點

此系列在架構上的賭注是統一化:單一一組權重同時處理文生圖、VQ 條件式生成、參考圖像編輯,以及中英文文字渲染——沒有獨立的編輯骨幹,這正是此次釋出中「編輯」那一半並未以獨立模型形式推出的原因。在編輯模式下,參考圖像會繞過語言模組,直接注入擴散模型,而語言模組僅處理指令;模型卡聲稱能在精確的視覺變更下忠實保留內容,同時實現照片級真實的生成效果,以及兩種語言中乾淨排版文字。

有兩個技術細節即便在第一天也值得記下。生成器是一個從零開始訓練的 6B 擴散 Transformer,採用無參數 RMSNorm 與 Muon 優化器——這些是論文詳實交代而非輕輕帶過的細節。而論文中的訓練敘事,是對常見圖像-文字配方的一次刻意反轉:先以純圖像的預訓練與中期訓練建立強大的視覺先驗,隨後實驗室才引入成對語言監督與聯合生成-編輯訓練。這樣的順序——加上論文標題中的「Fully Open Training Recipes」——正是研究上的亮點。值得注意的是,論文表述與 Hugging Face 發布計畫之間存在落差:權重與推論程式碼已勾選完成,訓練程式碼卻仍標示為「coming soon」。

A single-column infographic titled 'LLaDA-Image-Turbo — the scoreboard' with rows reading 'Release: Sep 4, 2026 — weights + inference code, no announcement', 'Sampling: 4 steps (Twin-DMD distilled; 2-4 supported)', 'Backbone: 6B DiT + frozen LLaDA2-family text module', 'Modes: text-to-image, VQ-conditioned, editing, EN/ZH text', 'Qwen-Image-Bench: 53.53 EN / 53.38 ZH (Base checkpoint)', 'Access: BF16 + FP8 on Hugging Face; no license declared'. A footer reads 'Benchmark vendor-reported and measured on the Base model; Turbo scores not yet published.' The OrcaRouter logo is composited in the bottom-right corner.

解讀 53.53 / 53.38 的說法

會被廣為流傳的數字是基準線:在 Qwen-Image-Bench(一個分設英文與中文軌道的文生圖基準)上,inclusionAI 報告 LLaDA-Image 在英文軌道整體得分 53.53、中文軌道得分 53.38,並稱這在兩條軌道上都是開源模型的新 state-of-the-art。若精確地讀它,就會浮現三個限制。該數字是廠商自行回報的,出自實驗室自己的評估,而且尚未被任何地方複現。它屬於五十步版本的 LLaDA-Image Base 模型,而不是 LLaDA-Image-Turbo——後者才是這次發布名義上的重點 checkpoint。再者,「開源 state-of-the-art」是一個每個月都會變動的類別;它宣稱的是模型在開源同儕之間的相對位置,而不是在閉源前沿面前的相對位置。

這張圖表真正告訴你的是,這個模型家族為何存在。一個中英雙語的文字轉圖像與編輯模型,在開放基準測試的兩條賽道上都名列前茅,擺明了就是瞄準快速演進的開放圖像模型市場——正是 Qwen-Image 家族檢查點,以及絡繹不絕的其他開放權重,一直在這個領域引領步伐。如果 LLaDA-Image-Turbo 能以四步生成重現基礎模型的大部分品質,它就會躋身運行成本最低、且背後有可信品質背書的開放圖像模型之列。這句話的關鍵,全在「如果」二字。

那些讓安靜的船艦無法啟航的間隙

• 一則公告。模型卡上 2026-09-04 那一行是廠商唯一的表態。沒有 inclusionAI 的部落格文章、沒有 Ant Group 的新聞稿、沒有社群貼文,除了聚合器之外也沒有任何媒體報導——這本身就是一個值得正視而非粉飾的信號。

• 授權。四個 Hugging Face 儲存庫皆未帶有授權標籤,GitHub 儲存庫也沒有 LICENSE 檔案——只有一份 LEGAL.md 雙語說明,指稱程式碼中的中文註解優先於翻譯後的註解。在未宣告授權的情況下,你無法假定自己對這些權重擁有商業使用權利,無論論文標題聽起來多「開放」。對任何商業用途而言,這是第一個問題,而目前尚無答案。

• Turbo 數據。針對 LLaDA-Image-Turbo,目前尚未公佈任何基準測試、延遲或品質數據。上方的記分板是基礎模型的;蒸餾檢查點是一項未經量化的宣稱,有待供應商或獨立運行填入數據。

• 獨立驗證與託管存取。下載數與按讚數都只在個位數,沒有獨立的複現結果,而且我們能找到的任何推論供應商——包括 OrcaRouter——都尚未提供此模型的服務。目前它只是 Hugging Face 上的權重,除此之外什麼也不是。

該拿一艘一天的安靜船怎麼辦?

如果您是研究者或自行架設(self-host)環境的團隊,這是本週值得 clone 下來執行的版本:開放權重、單一 Diffusers 管線、BF16 與 FP8 兩種變體可在記憶體與品質之間取捨,還有一篇論文,早在訓練程式碼正式釋出之前,就先說明瞭它是如何被訓練的。如果您的用途屬於商業性質,授權上的落差必須優先考量——一個只需四步的影像模型,就算品質宣稱再怎麼有說服力,也不值得冒法律風險;負責任的做法是先在自己的 GPU 上評估,等授權條款明確之後,再讓它接近任何產品。

有四件事能讓這艘沉寂的船艦變成值得打造的發射平台,但截至2026年9月4日,沒有一件發生:

• 來自 inclusionAI 或 Ant Group 的真實公告,需指明該系列名稱及其條款。

• 在儲存庫上宣告授權 — Apache-2.0 能符合實驗室更廣泛的開放權重做法,並排除商業使用的障礙。

• 已發布的 LLaDA-Image-Turbo 分數,或對 Base 模型在 Qwen-Image-Bench 結果的獨立重現。

• 由託管供應商採用後,模型才開始有每張圖片的定價,並成為路由 API 能在單次呼叫中直接提供給你的東西。

An infographic titled 'Turning a quiet ship into a launch' with four numbered rows reading '1. An official inclusionAI or Ant Group announcement', '2. A declared license on the repositories', '3. Published LLaDA-Image-Turbo scores or an independent reproduction', '4. A hosted provider starts serving it'. A footer reads 'None has happened as of Sep 4, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

當那最後的信號觸發——如果真的觸發——定價的計算很簡單:供應商設定標價,而一個路由 API 以 0% 加價率直接傳遞供應商的標價,正是讓該價格當天就在您這端維持有效的原因,無需重新談判,也無需第二份合約。但對 LLaDA-Image-Turbo 而言,那一天尚未到來,這篇文章中的任何內容都不應被解讀成那一天已經降臨。如今,誠實的總結很短:一個嚴肅的實驗室悄悄地推出了一個嚴肅的開源圖像模型,帶有真實的品質宣稱,以及數個懸而未決的問題;而要找出該宣稱的哪些部分經得起現實考驗,最快的方法就是親自執行這四個步驟的檢查點。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube