用於比較 Qwen-Image 2.1 與 LLaDA-Image-Turbo 的主視覺卡片,對比 Qwen 僅限研究用途的授權條款與 LLaDA-Image-Turbo 未明示的授權條款,並將 40 步的 7B 擴散 Transformer 對上 4 步的 6B 蒸餾模型
Guides & Insights

Qwen-Image 2.1 對比 LLaDA-Image-Turbo:兩個開源圖像模型,兩種截然不同的授權條款

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩款開放權重影像模型在同一段三週期間內相繼問世。Qwen-Image 團隊發布了Qwen-Image 2.1於 2026 年 9 月 20 日——權重、授權檔案、模型卡與一篇部落格文章,全都在同一天推出,事前幾乎沒有任何預熱。十六天前,也就是 2026 年 9 月 4 日,inclusionAI(Ant Group 的研究實驗室)發布了LLaDA-Image-Turbo,沒有發布貼文、沒有新聞稿,也沒有任何形式的公告。如今兩者皆可下載。兩者都沒有任何一項獨立的基準測試分數。而真正決定你能使用哪一個的差異,並不在任何一份模型卡中——而是在文書作業裡。Qwen-Image 2.1 以研究授權發布,徹底禁止商業使用。LLaDA-Image-Turbo 則在其所有儲存庫上完全未宣告任何授權。

授權問題必須先處理,因為它是唯一有明確答案的問題。

從這裡開始,因為這份比較中其他的一切都是暫定的,而這一點並非如此。

Qwen-Image 2.1依 2026 年 9 月 20 日的 Qwen 研究授權協議發布,該協議授予的權利為「僅限非商業用途」,並載明商業使用須另行向供應商申請授權。這與先前以 Apache 2.0 發布的 Qwen-Image 系列相比,是一項重大變更。這點無庸置疑:你可以閱讀它、評估它、對其進行基準測試,並撰寫相關文章。但你不能把它放進產品裡。

LLaDA-Image-Turbo完全沒有宣告任何授權條款。不是寬鬆授權,也不是限制性授權,更不是佔位符。沒有授權條款的儲存庫,在任何法律意義上都不是「可免費使用」——它預設為保留所有權利,這比 Qwen 的研究授權更嚴格,而非更寬鬆。如果你打算以此為基礎進行開發,那是實驗室的問題,不是 README 的問題。

諷刺的是,這一點值得直說:那個問世時附帶正式且限制性授權條款的模型,反而是你今天能夠據以規劃的,因為你清楚知道自己的處境。沒有授權條款的那個模型,則是你無法據以規劃的。

Screenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

這兩個模型實際上究竟是什麼

撇開授權不談,這確實是兩款截然不同的設計,出於不同原因而打造。

架構 — Qwen-Image 2.1 是具備 32 層的單流擴散 Transformer,其視覺生成元件擁有 7B 參數,搭配 Qwen3-VL 8B 文字編碼器,以及具備 16× 空間壓縮的 64 通道 RGBA VAE,整個套件約 33 GB。LLaDA-Image-Turbo 則是 6B 的統一生成與編輯模型——以一組權重同時完成這兩項工作,而非一個基礎模型外加一條獨立的編輯路徑。

推理步數 — Qwen-Image 2.1 預設為 2048×2048、40 步,採用流匹配與 Euler 離散排程。LLaDA-Image-Turbo 透過 Twin-DMD 蒸餾至 2–4 步,建議使用 4 步,並以引導尺度 1.0 執行,相對於 Base 模型的 5.0。

精度選項 — Qwen-Image 2.1 透過其 vLLM-Omni 路徑發布 FP8 量化支援。LLaDA-Image-Turbo 以個別下載的形式提供 BF16 與 FP8 檢查點。

參考圖條件控制 — Qwen-Image 2.1 最多可接受 10 張參考圖,支援以圈選、塗繪標註或獨立遮罩進行局部編輯,並能生成原生 RGBA 與透明圖層編輯。LLaDA-Image-Turbo 的模型卡並未公布參考圖數量上限。

注意力 — Qwen-Image 2.1 採用區塊因果注意力:文字使用詞元層級的因果遮罩,圖像生成則使用區塊層級的雙向遮罩,並在檢查點帶有 causal_condition: true 時重複使用前綴 KV 快取。LLaDA-Image-Turbo 的模型卡並未以同樣的細節描述其遮罩機制。

授權——僅限研究且明確聲明,對比未聲明者。

注意步數與參數量共同代表的意義。Qwen-Image 2.1 是一個更大的模型,執行的步數多十倍;LLaDA-Image-Turbo 則是較小的模型,被蒸餾到只需少數幾步。這兩者是在押注圖像生成成本落於何處的相反賭注,而正確答案完全取決於你的瓶頸是每張圖的 GPU 秒數,還是圖像外觀所能達到的上限。

速度經濟學:40 步對 4 步

Turbo 這個名稱在這裡確實名副其實。Twin-DMD 蒸餾把擴散軌跡壓縮成少數幾次大幅跳躍,這正是 LLaDA-Image-Turbo 能在 4 步內執行的原因,而它的 Base 模型則需要傳統的排程。在 guidance 1.0 時,它也會略過無分類器引導,而這通常會讓每步的前向傳遞次數加倍——因此實際差距比單看 40 對 4 所暗示的還要更大。

這麼做能為你換來的是吞吐量與可預測性。一個 6B 模型在四步下,正是那種能裝進單張消費級顯示卡,且產生草稿影像的速度快到足以放進互動式迴圈裡的東西。Qwen-Image 2.1 在 40 步與 2048×2048 下,是品質優先的配置;模型卡本身對受限硬體的建議是 CPU 卸載,透過 pipe.enable_model_cpu_offload(),這只是權宜之計,而非真正的解決方案。

制衡之處在於,蒸餾是對能力的一種壓縮,而這裡的所有數字都沒有經過這兩間實驗室以外的任何人實測。兩個模型唯一存在的獨立數據點,是 Qwen 大使計畫中一位測試者對 Qwen-Image 2.1 的早期存取親測評論;他將最終權重跑在 ModelScope Studio 介面上,回報文生圖約需 10–15 秒、編輯約需 18–23 秒。那只是單一評論者的說法,用的是早期存取介面,也沒有顯示計時器——是有用的訊號,不是基準測試。LLaDA-Image-Turbo 則完全沒有任何可比的公開親測報告。

Two-column scoreboard for Qwen-Image 2.1 and LLaDA-Image-Turbo: Qwen rows read Release 20 Sept 2026 / Licence research-only, non-commercial / Architecture 32-layer DiT, 7B generation component / Steps 40 at 2048x2048 / Reference images up to 10 / Independent score none yet; LLaDA-Image-Turbo rows read Release 4 Sept 2026 / Licence undeclared on any repo / Architecture 6B unified gen+edit / Steps 2-4, recommended 4 / Reference images not published / Independent score none yet; footer reads 'Both sets of figures vendor-reported; neither model has an independent benchmark score.'

編輯是這兩種設計分歧最大的地方

這兩個模型都能進行文字轉圖像與編輯,但它們達成的方式不同,而差異體現在底層機制,而非輸出結果。

Qwen-Image 2.1 將指令遵循視為一個獨立、可檢視的元件。除了影像模型之外,此版本還包含兩個提示改寫檢查點——Qwen/Qwen-Image-2.1-PE-T2IQwen/Qwen-Image-2.1-PE-I2I,各自是微調過的 Qwen3.5-VL 9B、約 18.8 GB——它們會接收模糊的指令,並在擴散模型看到之前,將其改寫成明確無歧義的指令。I2I 變體一定帶有輸入影像,因此它永遠是編輯任務,絕不是從無到有的生成。至關重要的是,改寫器隨附了一份system_prompt.txt,你可以自行閱讀並覆寫,而且它對語言的說明異常明確:描述所用的語言會遵循你的指令,而繪製影像中的文字語言,則由一套嚴格的優先順序決定,即使你以另一種語言下提示,也會保留輸入影像既有的標籤語言。

這是個小小的工程環節,影響範圍卻很大。如果你正為包裝文字很重要的市場產出產品圖像,「改寫器會保留現有標籤語言」和「改寫器會很貼心地把所有內容翻譯成英文」之間的差別,就是素材可用還是被退件——而且因為它存在於系統提示中,而不是託管的黑箱裡,所以你可以對它進行 diff 並修改它。

LLaDA-Image-Turbo 做了相反的取捨:一個 6B 模型、一組權重,生成與編輯共享一切。更少的變動環節、更少的設定項目,也沒有任何可供檢視或覆寫的東西。它的模型卡引用 Qwen-Image-Bench 的數字:英文 53.53、中文 53.38,並宣稱達到開源 SOTA——由廠商自行回報、未經重現,而且請注意,它正在勝出的那個基準,是以它隱含競爭的模型來命名的。

你實際上會在哪裡執行它們

上線首日的生態系支援,是整個發布流程中最不光鮮亮麗的一環,卻也決定了你得花上一個下午,還是整個週末。

Qwen-Image 2.1 全面登場:一個 QwenImage21Pipeline 在首日即合併進 Diffusers;原生 ComfyUI 支援,附帶文字生圖與圖像編輯工作流程範本;vLLM-Omni 具備逐步執行、前綴 KV 快取、CUDA Graph 解碼、FP8 量化,以及張量/Ulysses 平行化;一份原生 SGLang 支援的 pull request 已於 9 月 17 日合併——權重早三天——涵蓋 DiT、RGBA VAE、Qwen3-VL 條件化與多參考輸入,並已在 H200、B200、RTX PRO 6000、RTX 5090 與 RTX 4090 上完成驗證;還有透過 LightX2V 搭配 AMD Radeon(經由 ROCm)實現的首日加速,以及透過 FlagOS 的多晶片支援。

LLaDA-Image-Turbo在 2026 年 9 月 7 日獲得 ComfyUI 支援,比權重發布晚三天,另外還有 Diffusers 與 Safetensors 發行版。這確實是一條能實際運行它的途徑,但這條路較為狹窄,而且沒有同等的前置發布推論服務工作可供佐證。

預先發布的 SGLang 拉取請求就是 Qwen-Image 2.1 的徵兆。框架支援比權重更早到位,意味著有人在對著檢查點測試服務路徑,而不是事後才照著模型卡來撰寫。

Screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo, showing the inclusionAI organisation, the model name and its Text-to-Image, Diffusers and Safetensors tags, and the opening of the model card describing LLaDA-Image as a unified model for high-quality image generation and editing

你與實驗一併保留的託管路徑

在撰寫本文時,這兩個模型都無法透過 OrcaRouter 進行路由,而本文也不會暗示並非如此——兩者都是自行託管的方案,一個採用不允許用於生產環境的授權條款,另一個則完全沒有任何授權。對正在評估它們的團隊而言,重要的是評估不必卡在關鍵路徑上。

OrcaRouter 以供應商定價、零加價,將 200 多個模型整合在單一 OpenAI 相容端點之後,並提供跨供應商的自動容錯移轉,以及一套路由 DSL,讓你將多個模型組合成單一次呼叫對這項決策而言,實際的做法是這樣一條路由:由你已經信任的模型承載正式流量,同時在旁測試一個自架的檢查點——而且因為是直接沿用定價而非加價,任何被路由模型的供應商價格變動,在我們這邊當天就會生效,不必等待合約修訂。我們目前確實有在路由的圖像模型,包括 OpenAIGPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。如果你打算花一週時間架起一個 33 GB 的擴散 Transformer,來確認它是否能勝過代管模型,代管模型就是對照組,而讓對照組早已掛在一組金鑰上,是值得的

什麼會改變這個比較?

三件事,按它們的重要性排序。

首先,是這兩個模型各自的獨立基準分數。兩者都沒有,而在情況改變之前,雙方所有的品質主張都只是實驗室在替自己的作業打分。第二,是授權:Qwen-Image 2.1 的寬鬆授權變體會讓它成為 7B 開放圖像工作中顯而易見的預設選擇,而 LLaDA-Image-Turbo 只要有宣布任何授權,至少就能讓人納入規劃。第三,Qwen 9 月 17 日 ModelScope 計畫的早期存取測試者,被要求在 9 月 29 日前——也就是距今八天——發表樣本或評論。那一刻起,這就不再是兩份模型卡的比較,而開始成為真正的比較。在那之前,誠實的總結是:Qwen-Image 2.1 是看起來能力更強、但你無法商業化的模型;LLaDA-Image-Turbo 是更快、但若沒有先談過就完全無法使用的模型;而授權檔案則是這兩個發布中唯一完全確定下來的部分。