
Qwen-Image 2.1 對比 LLaDA-Image-Turbo:兩個開源圖像模型,兩種截然不同的授權條款
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
兩款開放權重影像模型在同一段三週期間內相繼問世。Qwen-Image 團隊發布了Qwen-Image 2.1於 2026 年 9 月 20 日——權重、授權檔案、模型卡與一篇部落格文章,全都在同一天推出,事前幾乎沒有任何預熱。十六天前,也就是 2026 年 9 月 4 日,inclusionAI(Ant Group 的研究實驗室)發布了LLaDA-Image-Turbo,沒有發布貼文、沒有新聞稿,也沒有任何形式的公告。如今兩者皆可下載。兩者都沒有任何一項獨立的基準測試分數。而真正決定你能使用哪一個的差異,並不在任何一份模型卡中——而是在文書作業裡。Qwen-Image 2.1 以研究授權發布,徹底禁止商業使用。LLaDA-Image-Turbo 則在其所有儲存庫上完全未宣告任何授權。
授權問題必須先處理,因為它是唯一有明確答案的問題。
從這裡開始,因為這份比較中其他的一切都是暫定的,而這一點並非如此。
• Qwen-Image 2.1依 2026 年 9 月 20 日的 Qwen 研究授權協議發布,該協議授予的權利為「僅限非商業用途」,並載明商業使用須另行向供應商申請授權。這與先前以 Apache 2.0 發布的 Qwen-Image 系列相比,是一項重大變更。這點無庸置疑:你可以閱讀它、評估它、對其進行基準測試,並撰寫相關文章。但你不能把它放進產品裡。
• LLaDA-Image-Turbo完全沒有宣告任何授權條款。不是寬鬆授權,也不是限制性授權,更不是佔位符。沒有授權條款的儲存庫,在任何法律意義上都不是「可免費使用」——它預設為保留所有權利,這比 Qwen 的研究授權更嚴格,而非更寬鬆。如果你打算以此為基礎進行開發,那是實驗室的問題,不是 README 的問題。
諷刺的是,這一點值得直說:那個問世時附帶正式且限制性授權條款的模型,反而是你今天能夠據以規劃的,因為你清楚知道自己的處境。沒有授權條款的那個模型,則是你無法據以規劃的。

這兩個模型實際上究竟是什麼
撇開授權不談,這確實是兩款截然不同的設計,出於不同原因而打造。
• 架構 — Qwen-Image 2.1 是具備 32 層的單流擴散 Transformer,其視覺生成元件擁有 7B 參數,搭配 Qwen3-VL 8B 文字編碼器,以及具備 16× 空間壓縮的 64 通道 RGBA VAE,整個套件約 33 GB。LLaDA-Image-Turbo 則是 6B 的統一生成與編輯模型——以一組權重同時完成這兩項工作,而非一個基礎模型外加一條獨立的編輯路徑。
• 推理步數 — Qwen-Image 2.1 預設為 2048×2048、40 步,採用流匹配與 Euler 離散排程。LLaDA-Image-Turbo 透過 Twin-DMD 蒸餾至 2–4 步,建議使用 4 步,並以引導尺度 1.0 執行,相對於 Base 模型的 5.0。
• 精度選項 — Qwen-Image 2.1 透過其 vLLM-Omni 路徑發布 FP8 量化支援。LLaDA-Image-Turbo 以個別下載的形式提供 BF16 與 FP8 檢查點。
• 參考圖條件控制 — Qwen-Image 2.1 最多可接受 10 張參考圖,支援以圈選、塗繪標註或獨立遮罩進行局部編輯,並能生成原生 RGBA 與透明圖層編輯。LLaDA-Image-Turbo 的模型卡並未公布參考圖數量上限。
• 注意力 — Qwen-Image 2.1 採用區塊因果注意力:文字使用詞元層級的因果遮罩,圖像生成則使用區塊層級的雙向遮罩,並在檢查點帶有 causal_condition: true 時重複使用前綴 KV 快取。LLaDA-Image-Turbo 的模型卡並未以同樣的細節描述其遮罩機制。
• 授權——僅限研究且明確聲明,對比未聲明者。
注意步數與參數量共同代表的意義。Qwen-Image 2.1 是一個更大的模型,執行的步數多十倍;LLaDA-Image-Turbo 則是較小的模型,被蒸餾到只需少數幾步。這兩者是在押注圖像生成成本落於何處的相反賭注,而正確答案完全取決於你的瓶頸是每張圖的 GPU 秒數,還是圖像外觀所能達到的上限。
速度經濟學:40 步對 4 步
Turbo 這個名稱在這裡確實名副其實。Twin-DMD 蒸餾把擴散軌跡壓縮成少數幾次大幅跳躍,這正是 LLaDA-Image-Turbo 能在 4 步內執行的原因,而它的 Base 模型則需要傳統的排程。在 guidance 1.0 時,它也會略過無分類器引導,而這通常會讓每步的前向傳遞次數加倍——因此實際差距比單看 40 對 4 所暗示的還要更大。
這麼做能為你換來的是吞吐量與可預測性。一個 6B 模型在四步下,正是那種能裝進單張消費級顯示卡,且產生草稿影像的速度快到足以放進互動式迴圈裡的東西。Qwen-Image 2.1 在 40 步與 2048×2048 下,是品質優先的配置;模型卡本身對受限硬體的建議是 CPU 卸載,透過 pipe.enable_model_cpu_offload(),這只是權宜之計,而非真正的解決方案。
制衡之處在於,蒸餾是對能力的一種壓縮,而這裡的所有數字都沒有經過這兩間實驗室以外的任何人實測。兩個模型唯一存在的獨立數據點,是 Qwen 大使計畫中一位測試者對 Qwen-Image 2.1 的早期存取親測評論;他將最終權重跑在 ModelScope Studio 介面上,回報文生圖約需 10–15 秒、編輯約需 18–23 秒。那只是單一評論者的說法,用的是早期存取介面,也沒有顯示計時器——是有用的訊號,不是基準測試。LLaDA-Image-Turbo 則完全沒有任何可比的公開親測報告。

編輯是這兩種設計分歧最大的地方
這兩個模型都能進行文字轉圖像與編輯,但它們達成的方式不同,而差異體現在底層機制,而非輸出結果。
Qwen-Image 2.1 將指令遵循視為一個獨立、可檢視的元件。除了影像模型之外,此版本還包含兩個提示改寫檢查點——Qwen/Qwen-Image-2.1-PE-T2I與Qwen/Qwen-Image-2.1-PE-I2I,各自是微調過的 Qwen3.5-VL 9B、約 18.8 GB——它們會接收模糊的指令,並在擴散模型看到之前,將其改寫成明確無歧義的指令。I2I 變體一定帶有輸入影像,因此它永遠是編輯任務,絕不是從無到有的生成。至關重要的是,改寫器隨附了一份system_prompt.txt,你可以自行閱讀並覆寫,而且它對語言的說明異常明確:描述所用的語言會遵循你的指令,而繪製到影像中的文字語言,則由一套嚴格的優先順序決定,即使你以另一種語言下提示,也會保留輸入影像既有的標籤語言。
這是個小小的工程環節,影響範圍卻很大。如果你正為包裝文字很重要的市場產出產品圖像,「改寫器會保留現有標籤語言」和「改寫器會很貼心地把所有內容翻譯成英文」之間的差別,就是素材可用還是被退件——而且因為它存在於系統提示中,而不是託管的黑箱裡,所以你可以對它進行 diff 並修改它。
LLaDA-Image-Turbo 做了相反的取捨:一個 6B 模型、一組權重,生成與編輯共享一切。更少的變動環節、更少的設定項目,也沒有任何可供檢視或覆寫的東西。它的模型卡引用 Qwen-Image-Bench 的數字:英文 53.53、中文 53.38,並宣稱達到開源 SOTA——由廠商自行回報、未經重現,而且請注意,它正在勝出的那個基準,是以它隱含競爭的模型來命名的。
你實際上會在哪裡執行它們
上線首日的生態系支援,是整個發布流程中最不光鮮亮麗的一環,卻也決定了你得花上一個下午,還是整個週末。
• Qwen-Image 2.1 全面登場:一個 QwenImage21Pipeline 在首日即合併進 Diffusers;原生 ComfyUI 支援,附帶文字生圖與圖像編輯工作流程範本;vLLM-Omni 具備逐步執行、前綴 KV 快取、CUDA Graph 解碼、FP8 量化,以及張量/Ulysses 平行化;一份原生 SGLang 支援的 pull request 已於 9 月 17 日合併——比權重早三天——涵蓋 DiT、RGBA VAE、Qwen3-VL 條件化與多參考輸入,並已在 H200、B200、RTX PRO 6000、RTX 5090 與 RTX 4090 上完成驗證;還有透過 LightX2V 搭配 AMD Radeon(經由 ROCm)實現的首日加速,以及透過 FlagOS 的多晶片支援。
• LLaDA-Image-Turbo在 2026 年 9 月 7 日獲得 ComfyUI 支援,比權重發布晚三天,另外還有 Diffusers 與 Safetensors 發行版。這確實是一條能實際運行它的途徑,但這條路較為狹窄,而且沒有同等的前置發布推論服務工作可供佐證。
預先發布的 SGLang 拉取請求就是 Qwen-Image 2.1 的徵兆。框架支援比權重更早到位,意味著有人在對著檢查點測試服務路徑,而不是事後才照著模型卡來撰寫。

你與實驗一併保留的託管路徑
在撰寫本文時,這兩個模型都無法透過 OrcaRouter 進行路由,而本文也不會暗示並非如此——兩者都是自行託管的方案,一個採用不允許用於生產環境的授權條款,另一個則完全沒有任何授權。對正在評估它們的團隊而言,重要的是評估不必卡在關鍵路徑上。
OrcaRouter 以供應商定價、零加價,將 200 多個模型整合在單一 OpenAI 相容端點之後,並提供跨供應商的自動容錯移轉,以及一套路由 DSL,讓你將多個模型組合成單一次呼叫對這項決策而言,實際的做法是這樣一條路由:由你已經信任的模型承載正式流量,同時在旁測試一個自架的檢查點——而且因為是直接沿用定價而非加價,任何被路由模型的供應商價格變動,在我們這邊當天就會生效,不必等待合約修訂。我們目前確實有在路由的圖像模型,包括 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。如果你打算花一週時間架起一個 33 GB 的擴散 Transformer,來確認它是否能勝過代管模型,代管模型就是對照組,而讓對照組早已掛在一組金鑰上,是值得的。
什麼會改變這個比較?
三件事,按它們的重要性排序。
首先,是這兩個模型各自的獨立基準分數。兩者都沒有,而在情況改變之前,雙方所有的品質主張都只是實驗室在替自己的作業打分。第二,是授權:Qwen-Image 2.1 的寬鬆授權變體會讓它成為 7B 開放圖像工作中顯而易見的預設選擇,而 LLaDA-Image-Turbo 只要有宣布任何授權,至少就能讓人納入規劃。第三,Qwen 9 月 17 日 ModelScope 計畫的早期存取測試者,被要求在 9 月 29 日前——也就是距今八天——發表樣本或評論。那一刻起,這就不再是兩份模型卡的比較,而開始成為真正的比較。在那之前,誠實的總結是:Qwen-Image 2.1 是看起來能力更強、但你無法商業化的模型;LLaDA-Image-Turbo 是更快、但若沒有先談過就完全無法使用的模型;而授權檔案則是這兩個發布中唯一完全確定下來的部分。
