一張為文章《Qwen-Image 2.1 vs Qwen-Image 3.0》生成的主視覺卡片,畫面中有兩張圓角模型卡片,分別標示為「Qwen-Image 2.1」與「Qwen-Image 3.0」,並附有日期標記 2026年9月20日 與 2026年7月21日,其中一張帶有下載圖示,另一張則有雲端圖示,還有一條橫幅寫著「數字較小的是較新的模型」。
Guides & Insights

Qwen-Image 2.1 對上 Qwen-Image 3.0:數字較小的才是較新的模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

先從最讓人卡住的地方說起。Qwen-Image 2.1Qwen-Image 3.0還新。該廠商於 2026 年 7 月 21 日推出 Qwen-Image 3.0,並在 8 月 5 日正式全面上市。它則於 2026 年 9 月 20 日推出 Qwen-Image 2.1——晚了七週,而且次要版號還更低。這套編號並不是先後順序,而是兩條共用同一名稱的不同產品線;而關於這兩者,最有用的單一項事實是,它們在決定你能否在其上進行開發的關鍵問題上,採取了完全相反的立場。Qwen-Image 3.0 是封閉且代管的,沒有權重、沒有授權條款,也沒有技術報告。Qwen-Image 2.1 則是開放權重,今天即可下載,採用僅允許非商業用途的研究授權。

兩個碰巧同名的產品

Qwen-Image 系列在十四個月內已採取了三種截然不同的授權立場,而將它們一一列出,便能消除大部分的困惑:

Qwen-Image 1.0 與 2.0 — 於 Hugging Face 和 ModelScope 上以 Apache 2.0 開放權重,發表當日即釋出技術報告,可自行架設、可微調、可量化。

Qwen-Image 3.0 — 閉源。未釋出權重、未說明授權條款、沒有模型卡、沒有技術報告,也沒有公開的基準測試表。僅能透過代管 API 使用,分為 Pro 與 Standard 版本。

Qwen-Image 2.1 — 再次開放權重,但依據 2026 年 9 月 20 日的《Qwen 研究授權協議》,該協議授予的權利「僅限非商業用途」,商業用途則須另行協商授權條款。

把它讀成一種模式而非時間線,輪廓就清楚了:阿里巴巴不再把「開放」當成二元選項。Qwen-Image 2.1 既不是 1.0 與 2.0 那種寬鬆的發布,也不是 3.0 那種封閉的發布。它是第三種立場——權重可供檢視、執行與修改,前方卻加裝了一道商業閘門。

每個模型實際上是什麼

Qwen-Image 2.1 — 一款統一的文字生圖與影像編輯模型,其視覺生成元件具備 7B 參數,並以 32 層單流 DiT 架構打造。一旁搭配的是 Qwen3-VL 8B 文字編碼器,以及在 16× 空間壓縮下的 64 通道 RGBA VAE;完整下載檔案約 33 GB,其中文字編碼器就佔了一半以上。採用區塊因果注意力,文字使用 token 層級的因果遮罩,影像生成則使用分塊層級的雙向遮罩,並支援前綴 KV 快取重用,以進行多影像編輯。原生 2K,預設為 2048×2048、40 步,並提供七種長寬比預設。《/3》

Qwen-Image 3.0——一款封閉式託管模型,提供 Pro 與 Standard 版本,透過單一 API 同時實現影像生成與編輯。阿里巴巴的發布資料宣稱,提示詞可長達約 4,500 個 token、文字清晰可辨至約 10 像素,並涵蓋 12 種語言、20 多種字型,輸出最高可達 2048×2048,每次呼叫最多可生成六張影像。官方並未公布參數數量;廣為流傳的約 20B MMDiT 數字僅屬報導所述,而非已獲證實。

實務上最關鍵的架構差異不在於規模,而在於模型在哪裡執行,以及你能對它做什麼。Qwen-Image 2.1 以檔案形式推出,你可以檢視、量化、用私有資料微調,並在自己的硬體上執行,甚至早在權重正式發布的三天前,支援 SGLang 的 pull request 就已經合併了。Qwen-Image 3.0 則以端點形式提供。你無法對它量化,無法對它微調,也無法在阿里巴巴執行它的地方之外執行它。

編輯正是兩者分歧最劇烈之處

兩個模型都在單一系統中進行生成與編輯,因此有趣的比較在於編輯的具體細節——而在這方面,從帳面規格來看,較新、較小的模型反而能力更強。

參考圖片 — Qwen-Image 2.1 最多接受 10 個輸入參考。Qwen-Image 3.0 的 Pro 說明文件指出支援 1–3 張輸入圖片。

局部編輯控制——Qwen-Image 2.1 支援圓圈標記、手繪註解,以及以獨立輸入提供的個別遮罩,因此原始影像能保持未標記的狀態。Qwen-Image 3.0 記載的編輯路徑涵蓋局部重寫、內容擴展、風格轉移與多鏡頭視角生成,但並未公布以遮罩為基礎的工作流程。

透明度 — Qwen-Image 2.1 原生生成與編輯 RGBA 影像、編輯透明圖層內的文字,並能將 RGB 照片中的主體擷取至透明圖層。Qwen-Image 3.0 的發布公告並未提出任何透明度相關宣稱。

提示詞改寫 — Qwen-Image 2.1 隨附兩個專用的改寫檢查點,兩者都是經過微調的 Qwen3.5-VL 9B 模型,一個用於文字轉圖像,一個用於編輯,並公開了改寫程式碼與系統提示詞。Qwen-Image 3.0 的提示詞處理則是藏在 API 背後的黑箱。

生態系 — Qwen-Image 2.1 在 Diffusers、ComfyUI、vLLM-Omni、SGLang 與 LightX2V 中皆有首日支援,並提供 AMD ROCm 與 FlagOS 路徑。Qwen-Image 3.0 則具備 API。

最後那一句並非修辭上的誇飾。對於管線是建立在 ComfyUI 上,或推論堆疊是 vLLM 的團隊而言,一個具有合併管線類別的模型,與一個具有 HTTP 端點的模型之間的差異,就是整合任務與改寫之間的差異。

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

價格,以及價格所無法捕捉的東西

Qwen-Image 3.0 是兩者中唯一有公開價格的:在供應商的雲端上,Pro 每張圖片定價約為 $0.04,Standard 約為 $0.03,而國內消費者定價則從約 ¥0.18 起。這些是上市時的數字,尚未經過獨立審核。Qwen-Image 2.1 則完全沒有公佈的託管費率——它是一種下載,成本就是你自己的 GPU 時間成本。

那兩行數字根本無法相提並論,而假裝它們可以相比,是這個對比中最常見的錯誤。按張計價的價格涵蓋了模型、推論服務基礎架構、擴展能力,以及別人的正常運行時間。下載權重則完全不含這些。正確的問題不是哪個數字比較小;而是你有沒有維運能力來跑一套 33 GB 的模型堆疊,以及便宜那一側的授權條款是否允許你打算用它來做的事。

這就把授權重新帶回比較的核心,也就是它本該所在的位置。Qwen-Image 3.0 的條款並未公布,這對受監管或代理機構的工作而言本身就是個問題——沒有文件可引用。Qwen-Image 2.1 的條款確實已公布,而且條款明定為非商業用途。在不明確的授權與明確具限制性的授權之間,明確具限制性的那一種更容易預先規劃,因為至少你知道該進行什麼樣的對話。

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

你應該選擇哪一個

你需要文字量大的正式製作用圖像,而且希望由別人來執行 —— Qwen-Image 3.0 正合適,但要注意的是,它主打的文字渲染數據屬於廠商宣稱,而現有的獨立測試指出,小字級文字在某些情況下仍會出現亂碼。

你需要自行運行模型、微調它,或將資料保存在自己的硬體上——在兩者之中,Qwen-Image 2.1 是唯一的選擇,而研究授權就是入場的代價。

你需要透明素材、產品去背,或超過三張參考圖片——就公開的規格而言,Qwen-Image 2.1 是更強的工具,而且在參考圖片數量上勝出幅度不小。

你需要商業權利與寬鬆的授權條款——這兩者都不是你的模型所具備的。Qwen-Image 3.0 完全沒有公布任何條款,而 Qwen-Image 2.1 則需要透過協商取得商業授權。此系列中以 Apache-2.0 發布的是較早的 Qwen-Image 1.0 與 2.0。

最後一列值得好好細想,因為它描述的是一個正在縮小的集合。已授予的授權不會追溯變更,所以 Apache-2.0 的 Qwen-Image 版本仍可依原始條款使用。但如果你正規劃商業影像流程,並假設最新的 Qwen-Image 會採用寬鬆授權,那麼最近三次發布就是反對這項假設的證據。

執行其中任何一個,而不把整個管線押在它身上

這兩個模型基於不同原因,目前都很難放進正式生產路徑中——一個是因為授權條款,一個是因為黑箱作業與未公開的參數數量。而這正是路由層存在的目的。OrcaRouter 以供應商定價、零加成的方式,將 200 多個模型置於單一與 OpenAI 相容的端點之後,並具備跨供應商的自動容錯移轉,以及一套路由 DSL,讓你能將多個模型組合成單次呼叫,因此一個新模型或難搞的模型可以與經過驗證的模型並列,而不是擋在它前面。模型融合則將同樣的概念推得更遠,讓一組模型共同運行,並讓你用自己的提示詞來比較它們,而不是看發表會上的圖表。

Qwen-Image 2.1 與 Qwen-Image 3.0 都不是我們目前路由的模型,而本文也不會暗示並非如此。我們確實有路由的圖像模型——OpenAIGPT-Image 系列、Google 的 Imagen 4 各層級與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點——才是你在按自身標準評估 Qwen 這兩個模型時,實際上可據以建構容錯移轉路徑的基礎。

值得關注的範圍比表面上看起來更窄。Alibaba 如今已證明,它會在同一季內、於同一系列中推出開放權重、封閉式託管模型,以及研究授權下載。下一次發布不會告訴你哪種模式勝出;授權檔案才會。

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.