
Qwen-Image 2.1 對上 Qwen-Image 3.0:數字較小的才是較新的模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
先從最讓人卡住的地方說起。Qwen-Image 2.1比Qwen-Image 3.0還新。該廠商於 2026 年 7 月 21 日推出 Qwen-Image 3.0,並在 8 月 5 日正式全面上市。它則於 2026 年 9 月 20 日推出 Qwen-Image 2.1——晚了七週,而且次要版號還更低。這套編號並不是先後順序,而是兩條共用同一名稱的不同產品線;而關於這兩者,最有用的單一項事實是,它們在決定你能否在其上進行開發的關鍵問題上,採取了完全相反的立場。Qwen-Image 3.0 是封閉且代管的,沒有權重、沒有授權條款,也沒有技術報告。Qwen-Image 2.1 則是開放權重,今天即可下載,採用僅允許非商業用途的研究授權。
兩個碰巧同名的產品
Qwen-Image 系列在十四個月內已採取了三種截然不同的授權立場,而將它們一一列出,便能消除大部分的困惑:
• Qwen-Image 1.0 與 2.0 — 於 Hugging Face 和 ModelScope 上以 Apache 2.0 開放權重,發表當日即釋出技術報告,可自行架設、可微調、可量化。
• Qwen-Image 3.0 — 閉源。未釋出權重、未說明授權條款、沒有模型卡、沒有技術報告,也沒有公開的基準測試表。僅能透過代管 API 使用,分為 Pro 與 Standard 版本。
• Qwen-Image 2.1 — 再次開放權重,但依據 2026 年 9 月 20 日的《Qwen 研究授權協議》,該協議授予的權利「僅限非商業用途」,商業用途則須另行協商授權條款。
把它讀成一種模式而非時間線,輪廓就清楚了:阿里巴巴不再把「開放」當成二元選項。Qwen-Image 2.1 既不是 1.0 與 2.0 那種寬鬆的發布,也不是 3.0 那種封閉的發布。它是第三種立場——權重可供檢視、執行與修改,前方卻加裝了一道商業閘門。
每個模型實際上是什麼
• Qwen-Image 2.1 — 一款統一的文字生圖與影像編輯模型,其視覺生成元件具備 7B 參數,並以 32 層單流 DiT 架構打造。一旁搭配的是 Qwen3-VL 8B 文字編碼器,以及在 16× 空間壓縮下的 64 通道 RGBA VAE;完整下載檔案約 33 GB,其中文字編碼器就佔了一半以上。採用區塊因果注意力,文字使用 token 層級的因果遮罩,影像生成則使用分塊層級的雙向遮罩,並支援前綴 KV 快取重用,以進行多影像編輯。原生 2K,預設為 2048×2048、40 步,並提供七種長寬比預設。《/3》
• Qwen-Image 3.0——一款封閉式託管模型,提供 Pro 與 Standard 版本,透過單一 API 同時實現影像生成與編輯。阿里巴巴的發布資料宣稱,提示詞可長達約 4,500 個 token、文字清晰可辨至約 10 像素,並涵蓋 12 種語言、20 多種字型,輸出最高可達 2048×2048,每次呼叫最多可生成六張影像。官方並未公布參數數量;廣為流傳的約 20B MMDiT 數字僅屬報導所述,而非已獲證實。
實務上最關鍵的架構差異不在於規模,而在於模型在哪裡執行,以及你能對它做什麼。Qwen-Image 2.1 以檔案形式推出,你可以檢視、量化、用私有資料微調,並在自己的硬體上執行,甚至早在權重正式發布的三天前,支援 SGLang 的 pull request 就已經合併了。Qwen-Image 3.0 則以端點形式提供。你無法對它量化,無法對它微調,也無法在阿里巴巴執行它的地方之外執行它。
編輯正是兩者分歧最劇烈之處
兩個模型都在單一系統中進行生成與編輯,因此有趣的比較在於編輯的具體細節——而在這方面,從帳面規格來看,較新、較小的模型反而能力更強。
• 參考圖片 — Qwen-Image 2.1 最多接受 10 個輸入參考。Qwen-Image 3.0 的 Pro 說明文件指出支援 1–3 張輸入圖片。
• 局部編輯控制——Qwen-Image 2.1 支援圓圈標記、手繪註解,以及以獨立輸入提供的個別遮罩,因此原始影像能保持未標記的狀態。Qwen-Image 3.0 記載的編輯路徑涵蓋局部重寫、內容擴展、風格轉移與多鏡頭視角生成,但並未公布以遮罩為基礎的工作流程。
• 透明度 — Qwen-Image 2.1 原生生成與編輯 RGBA 影像、編輯透明圖層內的文字,並能將 RGB 照片中的主體擷取至透明圖層。Qwen-Image 3.0 的發布公告並未提出任何透明度相關宣稱。
• 提示詞改寫 — Qwen-Image 2.1 隨附兩個專用的改寫檢查點,兩者都是經過微調的 Qwen3.5-VL 9B 模型,一個用於文字轉圖像,一個用於編輯,並公開了改寫程式碼與系統提示詞。Qwen-Image 3.0 的提示詞處理則是藏在 API 背後的黑箱。
• 生態系 — Qwen-Image 2.1 在 Diffusers、ComfyUI、vLLM-Omni、SGLang 與 LightX2V 中皆有首日支援,並提供 AMD ROCm 與 FlagOS 路徑。Qwen-Image 3.0 則具備 API。
最後那一句並非修辭上的誇飾。對於管線是建立在 ComfyUI 上,或推論堆疊是 vLLM 的團隊而言,一個具有合併管線類別的模型,與一個具有 HTTP 端點的模型之間的差異,就是整合任務與改寫之間的差異。

價格,以及價格所無法捕捉的東西
Qwen-Image 3.0 是兩者中唯一有公開價格的:在供應商的雲端上,Pro 每張圖片定價約為 $0.04,Standard 約為 $0.03,而國內消費者定價則從約 ¥0.18 起。這些是上市時的數字,尚未經過獨立審核。Qwen-Image 2.1 則完全沒有公佈的託管費率——它是一種下載,成本就是你自己的 GPU 時間成本。
那兩行數字根本無法相提並論,而假裝它們可以相比,是這個對比中最常見的錯誤。按張計價的價格涵蓋了模型、推論服務基礎架構、擴展能力,以及別人的正常運行時間。下載權重則完全不含這些。正確的問題不是哪個數字比較小;而是你有沒有維運能力來跑一套 33 GB 的模型堆疊,以及便宜那一側的授權條款是否允許你打算用它來做的事。
這就把授權重新帶回比較的核心,也就是它本該所在的位置。Qwen-Image 3.0 的條款並未公布,這對受監管或代理機構的工作而言本身就是個問題——沒有文件可引用。Qwen-Image 2.1 的條款確實已公布,而且條款明定為非商業用途。在不明確的授權與明確具限制性的授權之間,明確具限制性的那一種更容易預先規劃,因為至少你知道該進行什麼樣的對話。

你應該選擇哪一個
• 你需要文字量大的正式製作用圖像,而且希望由別人來執行 —— Qwen-Image 3.0 正合適,但要注意的是,它主打的文字渲染數據屬於廠商宣稱,而現有的獨立測試指出,小字級文字在某些情況下仍會出現亂碼。
• 你需要自行運行模型、微調它,或將資料保存在自己的硬體上——在兩者之中,Qwen-Image 2.1 是唯一的選擇,而研究授權就是入場的代價。
• 你需要透明素材、產品去背,或超過三張參考圖片——就公開的規格而言,Qwen-Image 2.1 是更強的工具,而且在參考圖片數量上勝出幅度不小。
• 你需要商業權利與寬鬆的授權條款——這兩者都不是你的模型所具備的。Qwen-Image 3.0 完全沒有公布任何條款,而 Qwen-Image 2.1 則需要透過協商取得商業授權。此系列中以 Apache-2.0 發布的是較早的 Qwen-Image 1.0 與 2.0。
最後一列值得好好細想,因為它描述的是一個正在縮小的集合。已授予的授權不會追溯變更,所以 Apache-2.0 的 Qwen-Image 版本仍可依原始條款使用。但如果你正規劃商業影像流程,並假設最新的 Qwen-Image 會採用寬鬆授權,那麼最近三次發布就是反對這項假設的證據。
執行其中任何一個,而不把整個管線押在它身上
這兩個模型基於不同原因,目前都很難放進正式生產路徑中——一個是因為授權條款,一個是因為黑箱作業與未公開的參數數量。而這正是路由層存在的目的。OrcaRouter 以供應商定價、零加成的方式,將 200 多個模型置於單一與 OpenAI 相容的端點之後,並具備跨供應商的自動容錯移轉,以及一套路由 DSL,讓你能將多個模型組合成單次呼叫,因此一個新模型或難搞的模型可以與經過驗證的模型並列,而不是擋在它前面。模型融合則將同樣的概念推得更遠,讓一組模型共同運行,並讓你用自己的提示詞來比較它們,而不是看發表會上的圖表。
Qwen-Image 2.1 與 Qwen-Image 3.0 都不是我們目前路由的模型,而本文也不會暗示並非如此。我們確實有路由的圖像模型——OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各層級與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點——才是你在按自身標準評估 Qwen 這兩個模型時,實際上可據以建構容錯移轉路徑的基礎。
值得關注的範圍比表面上看起來更窄。Alibaba 如今已證明,它會在同一季內、於同一系列中推出開放權重、封閉式託管模型,以及研究授權下載。下一次發布不會告訴你哪種模式勝出;授權檔案才會。

