
Qwen-Image 2.1 悄然發布:深入解析 Qwen/Qwen-Image-2.1-PE-I2I
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年9月20日,Qwen-Image 團隊將 Qwen-Image 2.1發布到 Hugging Face 和 ModelScope——權重、授權檔案、模型卡與一篇部落格文章,全都在同一天內完成,幾乎沒有前置準備期。最受矚目的數字是視覺生成元件中的 70 億參數。幾乎還沒有人打開來看的部分是 Qwen/Qwen-Image-2.1-PE-I2I,它是隨這款圖像模型一同發布的兩個提示詞改寫檢查點之一。它不是圖像模型。它是在圖像模型看到你的指令之前,決定你的指令代表什麼意思的東西——而在這次發布中,它正是那個默默決定你的輸出會以哪種語言回傳的元件。
「靜悄悄上線」在這裡究竟是什麼意思?
措辭很重要,因為很容易往任一個方向誇大其詞。Qwen-Image 2.1 並非遭到洩漏,也不是毫無預告。有一篇日期為 2026 年 9 月 20 日的廠商部落格貼文、一個新聞區段標註同日的 GitHub 儲存庫,以及已上線的權重下載。它沒有的是事前預熱期:唯一的提前訊號是 9 月 17 日的一則公告,透過 ModelScope 提供 50 個搶先體驗名額,並要求獲選測試者在 9 月 29 日前發布範例或評論。三天後,權重便公開了。沒有主題演講、沒有基準測試禁發期,也沒有媒體宣傳週期。
這是一種特定類型的發布,值得精確地加以命名。廠商宣布了它,卻沒有宣傳它。對任何正在決定是否要以其為基礎來開發的人而言,實際的後果是,目前還沒有任何獨立評估可以參考——只有廠商自家的資料,以及早期試用者接下來一週所發布的內容。在阿里巴巴以外的人公開運行它之前,請把本文中每一項關於品質的說法都當成來自模型卡與部落格文章。
為什麼 PE-I2I 檢查點才是有趣的那一個
Qwen-Image 2.1 的發行版本包含三個可下載的部分,而非一個:
• Qwen/Qwen-Image-2.1——影像模型本身。視覺生成元件為 32 層單流式 DiT,具 7B 參數,搭配 Qwen3-VL 8B 文字編碼器,以及具 16× 空間壓縮的 64 通道 RGBA VAE。三個元件合計約 33 GB。
• Qwen/Qwen-Image-2.1-PE-T2I — 用於文字生圖的提示詞改寫器。經微調的 Qwen3.5-VL 9B,約 18.8 GB。
• Qwen/Qwen-Image-2.1-PE-I2I — 用於圖像到圖像編輯的提示詞改寫器。同樣是經過微調的 Qwen3.5-VL 9B,大小也約為 18.8 GB,於 9 月 20 日 08:46 UTC 上傳至 Hugging Face。
「PE」是提示詞增強。I2I 變體會接收一道模糊的編輯指示以及一或多張輸入影像,並將其改寫成精確、無歧義的編輯指令,供下游擴散模型使用。該儲存庫本身的說明對輸入形態直言不諱:輸入影像永遠存在,因此這始終是影像編輯任務,絕不是從無到有的文字轉圖像。改寫程式碼位於 prompt_rewrite/ 資料夾中,該資料夾同時服務兩個檢查點——--task t2i 或 --task edit——並具備 transformers 路徑、vLLM 路徑、serve.sh 加上 client.py 用於常駐服務,以及 pe_core.py 用於共用邏輯。
這就是為什麼這件事比聽起來更重要。圖像模型根本不知道你的本意是什麼。它只知道你的提示字面上寫了什麼,並依文字編碼器對其的處理方式來加權。位於它前面的改寫器,正是解決歧義的地方——或者說,是讓歧義被解決得錯誤的地方,而且在你生成的每一張圖片上都一致如此。在一個支援多達 10 張參考圖片的統一生成與編輯模型中,這個解決步驟比平常更容易出錯。
系統提示詞就是語言決策的所在之處
PE-I2I 儲存庫會隨權重一併附上 system_prompt.txt,而且它對一件事異常明確:語言。直接閱讀該檔案,改寫器被指示要做出兩項各自獨立的語言決策,並且要將它們區分開來。
• 描述語言。改寫者用來描述編輯的說明文字,會遵循使用者指令所用的語言——中文指令,中文描述;英文指令,英文描述;日文、韓文、法文、泰文或其他任何語言的指令,則會得到英文描述。
• 所渲染文字的語言。實際會被繪製到輸出影像中、包在雙引號裡的文字,是由嚴格的優先順序決定:第一,如果使用者指定了確切文字或目標語言,就照字面遵從;第二,如果輸入影像已經含有文字,就配合該現有文字的主要語言——即使指令是以不同語言撰寫;第三,如果影像中沒有文字,也沒有指定語言,就使用指令本身的語言,而且特別不要強制使用英文。
提示詞以一個實例強化了第二條規則——一張以泰文為主的圖像,若以未指明語言的英文指令進行編輯,就必須渲染出泰文文字——並新增了兩項限制:渲染出的文字必須是單一語言,而非中英並列;而「規格表」或「分鏡腳本」這類視覺類型,須透過版面配置與字體排印來達成,絕不能藉由把渲染出的標籤切換成英文來實現。
這是一項規模很小的工程,卻有極大的影響範圍。如果你正在為一個包裝文字很重要的市場生成產品圖像,那麼「改寫器會保留現有的標籤語言」與「改寫器會好意地把所有內容都翻譯成英文」之間的差別,就是可用素材與被退回素材之間的差別。而且,由於這種行為是在隨儲存庫一同發布的系統提示中指定的,你可以閱讀它、比對差異,並加以覆寫——這可是封閉式託管模型裡的同一個步驟所辦不到的。
什麼是已確認的,什麼又不是
在這裡精確劃定界線,正是「我們所知」類文章的全部意義所在。
• 已從儲存庫與模型卡確認 — 7B/32 層單流 DiT 的架構數據;Qwen3-VL 8B 文字編碼器;64 通道 RGBA VAE,具備 16× 空間壓縮;區塊因果注意力,文字採用 token 層級的因果遮罩,影像生成則採用區塊層級的雙向遮罩;前綴 KV 快取重用,模型卡指出當檢查點帶有 causal_condition: true(確實如此)時便會啟用;採用歐拉離散排程的流匹配;原生 2K 輸出,預設為 2048×2048、40 個推論步數;七種已記錄的長寬比預設;支援最多 10 張參考影像;透過圈選、塗繪標註或獨立遮罩進行局部編輯;以及 RGBA 生成、透明圖層編輯,以及從 RGB 照片擷取主體。
• 已確認授權的部分,而這正是最棘手的地方——該版本採用的是《Qwen 研究授權協議》(Qwen Research License Agreement),日期為 2026 年 9 月 20 日,該協議授予的權利為「僅限非商業用途」,並聲明商業用途需另行向廠商申請授權。這與早先以 Apache 2.0 發布的 Qwen-Image 系列相比,是一項重大變更。在你據此打造產品之前,請先閱讀授權文件,而不是之後才讀。
• 尚未確認 — 目前尚無獨立的基準測試分數。該部落格文章引用了 Qwen-Image-Bench 比較圖表,但其中的數字是廠商自家的,且在撰寫當下尚未被任何第三方重現。Qwen-Image 2.1 沒有公布託管端點價格,也沒有載明商業授權條款。而且目前也還不知道是否會推出採用寬鬆授權的版本。
唯一確實存在的獨立資料點,是一篇來自測試者的實測早期存取評測;該測試者透過 Qwen Ambassador 計畫取得存取權,並在 ModelScope Studio 介面上執行最終發布權重。該評測回報,文生圖的生成時間約為 10–15 秒,編輯則約 18–23 秒;在鏡頭位置預設與多角色指派方面表現強勁;另外還有一個值得知道的特定失效模式:多參考一致性從大約三張輸入圖像起開始劣化,側馬尾的位置在側面角度下會塌縮成中央馬尾。那只是單一評測者、在早期存取 UI 上、且未顯示計時器的結果。這是有用的訊號。這不是基準測試。

首日框架支援,這是個低調的好消息
一個模型在發布當天於何處上線,比模型卡更能說明你究竟能不能實際使用它,而 Qwen-Image 2.1 的上線範圍很廣:
• Diffusers — QwenImage21Pipeline在首日便已合併,而模型儲存庫帶有diffusers:QwenImage21Pipeline標籤。
• ComfyUI — 原生首日支援,內建文生圖與圖像編輯工作流程範本,並提供獨立的 Comfy 相容權重倉庫。
• vLLM-Omni — 逐步執行、前綴 KV 快取、CUDA Graph 解碼、FP8 量化,以及張量/Ulysses 平行處理。
• SGLang——原生支援的 pull request 已於 9 月 17 日合併,比權重發布早三天,涵蓋 DiT、RGBA VAE、Qwen3-VL 條件處理、多張參考影像,以及 RGBA 輸入/輸出,並已在 H200、B200、RTX PRO 6000、RTX 5090 與 RTX 4090 上驗證。
• LightX2V — 首日加速,並透過 ROCm 支援 AMD Radeon,同時透過 FlagOS 支援多晶片。
SGLang 的預發佈 pull request 就是線索。在權重之前就落地的框架支援,意味著服務路徑是針對檢查點進行測試,而不是之後才根據模型卡編寫的。對於一個 7B 元件,旁邊還有一個 17.5 GB 的文字編碼器,這就是週末瞎忙和一個下午的差別。
對於資源受限的 GPU,模型卡建議採用 CPU 卸載 —— pipe.enable_model_cpu_offload()—— 這是標準的權宜之計,而非根本的解決方案。這 33 GB 的下載內容主要由文字編碼器占據,而非 DiT;擴散 Transformer 本身只占整個套件中較小的一半,約 14 GB。

實用解讀
如果你今天想試用 Qwen-Image 2.1,誠實的立場是:你可以,在本機執行,依據研究授權,但沒有獨立基準測試,也沒有商業使用權利。對評估來說這是合理的取捨,對正式生產流程來說卻是糟糕的選擇,而這兩者之間的落差,正是授權條款檔案所決定的事。
對於想評測圖像模型、卻不願把正式上線路徑押在一個才發表幾天的檢查點上的團隊而言,路由層正是把這類風險圈住的地方。OrcaRouter 把 200 多個模型整合在單一 OpenAI 相容端點之後,以供應商定價、零加價提供,並具備跨供應商的自動容錯移轉,因此一個尚未經過驗證的模型可以與你已經信任的模型並存在同一條路由後方,而不是取代它——而且由於定價是直接透传的,任何已路由模型只要廠商降價,當天就生效,不必等合約變更。截至撰稿時,Qwen-Image 2.1 並不在我們所路由的模型之列,本文也不會暗示並非如此。我們確實有路由的是周邊的圖像產品線——OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點——當你在自己的硬體上評測這個新進者時,容錯移轉路徑正是由此而來。
那個懸而未決的問題,正是這個儲存庫無法回答的問題。阿里巴巴以僅限研究用途的授權,推出了 7B 的開放權重影像模型;而就在同一年,它也將 Qwen-Image 3.0 以完全不公開權重的封閉式代管模型形式推出。兩次發布,兩種相反的押注,相隔四個月。這兩者之中,哪一種會決定下一代 Qwen 影像模型的樣貌——以及那份研究授權是否終將轉變為企業可用的形式——正是值得關注的焦點。權重現在已經放在 Hugging Face 上,任何人都可以自行閱讀授權條款檔案。

