一張生成的主視覺卡片,標題為 Qwen-Image-2.1 vs GPT-Image-2.5,顯示一張標示為 Qwen-Image-2.1 的卡片,帶有下載圖示與「33 GB 權重」文字,旁邊是一張標示為 GPT-Image-2.5 的卡片,帶有計量錶盤圖示與「token 計費」文字,並附上說明文字:一個供你下載,一個供你計量。
Guides & Insights

Qwen-Image-2.1 對決 GPT-Image-2.5:差距只是一個數字,而且不是品質

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen-Image-2.1GPT-Image-2.5並排放在規格表上比較,牠們看起來就像一對手足:兩者都是統一生成與編輯的圖像模型,都能輸出透明背景,都在最近五週內推出,也都能製作 2K 等級的靜態影像。決定兩者之間該選誰的關鍵差異只有一個數字,而且那不是基準測試分數。Qwen-Image-2.1 可免費下載,卻不可能拿來賣。GPT-Image-2.5 不可能下載,卻輕而易舉就能賣。其餘的一切——架構、延遲、透明效果的實作方式——都是這個差異的下游結果。Qwen-Image-2.1 於 2026 年 9 月 20 日開源;GPT-Image-2.5 則於 2026 年 9 月 8 日發布,其 API 模型同日上線。

兩種增加透明度的方式,相隔一個月

兩個模型在幾週之內先後獲得透明輸出,這個巧合值得深入理解,因為這兩種實作方式並不等同。

Qwen-Image-2.1 將 alpha 納入模型內部。它在 64 通道的 RGBA 潛在空間中進行去噪,並具備 16× 空間壓縮,因此 alpha 通道是取樣器所產出結果的一等公民。沒有分割步驟,也沒有去背(matting)處理。除此之外還有一項不尋常的額外能力:由於模型可以針對每個提示詞決定要輸出 RGB 還是 alpha 通道影像,它也能從一般照片中擷取主體,並回傳透明圖層,而不是二值遮罩。

GPT-Image-2.5 走的是參數路線。OpenAI 的 API 接受 background 設定,可設為 auto、opaque 或 transparent,模型便會據此回應。這是在代管端點上的能力切換,而非潛在空間本身的屬性,好處是你完全不必為此費心:設好旗標,取得去背圖,繼續往下走。代價則是端點給你什麼,你就只能拿到什麼,解析度與成本都由端點決定。

哪一個更好,實際上仍未定論。在撰寫本文時,並不存在將 Qwen-Image-2.1 的 alpha 邊緣與專用去背模型進行比較的公開評測,而 Qwen 方面唯一已公開的檢查是功能性的——通過了透明 PNG 輸出、alpha 在完整 0–255 範圍內保留、單一樣本的 RGBA PSNR 為 60.69 dB。那是正確性檢查,而非品質評斷。它只告訴你這個通道是真實存在的。

你實際能衡量什麼

參數 — Qwen-Image-2.1 的生成元件是一個 7B、32 層的單流擴散 Transformer,搭配 Qwen3-VL 8B 文字編碼器;權重總計約 33 GB,其中 DiT 約占 14 GB。OpenAI 並未公布 GPT-Image-2.5 的參數量。
解析度 — Qwen-Image-2.1 在 40 個推論步驟下可原生輸出最高 2048×2048,並提供七種長寬比預設。GPT-Image-2.5 接受的尺寸最高可達 3840×2160 與 2160×3840,每邊上限為 3840 px,且必須為 16 的倍數。
參考圖片 — Qwen-Image-2.1 最多可接受 10 張,用於多主體構圖與虛擬試穿。OpenAI 的圖像模型可接受參考輸入以進行編輯,但實際上限與保真度行為會因模型與品質層級而異。
延遲 — SGLang-Diffusion 公布在單張 B200 上進行 1024×1024、40 步生成需 2.748 秒,而在 24 GB 的 RTX 4090 上搭配 Cache-DiT 與 INT8 核心、僅計去噪部分則需 4.74 秒。OpenAI 宣稱 GPT-Image-2.5 的 Flare 變體延遲最多可比 GPT-Image-2 降低 50%,另有一家發布合作夥伴測得 2–4 倍;前者為廠商自述,後者為合作夥伴所述,並非受控比較。
價格 — Qwen-Image-2.1 沒有託管價格,因為沒有託管端點;成本就是你自己的 GPU 時間。GPT-Image-2.5 的計費代幣費率與 GPT-Image-2 相同:每 1M 圖像輸入代幣 $8.00、每 1M 圖像輸出代幣 $30.00、每 1M 文字輸入代幣 $5.00。
授權 — Qwen-Image-2.1 依 2026 年 9 月 20 日的 Qwen Research License Agreement 發布,僅限非商業用途。GPT-Image-2.5 是商業 API,輸出帶有 C2PA 來源證明與不可見浮水印。

那份清單中有一列比表面上看起來更薄弱。OpenAI 並未公布 GPT-Image-2.5 的每張圖片價格,只公布權杖費率,而圖片權杖的消耗量會隨解析度與品質等級而異。第三方測量結果顯示,在 1:1 長寬比下,涵蓋 1K、2K 與 4K,以及低、中、高設定,每張圖片的價格範圍約為 $0.0059 至 $0.712——可作為數量級的參考,而非報價。如果你正在做預測,請根據權杖數量和你自己的提示詞分布來建立估算,而不是依據別人測出的每張圖片數字。

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

沒有人會放在同一欄的兩項成本

這個比較之所以難以給出簡單答案,是因為這兩種模式以不同貨幣向你收費,而匯率就是你自己所處的情況。

GPT-Image-2.5 以 token 計費,也就是說計費錶看得見、可預測,而且隨用量線性增減。對於流量已知的產品而言,這是實實在在的優勢:你可以把它編進預算裡,而供應商一降價,你的成本當天就會跟著下降。但它同時也是對探索行為課的一種稅,因為同一個提示詞改到第十版,成本和第一版一模一樣。input_fidelity 的行為讓這一點比表面上的公告費率所暗示的更為明顯——API 可以對圖片輸入自動套用高保真模式,這會消耗比隨手看一眼價目表所能推斷的更多的輸入 token,因此反覆編輯的成本會高於大家常引用的每張圖片數字。

Qwen-Image-2.1 把這兩種特性完全反轉了。第一百次生成的邊際成本就是電費。這讓它成為更適合迭代、批次回填,以及任何提示詞仍在摸索階段的作業的工具。它無法給你的是填進財務報表的數字——無論 GPU 是忙是閒,你都得付錢——它也不會賦予你販售輸出內容的權利。Qwen Research License Agreement 允許非商業的研究與評估,並載明商業部署需另行取得杭州通義實驗室科技有限公司的授權。該授權沒有公開的價格,也沒有載明任何條款。這不是什麼附帶的註腳;對商業化流程而言,這就是整個決策的關鍵。

在沒有第二份合約的情況下同時執行兩者

對大多數團隊來說,務實的答案既不是二選一,而是兩者都要。GPT-Image-2.5 負責正式生產的路徑:產出要交付給客戶,而每 token 的計量是一筆明列的支出項目。Qwen-Image-2.1 則負責探索的路徑:你需要兩百種透明產品照的變化版本,而沒有供應商願意用合理的價格賣你這樣的量。

摩擦點在於,這兩者抵達的途徑截然不同。一個是 API 金鑰。另一個則是 33 GB 的下載檔、一套 Python 環境,以及一顆你自己擁有的 GPU。OrcaRouter 涵蓋了代管的那一半:200+ 個模型藏在單一 OpenAI 相容端點之後,供應商定價原價直通、零加成,跨供應商自動容錯移轉、用來表達備援路徑的路由 DSL,以及把多個模型合併成一次呼叫的模型融合。對這個模型講求精確很重要——我們今天並不路由 GPT-Image-2.5;我們的 OpenAI 圖像路由是 GPT-Image-2、GPT-Image-1.5GPT-Image-1-mini,全都採用 OpenAI 定價,而當上游供應商加入 gpt-image-2.5 識別碼的那一天,同一把金鑰就能呼叫它們,無須修改程式碼。我們也沒有路由任何版本的 Qwen-Image 模型,因此 Qwen-Image-2.1 在我們這邊根本不是一條路由。在此同時,直通定價為你帶來的好處是:當 OpenAI 調整費率時,我們這邊的數字會跟著變動,而不是慢半拍才更新。

裁決,陳述為一項條件,而非贏家

如果產出必須拿去賣,那這根本沒得比:GPT-Image-2.5 是這兩者中唯一你有授權可用的,而 token 計量錶就是這件事的代價。如果產出是研究、內部工具或評估用途,Qwen-Image-2.1 則是更強力的工具——原生 2K、alpha 直接從取樣器輸出、十張參考影像,而且硬體成本一旦付清,邊際成本就是零。如果你兩者都需要,那就兩者都跑,並把授權當成決定某項工作該進哪條管線的界線。

有兩件事會改變這一點。若 Qwen-Image-2.1 公布一份商業條款清單,就會讓授權條款那一列的差距消失,而那一列目前在這項比較中發揮了最大的作用。而 Qwen-Image-2.1 若能在獨立的圖像排行榜上有一筆紀錄,就能告訴我們該供應商的 Qwen-Image-Bench 成績——60.28,領先 Nano Banana 2.0 的 59.82 與 GPT Image 1.5 的 59.65,在開放模型中排名第一——在產出該成績的實驗室之外是否站得住腳。這兩者目前都不存在。在那之前,誠實的建議是根據授權條款與計費方式來做選擇,而不是看排行榜分數。

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.