一張生成的主視覺卡片,標題為 Qwen-Image-2.1 vs Gemini Omni 1.1 Flash,圖中顯示一張標示為 Qwen-Image-2.1 的卡片,帶有相框圖示與透明棋盤格,旁邊是一張標示為 Gemini Omni 1.1 Flash 的卡片,帶有電影膠卷圖示,並附上說明文字:一個回傳檔案,另一個回傳影片片段。
Guides & Insights

Qwen-Image-2.1 對比 Gemini Omni 1.1 Flash:一個能回傳 PNG,另一個卻不行

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

關於 Qwen-Image-2.1Gemini Omni 1.1 Flash,最有用的一點是:它們並不互相競爭。要求 Gemini Omni 1.1 Flash 產生一張靜態影像,你會得到錯誤:廠商自家的文件將圖像生成、圖像編輯,以及圖文交錯輸出列為該模型不支援的功能。要求 Qwen-Image-2.1 產生影片,你會得到一張帶有 alpha 通道的 2048×2048 靜態影像。任何把它們放在兩欄的比較表,都是在拿相機跟投影機相比。真正的問題——那個真正會花到錢的問題——是當你把他們串接起來會發生什麼事,以及這條串接鏈能否經得起價目表的考驗。Qwen-Image-2.1 於 2026 年 9 月 20 日正式公開;Gemini Omni 1.1 Flash 自 2026 年 8 月 27 日起全面提供。

每個模型實際上回傳的內容

這就是全部的比較,其餘一切皆由此而來。

輸出格式 — Qwen-Image-2.1 會回傳靜態圖片,原生最高可達 2048×2048,使用 40 個推論步數,並可選擇帶有真正的 alpha 通道;Gemini Omni 1.1 Flash 則回傳影片,最多 40 秒,由 10 秒生成與延伸呼叫組裝而成,而且完全沒有靜態圖片模式。
透明度 — Qwen-Image-2.1 在 64 通道 RGBA 潛在空間中進行去噪,因此 alpha 是由取樣器輸出;Gemini Omni 1.1 Flash 沒有透明背景輸出,要求此類輸出會失敗。
參考輸入 — Qwen-Image-2.1 最多接受 10 張參考圖片,用於多主體構圖;Gemini Omni 1.1 Flash 每個提示最多接受 10 張圖片作為*輸入*,以及最多三段 3 秒的參考影片片段。
解析度上限 — Qwen-Image-2.1 為原生 2K;Gemini Omni 1.1 Flash 提供 360p、720p、1080p 與 4K,但 1080p 與 4K 是原生 720p 算繪的升頻,而非原生生成。
成本 — Qwen-Image-2.1 沒有託管價格,因為沒有託管端點,所以成本就是你自己的 GPU 時間;Gemini Omni 1.1 Flash 在 720p 下每秒計費 $0.10,並有 360p 草稿層級,約每秒 $0.03。
授權 — Qwen-Image-2.1 依 2026 年 9 月 20 日《Qwen Research License Agreement》發布,僅限非商業用途;Gemini Omni 1.1 Flash 是商業 API,其輸出預設帶有 SynthID 與 C2PA 來源資訊。

最後一列,是大多數人會直接略過的那一列。一邊是你能下載、卻不能販售的模型;另一邊則是你無法下載、卻能自由販售的模型——而且每一格畫面裡都藏著看不見的浮水印。

為什麼「versus」框架仍然不斷出現

同時搜尋這兩個名字,你會找到把它們捉對廝殺、互相比較的頁面。原因在於,即使框架方式有誤,背後的問題依然真實:這兩個模型都身處同一條創意工作流程之中,而且都是其中最新的東西。人們真正想弄清楚的,是靜態影像在哪裡結束、動態影像從哪裡開始。

Gemini Omni 1.1 Flash 在那個問題上,靠的是獨立數據而非廠商自家的數字,才贏得一席之地。在 Artificial Analysis 上,截至 2026 年 9 月 2 日,它在無音訊類別的文字轉影片與圖像轉影片兩項競技場中都穩居榜首,Elo 分別為 1324 與 1364。開啟音訊後,它降至 Elo 1237 與 1180——分別排名第二與第四。這種音訊落差,正是規格表會隱藏、排行榜會揭露的那種細節。

Qwen-Image-2.1 的證據較薄弱,且性質不同。廠商自家的 Qwen-Image-Bench 將其列在 60.28,領先 Nano Banana 2.0 的 59.82 與 GPT Image 1.5 的 59.65,並在開源模型中排名第一——但那是廠商自行跑出的基準,差距不到一分,而且並非第三方重現的結果。迄今的獨立測試,只有 GenAI Showdown 的人工評分一輪,得分 7/15,高於初代 Qwen-Image 的 4/15,但落後 Ideogram 4 的 8/15。截至撰稿時,該模型在 Artificial Analysis 的圖像排行榜上並無任何登錄成績。不是低分——是根本沒分數。

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

交接,以及它實際上要付出什麼代價

如果你要打造的東西同時需要靜態影像和短片,這條流程只有單一方向:Qwen-Image-2.1 生成畫面,Gemini Omni 1.1 Flash 讓它動起來。反向並不存在。

一旦實際算過,這筆帳就毫不留情。在 Gemini Omni 1.1 Flash 上,一段 10 秒的 720p 短片帳單約為 $1.00。在 360p 草稿層級,同樣 10 秒大約是 $0.30,而 720p 的完整 40 秒場景——一次生成加上三次延伸呼叫——則接近 $4.00。與此同時,作為整段影片種子的那張靜態圖,除了你自己顯卡的電費之外什麼都不花。這意味著真正耐人尋味的成本決策不是「用哪個模型」,而是「要生成幾次」。靜態圖可以免費反覆迭代;影片則不行。那些以每項成品、而非每次嘗試來編列影片生成預算的團隊,正是會大吃一驚的團隊,因為第一幀免費,重試可不免費。

交接過程中同樣藏著品質陷阱。Gemini Omni 1.1 Flash 原生以 720p 渲染,再升頻到 1080p 與 4K。如果你的靜態影像是一張帶有乾淨 Alpha 通道的 2048×2048 Qwen-Image-2.1 畫面,把它送入會以 720p 渲染再升頻的影片流程,就等於丟掉影像模型給你的大部分成果——而且 Alpha 通道會被完全捨棄,因為沒有透明影片輸出。透明度是在合成器中保留下來的,不是在模型鏈中。請在片段回來之後再規劃合成,而不是在此之前。

路由層的定位

這個組合麻煩的地方在於,這兩個模型都不是用你技術堆疊裡其他元件那種方式就能存取的。Gemini Omni 1.1 Flash 是供應商 API,有自己的金鑰,也有自己按秒計費的計量方式。Qwen-Image-2.1 則是大約 33 GB 的下載檔——一個 7B 的擴散 Transformer,再加上一個 Qwen3-VL 8B 的文字編碼器——得由你自己架設服務,而且授權條款只允許非商業用途。兩套計費模式、兩條存取路徑,卻只有一個專案。

OrcaRouter 的存在正是為了周邊這一塊表面:一個相容於 OpenAI 的端點,涵蓋 200 多個模型,供應商定價原價直通、零加成,跨供應商的自動容錯移轉、用來組合備援路徑的路由 DSL,以及供 panel 式呼叫使用的模型融合。在這裡精確說明它究竟涵蓋什麼很重要。我們不路由任何版本的 Qwen-Image 模型,因此 Qwen-Image-2.1 並不是你能在我們這邊呼叫的路由——它只能在你的硬體上執行,否則就完全跑不了。我們同樣不路由 Gemini Omni 1.1 Flash。我們在動態影像方面確實提供的是 Kling 的影片系列,包括 kling-v3、kling-v3-omni 與 kling-video-o1,再加上 MiniMax H3——因此這條流程中屬於動畫的那一半,有一條不需要第二份供應商合約的託管路徑;而在圖像方面,我們提供 OpenAI GPT-Image 系列、Google 的 Imagen 4 各級方案與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。由於定價是原價直通而非加成,其中任何一項的供應商降價,當天就會在我們這裡生效。

你實際需要的是哪一個

你需要的是素材,不是實拍影片——Qwen-Image-2.1,而 alpha 通道正是原因。透明的產品去背圖、圖示、精靈圖與分層合成,正是能輸出 RGBA 的取樣器能省下整條去背流程的地方。
你需要動態,而且需要可衡量的動態——Gemini Omni 1.1 Flash。它是這兩者中唯一在排行榜頂端擁有獨立競技場評測結果的模型,也是唯一有公開每秒價格、能讓你寫進預測的模型。
你兩者都需要——影片那一半的預算要按每次嘗試來編列,而不是按每個素材,而且不要假設 alpha 通道能順利保留。
你需要把產出賣出去——Gemini Omni 1.1 Flash,而且只有 Gemini Omni 1.1 Flash,直到 Qwen 公布 Qwen-Image-2.1 的商業條款為止。該授權目前沒有公開的價格或條款清單。

誠實的總結是:把它們排出高下的那份比較,本身就是錯誤的產物。接下來真正值得觀察的,是 Qwen 是否會為 Qwen-Image-2.1 附加商業條款,以及 Google 是否會在 Omni 排行榜上縮小音訊方面的差距——決定這條流程中哪一半能拿到預算的,是這兩件事實,而不是又一份計分板。

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新