
Qwen-Image-2.1 對決 Nano Banana 2 Lite:一萬張圖片 340 美元,還是 13 小時的 GPU
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
用 Nano Banana 2 Lite生成一萬張 1024 像素的圖片,約需 340 美元。用 Qwen-Image-2.1生成一萬張圖片,則約需一張 24 GB 顯示卡跑十三個小時,外加一份禁止你轉售其中任何一張的授權條款。這就是一句話講完的取捨,而這也是這個系列中唯一一組兩款模型真的在同一時刻做同一件事的比較。Qwen-Image-2.1 於 2026 年 9 月 20 日開放權重。Nano Banana 2 Lite——廠商的模型 ID google/gemini-3.1-flash-lite-image,正式名稱為 Gemini 3.1 Flash-Lite Image——於 2026 年 6 月 30 日推出,是 Nano Banana 系列中最便宜的靜態圖像生成器。
兩位候選人,誠實定價
Nano Banana 2 Lite 生成一張 1K 圖片約需四秒,比 Gemini 3.1 Flash Image 快約 2.7 倍,且每張 1K 圖片固定收費 $0.034。這個數字背後的 Google token 費率是每 100 萬個輸入 token $0.25,以及每 100 萬個圖片輸出 token $30;換算下來,1K 時約為 $0.0336,批次模式則減半至約 $0.0168。沒有免費層級,而且每項輸出都帶有不可見的 SynthID 浮水印。
Qwen-Image-2.1 沒有價格,因為沒有東西可以買。它是一個約 33 GB 的下載項目——一個 7B、32 層的單流擴散 Transformer,搭配 Qwen3-VL 8B 文字編碼器——由你自己部署服務。最接近價目表的東西是 SGLang-Diffusion 測得的延遲:在 24 GB RTX 4090 上使用 Cache-DiT 與 INT8 核心進行去雜訊階段需 4.74 秒;在 RTX PRO 6000 Blackwell 上以 40.1 GiB 峰值記憶體佔用量進行完整的 1024×1024、40 步生成需 8.23 秒;在單張 B200 上則需 2.748 秒。這些是包含上述元件的單一請求延遲,不是輸送量數據,因此請把一萬張影像需 13 小時視為數量級估計,而非基準測試結果。
把這些放在一起看,算起來並不是「$340 對上免費」。而是 $340 對上十三小時的顯卡使用時間(無論那張卡是你已經擁有或租用的),再加上架設服務堆疊的工程時間。成本交叉的用量遠低於大多數團隊所假設——但前提是那張卡在當月其餘時間沒有閒置,而且前提是輸出內容是你被允許產出的。
三種工作負載,以及各由哪個模型處理
單看數量本身是錯誤的判斷軸。工作類型能更快決定。
• 大量螢幕用素材 — 社群平台裁切版、縮圖、A/B 測試變體。 Nano Banana 2 Lite 幾乎在每一個項目上都勝出。每張圖片四秒、十四種長寬比(包含 1:4 與 8:1)、可精算到分的固定單張價格、批次模式只要一半。這類工作負載完全不需要 alpha 或 2K,而當成品要正式出貨時,帶浮水印的商業授權正是你想要的。
• 印刷、大尺寸合成,或任何你會大幅裁切的內容。 Qwen-Image-2.1,而且差距不小。原生 2048×2048、40 步,對上一個硬性上限約一百萬像素、沒有 2K 模式、沒有放大功能,也沒有任何 API 參數可以調高的模型——Google 會把 2K 與 4K 的工作導向 Nano Banana 2 或 Nano Banana Pro。如果你需要裁掉畫面三分之一後仍要有可用的素材,Lite 辦不到。
• 透明去背、圖示、精靈圖、圖層合成。 Qwen-Image-2.1。Alpha 通道是取樣器在其中進行去噪的 64 通道 RGBA 潛在空間的一個組成部分,因此不需要分割處理,也不需要去背處理;該模型還能將主體從一般照片中提取到透明圖層。Nano Banana 2 Lite 則沒有記載任何透明背景輸出功能。
• 任何必須取得商業授權的用途。 Nano Banana 2 Lite,毋須贅言。Qwen-Image-2.1 依 2026 年 9 月 20 日的《Qwen 研究授權協議》發布,僅允許非商業研究與評估;商業部署須向杭州通義實驗室科技有限公司另行取得授權,而且沒有公開的價格或條款清單。
那個清單裡還該多一列,而這一列對開源模型不利。Nano Banana 2 Lite 是有知識的——它的知識截止日為 2025 年 1 月,其提示遵循度表現建立在 Gemini 3.1 Flash Lite 骨幹之上,並具備強大的圖像內文字渲染能力,涵蓋中文、日文與韓文。Qwen-Image-2.1 在指令遵循方面的獨立證據既稀少又分歧。一場由 AI 評審進行的競技場比較,讓 Nano Banana 2 Lite 對上某個 Qwen 圖像模型——該條目並未指定版本,所以應將其解讀為關於整個系列的訊號,而非專指 2.1——結果由 Lite 在奇特的空間提示(「太空人騎馬」、「水豚計程車司機」)以及文字渲染上勝出,而在後者中,Qwen 的輸出把萬聖節邀請函標題渲染成「Hallofarty Invitation」。Lite 自身有紀錄的弱點是小臉孔、細微文字細節、密集資訊圖表,以及複雜的遮罩編輯。在遵循古怪指令方面,兩者都沒有穩定可靠的優勢;它們失敗的地方不同。

參考影像問題,懸而未決
多圖編輯正是規模化流程再也無法以一個模型替代另一個模型的環節,也是公開資訊出現矛盾的那一列。
Qwen-Image-2.1 最多可接受 10 張參考圖片,並在此基礎上支援虛擬試穿、團體照與衣櫥搭配組合。至於 Nano Banana 2 Lite,各方來源說法嚴重分歧:某供應商的模型頁面指出,它支援最多 14 張參考圖片,用於風格轉移與多重參考編輯;而一篇比較文章則提出相反說法——Lite 僅接受單一圖片進行編輯,14 張參考圖片的能力屬於完整的 Nano Banana 2,且上限為五個人加六個物件。鑒於這項衝突,站得住腳的立場是:Lite 支援圖片輸入與多圖合成,但其參考圖片容量是 Google 用來區隔它與 Nano Banana 2 的差異點。如果你的工作流程需要在一系列作品中維持六個一致的角色,請先對照 Google 自家的模型卡驗證此上限,再據此規劃架構。
這也是更廣泛意義上,這些模型不再能互換的地方。Google 將 Nano Banana 2 Lite 與 Gemini Omni Flash 定位為一對——靜態圖像模型與影片模型,設計上可彼此串接。Qwen-Image-2.1 沒有對應的影片模型,而它的動畫技巧是一連串局部區域編輯的鏈式操作,藉此建構出簡單的逐格循環,並非影片模型。
路由層在什麼情況下能證明其價值
這兩個模型都不在 OrcaRouter 上。我們不路由任何版本的 Qwen-Image 模型,所以 Qwen-Image-2.1 只能自行架設,否則就沒有。Nano Banana 2 Lite —— gemini-3.1-flash-lite-image 這個識別碼 —— 也不在我們的目錄中;我們確實有提供的 Google 圖像路由是 google/gemini-3.1-flash-image-preview、google/gemini-2.5-flash-image、google/gemini-3-pro-image-preview,以及三個 Imagen 4 等級,另外還有 OpenAI 的 GPT-Image-2、GPT-Image-1.5 和 GPT-Image-1-mini,以及 xAI 的 Grok Imagine 圖像端點。
這種混合式管線能換來什麼,正是這項比較不斷撞見的那件事:一個會隨資產而異的決策。大批量資產走便宜的託管路線,透明去背圖走你自己的顯卡,而託管端的供應商價格調整當天就會生效,因為我們是以零加成直接傳遞供應商定價,而不是自行定價。再加上跨供應商的自動容錯移轉、用來組合備援的路由 DSL,以及針對面板式呼叫的模型融合,託管的那一半就不再是你必須逐模型管理的供應商關係——200+ 個模型、一個與 OpenAI 相容的端點、一組金鑰。自架的那一半仍然是你自己的問題,這就是在你擁有的硬體上執行研究授權檢查點所付出的誠實成本。
該選哪一個,以及會讓它翻轉的條件
如果你正在為商業用途製作大量螢幕上的素材,Nano Banana 2 Lite 就是答案,授權問題永遠不會出現:每張圖片 $0.034,四秒,可預測,可銷售。如果你需要 2K、原生透明度,或十張參考圖像,Qwen-Image-2.1 是兩者中唯一具備其中任何一項的,而你為此付出的代價是硬體、工程時間,以及一個非商業授權,這使它成為研究工具而非生產依賴。
一個事實就能弭平這道落差。一份公開的 Qwen-Image-2.1 商業條款清單——附上真的有人能簽的價格與條件——會把一趟 13 小時的 GPU 工作變成一個能與 340 美元競爭的明細項目,而到了那個時候,解析度與 alpha 優勢就會開始搶下目前預設交給 Lite 的工作負載。在那之前,分工很乾淨:要出貨的一律用 Lite,留在公司內部的用 Qwen-Image-2.1,而後者還得靠你自己維護的一套推論服務堆疊。


本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
