
Qwen-Image 2.1 對比 Nano Banana 2:每張圖片的費用,以及擁有所需付出的代價
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這兩個模型中,只有一個的價格可以放進試算表。Nano Banana 2——也就是 Gemini 3.1 Flash Image 模型,自 2026 年 5 月 28 日起正式推出——每張 1024×1024 影像約 0.067 美元,2048×2048 為 0.101 美元,4K 規格則約 0.151 美元;批次模式約為半價,文字輸入則另行計費,每百萬個 token 收費 0.25 美元。Qwen-Image 2.1由 Qwen-Image 團隊於 2026 年 9 月 20 日開源,完全沒有按張計價的價格,因為根本沒有可購買的託管端點:它是一個 33 GB 的權重下載檔,採用禁止商業用途的研究授權條款。所以這場對決的第一個問題並不是哪個模型比較好,而是你買的是影像,還是買一台製造影像的機器,而這兩筆採購並不像規格表所暗示的那樣可以互相比較。
可預測性,才是每張圖片計價真正買到的東西。
Google 在圖像類別中的定價之所以與眾不同,在於它的換算方式極為乾淨俐落。這個模型每百萬個輸出 token 收費 60 美元,而由於圖像輸出會以可預測的方式轉換成 token,這便能換算出每張圖的價格,讓你在生成任何內容之前就能先推算清楚。
• Nano Banana 2——1024×1024 約 $0.067,2048×2048 為 $0.101,4K 約 $0.151;批次模式下約為上述數字的一半,另加文字輸入每百萬個 token 收費 $0.25。一千張 2K 圖片約 $101,可精準預估至個位美元。
• Qwen-Image 2.1 — 未公布價格。成本是你自己在 33 GB 套件上消耗的 GPU 時間,而模型卡對硬體受限情況的建議是透過 pipe.enable_model_cpu_offload() 進行 CPU 卸載,這只是權宜之計,而非真正的解決方案。
按量計價所購買的不只是圖像。它還讓你能夠回答「這項功能在每個月一萬張圖像時會花我們多少錢」,而不必先對自己的硬體進行基準測試。這是一項實實在在的優勢,而且很容易被低估,因為替代方案——自架——有一項真正難以計算的成本:它取決於你的使用率、你的顯卡、你的電費,以及這台機器是否本來就會閒置。誠實的比較不是每千張 101 美元對上免費。而是每千張 101 美元對上一個你必須自己算出來的攤銷數字,而大多數做過這道算術的團隊都會發現,按量計價的價格具有競爭力,直到使用率變得非常高為止。
授權條款正是「自由重量」不再自由的地方。
這是兩個模型之間最顯著的差異,而且差距很大。
Nano Banana 2 是一款商業產品,採用商業條款。你按張付費,成品歸你。Qwen-Image 2.1 依據 2026 年 9 月 20 日的《Qwen 研究授權協議》發布,該協議授予的權利「僅限非商業用途」,並載明商業使用須另行向供應商申請授權。這與較早的 Qwen-Image 系列相比是一項改變——後者採用 Apache 2.0 發布——因此這項比較中的開放選項,其「開放」指的是你可以閱讀它、執行它,而不是指你可以靠它建立事業。
對研究團隊、業餘愛好者,或任何做基準測試的人來說,那是個不錯的授權,而且下載確實免費。對產品團隊而言,這意味著在這場對比中,那個沒有每張圖片定價的模型也沒有商業化路徑,這讓成本比較徹底瓦解:你不是在 $101 和某個更便宜的選項之間做選擇,而是在一個你能販售其輸出的模型,和一個你不能的模型之間做選擇。
解析度與長寬比,正是開源模型真正佔優勢之處
撇開授權不談,Qwen-Image 2.1 做到了 Nano Banana 2 做不到的某件事,而這對特定工作流程來說至關重要。
• Qwen-Image 2.1 — 原生 2K,以 2048×2048 作為官方文件記載的預設值,搭配 40 步推論、七種長寬比預設、最多 10 張參考影像,以及 RGBA 輸出:真正的 Alpha 通道、透明圖層編輯,還能從 RGB 相片中擷取主體。
• Nano Banana 2 — 支援 4K 輸出與罕見的比例,包括 1:4 和 1:8 等極端比例,延伸範圍比大多數模型在任一方向上所能提供的都更廣,並且公布單次生成中五個角色與十四個物件的一致性數據。
最值得留意的是 alpha 通道。Google 的模型並無文件記載會產生透明度,而 Qwen-Image 2.1 則是原生就能做到,這意味著原本得靠人工完成的合成步驟——將主體去背、保留柔邊、放到別的背景上——是在模型內部完成,而非在模型之後才做。如果你靠製作分層素材維生,那是工作流程上的差異,而不是品質上的主張。同樣也值得直說:兩個模型渲染出的尺寸都大於多數工作所需,4K 與 2048×2048 都已越過「限制在於模型,而非輸出目標」的那個點。

公布的數字對照一項承諾
Google 的模型自春季以來一直同時出現在 Artificial Analysis 的兩個圖像排行榜上,並在九月快照中躋身文字轉圖像與圖像編輯的前五名,文字轉圖像的 Elo 約為 1,320。其一致性數據——五個人物、十四個物件——是 Google 自家的,但這些數據就放在獨立排行榜旁邊,這意味著它們可以對照模型在盲測比較中的實際表現來進行合理性檢查。
Qwen-Image 2.1 沒有獨立的評分。它有一篇供應商部落格文章,內含一張 Qwen-Image-Bench 圖表,而沒有任何第三方重現過;還有一份來自 Qwen Ambassador 計畫測試者的實測早期試用報告,該測試者透過 ModelScope Studio 介面執行最終權重:文字轉圖像大約 10–15 秒,編輯則為 18–23 秒,相機位置與多角色角色處理表現強勁,而多參考一致性從大約三張輸入圖片之後開始下降。只有一位評測者,未顯示計時器,也沒有公布提示集。這是公開領域中對該模型唯一的外部觀察,應將其視為提示,而非測量結果。
另外,第三方報導中還流傳著一個數字,將 Qwen-Image 2.1 描述為 20 層 transformer。這與模型卡相互矛盾,模型卡記載的是一個 32 層單流擴散 transformer,其視覺生成元件具有 70 億參數、一個 Qwen3-VL 8B 文字編碼器,以及一個在 16× 空間壓縮下的 64 通道 RGBA VAE。請以模型卡為準。
你能用兩者做的唯一一件事
這是本批次中唯一一篇文章,其對手是我們實際有在路由的模型。Nano Banana 2 在 OrcaRouter 上以 google/gemini-3.1-flash-image-preview 的形式提供,與影像產品線的其他成員並列——OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各層級、其他 Gemini 影像預覽版,以及 xAI 的 Grok Imagine 影像端點——全都在同一個 OpenAI 相容端點後方,以供應商定價提供,零加成。Qwen-Image 2.1 並不在我們路由的模型之列,而本文也不會暗示它屬於其中。
在實務上,這對這項決策的意義比推銷話術來得狹窄,卻也比它更有用。如果你想用自己的提示詞比較這兩個模型,Google 這邊只需要一組 API 金鑰,而且在 2K 解析度下每張圖片約十分之一美分,並且與你呼叫的其他所有服務共用同一個端點。Alibaba 這邊則得先付出 33 GB 的下載、一張 GPU,以及研究授權審查,才能把輸出用於任何商業用途。跨供應商的自動容錯移轉是這裡另一個關鍵環節:一條路由可以在已量測的模型上承載正式流量,同時讓尚未量測的模型在一旁接受評估,因此評估永遠不會落在關鍵路徑上。


哪一個,給誰?
• 選擇 Nano Banana 2,如果你是要正式出貨。它具備商業授權、價格可精確預測到每一美元、在兩個排行榜上都拿下獨立評分前五名、支援 4K 輸出,以及本次比較中最廣的長寬比範圍。一千張 2K 影像的成本約為 $101,而且你今天下午就能開始生成。
• 選擇 Qwen-Image 2.1如果你是在做研究。它可免費下載,架構與提示詞改寫的系統提示都可供完整檢視,原生以 2048×2048 渲染並具備真正的透明背景,還能接受最多 10 張參考圖,並透過圈選、手繪標註或遮罩進行局部編輯。你無法販售它產出的內容,而且沒有人測量過它到底好不好。
那兩段之間的落差,就是這些模型之間的落差;而這不是品質上的落差——而是成熟度的落差,而且它正按照時程逐步縮小。Qwen 的早期存取測試者被要求在 2026 年 9 月 29 日前發表樣本或評論。當這些內容出爐後,這個開放模型就不再是未知數,而開始可被拿來比較,屆時唯一剩下的問題會是授權條款。那才是值得關注的數字,而且它是一份授權檔案,而不是一項基準測試。
