Ett genererat hero-kort med rubriken Qwen-Image-2.1 vs Nano Banana 2 Lite, som visar en kvittosikon med texten 0,034 dollar per bild bredvid en stoppursikon med texten 4,74 s per generering, med bildtexten den billiga mäts, den snabba är inte gratis.
Guides & Insights

Qwen-Image-2.1 vs Nano Banana 2 Lite: 340 $ för tiotusen bilder, eller 13 timmar GPU

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tiotusen 1024-pixelbilder på Nano Banana 2 Lite kostar cirka 340 dollar. Tiotusen bilder från Qwen-Image-2.1 kostar ungefär tretton timmar på en 24 GB GPU och en licens som förbjuder dig att sälja någon av dem. Det är avvägningen på en rad, och det är den enda jämförelsen i den här familjen där de två modellerna faktiskt gör samma jobb vid samma tillfälle. Qwen-Image-2.1 släpptes med öppna vikter den 20 september 2026. Nano Banana 2 Lite – leverantörens modell-ID google/gemini-3.1-flash-lite-image, officiellt Gemini 3.1 Flash-Lite Image – lanserades den 30 juni 2026 och är den billigaste stillbildsgeneratorn i Nano Banana-serien.

De två kandidaterna, ärligt prissatta

Nano Banana 2 Lite genererar en 1K-bild på ungefär fyra sekunder, cirka 2,7× snabbare än Gemini 3.1 Flash Image, och debiterar en fast avgift på 0,034 USD per 1K-bild. Googles tokensatser bakom den siffran är 0,25 USD per 1 miljon indata-tokens och 30 USD per 1 miljon bildutdata-tokens, vilket motsvarar cirka 0,0336 USD vid 1K; batchläge halverar det till ungefär 0,0168. Det finns ingen gratisnivå, och varje utdata förses med en osynlig SynthID-vattenstämpel.

Qwen-Image-2.1 har inget pris, eftersom det inte finns något att köpa. Det är en nedladdning på ungefär 33 GB – en 7B, 32-lagers single-stream-diffusionstransformer parad med en Qwen3-VL 8B-textkodare – som du själv hostar. Det närmaste man kommer en prislista är SGLang-Diffusions uppmätta latens: 4,74 sekunder för denoisingspasset på ett 24 GB RTX 4090 med Cache-DiT och INT8-kärnor, 8,23 sekunder för en fullständig 1024×1024-generering i 40 steg på ett RTX PRO 6000 Blackwell vid ett maximalt minnesavtryck på 40,1 GiB, och 2,748 sekunder på ett enda B200. Dessa är latenser för enskilda förfrågningar inklusive de nämnda komponenterna, inte genomströmningssiffror, så betrakta 13 timmar för tiotusen bilder som en storleksordning snarare än ett riktmärke.

Ställ dem bredvid varandra och kalkylen är inte "$340 mot gratis". Det är $340 mot tretton timmar av ett kort som du antingen redan äger eller hyr, plus ingenjörstiden för att sätta upp en serveringsstack. Brytpunktsvolymen är mycket lägre än de flesta team antar – men bara om kortet inte står oanvänt resten av månaden, och bara om resultatet är något du har tillstånd att producera.

Tre arbetsbelastningar, och vilken modell som hanterar var och en

Volym är fel axel i sig. Arbetstypen avgör det snabbare.

Högvolymsmaterial för skärm — beskärningar för sociala medier, miniatyrer, A/B-varianter. Nano Banana 2 Lite vinner på nästan varje komponent. Fyra sekunder per bild, fjorton bildförhållanden inklusive 1:4 och 8:1, ett fast pris per bild som du kan förutse på öret, batch-läge till halva priset. Inget i den här arbetsbelastningen behöver alfa eller 2K, och den vattenmärkta kommersiella licensen är precis vad du vill ha när utdata levereras.
Tryck, kompositering i stort format, eller allt du kommer att beskära hårt. Qwen-Image-2.1, och det är inte ens nära. Nativ 2048×2048 vid 40 steg mot en modell som är hårt begränsad till ungefär 1 megapixel, utan 2K-läge, utan uppskalning och utan API-parameter för att höja den — Google hänvisar 2K- och 4K-arbete till Nano Banana 2 eller Nano Banana Pro i stället. Om du behöver beskära bort en tredjedel av bildrutan och fortfarande ha en användbar tillgång, kan Lite inte få dig dit.
Transparenta utskärningar, ikoner, sprites, lagerkompositer. Qwen-Image-2.1. Alfakanalen är en komponent i det 64-kanaliga RGBA-latentutrymmet som samplern avbrusar i, så det finns ingen segmenteringspass och ingen matting-pass; modellen kan också dra ut ett motiv ur ett vanligt fotografi till ett transparent lager. Nano Banana 2 Lite har ingen dokumenterad utdata för transparent bakgrund.
Allt som måste vara kommersiellt licensierat. Nano Banana 2 Lite, utan förbehåll. Qwen-Image-2.1 levereras under Qwen Research License Agreement daterat den 20 september 2026 och tillåter endast icke-kommersiell forskning och utvärdering; kommersiell driftsättning kräver en separat licens från Hangzhou Tongyi Laboratory Technology, och det finns inget publicerat pris eller term sheet för en sådan.

Ännu en rad hör hemma i den listan, och den går emot den öppna modellen. Nano Banana 2 Lite vet saker – den levereras med en kunskapsavgränsning i januari 2025 och en promptföljsamhetsprofil byggd på Gemini 3.1 Flash Lite-stommen, med stark återgivning av text i bild, inklusive kinesiska, japanska och koreanska. Oberoende bevis för Qwen-Image-2.1:s instruktionsföljning är tunna och blandade. En jämförelse i en AI-domararena som ställde Nano Banana 2 Lite mot en Qwen-bildmodell – posten anger ingen specifik version, så läs det som en signal om familjen snarare än om 2.1 specifikt – gav Lite segern vid de udda rumsliga prompterna ("astronaut ridande på en häst", "kapybarataxichaufför") och vid textåtergivning, där Qwen-utdata återgav en Halloween-inbjudans titel som "Hallofarty Invitation". Lites egna dokumenterade svagheter är små ansikten, fina textdetaljer, täta infografiker och komplexa maskerade redigeringar. Ingen av modellerna är pålitligt bättre på att följa en märklig instruktion; de misslyckas på olika ställen.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Nano Banana 2 Lite - the scoreboard. Left column Qwen-Image-2.1 rows: Speed 4.74 s denoise on an RTX 4090; Price self-hosted GPU time; Resolution 2048 x 2048 native; Transparency native RGBA; Reference images up to 10; Licence non-commercial research only. Right column Nano Banana 2 Lite rows: Speed about 4 s per 1K image; Price 0.034 dollars per 1K image; Resolution hard cap at 1K; Transparency not supported; Reference images one image for editing; Licence commercial, SynthID watermark. Footer: Qwen figures per the vendor model card and SGLang measurements, unaudited; Google figures per the vendor launch material.

Referensbildsfrågan, olöst

Redigering av flera bilder är där en volym-pipeline slutar kunna ersätta den ena modellen med den andra, och det är också den rad där den offentliga informationen går isär.

Qwen-Image-2.1 tar emot upp till 10 referensbilder och stöder dessutom virtuell provning, grupporträtt och garderobskomposition. För Nano Banana 2 Lite går källorna starkt isär: en leverantörs modellsida uppger stöd för upp till 14 referensbilder för stilöverföring och redigering med flera referenser, medan en jämförelseartikel påstår motsatsen – att Lite tar emot en enda bild för redigering, och att kapaciteten med 14 referenser tillhör den fullständiga Nano Banana 2, med max fem personer plus sex objekt. Med tanke på konflikten är den hållbara ståndpunkten att Lite stöder bildinmatning och komposition av flera bilder, men att dess referenskapacitet är den särskiljande faktor som Google använder för att skilja den från Nano Banana 2. Om ditt arbetsflöde är beroende av sex konsekventa karaktärer genom en serie bör du verifiera gränsen mot Googles eget modellkort innan du bygger din arkitektur kring den.

Det är också här som modellerna slutar vara utbytbara i en bredare bemärkelse. Google positionerar Nano Banana 2 Lite och Gemini Omni Flash som ett par – stillbildsmodellen och videomodellen, byggda för att kedjas samman. Qwen-Image-2.1 har ingen videomotsvarighet, och dess animationstrick är en kedjad sekvens av lokala områdesredigeringar som bygger en enkel bildruta-för-bildruta-loop, inte en videomodell.

Där ett routningslager förtjänar sin plats

Ingen av dessa modeller finns på OrcaRouter. Vi dirigerar ingen Qwen-Image-modell av någon version, så Qwen-Image-2.1 är självhostad eller inget. Nano Banana 2 Lite – gemini-3.1-flash-lite-image identifieraren – finns inte heller i vår katalog; de Google-bildrutter vi faktiskt tillhandahåller är google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview och de tre Imagen 4-nivåerna, plus OpenAI:s GPT-Image-2, GPT-Image-1.5 och GPT-Image-1-mini, samt xAI:s Grok Imagine-bildslutpunkt.

Vad det ger en blandad pipeline är det som den här jämförelsen ständigt stöter på: ett beslut som varierar per tillgång. Volymtillgångar går till en billig hostad rutt, transparenta urklipp går till ditt eget kort, och en leverantörsprisändring på den hostade sidan slår igenom samma dag eftersom vi för vidare leverantörens listpris med noll påslag i stället för att prissätta det själva. Lägg till automatisk failover mellan leverantörer, ett routing-DSL för att komponera fallbacks och modellfusion för panel-liknande anrop, och den hostade halvan slutar vara en leverantörsrelation du måste hantera per modell — 200+ modeller, en OpenAI-kompatibel slutpunkt, en nyckel. Den självhostade halvan förblir ditt problem, vilket är den ärliga kostnaden för att köra en forskningslicensierad checkpoint på hårdvara du äger.

Vilken man ska välja, och villkoret som vänder på det

Om du producerar skärmbaserade tillgångar i volym för kommersiellt bruk är Nano Banana 2 Lite svaret och licensfrågan uppstår aldrig: $0,034 per bild, fyra sekunder, förutsägbart, säljbart. Om du behöver 2K, inbyggd transparens eller tio referensbilder är Qwen-Image-2.1 den enda av de två som har någon av dem, och det betalar du i form av hårdvara, ingenjörstid och en icke-kommersiell licens som gör Qwen-Image-2.1 till ett forskningsinstrument snarare än ett produktionsberoende.

Ett enda faktum skulle få gapet att kollapsa. Ett publicerat kommersiellt term sheet för Qwen-Image-2.1 – med ett pris och villkor som någon faktiskt kan skriva under – förvandlar ett 13-timmars GPU-jobb till en radpost som konkurrerar med $340, och vid det laget börjar fördelarna med upplösning och alfa vinna arbetsbelastningar som för närvarande som standard går till Lite. Tills det finns är uppdelningen ren: Lite för allt som släpps, Qwen-Image-2.1 för allt som stannar internt, och en serveringsstack för den andra som du själv underhåller.

A screenshot of OrcaRouter's own model page for google/gemini-3.1-flash-image-preview, captured September 21 2026, showing the model title Nano Banana 2 (Gemini 3.1 Flash Image Preview), the Vision, JSON and Reasoning capability tags, the 2026-02-26 date, the generateContent endpoint and a $0.15 price.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.