Ett genererat hero-kort med rubriken Qwen-Image-2.1 vs Gemini Omni 1.1 Flash, som visar ett kort märkt Qwen-Image-2.1 med en ikon för bildram och ett transparensrutnät bredvid ett kort märkt Gemini Omni 1.1 Flash med en filmremsikon, med bildtexten: den ena returnerar en fil, den andra returnerar ett klipp.
Guides & Insights

Qwen-Image-2.1 vs Gemini Omni 1.1 Flash: Den ena returnerar en PNG, den andra kan inte.

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest användbara att veta om Qwen-Image-2.1 och Gemini Omni 1.1 Flash är att de inte konkurrerar. Ber du Gemini Omni 1.1 Flash om en stillbild får du ett fel: leverantörens egen dokumentation listar bildgenerering, bildredigering och interfolierad bild- och textutdata som funktioner som modellen inte stöder. Ber du Qwen-Image-2.1 om en video får du en stillbild i 2048×2048 med en alfakanal. Varje jämförelsetabell som placerar dem i två kolumner jämför en kamera med en projektor. Den verkliga frågan – den som faktiskt kostar pengar – är vad som händer när man kedjar dem, och om kedjan klarar kontakten med prislistan. Qwen-Image-2.1 blev offentligt tillgänglig den 20 september 2026; Gemini Omni 1.1 Flash har varit allmänt tillgänglig sedan den 27 augusti 2026.

Vad varje modell fysiskt returnerar

Detta är hela jämförelsen, och allt annat följer av den.

Utdataformat — Qwen-Image-2.1 returnerar en stillbild, upp till 2048×2048 native vid 40 inferenssteg, valfritt med en riktig alfakanal; Gemini Omni 1.1 Flash returnerar video, upp till 40 sekunder sammansatt av 10-sekunders genererings- och förlängningsanrop, utan något stillbildsläge alls.
Transparens — Qwen-Image-2.1 avbrusar i ett 64-kanaligt RGBA-latentrum, så alfa kommer ut ur samplern; Gemini Omni 1.1 Flash har ingen utdata med genomskinlig bakgrund, och att begära en sådan misslyckas.
Referensindata — Qwen-Image-2.1 accepterar upp till 10 referensbilder för komposition med flera motiv; Gemini Omni 1.1 Flash accepterar upp till 10 bilder per prompt som *indata* och upp till tre 3-sekunders referensvideoklipp.
Upplösningstak — Qwen-Image-2.1 är native 2K; Gemini Omni 1.1 Flash erbjuder 360p, 720p, 1080p och 4K, men 1080p och 4K är uppskalningar av en native 720p-rendering snarare än native genereringar.
Vad det kostar — Qwen-Image-2.1 har inget hostat pris eftersom det inte finns någon hostad endpoint, så kostnaden är din egen GPU-tid; Gemini Omni 1.1 Flash debiterar $0.10 per sekund vid 720p, med en 360p-utkastnivå på cirka $0.03 per sekund.
Licens — Qwen-Image-2.1 levereras under Qwen Research License Agreement daterat 20 september 2026, endast icke-kommersiellt; Gemini Omni 1.1 Flash är ett kommersiellt API vars utdata bär SynthID och C2PA-proveniens som standard.

Den sista raden är den som folk skummar förbi. På ena sidan har du en modell som du kan ladda ner men inte sälja. På den andra en modell som du inte kan ladda ner men fritt sälja – med en osynlig vattenstämpel i varje bildruta.

Varför "versus"-inramningen ändå fortsätter att dyka upp

Sök på de två namnen tillsammans och du hittar sidor som rangordnar dem mot varandra. Anledningen är att den underliggande frågan är verklig även när inramningen är fel: båda modellerna finns i samma kreativa pipeline, och båda är det nyaste i den. Vad folk egentligen försöker avgöra är var stillbilden slutar och rörelsen börjar.

Gemini Omni 1.1 Flash förtjänade sin plats i den frågan med oberoende siffror snarare än leverantörens. På Artificial Analysis höll den topplatsen i både text-till-video- och bild-till-video-arenorna i kategorin utan ljud per den 2 september 2026, med Elo 1324 och 1364. Med ljud aktiverat sjunker den till Elo 1237 och 1180 – tvåa och fyra. Det där ljudgapet är den sorts detalj som ett specifikationsblad döljer och en resultattavla avslöjar.

Qwen-Image-2.1:s bevis är tunnare och av ett annat slag. Leverantörens egen Qwen-Image-Bench placerar den på 60,28, före Nano Banana 2.0 på 59,82 och GPT Image 1.5 på 59,65, och som etta bland öppna modeller – men det är ett benchmark som körts av leverantören, med marginaler på under en poäng, och det är inte en tredjepartsreproduktion. Oberoende testning består hittills av en mänskligt poängsatt körning i GenAI Showdown på 7/15, upp från 4/15 för den ursprungliga Qwen-Image och bakom Ideogram 4:s 8/15. Modellen fanns inte med i Artificial Analysis rankningstabeller för bilder när detta skrevs. Inte en låg poäng – ingen poäng.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Överlämningen, och vad den faktiskt kostar

Om du bygger något som behöver både en stillbild och ett klipp, går flödet bara i en riktning: Qwen-Image-2.1 skapar bildrutan, Gemini Omni 1.1 Flash animerar den. Det omvända finns inte.

Matematiken är obeveklig när man väl räknar på den. Ett 10 sekunder långt 720p-klipp på Gemini Omni 1.1 Flash kostar ungefär 1,00 dollar. På 360p-utkastnivån kostar samma 10 sekunder ungefär 0,30 dollar, och en hel 40 sekunder lång scen i 720p – en generering plus tre förlängningsanrop – landar på nära 4,00 dollar. Samtidigt kostar stillbilden som ligger till grund för alltihop inget annat än elen till ditt eget grafikkort. Vilket innebär att det intressanta kostnadsbeslutet inte är ”vilken modell” utan ”hur många tagningar”. En stillbild kan man iterera gratis; en video kan man inte. Team som budgeterar videogenerering per tillgång i stället för per försök är de som blir överraskade, eftersom den första bildrutan är gratis och omtagningarna inte är det.

Det finns en kvalitetsfälla i överlämningen också. Gemini Omni 1.1 Flash renderar nativt i 720p och skalar upp till 1080p och 4K. Om din stillbild är en 2048×2048 Qwen-Image-2.1-bild med en ren alfakanal, kastar det bort det mesta som bildmodellen gav dig att mata in den i en videobana som renderar i 720p och skalar upp — och alfakanalen tas bort helt, eftersom det inte finns någon transparent videoutgång. Transparens överlever i compositorn, inte i modellkedjan. Planera kompositen efter att klippet har kommit tillbaka, inte före.

Var routinglagret passar in

Det besvärliga med den här kombinationen är att ingen av modellerna nås på samma sätt som resten av din stack förmodligen gör. Gemini Omni 1.1 Flash är ett leverantörs-API med egen nyckel och egen mätare per sekund. Qwen-Image-2.1 är en nedladdning på ungefär 33 GB – en 7B-diffusionstransformator plus en Qwen3-VL 8B-textkodare – som du driftar själv, under en licens som endast tillåter icke-kommersiell användning. Två faktureringsmodeller, två åtkomstvägar, ett projekt.

OrcaRouter finns till för exakt den omgivande ytan: en OpenAI-kompatibel endpoint för 200+ modeller, leverantörens listpris vidarebefordrat utan påslag, automatisk failover mellan leverantörer, ett routing-DSL för att komponera fallbacks och modellfusion för anrop i panelstil. Att vara precis om vad det täcker här spelar roll. Vi routar ingen Qwen-Image-modell av någon version, så Qwen-Image-2.1 är inte en rutt du kan anropa hos oss – den körs på din hårdvara eller inte alls. Vi routar inte heller Gemini Omni 1.1 Flash. Det vi däremot har på rörelsesidan är Klings videolinje, inklusive kling-v3, kling-v3-omni och kling-video-o1, plus MiniMax H3 – så den animerade halvan av den här pipelinen har en hostad rutt som inte kräver ett andra leverantörsavtal, och på bildsidan har vi OpenAI GPT-Image-familjen, Googles Imagen 4-nivåer och Geminis bildförhandsvisningar samt xAI:s Grok Imagine-endpoint för bilder. Eftersom listpriset vidarebefordras i stället för att beläggas med påslag blir en leverantörsprissänkning på någon av dem live här samma dag.

Vilken du faktiskt behöver

Du behöver tillgångar, inte filmmaterial — Qwen-Image-2.1, och alfakanalen är anledningen. Transparenta produkturklipp, ikoner, sprites och skiktade kompositer är där en sampler som matar ut RGBA sparar en hel matting-pipeline.
Du behöver rörelse och du behöver den mätbar — Gemini Omni 1.1 Flash. Den är den enda av de två med oberoende arenaresultat i toppen av en resultattavla, och den enda med ett publicerat pris per sekund som du kan lägga in i en prognos.
Du behöver båda — budgetera videohalvan per försök, inte per tillgång, och utgå inte från att alfakanalen tar sig igenom.
Du behöver kunna sälja resultatet — Gemini Omni 1.1 Flash, och endast Gemini Omni 1.1 Flash, tills Qwen publicerar kommersiella villkor för Qwen-Image-2.1. Det finns inget publicerat pris eller avtalsunderlag för den licensen i dag.

Den ärliga sammanfattningen är att jämförelsen som rangordnar dem är fel artefakt. Det som är värt att bevaka härnäst är huruvida Qwen kopplar kommersiella villkor till Qwen-Image-2.1, och huruvida Google stänger ljudgapet på Omni-topplistorna – dessa två fakta, inte ännu en resultattavla, avgör vilken halva av den här pipelinen som får budgeten.

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen