Ett genererat hero-kort för artikeln ”Qwen-Image 2.1 vs Qwen-Image 3.0” som visar två rundade modellkort märkta ”Qwen-Image 2.1” och ”Qwen-Image 3.0” med datummarkeringarna 20 sep 2026 och 21 jul 2026, en nedladdningsikon på det ena och en molnikon på det andra, samt ett band med texten ”Det lägre numret är den nyare modellen”.
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0: Det lägre numret är den nyare modellen

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Börja med det som förvirrar alla. Qwen-Image 2.1 är nyare än Qwen-Image 3.0. Leverantören släppte Qwen-Image 3.0 den 21 juli 2026 och gjorde den allmänt tillgänglig den 5 augusti. Leverantören släppte Qwen-Image 2.1 den 20 september 2026 – sju veckor senare, och en minorversion lägre. Numreringen är inte en sekvens; det är två olika produktlinjer som delar ett namn, och det enskilt mest användbara faktumet om någon av dem är att de intar motsatta ståndpunkter i frågan som avgör om du kan bygga vidare på dem. Qwen-Image 3.0 är stängd och hostad, utan vikter, utan licens och utan teknisk rapport. Qwen-Image 2.1 har öppna vikter, kan laddas ner idag, under en forskningslicens som endast tillåter icke-kommersiell användning.

Två produkter som råkar ha samma namn

Qwen-Image-familjen har nu intagit tre olika licenspositioner under fjorton månader, och att lägga fram dem undanröjer det mesta av förvirringen:

Qwen-Image 1.0 och 2.0 — Apache 2.0 öppna vikter på Hugging Face och ModelScope, tekniska rapporter på lanseringsdagen, möjliga att självhosta, finjustera och kvantisera.

Qwen-Image 3.0 — stängd. Inga vikter, ingen angiven licens, inget modellkort, ingen teknisk rapport, ingen publicerad benchmarktabell. Nås endast via ett hostat API, i Pro- och Standard-utgåvorna.

Qwen-Image 2.1 — återigen öppna vikter, men under Qwen Research License Agreement daterat den 20 september 2026, som beviljar rättigheter "ENDAST FÖR ICKE-KOMMERSIELLA ÄNDAMÅL" och hänvisar kommersiell användning till en separat förhandlad licens.

Läs det som ett mönster snarare än en tidslinje, och formen är tydlig: Alibaba behandlar inte längre "öppen" som ett binärt begrepp. Qwen-Image 2.1 är varken den tillåtande utgåvan som 1.0 och 2.0 var, eller den stängda utgåvan som 3.0 var. Det är en tredje position – vikter du kan granska, köra och ändra, med en kommersiell grind fastskruvad framtill.

Vad varje modell faktiskt är

Qwen-Image 2.1 — en enhetlig modell för text-till-bild-generering och bildredigering med 7B parametrar i sin visuella genereringskomponent, byggd som en 32-lagers single-stream-DiT. En Qwen3-VL 8B-textkodare och en 64-kanals RGBA-VAE med 16× rumslig komprimering finns vid sidan av; hela nedladdningen är cirka 33 GB, där textkodaren står för mer än hälften. Block-kausal uppmärksamhet med en kausal mask på token-nivå för text och en dubbelriktad mask på chunk-nivå för bildgenerering, plus återanvändning av prefix-KV-cache för redigering av flera bilder. Inbyggd 2K, med standardvärdet 2048×2048 vid 40 steg, med sju förinställningar för bildförhållande.

Qwen-Image 3.0 — en sluten hostad modell i Pro- och Standardversioner som levererar bildgenerering och bildredigering via ett enda API. Alibabas lanseringsmaterial hävdar prompts på upp till cirka 4 500 tokens, läsbar text ned till ungefär 10 pixlar och täckning av 12 språk över fler än 20 typsnitt, med utdata upp till 2048×2048 och upp till sex bilder per anrop. Inget parameterantal publicerades; den vitt spridda siffran ~20B MMDiT rapporteras snarare än bekräftas.

Den arkitektoniska skillnaden som spelar störst roll i praktiken är inte storleken — det är var modellen körs och vad du kan göra med den. Qwen-Image 2.1 kommer som filer du kan granska, kvantisera, finjustera på privata data och köra på din egen hårdvara, med en pull request för SGLang-stöd som slogs samman tre dagar innan vikterna ens hade landat. Qwen-Image 3.0 kommer som en slutpunkt. Du kan inte kvantisera den, du kan inte finjustera den, och du kan inte köra den någon annanstans än där Alibaba kör den.

Redigering är där de två går isär som mest

Båda modellerna utför generering och redigering i ett och samma system, så den intressanta jämförelsen ligger i redigeringsdetaljerna – och här är den nyare, mindre modellen den mer kapabla på pappret.

Referensbilder — Qwen-Image 2.1 tar emot upp till 10 indatareferenser. Qwen-Image 3.0:s Pro-dokumentation beskriver stöd för 1–3 indatabilder.

Lokal redigeringskontroll — Qwen-Image 2.1 stöder cirklar, målade annoteringar och en separat mask som anges som egen indata så att originalbilden förblir omarkerad. Qwen-Image 3.0:s dokumenterade redigeringsväg omfattar lokal omskrivning, innehållsutökning, stilöverföring och generering av flera kameravinklar, utan ett publicerat maskbaserat arbetsflöde.

Transparens — Qwen-Image 2.1 genererar och redigerar RGBA-bilder inbyggt, redigerar text i ett transparent lager och extraherar ett motiv från ett RGB-fotografi till ett transparent lager. Qwen-Image 3.0:s tillkännagivande innehåller inget påstående om transparens.

Prompt-omskrivning — Qwen-Image 2.1 levererar två dedikerade omskrivningscheckpunkter, båda finjusterade Qwen3.5-VL 9B-modeller, en för text-till-bild och en för redigering, med omskrivningskoden och systemprompten publicerade. Qwen-Image 3.0:s prompthantering är en svart låda bakom API:et.

Ekosystem — Qwen-Image 2.1 har stöd från dag ett i Diffusers, ComfyUI, vLLM-Omni, SGLang och LightX2V, plus AMD ROCm- och FlagOS-vägar. Qwen-Image 3.0 har ett API.

Den där sista raden är inte en retorisk finess. För ett team vars pipeline ligger i ComfyUI eller vars inferensstack är vLLM, är skillnaden mellan en modell med en sammanslagen pipeline-klass och en modell med en HTTP-slutpunkt skillnaden mellan en integrationsuppgift och en omskrivning.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

Priset, och det som priset inte fångar

Qwen-Image 3.0 har det enda publicerade priset av de två: hos leverantörens molntjänst listas Pro till cirka 0,04 USD per bild och Standard till cirka 0,03 USD, med inhemska konsumentpriser som börjar nära ¥0,18. Det är lanseringssiffror och har inte oberoende granskats. Qwen-Image 2.1 har ingen publicerad taxa för hosting alls – den är en nedladdning, och kostnaden är vad din egen GPU-tid kostar.

De två raderna är inte jämförbara, och att låtsas något annat är det vanligaste misstaget i den här jämförelsen. Ett pris per bild täcker modellen, serveringsinfrastrukturen, skalningen och någon annans upptid. En nedladdning av vikter täcker inget av detta. Den rätta frågan är inte vilket tal som är mindre; den är om du har den operativa kapaciteten att köra en modellstack på 33 GB, och om licensen på den billiga sidan tillåter vad du planerar att göra med den.

Vilket för licensen tillbaka till centrum av jämförelsen, där den hör hemma. Qwen-Image 3.0:s villkor är inte publicerade, vilket är ett problem i sig för reglerat arbete eller byråarbete – det finns inget dokument att citera. Qwen-Image 2.1:s villkor är publicerade, och de säger icke-kommersiell. Mellan en otydlig licens och en klart begränsande är den klart begränsande lättare att planera utifrån, eftersom man åtminstone vet vilket samtal man behöver ha.

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

Vilken du bör välja

Du behöver texttung produktionsbild och vill att någon annan sköter det — Qwen-Image 3.0 passar, med förbehållet att dess främsta siffror för textrendering är leverantörens egna påståenden och att de oberoende tester som finns beskriver att text i liten stil fortfarande förvrängs i vissa fall.

Du behöver köra modellen själv, finjustera den eller hålla data på din egen hårdvara — Qwen-Image 2.1 är det enda alternativet av de två, och forskningslicensen är priset för inträde.

Du behöver transparenta tillgångar, produkturklipp eller fler än tre referensbilder — Qwen-Image 2.1 är, enligt de publicerade specifikationerna, det starkare verktyget, och det är inte i närheten vad gäller antalet referenser.

Du behöver kommersiella rättigheter och permissiv licensiering — ingen av dessa är din modell. Qwen-Image 3.0 har inga publicerade villkor alls, och Qwen-Image 2.1 kräver en förhandlad kommersiell licens. Apache-2.0-utgåvorna i den här familjen är de tidigare Qwen-Image 1.0 och 2.0.

Den sista raden är den som är värd att stanna upp vid, eftersom den beskriver en krympande uppsättning. En licens som redan har beviljats ändras inte retroaktivt, så Apache-2.0-utgåvorna av Qwen-Image förblir användbara på sina ursprungliga villkor. Men om du planerar en kommersiell bildpipeline utifrån antagandet att den nyaste Qwen-Image kommer att ha en permissiv licens, utgör de tre senaste utgåvorna bevis mot det antagandet.

Att köra endera av dem utan att satsa hela pipelinen på det

Båda dessa modeller är, av olika skäl, besvärliga att sätta bakom en produktionsväg i dag – den ena på grund av en licens, den andra på grund av en svart låda och ett opublicerat parameterantal. Det är precis den situation som ett routinglager är byggt för. OrcaRouter placerar 200+ modeller bakom en och samma OpenAI-kompatibla endpoint till leverantörens listpris utan påslag, med automatisk failover mellan leverantörer och en routing-DSL som låter dig komponera flera modeller till ett enda anrop, så att en ny eller krånglig modell kan stå bredvid en beprövad i stället för framför den. Modellfusion tar samma idé ett steg längre, genom att köra en panel av modeller tillsammans och låta dig jämföra dem på dina egna prompter i stället för på ett lanseringsdiagram.

Varken Qwen-Image 2.1 eller Qwen-Image 3.0 finns bland de modeller vi routar idag, och den här artikeln kommer inte att antyda något annat. De bildmodeller vi faktiskt routar – OpenAI:s GPT-Image-serie, Googles Imagen 4-nivåer och Gemini-bildförhandsvisningar samt xAIs Grok Imagine-bildendpoint – är vad en failover-väg faktiskt skulle byggas från medan du utvärderar Qwen-paret på dina egna villkor.

Det man bör hålla utkik efter är snävare än det verkar. Alibaba har nu visat att de kommer att släppa öppna vikter, stängda hostade modeller och nedladdningar med forskningslicens inom samma familj under samma kvartal. Nästa lansering kommer inte att berätta vilket mönster som segrade. Licensfilen kommer att göra det.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.