Ett genererat hero-titelkort med rubriken Qwen-Image-2.1 toppar båda bildarenorna, underrubriken Vad etiketten som #1 inom öppen källkod döljer, som visar två topplistekort märkta Image Edit Arena med ett rankningschip som visar 16 av 56 och ett poängchip som visar 1367, samt Text-to-Image Arena med ett rankningschip som visar 17 av 79 och ett poängchip som visar 1228, ovanför en tagg med texten qwen-research licence.
Guides & Insights

Qwen-Image-2.1 toppar båda bildarenorna: vad etiketten som #1 med öppen källkod döljer

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Teamet bakom Qwen-Image-2.1 tackade Arena för erkännandet, och erkännandet är äkta. Qwen-Image-2.1 är den högst poängsatta modellen på båda av Arenas bildtavlor som tavlorna inte märker som Proprietary: 1 367 på Image Edit och 1 228 på Text-to-Image, i ögonblicksbilden från den 22 september 2026. Varje rad ovanför den på båda tavlorna bär en Proprietary-tagg. Tre fakta som tillkännagivandet inte nämner är precis lika kontrollerbara som påståendet i sig — den totalplacering som poängen köper, den Preliminary flagga som båda raderna levereras med, och en licenssträng som lyder qwen-research i stället för Apache 2.0 på dess tidigare bildmodeller. Påståendet överlever kontakten med tavlorna. Det säger bara mindre än rubriken antyder.

Att läsa de två tavlorna sida vid sida

Arenapoäng är Elo-liknande betyg som byggs upp av blinda parvisa röster: en person ser två utdata, vet inte vilken modell som producerade vilken, och väljer. Det är en kategoriskt annan typ av bevis än en leverantörsbenchmark, vilket är anledningen till att ett påstående som vilar på det är värt att verifiera snarare än att upprepa. Båda resultattavlorna hämtades den 22 september 2026, och båda lästes rad för rad i stället för att skummas från rankningsgrafiken.

A screenshot of the LMArena Image Edit Arena leaderboard, captured September 22 2026, showing the board header reading 29,902,508 votes and 56 models, with ranks 13 to 22 visible: gemini-3-pro-image-preview at 1385, reve-2.1 at 1375, gpt-image-1.5-high-fidelity at 1370, qwen-image-2.1 at rank 16 with 1367 and a confidence interval of plus or minus 9 and 4,841 votes marked Preliminary, reve-2.0 at 1358, uni-1.1-max at 1334, grok-imagine-image at 1329, uni-1.1 at 1315, gemini-3.1-flash-lite-image at 1314 and qwen-image-2.0-pro-2026-06-22 at 1304, with every row above qwen-image-2.1 labelled Proprietary.

Image Edit-tavlan listar 56 modeller och 29 902 508 röster. Qwen-Image-2.1 ligger på plats 16 med en poäng på 1 367, ett konfidensintervall på ±9 och 4 841 röster. De femton raderna ovanför den — från gpt-image-2.5-sunburst på 1 526 ner till gpt-image-1.5-high-fidelity på 1 370 — är alla proprietära. Det gäller även de två raderna omedelbart under den, reve-2.0 på 1 358 och uni-1.1-max på 1 334.

A screenshot of the LMArena Text-to-Image Arena leaderboard, captured September 22 2026, showing the board header reading 6,258,152 votes and 79 models, with ranks 14 to 21 visible: gemini-3-pro-image-2k at 1246, gpt-image-1.5-high-fidelity at 1239, gemini-3-pro-image-preview at 1232, qwen-image-2.1 at rank 17 with 1228 and a confidence interval of plus or minus 11 and 2,843 votes marked Preliminary, ideogram-4.0-quality at 1204 labelled Ideogram Open Model, qwen-image-2.0-pro-2026-06-22 at 1191, uni-1.1-max at 1188 and mai-image-2 at 1183, with Proprietary labelling on every row above qwen-image-2.1.

Text-till-bild-tavlan samma dag listar 79 modeller och 6 258 152 röster. Qwen-Image-2.1 ligger på plats 17 med 1 228, ett konfidensintervall på ±11 och 2 843 röster. Samma mönster: de sexton raderna ovanför är Proprietära, och den första icke-proprietära raden nedanför är ideogram-4.0-quality på 1 204, märkt Ideogram Open Model.

Två detaljer från de raderna är värda att lyfta fram, eftersom de strider mot hur påståendet vanligtvis upprepas.

Rang och poäng berättar olika historier — 1 367 är den bästa icke-proprietära poängen på bildredigeringslistan, och den ligger också på sextonde plats, 159 poäng efter ledaren och 3 poäng från femtonde plats.
På en av listorna vinner Alibabas egen slutna modell — qwen-image-3.0-pro, märkt Proprietär, ligger på 1 254 i Text-to-Image, tjugosex poäng över qwen-image-2.1:s 1 228. På redigeringslistan slår den öppna modellen den tidigare proprietära qwen-image-2.0-pro-2026-06-22, som ligger på 1 304. Husets mästare är inte samma modell på båda listorna.
Avståndet till nästa öppna modell är stort på den ena listan och litet på den andra — på Image Edit är nästa icke-proprietära rad hunyuan-image-3.0-instruct på 1 302, sextiofem poäng efter; på Text-to-Image är det ideogram-4.0-quality på 1 204, tjugofyra poäng efter.

Licenssträngen gör mer arbete än rankningen.

Varje rad i Arena har en etikett för organisation och licens. Qwen-Image-2.1:s lyder Alibaba · qwen-research på båda tavlorna. Det är inte Apache 2.0-etiketten på Alibabas tidigare bildmodeller: qwen-image-edit med 1 241 och qwen-image-edit-2511 med 1 235 på redigeringstavlan är båda taggade Apache 2.0, liksom qwen-image-2512 med 1 125 och qwen-image med 1 057 på Text-to-Image. Leverantörens blogginlägg sluter samma cirkel genom att publicera vikterna under Qwen Research License Agreement daterat den 20 september 2026, som tillåter forskning och utvärdering men inte kommersiell användning.

Så den ärliga läsningen av "#1 öppen källkodsmodell" är snävare än det låter. På resultattavlans egen tvåvägsuppdelning — proprietär eller inte — är Qwen-Image-2.1 först. Enligt OSI:s definition av öppen källkod, som inte accepterar en begränsning av användningsområde, är den inte öppen källkod alls, och det är inte heller de flesta av modellerna som den jämförs med: samma resultattavlor har rader märkta flux-non-commercial-license, tencent-hunyuan-community, krea-2-community-license och Ideogram Open Model. Arenas "Open Source"-filter är en grov växel mellan proprietär och icke-proprietär. Det är ett användbart filter. Det är inte en licensgranskning.

Den distinktionen spelar större roll här än tvåpunktsmarginalerna, eftersom det är det enda som inte kan förändras med ännu en veckas röster. Om du vill ha en bildmodell med tillåtande licens från den här familjen idag, är Apache 2.0-raderna qwen-image-edit och qwen-image-edit-2511 – båda äldre, och båda mer än etthundra tjugo punkter lägre på samma redigeringstavla (1 241 och 1 235 mot 1 367). Den Qwen-bildmodell med öppen märkning som får bäst resultat och den kommersiellt användbara Qwen-bildmodellen är inte samma nedladdning.

Preliminärt betyder att siffran fortfarande kan ändras

Qwen-Image-2.1:s båda rader bär resultattavlans Preliminär-markering, som Arena tillämpar när en rad inte har samlat tillräckligt många röster för att poängen ska betraktas som fastställd. Röstsiffrorna är anledningen: 4 841 röster mot ett totalt antal på 29 902 508 på Image Edit, och 2 843 mot 6 258 152 på Text-to-Image. Som jämförelse har raderna runt den långt fler röster — gpt-image-1.5-high-fidelity har 589 013 röster på redigeringstavlan, och qwen-image-2.0-pro-2026-06-22 har 307 705 på Text-to-Image-tavlan.

Ett konfidensintervall på ±9 och ±11 för en modell som är tre dagar gammal är inte ett varningstecken; det är så en ny lansering ser ut. Men det innebär att den specifika ordningen i toppen av den öppna nivån kan förskjutas i takt med att röster ackumuleras, särskilt inom Text-to-Image där marginalen ned till nästa öppna rad är tjugofyra punkter.

Vad modellen är, i leverantörens eget datablad

Alibabas egen redogörelse beskriver en enhetlig text-till-bild- och redigeringsmodell med en visuell genereringskomponent på 7B parametrar byggd av 32 Single-Stream DiT-lager, inbyggd generering och redigering av transparenta bilder, stöd för upp till 10 referensbilder samt en inbyggd utdatagräns på 2048×2048 – nedladdningen av hela pipelinen är ungefär 33 GB. Transparensstödet är det minst vanliga inslaget på den listan; det är inte uppenbart att Arenas redigeringstavla mäter det, så en placering på tavlan utgör inte bevis i någon riktning för just den specifika förmågan.

Leverantörens främsta benchmark är Qwen-Image-Bench, där modellen rapporteras ligga på 60,28, före Nano Banana 2.0 på 59,82 och GPT Image 1.5 på 59,65. Det är en utvärdering som leverantören själv har utfört, utan reproduktion av tredje part, och marginalerna är under en poäng – en spridning som inte skulle stå sig vid ett byte av promptuppsättning. Det är värt att säga rakt ut: Arena-siffrorna ovan är andra människors röster, och Qwen-Image-Bench-siffrorna är Alibabas egna. De är inte samma typ av bevis och bör inte medelvärdesberäknas till ett enda intryck av modellen.

Driftsättningsstöd kom med releasen i stället för efter den: dag-noll-integrationer för modellen finns i ComfyUI, SGLang, vLLM-Omni, LightX2V och Diffusers-biblioteket, vilket innebär att den praktiska frågan för de flesta team inte är om modellen kan serveras utan om serveringskostnaden är rimlig.

Var ett sådant påstående landar om du behöver ett bild-API den här veckan

Här är det viktigt att vara precis om vår egen position. OrcaRouter routar inte Qwen-Image-2.1, eller någon Qwen-Image-modell oavsett version. Om det var Arena-poängen som övertygade dig, nås modellen via leverantörens eget API och flera tredjepartsplattformar, eller som en självhostad nedladdning – inte via oss. Vi har ingen Qwen-bildrutt att sälja till dig, och placeringen på resultattavlan är inte ett skäl att låtsas något annat.

Det vi routar är resten av den bildnivå som topplistorna rangordnar, och flera av raderna ovanför Qwen-Image-2.1 finns med där. OpenAI:s GPT-Image-2, GPT-Image-1.5 och GPT-Image-1-mini är tillgängliga, liksom Googles Imagen 4-nivåer och Gemini-endpoints för bildförhandsvisning, samt xAI:s Grok Imagine-bildendpoint. Den mixen är det praktiska svaret på ett påstående som detta. Om Arena hade placerat en öppen modell högst upp direkt, skulle ett byte vara en enradig kodändring på en enda nyckel. Det gjorde den inte – toppen av båda topplistorna är proprietär, och det intressanta beslutet står mellan en forskningslicensierad nedladdning och en hostad endpoint som du kan anropa idag.

Tre egenskaper hos plattformen spelar roll för det beslutet. Routning sker via en enda OpenAI-kompatibel endpoint över 200+ modeller, så att jämföra de hostade raderna med varandra innebär inte ett andra avtal eller ett andra SDK. Leverantörens listpris förs vidare utan påslag, vilket innebär att en ändring av leverantörspriset når din faktura samma dag som den tillkännages i stället för vid nästa avtalsförnyelse. Och automatisk failover mellan leverantörer innebär att en ny modell med få röster kan ligga bakom en etablerad i en reservkedja i stället för att bli ett produktionsberoende på dag tre – vilket ungefär är var Qwen-Image-2.1 befinner sig just nu.

Påståendet är sant, och tunnare än det framstår när man läser det.

Det Alibaba publicerade är verifierbart: i ögonblicksbilden från den 22 september 2026 av båda Arena-bildtavlorna är Qwen-Image-2.1 den modell med bäst poäng som inte är taggad Proprietary. Det som inlägget komprimerar är allt som nyanserar det – sextonde och sjuttonde totalt, en preliminär poäng baserad på några tusen röster och en forskningslicens som står i stället för den öppen källkodslicens som frasen för tankarna till.

A generated scoreboard titled Qwen-Image-2.1 - the scoreboard, with rows reading Image Edit Arena score 1367 at rank 16 of 56, Text-to-Image Arena score 1228 at rank 17 of 79, row status Preliminary on both boards, licence qwen-research non-commercial, Apache 2.0 sibling qwen-image-edit at 1241, and vendor benchmark Qwen-Image-Bench 60.28 unreproduced, above a footer reading Arena figures per the LMArena boards captured September 22 2026; Qwen-Image-Bench figure vendor-reported, no third-party reproduction.

Inget av detta gör resultatet litet. Att vara den första icke-proprietära raden på båda resultattavlorna, tre dagar efter släppet, är en verklig förändring av var den öppna nivån befinner sig — de Qwen-bildmodeller med tillåtande licens som föregår den ligger mer än etthundratjugo poäng efter på samma redigeringsresultattavla. Det är bara inte samma påstående som "den bästa bildmodellen som är öppen källkod", och skillnaden är en licensrad och en rangkolumn som tar ungefär en minut att kontrollera.