Hero-kort för jämförelsen mellan Qwen-Image 2.1, en modell med öppna vikter utan oberoende poäng, och MAI-Image-2.5-Pro, den uppmätta ledaren i Artificial Analysis bildredigeringsarena vid Elo 1 272
Guides & Insights

Qwen-Image 2.1 mot MAI-Image-2.5-Pro: 6 100 blinda röster mot noll

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En av dessa två modeller har rankats genom ungefär 6 100 blinda mänskliga jämförelser. Den andra har inte rankats av någon utanför dess eget labb. MAI-Image-2.5-Pro, Microsofts premiumbildmodell, ligger på första plats på Artificial Analysis arena för bildredigering med en Elo på 1 272 – resultatet med flest röster i kategorin. Qwen-Image 2.1, som Qwen-Image-teamet släppte som öppen källkod den 20 september 2026, har ingen oberoende poäng alls och kommer inte att få någon förrän tillräckligt många människor kör den offentligt för att generera röster. Den klyftan är det egentliga ämnet för denna jämförelse, eftersom den är den enda skillnaden mellan de två modellerna som inte är ett leverantörspåstående. Allt annat – arkitekturen, upplösningen, priset – är känt men obevisat, och de två modellerna ligger tillräckligt nära varandra på papperet för att mätklyftan bör styra beslutet.

Vad rösterna faktiskt säger, och vad de inte säger

Artificial Analysis genomför blinda parvisa jämförelser: två modeller får samma prompt, röstarna väljer den bättre outputen och Elo följer av resultaten. Det är inte ett perfekt instrument, men det är det närmaste den här kategorin kommer en gemensam resultattavla, och urvalsstorleken spelar lika stor roll som siffran.

MAI-Image-2.5-Pro — bildredigering #1 vid Elo 1 272 på ungefär 6 100 jämförelser. I text-till-bild ligger den på #7 med Elo 1 292, bakom GPT Image 2 (high) vid 1 369, Reve 2.1 vid 1 322, Nano Banana 2 vid 1 320, GPT Image 1.5 (high) vid 1 310 och MAI-Image-2.5 vid 1 304.

Qwen-Image 2.1 — ingen post på någon av listorna. Inte en låg poäng; ingen poäng alls. Släppet är en dag gammalt när detta skrivs.

Formen på de där siffrorna är värd att läsa noggrant, för den är inte den form som marknadsföringen antyder. Microsofts modell är verkligen först inom redigering och verkligen sjunde inom generering. Det är en specifik, försvarbar position – en redigeringsspecialist som leder sin kategori – och det är något annat än att vara den bästa bildmodellen, vilket den inte är. Samtidigt är modellen som slår den på text-till-bild GPT Image 2 (high), som inte heller är den nyaste OpenAI-modellen inom detta område. Oberoende rankningslistor belönar den modell som har mätts mest, och i den här jämförelsen är det entydigt Microsofts modell.

Den enda specifikationen där den öppna modellen vinner ohotat

Det finns en konkret, icke-subjektiv skillnad mellan dessa två, och det är upplösningen.

Qwen-Image 2.1genererar nativt i 2K, med 2048×2048 som dokumenterad standard vid 40 inferenssteg, sju förinställningar för bildförhållande och RGBA-utdata med en riktig alfakanal i stället för en mask.

MAI-Image-2.5-Pro begränsar utdata till 1 048 576 pixlar – ungefär en megapixel. Dess främsta specifikationssiffror finns någon annanstans: 32 000 token för textinmatning, ett kontextfönster på 131k och 4 096 utdatatoken, vilket säger något om hur mycket instruktioner den kan absorbera, inte hur mycket bild den kan avge.

För de flesta arbeten inom sociala medier och produkt är ett tak på en megapixel inte en begränsning. För tryck, för storformatskomposition, för allt där en beskärning måste hålla, är det en begränsning. Detta är den enda dimensionen i hela jämförelsen där man kan peka på en siffra och säga att den öppna modellen ligger före — och notera att det är ett arkitektoniskt faktum från modellkortet, inte ett kvalitetsanspråk. Qwen-Image 2.1 kommer att rendera i 2048×2048 oavsett om den renderar något som är värt att titta på.

Priset, vilket är där jämförelsen blir obehaglig

MAI-Image-2.5-Pro är prissatt som en premiummodell och siffrorna är inte subtila: 5 USD per miljon textinmatningstoken, 8 USD per miljon bildinmatningstoken och 106 USD per miljon bildutmatningstoken. Vid en utdata på 1024 pixlar motsvarar det ungefär 108,50 USD per tusen bilder. För att sätta det i perspektiv är det ungefär 2,3× kostnaden för MAI-Image-2.5 och ungefär 5,4× MAI-Image-2.5-Flash, så Microsoft har medvetet segmenterat sin egen serie i stället för att prissätta Pro-nivån som en gradvis uppgradering.

Qwen-Image 2.1 har inget hostat pris, eftersom det inte finns någon hostad slutpunkt – det är en nedladdning av vikter under en forskningslicens. Kostnaden är din GPU-tid, och begränsningen är att du inte lagligt kan sälja det den producerar. Att jämföra 108,50 USD per tusen bilder med ”fria vikter” är att jämföra en tjänst med en maskin, och den ärliga versionen av den jämförelsen är: det avgiftsmätta priset ger dig en uppmätt, supportad, kommersiellt licensierad modell, och vikterna ger dig en nedladdning på 33 GB och en licensfil som säger endast icke-kommersiell användning.

Det bytet är precis där ett routningslager förtjänar sin plats. OrcaRouter frontar 200+ modeller bakom en enda OpenAI-kompatibel endpoint till leverantörens listpris utan påslag, med automatiskt failover mellan leverantörer — så ett team som vill utvärdera en omätt öppen modell behöver inte flytta produktionen till den för att göra det, och eftersom listpriset förs vidare oförändrat landar varje leverantörsprisändring på en routad modell hos oss samma dag i stället för vid nästa avtalsförnyelse. Varken MAI-Image-2.5-Pro eller Qwen-Image 2.1 finns bland de modeller vi routar i dag, och den här artikeln kommer inte att påstå något annat. Den bildlinje vi faktiskt frontar är OpenAIs GPT-Image-familj, Googles Imagen 4-nivåer och Geminis bildförhandsvisningar samt xAIs Grok Imagine-bildendpoint.

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Var leverantörens påståenden ligger, och hur mycket vikt man bör ge dem

Båda leverantörerna publicerar siffror som ingen tredje part har reproducerat, och de bör läsas med samma skepsis i båda riktningarna.

Microsofts påståenden — 96,8 % noggrannhet för textåtergivning över engelska, kinesiska, japanska, koreanska och spanska; 27 % bättre promptföljsamhet än GPT-Image-1.5; 94 % karaktärskonsistens över flera bilder; och upp till 84–89 % lägre GPU-kostnad i specifika Microsoft-interna scenarier. Det sista är det man bör vara försiktig med: det beskriver Microsofts egen serving-konfiguration, inte något som en kund kan verifiera.

Alibabas påståenden — blogginlägget om Qwen-Image 2.1 innehåller ett jämförelsediagram från Qwen-Image-Bench, och siffrorna i det är leverantörens egna. Det cirkulerar också en siffra i tredjepartsrapportering som beskriver modellen som en 20-lagers transformer, vilket motsäger modellkortets 32-lagers single-stream-DiT; modellkortet är den primära källan och 32-lagerssiffran är den man bör använda.

Skillnaden mellan de två situationerna är inte ärligheten hos endera leverantören. Det är att Microsofts modell har mätts oberoende och Alibabas inte har det, så Microsofts påståenden kan kontrolleras mot något och Alibabas kan ännu inte kontrolleras mot något.

Vad var och en är till för

Lästa tillsammans konkurrerar de inte om samma plats.

MAI-Image-2.5-Pro är redigeringsinstrumentet. Det toppar redigeringstabellen på ett stort röstunderlag, det tar emot en lång instruktion (32k textinmatningstokens, 131k kontext), det är kommersiellt licensierat och det är nu tillgängligt som offentlig förhandsversion på Microsoft Foundry och MAI Playground. Om ditt arbete är iterativ bildkorrigering och du behöver veta innan du satsar att det är det bästa som finns för den uppgiften, är detta det uppmätta svaret, och det kostar cirka 108,50 USD per tusen bilder.

Qwen-Image 2.1 är den öppna forskningsartefakten. Den renderar större, den levereras med en granskningsbar checkpoint för promptomskrivning tillsammans med bildmodellen, den tar emot upp till 10 referensbilder med lokala redigeringar via cirkel, målad annotering eller mask, och den är gratis att ladda ner och olaglig att sälja med. Om ditt arbete är utvärdering, benchmarking eller att bygga vidare på vikter du kan läsa, är det det mer intressanta objektet – och du utför det arbetet utan en resultattavla som talar om för dig om det är något att ha.

Det finns också en tidsmässig asymmetri som är värd att nämna. MAI-Image-2.6 gick in i privat förhandsvisning den 19 augusti 2026, vilket innebär att modellen i toppen av redigeringstavlan redan är en generation efter det som Microsoft förbereder att släppa. Qwen-Image 2.1 är däremot på dag ett, med ett program för tidig åtkomst som bad sina testare att publicera senast den 29 september. Båda resultattavlorna i den här jämförelsen kommer att se annorlunda ut inom en månad.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Vad skulle avgöra det

En sak: Qwen-Image 2.1 som dyker upp på en topplista. Allt i den här artikeln som inte är upplösningstaket eller priset är ett påstående från det ena eller andra labbet, och hela anledningen till att MAI-Image-2.5-Pro kan rekommenderas med rak min är att 6 100 personer som inte arbetade för Microsoft tittade på dess utdata bredvid något annat och föredrog det. Det är den standard som den öppna modellen inte har uppfyllt, och den standard som den bör hållas till.

Fram till dess är den praktiska tolkningen enkel. Om du behöver en redigeringsmodell i dag, med en kommersiell licens och en resultattavla bakom sig, är svaret Microsofts, och den kostar omkring 108,50 USD per tusen bilder. Om du vill ta reda på om en 7B-modell med öppna vikter, nativ 2K-utdata och en inspekterbar prompt-omskrivare är bättre, måste du mäta själv – och det mest användbara du kan göra med resultatet är att publicera det, eftersom hela kategorin för närvarande saknar en datapunkt.