
Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6.100 blinde stemmen tegen nul
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Een van deze twee modellen is gerangschikt op basis van ongeveer 6.100 blinde menselijke vergelijkingen. Het andere is door niemand buiten zijn eigen lab gerangschikt. MAI-Image-2.5-Pro, Microsofts premium beeldmodel, staat op nummer één in de Artificial Analysis image editing arena met een Elo van 1.272 — het resultaat met de meeste stemmen in de categorie. Qwen-Image 2.1, dat het Qwen-Image-team op 20 september 2026 open source heeft gemaakt, heeft helemaal geen onafhankelijke score, en zal die pas krijgen zodra genoeg mensen het publiekelijk draaien om stemmen te genereren. Dat gat is het eigenlijke onderwerp van deze vergelijking, want het is het enige verschil tussen de twee modellen dat geen claim van een leverancier is. Al het andere — de architectuur, de resolutie, de prijs — is kenbaar maar onbewezen, en de twee modellen liggen op papier dicht genoeg bij elkaar dat het meetgat de beslissing zou moeten bepalen.
Wat de stemmen werkelijk zeggen, en wat niet.
Artificial Analysis voert blinde paarsgewijze vergelijkingen uit: twee modellen krijgen dezelfde prompt, stemmers kiezen de betere output, en Elo volgt uit de resultaten. Het is geen perfect instrument, maar het is het dichtst dat deze categorie heeft bij een gedeeld scorebord, en de steekproefgrootte is net zo belangrijk als het getal.
• MAI-Image-2.5-Pro — beeldbewerking nummer 1 met Elo 1.272 op ongeveer 6.100 vergelijkingen. Bij tekst-naar-afbeelding staat het op nummer 7 met Elo 1.292, achter GPT Image 2 (high) met 1.369, Reve 2.1 met 1.322, Nano Banana 2 met 1.320, GPT Image 1.5 (high) met 1.310 en MAI-Image-2.5 met 1.304.
• Qwen-Image 2.1 — geen vermelding op een van beide boards. Geen lage score; geen score. Op het moment van schrijven is de release één dag oud.
De vorm van die cijfers verdient een zorgvuldige lezing, want het is niet de vorm die de marketing suggereert. Het model van Microsoft staat werkelijk eerste in de categorie bewerken en werkelijk zevende in de categorie generatie. Dat is een specifieke, verdedigbare positie — een specialist in bewerken die zijn categorie aanvoert — en het is iets anders dan het beste beeldmodel zijn, wat het niet is. Ondertussen is het model dat het verslaat op tekst-naar-afbeelding GPT Image 2 (high), dat ook niet het nieuwste OpenAI-model op dit gebied is. Onafhankelijke leaderboards belonen het model dat het vaakst is gemeten, en in deze vergelijking is dat onmiskenbaar het model van Microsoft.
De enige specificatie waarin het open model onbetwist wint
Er is een concreet, niet-subjectief verschil tussen deze twee, en dat is resolutie.
• Qwen-Image 2.1 genereert native op 2K, met 2048×2048 als de gedocumenteerde standaard bij 40 inferentiestappen, zeven presets voor beeldverhoudingen, en RGBA-uitvoer met een echt alfakanaal in plaats van een matte.
• MAI-Image-2.5-Pro beperkt de uitvoer tot 1.048.576 pixels — ongeveer één megapixel. De opvallende specificaties staan elders: 32.000 invoertokens voor tekst, een contextvenster van 131k en 4.096 uitvoertokens, wat iets zegt over hoeveel instructie het kan opnemen, niet over hoeveel beeld het kan produceren.
Voor het meeste socialmedia- en productwerk is een limiet van één megapixel geen beperking. Voor drukwerk, voor compositing op groot formaat, voor alles waarbij een uitsnede intact moet blijven, is dat wel het geval. Dit is de enige dimensie in de hele vergelijking waar je naar een getal kunt wijzen en kunt zeggen dat het open model voorloopt — en let op: het is een architectonisch feit uit de modelkaart, geen kwaliteitsclaim. Qwen-Image 2.1 rendert op 2048×2048, of het nu iets oplevert dat de moeite waard is om naar te kijken of niet.
Prijs, en dat is waar de vergelijking ongemakkelijk wordt.
MAI-Image-2.5-Pro is geprijsd als een premiummodel en de cijfers zijn niet subtiel: $5 per miljoen tekstinvoertokens, $8 per miljoen afbeeldingsinvoertokens en $106 per miljoen afbeeldingsuitvoertokens. Bij een uitvoer van 1024 pixels komt dat neer op ongeveer $108,50 per duizend afbeeldingen. Ter vergelijking: dat is ongeveer 2,3× de kosten van MAI-Image-2.5 en ruwweg 5,4× MAI-Image-2.5-Flash, dus Microsoft heeft zijn eigen lijn bewust gesegmenteerd in plaats van de Pro-tier te prijzen als een incrementele upgrade.
Qwen-Image 2.1 heeft geen gehoste prijs, want er is geen gehost eindpunt — het is een download van gewichten onder een onderzoekslicentie. De kosten zijn je GPU-tijd, en de beperking is dat je wat het produceert niet legaal kunt verkopen. Het vergelijken van $108,50 per duizend afbeeldingen met "gratis gewichten" is het vergelijken van een dienst met een machine, en de eerlijke versie van die vergelijking is: de verbruiksprijs levert je een afgemeten, ondersteund, commercieel gelicentieerd model, en de gewichten leveren je een download van 33 GB en een licentiebestand dat zegt: uitsluitend niet-commercieel.
Die afweging is precies waar een routeringslaag zijn plaats verdient. OrcaRouter zet 200+ modellen achter één OpenAI-compatibel endpoint tegen de listprijs van de provider, zonder markup, met automatische failover tussen providers — dus een team dat een nog niet gemeten open model wil evalueren, hoeft daarvoor de productieomgeving er niet naartoe te verplaatsen, en omdat de listprijs wordt doorgegeven, komt een eventuele prijswijziging van een leverancier voor een gerouteerd model dezelfde dag nog bij ons terecht, in plaats van pas bij de volgende contractvernieuwing. Noch MAI-Image-2.5-Pro noch Qwen-Image 2.1 behoort tot de modellen die we vandaag routeren, en dit stuk zal niet het tegendeel suggereren. De beeldlijn die we wél aanbieden is OpenAI's GPT-Image-familie, Google's Imagen 4-tiers en Gemini-beeldpreviews, en xAI's Grok Imagine-beeldeindpoint.

Waar de claims van de leverancier staan, en hoeveel waarde je eraan moet hechten
Beide leveranciers publiceren cijfers die geen enkele derde partij heeft gereproduceerd, en ze moeten in beide richtingen met hetzelfde scepticisme worden gelezen.
• De beweringen van Microsoft — 96,8% nauwkeurigheid bij tekstweergave in het Engels, Chinees, Japans, Koreaans en Spaans; 27% betere naleving van prompts dan GPT-Image-1.5; 94% consistentie van personages over meerdere afbeeldingen; en tot 84–89% lagere GPU-kosten in specifieke Microsoft-interne scenario's. De laatste is degene waar je voorzichtig mee moet zijn: die beschrijft Microsofts eigen serverconfiguratie, niet iets wat een klant kan verifiëren.
• Claims van Alibaba — de blogpost over Qwen-Image 2.1 bevat een vergelijkingsgrafiek van Qwen-Image-Bench, en de cijfers daarin zijn afkomstig van de leverancier zelf. In berichtgeving van derden circuleert ook een getal dat het model beschrijft als een transformer met 20 lagen, wat in tegenspraak is met de 32-laags single-stream-DiT van de modelkaart; de modelkaart is de primaire bron en het getal van 32 lagen is het getal dat je moet aanhouden.
Het verschil tussen de twee situaties is niet de eerlijkheid van een van beide leveranciers. Het is dat het model van Microsoft onafhankelijk is gemeten en dat van Alibaba niet, dus de beweringen van Microsoft kunnen aan iets worden getoetst en die van Alibaba kunnen nog nergens aan worden getoetst.
Waarvoor elk dient
Samen gelezen concurreren deze niet om dezelfde plek.
• MAI-Image-2.5-Pro is het bewerkingsinstrument. Het leidt het bewerkingsboard op basis van een groot aantal stemmen, het accepteert een lange instructie (32k tekstinvoertokens, 131k context), het is commercieel gelicentieerd en het is nu beschikbaar als openbare preview op Microsoft Foundry en de MAI Playground. Als je werk iteratieve beeldcorrectie is en je moet weten voordat je je vastlegt dat het de beste beschikbare is voor die taak, dan is dit het gemeten antwoord, en het kost ongeveer $108,50 per duizend afbeeldingen.
• Qwen-Image 2.1 is het open onderzoeksartefact. Het rendert groter, het levert een inspecteerbaar checkpoint voor het herschrijven van prompts mee naast het beeldmodel, het accepteert tot 10 referentieafbeeldingen met lokale bewerkingen via cirkel, geschilderde annotatie of masker, en het is gratis te downloaden en illegaal om het te verkopen. Als je werk evaluatie, benchmarking of voortbouwen op gewichten die je kunt lezen is, dan is het het interessantere object — en je doet dat werk zonder een leaderboard dat je vertelt of het deugt.
Er is ook een timingasymmetrie die het benoemen waard is. MAI-Image-2.6 ging op 19 augustus 2026 in private preview, wat betekent dat het model bovenaan de bewerkingsranglijst al een generatie achterloopt op wat Microsoft op het punt staat uit te brengen. Qwen-Image 2.1 daarentegen zit op dag één, met een early-accessprogramma dat zijn testers vroeg om uiterlijk 29 september te publiceren. Beide ranglijsten in deze vergelijking zullen er binnen een maand anders uitzien.


Wat zou het beslechten?
Eén ding: Qwen-Image 2.1 verschijnt op een leaderboard. Alles in dit artikel dat niet de resolutielimiet of de prijs is, is een claim van het ene of het andere lab, en de hele reden dat MAI-Image-2.5-Pro met een stalen gezicht kan worden aanbevolen, is dat 6.100 mensen die niet voor Microsoft werkten naar de output keken naast iets anders en die verkozen. Dat is de standaard waaraan het open model niet voldoet, en de standaard waaraan het zou moeten worden gehouden.
Tot dan is de praktische conclusie eenvoudig. Als je vandaag een bewerkingsmodel nodig hebt, onder een commerciële licentie, met een scorebord erachter, is het antwoord dat van Microsoft en kost het ongeveer $108,50 per duizend afbeeldingen. Als je wilt ontdekken of een 7B open-weightsmodel met native 2K-uitvoer en een inspecteerbare prompt-rewriter beter is, moet je zelf de meting doen — en het nuttigste wat je met het resultaat kunt doen, is het publiceren, want de hele categorie heeft momenteel één datapunt te weinig.
