
Qwen-Image-2.1 voert beide beeldarena's aan: wat het #1 open-source label verbergt
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het team achter Qwen-Image-2.1 bedankte de Arena voor de erkenning, en die erkenning is terecht. Qwen-Image-2.1 is het model met de hoogste score op beide Arena-afbeeldingsleaderboards waarop de leaderboards het niet als Proprietary bestempelen: 1.367 op Image Edit en 1.228 op Text-to-Image, in de snapshot van 22 september 2026. Elke rij erboven op beide leaderboards draagt een Proprietary-label. Drie feiten die de aankondiging niet vermeldt, zijn even controleerbaar als de bewering zelf — de algemene rang die die scores opleveren, de Preliminary-markering die beide rijen hebben, en een licentietekst met de waarde qwen-research in plaats van de Apache 2.0 op zijn eerdere afbeeldingsmodellen. De bewering doorstaat contact met de leaderboards. Deze zegt alleen minder dan de kop impliceert.
De twee borden naast elkaar lezen
Arena-scores zijn Elo-achtige ratings die zijn opgebouwd uit blinde paarsgewijze stemmen: iemand ziet twee outputs, weet niet welk model welke heeft geproduceerd, en kiest. Dat is een categorisch andere bewijsklasse dan een leveranciersbenchmark, en daarom is een bewering die daarop steunt het waard om te verifiëren in plaats van te herhalen. Beide ranglijsten werden op 22 september 2026 vastgelegd, en beide werden rij voor rij gelezen in plaats van vluchtig doorgenomen vanaf de rangschikkingsgrafiek.

Het Image Edit-bord vermeldt 56 modellen en 29,902,508 stemmen. Qwen-Image-2.1 neemt de 16e plaats in met een score van 1,367, een betrouwbaarheidsinterval van ±9 en 4,841 stemmen. De vijftien rijen erboven — van gpt-image-2.5-sunburst op 1,526 tot gpt-image-1.5-high-fidelity op 1,370 — zijn allemaal Proprietary. Dat geldt ook voor de twee rijen er direct onder, reve-2.0 op 1,358 en uni-1.1-max op 1,334.

De Text-to-Image-ranglijst van dezelfde dag vermeldt 79 modellen en 6.258.152 stemmen. Qwen-Image-2.1 staat op plaats 17 met 1.228, met een betrouwbaarheidsinterval van ±11 en 2.843 stemmen. Hetzelfde patroon: de zestien rijen erboven zijn Propriëtair, en de eerste niet-propriëtaire rij eronder is ideogram-4.0-quality met 1.204, aangeduid als Ideogram Open Model.
Twee details uit die rijen zijn het uitlichten waard, omdat ze haaks staan op de manier waarop de bewering gewoonlijk wordt herhaald.
• Rang en score vertellen een ander verhaal — 1.367 is het beste non-Proprietary-getal op het leaderboard voor beeldbewerking, en het is tegelijk de zestiende plaats, 159 punten achter de koploper en 3 punten verwijderd van de vijftiende plaats.
• Op het ene leaderboard wint Alibaba's eigen gesloten model — qwen-image-3.0-pro, getagd als Proprietary, staat op 1.254 bij Text-to-Image, zesentwintig punten boven de 1.228 van qwen-image-2.1. Op het bewerkingsleaderboard verslaat het open model de eerdere propriëtaire qwen-image-2.0-pro-2026-06-22 op 1.304. De huiskampioen is niet op beide leaderboards hetzelfde model.
• De kloof naar het volgende open model is groot op het ene leaderboard en klein op het andere — op Image Edit is de volgende non-Proprietary-rij hunyuan-image-3.0-instruct op 1.302, vijfenzestig punten daarachter; op Text-to-Image is dat ideogram-4.0-quality op 1.204, vierentwintig punten daarachter.
De licentiestring doet meer werk dan de ranking
Elke Arena-rij heeft een organisatie- en licentielabel. Het label van Qwen-Image-2.1 luidt Alibaba · qwen-research op beide boards. Dat is niet het Apache 2.0-label op Alibaba's eerdere beeldmodellen: qwen-image-edit met 1.241 en qwen-image-edit-2511 met 1.235 op het editing board zijn beide gemarkeerd als Apache 2.0, net als qwen-image-2512 met 1.125 en qwen-image met 1.057 op Text-to-Image. De blogpost van de leverancier sluit dezelfde cirkel met de publicatie van de gewichten onder de Qwen Research License Agreement van 20 september 2026, die onderzoek en evaluatie toestaat en geen commercieel gebruik.
De eerlijke lezing van "#1 open-sourcemodel" is dus beperkter dan het klinkt. Op de eigen tweedeling van het bord — Proprietary of niet — staat Qwen-Image-2.1 op de eerste plaats. Volgens de OSI-definitie van open source, die geen beperking op het gebruiksgebied accepteert, is het helemaal geen open source, en de meeste modellen waarmee het wordt vergeleken evenmin: op dezelfde borden staan rijen met het label flux-non-commercial-license, tencent-hunyuan-community, krea-2-community-license en Ideogram Open Model. Het filter "Open Source" van de Arena is een grove schakelaar tussen proprietary en niet-proprietary. Het is een nuttige schakelaar. Het is geen licentiereview.
Dat onderscheid is hier belangrijker dan de tweepuntsmarges, want het is het enige dat niet kan veranderen met nog een week stemmen. Als je vandaag een permissief gelicentieerd beeldmodel uit deze familie wilt, zijn de Apache 2.0-rijen qwen-image-edit en qwen-image-edit-2511 — beide ouder, en beide meer dan honderdtwintig punten lager op dezelfde bewerkingsranglijst (1.241 en 1.235 tegen 1.367). Het best scorende open-gelabelde Qwen-beeldmodel en het commercieel bruikbare Qwen-beeldmodel zijn niet dezelfde download.
Voorlopig betekent dat het nummer nog kan veranderen
Beide rijen van Qwen-Image-2.1 dragen de Preliminary-markering van de ranglijst, die de Arena toepast wanneer een rij niet genoeg stemmen heeft verzameld om de score als definitief te beschouwen. De stemmenaantallen zijn de reden: 4.841 stemmen tegenover een ranglijsttotaal van 29.902.508 voor Image Edit, en 2.843 tegenover 6.258.152 voor Text-to-Image. Ter vergelijking: de rijen eromheen hebben veel meer stemmen — gpt-image-1.5-high-fidelity heeft 589.013 stemmen op de bewerkingsranglijst, en qwen-image-2.0-pro-2026-06-22 heeft er 307.705 op de Text-to-Image-ranglijst.
Een betrouwbaarheidsinterval van ±9 en een van ±11 voor een model dat drie dagen oud is, is geen waarschuwingssignaal; het is hoe een nieuwe release eruitziet. Maar het betekent wel dat de specifieke volgorde bovenaan de open tier kan verschuiven naarmate er meer stemmen binnenkomen, vooral bij Text-to-Image, waar de marge ten opzichte van de volgende open rij vierentwintig punten is.
Wat het model is, op het eigen blad van de leverancier
Alibaba's eigen beschrijving schetst een uniform model voor tekst-naar-afbeelding en bewerken, met een visuele generatiecomponent van 7B parameters, opgebouwd uit 32 Single-Stream DiT-lagen, native generatie en bewerking van transparante afbeeldingen, ondersteuning voor maximaal 10 referentieafbeeldingen en een native uitvoerplafond van 2048×2048 — de download van de volledige pipeline is ongeveer 33 GB. De transparantieondersteuning is het minst voorkomende onderdeel op die lijst; het is niet duidelijk of Arena's editing board die meet, dus een positie op dat board is geen bewijs voor of tegen die specifieke capaciteit.
De belangrijkste benchmark van de leverancier is Qwen-Image-Bench, waarop het model op 60,28 wordt gerapporteerd, voor Nano Banana 2.0 met 59,82 en GPT Image 1.5 met 59,65. Dat is een evaluatie die door de leverancier zelf is uitgevoerd, zonder reproductie door derden, en de marges liggen onder één punt — een verschil dat een wijziging van de promptset niet zou overleven. Het is de moeite waard om het ronduit te zeggen: de Arenacijfers hierboven zijn de stemmen van anderen, en de Qwen-Image-Bench-cijfers zijn die van Alibaba zelf. Het zijn niet hetzelfde soort bewijs en ze moeten niet worden gemiddeld tot één indruk van het model.
Deploymentondersteuning kwam samen met de release in plaats van erna: day-zero-integraties voor het model bestaan in ComfyUI, SGLang, vLLM-Omni, LightX2V en de Diffusers-bibliotheek, wat betekent dat de praktische vraag voor de meeste teams niet is of het model kan worden geserveerd, maar of de serveerkosten passen.
Waar een claim als deze landt als je deze week een image API nodig hebt
Het is hier van belang precies te zijn over onze eigen positie. OrcaRouter routeert Qwen-Image-2.1 niet, noch enig Qwen-Image-model van welke versie dan ook. Als de Arena-scores je hebben overtuigd: het model is bereikbaar via de eigen API van de leverancier en diverse platforms van derden, of als een zelfgehoste download — niet via ons. We hebben geen Qwen-imageroute om aan je te verkopen, en de positie op het leaderboard is geen reden om het tegendeel voor te wenden.
Wat we routeren is de rest van de image-tier die die boards rangschikken, en meerdere van de rijen boven Qwen-Image-2.1 staan erop. OpenAI's GPT-Image-2, GPT-Image-1.5 en GPT-Image-1-mini zijn beschikbaar, net als Google's Imagen 4-tiers en de Gemini image preview-endpoints, en xAI's Grok Imagine image-endpoint. Die mix is het praktische antwoord op een bewering als deze. Als de Arena meteen een open model bovenaan had gezet, zou overstappen een codewijziging van één regel op één key zijn. Dat is niet gebeurd — de top van beide boards is propriëtair, en de interessante beslissing gaat tussen een download met onderzoekslicentie en een gehost endpoint dat je vandaag kunt aanroepen.
Drie eigenschappen van het platform zijn van belang voor die beslissing. Routing loopt via één OpenAI-compatibel endpoint over meer dan 200 modellen, dus het tegen elkaar vergelijken van de gehoste rijen betekent niet een tweede contract of een tweede SDK. De lijstprijs van de provider wordt met nul opslag doorgegeven, wat betekent dat een prijswijziging van een leverancier dezelfde dag dat die wordt aangekondigd op je factuur terechtkomt in plaats van bij de volgende contractverlenging. En automatische failover tussen providers betekent dat een nieuw model waar nog weinig op is gestemd achter een gevestigd model in een fallbackketen kan zitten in plaats van op dag drie een productieafhankelijkheid te worden — wat ongeveer is waar Qwen-Image-2.1 zich nu bevindt.
De bewering is waar, en dunner dan hij leest.
Wat Alibaba heeft gepost, is verifieerbaar: op de momentopname van 22 september 2026 van beide Arena-imageboards is Qwen-Image-2.1 het model met de hoogste score dat niet het label Proprietary draagt. Wat de post verdicht, is alles wat het nuanceert — zestiende en zeventiende overall, een voorlopige score op een paar duizend stemmen, en een onderzoekslicentie die in de plaats komt van de open-sourcelicentie die de formulering oproept.

Niets hiervan maakt het resultaat klein. Dat het drie dagen na de release de eerste niet-propriëtaire rij op beide ranglijsten is, is een echte verschuiving in waar het open niveau zich bevindt — de permissief gelicentieerde Qwen-beeldmodellen die eraan voorafgaan, lopen op dezelfde bewerkingsranglijst meer dan honderdtwintig punten achter. Het is alleen niet dezelfde bewering als "het beste beeldmodel dat open source is", en het verschil is een licentieregel en een rangkolom die je in ongeveer een minuut kunt controleren.
