
Qwen-Image 2.1 stilletjes uitgebracht: een kijkje in Qwen/Qwen-Image-2.1-PE-I2I
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Op 20 september 2026 zette het Qwen-Image-team Qwen-Image 2.1 op Hugging Face en ModelScope — gewichten, licentiebestand, modelkaart en een blogpost, allemaal op dezelfde dag, met bijna geen aanloop vooraf. Het opvallendste cijfer is 7B parameters in de visuele generatiecomponent. Het onderdeel dat bijna niemand nog heeft geopend is Qwen/Qwen-Image-2.1-PE-I2I, een van de twee prompt-herschrijvende checkpoints die samen met het beeldmodel zijn uitgebracht. Het is niet het beeldmodel. Het is het onderdeel dat bepaalt wat je instructie betekent voordat het beeldmodel die ooit ziet — en in deze release is het de component die stilzwijgend de taal bepaalt waarin je output terugkomt.
Wat "stilletjes uitgebracht" hier eigenlijk betekent
De formulering is belangrijk, want het is gemakkelijk om in beide richtingen te overdrijven. Qwen-Image 2.1 was niet uitgelekt, en het was niet onaangekondigd. Er is een leveranciersblogpost gedateerd 20 september 2026, een GitHub-repository met een nieuwsrubriek van dezelfde dag, en een live download van de gewichten. Wat het niet kreeg, was een aanloop: het enige signaal vooraf was een bericht van 17 september met 50 plekken voor vroege toegang via ModelScope, waarbij geselecteerde testers werd gevraagd om uiterlijk 29 september een voorbeeld of een review te publiceren. Drie dagen later waren de gewichten openbaar. Geen keynote, geen benchmark-embargo, geen perscyclus.
Dat is een specifiek soort release, en het is de moeite waard die precies te benoemen. De leverancier heeft het aangekondigd. De leverancier heeft het niet gepromoot. Voor iedereen die besluit of hij erop voortbouwt, is het praktische gevolg dat er nog geen onafhankelijke evaluatie is waarop je kunt leunen — alleen het eigen materiaal van de leverancier en wat testers met vroege toegang de komende week publiceren. Beschouw elke kwaliteitsclaim in dit artikel als afkomstig van de modelkaart en de blogpost totdat iemand buiten Alibaba het in het openbaar draait.
Waarom de PE-I2I-checkpoint de interessante is
De release van Qwen-Image 2.1 bevat drie downloadbare onderdelen, niet één:
• Qwen/Qwen-Image-2.1 — het imagemodel zelf. Een 32-laags single-stream DiT met 7B parameters in de visuele generatiecomponent, een Qwen3-VL 8B tekstencoder en een 64-kanaals RGBA-VAE met 16× ruimtelijke compressie. Ongeveer 33 GB verdeeld over de drie componenten.
• Qwen/Qwen-Image-2.1-PE-T2I — een prompt-her schrijver voor tekst-naar-afbeelding. Een fijn afgestelde Qwen3.5-VL 9B, ongeveer 18,8 GB.
• Qwen/Qwen-Image-2.1-PE-I2I — een prompt-herschrijver voor beeld-naar-beeldbewerking. Ook een fijngetunede Qwen3.5-VL 9B, ook ongeveer 18,8 GB, geüpload naar Hugging Face op 20 september om 08:46 UTC.
"PE" staat voor promptverbetering. De I2I-variant neemt een vage bewerkingsinstructie plus een of meer invoerafbeeldingen en herschrijft die tot een precieze, ondubbelzinnige bewerkingsopdracht voor het downstream diffusiemodel. De eigen beschrijving van de repository is onverbloemd over de invoervorm: er is altijd een invoerafbeelding aanwezig, dus dit is altijd een beeldbewerkingstaak en nooit tekst-naar-afbeelding vanuit het niets. De herschrijfcode bevindt zich in een prompt_rewrite/ map die beide checkpoints bedient — --task t2i of --task edit — met een transformers-pad, een vLLM-pad, een serve.sh plus client.py voor een continu draaiende service, en pe_core.py voor de gedeelde logica.
Dit is waarom dat meer uitmaakt dan het klinkt. Het beeldmodel heeft geen idee wat je bedoelde. Het heeft een idee van wat je prompt letterlijk zegt, gewogen door wat de tekstencoder ermee doet. Een herschrijver die ervoor zit, is de plek waar ambiguïteit wordt opgelost — of die verkeerd wordt opgelost, consequent, bij elke afbeelding die je genereert. In een uniform generatie- en bewerkingsmodel met maximaal 10 referentieafbeeldingen heeft die resolutiestap meer om fout te doen dan gewoonlijk.
De systeemprompt is waar de taalbeslissing wordt genomen.
De PE-I2I-repository levert een system_prompt.txt mee, samen met de weights, en is ongewoon expliciet over één ding: taal. Als je het direct leest, krijgt de herschrijver de instructie om twee afzonderlijke taalbeslissingen te nemen, en die gescheiden te houden.
• De taal van de beschrijving. De tekst die de herschrijver schrijft om de bewerking te beschrijven, volgt de taal van de instructie van de gebruiker — Chinese instructie, Chinese beschrijving; Engelse instructie, Engelse beschrijving; een instructie in het Japans, Koreaans, Frans, Thai of iets anders krijgt een Engelse beschrijving.
• De taal van de weergegeven tekst. De tekst die daadwerkelijk in de uitvoerafbeelding wordt geschilderd, tussen dubbele aanhalingstekens, wordt bepaald door een strikte prioriteitsorde: ten eerste, als de gebruiker de exacte tekst of de doeltaal noemt, gehoorzaam dat letterlijk; ten tweede, als de invoerafbeelding al tekst bevat, kom overeen met de dominante taal van die bestaande tekst — zelfs wanneer de instructie in een andere taal is geschreven; ten derde, als er geen tekst in de afbeelding staat en er geen taal is genoemd, gebruik dan de taal van de instructie zelf, en forceer die specifiek niet naar het Engels.
De prompt versterkt de tweede regel met een uitgewerkt voorbeeld — een afbeelding die grotendeels Thais is, bewerkt met een Engelse instructie die geen taal noemt, moet Thaise tekst weergeven — en voegt twee beperkingen toe: weergegeven tekst moet eentalig zijn in plaats van een Chinees/Engelse combinatie, en een "spec sheet"- of "storyboard"-visueel genre wordt bereikt door lay-out en typografie, nooit door de weergegeven labels naar het Engels om te schakelen.
Dit is een klein stukje engineering met een grote impact. Als je productafbeeldingen genereert voor een markt waar de tekst op de verpakking ertoe doet, is het verschil tussen "de herschrijver behoudt de taal van het bestaande label" en "de herschrijver vertaalt uit behulpzaamheid alles naar het Engels" het verschil tussen een bruikbare asset en een afgewezen asset. En omdat dit gedrag is gespecificeerd in een systeemprompt die met de repository wordt meegeleverd, kun je die lezen, er een diff van maken en die overschrijven — en dat is meer dan je kunt zeggen van dezelfde stap in een gesloten gehost model.
Wat is bevestigd, en wat niet
Hier precies zijn over de grens is het hele punt van een stuk over wat we weten.
• Bevestigd op basis van de repository en de modelkaart — de 7B / 32-laags single-stream DiT-configuratie; de Qwen3-VL 8B-tekstencoder; de 64-kanaals RGBA-VAE met 16× ruimtelijke compressie; block-causale attention met een causaal masker op tokenniveau voor tekst en een bidirectioneel masker op chunkniveau voor beeldgeneratie; hergebruik van de prefix-KV-cache, dat volgens de kaart wordt geactiveerd wanneer de checkpoint causal_condition: true bevat (wat het geval is); flow matching met Euler discrete scheduling; native 2K-uitvoer met 2048×2048 als standaard bij 40 inferentiestappen; zeven gedocumenteerde presets voor beeldverhoudingen; ondersteuning voor maximaal 10 referentieafbeeldingen; lokale bewerking via een cirkel, geschilderde annotatie of een apart masker; en RGBA-generatie, het bewerken van transparante lagen en het extraheren van onderwerpen uit RGB-foto's.
• Bevestigd wat de licentie betreft, en dit is het scherpe punt — de release valt onder de Qwen Research License Agreement, gedateerd 20 september 2026, die rechten verleent "FOR NON-COMMERCIAL PURPOSES ONLY" en stelt dat commercieel gebruik een aparte licentie vereist die bij de leverancier moet worden aangevraagd. Dat is een wezenlijke verandering ten opzichte van de eerdere Qwen-Image-lijn, die onder Apache 2.0 werd uitgebracht. Lees het licentiebestand voordat je hier een product op bouwt, niet erna.
• Niet bevestigd — er bestaan nog geen onafhankelijke benchmarkscores. De blogpost verwijst naar een Qwen-Image-Bench-vergelijkingsgrafiek, maar de cijfers daarin zijn afkomstig van de leverancier zelf en waren op het moment van schrijven door geen enkele derde partij gereproduceerd. Er is geen gepubliceerde prijs voor een gehost eindpunt voor Qwen-Image 2.1, en er zijn geen vastgelegde voorwaarden voor de commerciële licentie. En er is nog niets bekend over de vraag of er een variant met een permissieve licentie zal volgen.
Het enige onafhankelijke datapunt dat daadwerkelijk bestaat, is een praktische review van vroege toegang door een tester die toegang had via het Qwen Ambassador-programma en de definitieve release-gewichten via een ModelScope Studio-interface liet draaien. Die review meldde generatietijden van ongeveer 10–15 seconden voor tekst-naar-afbeelding en 18–23 seconden voor bewerken, sterke prestaties bij voorinstellingen voor camerapositie en roltoewijzing aan meerdere personages, en een specifieke faalmodus die het waard is om te kennen: consistentie bij meerdere referenties verslechterde vanaf ongeveer drie invoerafbeeldingen, waarbij de plaatsing van een zijpaardenstaart bij profielhoeken ineenklapte tot een middenpaardenstaart. Dat is één reviewer, op een UI met vroege toegang, zonder weergegeven timer. Het is nuttig signaal. Het is geen benchmark.

Day-zero-ondersteuning voor frameworks, wat het stille goede nieuws is
Waar een model op de lanceringsdag terechtkomt, vertelt je meer over of je het daadwerkelijk kunt gebruiken dan de modelkaart doet, en Qwen-Image 2.1 werd breed uitgerold:
• Diffusers — een QwenImage21Pipeline werd op dag nul samengevoegd, en de modelrepository draagt de tag diffusers:QwenImage21Pipeline.
• ComfyUI — native ondersteuning vanaf dag één met workflowtemplates voor tekst-naar-afbeelding en beeldbewerking, plus een aparte, met Comfy compatibele gewichtenrepository.
• vLLM-Omni — stapsgewijze uitvoering, prefix-KV-caching, CUDA Graph-decodering, FP8-kwantisatie en tensor-/Ulysses-parallellisme.
• SGLang — een pull request voor native ondersteuning landde op 17 september, drie dagen voor de weights, met ondersteuning voor de DiT, de RGBA-VAE, Qwen3-VL-conditionering, meerdere referentieafbeeldingen en RGBA-invoer/uitvoer, gevalideerd op H200, B200, RTX PRO 6000, RTX 5090 en RTX 4090.
• LightX2V — day-zero acceleratie, plus AMD Radeon via ROCm en multi-chipondersteuning via FlagOS.
De pre-release SGLang pull request is de aanwijzing. Frameworkondersteuning die landt voordat de gewichten er zijn, betekent dat het serving-pad tegen de checkpoint werd getest, niet achteraf vanaf de modelkaart is geschreven. Voor een 7B-component met een tekstencoder van 17,5 GB ernaast is dat het verschil tussen een weekend yak-shaving en een middag.
Voor GPU's met beperkte capaciteit beveelt de modelkaart CPU-offloading aan — pipe.enable_model_cpu_offload() — wat veeleer de standaard-uitwijkmogelijkheid is dan een echte oplossing. De download van 33 GB wordt gedomineerd door de tekstencoder, niet door de DiT; de diffusietransformer zelf vormt de kleinere helft van het pakket, met ongeveer 14 GB.

De praktische duiding
Als je Qwen-Image 2.1 vandaag wilt uitproberen, is de eerlijke positie dat je het kunt, lokaal, onder een onderzoekslicentie, zonder onafhankelijke benchmarks en zonder commerciële rechten. Dat is een redelijke ruil voor evaluatie en een slechte voor een productiepijplijn, en het verschil tussen die twee is precies wat het licentiebestand bepaalt.
Voor teams die beeldmodellen benchmarken zonder een productiepad te willen vastleggen op een checkpoint van dagen oud, is de routeringslaag waar dat risico wordt ingeperkt. OrcaRouter zet meer dan 200 modellen achter één OpenAI-compatibel endpoint tegen de lijstprijs van de aanbieder, zonder markup, met automatische failover tussen aanbieders, zodat een onbewezen model achter een route kan zitten naast een model dat je al vertrouwt in plaats van het te vervangen — en omdat de lijstprijs wordt doorgegeven, is een prijsverlaging van een leverancier op elk gerouteerd model dezelfde dag live in plaats van te wachten op een contractwijziging. Qwen-Image 2.1 behoort op het moment van schrijven niet tot de modellen die wij routeren, en dit artikel zal dat ook niet suggereren. Wat wij wel routeren is de omliggende beeldlijn — OpenAI's GPT-Image-familie, Google's Imagen 4-tiers en Gemini-beeldvoorbeelden, en xAI's Grok Imagine-beeldeindpunt — waar een failoverpad vandaan zou komen terwijl je de nieuwkomer op je eigen hardware evalueert.
De vraag die openblijft, is degene die de repository niet kan beantwoorden. Alibaba bracht een 7B-beeldmodel met open gewichten uit onder een licentie uitsluitend voor onderzoek, in hetzelfde jaar dat het Qwen-Image 3.0 uitbracht als een gesloten gehost model zonder enige gewichten. Twee releases, twee tegenovergestelde weddenschappen, vier maanden uit elkaar. Welke van die twee de vorm bepaalt van het volgende Qwen-beeldmodel — en of de onderzoekslicentie ooit verandert in iets dat een bedrijf kan gebruiken — is wat je in de gaten moet houden. De gewichten staan nu op Hugging Face, en iedereen kan het licentiebestand zelf lezen.

