Hero-kaart voor de vergelijking tussen Qwen-Image 2.1 en LLaDA-Image-Turbo, waarin Qwens licentie uitsluitend voor onderzoek wordt gecontrasteerd met de niet-gedeclareerde licentie van LLaDA-Image-Turbo, en een 40-staps 7B-diffusietransformer tegenover een 4-staps 6B-gedistilleerd model
Guides & Insights

Qwen-Image 2.1 vs LLaDA-Image-Turbo: Twee open beeldmodellen, twee heel verschillende licenties

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee open-weight beeldmodellen verschenen binnen dezelfde drie weken. Het Qwen-Image-team publiceerde Qwen-Image 2.1 op 20 september 2026 — gewichten, licentiebestand, modelkaart en een blogpost, allemaal op dezelfde dag, met nauwelijks enige aanloop vooraf. Zestien dagen eerder, op 4 september 2026, publiceerde inclusionAI (het onderzoekslab van Ant Group) LLaDA-Image-Turbo zonder lanceringsbericht, zonder persbericht en zonder enige vorm van aankondiging. Beide zijn vandaag downloadbaar. Geen van beide heeft ook maar één onafhankelijke benchmarkscore. En het verschil dat daadwerkelijk bepaalt welke je kunt gebruiken, staat niet in de modelkaart van een van beide — het zit in de papierwinkel. Qwen-Image 2.1 komt onder een onderzoekslicentie die commercieel gebruik ronduit verbiedt. LLaDA-Image-Turbo komt zonder licentie die op ook maar een van zijn repositories is aangegeven.

De licentiekwestie komt eerst, omdat het de enige is met een duidelijk antwoord.

Begin hier, want al het andere in deze vergelijking is voorlopig en dit niet.

Qwen-Image 2.1 is uitgebracht onder de Qwen Research License Agreement, gedateerd 20 september 2026, die rechten verleent "ALLEEN VOOR NIET-COMMERCIËLE DOELEINDEN" en stelt dat commercieel gebruik een afzonderlijke licentie vereist die bij de leverancier moet worden aangevraagd. Dat is een wezenlijke wijziging ten opzichte van de eerdere Qwen-Image-lijn, die onder Apache 2.0 werd uitgebracht. Het is ondubbelzinnig: je kunt het lezen, evalueren, benchmarken en erover schrijven. Je kunt het niet in een product verwerken.

LLaDA-Image-Turbo vermeldt helemaal geen licentie. Niet een permissieve, niet een restrictieve, zelfs geen tijdelijke aanduiding. Een repository zonder licentie is in juridische zin niet "vrij te gebruiken" — standaard zijn alle rechten voorbehouden, wat een strenger standpunt is dan Qwens onderzoekslicentie, niet een soepeler een. Als je van plan bent erop voort te bouwen, is dat een vraag voor het lab, niet voor een README.

De ironie is het waard om ronduit te zeggen: het model dat met een formele, restrictieve licentie kwam, is het model waarop je vandaag kunt plannen, omdat je precies weet waar je aan toe bent. Het model zonder licentie is het model waarop je dat niet kunt.

Screenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Wat de twee modellen eigenlijk zijn

Zet de licenties opzij en het zijn twee werkelijk verschillende ontwerpen, gebouwd om verschillende redenen.

Architectuur — Qwen-Image 2.1 is een 32-laags single-stream diffusietransformer met 7B parameters in de visuele generatiecomponent, een Qwen3-VL 8B tekstencoder en een 64-kanaals RGBA-VAE bij 16× ruimtelijke compressie, ongeveer 33 GB voor de hele bundel. LLaDA-Image-Turbo is een 6B uniform model voor generatie en bewerking — één set gewichten die beide taken uitvoert in plaats van een basismodel plus een apart bewerkingspad.

Inferentiestappen — Qwen-Image 2.1 gebruikt standaard 2048×2048 bij 40 stappen met flow matching en Euler discrete scheduling. LLaDA-Image-Turbo is via Twin-DMD gedistilleerd naar 2–4 stappen, waarbij 4 wordt aanbevolen, en draait met guidance scale 1.0 tegenover 5.0 van het Base-model.

Precisie-opties — Qwen-Image 2.1 publiceert ondersteuning voor FP8-kwantisatie via zijn vLLM-Omni-pad. LLaDA-Image-Turbo levert zowel BF16- als FP8-checkpoints als afzonderlijke downloads.

Referentieconditionering — Qwen-Image 2.1 accepteert tot 10 referentieafbeeldingen, ondersteunt lokale bewerkingen via een cirkel, een geschilderde annotatie of een apart masker, en genereert native RGBA met bewerking van transparante lagen. De kaart van LLaDA-Image-Turbo publiceert geen maximum voor referentieafbeeldingen.

Let op — Qwen-Image 2.1 gebruikt block-causale attention: een causale masker op tokenniveau voor tekst en een bidirectioneel masker op chunkniveau voor beeldgeneratie, met hergebruik van de prefix-KV-cache wanneer de checkpoint causal_condition: true bevat. De kaart van LLaDA-Image-Turbo beschrijft het maskeringsschema niet in hetzelfde detail.

Licentie — uitsluitend voor onderzoek en expliciet, tegenover niet-aangegeven.

Let op wat de stapaantallen betekenen in combinatie met de parameteraantallen. Qwen-Image 2.1 is een groter model dat tien keer zoveel stappen doorloopt; LLaDA-Image-Turbo is een kleiner model dat gedistilleerd is tot een handjevol stappen. Dat zijn tegengestelde gokken op waar de kosten van beeldgeneratie liggen, en het juiste antwoord hangt volledig af van de vraag of je knelpunt GPU-seconden per afbeelding is of het plafond van hoe een afbeelding eruit kan zien.

Snelheidseconomie: 40 stappen tegen 4

De naam Turbo doet hier echt werk. Twin-DMD-distillatie laat een diffusietrajectorie instorten tot een paar grote sprongen, waardoor LLaDA-Image-Turbo in 4 stappen kan worden uitgevoerd waar zijn Base-model een conventioneel schema wil. Bij guidance 1,0 slaat het ook classifier-free guidance over, wat normaal het aantal forward passes per stap verdubbelt — dus het effectieve verschil is groter dan 40-tegen-4 op zichzelf suggereert.

Wat dat je oplevert, is doorvoer en voorspelbaarheid. Een 6B-model in vier stappen is het soort model dat op één consumentenkaart past en een conceptafbeelding snel genoeg genereert om in een interactieve lus te passen. Qwen-Image 2.1 met 40 stappen en 2048×2048 is een kwaliteitseerst-configuratie; de aanbeveling van de modelkaart zelf voor beperkte hardware is CPU-offload via pipe.enable_model_cpu_offload(), wat eerder een noodoplossing is dan een echte oplossing.

Het tegenwicht is dat distillatie een compressie van capaciteit is, en niets hiervan is door iemand buiten de twee labs gemeten. Het enige onafhankelijke datapunt dat voor een van beide modellen bestaat, is een hands-on early-accessreview van Qwen-Image 2.1 door een tester in het Qwen Ambassador-programma, die de definitieve gewichten via een ModelScope Studio-interface liet draaien en ongeveer 10–15 seconden voor tekst-naar-afbeelding en 18–23 seconden voor bewerken rapporteerde. Dat is één reviewer, op een early-access-UI, zonder getoonde timer — een nuttig signaal, geen benchmark. Over LLaDA-Image-Turbo is helemaal geen vergelijkbaar hands-on verslag openbaar.

Two-column scoreboard for Qwen-Image 2.1 and LLaDA-Image-Turbo: Qwen rows read Release 20 Sept 2026 / Licence research-only, non-commercial / Architecture 32-layer DiT, 7B generation component / Steps 40 at 2048x2048 / Reference images up to 10 / Independent score none yet; LLaDA-Image-Turbo rows read Release 4 Sept 2026 / Licence undeclared on any repo / Architecture 6B unified gen+edit / Steps 2-4, recommended 4 / Reference images not published / Independent score none yet; footer reads 'Both sets of figures vendor-reported; neither model has an independent benchmark score.'

Bewerken is waar de twee ontwerpen het meest uiteenlopen

Beide modellen doen tekst-naar-afbeelding en beeldbewerking, maar ze bereiken dat op verschillende manieren, en het verschil zit in de onderliggende techniek in plaats van in de output.

Qwen-Image 2.1 behandelt het opvolgen van instructies als een afzonderlijke, inspecteerbare component. Naast het beeldmodel bevat de release twee checkpoints voor het herschrijven van prompts — Qwen/Qwen-Image-2.1-PE-T2I en Qwen/Qwen-Image-2.1-PE-I2I, elk een fijn afgestemde Qwen3.5-VL 9B van ongeveer 18,8 GB — die een vage instructie aannemen en deze herschrijven tot een ondubbelzinnige richtlijn voordat het diffusiemodel die te zien krijgt. De I2I-variant heeft altijd een invoerafbeelding, dus het is altijd een bewerkingstaak en nooit generatie uit het niets. Cruciaal is dat de rewriter wordt geleverd met een system_prompt.txt die je kunt lezen en overschrijven, en dat deze ongewoon expliciet is over taal: de beschrijvingstaal volgt je instructie, terwijl de taal van tekst die in de afbeelding wordt geschilderd, wordt bepaald door een strikte prioriteitsorde die de bestaande labeltaal van de invoerafbeelding behoudt, zelfs wanneer je in een andere taal prompt.

Dat is een klein stukje engineering met een grote impact. Als je productafbeeldingen maakt voor een markt waar de verpakkingstekst belangrijk is, zijn "de rewriter behoudt de bestaande labeltaal" en "de rewriter vertaalt behulpzaam alles naar het Engels" het verschil tussen een bruikbare en een afgekeurde asset — en omdat het in een systeemprompt zit in plaats van in een gehoste black box, kun je het diffen en aanpassen.

LLaDA-Image-Turbo maakt de tegenovergestelde afweging: één 6B-model, één set gewichten, waarbij generatie en bewerking alles delen. Minder bewegende delen, minder om te configureren, en niets om te inspecteren of te overrulen. De bijbehorende modelkaart citeert Qwen-Image-Bench-cijfers van 53,53 voor Engels en 53,38 voor Chinees met een open-source-SOTA-bewering — door de leverancier gerapporteerd, niet gereproduceerd, en let op: de benchmark die het wint is vernoemd naar het model waarmee het impliciet concurreert.

Waarop je ze daadwerkelijk zou draaien

Ecosysteemondersteuning op de lanceerdag is het minst glamoureuze onderdeel van een release en het onderdeel dat bepaalt of je een middag of een weekend kwijt bent.

Qwen-Image 2.1 is breed beschikbaar gekomen: een QwenImage21Pipeline die op dag nul in Diffusers is samengevoegd; native ComfyUI-ondersteuning met workflow-sjablonen voor tekst-naar-afbeelding en beeldbewerking; vLLM-Omni met stapsgewijze uitvoering, prefix-KV-caching, CUDA Graph-decodering, FP8-kwantisatie en tensor-/Ulysses-parallelisme; een pull request voor native SGLang-ondersteuning die op 17 september werd samengevoegd — drie dagen vóór de gewichten — met ondersteuning voor de DiT, de RGBA VAE, Qwen3-VL-conditionering en multi-referentie-invoer, gevalideerd op H200, B200, RTX PRO 6000, RTX 5090 en RTX 4090; en acceleratie op dag nul via LightX2V met AMD Radeon via ROCm en multi-chipondersteuning via FlagOS.

LLaDA-Image-Turbokreeg op 7 september 2026 ComfyUI-ondersteuning, drie dagen na de gewichten, plus een Diffusers- en Safetensors-distributie. Dat is een reële manier om het te draaien, maar wel een dunnere, en er is geen equivalent pre-release servingwerk om naar te wijzen.

De pre-release SGLang pull request verraadt Qwen-Image 2.1. Frameworksupport die landt voordat de gewichten er zijn, betekent dat iemand het serving-pad tegen de checkpoint aan het testen was, en het niet achteraf vanaf de model card schreef.

Screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo, showing the inclusionAI organisation, the model name and its Text-to-Image, Diffusers and Safetensors tags, and the opening of the model card describing LLaDA-Image as a unified model for high-quality image generation and editing

Het gehoste pad dat je naast het experiment houdt

Geen van deze twee modellen is op het moment van schrijven routeerbaar via OrcaRouter, en dit artikel zal niet anders suggereren — beide zijn voorstellen voor self-hosting, de ene onder een licentie die productie uitsluit en de andere onder helemaal geen licentie. Wat voor een team dat ze evalueert van belang is, is dat de evaluatie niet op het kritieke pad hoeft te liggen.

OrcaRouter zet 200+ modellen achter één OpenAI-compatibel endpoint tegen de lijstprijs van de provider, zonder opslag, met automatische failover tussen providers en een routing-DSL waarmee je meerdere modellen in één call kunt combineren. De praktische vorm daarvan voor deze beslissing is een route waarbij het model dat je al vertrouwt het productieverkeer draagt terwijl een self-hosted checkpoint ernaast wordt getest — en omdat de lijstprijs wordt doorgegeven in plaats van dat er opslag op zit, is een prijswijziging van een leverancier voor een gerouteerd model dezelfde dag nog live aan onze kant in plaats van te wachten op een contractwijziging. De beeldmodellen die we vandaag routeren zijn OpenAI's GPT-Image-familie, Google's Imagen 4-tiers en Gemini-beeldpreviews, en xAI's Grok Imagine-beeldendpoint. Als je een week gaat besteden aan het opzetten van een 33 GB diffusietransformer om erachter te komen of die het wint van een gehost model, dan is het gehoste model de controlegroep, en het is de moeite waard om de controlegroep al op een key te hebben.

Wat zou deze vergelijking veranderen?

Drie dingen, in volgorde van hoeveel ze zouden uitmaken.

Ten eerste een onafhankelijke benchmarkscore voor elk van beide modellen. Geen van beide heeft er een, en totdat dat verandert, is elke kwaliteitsclaim aan beide kanten een lab dat zijn eigen huiswerk nakijkt. Ten tweede een licentie: een permissieve variant van Qwen-Image 2.1 zou het de voor de hand liggende standaard maken voor open beeldwerk op 7B, en een überhaupt aangegeven licentie op LLaDA-Image-Turbo zou het op zijn minst planbaar maken. Ten derde is aan de early-access-testers van Qwens ModelScope-programma van 17 september gevraagd om tegen 29 september — over acht dagen — samples of reviews te publiceren. Dan houdt dit op een vergelijking van twee modelkaarten te zijn en wordt het een echte vergelijking. Tot dan is de eerlijke samenvatting dat Qwen-Image 2.1 het capabeler ogende model is dat je niet commercieel kunt inzetten, LLaDA-Image-Turbo het snellere model dat je helemaal niet kunt gebruiken zonder een gesprek, en dat het licentiebestand het enige onderdeel van beide releases is dat volledig is geregeld.