
Qwen-Image 2.1 vs LLaDA-Image-Turbo: Två öppna bildmodeller, två mycket olika licenser
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Två bildmodeller med öppna vikter lanserades inom samma treveckorsperiod. Qwen-Image-teamet publicerade Qwen-Image 2.1 den 20 september 2026 – vikter, licensfil, modellkort och ett blogginlägg, allt samma dag, med nästan ingen framförhållning. Sexton dagar tidigare, den 4 september 2026, publicerade inclusionAI (Ant Groups forskningslabb) LLaDA-Image-Turbo utan lanseringsinlägg, utan pressmeddelande och utan någon form av tillkännagivande. Båda går att ladda ner i dag. Ingen av dem har en enda oberoende benchmarkpoäng. Och skillnaden som faktiskt kommer att avgöra vilken av dem du kan använda finns inte i något av modellkorten – den finns i pappersarbetet. Qwen-Image 2.1 levereras under en forskningslicens som helt och hållet förbjuder kommersiell användning. LLaDA-Image-Turbo levereras utan att någon licens deklareras i något av dess repositorier överhuvudtaget.
Licensfrågan kommer först, eftersom den är den enda med ett tydligt svar.
Börja här, för allt annat i den här jämförelsen är preliminärt och det här är det inte.
• Qwen-Image 2.1 släpps under Qwen Research License Agreement, daterat den 20 september 2026, som beviljar rättigheter "ENDAST FÖR ICKE-KOMMERSIELLA ÄNDAMÅL" och anger att kommersiell användning kräver en separat licens som måste begäras från leverantören. Det är en väsentlig förändring från den tidigare Qwen-Image-serien, som levererades under Apache 2.0. Det är otvetydigt: du kan läsa det, utvärdera det, benchmarka det och skriva om det. Du kan inte inkludera det i en produkt.
• LLaDA-Image-Turboanger ingen licens alls. Inte en tillåtande, inte en restriktiv, inte en platshållare. Ett repo utan licens är inte ”fritt att använda” i någon juridisk bemärkelse – det är alla rättigheter förbehållna som standard, vilket är en striktare position än Qwens forskningslicens, inte en lösare. Om du planerar att bygga vidare på det är det en fråga för labbet, inte för en README.
Ironin är värd att säga rent ut: modellen som kom med en formell, restriktiv licens är den du kan planera kring i dag, eftersom du vet exakt var du står. Modellen utan licens är den du inte kan.

Vad de två modellerna egentligen är
Tar man bort licensieringen är det här två helt olika konstruktioner, byggda av olika skäl.
• Arkitektur — Qwen-Image 2.1 är en 32-lagrig diffusionstransformer med enkel ström och 7B parametrar i den visuella genereringskomponenten, en Qwen3-VL 8B-textkodare och en 64-kanalig RGBA-VAE vid 16× rumslig komprimering, cirka 33 GB totalt i paketet. LLaDA-Image-Turbo är en 6B enhetlig genererings- och redigeringsmodell – en uppsättning vikter som utför båda uppgifterna i stället för en basmodell plus en separat redigeringsväg.
• Inferenssteg — Qwen-Image 2.1 använder som standard 2048×2048 vid 40 steg med flow matching och diskret Euler-schemaläggning. LLaDA-Image-Turbo destilleras genom Twin-DMD till 2–4 steg, där 4 rekommenderas, och körs med vägledningsskala 1,0 jämfört med Base-modellens 5,0.
• Precisionsalternativ — Qwen-Image 2.1 publicerar FP8-kvantiseringsstöd via sin vLLM-Omni-väg. LLaDA-Image-Turbo levereras med både BF16- och FP8-checkpoints som separata nedladdningar.
• Referenskonditionering — Qwen-Image 2.1 tar emot upp till 10 referensbilder, stöder lokala redigeringar med cirkel, målad markering eller en separat mask, och genererar nativ RGBA med redigering av transparenta lager. LLaDA-Image-Turbos modellkort anger ingen övre gräns för referensbilder.
• Attention — Qwen-Image 2.1 använder block-kausal attention: en kausal mask på token-nivå för text och en bidirektionell mask på chunk-nivå för bildgenerering, med återanvändning av prefix-KV-cache när checkpointen har causal_condition: true. LLaDA-Image-Turbos kort beskriver inte sitt maskeringsschema lika detaljerat.
• Licens — endast för forskning och uttrycklig, kontra odeklarerad.
Lägg märke till vad stegantalen betyder tillsammans med parameterantalen. Qwen-Image 2.1 är en större modell som körs i tio gånger så många steg; LLaDA-Image-Turbo är en mindre modell som destillerats ner till en handfull steg. Det är motsatta satsningar på var kostnaden för bildgenerering ligger, och det rätta svaret beror helt och hållet på om din flaskhals är GPU-sekunder per bild eller taket för hur en bild kan se ut.
Hastighetsekonomi: 40 steg mot 4
Turbo-namnet gör verkligen nytta här. Twin-DMD-destillation kollapsar en diffusionsbana till några få stora hopp, vilket är anledningen till att LLaDA-Image-Turbo kan köras i 4 steg där dess basmodell vill ha ett konventionellt schema. Vid guidance 1.0 hoppar den också över classifier-free guidance, vilket normalt fördubblar antalet framåtpassningar per steg — så den effektiva skillnaden är större än vad 40 mot 4 antyder i sig.
Det du får ut av det är genomströmning och förutsägbarhet. En 6B-modell med fyra steg är den typ av sak som får plats på ett enda konsumentkort och producerar en utkastbild tillräckligt snabbt för att ingå i en interaktiv loop. Qwen-Image 2.1 med 40 steg och 2048×2048 är en konfiguration där kvaliteten prioriteras; modellkortets egen rekommendation för begränsad hårdvara är CPU-avlastning via pipe.enable_model_cpu_offload(), vilket är en nödlösning snarare än en åtgärd.
Motvikten är att destillation är en komprimering av förmåga, och inget här har mätts av någon utanför de två labben. Den enda oberoende datapunkten som finns för någon av modellerna är en praktisk recension med tidig åtkomst av Qwen-Image 2.1 från en testare i Qwen Ambassador-programmet, som körde de slutliga vikterna genom ett ModelScope Studio-gränssnitt och rapporterade ungefär 10–15 sekunder för text-till-bild och 18–23 sekunder för redigering. Det är en granskare, på ett användargränssnitt med tidig åtkomst, utan någon visad timer — en användbar signal, inte ett benchmark. LLaDA-Image-Turbo har överhuvudtaget ingen jämförbar praktisk rapport offentligt.

Redigeringen är där de två designerna skiljer sig mest
Båda modellerna utför text-till-bild och redigering, men de kommer dit på olika sätt, och skillnaden visar sig i det underliggande maskineriet snarare än i resultatet.
Qwen-Image 2.1 behandlar instruktionsföljning som en separat, granskningsbar komponent. Tillsammans med bildmodellen innehåller utgåvan två kontrollpunkter för omskrivning av prompter – Qwen/Qwen-Image-2.1-PE-T2I och Qwen/Qwen-Image-2.1-PE-I2I, båda en finjusterad Qwen3.5-VL 9B på cirka 18,8 GB – som tar en vag instruktion och skriver om den till ett entydigt direktiv innan diffusionsmodellen ser den. I2I-varianten har alltid en indatabild, så det är alltid en redigeringsuppgift och aldrig generering från ingenting. Avgörande är att omskrivaren levereras med en system_prompt.txt som du kan läsa och åsidosätta, och den är ovanligt explicit om språk: beskrivningsspråket följer din instruktion, medan språket för text som målas in i bilden bestäms av en strikt prioritetsordning som bevarar indatabildens befintliga etikettspråk även när du promptar på ett annat språk.
Det är ett litet ingenjörsarbete med stor sprängradie. Om du tar fram produktbilder för en marknad där förpackningstexten spelar roll, är "omskrivaren bevarar det befintliga etikettspråket" och "omskrivaren översätter hjälpsamt allt till engelska" skillnaden mellan en användbar tillgång och en avvisad sådan — och eftersom den ligger i en systemprompt i stället för inuti en svart låda hos en extern leverantör kan du diffa den och ändra den.
LLaDA-Image-Turbo gör den motsatta avvägningen: en enda 6B-modell, en enda uppsättning vikter, där generering och redigering delar allt. Färre rörliga delar, mindre att konfigurera och inget att granska eller åsidosätta. Dess kort citerar siffror från Qwen-Image-Bench på 53,53 för engelska och 53,38 för kinesiska med ett påstående om open source-SOTA — rapporterat av leverantören, ej reproducerat, och notera att det benchmark som den vinner är uppkallat efter den modell som den implicit tävlar mot.
Vad du faktiskt skulle köra dem på
Ekosystemstöd på lanseringsdagen är den minst glamorösa delen av en lansering och den del som avgör om du spenderar en eftermiddag eller en helg.
• Qwen-Image 2.1 lanserades brett: en QwenImage21Pipeline integrerades i Diffusers från dag noll; inbyggt stöd för ComfyUI med arbetsflödesmallar för text-till-bild och bildredigering; vLLM-Omni med stegvis exekvering, prefix-KV-cachning, CUDA Graph-avkodning, FP8-kvantisering och tensor-/Ulysses-parallellism; en pull request för inbyggt SGLang-stöd som landade 17 september – tre dagar före vikterna – som täcker DiT, RGBA-VAE, Qwen3-VL-betingning och indata med flera referenser, validerad på H200, B200, RTX PRO 6000, RTX 5090 och RTX 4090; samt acceleration från dag noll via LightX2V med AMD Radeon via ROCm och stöd för flera chip via FlagOS.
• LLaDA-Image-Turbo fick ComfyUI-stöd den 7 september 2026, tre dagar efter vikterna, plus en Diffusers- och Safetensors-distribution. Det är en verklig väg till att köra den, men det är en tunnare sådan, och det finns inget motsvarande serveringsarbete före lansering att peka på.
Den förhandsutgivna SGLang-pull-begäran är det som avslöjar Qwen-Image 2.1. Ramverksstöd som landar före vikterna innebär att någon testade serveringsvägen mot checkpointen, inte skrev det utifrån modellkortet i efterhand.

Den hostade sökvägen som du behåller vid sidan av experimentet
Ingen av dessa modeller kan routas via OrcaRouter i skrivande stund, och den här artikeln kommer inte att antyda något annat — båda är självhostningsalternativ, det ena under en licens som utesluter produktion och det andra helt utan licens. Det som spelar roll för ett team som utvärderar dem är att utvärderingen inte behöver ligga på den kritiska linjen.
OrcaRouter tillhandahåller 200+ modeller bakom en enda OpenAI-kompatibel endpoint till leverantörens listpris utan påslag, med automatisk failover mellan leverantörer och ett routing-DSL som låter dig komponera flera modeller till ett enda anrop. Den praktiska formen av det för det här beslutet är en route där modellen du redan litar på bär produktionstrafiken medan en självhostad checkpoint testas vid sidan av — och eftersom listpriset förs vidare i stället för att läggas på, slår en leverantörsprisändring på vilken routad modell som helst igenom på vår sida samma dag i stället för att vänta på ett avtalsärende. De bildmodeller vi faktiskt routar i dag är OpenAI:s GPT-Image-familj, Googles Imagen 4-nivåer och Gemini-bildförhandsvisningar, samt xAI:s Grok Imagine-bildendpoint. Om du ska lägga en vecka på att sätta upp en 33 GB diffusion transformer för att ta reda på om den slår en hostad modell, är den hostade modellen kontrollgruppen, och det är värt att ha kontrollgruppen redan på en nyckel.
Vad skulle ändra denna jämförelse
Tre saker, i ordning efter hur mycket de skulle betyda.
För det första, en oberoende benchmarkpoäng för endera modellen. Ingen av dem har en, och tills det ändras är varje kvalitetsanspråk från båda sidor ett laboratorium som rättar sin egen läxa. För det andra, en licens: en tillåtande variant av Qwen-Image 2.1 skulle göra den till det självklara standardvalet för öppet bildarbete vid 7B, och en överhuvudtaget angiven licens på LLaDA-Image-Turbo skulle åtminstone göra den planerbar. För det tredje, testarna med tidig åtkomst från Qwens ModelScope-program den 17 september ombads publicera exempel eller recensioner senast den 29 september — åtta dagar från nu. Det är då detta slutar vara en jämförelse mellan två modellkort och börjar bli en verklig sådan. Fram till dess är den ärliga sammanfattningen att Qwen-Image 2.1 är den till synes mer kapabla modellen som du inte kan kommersialisera, LLaDA-Image-Turbo är den snabbare som du inte kan använda alls utan ett samtal, och licensfilen är den enda delen av någon av utgåvorna som är helt fastställd.
