Hero-kaart die Qwen-Image-2.1-Turbo vergelijkt met Qwen-Image-2.1, met 8 denoisingstappen tegenover 40, een identieke 7B 32-laags DiT-architectuur, dezelfde zeven resolutiepresets, dezelfde niet-commerciële Qwen Research Licence, en een opgeslagen samplingschema dat niet door num_inference_steps wordt overschreven
Engineering & Research

Qwen-Image-2.1-Turbo vs Qwen-Image-2.1: Wat is er echt veranderd tussen het basischeckpoint en de versnelde versie

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Dezelfde 7B-component voor visuele generatie. Dezelfde 32 single-stream-DiT-lagen. Dezelfde zeven resolutievoorinstellingen, hetzelfde geïntegreerde generatie- en bewerkingsoppervlak, dezelfde niet-commerciële licentie, dezelfde pipeline-klasse om het te laden. Qwen-Image-2.1-Turbo en Qwen-Image-2.1 zijn geen twee modellen waaruit je op basis van capaciteit kiest — de Turbo-checkpoint is een fine-tune van het basismodel, en de repository zegt dat in zijn eigen metadata. Wat ze scheidt, is een enkel samplingtraject, en de manier waarop dat traject wordt opgeslagen. De ene draait veertig stappen. De andere draait er acht, en weigert bij het aanroepen anders te worden ingesteld. Alles wat interessant is aan het paar zit in die tweede zin.

Begin met de delen die identiek zijn

Voor de verschillen is het de moeite waard het gemeenschappelijke in kaart te brengen, want het is uitgebreider dan het label "Turbo" doet vermoeden, en het is wat de uitwisseling aantrekkelijk maakt.

• De architectuur. De Turbo-modelkaart stelt dat deze "dezelfde 7B-architectuur voor visuele generatie gebruikt" als Qwen-Image-2.1. Het project beschrijft dat onderdeel als 7B parameters verdeeld over 32 Single-Stream DiT-lagen. Niets in de Turbo-repository kondigt een kleinere, uitgedunde of herontworpen backbone aan.

• De mogelijkheden. Beide checkpoints worden beschreven als het uitvoeren van tekst-naar-afbeelding-generatie en beeldbewerking. Turbo neemt het oppervlak van het basismodel over in plaats van het te herhalen: de kaart van het basismodel documenteert native RGBA-transparantie, tot 10 referentieafbeeldingen en lokale bewerkingen die worden gespecificeerd door cirkels, geschilderde annotaties of afzonderlijke maskers, met behoud van identiteit voor personen en producten.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured in English, showing the Qwen organisation, 3.14k likes, the Text-to-image (diffusers), Diffusers, Safetensors and QwenImage21Pipeline tags, and the introduction text stating that Qwen-Image-2.1 is a unified text-to-image generation and image editing model with 7B parameters in its visual generation component and 32 Single-Stream DiT layers

• De resoluties.Op de kaart van Turbo staat dat je "dezelfde resolutiepresets als Qwen-Image-2.1 moet gebruiken", gevolgd door een lijst: 1:1 op 2048 × 2048, 4:3 op 2400 × 1792, 3:4 op 1792 × 2400, 3:2 op 2528 × 1696, 2:3 op 1696 × 2528, 16:9 op 2752 × 1536 en 9:16 op 1536 × 2752. De kaart van het basismodel bevat exact dezelfde tabel. Beide kaarten gebruiken het 2048-resolutieniveau voor hun voorbeelden.

• Het laadpad. Beide laden via QwenImage21Pipeline in Diffusers. De quickstart van de Turbo-kaart is de quickstart van de basiskaart, met een andere naam voor de checkpoint en bfloat16 gespeld als dtype in plaats van torch_dtype.

• Het papierwerk. Beide zijn gelicentieerd onder de Qwen-Image-2.1 Research License Agreement, beide hebben license: other met license_name: qwen-research, en beide hebben een LICENSE-bestand in de repository, naast de gewichten.

Als je Qwen-Image-2.1 al hebt aangesloten, dan is het migratieoppervlak echt klein. Dat is precies waarom dat ene argument dat zich niet gedraagt zoals je verwacht, de moeite waard is om bij stil te staan.

Het schema is uit je code verplaatst en naar de checkpoint gegaan.

Bij het basismodel is het aantal stappen aan jou om in te stellen. Het tekst-naar-afbeelding-voorbeeld op de modelkaart van Qwen-Image-2.1, het bewerkingsvoorbeeld en het RGBA-transparantievoorbeeld geven allemaal num_inference_steps=40 mee, en dat getal is een argument dat je bij de aanroep meegeeft, op de gebruikelijke Diffusers-manier. Niets op die modelkaart vertelt je dat de checkpoint uitgesproken opvattingen heeft over het schema.

Bij Turbo is het schema checkpoint-metadata. De kaart vermeldt dat de checkpoint "het aanbevolen sampling-schema bevat, zodat deze direct te gebruiken is zonder de scheduler handmatig te configureren," en legt vervolgens in de sampling-sectie uit wat dat in de praktijk betekent: "Het aanbevolen sampling-schema van 8 stappen wordt samen met de checkpoint opgeslagen en automatisch geladen. Het alleen instellen van num_inference_steps overschrijft dit niet."

Er volgen twee dingen, en beide zijn gemakkelijk op tegengestelde manieren verkeerd te doen.

Het eerste is dat acht geen standaardwaarde is die je naar boven kunt bijstellen. Als je wilt weten hoe Turbo eruitziet bij twaalf of twintig stappen, vertelt de kaart je dat de enige route een expliciet sigmas-argument bij de aanroep is — en sluit dan de deur voor het experiment door op te merken dat andere schema's "niet zijn geëvalueerd voor deze checkpoint." Dat is een leverancier die je vertelt dat de achtstappenconfiguratie de enige is waar ze achter staan, en dat al het andere onverkend terrein is dat je alleen betreedt. Het is een ongewoon eerlijke zin en die moet worden gelezen als een grens, niet als een uitnodiging.

De tweede is een reproductieval zonder foutmelding. Neem het voorbeeld van het basismodel, verander de repository-string naar het Turbo-checkpoint, laat num_inference_steps=40 staan, en de code zal draaien. Je krijgt geen waarschuwing. Het zal een afbeelding produceren met behulp van het opgeslagen achtstappenschema, en het zal niet de uitvoer zijn die de Turbo-showcase toont, omdat veertig nooit is gelezen. Dit is de faalmodus waarbij niets kapot lijkt — de render voltooit, de afbeelding is plausibel, en de enige manier waarop je erachter komt, is als je op zoek gaat naar een verschil. Er is een tweede afhankelijkheid die er naast verborgen zit: het checkpoint heeft een Diffusers-build nodig die pipeline-geconfigureerde sampling-sigma's begrijpt, toegevoegd in PR #14950, die op het moment van schrijven in de Diffusers-broncodestructuur zit in plaats van in een getagde release. De aangegeven installatie is een CUDA-compatibele PyTorch-build plus de Diffusers-broncode, transformers>=5.17.0, accelerate en pillow.

Wat betaalt voor de 32 stappen die je niet hebt genomen?

De kaart noemt twee mechanismen, en beide zijn het kennen waard omdat ze uitleggen wat het Turbo checkpoint veronderstelt over hoe je het zult aanroepen.

• CFG 1 standaard. 'Generatie gebruikt standaard CFG=1.' Bij een classifier-free guidance-schaal van één draait het model niet de tweede, onvoorwaardelijke pass die CFG normaal vereist — wat een groot deel verklaart van hoe een traject wordt verkort zonder simpelweg te worden afgekapt. Het betekent ook dat de gewoonte van het basismodel om een guidance-schaal af te stemmen niet overdraagbaar is; er valt hier niets af te stemmen, en de kaart biedt geen guidance-aanbeveling om naar af te stemmen.

• Prefix-KV-caching. In de kaart van Turbo staat: "prefix-KV-caching hergebruikt de tekst- en referentieafbeeldingscontext over de denoising-stappen." Dit is overgenomen machinerie, niet iets nieuws voor het versnelde checkpoint: de aankondiging van Qwen-Image-2.1 noemt hergebruik van prefix-KV-cache als een van de vier belangrijkste verbeteringen van het basismodel, naast mixed-granularity attention, en de day-zero serving-integraties voor het basismodel — de vLLM-Omni- en SGLang-vermeldingen in de nieuwslijst van het project — noemen prefix-KV-caching expliciet bij de functies die ze ondersteunen. In een lus van veertig stappen is dat hergebruik een optimalisatie. In een lus van acht stappen weegt het proportioneel zwaarder, omdat elke gecachte stap een groter deel van het totale werk vertegenwoordigt.

De kaart noemt geen enkele distillatietechniek. De modelkaart van het basismodel Qwen-Image-2.1 en de README van het project beschrijven de architectuur en mogelijkheden; de Turbo beschrijft de mechanica. Als je probeert te beredeneren wat acht stappen aan kwaliteit kosten, biedt de repository je geen methode om vanuit te redeneren — alleen een schema en een reeks showcase-afbeeldingen.

Het aantal stappen is geen benchmark.

Dit is het deel van de vergelijking waar het eerlijke antwoord is dat er geen vergelijking is, en het is de moeite waard om ronduit te zeggen waarom.

• Voor het Turbo-checkpoint is geen gepubliceerde score beschikbaar. De modelkaart bevat geen enkel evaluatienummer. Er is geen Qwen-Image-Bench-resultaat voor Turbo, geen zij-aan-zij-vergelijking met het basis-checkpoint, geen ablatiestudie over het aantal stappen, en geen tabel die laat zien waar de kwaliteit afvlakt.

• De score van het basis-checkpoint is door de leverancier gerapporteerd. Het enige kerncijfer in de Qwen-Image-2.1-lijn is het eigen Qwen-Image-Bench-resultaat van het basismodel, door de leverancier gerapporteerd ten opzichte van het basis-checkpoint. Het is geen meting van het Turbo-checkpoint en mag er niet naartoe worden overgedragen — de versnelling is precies het ding waarvan je zou verwachten dat het zo'n cijfer beïnvloedt, en de leverancier heeft niet gezegd in welke mate.

• Geen van beide kaarten rapporteert tijd of geheugen. Er is geen latentiecijfer, geen doorvoercijfer en geen geheugengebruik voor beide checkpoints, en geen van beide kaarten noemt de hardware waarop de voorbeelden zijn uitgevoerd. De kaart van het basismodel documenteert ten minste een sectie over geheugenoptimalisatie; de Turbo-kaart documenteert installatie, generatie, bewerking, sampling en beeldverhoudingen, en houdt daar op.

Dus het pleidooi voor Turbo ten opzichte van het basis-checkpoint is momenteel een kwestie van ontwerpintentie, niet van gemeten resultaten. Acht stappen bij dezelfde architectuur en hetzelfde resolutieniveau van 2048 zouden per afbeelding aanzienlijk minder moeten kosten. "Aanzienlijk" doet in die zin echt werk, en de enige manier om het door een getal te vervangen is beide checkpoints op je eigen workload te draaien, wat ook de enige manier is om erachter te komen wat het verkorte traject doet met de specifieke afbeeldingen die je belangrijk vindt.

Niets anders is verplaatst, inclusief de licentie.

Twee dingen waarvan een lezer redelijkerwijs zou verwachten dat ze veranderd waren, en die dat niet zijn.

Het eerste is het ecosysteem. Toen Qwen-Image-2.1 op 20 september 2026 uitkwam, noteerde de nieuwslijst van het project diezelfde dag vijf afzonderlijke day-zero-integraties: Diffusers-ondersteuning via PR #14804, native ComfyUI-ondersteuning met gepubliceerde workflowtemplates voor tekst-naar-afbeelding en bewerken, vLLM-Omni-ondersteuning met stapsgewijze uitvoering, CUDA Graph-decodering, FP8-kwantisatie en tensorparallellisme, SGLang-ondersteuning met Cache-DiT en component-offload, en versnelling vanuit het LightX2V-project. Het item van 9 oktober 2026 dat Qwen-Image-2.1-Turbo behandelt, vermeldt het checkpoint zelf en een opmerking dat de Pro- en Turbo-API's live zijn op Alibaba Cloud Model Studio. Er is geen day-zero-frameworklijst voor Turbo, en elke frameworkvermelding in de nieuwslijst verwijst nog steeds naar het basismodel. Het Turbo-checkpoint laadt via een pipelineklasse die al bestond; ondersteuning voor het opgeslagen schema is het enige nieuwe onderdeel, en die komt via de Diffusers-broncode in plaats van een getagde release.

Het tweede is de licentie. Turbo heeft de Qwen Research License Agreement, precies zoals het basismodel. Versnelling ging niet gepaard met een commerciële uitzondering, een aparte laag of een versoepeling van de voorwaarden — de niet-commerciële beperking geldt net zo goed voor de fine-tune als voor het basismodel. De metadata van de repository zelf en het licentiebestand naast de gewichten zijn het bewijs; de licentiesectie van de kaart is één zin die naar dezelfde overeenkomst verwijst. Als de reden dat acht stappen voor jou belangrijk zijn, is dat ze het model goedkoop genoeg maken om in een product op te nemen, dan staat de licentie pal in de weg, en het is de leverancier — niet deze repository — die zich daarvoor moet verantwoorden.

Gehoste endpoints, en waar OrcaRouter past

OrcaRouter routeert noch Qwen-Image-2.1-Turbo noch Qwen-Image-2.1. Beide ontbreken in onze catalogus, en niets hier is een aanbod om een van beide te serveren. Als je ze wilt, zijn je routes de eigen gehoste API's van de leverancier, verschillende platforms van derden, of de gewichten met een Diffusers-build die recent genoeg is om het opgeslagen samplingschema van het Turbo-checkpoint aan te kunnen.

Waar OrcaRouter relevant is voor deze specifieke vergelijking, is de overstap die je maakt wanneer het zelf hosten van een checkpoint niet langer het juiste antwoord is. Van een open-weightsmodel dat je zelf draait naar een gehost image-endpoint is niet alleen een wisseling van model — het is een wisseling van faalmodi. Een lokaal proces faalt op manieren die je kunt zien; een gehost endpoint faalt op manieren die afhangen van welke provider heeft geantwoord, en van wat er gebeurt wanneer een van hen midden in een request degradeert. OrcaRouter zet 200+ modellen achter één OpenAI-compatibel endpoint en geeft de listprijs van de provider zonder markup door, zodat een prijsverlaging van een leverancier dezelfde dag aan onze kant zichtbaar is in plaats van te wachten op een herprijzingsronde. Daarbovenop voegt het automatische failover tussen providers toe, een routing-DSL om te specificeren welke modellen en providers een request mag gebruiken, en model fusion om meerdere modellen in één call samen te stellen. De image-modellen die wij wel fronten zijn de OpenAI GPT-Image-familie, Google's Imagen 4-tiers waaronder de fast- en ultra-varianten, Google's Gemini image preview-endpoints, en het xAI Grok Imagine image-endpoint.

Concreet: als je kiest tussen de twee Qwen-checkpoints, is dat een beslissing over zelf hosten, en de redenen om de een boven de andere te verkiezen zijn het gedrag van het schema en het aantal stappen. Als je in productie daadwerkelijk een afbeelding nodig hebt zonder de GPU's te bezitten, dan is dat de beslissing waar wij je mee kunnen helpen, en het is een andere beslissing.

De korte versie

• Kies Qwen-Image-2.1 als je de checkpoint wilt waarvan het samplinggedrag overeenkomt met de documentatie, als je het aantal stappen wilt variëren of schema's wilt verkennen, of als je de release wilt die vanaf dag één ondersteund werd in Diffusers, ComfyUI, vLLM-Omni, SGLang en LightX2V.

• Kies Qwen-Image-2.1-Turboals je dezelfde architectuur en dezelfde mogelijkheden wilt, maar met een aanzienlijk korter traject, en bereid bent om acht stappen als vaststaand te beschouwen en Diffusers vanaf de broncode te installeren om het te laden.

Checklist card headed 'Identical across both checkpoints' listing the 7B visual generation component, 32 single-stream DiT layers, seven resolution presets, text-to-image and image editing, the QwenImage21Pipeline load path, and the non-commercial Qwen Research Licence, with a chip reading 'The only differences are the sampling schedule and the step count'

• Verwacht in beide gevallen dezelfde licentie, en verwacht geen gepubliceerd kwaliteitscijfer voor het versnelde checkpoint om mee te vergelijken met de basis. De stappenvermindering is reëel en gedocumenteerd. Hoeveel beeldkwaliteit het kost, staat nergens gedocumenteerd, en hoe vaak je de twee kaarten ook leest, het zal je niets vertellen — dat antwoord bestaat alleen op je eigen hardware, met je eigen prompts.