Een gegenereerde hero-kaart voor het artikel, met als kop SGLang-Diffusion serveert Qwen-Image-2.1, met de ondertitel Day-zero-serving, gemeten, waarop drie afgeronde kaarten met de labels Tekst naar afbeelding, Multi-image-bewerking en RGBA-uitvoer te zien zijn boven een latency-strip met de tekst 2,75 s generatie en 3,36 s bewerking, met het bijschrift 1024 x 1024, 40 stappen, één B200.
Engineering & Research

SGLang-Diffusion serveert Qwen-Image-2.1 op dag nul: generaties in 2,75s op één B200

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Qwen-Image-2.1 werd op 20 september 2026 vrijgegeven, en het SGLang-Diffusion-team had al een servingpad voor het model klaarstaan. De day-zero-ondersteuning dekt de drie taken die het model uitvoert — tekst-naar-afbeeldinggeneratie, het bewerken van meerdere afbeeldingen en transparante RGBA-uitvoer — en gaat gepaard met iets zeldzamers dan een samengevoegde pull request: gemeten latency op met naam genoemde hardware, gepubliceerd samen met de configuratie die de cijfers heeft opgeleverd. Op één enkele NVIDIA B200, 1024×1024 bij 40 stappen, komen de SGLang-cijfers uit op 2,748 seconden voor een generatie en 3,358 seconden voor een bewerking. De ondersteunende pull request, sgl-project/sglang#39983, werd op 17 september geopend — drie dagen voordat de gewichten downloadbaar waren — en dat is de reden dat de cijfers überhaupt bestaan, in plaats van dat ze pas later werden beloofd.

Wat "dag nul" hier betekent, en waarom de timing het interessante deel is

Frameworkondersteuning wordt meestal in één adem met een modelrelease aangekondigd en pas weken later geleverd. Bij SGLang is het net omgekeerd. De implementatie werd geschreven tegen een checkpoint dat nog niet openbaar was, wat de auteurs dwingt om de echte architectuur aan te pakken in plaats van een specificatieblad: de diffusietransformer, de 64-kanaals RGBA-VAE, Qwen3-VL-conditionering, invoer met meerdere referentieafbeeldingen, en RGBA als invoer en uitvoer.

Dat is de reden om een latentietabel meer te vertrouwen dan een capaciteitenlijst. Een model dat nooit is geserveerd, heeft geen gemeten cijfers, en een getal dat samen met de hardware, resolutie, het aantal stappen en de precisie wordt aangeleverd, kan door iedereen met dezelfde kaart worden gecontroleerd. De cijfers van SGLang zijn aangeduid als een specifieke configuratie, niet als een algemene bewering over het model.

De rest van de tooling verscheen in hetzelfde tijdvenster. ComfyUI bracht native ondersteuning uit, Diffusers mergede QwenImage21Pipeline, vLLM-Omni voegde stapsgewijze uitvoering en FP8-kwantisatie toe, en LightX2V voegde versnelling toe met AMD Radeon-ondersteuning via ROCm. De frameworks zijn het onderdeel van een release dat bepaalt of iemand buiten een lab het kan gebruiken.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

De cijfers, en wat ze niet zeggen

Het SGLang-werk publiceert latentie per verzoek, niet doorvoer. Dat onderscheid is belangrijk als je een service aan het dimensioneren bent in plaats van een demo te draaien: één generatie van 2,7 seconden vertelt je de retourtijd, niet hoeveel gelijktijdige gebruikers één kaart aankan. De gepubliceerde configuraties, allemaal op 1024×1024 en 40 stappen:

B200, residente gewichten, FlashAttention — 2,748 s generatie, 3,358 s bewerken, na een Q/K-norm-fix en een LayerNorm-wijziging die elk een paar procent bespaarden.
RTX PRO 6000 Blackwell, 96 GB, resident — 8,23 s generatie, 9,85 s bewerken bij een piekvoetafdruk van 40,1 GiB; 10,28 s en 10,66 s met de diffusion transformer offloaded, waardoor de piek daalt naar 26,1 GiB.
DGX Spark, 1× GB10, eager, volledige VAE-decodering — 35,36 s generatie, 42,23 s bewerken, 35,49 s en 42,21 s voor de transparante varianten. Die omvatten PNG-serialisatie. Breekbare CUDA-graphs leverden identieke pixels op zonder meetbaar snelheidsvoordeel (35,96 s tegen 35,64 s), en batchverwerking en multi-Spark-opstellingen werden helemaal niet gebenchmarkt.
RTX 4090, 24 GB, layerwise offload, alleen denoise — 26,69 s bij basis-BF16 met SDPA, 10,31 s met Cache-DiT (2,59×), 5,59 s met Cache-DiT plus de INT8-kernelset (4,77×), 4,74 s met Sage attention toegevoegd (5,63×).

Aan die rijen kleven twee eerlijke kanttekeningen. Ten eerste zijn het latenties voor één enkele aanvraag, en de 4090-rij meet alleen denoising — de tekstencoder en VAE vallen buiten de timer. Ten tweede kaderen de SGLang-auteurs de bredere verificatie als functioneel, niet als evaluatief: BF16-uitvoer is niet bit-exact tussen verschillende plaatsingen, en kwantisering of tensorparallellisme verandert de cijfers. Sneller en anders is niet hetzelfde als sneller en beter.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Waarom je het transparante uitvoerpad in de gaten moet houden

RGBA is waar dit model verschilt van de image-endpoints die de meeste teams al aanroepen, en het is ook waar het serveren onhandig wordt. Qwen-Image-2.1 denoist in een latente ruimte met een alfakanaal als volwaardige component, via een RGBA-VAE met 64 kanalen en 16× ruimtelijke compressie. Transparantie is geen post-process dat je er met een segmentatiemodel aan vastschroeft; het is wat de sampler uitstuurt.

Dat goed serveren is moeilijker dan RGB serveren. De uitvoer is groter, de VAE heeft meer kanalen om te decoderen, en het verzoek draagt een extra modusbit die de scheduler moet routeren. De verificatie van SGLang dekt precies dat oppervlak — transparante PNG-uitvoer, alpha behouden over het volledige bereik van 0–255, en een RGBA-PSNR van 60,69 dB in één enkel voorbeeld, waarbij de FP8-configuraties ook transparante generatie doorstaan. Dat is een correctheidscontrole in plaats van een kwaliteitsbenchmark, en dat geven de auteurs zelf aan. Het stelt vast dat het alfakanaal echt is en kwantisatie overleeft; het zegt niets over of de randen schoon zijn bij haar, bont of glas.

De praktische waarde van een servingstack met een getest transparantiepad is dat deze een pijplijn van drie tools omzet in één aanroep. Genereren met alpha, bewerken binnen een afbeelding die al alpha heeft, en een onderwerp uit een gewone RGB-foto naar een transparante laag halen, gaan allemaal via hetzelfde endpoint.

Waar dit past als je de GPU niet zelf draait

Het onhandige aan de release van Qwen-Image-2.1 is dat er geen gehost endpoint is om aan te roepen. De gewichten zijn een download van ongeveer 33 GB, de generatiecomponent is een 7B-diffusietransformer gekoppeld aan een Qwen3-VL 8B-tekstencoder, en het geheel valt onder de Qwen Research License Agreement van 20 september 2026 — alleen voor niet-commercieel gebruik, waarbij commerciële inzet een aparte licentie van de leverancier vereist. Het SGLang-recept is dus geen alternatief voor een API. Het ís de API, en jij bent de operator.

Dat verandert waarvoor een routeringslaag dient. OrcaRouter biedt 200+ modellen achter één OpenAI-compatibel endpoint tegen de lijstprijs van de provider, met nul markup, automatische failover tussen providers, een routing-DSL voor het samenstellen van fallbacks, en modelfusie voor panel-style-aanroepen — maar het routeert geen enkel Qwen-Image-model, van welke versie dan ook, en Qwen-Image-2.1 zal daar nooit een route zijn die je kunt aanroepen. De realistische architectuur is een gesplitste: draai Qwen-Image-2.1 op je eigen hardware via SGLang voor het transparante werk en het werk met meerdere referenties, en stuur al het overige naar gehoste beeldmodellen met één sleutel. Onze catalogus bevat de OpenAI GPT-Image-lijn, de Imagen 4-tiers en Gemini image previews van Google, en de Grok Imagine image-endpoint van xAI, allemaal tegen lijstprijs doorgegeven, zodat een prijswijziging van een leverancier voor een van hen dezelfde dag nog live staat aan onze kant.

Hoe een deployment er daadwerkelijk uitziet

De SGLang-documentatie wordt geleverd met een cookbook voor dit model met opdrachten per GPU, en de aanbevolen serveraanroep is één regel — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Verzoeken voor tekst-naar-afbeelding ondersteunen optionele dynamische batchering; verzoeken voor het bewerken van afbeeldingen worden via een apart pad afgehandeld, en één verzoek kan meerdere uitvoerresultaten retourneren.

De configuraties die daadwerkelijk zijn geverifieerd, zijn beperkter dan de compatibiliteitsmatrix suggereert. H200, B200, RTX PRO 6000 96 GB, RTX 5090 en RTX 4090 worden gedekt voor generatie en bewerking op 1024×1024 bij 40 stappen, inclusief hun transparante varianten, plus multi-GPU-tensorparallellisme, Ulysses- en Ring-attention, layerwise-offload, parallelle getegelde VAE-decodering, Cache-DiT, CUDA-graphs en online en geserialiseerde FP8-kwantisatie. Multi-GPU- en NVFP4-recepten op de RTX PRO 6000 blijven ongeverifieerd, en multi-host-RDMA en gedisaggregeerde rollen met meerdere ranks zijn niet gedekt. Als uw plan vier kaarten en een fabric omvat, loopt u voor op het gepubliceerde bewijs.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Twee dingen om in de gaten te houden. Het eerste is of iemand doorvoer publiceert in plaats van latency — het zijn de gelijktijdigheidscijfers die van een getal van 2,7 seconden een capaciteitsplan maken. Het tweede is de licentie: er is geen gepubliceerde prijs of term sheet voor commercieel gebruik van Qwen-Image-2.1, en zolang die er niet is, is de niet-commerciële beperking het hele verhaal voor alles wat bij een klant terechtkomt.