Ett genererat hero-kort för artikeln, med rubriken SGLang-Diffusion serverar Qwen-Image-2.1, med underrubriken Day-zero-servering, uppmätt, som visar tre rundade kort märkta Text till bild, Redigering av flera bilder och RGBA-utdata ovanför en latensremsa som anger 2,75 s generering och 3,36 s redigering, med bildtexten 1024 x 1024, 40 steg, en B200.
Engineering & Research

SGLang-Diffusion stöder Qwen-Image-2.1 på dag noll: genereringar på 2,75 s på en B200

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen-Image-2.1 släpptes offentligt den 20 september 2026, och SGLang-Diffusion-teamet hade en serveringsväg som väntade på den. Stödet från dag ett täcker de tre uppgifter modellen utför – text-till-bild-generering, redigering av flera bilder och transparent RGBA-utdata – och det kommer med något mer sällsynt än en mergad pull request: uppmätt latens på namngiven hårdvara, publicerad tillsammans med konfigurationen som gav den. På en enda NVIDIA B200, 1024×1024 vid 40 steg, landar SGLang-siffrorna på 2,748 sekunder för en generering och 3,358 sekunder för en redigering. Den understödjande pull requesten, sgl-project/sglang#39983, öppnades den 17 september – tre dagar innan vikterna gick att ladda ner – vilket är anledningen till att siffrorna överhuvudtaget finns, i stället för att ha utlovats till senare.

Vad "dag noll" betyder här, och varför tajmingen är det intressanta

Ramverksstöd tillkännages vanligtvis i samma andetag som ett modellsläpp och levereras veckor efteråt. SGLang-fallet är det omvända. Implementationen skrevs mot en checkpoint som ännu inte var offentlig, vilket tvingar författarna att hantera den verkliga arkitekturen i stället för ett specifikationsblad: diffusionstransformatorn, den 64-kanaliga RGBA-VAE:n, Qwen3-VL-konditionering, indata med flera referensbilder och RGBA in och ut.

Det är anledningen till att lita mer på en latenstabell än på en kapabilitetslista. En modell som aldrig har serverats har inga uppmätta siffror, och en siffra som kommer med sin hårdvara, upplösning, stegantal och precision bifogad kan kontrolleras av vem som helst med samma kort. SGLang-siffrorna är märkta som en specifik konfiguration, inte som ett allmänt påstående om modellen.

Resten av verktygen landade i samma fönster. ComfyUI släppte inbyggt stöd, Diffusers mergade QwenImage21Pipeline, vLLM-Omni lade till stegvis exekvering och FP8-kvantisering, och LightX2V lade till acceleration med AMD Radeon-stöd via ROCm. Ramverken är den del av ett släpp som avgör om någon utanför ett labb kan använda det.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

Siffrorna, och vad de inte säger

SGLang-arbetet publicerar latens per begäran, inte genomströmning. Den skillnaden spelar roll om du dimensionerar en tjänst snarare än kör en demo: en enskild generering på 2,7 sekunder säger dig rundturen, inte hur många samtidiga användare ett kort klarar. De publicerade konfigurationerna, alla vid 1024×1024 och 40 steg:

B200, residenta vikter, FlashAttention — 2,748 s generering, 3,358 s redigering, efter en Q/K-norm-fix och en LayerNorm-ändring som var för sig kapade några procent.
RTX PRO 6000 Blackwell, 96 GB, resident — 8,23 s generering, 9,85 s redigering vid ett högsta minnesavtryck på 40,1 GiB; 10,28 s och 10,66 s med diffusionstransformatorn avlastad, vilket sänker toppen till 26,1 GiB.
DGX Spark, 1× GB10, eager, full VAE-avkodning — 35,36 s generering, 42,23 s redigering, 35,49 s och 42,21 s för de transparenta varianterna. Dessa inkluderar PNG-serialisering. Brytbara CUDA-grafer gav identiska pixlar utan mätbar hastighetsvinst (35,96 s mot 35,64 s), och varken batchning eller multi-Spark-uppsättningar benchmarkades alls.
RTX 4090, 24 GB, lagervis avlastning, endast avbrusning — 26,69 s vid bas-BF16 med SDPA, 10,31 s med Cache-DiT (2,59×), 5,59 s med Cache-DiT plus INT8-kärnuppsättningen (4,77×), 4,74 s med tillägg av Sage attention (5,63×).

Två ärliga förbehåll vidlåder de raderna. För det första är de latenser för enskilda förfrågningar, och 4090-raden mäter endast avbrusning – textkodaren och VAE ligger utanför tidtagningen. För det andra beskriver SGLang-författarna den bredare verifieringen som funktionell, inte utvärderande: BF16-utdata är inte bit-exakt över olika placeringar, och kvantisering eller tensorparallellism ändrar siffrorna. Snabbare och annorlunda är inte samma sak som snabbare och bättre.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Varför den transparenta utdatavägen är den att hålla koll på

RGBA är där den här modellen skiljer sig från de bildslutpunkter som de flesta team redan anropar, och det är också där serveringen blir besvärlig. Qwen-Image-2.1 avbrusar i ett latent utrymme som har en alfakanal som en förstklassig komponent, via en RGBA-VAE med 64 kanaler och 16× rumslig komprimering. Transparens är inte en efterbearbetning som man hakar på med en segmenteringsmodell; det är vad samplern skickar ut.

Att betjäna det väl är svårare än att betjäna RGB. Utdata är större, VAE:n har fler kanaler att avkoda, och begäran bär en extra lägesbit som schemaläggaren måste dirigera. SGLangs verifiering täcker exakt detta område – transparent PNG-utdata, alfa som bevaras över hela intervallet 0–255, och en RGBA-PSNR på 60,69 dB i ett enda sampel, där även FP8-konfigurationerna klarar transparent generering. Det är en korrekthetskontroll snarare än ett kvalitetsbenchmark, och författarna säger det. Det fastställer att alfakanalen är verklig och överlever kvantisering; det säger ingenting om huruvida kanterna är rena på hår, päls eller glas.

Det praktiska värdet av en serveringsstack med en testad transparensväg är att den förvandlar en pipeline med tre verktyg till ett enda anrop. Generering med alfa, redigering inuti en bild som redan har alfa och att lyfta ut ett motiv ur ett vanligt RGB-fotografi till ett transparent lager går alla genom samma slutpunkt.

Var detta passar in om du inte kör GPU:n själv

Det besvärliga med lanseringen av Qwen-Image-2.1 är att det inte finns någon hostad slutpunkt att anropa. Vikterna är en nedladdning på ungefär 33 GB, genereringskomponenten är en 7B-diffusionstransformerare parad med en Qwen3-VL 8B-textkodare, och helheten levereras under Qwen Research License Agreement daterat den 20 september 2026 – endast för icke-kommersiell användning, och kommersiell driftsättning kräver en separat licens från leverantören. Så SGLang-receptet är inte ett alternativ till ett API. Det är API:et, och du är operatören.

Det förändrar vad ett routningslager är till för. OrcaRouter tillhandahåller 200+ modeller bakom en OpenAI-kompatibel endpoint till leverantörens listpris med noll påslag, automatisk redundansväxling mellan leverantörer, ett routnings-DSL för att komponera reservvägar och modellfusion för panel-liknande anrop – men den routar ingen Qwen-Image-modell av någon version, och Qwen-Image-2.1 kommer aldrig att vara en rutt du kan anropa där. Den realistiska arkitekturen är delad: kör Qwen-Image-2.1 på din egen hårdvara via SGLang för det transparenta arbetet och multireferensarbetet, och skicka allt annat till hostade bildmodeller med en enda nyckel. Vår katalog innehåller OpenAIs GPT-Image-serie, Googles Imagen 4-nivåer och Gemini-bildförhandsvisningar samt xAIs Grok Imagine-bildendpoint, allt till listpris som förs vidare, så en leverantörsprisändring på någon av dem är live hos oss samma dag.

Hur en driftsättning faktiskt ser ut

SGLang-dokumentationen levereras med en kokbok för den här modellen med kommandon per GPU, och det rekommenderade serveranropet är en enda rad — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Text-till-bild-begäranden stöder dynamisk batchning som tillval; bildredigeringsbegäranden hanteras som en separat väg, och en begäran kan returnera flera utdata.

De konfigurationer som faktiskt har verifierats är snävare än vad kompatibilitetsmatrisen antyder. H200, B200, RTX PRO 6000 96 GB, RTX 5090 och RTX 4090 täcks för 1024×1024-generering och redigering vid 40 steg, inklusive deras transparenta varianter, plus multi-GPU-tensorparallellism, Ulysses- och Ring-attention, lagervis offload, parallell tile-baserad VAE-avkodning, Cache-DiT, CUDA-grafer samt online- och serialiserad FP8-kvantisering. Multi-GPU- och NVFP4-recept på RTX PRO 6000 är fortfarande overifierade, och multi-host-RDMA och multi-rank-disaggregerade roller är inte täckta. Om din plan involverar fyra kort och ett fabric ligger du före den publicerade evidensen.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Två saker att bevaka härnäst. Det första är om någon publicerar genomströmning snarare än latens – samtidighetssiffror är det som förvandlar en siffra på 2,7 sekunder till en kapacitetsplan. Det andra är licensen: det finns inget publicerat pris eller villkorsblad för kommersiell användning av Qwen-Image-2.1, och tills det finns är den icke-kommersiella begränsningen hela historien för allt som levereras till en kund.