Una tarjeta destacada generada para el artículo, con el titular SGLang-Diffusion sirve Qwen-Image-2.1 y el subtítulo Servicio desde el día cero, medido, que muestra tres tarjetas redondeadas etiquetadas Texto a imagen, Edición de varias imágenes y Salida RGBA sobre una franja de latencia que indica 2,75 s de generación y 3,36 s de edición, con la leyenda 1024 x 1024, 40 pasos, una B200.
Engineering & Research

SGLang-Diffusion sirve Qwen-Image-2.1 en el Día Cero: generaciones en 2.75s en una sola B200

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Qwen-Image-2.1 se hizo público el 20 de septiembre de 2026, y el equipo de SGLang-Diffusion ya tenía una ruta de servicio preparada para él. El soporte desde el día cero abarca las tres tareas que realiza el modelo —generación de texto a imagen, edición de varias imágenes y salida RGBA transparente—, y viene con algo más raro que una pull request fusionada: latencia medida en hardware con nombre propio, publicada junto con la configuración que la produjo. En una sola NVIDIA B200, a 1024×1024 con 40 pasos, las cifras de SGLang se sitúan en 2,748 segundos para una generación y 3,358 segundos para una edición. La pull request de respaldo, sgl-project/sglang#39983, se abrió el 17 de septiembre —tres días antes de que los pesos se pudieran descargar—, y por eso las cifras existen, en lugar de quedar como una promesa para más adelante.

Qué significa aquí «día cero», y por qué lo interesante está en el momento elegido

El soporte para frameworks suele anunciarse a la vez que el lanzamiento de un modelo y entregarse semanas después. El caso de SGLang va en la dirección contraria. La implementación se escribió contra un checkpoint que aún no era público, lo que obliga a los autores a lidiar con la arquitectura real en lugar de una hoja de especificaciones: el transformer de difusión, el VAE RGBA de 64 canales, el condicionamiento de Qwen3-VL, la entrada de múltiples imágenes de referencia y RGBA de entrada y de salida.

Esa es la razón para confiar más en una tabla de latencia que en una lista de capacidades. Un modelo que nunca ha sido servido no tiene cifras medidas, y una cifra que llega acompañada de su hardware, su resolución, su número de pasos y su precisión puede verificarla cualquiera que tenga la misma tarjeta. Las cifras de SGLang están etiquetadas como una configuración específica, no como una afirmación general sobre el modelo.

El resto de las herramientas llegó en la misma ventana. ComfyUI lanzó soporte nativo, Diffusers fusionó QwenImage21Pipeline, vLLM-Omni añadió ejecución paso a paso y cuantización FP8, y LightX2V añadió aceleración con soporte para AMD Radeon a través de ROCm. Los frameworks son la parte de un lanzamiento que determina si alguien fuera de un laboratorio puede usarlo.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

Los números, y lo que no dicen

El trabajo de SGLang publica la latencia por solicitud, no el rendimiento. Esa distinción importa si estás dimensionando un servicio en lugar de ejecutar una demo: una sola generación de 2,7 segundos te indica el tiempo de ida y vuelta, no cuántos usuarios concurrentes absorbe una tarjeta. Las configuraciones publicadas, todas a 1024×1024 y 40 pasos:

B200, pesos residentes, FlashAttention — 2,748 s de generación, 3,358 s de edición, tras una corrección de la norma Q/K y un cambio en LayerNorm que recortaron unos pocos puntos porcentuales cada uno.
RTX PRO 6000 Blackwell, 96 GB, residente — 8,23 s de generación, 9,85 s de edición con un pico de huella de memoria de 40,1 GiB; 10,28 s y 10,66 s con el transformer de difusión descargado, lo que redujo el pico a 26,1 GiB.
DGX Spark, 1× GB10, modo eager, decodificación VAE completa — 35,36 s de generación, 42,23 s de edición, 35,49 s y 42,21 s para las variantes transparentes. Esos tiempos incluyen la serialización a PNG. Los grafos CUDA «breakable» produjeron píxeles idénticos sin ninguna mejora de velocidad medible (35,96 s frente a 35,64 s), y el batching y las configuraciones con varios Spark no se evaluaron en absoluto.
RTX 4090, 24 GB, descarga por capas, solo denoising — 26,69 s en BF16 base con SDPA, 10,31 s con Cache-DiT (2,59×), 5,59 s con Cache-DiT más el conjunto de kernels INT8 (4,77×), 4,74 s añadiendo atención Sage (5,63×).

Dos advertencias honestas acompañan a esas filas. Primero, son latencias de una sola solicitud, y la fila de la 4090 solo mide el denoising —el codificador de texto y el VAE quedan fuera del temporizador. Segundo, los autores de SGLang enmarcan la verificación más amplia como funcional, no evaluativa: la salida BF16 no es exacta a nivel de bits entre distintas ubicaciones, y la cuantización o el paralelismo de tensores cambia los números. Más rápido y diferente no es lo mismo que más rápido y mejor.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Por qué la ruta de salida transparente es la que hay que seguir de cerca

RGBA es donde este modelo se diferencia de los endpoints de imágenes que la mayoría de los equipos ya invoca, y también es donde el serving se vuelve engorroso. Qwen-Image-2.1 elimina el ruido en un espacio latente que tiene un canal alfa como componente de primera clase, mediante un VAE RGBA de 64 canales con compresión espacial de 16×. La transparencia no es un posproceso que se añade con un modelo de segmentación; es lo que emite el muestreador.

Servir eso bien es más difícil que servir RGB. La salida es más grande, el VAE tiene más canales que decodificar y la solicitud lleva un bit de modo adicional que el planificador tiene que enrutar. La verificación de SGLang cubre exactamente esa superficie: salida PNG transparente, alfa conservado en todo el rango de 0 a 255 y un PSNR de RGBA de 60,69 dB en una sola muestra, con las configuraciones de FP8 aprobando también la generación transparente. Eso es una comprobación de corrección más que un benchmark de calidad, y los autores lo dicen. Establece que el canal alfa es real y sobrevive a la cuantización; no dice nada sobre si los bordes quedan limpios en pelo, pelaje o vidrio.

El valor práctico de un stack de servicio con una ruta de transparencia probada es que convierte una canalización de tres herramientas en una sola llamada. La generación con alfa, la edición dentro de una imagen que ya tiene alfa y la extracción de un sujeto de una fotografía RGB normal hacia una capa transparente pasan todas por el mismo endpoint.

Dónde encaja esto si no estás ejecutando la GPU tú mismo

La parte incómoda del lanzamiento de Qwen-Image-2.1 es que no hay ningún endpoint alojado al que llamar. Los pesos son una descarga de aproximadamente 33 GB, el componente de generación es un transformer de difusión de 7B emparejado con un codificador de texto Qwen3-VL 8B, y todo se distribuye bajo el Qwen Research License Agreement con fecha del 20 de septiembre de 2026 —solo para uso no comercial, y el despliegue comercial requiere una licencia aparte del proveedor. Así que la receta de SGLang no es una alternativa a una API. Es la API, y tú eres el operador.

Eso cambia para qué sirve una capa de enrutamiento. OrcaRouter pone más de 200 modelos al frente tras un único endpoint compatible con OpenAI, al precio de lista del proveedor y sin ningún margen, con conmutación por error automática entre proveedores, un DSL de enrutamiento para componer alternativas de respaldo y fusión de modelos para llamadas tipo panel, pero no enruta ningún modelo Qwen-Image de ninguna versión, y Qwen-Image-2.1 nunca será una ruta que puedas invocar allí. La arquitectura realista es una dividida: ejecuta Qwen-Image-2.1 en tu propio hardware a través de SGLang para el trabajo con transparencia y con múltiples referencias, y envía todo lo demás a modelos de imagen alojados con una sola clave. Nuestro catálogo incluye la línea GPT-Image de OpenAI, los niveles de Imagen 4 de Google y las vistas previas de imágenes de Gemini, y el endpoint de imágenes Grok Imagine de xAI, todos al precio de lista traspasado, de modo que cualquier cambio de precio de un proveedor en cualquiera de ellos se refleja en nuestro lado el mismo día.

Cómo se ve realmente un despliegue

La documentación de SGLang incluye un cookbook para este modelo con comandos por GPU, y la invocación recomendada del servidor es una sola línea: sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Las solicitudes de texto a imagen admiten el batching dinámico opcional; las solicitudes de edición de imágenes se gestionan mediante una ruta independiente, y una misma solicitud puede devolver varias salidas.

Las configuraciones que realmente se han verificado son más limitadas de lo que implica la matriz de compatibilidad. H200, B200, RTX PRO 6000 96 GB, RTX 5090 y RTX 4090 están cubiertas para la generación y edición a 1024×1024 en 40 pasos, incluidas sus variantes transparentes, además de paralelismo de tensores con múltiples GPU, atención Ulysses y Ring, offload por capas, decodificación VAE en mosaicos paralelos, Cache-DiT, grafos CUDA y cuantización FP8 en línea y serializada. Las recetas multi-GPU y NVFP4 en la RTX PRO 6000 siguen sin verificarse, y el RDMA multihost y los roles desagregados multi-rank no están cubiertos. Si tu plan implica cuatro tarjetas y un fabric, estás por delante de la evidencia publicada.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Dos cosas que hay que vigilar a continuación. La primera es si alguien publica rendimiento en lugar de latencia: las cifras de concurrencia son lo que convierte una cifra de 2,7 segundos en un plan de capacidad. La segunda es la licencia: no hay precio ni hoja de términos publicados para el uso comercial de Qwen-Image-2.1 y, hasta que los haya, la restricción de uso no comercial es todo lo que hay para cualquier cosa que se entregue a un cliente.