Qwen-Image-2.1 já está disponível na WaveSpeedAI. Disponibilização desde o dia zero, com desempenho medido. Experimente agora.
Engineering & Research

SGLang-Diffusion atende Qwen-Image-2.1 no Dia Zero: gerações em 2,75 s em uma única B200

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Qwen-Image-2.1 tornou-se público a 20 de setembro de 2026, e a equipa do SGLang-Diffusion já tinha um caminho de serving à espera dele. O suporte no dia zero cobre as três tarefas que o modelo desempenha — geração de texto para imagem, edição de várias imagens e saída RGBA transparente — e vem com algo mais raro do que um pull request integrado: latência medida em hardware nomeado, publicada com a configuração que a produziu. Num único NVIDIA B200, 1024×1024 com 40 passos, os números do SGLang ficam em 2,748 segundos para uma geração e 3,358 segundos para uma edição. O pull request de suporte, sgl-project/sglang#39983, foi aberto a 17 de setembro — três dias antes de os pesos estarem disponíveis para download — e é por isso que os números existem de facto, em vez de serem prometidos para mais tarde.

O que "dia zero" significa aqui, e por que o momento é a parte interessante

O suporte a frameworks costuma ser anunciado no mesmo fôlego que o lançamento de um modelo e entregue semanas depois. O caso do SGLang segue o caminho inverso. A implementação foi escrita para um checkpoint que ainda não era público, o que obriga os autores a lidar com a arquitetura real em vez de uma ficha de especificações: o transformer de difusão, o VAE RGBA de 64 canais, o condicionamento Qwen3-VL, a entrada de múltiplas imagens de referência e RGBA na entrada e na saída.

Essa é a razão para confiar mais em uma tabela de latência do que em uma lista de capacidades. Um modelo que nunca foi servido não tem números medidos, e um número que chega com seu hardware, resolução, número de etapas e precisão anexados pode ser verificado por qualquer pessoa com a mesma placa. Os números do SGLang são rotulados como uma configuração específica, não como uma afirmação geral sobre o modelo.

O restante das ferramentas chegou na mesma janela. O ComfyUI lançou suporte nativo, o Diffusers integrou QwenImage21Pipeline, o vLLM-Omni adicionou execução passo a passo e quantização FP8, e o LightX2V adicionou aceleração com suporte a AMD Radeon via ROCm. Os frameworks são a parte de um lançamento que decide se alguém fora de um laboratório pode usá-lo.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

Os números, e o que eles não dizem

O trabalho do SGLang publica latência por requisição, não throughput. Essa distinção importa se você está dimensionando um serviço em vez de executar uma demonstração: uma única geração de 2,7 segundos informa o tempo de ida e volta, não quantos usuários simultâneos uma placa absorve. As configurações publicadas, todas em 1024×1024 e 40 passos:

B200, pesos residentes, FlashAttention — 2,748 s de geração, 3,358 s de edição, após uma correção de Q/K-norm e uma alteração de LayerNorm que cada uma reduziu alguns por cento.
RTX PRO 6000 Blackwell, 96 GB, residente — 8,23 s de geração, 9,85 s de edição com um pico de ocupação de 40,1 GiB; 10,28 s e 10,66 s com o transformer de difusão descarregado, reduzindo o pico para 26,1 GiB.
DGX Spark, 1× GB10, eager, descodificação VAE completa — 35,36 s de geração, 42,23 s de edição, 35,49 s e 42,21 s para as variantes transparentes. Estes incluem a serialização PNG. Grafos CUDA breakable produziram píxeis idênticos sem qualquer benefício de velocidade mensurável (35,96 s contra 35,64 s), e o batching e configurações multi-Spark não foram avaliados de todo.
RTX 4090, 24 GB, offload camada a camada, apenas denoise — 26,69 s em BF16 base com SDPA, 10,31 s com Cache-DiT (2,59×), 5,59 s com Cache-DiT mais o conjunto de kernels INT8 (4,77×), 4,74 s adicionando atenção Sage (5,63×).

Dois avisos honestos acompanham essas linhas. Primeiro, são latências de requisição única, e a linha da 4090 mede apenas o denoising — o codificador de texto e o VAE ficam fora da contagem de tempo. Segundo, os autores do SGLang apresentam a verificação mais ampla como funcional, e não avaliativa: a saída em BF16 não é bit-exata entre diferentes posicionamentos, e a quantização ou o paralelismo de tensores altera os números. Mais rápido e diferente não é o mesmo que mais rápido e melhor.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Por que o caminho de saída transparente é o que merece atenção

RGBA é onde este modelo se diferencia dos endpoints de imagem que a maioria das equipes já chama, e também é onde o serving fica complicado. O Qwen-Image-2.1 faz denoising em um espaço latente que tem um canal alfa como componente de primeira classe, por meio de um VAE RGBA de 64 canais com compressão espacial de 16×. A transparência não é um pós-processamento que você acopla com um modelo de segmentação; é o que o amostrador emite.

Servir isso bem é mais difícil do que servir RGB. A saída é maior, o VAE tem mais canais para descodificar e o pedido transporta um bit de modo extra que o escalonador tem de encaminhar. A verificação do SGLang cobre exatamente essa superfície — saída PNG transparente, alfa retido em toda a faixa de 0–255 e um PSNR RGBA de 60,69 dB numa única amostra, com as configurações FP8 também a passarem na geração transparente. Trata-se de uma verificação de correção e não de um benchmark de qualidade, e os autores afirmam-no. Estabelece que o canal alfa é real e sobrevive à quantização; não diz nada sobre se as bordas ficam limpas em cabelo, pelos ou vidro.

O valor prático de um stack de serving com um caminho de transparência testado é que ele transforma um pipeline de três ferramentas em uma única chamada. A geração com alpha, a edição dentro de uma imagem que já tem alpha e a extração de um sujeito de uma fotografia RGB comum para uma camada transparente passam todas pelo mesmo endpoint.

Onde isto se encaixa se você não estiver rodando a GPU por conta própria

A parte incômoda do lançamento do Qwen-Image-2.1 é que não há um endpoint hospedado para chamar. Os pesos são um download de aproximadamente 33 GB, o componente de geração é um transformador de difusão de 7B emparelhado com um codificador de texto Qwen3-VL 8B, e tudo é distribuído sob o Qwen Research License Agreement datado de 20 de setembro de 2026 — apenas para uso não comercial, com implantação comercial exigindo uma licença separada do fornecedor. Portanto, a receita do SGLang não é uma alternativa a uma API. É a API, e você é o operador.

Isso muda para que serve uma camada de roteamento. O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com a OpenAI, ao preço de tabela do provedor e sem nenhum acréscimo, failover automático entre provedores, uma DSL de roteamento para compor fallbacks e fusão de modelos para chamadas no estilo painel — mas não roteia nenhum modelo Qwen-Image de qualquer versão, e o Qwen-Image-2.1 nunca será uma rota que você possa chamar lá. A arquitetura realista é dividida: execute o Qwen-Image-2.1 no seu próprio hardware via SGLang para o trabalho transparente e com múltiplas referências, e envie todo o resto para modelos de imagem hospedados usando uma única chave. Nosso catálogo inclui a linha GPT-Image da OpenAI, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, e o endpoint de imagem Grok Imagine da xAI, todos com o preço de tabela repassado, então uma mudança de preço de um fornecedor em qualquer um deles entra no ar do nosso lado no mesmo dia.

Como é realmente um deployment

A documentação do SGLang vem com um cookbook para este modelo, com comandos por GPU, e a invocação recomendada do servidor é uma única linha — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. As requisições de texto para imagem suportam batching dinâmico opcional; as requisições de edição de imagem são tratadas como um caminho separado, e uma requisição pode retornar múltiplas saídas.

As configurações que foram efetivamente verificadas são mais restritas do que a matriz de compatibilidade sugere. H200, B200, RTX PRO 6000 96 GB, RTX 5090 e RTX 4090 estão cobertos para geração e edição em 1024×1024 com 40 etapas, incluindo suas variantes transparentes, além de paralelismo de tensores multi-GPU, atenção Ulysses e Ring, offload por camada, decodificação VAE com tiles paralelos, Cache-DiT, grafos CUDA e quantização FP8 online e serializada. As receitas multi-GPU e NVFP4 na RTX PRO 6000 permanecem não verificadas, e RDMA multi-host e funções desagregadas multi-rank não estão cobertos. Se o seu plano envolve quatro placas e uma malha de interconexão, você está à frente das evidências publicadas.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Duas coisas para acompanhar a seguir. A primeira é se alguém publica vazão em vez de latência — os números de concorrência são o que transforma um valor de 2,7 segundos em um plano de capacidade. A segunda é a licença: não há preço publicado nem termo de condições para uso comercial do Qwen-Image-2.1 e, enquanto não houver, a restrição não comercial é tudo o que importa para qualquer coisa que seja entregue a um cliente.