
SGLang-Diffusion atende Qwen-Image-2.1 no Dia Zero: gerações em 2,75 s em uma única B200
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O Qwen-Image-2.1 tornou-se público a 20 de setembro de 2026, e a equipa do SGLang-Diffusion já tinha um caminho de serving à espera dele. O suporte no dia zero cobre as três tarefas que o modelo desempenha — geração de texto para imagem, edição de várias imagens e saída RGBA transparente — e vem com algo mais raro do que um pull request integrado: latência medida em hardware nomeado, publicada com a configuração que a produziu. Num único NVIDIA B200, 1024×1024 com 40 passos, os números do SGLang ficam em 2,748 segundos para uma geração e 3,358 segundos para uma edição. O pull request de suporte, sgl-project/sglang#39983, foi aberto a 17 de setembro — três dias antes de os pesos estarem disponíveis para download — e é por isso que os números existem de facto, em vez de serem prometidos para mais tarde.
O que "dia zero" significa aqui, e por que o momento é a parte interessante
O suporte a frameworks costuma ser anunciado no mesmo fôlego que o lançamento de um modelo e entregue semanas depois. O caso do SGLang segue o caminho inverso. A implementação foi escrita para um checkpoint que ainda não era público, o que obriga os autores a lidar com a arquitetura real em vez de uma ficha de especificações: o transformer de difusão, o VAE RGBA de 64 canais, o condicionamento Qwen3-VL, a entrada de múltiplas imagens de referência e RGBA na entrada e na saída.
Essa é a razão para confiar mais em uma tabela de latência do que em uma lista de capacidades. Um modelo que nunca foi servido não tem números medidos, e um número que chega com seu hardware, resolução, número de etapas e precisão anexados pode ser verificado por qualquer pessoa com a mesma placa. Os números do SGLang são rotulados como uma configuração específica, não como uma afirmação geral sobre o modelo.
O restante das ferramentas chegou na mesma janela. O ComfyUI lançou suporte nativo, o Diffusers integrou QwenImage21Pipeline, o vLLM-Omni adicionou execução passo a passo e quantização FP8, e o LightX2V adicionou aceleração com suporte a AMD Radeon via ROCm. Os frameworks são a parte de um lançamento que decide se alguém fora de um laboratório pode usá-lo.

Os números, e o que eles não dizem
O trabalho do SGLang publica latência por requisição, não throughput. Essa distinção importa se você está dimensionando um serviço em vez de executar uma demonstração: uma única geração de 2,7 segundos informa o tempo de ida e volta, não quantos usuários simultâneos uma placa absorve. As configurações publicadas, todas em 1024×1024 e 40 passos:
• B200, pesos residentes, FlashAttention — 2,748 s de geração, 3,358 s de edição, após uma correção de Q/K-norm e uma alteração de LayerNorm que cada uma reduziu alguns por cento.
• RTX PRO 6000 Blackwell, 96 GB, residente — 8,23 s de geração, 9,85 s de edição com um pico de ocupação de 40,1 GiB; 10,28 s e 10,66 s com o transformer de difusão descarregado, reduzindo o pico para 26,1 GiB.
• DGX Spark, 1× GB10, eager, descodificação VAE completa — 35,36 s de geração, 42,23 s de edição, 35,49 s e 42,21 s para as variantes transparentes. Estes incluem a serialização PNG. Grafos CUDA breakable produziram píxeis idênticos sem qualquer benefício de velocidade mensurável (35,96 s contra 35,64 s), e o batching e configurações multi-Spark não foram avaliados de todo.
• RTX 4090, 24 GB, offload camada a camada, apenas denoise — 26,69 s em BF16 base com SDPA, 10,31 s com Cache-DiT (2,59×), 5,59 s com Cache-DiT mais o conjunto de kernels INT8 (4,77×), 4,74 s adicionando atenção Sage (5,63×).
Dois avisos honestos acompanham essas linhas. Primeiro, são latências de requisição única, e a linha da 4090 mede apenas o denoising — o codificador de texto e o VAE ficam fora da contagem de tempo. Segundo, os autores do SGLang apresentam a verificação mais ampla como funcional, e não avaliativa: a saída em BF16 não é bit-exata entre diferentes posicionamentos, e a quantização ou o paralelismo de tensores altera os números. Mais rápido e diferente não é o mesmo que mais rápido e melhor.

Por que o caminho de saída transparente é o que merece atenção
RGBA é onde este modelo se diferencia dos endpoints de imagem que a maioria das equipes já chama, e também é onde o serving fica complicado. O Qwen-Image-2.1 faz denoising em um espaço latente que tem um canal alfa como componente de primeira classe, por meio de um VAE RGBA de 64 canais com compressão espacial de 16×. A transparência não é um pós-processamento que você acopla com um modelo de segmentação; é o que o amostrador emite.
Servir isso bem é mais difícil do que servir RGB. A saída é maior, o VAE tem mais canais para descodificar e o pedido transporta um bit de modo extra que o escalonador tem de encaminhar. A verificação do SGLang cobre exatamente essa superfície — saída PNG transparente, alfa retido em toda a faixa de 0–255 e um PSNR RGBA de 60,69 dB numa única amostra, com as configurações FP8 também a passarem na geração transparente. Trata-se de uma verificação de correção e não de um benchmark de qualidade, e os autores afirmam-no. Estabelece que o canal alfa é real e sobrevive à quantização; não diz nada sobre se as bordas ficam limpas em cabelo, pelos ou vidro.
O valor prático de um stack de serving com um caminho de transparência testado é que ele transforma um pipeline de três ferramentas em uma única chamada. A geração com alpha, a edição dentro de uma imagem que já tem alpha e a extração de um sujeito de uma fotografia RGB comum para uma camada transparente passam todas pelo mesmo endpoint.
Onde isto se encaixa se você não estiver rodando a GPU por conta própria
A parte incômoda do lançamento do Qwen-Image-2.1 é que não há um endpoint hospedado para chamar. Os pesos são um download de aproximadamente 33 GB, o componente de geração é um transformador de difusão de 7B emparelhado com um codificador de texto Qwen3-VL 8B, e tudo é distribuído sob o Qwen Research License Agreement datado de 20 de setembro de 2026 — apenas para uso não comercial, com implantação comercial exigindo uma licença separada do fornecedor. Portanto, a receita do SGLang não é uma alternativa a uma API. É a API, e você é o operador.
Isso muda para que serve uma camada de roteamento. O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com a OpenAI, ao preço de tabela do provedor e sem nenhum acréscimo, failover automático entre provedores, uma DSL de roteamento para compor fallbacks e fusão de modelos para chamadas no estilo painel — mas não roteia nenhum modelo Qwen-Image de qualquer versão, e o Qwen-Image-2.1 nunca será uma rota que você possa chamar lá. A arquitetura realista é dividida: execute o Qwen-Image-2.1 no seu próprio hardware via SGLang para o trabalho transparente e com múltiplas referências, e envie todo o resto para modelos de imagem hospedados usando uma única chave. Nosso catálogo inclui a linha GPT-Image da OpenAI, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, e o endpoint de imagem Grok Imagine da xAI, todos com o preço de tabela repassado, então uma mudança de preço de um fornecedor em qualquer um deles entra no ar do nosso lado no mesmo dia.
Como é realmente um deployment
A documentação do SGLang vem com um cookbook para este modelo, com comandos por GPU, e a invocação recomendada do servidor é uma única linha — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. As requisições de texto para imagem suportam batching dinâmico opcional; as requisições de edição de imagem são tratadas como um caminho separado, e uma requisição pode retornar múltiplas saídas.
As configurações que foram efetivamente verificadas são mais restritas do que a matriz de compatibilidade sugere. H200, B200, RTX PRO 6000 96 GB, RTX 5090 e RTX 4090 estão cobertos para geração e edição em 1024×1024 com 40 etapas, incluindo suas variantes transparentes, além de paralelismo de tensores multi-GPU, atenção Ulysses e Ring, offload por camada, decodificação VAE com tiles paralelos, Cache-DiT, grafos CUDA e quantização FP8 online e serializada. As receitas multi-GPU e NVFP4 na RTX PRO 6000 permanecem não verificadas, e RDMA multi-host e funções desagregadas multi-rank não estão cobertos. Se o seu plano envolve quatro placas e uma malha de interconexão, você está à frente das evidências publicadas.

Duas coisas para acompanhar a seguir. A primeira é se alguém publica vazão em vez de latência — os números de concorrência são o que transforma um valor de 2,7 segundos em um plano de capacidade. A segunda é a licença: não há preço publicado nem termo de condições para uso comercial do Qwen-Image-2.1 e, enquanto não houver, a restrição não comercial é tudo o que importa para qualquer coisa que seja entregue a um cliente.
