Wygenerowana karta bohatera dla artykułu, z nagłówkiem SGLang-Diffusion obsługuje Qwen-Image-2.1 z podtytułem Obsługa od dnia zerowego, zmierzona, pokazująca trzy zaokrąglone karty oznaczone Tekst na obraz, Edycja wielu obrazów i Wyjście RGBA nad paskiem opóźnienia odczytującym 2,75 s generowania i 3,36 s edycji z podpisem 1024 x 1024, 40 kroków, jeden B200.
Engineering & Research

SGLang-Diffusion obsługuje Qwen-Image-2.1 od dnia zero: generowanie w 2,75 s na jednym B200

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen-Image-2.1 został udostępniony publicznie 20 września 2026 r., a zespół SGLang-Diffusion miał już dla niego gotową ścieżkę serwowania. Wsparcie od dnia zerowego obejmuje trzy zadania, które wykonuje model — generowanie obrazów na podstawie tekstu, edycję wielu obrazów i przezroczyste wyjście RGBA — a towarzyszy temu coś rzadszego niż scalony pull request: zmierzona latencja na konkretnym sprzęcie, opublikowana wraz z konfiguracją, która ją wygenerowała. Na pojedynczym NVIDIA B200, 1024×1024 przy 40 krokach, wyniki SGLang wynoszą 2,748 sekundy dla generowania i 3,358 sekundy dla edycji. Wspierający pull request, sgl-project/sglang#39983, został otwarty 17 września — trzy dni przed tym, jak wagi stały się dostępne do pobrania — i dlatego te liczby w ogóle istnieją, zamiast być obiecywane na później.

Co oznacza tutaj „dzień zero” i dlaczego najciekawszy jest moment jego wystąpienia

Wsparcie dla frameworka jest zwykle ogłaszane jednym tchem wraz z premierą modelu i dostarczane kilka tygodni później. W przypadku SGLang jest odwrotnie. Implementację napisano pod checkpoint, który nie był jeszcze publicznie dostępny, co zmusza autorów do zmierzenia się z rzeczywistą architekturą, a nie kartą specyfikacji: transformator dyfuzyjny, VAE RGBA z 64 kanałami, warunkowanie Qwen3-VL, wejście z wieloma obrazami referencyjnymi oraz RGBA na wejściu i na wyjściu.

To jest powód, by ufać tabeli opóźnień bardziej niż liście możliwości. Model, który nigdy nie był serwowany, nie ma zmierzonych liczb, a liczbę, która pojawia się wraz z dołączonym sprzętem, rozdzielczością, liczbą kroków i precyzją, może sprawdzić każdy, kto ma tę samą kartę. Liczby SGLang są oznaczone jako konkretna konfiguracja, a nie jako ogólne twierdzenie o modelu.

Reszta narzędzi trafiła w tym samym oknie czasowym. ComfyUI udostępniło natywne wsparcie, Diffusers scaliło QwenImage21Pipeline, vLLM-Omni dodało wykonanie krokowe i kwantyzację FP8, a LightX2V dodało przyspieszenie ze wsparciem AMD Radeon poprzez ROCm. Frameworki to ta część wydania, która decyduje o tym, czy ktokolwiek spoza laboratorium może z niego korzystać.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

Liczby i to, czego nie mówią

Praca nad SGLang publikuje opóźnienie na żądanie, a nie przepustowość. To rozróżnienie ma znaczenie, jeśli dobierasz zasoby pod usługę, a nie uruchamiasz wersję demonstracyjną: pojedyncze generowanie trwające 2,7 sekundy mówi o czasie pełnej rundy, a nie o tym, ilu współbieżnych użytkowników obsłuży jedna karta. Opublikowane konfiguracje, wszystkie przy 1024×1024 i 40 krokach:

B200, wagi rezydentne, FlashAttention — 2,748 s generowania, 3,358 s edycji, po poprawce normalizacji Q/K i zmianie LayerNorm, z których każda ucięła kilka procent.
RTX PRO 6000 Blackwell, 96 GB, rezydentne — 8,23 s generowania, 9,85 s edycji przy szczytowym zużyciu 40,1 GiB; 10,28 s i 10,66 s przy odciążonym transformatorze dyfuzyjnym, co obniża szczyt do 26,1 GiB.
DGX Spark, 1× GB10, tryb eager, pełny dekod VAE — 35,36 s generowania, 42,23 s edycji, 35,49 s i 42,21 s dla wariantów przezroczystych. Obejmują one serializację PNG. Łamliwe grafy CUDA dawały identyczne piksele bez mierzalnej korzyści szybkości (35,96 s wobec 35,64 s), a przetwarzanie wsadowe i konfiguracje z wieloma Sparkami nie zostały w ogóle poddane benchmarkom.
RTX 4090, 24 GB, layerwise offload, tylko odszumianie — 26,69 s przy bazowym BF16 z SDPA, 10,31 s z Cache-DiT (2,59×), 5,59 s z Cache-DiT i zestawem jąder INT8 (4,77×), 4,74 s po dodaniu uwagi Sage (5,63×).

Z tymi wierszami wiążą się dwa szczere zastrzeżenia. Po pierwsze, są to opóźnienia dla pojedynczego żądania, a wiersz 4090 mierzy wyłącznie odszumianie — enkoder tekstu i VAE znajdują się poza pomiarem czasu. Po drugie, autorzy SGLang określają szerszą weryfikację jako funkcjonalną, a nie oceniającą: wyjście BF16 nie jest bitowo dokładne w różnych rozmieszczeniach, a kwantyzacja lub równoległość tensorowa zmienia liczby. Szybsze i inne to nie to samo co szybsze i lepsze.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Dlaczego ścieżka przezroczystego wyjścia jest tą, na którą warto zwrócić uwagę

RGBA to obszar, w którym ten model różni się od endpointów obrazów, które większość zespołów już wywołuje, i to również obszar, w którym obsługa staje się kłopotliwa. Qwen-Image-2.1 odszumia w przestrzeni ukrytej, w której kanał alfa jest pełnoprawnym komponentem, za pomocą 64-kanałowego VAE RGBA z 16× kompresją przestrzenną. Przezroczystość nie jest procesem doczepianym po fakcie przy użyciu modelu segmentacji; jest tym, co emituje sampler.

Serwowanie tego w dobry sposób jest trudniejsze niż serwowanie RGB. Wynik jest większy, VAE ma więcej kanałów do zdekodowania, a żądanie niesie dodatkowy bit trybu, który scheduler musi skierować. Weryfikacja SGLang obejmuje dokładnie ten obszar — przezroczysty wynik w formacie PNG, zachowany kanał alfa w pełnym zakresie 0–255 oraz PSNR dla RGBA wynoszący 60,69 dB w pojedynczej próbce, a konfiguracje FP8 również przechodzą generowanie przezroczystych obrazów. To sprawdzenie poprawności, a nie benchmark jakości, i autorzy tak twierdzą. Dowodzi, że kanał alfa jest rzeczywisty i przetrwa kwantyzację; nie mówi nic o tym, czy krawędzie są czyste na włosach, futrze lub szkle.

Praktyczna wartość stosu serwującego z przetestowaną ścieżką przezroczystości polega na tym, że zamienia potok trzech narzędzi w jedno wywołanie. Generowanie z kanałem alfa, edycja wewnątrz obrazu, który już ma kanał alfa, oraz wyodrębnianie obiektu ze zwykłego zdjęcia RGB do przezroczystej warstwy – wszystko to przechodzi przez ten sam punkt końcowy.

Gdzie to pasuje, jeśli sam nie uruchamiasz GPU

Kłopotliwa część wydania Qwen-Image-2.1 polega na tym, że nie ma hostowanego endpointu, który można wywołać. Wagi to około 33 GB do pobrania, komponent generujący to 7B transformer dyfuzyjny w parze z 8B enkoderem tekstowym Qwen3-VL, a całość jest dystrybuowana na warunkach Qwen Research License Agreement z dnia 20 września 2026 r. — wyłącznie do użytku niekomercyjnego, przy czym wdrożenie komercyjne wymaga oddzielnej licencji od dostawcy. Zatem recepta SGLang nie jest alternatywą dla API. To jest API, a operatorem jesteś ty.

To zmienia sens istnienia warstwy routingu. OrcaRouter udostępnia ponad 200 modeli za jednym endpointem zgodnym z OpenAI, w cenie katalogowej dostawcy i bez żadnej marży, z automatycznym przełączaniem awaryjnym między dostawcami, DSL-em routingu do komponowania łańcuchów fallbacków oraz fuzją modeli do wywołań w stylu panelowym — ale nie kieruje żadnego modelu Qwen-Image w żadnej wersji, a Qwen-Image-2.1 nigdy nie będzie trasą, którą można by tam wywołać. Realistyczna architektura jest podzielona: uruchamiaj Qwen-Image-2.1 na własnym sprzęcie przez SGLang do zadań transparentnych i z wieloma referencjami, a wszystko inne wysyłaj do hostowanych modeli obrazowych za pomocą jednego klucza. Nasz katalog obejmuje linię OpenAI GPT-Image, warianty Google Imagen 4 i podglądy obrazów Gemini oraz endpoint obrazowy xAI Grok Imagine — wszystko w cenie katalogowej przekazywanej dalej, więc zmiana ceny u dostawcy któregokolwiek z nich jest widoczna po naszej stronie tego samego dnia.

Jak faktycznie wygląda wdrożenie

Dokumentacja SGLang zawiera cookbook dla tego modelu z poleceniami dla poszczególnych GPU, a zalecane wywołanie serwera to jedna linia — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Żądania text-to-image obsługują opcjonalnie włączane dynamiczne grupowanie wsadowe; żądania edycji obrazów są obsługiwane jako osobna ścieżka, a jedno żądanie może zwrócić wiele wyników.

Konfiguracje, które faktycznie zweryfikowano, są węższe, niż sugeruje macierz kompatybilności. H200, B200, RTX PRO 6000 96 GB, RTX 5090 i RTX 4090 są objęte generowaniem i edycją w rozdzielczości 1024×1024 przy 40 krokach, w tym ich przezroczystymi wariantami, a także równoległością tensorową na wielu GPU, Ulysses i Ring attention, odciążaniem warstwowym, równoległym kafelkowym dekodowaniem VAE, Cache-DiT, grafami CUDA oraz kwantyzacją FP8 online i serializowaną. Receptury multi-GPU i NVFP4 na RTX PRO 6000 pozostają niezweryfikowane, a wielohostowe RDMA i rozdzielone role multi-rank nie są objęte. Jeśli Twój plan zakłada cztery karty i fabric, wyprzedzasz opublikowane dowody.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Dwie rzeczy, na które warto teraz uważać. Pierwsza: czy ktoś opublikuje przepustowość, a nie opóźnienie — liczby dotyczące współbieżności są tym, co zamienia wynik 2,7 sekundy w plan przepustowości. Druga: licencja — nie ma opublikowanej ceny ani term sheetu dla komercyjnego wykorzystania Qwen-Image-2.1, a dopóki go nie ma, ograniczenie niekomercyjne jest całą historią dla wszystkiego, co trafia do klienta.