
SGLang-Diffusion obsługuje Qwen-Image-2.1 od dnia zero: generowanie w 2,75 s na jednym B200
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 został udostępniony publicznie 20 września 2026 r., a zespół SGLang-Diffusion miał już dla niego gotową ścieżkę serwowania. Wsparcie od dnia zerowego obejmuje trzy zadania, które wykonuje model — generowanie obrazów na podstawie tekstu, edycję wielu obrazów i przezroczyste wyjście RGBA — a towarzyszy temu coś rzadszego niż scalony pull request: zmierzona latencja na konkretnym sprzęcie, opublikowana wraz z konfiguracją, która ją wygenerowała. Na pojedynczym NVIDIA B200, 1024×1024 przy 40 krokach, wyniki SGLang wynoszą 2,748 sekundy dla generowania i 3,358 sekundy dla edycji. Wspierający pull request, sgl-project/sglang#39983, został otwarty 17 września — trzy dni przed tym, jak wagi stały się dostępne do pobrania — i dlatego te liczby w ogóle istnieją, zamiast być obiecywane na później.
Co oznacza tutaj „dzień zero” i dlaczego najciekawszy jest moment jego wystąpienia
Wsparcie dla frameworka jest zwykle ogłaszane jednym tchem wraz z premierą modelu i dostarczane kilka tygodni później. W przypadku SGLang jest odwrotnie. Implementację napisano pod checkpoint, który nie był jeszcze publicznie dostępny, co zmusza autorów do zmierzenia się z rzeczywistą architekturą, a nie kartą specyfikacji: transformator dyfuzyjny, VAE RGBA z 64 kanałami, warunkowanie Qwen3-VL, wejście z wieloma obrazami referencyjnymi oraz RGBA na wejściu i na wyjściu.
To jest powód, by ufać tabeli opóźnień bardziej niż liście możliwości. Model, który nigdy nie był serwowany, nie ma zmierzonych liczb, a liczbę, która pojawia się wraz z dołączonym sprzętem, rozdzielczością, liczbą kroków i precyzją, może sprawdzić każdy, kto ma tę samą kartę. Liczby SGLang są oznaczone jako konkretna konfiguracja, a nie jako ogólne twierdzenie o modelu.
Reszta narzędzi trafiła w tym samym oknie czasowym. ComfyUI udostępniło natywne wsparcie, Diffusers scaliło QwenImage21Pipeline, vLLM-Omni dodało wykonanie krokowe i kwantyzację FP8, a LightX2V dodało przyspieszenie ze wsparciem AMD Radeon poprzez ROCm. Frameworki to ta część wydania, która decyduje o tym, czy ktokolwiek spoza laboratorium może z niego korzystać.

Liczby i to, czego nie mówią
Praca nad SGLang publikuje opóźnienie na żądanie, a nie przepustowość. To rozróżnienie ma znaczenie, jeśli dobierasz zasoby pod usługę, a nie uruchamiasz wersję demonstracyjną: pojedyncze generowanie trwające 2,7 sekundy mówi o czasie pełnej rundy, a nie o tym, ilu współbieżnych użytkowników obsłuży jedna karta. Opublikowane konfiguracje, wszystkie przy 1024×1024 i 40 krokach:
• B200, wagi rezydentne, FlashAttention — 2,748 s generowania, 3,358 s edycji, po poprawce normalizacji Q/K i zmianie LayerNorm, z których każda ucięła kilka procent.
• RTX PRO 6000 Blackwell, 96 GB, rezydentne — 8,23 s generowania, 9,85 s edycji przy szczytowym zużyciu 40,1 GiB; 10,28 s i 10,66 s przy odciążonym transformatorze dyfuzyjnym, co obniża szczyt do 26,1 GiB.
• DGX Spark, 1× GB10, tryb eager, pełny dekod VAE — 35,36 s generowania, 42,23 s edycji, 35,49 s i 42,21 s dla wariantów przezroczystych. Obejmują one serializację PNG. Łamliwe grafy CUDA dawały identyczne piksele bez mierzalnej korzyści szybkości (35,96 s wobec 35,64 s), a przetwarzanie wsadowe i konfiguracje z wieloma Sparkami nie zostały w ogóle poddane benchmarkom.
• RTX 4090, 24 GB, layerwise offload, tylko odszumianie — 26,69 s przy bazowym BF16 z SDPA, 10,31 s z Cache-DiT (2,59×), 5,59 s z Cache-DiT i zestawem jąder INT8 (4,77×), 4,74 s po dodaniu uwagi Sage (5,63×).
Z tymi wierszami wiążą się dwa szczere zastrzeżenia. Po pierwsze, są to opóźnienia dla pojedynczego żądania, a wiersz 4090 mierzy wyłącznie odszumianie — enkoder tekstu i VAE znajdują się poza pomiarem czasu. Po drugie, autorzy SGLang określają szerszą weryfikację jako funkcjonalną, a nie oceniającą: wyjście BF16 nie jest bitowo dokładne w różnych rozmieszczeniach, a kwantyzacja lub równoległość tensorowa zmienia liczby. Szybsze i inne to nie to samo co szybsze i lepsze.

Dlaczego ścieżka przezroczystego wyjścia jest tą, na którą warto zwrócić uwagę
RGBA to obszar, w którym ten model różni się od endpointów obrazów, które większość zespołów już wywołuje, i to również obszar, w którym obsługa staje się kłopotliwa. Qwen-Image-2.1 odszumia w przestrzeni ukrytej, w której kanał alfa jest pełnoprawnym komponentem, za pomocą 64-kanałowego VAE RGBA z 16× kompresją przestrzenną. Przezroczystość nie jest procesem doczepianym po fakcie przy użyciu modelu segmentacji; jest tym, co emituje sampler.
Serwowanie tego w dobry sposób jest trudniejsze niż serwowanie RGB. Wynik jest większy, VAE ma więcej kanałów do zdekodowania, a żądanie niesie dodatkowy bit trybu, który scheduler musi skierować. Weryfikacja SGLang obejmuje dokładnie ten obszar — przezroczysty wynik w formacie PNG, zachowany kanał alfa w pełnym zakresie 0–255 oraz PSNR dla RGBA wynoszący 60,69 dB w pojedynczej próbce, a konfiguracje FP8 również przechodzą generowanie przezroczystych obrazów. To sprawdzenie poprawności, a nie benchmark jakości, i autorzy tak twierdzą. Dowodzi, że kanał alfa jest rzeczywisty i przetrwa kwantyzację; nie mówi nic o tym, czy krawędzie są czyste na włosach, futrze lub szkle.
Praktyczna wartość stosu serwującego z przetestowaną ścieżką przezroczystości polega na tym, że zamienia potok trzech narzędzi w jedno wywołanie. Generowanie z kanałem alfa, edycja wewnątrz obrazu, który już ma kanał alfa, oraz wyodrębnianie obiektu ze zwykłego zdjęcia RGB do przezroczystej warstwy – wszystko to przechodzi przez ten sam punkt końcowy.
Gdzie to pasuje, jeśli sam nie uruchamiasz GPU
Kłopotliwa część wydania Qwen-Image-2.1 polega na tym, że nie ma hostowanego endpointu, który można wywołać. Wagi to około 33 GB do pobrania, komponent generujący to 7B transformer dyfuzyjny w parze z 8B enkoderem tekstowym Qwen3-VL, a całość jest dystrybuowana na warunkach Qwen Research License Agreement z dnia 20 września 2026 r. — wyłącznie do użytku niekomercyjnego, przy czym wdrożenie komercyjne wymaga oddzielnej licencji od dostawcy. Zatem recepta SGLang nie jest alternatywą dla API. To jest API, a operatorem jesteś ty.
To zmienia sens istnienia warstwy routingu. OrcaRouter udostępnia ponad 200 modeli za jednym endpointem zgodnym z OpenAI, w cenie katalogowej dostawcy i bez żadnej marży, z automatycznym przełączaniem awaryjnym między dostawcami, DSL-em routingu do komponowania łańcuchów fallbacków oraz fuzją modeli do wywołań w stylu panelowym — ale nie kieruje żadnego modelu Qwen-Image w żadnej wersji, a Qwen-Image-2.1 nigdy nie będzie trasą, którą można by tam wywołać. Realistyczna architektura jest podzielona: uruchamiaj Qwen-Image-2.1 na własnym sprzęcie przez SGLang do zadań transparentnych i z wieloma referencjami, a wszystko inne wysyłaj do hostowanych modeli obrazowych za pomocą jednego klucza. Nasz katalog obejmuje linię OpenAI GPT-Image, warianty Google Imagen 4 i podglądy obrazów Gemini oraz endpoint obrazowy xAI Grok Imagine — wszystko w cenie katalogowej przekazywanej dalej, więc zmiana ceny u dostawcy któregokolwiek z nich jest widoczna po naszej stronie tego samego dnia.
Jak faktycznie wygląda wdrożenie
Dokumentacja SGLang zawiera cookbook dla tego modelu z poleceniami dla poszczególnych GPU, a zalecane wywołanie serwera to jedna linia — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Żądania text-to-image obsługują opcjonalnie włączane dynamiczne grupowanie wsadowe; żądania edycji obrazów są obsługiwane jako osobna ścieżka, a jedno żądanie może zwrócić wiele wyników.
Konfiguracje, które faktycznie zweryfikowano, są węższe, niż sugeruje macierz kompatybilności. H200, B200, RTX PRO 6000 96 GB, RTX 5090 i RTX 4090 są objęte generowaniem i edycją w rozdzielczości 1024×1024 przy 40 krokach, w tym ich przezroczystymi wariantami, a także równoległością tensorową na wielu GPU, Ulysses i Ring attention, odciążaniem warstwowym, równoległym kafelkowym dekodowaniem VAE, Cache-DiT, grafami CUDA oraz kwantyzacją FP8 online i serializowaną. Receptury multi-GPU i NVFP4 na RTX PRO 6000 pozostają niezweryfikowane, a wielohostowe RDMA i rozdzielone role multi-rank nie są objęte. Jeśli Twój plan zakłada cztery karty i fabric, wyprzedzasz opublikowane dowody.

Dwie rzeczy, na które warto teraz uważać. Pierwsza: czy ktoś opublikuje przepustowość, a nie opóźnienie — liczby dotyczące współbieżności są tym, co zamienia wynik 2,7 sekundy w plan przepustowości. Druga: licencja — nie ma opublikowanej ceny ani term sheetu dla komercyjnego wykorzystania Qwen-Image-2.1, a dopóki go nie ma, ograniczenie niekomercyjne jest całą historią dla wszystkiego, co trafia do klienta.
