
SGLang-Diffusion unterstützt Qwen-Image-2.1 ab Tag Null: 2,75 s Generierungen auf einer B200
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 wurde am 20. September 2026 veröffentlicht, und das SGLang-Diffusion-Team hatte bereits einen Serving-Pfad parat, der darauf wartete. Die Day-zero-Unterstützung deckt die drei Aufgaben ab, die das Modell erledigt – Text-zu-Bild-Generierung, Multi-Image-Editing und transparente RGBA-Ausgabe –, und sie bringt etwas mit, das seltener ist als ein gemergter Pull Request: gemessene Latenz auf benannter Hardware, veröffentlicht mit der Konfiguration, die sie erzeugt hat. Auf einer einzelnen NVIDIA B200, 1024×1024 bei 40 Schritten, liegen die SGLang-Zahlen bei 2,748 Sekunden für eine Generierung und 3,358 Sekunden für eine Bearbeitung. Der zugehörige Pull Request, sgl-project/sglang#39983, wurde am 17. September geöffnet – drei Tage bevor die Gewichte herunterladbar waren –, weshalb die Zahlen überhaupt existieren, statt für später versprochen zu werden.
Was „Tag Null“ hier bedeutet und warum das Timing der interessante Teil ist.
Framework-Unterstützung wird üblicherweise im selben Atemzug wie ein Modell-Release angekündigt und Wochen später geliefert. Beim SGLang-Fall ist es andersherum. Die Implementierung wurde gegen einen Checkpoint geschrieben, der noch nicht öffentlich war, was die Autoren dazu zwingt, sich mit der tatsächlichen Architektur statt mit einem Spezifikationsblatt auseinanderzusetzen: dem Diffusion Transformer, dem 64-Kanal-RGBA-VAE, Qwen3-VL-Konditionierung, Multi-Referenzbild-Eingabe sowie RGBA-Eingabe und -Ausgabe.
Das ist der Grund, warum man einer Latenztabelle mehr trauen sollte als einer Fähigkeitsliste. Ein Modell, das nie ausgeliefert wurde, hat keine gemessenen Zahlen, und eine Zahl, die zusammen mit ihrer Hardware, Auflösung, Schrittanzahl und Präzision daherkommt, kann von jedem mit derselben Karte überprüft werden. Die SGLang-Werte sind als spezifische Konfiguration ausgewiesen, nicht als allgemeine Aussage über das Modell.
Der Rest des Toolings erschien im selben Zeitfenster. ComfyUI lieferte native Unterstützung, Diffusers integrierte QwenImage21Pipeline, vLLM-Omni fügte schrittweise Ausführung und FP8-Quantisierung hinzu, und LightX2V fügte Beschleunigung mit AMD-Radeon-Unterstützung über ROCm hinzu. Die Frameworks sind der Teil eines Releases, der darüber entscheidet, ob jemand außerhalb eines Labors es nutzen kann.

Die Zahlen, und was sie nicht sagen
Die SGLang-Arbeit veröffentlicht die Latenz pro Anfrage, nicht den Durchsatz. Dieser Unterschied ist wichtig, wenn man einen Dienst dimensioniert statt eine Demo laufen zu lassen: Eine einzelne Generierung mit 2,7 Sekunden verrät Ihnen die Roundtrip-Dauer, nicht, wie viele gleichzeitige Nutzer eine Karte verkraftet. Die veröffentlichten Konfigurationen, alle bei 1024×1024 und 40 Schritten:
• B200, residente Gewichte, FlashAttention — 2,748 s Generierung, 3,358 s Bearbeitung, nach einem Q/K-Norm-Fix und einer LayerNorm-Änderung, die jeweils ein paar Prozent einsparten.
• RTX PRO 6000 Blackwell, 96 GB, resident — 8,23 s Generierung, 9,85 s Bearbeitung bei einem Spitzenbedarf von 40,1 GiB; 10,28 s und 10,66 s mit ausgelagertem Diffusion-Transformer, wodurch die Spitze auf 26,1 GiB sinkt.
• DGX Spark, 1× GB10, eager, vollständige VAE-Dekodierung — 35,36 s Generierung, 42,23 s Bearbeitung, 35,49 s und 42,21 s für die transparenten Varianten. Diese beinhalten die PNG-Serialisierung. Unterbrechbare CUDA-Graphen erzeugten identische Pixel ohne messbaren Geschwindigkeitsvorteil (35,96 s gegenüber 35,64 s), und Batching sowie Multi-Spark-Setups wurden überhaupt nicht benchmarkt.
• RTX 4090, 24 GB, schichtweises Offloading, nur Denoising — 26,69 s bei Basis-BF16 mit SDPA, 10,31 s mit Cache-DiT (2,59×), 5,59 s mit Cache-DiT plus dem INT8-Kernel-Set (4,77×), 4,74 s mit zusätzlicher Sage-Attention (5,63×).
Zwei ehrliche Vorbehalte lasten auf diesen Zeilen. Erstens handelt es sich um Latenzen einzelner Anfragen, und die 4090-Zeile misst nur das Denoising — der Text-Encoder und der VAE liegen außerhalb der Zeitmessung. Zweitens rahmen die SGLang-Autoren die breitere Verifikation als funktional, nicht als bewertend ein: BF16-Ausgaben sind über verschiedene Platzierungen hinweg nicht bitgenau, und Quantisierung oder Tensor-Parallelismus verändern die Zahlen. Schneller und anders ist nicht dasselbe wie schneller und besser.

Warum der Transparentausgabe-Pfad der ist, den man im Auge behalten sollte
RGBA ist der Punkt, an dem sich dieses Modell von den Bild-Endpunkten unterscheidet, die die meisten Teams bereits aufrufen, und außerdem der Punkt, an dem das Serving umständlich wird. Qwen-Image-2.1 entrauscht in einem latenten Raum, der einen Alphakanal als erstklassige Komponente besitzt, über einen RGBA-VAE mit 64 Kanälen und 16-facher räumlicher Kompression. Transparenz ist kein Nachbearbeitungsschritt, den man mit einem Segmentierungsmodell nachrüstet; sie ist das, was der Sampler ausgibt.
Dies gut bereitzustellen ist schwieriger als RGB bereitzustellen. Die Ausgabe ist größer, das VAE hat mehr Kanäle zu dekodieren, und die Anfrage trägt ein zusätzliches Modus-Bit, das der Scheduler weiterleiten muss. SGLangs Verifikation deckt genau diese Oberfläche ab — transparente PNG-Ausgabe, Alpha über den vollen 0–255-Bereich erhalten, und ein RGBA-PSNR von 60,69 dB in einer einzelnen Stichprobe, wobei die FP8-Konfigurationen auch die transparente Generierung bestehen. Das ist eher eine Korrektheitsprüfung als ein Qualitäts-Benchmark, und die Autoren sagen das selbst. Es belegt, dass der Alpha-Kanal real ist und die Quantisierung übersteht; es sagt nichts darüber aus, ob die Kanten bei Haar, Fell oder Glas sauber sind.
Der praktische Wert eines Serving-Stacks mit einem getesteten Transparenzpfad liegt darin, dass er eine Pipeline aus drei Tools in einen einzigen Aufruf verwandelt. Generierung mit Alpha, Bearbeitung innerhalb eines Bildes, das bereits Alpha besitzt, und das Freistellen eines Motivs aus einem gewöhnlichen RGB-Foto in eine transparente Ebene laufen alle über denselben Endpunkt.
Wo das einzuordnen ist, wenn du die GPU nicht selbst betreibst
Der unangenehme Teil der Veröffentlichung von Qwen-Image-2.1 ist, dass es keinen gehosteten Endpunkt gibt, den man aufrufen kann. Die Gewichte sind ein Download von rund 33 GB, die Generierungskomponente ist ein 7B-Diffusionstransformer, gepaart mit einem Qwen3-VL-8B-Textencoder, und das Ganze wird unter der Qwen Research License Agreement vom 20. September 2026 ausgeliefert – nur für nichtkommerzielle Nutzung, wobei der kommerzielle Einsatz eine separate Lizenz vom Anbieter erfordert. Das SGLang-Rezept ist also keine Alternative zu einer API. Es ist die API, und Sie sind der Betreiber.
Das ändert, wofür eine Routing-Schicht da ist. OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters ohne Aufschlag bereit, mit automatischem Failover über Anbieter hinweg, einer Routing-DSL zum Zusammensetzen von Fallbacks und Modell-Fusion für Aufrufe im Panel-Stil – doch es routet kein Qwen-Image-Modell irgendeiner Version, und Qwen-Image-2.1 wird dort niemals eine Route sein, die man aufrufen kann. Die realistische Architektur ist eine geteilte: Qwen-Image-2.1 auf eigener Hardware über SGLang für die transparenten und Multi-Referenz-Aufgaben ausführen und alles andere über einen Schlüssel an gehostete Bildmodelle senden. Unser Katalog umfasst die OpenAI-GPT-Image-Reihe, Googles Imagen-4-Stufen und Gemini-Bildvorschauen sowie xAIs Grok-Imagine-Bildendpunkt, alle zum durchgereichten Listenpreis, sodass eine Preisänderung eines Anbieters bei einem von ihnen am selben Tag bei uns live ist.
Wie ein Deployment tatsächlich aussieht
Die SGLang-Dokumentation enthält für dieses Modell ein Cookbook mit Befehlen pro GPU, und der empfohlene Server-Aufruf ist eine einzige Zeile — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Anfragen zur Text-zu-Bild-Generierung unterstützen optionales dynamisches Batching; Anfragen zur Bildbearbeitung werden über einen separaten Pfad abgewickelt, und eine Anfrage kann mehrere Ausgaben zurückgeben.
Die tatsächlich verifizierten Konfigurationen sind enger als die Kompatibilitätsmatrix nahelegt. H200, B200, RTX PRO 6000 96 GB, RTX 5090 und RTX 4090 sind für die 1024×1024-Generierung und -Bearbeitung bei 40 Schritten abgedeckt, einschließlich ihrer transparenten Varianten, plus Multi-GPU-Tensor-Parallelität, Ulysses- und Ring-Attention, Layerwise-Offload, paralleles Tiled-VAE-Decoding, Cache-DiT, CUDA-Graphen sowie Online- und serialisierte FP8-Quantisierung. Multi-GPU- und NVFP4-Rezepte auf der RTX PRO 6000 bleiben unverifiziert, und Multi-Host-RDMA sowie disaggregierte Multi-Rank-Rollen sind nicht abgedeckt. Wenn Ihr Plan vier Karten und ein Fabric umfasst, sind Sie der veröffentlichten Evidenz voraus.

Zwei Dinge, auf die man als Nächstes achten sollte. Erstens: ob jemand Durchsatz statt Latenz veröffentlicht – Parallelitätszahlen sind das, was aus einer 2,7-Sekunden-Angabe einen Kapazitätsplan macht. Zweitens: die Lizenz. Es gibt weder einen veröffentlichten Preis noch ein Term Sheet für die kommerzielle Nutzung von Qwen-Image-2.1, und solange das so ist, ist die nichtkommerzielle Beschränkung der entscheidende Punkt für alles, was an einen Kunden ausgeliefert wird.
