Kartu hero yang dihasilkan untuk artikel tersebut, berjudul SGLang-Diffusion melayani Qwen-Image-2.1 dengan subjudul penyajian hari-nol, terukur, menampilkan tiga kartu membulat berlabel Teks ke gambar, Edit multi-gambar, dan Keluaran RGBA di atas bilah latensi yang bertuliskan 2,75 dtk pembuatan dan 3,36 dtk penyuntingan dengan keterangan 1024 x 1024, 40 langkah, satu B200.
Engineering & Research

SGLang-Diffusion Melayani Qwen-Image-2.1 pada Hari Pertama: Generasi 2,75 dtk di Satu B200

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Qwen-Image-2.1 menjadi publik pada 20 September 2026, dan tim SGLang-Diffusion sudah memiliki jalur penyajian yang menunggunya. Dukungan hari-nol mencakup tiga pekerjaan yang dilakukan model ini — pembuatan gambar dari teks, pengeditan multi-gambar, dan keluaran RGBA transparan — dan disertai sesuatu yang lebih langka daripada pull request yang digabungkan: latensi terukur pada perangkat keras yang disebutkan, yang diterbitkan bersama konfigurasi yang menghasilkannya. Pada satu NVIDIA B200, 1024×1024 pada 40 langkah, angka SGLang berada di 2,748 detik untuk generasi dan 3,358 detik untuk pengeditan. Pull request pendukungnya, sgl-project/sglang#39983, dibuka pada 17 September — tiga hari sebelum bobotnya dapat diunduh — itulah sebabnya angka-angka itu ada sama sekali alih-alih dijanjikan untuk nanti.

Apa arti "day zero" di sini, dan mengapa soal waktunya justru menjadi bagian yang menarik.

Dukungan framework biasanya diumumkan bersamaan dengan rilis model dan baru tersedia beberapa minggu setelahnya. Kasus SGLang justru sebaliknya. Implementasinya ditulis terhadap checkpoint yang belum dipublikasikan, yang memaksa para penulisnya menangani arsitektur sebenarnya alih-alih lembar spesifikasi: diffusion transformer, VAE RGBA 64 kanal, pengondisian Qwen3-VL, input banyak gambar referensi, serta RGBA masuk dan keluar.

Itulah alasan untuk lebih memercayai tabel latensi daripada daftar kemampuan. Model yang tidak pernah dilayani tidak memiliki angka terukur, dan angka yang datang dengan perangkat keras, resolusi, jumlah langkah, serta presisi yang melekat padanya dapat diperiksa oleh siapa pun yang memiliki kartu yang sama. Angka-angka SGLang diberi label sebagai konfigurasi spesifik, bukan sebagai klaim umum tentang model.

Perkakas lainnya hadir pada jendela waktu yang sama. ComfyUI merilis dukungan native, Diffusers menggabungkan QwenImage21Pipeline, vLLM-Omni menambahkan eksekusi bertahap dan kuantisasi FP8, serta LightX2V menambahkan akselerasi dengan dukungan AMD Radeon melalui ROCm. Framework adalah bagian dari sebuah rilis yang menentukan apakah siapa pun di luar lab dapat menggunakannya.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

Angka-angka itu, dan apa yang tidak mereka katakan

Karya SGLang menerbitkan latensi per permintaan, bukan throughput. Perbedaan itu penting jika Anda sedang menentukan ukuran layanan, bukan menjalankan demo: satu generasi 2,7 detik memberi tahu Anda waktu bolak-balik, bukan berapa banyak pengguna bersamaan yang dapat diserap satu kartu. Konfigurasi yang diterbitkan, semuanya pada 1024×1024 dan 40 langkah:

B200, bobot tetap di memori, FlashAttention — pembuatan 2,748 s, pengeditan 3,358 s, setelah perbaikan Q/K-norm dan perubahan LayerNorm yang masing-masing memangkas beberapa persen.
RTX PRO 6000 Blackwell, 96 GB, tetap di memori — pembuatan 8,23 s, pengeditan 9,85 s pada puncak penggunaan 40,1 GiB; 10,28 s dan 10,66 s dengan diffusion transformer di-offload, menurunkan puncaknya menjadi 26,1 GiB.
DGX Spark, 1× GB10, eager, dekode VAE penuh — pembuatan 35,36 s, pengeditan 42,23 s, 35,49 s dan 42,21 s untuk varian transparan. Itu termasuk serialisasi PNG. Breakable CUDA graphs menghasilkan piksel yang identik tanpa manfaat kecepatan yang terukur (35,96 s versus 35,64 s), dan batching serta penyiapan multi-Spark sama sekali tidak di-benchmark.
RTX 4090, 24 GB, offload per lapis, hanya denoise — 26,69 s pada BF16 dasar dengan SDPA, 10,31 s dengan Cache-DiT (2,59×), 5,59 s dengan Cache-DiT plus kumpulan kernel INT8 (4,77×), 4,74 s dengan menambahkan Sage attention (5,63×).

Dua peringatan jujur menyertai baris-baris tersebut. Pertama, itu adalah latensi permintaan tunggal, dan baris 4090 hanya mengukur denoising — text encoder dan VAE berada di luar timer. Kedua, penulis SGLang membingkai verifikasi yang lebih luas sebagai fungsional, bukan evaluatif: keluaran BF16 tidak bit-exact di berbagai penempatan yang berbeda, dan kuantisasi atau paralelisme tensor mengubah angka-angka tersebut. Lebih cepat dan berbeda tidak sama dengan lebih cepat dan lebih baik.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Mengapa jalur keluaran transparan adalah yang perlu diperhatikan

RGBA adalah titik di mana model ini berbeda dari endpoint gambar yang sudah biasa dipanggil oleh sebagian besar tim, dan di sinilah penyajian menjadi sulit. Qwen-Image-2.1 melakukan denoising di ruang laten yang memiliki kanal alfa sebagai komponen kelas satu, melalui VAE RGBA 64-kanal dengan kompresi spasial 16×. Transparansi bukanlah pascaproses yang Anda tempelkan dengan model segmentasi; melainkan apa yang dihasilkan oleh sampler.

Melayani hal itu dengan baik lebih sulit daripada melayani RGB. Outputnya lebih besar, VAE memiliki lebih banyak kanal untuk didekode, dan permintaan membawa bit mode tambahan yang harus dirutekan oleh penjadwal. Verifikasi SGLang mencakup tepat permukaan itu — keluaran PNG transparan, alpha dipertahankan di seluruh rentang 0–255, dan PSNR RGBA sebesar 60,69 dB dalam satu sampel, dengan konfigurasi FP8 juga lulus pembuatan transparan. Itu adalah pemeriksaan kebenaran, bukan tolok ukur kualitas, dan para penulis mengatakan demikian. Ini membuktikan bahwa kanal alpha itu nyata dan bertahan terhadap kuantisasi; ini tidak mengatakan apa pun tentang apakah tepinya bersih pada rambut, bulu, atau kaca.

Nilai praktis dari stack penyajian dengan jalur transparansi yang telah teruji adalah bahwa ia mengubah pipeline tiga alat menjadi satu panggilan. Pembuatan dengan alpha, penyuntingan di dalam gambar yang sudah memiliki alpha, dan mengekstraksi subjek dari foto RGB biasa menjadi lapisan transparan semuanya melewati endpoint yang sama.

Di mana ini cocok jika Anda tidak menjalankan GPU sendiri

Bagian yang janggal dari rilis Qwen-Image-2.1 adalah tidak ada endpoint yang dihosting untuk dipanggil. Bobotnya adalah unduhan sekitar 33 GB, komponen generasinya adalah transformer difusi 7B yang dipasangkan dengan encoder teks Qwen3-VL 8B, dan semuanya dirilis di bawah Qwen Research License Agreement tertanggal 20 September 2026 — hanya untuk penggunaan non-komersial, dengan penerapan komersial yang memerlukan lisensi terpisah dari vendor. Jadi resep SGLang bukanlah alternatif untuk API. Itu adalah API-nya, dan Anda adalah operatornya.

Itu mengubah tujuan lapisan perutean. OrcaRouter menghadirkan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI pada harga daftar penyedia tanpa markup, failover otomatis lintas penyedia, DSL perutean untuk menyusun fallback, dan fusi model untuk panggilan bergaya panel — tetapi tidak ada model Qwen-Image versi mana pun yang dirutekannya, dan Qwen-Image-2.1 tidak akan pernah menjadi rute yang dapat Anda panggil di sana. Arsitektur yang realistis adalah arsitektur terpisah: jalankan Qwen-Image-2.1 di perangkat keras Anda sendiri melalui SGLang untuk pekerjaan transparan dan multi-referensi, lalu kirim semua yang lain ke model gambar yang dihosting dengan satu kunci. Katalog kami mencakup lini OpenAI GPT-Image, tier Google Imagen 4 dan pratinjau gambar Gemini, serta endpoint gambar Grok Imagine dari xAI, semuanya pada harga daftar yang diteruskan apa adanya, sehingga perubahan harga vendor pada salah satunya langsung aktif di sisi kami pada hari yang sama.

Seperti apa bentuk deployment sebenarnya

Dokumentasi SGLang menyertakan cookbook untuk model ini dengan perintah untuk setiap GPU, dan pemanggilan server yang direkomendasikan hanya satu baris — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Permintaan text-to-image mendukung dynamic batching yang diaktifkan secara opsional; permintaan image-edit ditangani sebagai jalur terpisah, dan satu permintaan dapat mengembalikan beberapa keluaran.

Konfigurasi yang benar-benar telah diverifikasi lebih sempit daripada yang tersirat oleh matriks kompatibilitas. H200, B200, RTX PRO 6000 96 GB, RTX 5090, dan RTX 4090 tercakup untuk pembuatan dan penyuntingan 1024×1024 pada 40 langkah, termasuk varian transparannya, plus paralelisme tensor multi-GPU, atensi Ulysses dan Ring, offload per lapisan, dekode VAE bertile paralel, Cache-DiT, CUDA graphs, serta kuantisasi FP8 online dan terserialisasi. Resep multi-GPU dan NVFP4 pada RTX PRO 6000 masih belum diverifikasi, dan RDMA multi-host serta peran terdisagregasi multi-rank belum tercakup. Jika rencana Anda melibatkan empat kartu dan fabric, Anda sudah melampaui bukti yang dipublikasikan.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Dua hal yang perlu diperhatikan berikutnya. Yang pertama adalah apakah ada yang mempublikasikan throughput alih-alih latensi — angka konkurensi adalah yang mengubah angka 2,7 detik menjadi rencana kapasitas. Yang kedua adalah lisensi: tidak ada harga atau term sheet yang dipublikasikan untuk penggunaan komersial Qwen-Image-2.1, dan sampai ada, pembatasan nonkomersial adalah keseluruhan ceritanya untuk apa pun yang dikirim ke pelanggan.