
SGLang-Diffusion Melayani Qwen-Image-2.1 pada Hari Pertama: Generasi 2,75 dtk di Satu B200
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 menjadi publik pada 20 September 2026, dan tim SGLang-Diffusion sudah memiliki jalur penyajian yang menunggunya. Dukungan hari-nol mencakup tiga pekerjaan yang dilakukan model ini — pembuatan gambar dari teks, pengeditan multi-gambar, dan keluaran RGBA transparan — dan disertai sesuatu yang lebih langka daripada pull request yang digabungkan: latensi terukur pada perangkat keras yang disebutkan, yang diterbitkan bersama konfigurasi yang menghasilkannya. Pada satu NVIDIA B200, 1024×1024 pada 40 langkah, angka SGLang berada di 2,748 detik untuk generasi dan 3,358 detik untuk pengeditan. Pull request pendukungnya, sgl-project/sglang#39983, dibuka pada 17 September — tiga hari sebelum bobotnya dapat diunduh — itulah sebabnya angka-angka itu ada sama sekali alih-alih dijanjikan untuk nanti.
Apa arti "day zero" di sini, dan mengapa soal waktunya justru menjadi bagian yang menarik.
Dukungan framework biasanya diumumkan bersamaan dengan rilis model dan baru tersedia beberapa minggu setelahnya. Kasus SGLang justru sebaliknya. Implementasinya ditulis terhadap checkpoint yang belum dipublikasikan, yang memaksa para penulisnya menangani arsitektur sebenarnya alih-alih lembar spesifikasi: diffusion transformer, VAE RGBA 64 kanal, pengondisian Qwen3-VL, input banyak gambar referensi, serta RGBA masuk dan keluar.
Itulah alasan untuk lebih memercayai tabel latensi daripada daftar kemampuan. Model yang tidak pernah dilayani tidak memiliki angka terukur, dan angka yang datang dengan perangkat keras, resolusi, jumlah langkah, serta presisi yang melekat padanya dapat diperiksa oleh siapa pun yang memiliki kartu yang sama. Angka-angka SGLang diberi label sebagai konfigurasi spesifik, bukan sebagai klaim umum tentang model.
Perkakas lainnya hadir pada jendela waktu yang sama. ComfyUI merilis dukungan native, Diffusers menggabungkan QwenImage21Pipeline, vLLM-Omni menambahkan eksekusi bertahap dan kuantisasi FP8, serta LightX2V menambahkan akselerasi dengan dukungan AMD Radeon melalui ROCm. Framework adalah bagian dari sebuah rilis yang menentukan apakah siapa pun di luar lab dapat menggunakannya.

Angka-angka itu, dan apa yang tidak mereka katakan
Karya SGLang menerbitkan latensi per permintaan, bukan throughput. Perbedaan itu penting jika Anda sedang menentukan ukuran layanan, bukan menjalankan demo: satu generasi 2,7 detik memberi tahu Anda waktu bolak-balik, bukan berapa banyak pengguna bersamaan yang dapat diserap satu kartu. Konfigurasi yang diterbitkan, semuanya pada 1024×1024 dan 40 langkah:
• B200, bobot tetap di memori, FlashAttention — pembuatan 2,748 s, pengeditan 3,358 s, setelah perbaikan Q/K-norm dan perubahan LayerNorm yang masing-masing memangkas beberapa persen.
• RTX PRO 6000 Blackwell, 96 GB, tetap di memori — pembuatan 8,23 s, pengeditan 9,85 s pada puncak penggunaan 40,1 GiB; 10,28 s dan 10,66 s dengan diffusion transformer di-offload, menurunkan puncaknya menjadi 26,1 GiB.
• DGX Spark, 1× GB10, eager, dekode VAE penuh — pembuatan 35,36 s, pengeditan 42,23 s, 35,49 s dan 42,21 s untuk varian transparan. Itu termasuk serialisasi PNG. Breakable CUDA graphs menghasilkan piksel yang identik tanpa manfaat kecepatan yang terukur (35,96 s versus 35,64 s), dan batching serta penyiapan multi-Spark sama sekali tidak di-benchmark.
• RTX 4090, 24 GB, offload per lapis, hanya denoise — 26,69 s pada BF16 dasar dengan SDPA, 10,31 s dengan Cache-DiT (2,59×), 5,59 s dengan Cache-DiT plus kumpulan kernel INT8 (4,77×), 4,74 s dengan menambahkan Sage attention (5,63×).
Dua peringatan jujur menyertai baris-baris tersebut. Pertama, itu adalah latensi permintaan tunggal, dan baris 4090 hanya mengukur denoising — text encoder dan VAE berada di luar timer. Kedua, penulis SGLang membingkai verifikasi yang lebih luas sebagai fungsional, bukan evaluatif: keluaran BF16 tidak bit-exact di berbagai penempatan yang berbeda, dan kuantisasi atau paralelisme tensor mengubah angka-angka tersebut. Lebih cepat dan berbeda tidak sama dengan lebih cepat dan lebih baik.

Mengapa jalur keluaran transparan adalah yang perlu diperhatikan
RGBA adalah titik di mana model ini berbeda dari endpoint gambar yang sudah biasa dipanggil oleh sebagian besar tim, dan di sinilah penyajian menjadi sulit. Qwen-Image-2.1 melakukan denoising di ruang laten yang memiliki kanal alfa sebagai komponen kelas satu, melalui VAE RGBA 64-kanal dengan kompresi spasial 16×. Transparansi bukanlah pascaproses yang Anda tempelkan dengan model segmentasi; melainkan apa yang dihasilkan oleh sampler.
Melayani hal itu dengan baik lebih sulit daripada melayani RGB. Outputnya lebih besar, VAE memiliki lebih banyak kanal untuk didekode, dan permintaan membawa bit mode tambahan yang harus dirutekan oleh penjadwal. Verifikasi SGLang mencakup tepat permukaan itu — keluaran PNG transparan, alpha dipertahankan di seluruh rentang 0–255, dan PSNR RGBA sebesar 60,69 dB dalam satu sampel, dengan konfigurasi FP8 juga lulus pembuatan transparan. Itu adalah pemeriksaan kebenaran, bukan tolok ukur kualitas, dan para penulis mengatakan demikian. Ini membuktikan bahwa kanal alpha itu nyata dan bertahan terhadap kuantisasi; ini tidak mengatakan apa pun tentang apakah tepinya bersih pada rambut, bulu, atau kaca.
Nilai praktis dari stack penyajian dengan jalur transparansi yang telah teruji adalah bahwa ia mengubah pipeline tiga alat menjadi satu panggilan. Pembuatan dengan alpha, penyuntingan di dalam gambar yang sudah memiliki alpha, dan mengekstraksi subjek dari foto RGB biasa menjadi lapisan transparan semuanya melewati endpoint yang sama.
Di mana ini cocok jika Anda tidak menjalankan GPU sendiri
Bagian yang janggal dari rilis Qwen-Image-2.1 adalah tidak ada endpoint yang dihosting untuk dipanggil. Bobotnya adalah unduhan sekitar 33 GB, komponen generasinya adalah transformer difusi 7B yang dipasangkan dengan encoder teks Qwen3-VL 8B, dan semuanya dirilis di bawah Qwen Research License Agreement tertanggal 20 September 2026 — hanya untuk penggunaan non-komersial, dengan penerapan komersial yang memerlukan lisensi terpisah dari vendor. Jadi resep SGLang bukanlah alternatif untuk API. Itu adalah API-nya, dan Anda adalah operatornya.
Itu mengubah tujuan lapisan perutean. OrcaRouter menghadirkan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI pada harga daftar penyedia tanpa markup, failover otomatis lintas penyedia, DSL perutean untuk menyusun fallback, dan fusi model untuk panggilan bergaya panel — tetapi tidak ada model Qwen-Image versi mana pun yang dirutekannya, dan Qwen-Image-2.1 tidak akan pernah menjadi rute yang dapat Anda panggil di sana. Arsitektur yang realistis adalah arsitektur terpisah: jalankan Qwen-Image-2.1 di perangkat keras Anda sendiri melalui SGLang untuk pekerjaan transparan dan multi-referensi, lalu kirim semua yang lain ke model gambar yang dihosting dengan satu kunci. Katalog kami mencakup lini OpenAI GPT-Image, tier Google Imagen 4 dan pratinjau gambar Gemini, serta endpoint gambar Grok Imagine dari xAI, semuanya pada harga daftar yang diteruskan apa adanya, sehingga perubahan harga vendor pada salah satunya langsung aktif di sisi kami pada hari yang sama.
Seperti apa bentuk deployment sebenarnya
Dokumentasi SGLang menyertakan cookbook untuk model ini dengan perintah untuk setiap GPU, dan pemanggilan server yang direkomendasikan hanya satu baris — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Permintaan text-to-image mendukung dynamic batching yang diaktifkan secara opsional; permintaan image-edit ditangani sebagai jalur terpisah, dan satu permintaan dapat mengembalikan beberapa keluaran.
Konfigurasi yang benar-benar telah diverifikasi lebih sempit daripada yang tersirat oleh matriks kompatibilitas. H200, B200, RTX PRO 6000 96 GB, RTX 5090, dan RTX 4090 tercakup untuk pembuatan dan penyuntingan 1024×1024 pada 40 langkah, termasuk varian transparannya, plus paralelisme tensor multi-GPU, atensi Ulysses dan Ring, offload per lapisan, dekode VAE bertile paralel, Cache-DiT, CUDA graphs, serta kuantisasi FP8 online dan terserialisasi. Resep multi-GPU dan NVFP4 pada RTX PRO 6000 masih belum diverifikasi, dan RDMA multi-host serta peran terdisagregasi multi-rank belum tercakup. Jika rencana Anda melibatkan empat kartu dan fabric, Anda sudah melampaui bukti yang dipublikasikan.

Dua hal yang perlu diperhatikan berikutnya. Yang pertama adalah apakah ada yang mempublikasikan throughput alih-alih latensi — angka konkurensi adalah yang mengubah angka 2,7 detik menjadi rencana kapasitas. Yang kedua adalah lisensi: tidak ada harga atau term sheet yang dipublikasikan untuk penggunaan komersial Qwen-Image-2.1, dan sampai ada, pembatasan nonkomersial adalah keseluruhan ceritanya untuk apa pun yang dikirim ke pelanggan.
