Kartu judul hero bertuliskan 'Qwen4Exp QSA DCP' dengan lencana 'TIDAK TERVERIFIKASI — DRAF PR, BELUM DIGABUNG', judul utama 'Qwen 4 QSA mendapatkan paralelisme konteks dekode', subjudul 'Di dalam vLLM PR #59279 untuk jalur Qwen3.8-Flash-Next Qwen4Exp', tiga chip bertuliskan 'Sumber: vllm-project/vllm PR #59279', 'Dibuka 2026-09-29' dan 'Status: terbuka, draf', serta baris footer bertuliskan 'Angka yang dilaporkan kontributor; tidak diaudit secara independen.' Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

Qwen 4 QSA memperoleh paralelisme konteks dekode: di dalam PR draf vLLM untuk Qwen3.8-Flash-Next

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 2026-09-29, sebuah pull request draf muncul di repositori vLLM dengan judul “[Model][DCP] Support Qwen4Exp QSA,” dan untuk model yang dijelaskannya, PR itu membawa angka serving paling konkret yang dipublikasikan siapa pun sepanjang bulan ini: run berpasangan Qwen3.8-Flash-Next pada empat GPU yang menunjukkan kapasitas token KV naik dari 9.759.529 menjadi 17.603.636, konkurensi maksimum dari 37,23× menjadi 67,15×, dan time to first token turun dari 1.869 ms menjadi 767 ms. Qwen3.8-Flash-Next adalah preview open-weight, mixture-of-experts 125 miliar parameter yang kartu Hugging Face-nya mendeskripsikannya sebagai “A Preview of the Qwen4 Architecture”; pull request tersebut menambahkan decode context parallelism ke jalur sparse-attention yang menjadi dasar arsitektur itu. Qwen4 sendiri — tier Qwen4 Max, Flash, Plus, dan 27B yang disebut vendor pada konferensi Apsara-nya pada 2026-09-22 — masih belum dirilis, tanpa bobot, tanpa pengenal, tanpa harga, dan tanpa tanggal. Jadi bacalah ini sebagai apa adanya: bukan peluncuran, bukan benchmark, melainkan artefak rekayasa yang memberi tahu Anda bagaimana cakupan serving Qwen4 diperlebar sebelum keluarga itu ada.

Ini adalah artikel "sejauh yang kita ketahui", dan sumbernya lebih penting daripada biasanya. Pull request-nya adalah draf, terbuka, dan belum di-merge — vllm-project/vllm#59279, dibuka pada 2026-09-29 oleh Sungsoo Ha, seorang insinyur perangkat lunak NVIDIA, dan masih berstatus draf. Setiap angka di bawah ini adalah pengukuran berpasangan milik penulis sendiri, yang dilaporkan di badan PR, yang diambil pada revisi sebelumnya dari pekerjaan yang sama. Tidak ada di sini yang diaudit secara independen, tidak ada di sini yang sudah masuk ke rilis, dan catatan yang disertakan penulis cukup penting sehingga mendapat bagiannya sendiri di bawah ini.

Apa yang sebenarnya diubah oleh pull request

Paralelisme konteks dekode — DCP — adalah teknik serving, bukan perubahan model. Alih-alih satu grup GPU memegang seluruh cache KV, DCP memecah cache itu ke seluruh rank, sehingga setiap rank hanya membaca potongan konteksnya sendiri sementara hasil attention digabungkan antar-rank di akhir. Intinya adalah kapasitas: dengan cache yang dipartisi, suatu deployment dapat menangani jauh lebih banyak lalu lintas konteks panjang secara bersamaan pada perangkat keras yang sama, yang justru merupakan kendala yang terasa ketika setiap permintaan membawa seperempat juta token.

Komplikasinya adalah Qwen Sparse Attention — QSA — bukan lapisan attention biasa. Seperti yang ditetapkan oleh kartu model Qwen3.8-Flash-Next, sebuah indexer ringan memampatkan key menjadi micro-block dengan rasio kompresi 4, memberi skor pada blok-blok itu, dan mempertahankan 512 blok terbaik, kira-kira 2.048 posisi token, sementara softmax akhir dan agregasi value tetap dijalankan pada K dan V yang tidak dimampatkan. Itu berarti QSA membawa lebih banyak state daripada cache KV: ada cache utama, dan ada cache selector serta cache side yang dipelihara indexer. Implementasi DCP generik di vLLM tidak mengetahui semua itu.

Apa yang dilakukan #59279, menurut deskripsinya, adalah mengajari DCP tentang bagian-bagian khusus QSA:

• Setiap peringkat membaca bagiannya sendiri dari utama cache KV, sementara selektor QSA dan cache samping tetap direplikasi di seluruh peringkat alih-alih di-shard.

• Hasil atensi digabungkan lintas rank setelah pembacaan terpisah.

• Selector dan cache KV utama disimpan dalam satu grup cache, sehingga keduanya tidak bisa terpisah.

• Batch V2 sintetis dicegah untuk menulis ke cache sisi QSA.

A capture of the vLLM GitHub pull request #59279, titled '[Model][DCP] Support Qwen4Exp QSA', showing an Open state with a Draft badge, the head branch sungsooha:n4/qsa-dcp-clean-20260929, the description of how decode context parallelism is enabled for Qwen4Exp QSA, and the labels kv-cache-manager, mrv2, speculative-decoding, dflash, nvidia, qwen and ci/build.

Pasangan detail terakhir itu adalah bagian yang menarik jika Anda lebih peduli pada kebenaran daripada throughput. Cache attention yang di-shard yang diam-diam tidak selaras dengan selector yang direplikasi adalah jenis bug yang muncul sebagai penurunan akurasi perlahan pada konteks panjang alih-alih crash, dan perubahan itu secara eksplisit memastikan keduanya tetap sinkron. Penulis juga menyatakan bahwa bantuan AI digunakan dan Codex dikreditkan sebagai co-author — layak dikatakan secara terang-terangan, karena dalam draft PR seperti ini adalah pertanyaan yang wajar untuk menanyakan siapa menulis apa.

Angka-angka berpasangan, dan bagaimana angka-angka itu diperoleh

Rencana pengujian ini cukup spesifik untuk dapat diperiksa, itulah sebabnya hasilnya layak dikutip. Kedua arm menjalankan Qwen/Qwen3.8-Flash-Next-FP8 pada empat GPU dengan tensor parallelism 4 dan expert parallelism diaktifkan, pada --gpu-memory-utilization 0.90 dengan prefix caching aktif. Satu-satunya perbedaan antara kedua arm adalah --decode-context-parallel-size: dihilangkan untuk DCP=1, diatur ke 2 untuk DCP=2, dengan restart di antara arm sehingga benchmark dimulai dari cache dingin. Beban berupa trace AgentX 256k pada 128 pengguna selama 900 detik; akurasi menggunakan EvalScope untuk GSM8K ditambah evaluator MRCR yang sudah ada di repositori, dijalankan enam kali per arm dengan eksekusi pertama setelah restart dibuang.

Delta throughput yang dilaporkan, DCP=2 dibandingkan DCP=1:

• Token KV — 9.759.529 vs 17.603.636, peningkatan kapasitas cache sebesar 1,80×.

• Konkurensi maksimum — 37,23× vs 67,15×, juga 1,80×.

• Permintaan per detik — 1.69 vs 2.30, 1.36×.

• Token masukan per detik — 128.730 vs 179.702, 1,40×.

• Waktu ke token pertama — 1.869 ms vs 767 ms, 2,44× lebih rendah.

• Latensi antar-token — 43,48 ms vs 26,27 ms, 1,66× lebih rendah.

• Tingkat hit cache prefiks pada kondisi tunak — 67,85% vs 88,98%, peningkatan sebesar 21,1 poin persentase.

A two-column comparison scoreboard titled 'Qwen4Exp QSA — DCP = 1 vs DCP = 2'. The DCP = 1 (baseline) column reads KV cache tokens 9,759,529, max concurrency 37.23x, requests/sec 1.69, time to first token 1,869 ms, inter-token latency 43.48 ms, prefix cache hit 67.85%. The DCP = 2 (context parallel) column reads KV cache tokens 17,603,636, max concurrency 67.15x, requests/sec 2.30, time to first token 767 ms, inter-token latency 26.27 ms, prefix cache hit 88.98%. A footer line reads that all figures are contributor-reported in vLLM PR #59279 and unaudited, measured on an earlier revision of the patch. The OrcaRouter logo is composited in the bottom-right corner.

Akurasi, yang dilaporkan sebagai rata-rata ± simpangan baku sampel di seluruh run pasca-warm-up, pada dasarnya datar: agregat MRCR 0,8630 ± 0,0005 pada DCP=1 versus 0,8697 ± 0,0153 pada DCP=2, dan GSM8K 0,9788 ± 0,0020 versus 0,9790 ± 0,0016. Sampel MRCR 2-needle dan 4-needle tetap pada 0,9960 dan 0,9906 pada kedua arm, sehingga seluruh pergerakan antar-run berasal dari sampel 8-needle — dan satu run agregat DCP=2 memperoleh skor 0,8970 sementara empat lainnya berada di antara 0,8620 dan 0,8632. Itu adalah sebaran yang nyata, bukan noise yang bisa diabaikan begitu saja, dan hal itu dinyatakan di PR, bukan dihaluskan.

Apa yang tidak dibuktikan oleh angka-angka ini

Peringatannya ada di dalam teks PR dan itu bukan hal kecil. Hasil AgentX dan akurasi yang dipasangkan diukur pada yang lebih awal, yaitu revisi QSA DCP, menggunakan vLLM nightly berdasarkan commit 3df4ae153eb. Commit bersih final dalam pull request menyertakan perbaikan kernel lokalisasi QSA berikutnya dan telah lulus validasi B200 yang terfokus — tetapi evaluasi AgentX dan akurasi lengkap belum diulang pada sumber persis tersebut. Dengan kata lain: cerita throughput dan diff yang dikirim bukan artefak yang sama, dan penulisnya mengatakan demikian.

Selain itu, disiplin yang biasa tetap berlaku, dan di sini berlaku dengan keras. Ini adalah angka konfigurasi tunggal dari seorang kontributor tunggal pada satu penyiapan empat GPU. Angka-angka ini lebih dekat ke vendor daripada bersifat netral: seorang kontributor framework yang mengukur perubahan framework adalah hal yang normal dan berguna, tetapi itu bukan audit independen, dan tidak ada pihak ketiga yang mereproduksi pengujian tersebut. Tidak ada versi vLLM rilis yang dapat Anda instal hari ini yang memuat perubahan ini, karena perubahan ini belum di-merge. Dan DCP=2 adalah pemisahan dua arah dari satu shape spesifik — delta-delta itu bukan janji tentang apa yang akan dilakukan DCP=4 atau DCP=8, dan tidak ada apa pun dalam PR yang mengklaim demikian.

Mengapa PR serving tentang arsitektur yang belum dirilis tetap layak menyita waktu Anda

Keberatan yang jelas: model dalam judul itu tidak ada, jadi mengapa peduli? Karena hal yang sedang disetel bukanlah Qwen 4. Itu adalah Qwen3.8-Flash-Next, dan model itu memang ada — Alibaba menerbitkannya pada 2026-08-24 sebagai MoE berparameter 125B dengan 6B diaktifkan, tabel embedding n-gram berparameter 51 miliar, kepala MTP 4B untuk decoding spekulatif, 48 lapisan yang disusun sebagai dua belas pengulangan tiga blok Gated DeltaNet diikuti oleh satu blok QSA, 512 pakar dengan 10 pakar yang dirutekan dan 1 pakar bersama yang aktif, dan konteks asli 262,144 token yang menurut kartunya dapat diperluas hingga 1,000,000. Ini adalah implementasi referensi arsitektur Qwen4 dalam bobot terbuka, dan QSA — attention sparse blok mikro yang sedang diajarkan pull request ini kepada DCP untuk di-shard — adalah bagian yang paling khas darinya.

Apa yang digambarkan oleh angka-angka itu adalah apa yang terjadi ketika Anda berhenti memperlakukan konteks 262K itu sebagai sesuatu yang harus ditampung utuh oleh satu grup GPU. Lonjakan 1,80× dalam kapasitas token KV dan konkurensi adalah aritmetika dari membelah cache menjadi dua, hasil yang paling tidak mengejutkan dalam daftar ini. Angka yang lebih menarik adalah angka latensinya: waktu ke token pertama 2,44× lebih rendah dan latensi antar-token 1,66× lebih rendah pada beban yang sama, ditambah peningkatan 21 poin dalam tingkat hit cache prefiks kondisi tunak. Angka-angka itu menunjukkan bahwa jalur DCP bukan sekadar membeli kapasitas dengan mengorbankan latensi — dalam uji berpasangan ini, keduanya diperoleh sekaligus. Itulah bentuk perubahan yang penting bagi siapa pun yang melayani lalu lintas agen dengan prompt sistem yang sangat panjang, karena perilaku cache prefiks pada konteks panjang biasanya menjadi tempat throughput konteks panjang mati secara diam-diam.

Dan ini bukan patch yang terisolasi. Minggu yang sama menghasilkan sekelompok pekerjaan engine Qwen4Exp: #59214 menambahkan rencana GEMM dekode latensi rendah SM100 untuk bentuk B200, #59010 menambahkan kernel prefill sparse native SM90 untuk jalur QSA di Hopper, #58977 mencakup embedding BF16 INC PLE, dan #58961 — yang benar-benar sudah digabungkan, pada 2026-09-28 — memperbaiki cache KV profiling yang selama ini dipertahankan tetap hidup oleh key view QSA. Jika dibaca bersama, semuanya adalah cakupan penyajian dari arsitektur Qwen4 yang dibangun secara terbuka, di dalam runtime, berbulan-bulan sebelum keluarga ini dirilis. Jika Anda merencanakan untuk Qwen 4, sinyal yang berguna bukanlah tanggal peluncuran — tidak ada — melainkan apa yang sudah diasumsikan oleh kernel dan tata letak cache tentang bagaimana Anda harus menyajikannya.

Apa yang dapat Anda sebut hari ini

Jika Anda ingin menguji perilaku konteks panjang pada arsitektur yang menjadi topik PR ini, model yang perlu Anda gunakan adalah tier Flash yang benar-benar disediakan oleh Alibaba. Qwen3.8-Flash — deployment produksi yang dibangun di atas Qwen3.8-Flash-Next, dengan konteks 1.000.000 token dan output maksimum 131.072 token, yang menerima input teks, gambar, dan video — sudah live, dan ini adalah satu endpoint untuk model yang benar-benar menjalankan arsitektur Qwen4Exp saat ini, tercantum sebagai qwen/qwen3.8-flash dengan harga $0,15 per juta token input dan $0,47 per juta token output, dengan pembacaan cache sebesar $0,0184. Karena itu adalah harga daftar dari penyedia yang diteruskan tanpa markup dari pihak kami, perubahan harga atau batas dari vendor tersebut akan sampai kepada Anda pada hari yang sama saat diumumkan.

A capture of the OrcaRouter model page for Qwen3.8 Flash (qwen/qwen3.8-flash), showing the model name and vendor, the Vision, Tools, JSON and Reasoning capability chips, text plus image plus video input, a 1,000,000-token context window, 131,072-token maximum output, a $0.15 per 1M token input rate and a $0.47 per 1M token output rate passed through at provider list price, and an OpenAI-compatible base URL of https://api.orcarouter.ai/v1.

Dua catatan jujur. Pertama, Qwen3.8-Flash-Next sendiri — bobot FP8 dalam rencana pengujian pull request tersebut, yang Anda perlukan untuk mereproduksi pengukuran ini secara lokal — tidak ada di katalog kami; tier Flash yang disajikan adalah lini produksi QwenCloud, bukan checkpoint pratinjau mentah. Jika Anda ingin menjalankan konfigurasi persis seperti di PR, Anda melakukan self-hosting di empat GPU. Kedua, perubahan DCP belum di-merge, jadi tidak ada yang bisa Anda panggil di mana pun saat ini yang menjalankannya. Yang diberikan oleh tier yang disajikan adalah cara untuk mengetahui apakah beban kerja Anda memang cocok untuk masalah yang dipecahkan DCP: jika prompt Anda panjang, agentik, dan berat prefiks, maka kapasitas 1,80× dan delta cache prefiks adalah angka yang perlu Anda perhatikan dalam trace Anda sendiri.

Dan jika bagian yang menarik bagi Anda bukan satu model melainkan pertanyaan peralihan — tier mana yang akan dijadikan fondasi sementara jajaran Qwen 4 masih tanpa nama — itu masalah perutean, bukan masalah penyajian, dan satu API untuk 200+ model adalah cara Anda menjaga opsi tetap terbuka tanpa kontrak kedua atau perubahan kode saat keluarga model itu akhirnya hadir.

Pertanyaan yang layak dijawab secara langsung

Apakah #59279 berarti Qwen 4 sudah dirilis, atau akan segera dirilis?

Tidak. Pull request ini tentang arsitektur Qwen4Exp sebagaimana diimplementasikan di Qwen3.8-Flash-Next, yang dikirim Alibaba pada 2026-08-24. Keluarga Qwen 4 — Max, Flash, Plus, dan 27B — diberi nama di atas panggung di Apsara pada 2026-09-22 dan ditempatkan dalam peta jalan perusahaan dengan lini penerus yang diproyeksikan pada 5 hingga 10 triliun parameter, dan keluarga ini masih belum memiliki kartu model, belum memiliki bobot, belum memiliki pengenal API, belum memiliki jendela konteks, belum memiliki harga, dan belum memiliki tanggal. PR framework yang menambahkan mode paralelisme ke arsitektur pratinjau adalah langkah menuju melayani Qwen 4 dengan baik. Ini bukan langkah menuju keberadaan Qwen 4.

Apa perbedaan decode context parallelism dengan tensor parallelism?

Keduanya memecah hal yang berbeda dan gagal dengan cara yang berbeda. Paralelisme tensor mempartisi bobot dan komputasi setiap lapisan ke berbagai GPU, sehingga setiap rank berpartisipasi dalam setiap token tetapi melihat seluruh sekuens. Paralelisme konteks decode mempartisi KV cache itu sendiri, sehingga setiap rank hanya menyimpan dan membaca satu irisan konteks dan hasil attention parsial digabungkan setelahnya. TP adalah tentang menampung model; DCP adalah tentang menampung konteks dan trafik bersamaan yang menumpang di atasnya. Justru perbedaan itulah yang membuat PR ini tidak sepele: selector dan cache samping milik QSA tidak bisa begitu saja di-shard seperti KV cache utama, jadi perubahan ini harus melakukan sharding pada salah satunya dan mereplikasi yang lainnya, lalu membuktikan keduanya tetap konsisten.

Jika saya memanggil Qwen3.8-Flash-Next hari ini melalui API yang dihosting, apakah saya sudah mendapatkan angka-angka ini?

Tidak, dan kesenjangan itu terdiri dari tiga bagian. Perubahan tersebut belum di-merge, sehingga tidak ada build vLLM yang dirilis yang memuatnya. Bahkan setelah di-merge, penyedia harus mengadopsi build itu dan memilih untuk berjalan dengan ukuran DCP di atas satu — itu adalah konfigurasi serving, bukan default. Dan delta yang diukur berasal dari revisi patch yang lebih awal, bukan commit final, yang menurut penulisnya sejauh ini baru menjalani validasi B200 yang terfokus. Anggap delta yang dilaporkan sebagai batas atas yang terdokumentasi dengan baik atas apa yang diberikan pendekatan ini dalam satu konfigurasi, bukan sebagai spesifikasi endpoint mana pun yang dapat Anda sewa minggu ini.

Pertanyaan terbuka

Hal yang perlu diperhatikan bukanlah apakah draf spesifik ini digabungkan — kemungkinan besar akan digabungkan dalam suatu bentuk, karena penanganan cache khusus QSA yang ditambahkannya adalah celah yang nyata, bukan sekadar preferensi. Hal yang perlu diperhatikan adalah apakah commit akhir mendapatkan evaluasi berpasangan yang sama seperti yang diperoleh revisi perantara. Perubahan pada serving yang klaim throughput-nya berasal dari satu build dan klaim kebenarannya berasal dari build lain, untuk saat ini, adalah proposal dengan argumen yang kuat, bukan hasil yang terukur, dan sebaran akurasi pada sampel MRCR 8-needle cukup lebar sehingga mengulang uji coba pada sumber yang dirilis akan menjadi satu hal paling berguna yang bisa dipublikasikan siapa pun tentangnya. Sampai saat itu: arahnya terbaca, pembukuannya belum ditutup, dan satu-satunya model berarsitektur Qwen4 dalam bobot terbuka tetap yang dari Agustus.