Rilis Qwen3.8-Flash-Next — Di Dalam Pratinjau Arsitektur Qwen4 Alibaba. Ilustrasi yang dihasilkan ulang.
Guides & Insights

Rilis Qwen3.8-Flash-Next: Melihat Lebih Dalam Pratinjau Arsitektur Qwen4 dari Alibaba

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dokumen paling berguna yang diterbitkan Ali​baba pada 26 Agustus 2026 bukanlah press kit — melainkan laporan teknis. Qwen3.8-Flash-Next, model multimodal mixture-of-experts berbobot terbuka yang dirilis pada hari itu, hadir bersama makalah berjudul "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability," dan laporan itulah substansi sebenarnya. Laporan ini melakukan hal yang hampir tidak pernah dilakukan peluncuran produk dari vendor: memublikasikan ablasi, hasil negatif, dan eksperimen resep pelatihan, lalu menarik benang merah dari setiap temuan ke arsitektur keluarga Qwen4 yang dimaksudkan untuk dipratinjau oleh model ini.

Apa yang sebenarnya dirilis pada 26 Agustus

Model itu sendiri tergolong sederhana menurut standar Qw​en tahun 2026, dan hal itu memang disengaja. Qwen3.8-Flash-Next menyimpan 125B parameter model utama ditambah tabel embedding n-gram terpisah sebesar 51B — kira-kira 176B sebelum modul prediksi multi-token 4B — tetapi hanya mengaktifkan 6B per token. Ia adalah model mixture-of-experts dengan 512 pakar, routing top-10, dan 48 lapisan, dengan konteks bawaan 262.144 token dan dapat diperluas hingga 1M melalui YaRN. Ia menerima masukan teks, gambar, dan video, dan menghasilkan teks. Bobotnya tersedia di Hugging Face dan ModelScope di bawah lisensi qwen-community-1.0, dan blog Ali​baba sendiri menyebutnya "pratinjau eksperimental dari arsitektur yang akan mendasari Qwen4" — peran yang sama yang dimainkan Qwen3-Next untuk lini Qw​en3.5, seekor kenari yang terbang sebelum kapal utama.

Pada hari yang sama, Ali​baba meluncurkan versi komersialnya: sebuah build yang dilayani bernama Qwen3.8-Flash pada API QwenCloud dengan harga $0,16 per juta token masukan dan $0,47 per juta token keluaran. Keduanya mudah tertukar dan penting untuk dibedakan. Qwen3.8-Flash-Next adalah pratinjau bobot terbuka yang dibedah laporan teknis; Qwen3.8-Flash adalah build API produksi, berbayar, dengan konteks token 1M secara default dan format permintaan yang kompatibel dengan Open​AI dan Anthropic. Harga, tolok ukur, dan argumen arsitektur semuanya bersumber dari rekayasa yang sama.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Empat taruhan arsitektur dalam laporan teknis

Tulang punggung makalah ini adalah empat taruhan tentang seperti apa model frontier berbiaya rendah dengan konteks panjang seharusnya, masing-masing dengan dukungan eksperimental.

• Attention — hibrida GDN + QSA. Tiga dari setiap empat lapisan menggunakan Gated DeltaNet, lapisan attention linear yang memampatkan riwayat menjadi status berulang berukuran tetap alih-alih cache KV yang tumbuh seiring panjang sekuens. Lapisan sisanya adalah Qw​en Sparse Attention, yang mengagregasi sekuens menjadi micro-block, memberinya skor secara murah, dan menjalankan attention penuh hanya pada area yang penting. Ali​baba melaporkan percepatan prefill hingga 7.6× dan decode 4.9× pada konteks 1M; benchmark day-0 milik SGLang sendiri terukur lebih tinggi lagi, yakni 10.2× dan 6.6×. Pada tingkat hit cache prefiks 90%, throughput prefill mencapai 8.6× dari Qwen3.7-Plus. Ini adalah angka yang dilaporkan oleh vendor dan mitra, bukan hasil audit independen.

• Residual stream — Gated Residual. Jalur residual tunggal diperlebar menjadi empat cabang paralel dengan gating dinamis per elemen, desain multi-cabang gaya Hyper-Connection dengan kontrol gaya GatedNorm. Gate tersebut mengatur pembacaan dan penulisan di setiap cabang, yang menurut paper menekan outlier aktivasi dan, secara praktis, memungkinkan status residual disimpan dalam FP8.

{{1}}Embedding{{/1}} — tabel n-gram 51B. Daripada satu embedding per token, model ini menjadikan token saat ini plus token-token sebelumnya sebagai kunci tabel pencarian, sehingga menyimpan seluruh frasa dan pola lokal. Biayanya hampir gratis per token, dan karena alamat pencarian sudah diketahui lebih dulu, tabel ini dapat berada di memori host dan di-prefetch secara asinkron, sepenuhnya di luar memori GPU. Inilah trik yang memungkinkan checkpoint 176B berjalan di mesin kelas 75GB, dan ini berakar dari embedding per-lapisan Gemma 3n serta Engram DeepSeek.

• Optimasi — Muon, disetel. Pelatihan menggunakan pengoptimal Muon, metode momentum berbasis ortogonalisasi, yang diterapkan pada peta linear dua dimensi (attention, GDN, dan bobot pakar MoE) sementara AdamW dipertahankan untuk embedding, router, dan parameter peringkat-rendah. Makalah ini juga melaporkan hasil negatif yang layak dibaca: pemanasan ukuran batch dihapus setelah ternyata membutuhkan 18.8% lebih banyak langkah pengoptimal tanpa meningkatkan apa pun.

Tabel benchmark, baca dengan cermat.

Setiap angka utama di sini adalah milik Qw​en sendiri, diterbitkan di kartu model dan dalam laporan tersebut, dan tidak ada satu pun yang direproduksi secara independen — model ini baru berumur satu hari dan belum ada pihak ketiga yang mengauditnya. Jika dibaca seperti itu, hasilnya tetap mencolok, karena Qwen3.8-Flash-Next mampu bertarung sengit dengan DeepSeek-V4-Flash-0731, model yang jauh lebih besar dan mapan, pada 6B parameter aktif.

• DeepSWE 1.1 — 58.7 vs 54.4 (dilaporkan vendor).

• SWE-bench Pro — 62.5 vs 56.0 (dilaporkan vendor).

• Toolathlon Terverifikasi — 73.5 vs 70.3 (dilaporkan vendor).

• LiveCodeBench v6 — 91.9 vs 90.6 (dilaporkan vendor).

• GPQA Diamond — 91,7 vs 90,8 (dilaporkan vendor).

• IFBench — 81.3 vs 79.2 (dilaporkan vendor).

Kemudian, kekurangan yang dilaporkan secara terbuka: NL2Repo-Bench, 48.1 hingga 54.2 milik DeepSeek-V4-Flash-0731 — defisit nyata dalam pembuatan kode tingkat repositori, satu-satunya dimensi pengodean agen di mana model yang lebih kecil tidak mampu mengimbangi. Agents' Last Exam tidak jauh berbeda pada 24.3 hingga 25.2. Pada otomatisasi kantor, Qw​en melaporkan CoWorkBench 73.9 — tetapi itu adalah tolok ukur internal dan Ali​baba tidak memasukkannya ke dalam bagan utama.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

Dalam hal visi, tabel yang dilaporkan sendiri menunjukkan AndroidWorld 84.5 berbanding 62.0 untuk Claude Opus 4.6 Max dan RealWorldQA 88.5 berbanding 73.9. Humanity's Last Exam adalah satu-satunya judul utama di mana Qw​en kalah telak dari Claude Opus 4.6 Max — dan penilaian skor itu sendiri dilakukan oleh GPT-4o, jadi perbandingan itu pun tidak bersih.

Harganya: seperdua belas dari model unggulan.

Lalu angka yang penting untuk anggaran. Build Qwen3.8-Flash yang dilayani dibanderol $0,16 per juta token masukan dan $0,47 per juta token keluaran di QwenCloud. Itu kira-kira seperduabelas dari harga model unggulan Ali​baba sendiri, Qwen3.8-Max, yang dibanderol $2,00 per juta token masukan dan $6,00 per juta token keluaran — pada model yang menurut laporan tersebut dilatih dengan komputasi sekitar sepersembilan dari Qwen3.7-Plus. Para vendor model asal China telah menghabiskan musim panas untuk memangkas harga tingkat flash, dan rilis ini adalah sisi Qw​en dari kampanye tersebut yang hadir dengan justifikasi arsitektur, bukan sekadar diskon.

Bagi siapa pun yang membandingkan lintas kategori, perhitungan menjadi lebih mudah ketika setiap penyedia menampilkan angka yang sama. OrcaRouter merutekan seluruh keluarga Qwen lainnya — Qwen3.8-Max, Qwen3.8-27B, dan Qwen3.8 — dengan harga daftar penyedia dan markup 0%, sehingga pemotongan harga vendor langsung aktif di sisi kami pada hari pemotongan tersebut diumumkan. Qwen3.8-Flash-Next belum ada dalam katalog kami; ketika mencapai runtime yang kami rute, ia masuk ke pengaturan harga daftar satu-kunci yang sama tanpa kontrak kedua.

Apa yang dapat Anda lakukan dengannya hari ini

Dukungan serving untuk hari pertama sangat luas. SGLang menyediakan halaman cookbook dan image khusus (lmsysorg/sglang:qwen38flashnext); vLLM memiliki vllm/vllm-openai:qwen38-flash-next; NVIDIA memvalidasi keduanya plus TensorRT LLM pada rack GB300 NVL72 dengan lebih dari 16.000 token per detik per GPU dalam FP8, dan NeMo mencakup fine-tuning. Di bawah skala pusat data, model ini berjalan pada klaster DGX Spark dan workstation 4×RTX PRO 6000, dan rangkaian kuantisasi komunitas di hari yang sama — GGUFs dari Unsloth dan build 1-bit yang muat dalam RAM 75GB dengan akurasi sekitar 80% dari akurasi penuh — berarti checkpoint 176B yang tersimpan ini benar-benar dapat dijalankan pada perangkat keras milik tim kecil. Tim yang lebih memilih memanggilnya daripada menjalankannya dapat mengakses API Qwen3.8-Flash melalui QwenCloud milik Ali​baba sendiri dan beberapa platform pihak ketiga, meskipun bobot terbuka adalah yang akan diambil lebih dulu oleh sebagian besar pengadopsi awal.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Perhitungan VRAM di balik daftar itu adalah tabel n-gram, dan di situlah titik konvergensi berikutnya bagi stack serving. Embedding per lapisan yang menurut laporan teknis itu tidak disimpan di memori GPU adalah struktur lookup murni — per token yang dihasilkan, model hanya mengambil sekitar 16 dari 320 juta barisnya — itulah yang membuat offloading-nya murah. vLLM melayani Qwen3.8-Flash-Next dari image pengembangan khusus sementara pull request dukungan arsitektur masih terbuka, dan bagian terbaru dari pekerjaan itu, draf PR dari penulis vLLM yang sama (vllm-project/vllm#54371, belum di-merge), menambahkan jalur serving PLE-Offload yang menyimpan tabel di memori host dan membacanya melalui CUDA unified virtual addressing alih-alih mengalokasikan VRAM. Pada FP8, tabel tersebut sekitar 48GB dari checkpoint ~173GB, jadi offloading-nya menjadi pembeda antara GPU pusat data dan satu kartu 96GB — RTX PRO 6000, atau kolam memori terpadu satu DGX Spark. Ini masih awal, jadi anggap saja sebagai arah, bukan opsi yang didukung saat ini; tetapi ini adalah runtime yang menyusul apa yang sudah diklaim laporan teknis tersebut, dan hal yang perlu diperhatikan jika angka VRAM itulah yang selama ini menghambat Anda.

Pratinjau berumur satu hari dengan angka yang belum dapat direproduksi adalah contoh klasik untuk tidak mempertaruhkan jalur produksi padanya, dan justru untuk itulah failover ada. Jika sebuah runtime membawa Qwen3.8-Flash-Next dan Anda mengarahkan satu endpoint ke runtime tersebut dengan failover otomatis ke model yang sudah Anda percayai, Anda mendapatkan keuntungan dari arsitektur baru pada lalu lintas non-kritis dan fallback yang bersih saat model tersebut kesulitan — tanpa pengkabelan ulang, karena itu adalah aturan routing, bukan perubahan kode.

Apa yang pratinjau ini katakan tentang Qwen4

Ali​baba telah menjalankan strategi ini sebelumnya. Qwen3-Next mempratinjau Gated DeltaNet pada akhir 2025 dengan dokumentasi tipis, dan arsitekturnya baru sepenuhnya dispesifikasikan setelah seri Qw​en3.5 mengadopsinya dalam skala besar. Pola ini berulang: Qwen3.8-Flash-Next adalah kenari percobaan, dan laporan tersebut merupakan spesifikasi melalui eksperimen. Hal-hal konkret yang perlu diperhatikan adalah apakah flagship Qwen4 mengadopsi pembagian tiga-ke-satu GDN-ke-QSA, apakah embedding n-gram bertahan menghadapi serving produksi pada skala flagship, dan yang terpenting, apakah evaluasi independen mengonfirmasi keunggulan 6B-aktif dibandingkan model yang lebih besar. Jika tesis efisiensi tersebut berlaku, flagship Qwen4 kemungkinan akan dirilis dengan biaya serving yang jauh lebih rendah daripada generasi sebelumnya.

FAQ

Apakah Qwen3.8-Flash-Next dan Qwen3.8-Flash — model yang sama?

Tidak, dan {{1}}perbedaan itu penting{{/1}}. Qwen3.8-Flash-Next adalah {{2}}pratinjau arsitektur open-weights{{/2}} yang dianalisis {{3}}laporan teknis{{/3}}; Qwen3.8-Flash adalah {{4}}build API produksi{{/4}} yang disediakan Ali​baba di QwenCloud seharga $0.16/$0.47 per juta token dengan konteks default 1M. {{5}}Garis keturunan rekayasa yang sama, artefak yang berbeda{{/5}} — satu untuk {{6}}self-hosting dan inspeksi{{/6}}, yang lainnya adalah layanan terkelola berbayar.

Haruskah beban kerja produksi berpindah ke sana hari ini?

{{1}}Tidak tanpa pendapat kedua.{{/1}} Setiap benchmark dilaporkan vendor dan belum pernah direproduksi secara independen, {{2}}arsitekturnya cukup baru sehingga stack-stack serving-nya masih dalam proses konvergensi{{/2}} — dukungan vLLM sendiri masih masuk lewat pull request terbuka — dan satu-satunya celah dalam coding agentik (NL2Repo) tepat pada jenis tugas yang sering dihadapi para developer produksi. {{3}}Bobot yang terbuka membuatnya murah untuk dievaluasi sendiri{{/3}}, dan dukungan SGLang dan vLLM sejak hari pertama memungkinkan pilot dilakukan minggu ini — tetapi pilot di belakang failover adalah cara yang jujur untuk memulai, bukan cutover langsung.

Kapan sebenarnya Qwen4 dikirim?

Ali​baba belum memberi pernyataan. Satu-satunya sinyal waktu dalam rilis ini bersifat historis: canary terakhir, Qwen3-Next, terbang kira-kira satu musim sebelum seri Qw​en3.5 mengadopsi arsitekturnya. Dengan ritme tersebut, model andalan Qwen4 lebih dekat daripada yang terlihat — tetapi laporan ini secara eksplisit membahas arsitektur, bukan peta jalan.

Intinya

Qwen3.8-Flash-Next adalah rilis langka di mana paper-nya menjadi produknya. Pada modelnya sendiri, rapor jujurnya berbunyi: 6B parameter aktif yang menyaingi model yang jauh lebih besar di sebagian besar benchmark yang digunakan bersama, satu kesenjangan yang disebutkan pada kode tingkat repositori, harga layanan seperdua belas dari model unggulan, serta arsitektur yang merupakan jawaban Qw​en atas pertanyaan bagaimana model frontier menjadi murah. Laporan teknis menjelaskan untuk apa Qwen3.8-Flash-Next dibuat — dan itu bukan modelnya. Itu adalah bukti bagi arsitektur yang akan menjadi Qwen4, dan itu layak dibaca sebelum Qwen4 dirilis, karena keputusan yang diubahnya adalah keputusan yang akan Anda ambil ketika Qwen4 tiba.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube