Kartu judul utama untuk artikel 'Qwen3.8-Flash-Next — LAPORAN BOCORAN' dengan lencana 'BELUM TERVERIFIKASI — PRATINJAU ARSITEKTUR QWEN4', subjudul 'Alibaba merilis arsitektur Qwen4 sebelum modelnya hadir', tiga chip bertuliskan 'Sumber: @kimmonismus', '26 Agu 2026', dan 'Rilis: 26 Agu 23:00 UTC+08', kartu kiri bertuliskan 'Klaimnya: MoE multimodal berbobot terbuka yang mempratinjau arsitektur Qwen4' dan kartu kanan bertuliskan 'Status: bobot belum dirilis, ~24 jam menuju rilis'. Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba Mempratinjau Arsitektur Qwen4 Sebelum Qwen4 Ada

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Alibaba akan segera memublikasikan arsitektur Qwen4 sebelum menerbitkan model Qwen4. Qwen3.8-Flash-Next — sebuah model mixture-of-experts multimodal dengan bobot terbuka yang dibangun di atas arsitektur generasi berikutnya yang akan mendukung keluarga Qwen4 — dijadwalkan rilis publik di ModelScope pada pukul 23:00 waktu Beijing, 26 Agustus 2026. Alibaba membingkai perilisan ini sebagai pratinjau teknologi: pengembang mendapatkan arsitekturnya lebih awal, sedangkan keluarga Qwen4 lengkap menyusul kemudian. Hingga tulisan ini dibuat, jumlah parameter, lisensi, dan harga belum dikonfirmasi, sehingga ini adalah artikel tentang apa yang kita ketahui sejauh ini — setiap detail di bawah diberi label seberapa kuat kebenarannya.

Jika Anda belum mengikuti ritme Alibaba bulan ini, acuannya adalah Qwen3.8-Max — model unggulan dengan 2,4 triliun parameter yang dirilis pada 3 Agustus dan dirilis sebagai open-source sebagai Qwen3.8-2.4T-A95B kurang dari dua minggu kemudian. Qwen3.8-Flash-Next hadir kurang dari sebulan setelahnya. Lab yang sama yang mengeluarkan model open-weight dengan 2,4 triliun parameter kini membagikan arsitektur untuk generasi berikutnya, sebelum model unggulan generasi tersebut bahkan diberi nama.

Apa yang diumumkan?

Sinyal tersebut mencapai arena melalui saluran yang biasa. Halaman teaser ModelScope untuk Qwen3.8-Flash-Next tayang pada 25 Agustus dengan lencana "Segera Rilis Terbuka", tagline "Melaju ke Generasi Berikutnya — Secepat Kilat," dan timer rilis yang menunjuk ke 2026-08-26 23:00 (UTC+08:00). Tim Qw​en Alibaba memposting di X pada hari yang sama — "Gelombang Qw​en berikutnya akan datang." Postingan yang mengarahkan tulisan ini kepada kami, dari @kimmonismus di X, menggambarkan hal yang sama dengan kata-kata yang sedikit berbeda: MoE multimodal dengan bobot terbuka pada arsitektur generasi berikutnya, akses awal agar komunitas dapat mempersiapkan diri untuk keluarga Qwen4.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Bagian yang perlu dibaca ulang adalah kerangka pemikiran Alibaba sendiri. Model ini digambarkan dibangun di atas arsitektur generasi berikutnya "yang akan menggerakkan keluarga Qwen4 yang akan datang" — dan secara eksplisit bukan sebagai Qwen4 itu sendiri. Alasan yang dinyatakan Alibaba adalah bahwa perubahan arsitektur harus berada di tangan komunitas sebelum keluarga tersebut hadir, sehingga runtime, kuantisasi, dan aplikasi siap saat produk yang sesungguhnya dirilis. Itu adalah posisi pemasaran, tetapi juga merupakan komitmen teknis: pratinjau bagian yang sulit terlebih dahulu, bawa komunitas bersama.

Apa yang dikonfirmasi hari ini, dan apa yang tidak:

• Dikonfirmasi, sesuai teaser dan pernyataan Qw​en: Qwen3.8-Flash-Next adalah model open-weight, multimodal, dan MoE pada arsitektur Qwen4.

• Dikonfirmasi, sesuai pernyataan {{1}}Qw​en{{/1}}: ini memperkenalkan dua perubahan arsitektur utama — arsitektur hibrida {{2}}GDN{{/2}} dan {{3}}Qw​en Sparse Attention (QSA){{/3}}.

• Dikonfirmasi, sesuai teaser: waktu rilis, 2026-08-26 23:00 (UTC+08:00), di ModelScope.

• Belum dikonfirmasi: total atau parameter aktif, ketentuan lisensi, panjang konteks, ketersediaan API atau harga, dan setiap skor tolok ukur. Belum ada evaluasi independen karena bobotnya belum dirilis.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Apa sebenarnya arsitektur Qwen4 itu.

Dua mekanisme menggerakkan cerita ini. Yang pertama, GDN — Gated Delta Network — adalah lapisan linear-attention milik Alibaba. Di mana transformer standar menyimpan cache key-value yang bertambah seiring panjang sekuens, lapisan GDN mempertahankan state recurrent berukuran tetap dan memperbaruinya dengan aturan gating yang dipelajari; garis keturunannya berjalan melalui DeltaNet dan Mamba-2. Keuntungannya adalah hal yang secara diam-diam telah menggerakkan lini Qw​en sejak Qwen3-Next: konteks panjang tetap murah karena state-nya tidak bertambah, sementara sebagian kecil lapisan full-attention tetap berada di dalam campuran untuk melakukan pengambilan presisi yang tidak dapat dilakukan dengan baik oleh linear-attention. Pada generasi saat ini, campuran tersebut memakai kira-kira tiga lapisan GDN untuk setiap lapisan full-attention — analisis komunitas terhadap checkpoint Qwen3.8-2.4T-A95B menghitung 69 lapisan GDN berbanding 23 lapisan attention. Qwen3.8-Flash-Next dideskripsikan sebagai "arsitektur hibrida GDN" pada garis keturunan yang persis itu.

Yang kedua, QSA — Qw​en Sparse Attention — adalah bagian yang benar-benar baru, dan belum ada deskripsi teknis publik mengenainya: hanya namanya, dan disebut-sebut sebagai salah satu dari dua perubahan utama pratinjau tersebut. Tidak adanya detail itu sendiri merupakan bagian dari pola tersebut. Pratinjau Qwen3-Next pada akhir 2025 memperkenalkan Gated DeltaNet dengan kelangkaan dokumentasi yang sama, dan arsitektur tersebut baru mendapatkan spesifikasi lengkap setelah seri Qw​en3.5 mengadopsinya. Bagi pembaca, kesimpulan praktisnya sama pada kedua kesempatan: arsitektur kanari muncul lebih dulu, dokumentasi dan model produksinya menyusul setelahnya.

Buku pedoman yang sudah pernah berhasil

Alibaba telah menjalankan strategi yang sama persis sebelumnya, dan itu berhasil. Pada akhir 2025, Qwen3-Next mempratinjau Gated DeltaNet dan hibrida dari perhatian linear dan penuh. Ketika seri Qw​en3.5 dirilis, seri tersebut mengadopsi cetak biru itu dalam skala besar — dan hibrida tersebut telah berlanjut hingga generasi Qw​en3.8 sejak saat itu, termasuk andalan 2.4T. Alasan preseden ini penting di sini adalah waktu yang diimplikasikannya. Keluarga Qwen4 yang lengkap seharusnya diharapkan berada di sisi jauh dari pratinjau ini, bukan di dalamnya; jika jarak Qwen3-Next bisa menjadi panduan, jarak antara "inilah arsitekturnya" dan "inilah keluarganya" diukur dalam hitungan bulan. Tidak ada apa pun dalam teaser yang mengonfirmasi hal itu — itu adalah inferensi dari pola yang kini telah Alibaba jalankan dua kali.

Apa yang masih belum kita ketahui

Yang tidak diketahui adalah inti dari sebuah pratinjau, dan hal-hal itu nyata:

• Parameter. Teaser tidak mengungkapkan apa pun. Spekulasi komunitas di X dan Reddit — tanpa dukungan resmi — mengarah pada konfigurasi dengan total sekitar 125B / 6B aktif serta tabel pencarian embedding n-gram yang besar. Anggap saja itu rumor.

• Tingkatan "Flash". Dalam generasi Qwen3.5, Qwen3.5-Flash yang hanya tersedia di cloud adalah varian yang disempurnakan dari Qwen3.5-35B-A3B yang bersifat open-weight. Apakah Qwen3.8-Flash-Next merupakan padanan open-weight dari model Qwen3.8 dengan ukuran serupa tidak diketahui; mungkin saja model kelas 125B-A6B. Kedua pembacaan tersebut hanyalah tebakan.

• Lisensi. Rilis terbaru Qw​en dari Alibaba berkisar dari Apache-2.0 (Qw​en3.8-27B) hingga lisensi Qwen3.8-Max yang dibatasi pendapatan. Di mana Flash-Next berada menentukan apakah dapat digunakan secara komersial, dan dalam hal apa.

• Tolok ukur. Pernyataan Qw​en menyoroti pengodean agen, tugas jangka panjang, dan kecerdasan multimodal, tetapi tidak ada angka yang dilampirkan dan tidak ada evaluasi independen sampai bobotnya dirilis.

Sebuah keluarga yang beriterasi dalam siklus dua mingguan.

Irama di sekitarnya adalah cerita tersendiri. Qwen3.8-Max, model unggulan dengan 2,4 triliun parameter, dirilis pada 3 Agustus; Qwen3.8-2.4T-A95B dengan bobot terbuka menyusul pada 12–13 Agustus; Qw​en3.8-27B gratis dengan lisensi Apache-2.0 hadir beberapa hari kemudian; dan kini, sebelum bulan berakhir, arsitektur generasi berikutnya sedang dipratinjau. Tidak ada laboratorium lain yang saat ini berinovasi dengan ritme secepat ini. Bagi pembaca yang memilih model, konsekuensi praktisnya adalah bahwa "Qw​en terbaik" adalah sasaran yang terus bergerak — dan jarak antargenerasi hadir lebih cepat daripada biasanya ekosistem di sekitarnya beradaptasi. Membeli keputusan alih-alih model semakin menjadi langkah yang dapat dipertahankan.

Apa yang harus dilakukan seorang pengembang sekarang

{{1}}Rencanakan arsitekturnya, bukan hanya modelnya.{{/1}} {{2}}Qwen3.8-Flash-Next akan menjadi pratinjau yang belum teruji pada hari pertama: tidak ada tolok ukur independen, ekosistem runtime yang masih mengejar ketertinggalan, dan hanya klaim vendor untuk keunggulan agenik dan horizon panjang yang penting bagi beban kerja yang akan menggunakannya.{{/2}} {{3}}Cara aman untuk mengevaluasinya bukan dengan menyambungkannya ke jalur produksi — melainkan dengan mengarahkan salinan beban kerja berisiko rendah ke model tersebut, membandingkan keluarannya dengan model yang ada, dan membiarkan failover otomatis menyerap momen-momen ketika penyedia yang melayani model open-weight yang baru dirilis berperilaku buruk.{{/3}} {{4}}Di OrcaRouter, itu adalah endpoint dan kunci yang sama yang sudah Anda gunakan: Qwen3.8-Flash-Next dan model Anda saat ini berada di balik satu API, dan DSL perutean dapat menguji A/B pratinjau tersebut terhadap model yang ada dengan prompt yang sama sebelum apa pun dikomit.{{/4}}

Harga, ketika ada, harus dibaca dengan cara yang sama. Alibaba belum mengumumkan harga API untuk Flash-Next, dan bobot yang belum dirilis tidak dapat dirutekan ke mana pun. Ketika penyedia layanan benar-benar mengeksposnya, OrcaRouter meneruskan harga daftar penyedia secara langsung dengan markup 0% — jadi berapa pun angka Alibaba nantinya akan tampil tanpa perubahan, di hari yang sama. Garis dasar terdekat yang sebenarnya dapat Anda panggil hari ini adalah Qwen3.8-Max (qwen/qwen3.8-max), unggulan yang kelak akan berada di bawah arsitektur ini: jendela konteks 1.000.000 token dengan harga $2,00 per juta token masukan dan $6,00 per juta token keluaran, diteruskan sesuai harga daftar. Ingat angka itu ketika harga Flash-Next turun; itulah biaya yang harus dikalahkan oleh generasi berikutnya.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Yang perlu ditonton saat kickoff

Empat hal yang penting pada saat timer rilis habis:

• Jumlah parameter dan tingkat parameter aktif — apakah ini model kelas 125B-A6B yang digambarkan oleh rumor atau entri yang lebih kecil.

• Lisensi — permisif seperti Qwen3.8-27B, atau dibatasi seperti lisensi Max.

• Apakah evaluasi independen pertama mereproduksi klaim vendor tentang pengkodean agentik dan berhorizon panjang — angka yang bisa dipercaya, bukan sekadar baris pemasaran.

Berapa lama Alibaba menunggu sebelum keluarga Qwen4 yang lengkap menyusul pratinjau tersebut.

Tidak ada yang bisa diketahui dari sini. Yang bisa diketahui hari ini adalah bentuk keputusan yang telah dibuat Alibaba: yaitu bertaruh bahwa generasi berikutnya dari arsitekturnya layak diberikan lebih dulu daripada produk unggulannya. Taruhan itulah yang menjadi cerita — dan bobotnya akan dirilis besok.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube