
Qwen3.8-Flash-Next: Alibaba Mempratinjau Arsitektur Qwen4 Sebelum Qwen4 Ada
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Alibaba akan segera memublikasikan arsitektur Qwen4 sebelum menerbitkan model Qwen4. Qwen3.8-Flash-Next — sebuah model mixture-of-experts multimodal dengan bobot terbuka yang dibangun di atas arsitektur generasi berikutnya yang akan mendukung keluarga Qwen4 — dijadwalkan rilis publik di ModelScope pada pukul 23:00 waktu Beijing, 26 Agustus 2026. Alibaba membingkai perilisan ini sebagai pratinjau teknologi: pengembang mendapatkan arsitekturnya lebih awal, sedangkan keluarga Qwen4 lengkap menyusul kemudian. Hingga tulisan ini dibuat, jumlah parameter, lisensi, dan harga belum dikonfirmasi, sehingga ini adalah artikel tentang apa yang kita ketahui sejauh ini — setiap detail di bawah diberi label seberapa kuat kebenarannya.
Jika Anda belum mengikuti ritme Alibaba bulan ini, acuannya adalah Qwen3.8-Max — model unggulan dengan 2,4 triliun parameter yang dirilis pada 3 Agustus dan dirilis sebagai open-source sebagai Qwen3.8-2.4T-A95B kurang dari dua minggu kemudian. Qwen3.8-Flash-Next hadir kurang dari sebulan setelahnya. Lab yang sama yang mengeluarkan model open-weight dengan 2,4 triliun parameter kini membagikan arsitektur untuk generasi berikutnya, sebelum model unggulan generasi tersebut bahkan diberi nama.
Apa yang diumumkan?
Sinyal tersebut mencapai arena melalui saluran yang biasa. Halaman teaser ModelScope untuk Qwen3.8-Flash-Next tayang pada 25 Agustus dengan lencana "Segera Rilis Terbuka", tagline "Melaju ke Generasi Berikutnya — Secepat Kilat," dan timer rilis yang menunjuk ke 2026-08-26 23:00 (UTC+08:00). Tim Qwen Alibaba memposting di X pada hari yang sama — "Gelombang Qwen berikutnya akan datang." Postingan yang mengarahkan tulisan ini kepada kami, dari @kimmonismus di X, menggambarkan hal yang sama dengan kata-kata yang sedikit berbeda: MoE multimodal dengan bobot terbuka pada arsitektur generasi berikutnya, akses awal agar komunitas dapat mempersiapkan diri untuk keluarga Qwen4.

Bagian yang perlu dibaca ulang adalah kerangka pemikiran Alibaba sendiri. Model ini digambarkan dibangun di atas arsitektur generasi berikutnya "yang akan menggerakkan keluarga Qwen4 yang akan datang" — dan secara eksplisit bukan sebagai Qwen4 itu sendiri. Alasan yang dinyatakan Alibaba adalah bahwa perubahan arsitektur harus berada di tangan komunitas sebelum keluarga tersebut hadir, sehingga runtime, kuantisasi, dan aplikasi siap saat produk yang sesungguhnya dirilis. Itu adalah posisi pemasaran, tetapi juga merupakan komitmen teknis: pratinjau bagian yang sulit terlebih dahulu, bawa komunitas bersama.
Apa yang dikonfirmasi hari ini, dan apa yang tidak:
• Dikonfirmasi, sesuai teaser dan pernyataan Qwen: Qwen3.8-Flash-Next adalah model open-weight, multimodal, dan MoE pada arsitektur Qwen4.
• Dikonfirmasi, sesuai pernyataan {{1}}Qwen{{/1}}: ini memperkenalkan dua perubahan arsitektur utama — arsitektur hibrida {{2}}GDN{{/2}} dan {{3}}Qwen Sparse Attention (QSA){{/3}}.
• Dikonfirmasi, sesuai teaser: waktu rilis, 2026-08-26 23:00 (UTC+08:00), di ModelScope.
• Belum dikonfirmasi: total atau parameter aktif, ketentuan lisensi, panjang konteks, ketersediaan API atau harga, dan setiap skor tolok ukur. Belum ada evaluasi independen karena bobotnya belum dirilis.

Apa sebenarnya arsitektur Qwen4 itu.
Dua mekanisme menggerakkan cerita ini. Yang pertama, GDN — Gated Delta Network — adalah lapisan linear-attention milik Alibaba. Di mana transformer standar menyimpan cache key-value yang bertambah seiring panjang sekuens, lapisan GDN mempertahankan state recurrent berukuran tetap dan memperbaruinya dengan aturan gating yang dipelajari; garis keturunannya berjalan melalui DeltaNet dan Mamba-2. Keuntungannya adalah hal yang secara diam-diam telah menggerakkan lini Qwen sejak Qwen3-Next: konteks panjang tetap murah karena state-nya tidak bertambah, sementara sebagian kecil lapisan full-attention tetap berada di dalam campuran untuk melakukan pengambilan presisi yang tidak dapat dilakukan dengan baik oleh linear-attention. Pada generasi saat ini, campuran tersebut memakai kira-kira tiga lapisan GDN untuk setiap lapisan full-attention — analisis komunitas terhadap checkpoint Qwen3.8-2.4T-A95B menghitung 69 lapisan GDN berbanding 23 lapisan attention. Qwen3.8-Flash-Next dideskripsikan sebagai "arsitektur hibrida GDN" pada garis keturunan yang persis itu.
Yang kedua, QSA — Qwen Sparse Attention — adalah bagian yang benar-benar baru, dan belum ada deskripsi teknis publik mengenainya: hanya namanya, dan disebut-sebut sebagai salah satu dari dua perubahan utama pratinjau tersebut. Tidak adanya detail itu sendiri merupakan bagian dari pola tersebut. Pratinjau Qwen3-Next pada akhir 2025 memperkenalkan Gated DeltaNet dengan kelangkaan dokumentasi yang sama, dan arsitektur tersebut baru mendapatkan spesifikasi lengkap setelah seri Qwen3.5 mengadopsinya. Bagi pembaca, kesimpulan praktisnya sama pada kedua kesempatan: arsitektur kanari muncul lebih dulu, dokumentasi dan model produksinya menyusul setelahnya.
Buku pedoman yang sudah pernah berhasil
Alibaba telah menjalankan strategi yang sama persis sebelumnya, dan itu berhasil. Pada akhir 2025, Qwen3-Next mempratinjau Gated DeltaNet dan hibrida dari perhatian linear dan penuh. Ketika seri Qwen3.5 dirilis, seri tersebut mengadopsi cetak biru itu dalam skala besar — dan hibrida tersebut telah berlanjut hingga generasi Qwen3.8 sejak saat itu, termasuk andalan 2.4T. Alasan preseden ini penting di sini adalah waktu yang diimplikasikannya. Keluarga Qwen4 yang lengkap seharusnya diharapkan berada di sisi jauh dari pratinjau ini, bukan di dalamnya; jika jarak Qwen3-Next bisa menjadi panduan, jarak antara "inilah arsitekturnya" dan "inilah keluarganya" diukur dalam hitungan bulan. Tidak ada apa pun dalam teaser yang mengonfirmasi hal itu — itu adalah inferensi dari pola yang kini telah Alibaba jalankan dua kali.
Apa yang masih belum kita ketahui
Yang tidak diketahui adalah inti dari sebuah pratinjau, dan hal-hal itu nyata:
• Parameter. Teaser tidak mengungkapkan apa pun. Spekulasi komunitas di X dan Reddit — tanpa dukungan resmi — mengarah pada konfigurasi dengan total sekitar 125B / 6B aktif serta tabel pencarian embedding n-gram yang besar. Anggap saja itu rumor.
• Tingkatan "Flash". Dalam generasi Qwen3.5, Qwen3.5-Flash yang hanya tersedia di cloud adalah varian yang disempurnakan dari Qwen3.5-35B-A3B yang bersifat open-weight. Apakah Qwen3.8-Flash-Next merupakan padanan open-weight dari model Qwen3.8 dengan ukuran serupa tidak diketahui; mungkin saja model kelas 125B-A6B. Kedua pembacaan tersebut hanyalah tebakan.
• Lisensi. Rilis terbaru Qwen dari Alibaba berkisar dari Apache-2.0 (Qwen3.8-27B) hingga lisensi Qwen3.8-Max yang dibatasi pendapatan. Di mana Flash-Next berada menentukan apakah dapat digunakan secara komersial, dan dalam hal apa.
• Tolok ukur. Pernyataan Qwen menyoroti pengodean agen, tugas jangka panjang, dan kecerdasan multimodal, tetapi tidak ada angka yang dilampirkan dan tidak ada evaluasi independen sampai bobotnya dirilis.
Sebuah keluarga yang beriterasi dalam siklus dua mingguan.
Irama di sekitarnya adalah cerita tersendiri. Qwen3.8-Max, model unggulan dengan 2,4 triliun parameter, dirilis pada 3 Agustus; Qwen3.8-2.4T-A95B dengan bobot terbuka menyusul pada 12–13 Agustus; Qwen3.8-27B gratis dengan lisensi Apache-2.0 hadir beberapa hari kemudian; dan kini, sebelum bulan berakhir, arsitektur generasi berikutnya sedang dipratinjau. Tidak ada laboratorium lain yang saat ini berinovasi dengan ritme secepat ini. Bagi pembaca yang memilih model, konsekuensi praktisnya adalah bahwa "Qwen terbaik" adalah sasaran yang terus bergerak — dan jarak antargenerasi hadir lebih cepat daripada biasanya ekosistem di sekitarnya beradaptasi. Membeli keputusan alih-alih model semakin menjadi langkah yang dapat dipertahankan.
Apa yang harus dilakukan seorang pengembang sekarang
{{1}}Rencanakan arsitekturnya, bukan hanya modelnya.{{/1}} {{2}}Qwen3.8-Flash-Next akan menjadi pratinjau yang belum teruji pada hari pertama: tidak ada tolok ukur independen, ekosistem runtime yang masih mengejar ketertinggalan, dan hanya klaim vendor untuk keunggulan agenik dan horizon panjang yang penting bagi beban kerja yang akan menggunakannya.{{/2}} {{3}}Cara aman untuk mengevaluasinya bukan dengan menyambungkannya ke jalur produksi — melainkan dengan mengarahkan salinan beban kerja berisiko rendah ke model tersebut, membandingkan keluarannya dengan model yang ada, dan membiarkan failover otomatis menyerap momen-momen ketika penyedia yang melayani model open-weight yang baru dirilis berperilaku buruk.{{/3}} {{4}}Di OrcaRouter, itu adalah endpoint dan kunci yang sama yang sudah Anda gunakan: Qwen3.8-Flash-Next dan model Anda saat ini berada di balik satu API, dan DSL perutean dapat menguji A/B pratinjau tersebut terhadap model yang ada dengan prompt yang sama sebelum apa pun dikomit.{{/4}}
Harga, ketika ada, harus dibaca dengan cara yang sama. Alibaba belum mengumumkan harga API untuk Flash-Next, dan bobot yang belum dirilis tidak dapat dirutekan ke mana pun. Ketika penyedia layanan benar-benar mengeksposnya, OrcaRouter meneruskan harga daftar penyedia secara langsung dengan markup 0% — jadi berapa pun angka Alibaba nantinya akan tampil tanpa perubahan, di hari yang sama. Garis dasar terdekat yang sebenarnya dapat Anda panggil hari ini adalah Qwen3.8-Max (qwen/qwen3.8-max), unggulan yang kelak akan berada di bawah arsitektur ini: jendela konteks 1.000.000 token dengan harga $2,00 per juta token masukan dan $6,00 per juta token keluaran, diteruskan sesuai harga daftar. Ingat angka itu ketika harga Flash-Next turun; itulah biaya yang harus dikalahkan oleh generasi berikutnya.

Yang perlu ditonton saat kickoff
Empat hal yang penting pada saat timer rilis habis:
• Jumlah parameter dan tingkat parameter aktif — apakah ini model kelas 125B-A6B yang digambarkan oleh rumor atau entri yang lebih kecil.
• Lisensi — permisif seperti Qwen3.8-27B, atau dibatasi seperti lisensi Max.
• Apakah evaluasi independen pertama mereproduksi klaim vendor tentang pengkodean agentik dan berhorizon panjang — angka yang bisa dipercaya, bukan sekadar baris pemasaran.
Berapa lama Alibaba menunggu sebelum keluarga Qwen4 yang lengkap menyusul pratinjau tersebut.
Tidak ada yang bisa diketahui dari sini. Yang bisa diketahui hari ini adalah bentuk keputusan yang telah dibuat Alibaba: yaitu bertaruh bahwa generasi berikutnya dari arsitekturnya layak diberikan lebih dulu daripada produk unggulannya. Taruhan itulah yang menjadi cerita — dan bobotnya akan dirilis besok.
