
Qwen3.8-Flash-Next vs Qwen3.8-27B: Qwen4-preview MoE melawan kuda kerja open-weights
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 578 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Hal yang mengejutkan tentang Qwen3.8-Flash-Next bukanlah bahwa Alibaba mengklaim model yang hanya mengaktifkan 6 miliar parameter per token mengungguli sebagian besar model terbuka — melainkan bahwa untuk menyajikannya diperlukan lebih banyak memori daripada model padat 27 miliar parameter yang dibandingkan dengannya. Qwen3.8-Flash-Next, yang dirilis sebagai sumber terbuka pada 26 Agustus 2026 sebagai pratinjau arsitektur Qwen4, menyimpan tabel pencarian N-gram dengan 51 miliar parameter di RAM sistem, bukan di VRAM; Qwen3.8-27B, model padat multimodal berlisensi Apache-2.0 yang diluncurkan pada pertengahan Agustus dan merupakan kuda kerja bobot terbuka generasi Qwen 3.8 saat ini, muat pada satu kartu grafis 24GB dengan 4-bit. Pada lembar benchmark Alibaba sendiri, MoE baru mengungguli 27B pada 21 dari 22 benchmark yang dibandingkan. Pada bukti independen — penempatan arena, studi agen hukum, pengukuran throughput pihak ketiga — 27B adalah satu-satunya dari keduanya yang memiliki bukti tersebut. Kombinasi itulah yang menjadi dasar keputusan.
Perbandingan dalam satu kalimat: dua anggota open-weight, teks-plus-visi dari generasi yang sama, konteks native 262K yang sama, keduanya dirancang untuk berjalan di luar pusat data — dan terpisah oleh arsitektur, lisensi, harga, serta seberapa banyak dari cerita mereka yang terverifikasi. Qwen3.8-Flash-Next adalah MoE sparse yang mempratinjau semua hal yang diharapkan akan diwarisi Qwen4. Qwen3.8-27B adalah model dense yang memadatkan apa yang Alibaba pelajari saat membangun andalan 2.4T menjadi sesuatu yang dapat dijalankan oleh satu GPU. Memilih di antara keduanya bukan soal kemampuan — Alibaba mengatakan pratinjau ini lebih unggul — melainkan soal apakah Anda mempercayai lembar vendor yang baru berumur satu hari dibandingkan model yang sudah dibedah oleh komunitas.
Papan skor
Pertama, soal sumber: setiap angka Qwen3.8-Flash-Next di bawah ini adalah milik Alibaba sendiri, baru berumur satu hari, dan belum direproduksi. Klaim benchmark paling menonjol dari Qwen3.8-27B juga berasal dari laporan Alibaba, tetapi 27B memiliki hasil independen — peringkat arena preferensi manusia, studi domain hukum, dan pengukuran throughput AMD — yang tidak dapat ditandingi oleh pratinjau.
Total parameter — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B tersimpan), 6B aktif. Qwen3.8-27B: ~27B dense (28B dengan encoder visi), semua aktif.
• Arsitektur — Qwen3.8-Flash-Next: pratinjau Qwen4 — Qwen Sparse Attention bergantian dengan Gated DeltaNet, residual ber-gate, embeddings N-gram, dilatih dengan Muon. Qwen3.8-27B: 48 lapisan attention linear GDN ditambah 16 lapisan attention penuh (3:1), padat.
• Konteks — keduanya 262.144 token native, dapat diperluas hingga 1M via YaRN.
• Modalitas — keduanya menerima input teks, gambar, dan video serta mengembalikan teks.
• Lisensi — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• Harga — Qwen3.8-Flash-Next: $0.16 / $0.47 per 1M (diumumkan; API produksi belum dibuka). Qwen3.8-27B: $0.33 / $2.40 per 1M, tersedia hari ini.
• Kebutuhan saat dijalankan — Qwen3.8-Flash-Next: tabel 51B di RAM host, ~96GB memori sistem plus GPU apa pun; FP8 ~186GB, Q4 GGUF ~82GB. Qwen3.8-27B: BF16 ~55.6GB, 4-bit muat di kartu 24GB.
• Bukti independen — Qwen3.8-Flash-Next: belum ada. Qwen3.8-27B: model terbuka #1 di Arena.ai Image-to-WebDev, #9 keseluruhan di Code Arena WebDev, open-weight #1 pada benchmark Harvey's Legal Agent, throughput terukur AMD.

Berdasarkan angka milik Alibaba sendiri, versi preview unggul di hampir semua hal.
Perbandingan yang dipublikasikan Alibaba menunjukkan Qwen3.8-Flash-Next memperoleh skor setara atau lebih baik pada 21 dari 22 tolok ukur bahasa dan visi dibandingkan Qwen3.8-27B, dan kemenangan ini bukan sekadar kosmetik. SWE-bench Pro 62.5 berbanding 61.7 adalah keunggulan tipis, tetapi DeepSWE 58.7 berbanding 42.2, JobBench 55.7 berbanding 33.4, dan CoWorkBench 73.9 berbanding 70.7 adalah kesenjangan nyata pada beban kerja agenik dan perkantoran yang justru menjadi sasaran tier flash. Angka-angka utama dari pratinjau ini — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — juga melampaui baris-baris terkait milik 27B pada tabel Alibaba. Inilah tesis dari rilis ini yang dinyatakan sebagai data: sebagian besar kemampuan penalaran dan pengodean dari lini Qwen 3.8 yang lebih besar, hanya dengan sebagian kecil dari komputasi aktif.
Pertahankan label yang menempel pada kalimat itu. Ini adalah evaluasi milik Alibaba sendiri, dari kerangka uji Alibaba sendiri, berumur satu hari dalam kasus pratinjau dan belum direplikasi untuk keduanya. Pembongkaran arsitektur KGP Talkie yang menempati peringkat untuk perbandingan ini mencapai bentuk kesimpulan yang sama, tetapi ia bekerja dari lembar vendor yang sama. Tabel vendor adalah sebuah janji; tidak ada apa pun dalam paragraf ini yang telah dikonfirmasi secara independen.
Apa yang dimiliki 27B yang tidak dimiliki Flash-Next: bukti
Di sinilah perbandingan tidak lagi timpang. Qwen3.8-27B telah dua minggu berada di ruang terbuka, dan komunitas telah menghasilkan tiga titik data independen. Di papan peringkat Image-to-WebDev milik Arena.ai — voting buta oleh manusia untuk menentukan mana dari dua keluaran anonim yang lebih ingin dirilis pengunjung — 27B menempati peringkat #1 di antara model terbuka dan #7 secara keseluruhan dengan skor yang dilaporkan sebesar 1.574. Di papan Code Arena WebDev yang sejenis, model ini berada di peringkat #9 secara keseluruhan dengan 1.595, satu-satunya model di kelas ukurannya yang masuk sepuluh besar. Harvey, perusahaan AI hukum, dan Engram menjalankan studi firma hukum sintetis yang menempatkan 27B yang diadaptasi di puncak tolok ukur agen hukum mereka — dengan catatan bahwa model tersebut telah mempelajari korpus uji sebelumnya, yang menjadikannya demonstrasi ruang penyesuaian halus (fine-tuning) alih-alih skor untuk bobot bawaan (stock weights). AMD menerbitkan pengukuran throughput Hari-0: 24,5 token/detik pada Ryzen AI Max+ 395 dan 51,8 token/detik pada Radeon AI PRO R9700. Tidak satu pun dari ini merupakan skor kualitas tujuan umum — masih belum ada indeks Artificial Analysis untuk 27B — tetapi masing-masing adalah pihak ketiga yang benar-benar menjalankan model tersebut.
Qwen3.8-Flash-Next tidak memiliki semua itu. Seluruh lembar tolok ukurnya milik Alibaba, baru berumur beberapa jam saat tulisan ini dibuat, dan tidak ada laboratorium independen yang mereproduksi satu baris pun. Itu bukan tuduhan; itu definisi rilis berumur satu hari. Tetapi justru asimetri itulah yang seharusnya memandu pilihan: pratinjaunya lebih unggul pada satu-satunya angka yang ada, dan setiap angka tersebut ditulis oleh vendor yang ingin Anda mempercayainya.
Fork penerapan
Perbedaan praktis antara kedua model ini terletak pada tempat parameter berada, dan hal itu menentukan perangkat keras yang Anda butuhkan. Qwen3.8-Flash-Next sengaja menurunkan tabel embedding N-gram 51B-nya ke memori host, di mana tabel tersebut dapat diambil lebih dahulu secara asinkron — itulah sebabnya ia menambah kapasitas 51B parameter tanpa menambah komputasi per token. Konsekuensinya, model ini tidak akan muat di kartu konsumen 24GB seperti Qwen lokal yang pernah muat sebelumnya. Perkiraan komunitas menunjukkan Q4 GGUF sekitar total 82GB (sekitar 58GB bobot utama ditambah tabel pencarian 24GB), build FP8 sekitar 186GB, BF16 sekitar 360GB; resep yang berhasil adalah mesin dengan RAM sistem sekitar 96GB ditambah GPU apa pun yang menjalankan 6B aktif. Hasilnya, komputasi per token menjadi murah — itulah taruhan utama arsitektur ini — dan konteks panjang 1M token tetap terjangkau karena lapisan GDN mengompresi riwayat alih-alih menumbuhkan cache KV.
Qwen3.8-27B adalah model yang justru sebaliknya: dense, sehingga setiap token menjalankan seluruh 27B parameter, tetapi cukup kecil sehingga semuanya muat di perangkat keras yang sudah Anda miliki. Bobot BF16-nya sekitar 55,6GB; pada 4-bit, model ini berjalan di kartu 24GB seperti RTX 3090 atau 4090, dan pengukuran AMD menunjukkan kecepatan 24,5 hingga 51,8 token/detik pada perangkat keras kelas AI Max dan Radeon PRO. Jika kendalanya adalah satu workstation, maka 27B adalah yang benar-benar muat; jika kendalanya adalah biaya per token dalam skala besar, Flash-Next adalah yang unggul di atas kertas.
Percabangan Harga
Harga API menceritakan hal yang sama dari sisi lain. {{1}}Qwen3.8-27B kini aktif di OrcaRouter dengan harga $0,33 per juta token input dan $2,40 per juta token output, harga daftar penyedia diteruskan tanpa markup — opsi self-host kini dapat digunakan, tanpa perlu membeli GPU.{{/1}} {{2}}Qwen3.8-Flash-Next belum dirutekan ke mana pun: bobot terbuka adalah satu-satunya jalur hingga Qwen3.8-Flash produksi dibuka di API QwenCloud dengan harga yang diumumkan $0,16/$0,47.{{/2}} {{3}}Saat API tersebut dibuka, pass-through yang sama akan menempatkan harga $0,16/$0,47 di sisi kami pada hari yang sama, dengan kunci yang sama seperti 27B, lengkap dengan failover otomatis di antara keduanya — jadi cara mengadopsi arsitektur yang baru berumur sehari bukanlah dengan mempertaruhkan produksi padanya, melainkan dengan mengarahkan sebagian lalu lintas ke arsitektur tersebut dan menggunakan model yang sudah terbukti sebagai cadangan.{{/3}} {{4}}Lapisan routing juga dapat menjadi pintu depan bagi model yang Anda jalankan sendiri, yang merupakan jalur praktis untuk mengevaluasi bobot terbuka Flash-Next hari ini tanpa integrasi kedua.{{/4}}

Yang mana yang harus dijalankan
Pilih Qwen3.8-Flash-Next jika Anda ingin mengikuti arah Qwen4 sekarang, jika beban kerja Anda cukup bervolume tinggi sehingga $0,16/$0,47 dibanding $0,33/$2,40 adalah angka yang nyata, atau jika Anda memiliki RAM untuk menjalankannya sendiri dan nyaman dengan lembar vendor. Pilih Qwen3.8-27B jika Anda memerlukan ketentuan Apache-2.0, satu kartu 24GB, model yang dapat Anda hubungi hari ini, atau tingkat bukti independen apa pun — itulah satu-satunya dari keduanya yang telah dijalankan oleh siapa pun di luar Alibaba.

Dua tangkapan layar di atas adalah permukaan publik dari masing-masing bagian: daftar OrcaRouter tempat Qwen3.8-27B dapat dipanggil hari ini seharga $0,33/$2,40, dan kartu model Qwen/Qwen3.8-Flash-Next di Hugging Face.
Dan penutup yang jujur adalah sebuah pertanyaan, karena basis buktinya baru berumur satu hari: dapatkah model yang mengaktifkan 6 miliar parameternya mempertahankan sapuan 21-dari-22 dalam replikasi independen, atau apakah tabel N-gram yang membuatnya melayani secara ramping juga hal yang gagal pada beban kerja nyata? 27B telah bertahan dua minggu di bawah pengawasan komunitas. Flash-Next berada di posisi yang sama dengan 27B dua minggu lalu — yang merupakan argumen terbaik untuk menjalankannya berdampingan daripada memilih salah satu.
