Qwen3.8-Flash-Next vs Qwen3.8-27B — MoE pratinjau Qwen4 melawan kuda kerja open-weights. Ilustrasi yang diregenerasi.
Guides & Insights

Qwen3.8-Flash-Next vs Qwen3.8-27B: Qwen4-preview MoE melawan kuda kerja open-weights

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal yang mengejutkan tentang Qwen3.8-Flash-Next bukanlah bahwa Alibaba mengklaim model yang hanya mengaktifkan 6 miliar parameter per token mengungguli sebagian besar model terbuka — melainkan bahwa untuk menyajikannya diperlukan lebih banyak memori daripada model padat 27 miliar parameter yang dibandingkan dengannya. Qwen3.8-Flash-Next, yang dirilis sebagai sumber terbuka pada 26 Agustus 2026 sebagai pratinjau arsitektur Qwen4, menyimpan tabel pencarian N-gram dengan 51 miliar parameter di RAM sistem, bukan di VRAM; Qw​en3.8-27B, model padat multimodal berlisensi Apache-2.0 yang diluncurkan pada pertengahan Agustus dan merupakan kuda kerja bobot terbuka generasi Qw​en 3.8 saat ini, muat pada satu kartu grafis 24GB dengan 4-bit. Pada lembar benchmark Alibaba sendiri, MoE baru mengungguli 27B pada 21 dari 22 benchmark yang dibandingkan. Pada bukti independen — penempatan arena, studi agen hukum, pengukuran throughput pihak ketiga — 27B adalah satu-satunya dari keduanya yang memiliki bukti tersebut. Kombinasi itulah yang menjadi dasar keputusan.

Perbandingan dalam satu kalimat: dua anggota open-weight, teks-plus-visi dari generasi yang sama, konteks native 262K yang sama, keduanya dirancang untuk berjalan di luar pusat data — dan terpisah oleh arsitektur, lisensi, harga, serta seberapa banyak dari cerita mereka yang terverifikasi. Qwen3.8-Flash-Next adalah MoE sparse yang mempratinjau semua hal yang diharapkan akan diwarisi Qwen4. Qwen3.8-27B adalah model dense yang memadatkan apa yang Alibaba pelajari saat membangun andalan 2.4T menjadi sesuatu yang dapat dijalankan oleh satu GPU. Memilih di antara keduanya bukan soal kemampuan — Alibaba mengatakan pratinjau ini lebih unggul — melainkan soal apakah Anda mempercayai lembar vendor yang baru berumur satu hari dibandingkan model yang sudah dibedah oleh komunitas.

Papan skor

Pertama, soal sumber: setiap angka Qwen3.8-Flash-Next di bawah ini adalah milik Alibaba sendiri, baru berumur satu hari, dan belum direproduksi. Klaim benchmark paling menonjol dari Qw​en3.8-27B juga berasal dari laporan Alibaba, tetapi 27B memiliki hasil independen — peringkat arena preferensi manusia, studi domain hukum, dan pengukuran throughput AMD — yang tidak dapat ditandingi oleh pratinjau.

Total parameter — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B tersimpan), 6B aktif. Qwen3.8-27B: ~27B dense (28B dengan encoder visi), semua aktif.

• Arsitektur — Qwen3.8-Flash-Next: pratinjau Qwen4 — Qw​en Sparse Attention bergantian dengan Gated DeltaNet, residual ber-gate, embeddings N-gram, dilatih dengan Muon. Qw​en3.8-27B: 48 lapisan attention linear GDN ditambah 16 lapisan attention penuh (3:1), padat.

• Konteks — keduanya 262.144 token native, dapat diperluas hingga 1M via YaRN.

• Modalitas — keduanya menerima input teks, gambar, dan video serta mengembalikan teks.

• Lisensi — Qwen3.8-Flash-Next: qwen-community-1.0. Qw​en3.8-27B: Apache 2.0.

• Harga — Qwen3.8-Flash-Next: $0.16 / $0.47 per 1M (diumumkan; API produksi belum dibuka). Qwen3.8-27B: $0.33 / $2.40 per 1M, tersedia hari ini.

• Kebutuhan saat dijalankan — Qwen3.8-Flash-Next: tabel 51B di RAM host, ~96GB memori sistem plus GPU apa pun; FP8 ~186GB, Q4 GGUF ~82GB. Qwen3.8-27B: BF16 ~55.6GB, 4-bit muat di kartu 24GB.

• Bukti independen — Qwen3.8-Flash-Next: belum ada. Qw​en3.8-27B: model terbuka #1 di Arena.ai Image-to-WebDev, #9 keseluruhan di Code Arena WebDev, open-weight #1 pada benchmark Harvey's Legal Agent, throughput terukur AMD.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

Berdasarkan angka milik Alibaba sendiri, versi preview unggul di hampir semua hal.

Perbandingan yang dipublikasikan Alibaba menunjukkan Qwen3.8-Flash-Next memperoleh skor setara atau lebih baik pada 21 dari 22 tolok ukur bahasa dan visi dibandingkan Qw​en3.8-27B, dan kemenangan ini bukan sekadar kosmetik. SWE-bench Pro 62.5 berbanding 61.7 adalah keunggulan tipis, tetapi DeepSWE 58.7 berbanding 42.2, JobBench 55.7 berbanding 33.4, dan CoWorkBench 73.9 berbanding 70.7 adalah kesenjangan nyata pada beban kerja agenik dan perkantoran yang justru menjadi sasaran tier flash. Angka-angka utama dari pratinjau ini — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — juga melampaui baris-baris terkait milik 27B pada tabel Alibaba. Inilah tesis dari rilis ini yang dinyatakan sebagai data: sebagian besar kemampuan penalaran dan pengodean dari lini Qw​en 3.8 yang lebih besar, hanya dengan sebagian kecil dari komputasi aktif.

Pertahankan label yang menempel pada kalimat itu. Ini adalah evaluasi milik Alibaba sendiri, dari kerangka uji Alibaba sendiri, berumur satu hari dalam kasus pratinjau dan belum direplikasi untuk keduanya. Pembongkaran arsitektur KGP Talkie yang menempati peringkat untuk perbandingan ini mencapai bentuk kesimpulan yang sama, tetapi ia bekerja dari lembar vendor yang sama. Tabel vendor adalah sebuah janji; tidak ada apa pun dalam paragraf ini yang telah dikonfirmasi secara independen.

Apa yang dimiliki 27B yang tidak dimiliki Flash-Next: bukti

Di sinilah perbandingan tidak lagi timpang. Qw​en3.8-27B telah dua minggu berada di ruang terbuka, dan komunitas telah menghasilkan tiga titik data independen. Di papan peringkat Image-to-WebDev milik Arena.ai — voting buta oleh manusia untuk menentukan mana dari dua keluaran anonim yang lebih ingin dirilis pengunjung — 27B menempati peringkat #1 di antara model terbuka dan #7 secara keseluruhan dengan skor yang dilaporkan sebesar 1.574. Di papan Code Arena WebDev yang sejenis, model ini berada di peringkat #9 secara keseluruhan dengan 1.595, satu-satunya model di kelas ukurannya yang masuk sepuluh besar. Harvey, perusahaan AI hukum, dan Engram menjalankan studi firma hukum sintetis yang menempatkan 27B yang diadaptasi di puncak tolok ukur agen hukum mereka — dengan catatan bahwa model tersebut telah mempelajari korpus uji sebelumnya, yang menjadikannya demonstrasi ruang penyesuaian halus (fine-tuning) alih-alih skor untuk bobot bawaan (stock weights). AMD menerbitkan pengukuran throughput Hari-0: 24,5 token/detik pada Ryzen AI Max+ 395 dan 51,8 token/detik pada Radeon AI PRO R9700. Tidak satu pun dari ini merupakan skor kualitas tujuan umum — masih belum ada indeks Artificial Analysis untuk 27B — tetapi masing-masing adalah pihak ketiga yang benar-benar menjalankan model tersebut.

Qwen3.8-Flash-Next tidak memiliki semua itu. Seluruh lembar tolok ukurnya milik Alibaba, baru berumur beberapa jam saat tulisan ini dibuat, dan tidak ada laboratorium independen yang mereproduksi satu baris pun. Itu bukan tuduhan; itu definisi rilis berumur satu hari. Tetapi justru asimetri itulah yang seharusnya memandu pilihan: pratinjaunya lebih unggul pada satu-satunya angka yang ada, dan setiap angka tersebut ditulis oleh vendor yang ingin Anda mempercayainya.

Fork penerapan

Perbedaan praktis antara kedua model ini terletak pada tempat parameter berada, dan hal itu menentukan perangkat keras yang Anda butuhkan. Qwen3.8-Flash-Next sengaja menurunkan tabel embedding N-gram 51B-nya ke memori host, di mana tabel tersebut dapat diambil lebih dahulu secara asinkron — itulah sebabnya ia menambah kapasitas 51B parameter tanpa menambah komputasi per token. Konsekuensinya, model ini tidak akan muat di kartu konsumen 24GB seperti Qwen lokal yang pernah muat sebelumnya. Perkiraan komunitas menunjukkan Q4 GGUF sekitar total 82GB (sekitar 58GB bobot utama ditambah tabel pencarian 24GB), build FP8 sekitar 186GB, BF16 sekitar 360GB; resep yang berhasil adalah mesin dengan RAM sistem sekitar 96GB ditambah GPU apa pun yang menjalankan 6B aktif. Hasilnya, komputasi per token menjadi murah — itulah taruhan utama arsitektur ini — dan konteks panjang 1M token tetap terjangkau karena lapisan GDN mengompresi riwayat alih-alih menumbuhkan cache KV.

Qwen3.8-27B adalah model yang justru sebaliknya: dense, sehingga setiap token menjalankan seluruh 27B parameter, tetapi cukup kecil sehingga semuanya muat di perangkat keras yang sudah Anda miliki. Bobot BF16-nya sekitar 55,6GB; pada 4-bit, model ini berjalan di kartu 24GB seperti RTX 3090 atau 4090, dan pengukuran AMD menunjukkan kecepatan 24,5 hingga 51,8 token/detik pada perangkat keras kelas AI Max dan Radeon PRO. Jika kendalanya adalah satu workstation, maka 27B adalah yang benar-benar muat; jika kendalanya adalah biaya per token dalam skala besar, Flash-Next adalah yang unggul di atas kertas.

Percabangan Harga

Harga API menceritakan hal yang sama dari sisi lain. {{1}}Qw​en3.8-27B kini aktif di OrcaRouter dengan harga $0,33 per juta token input dan $2,40 per juta token output, harga daftar penyedia diteruskan tanpa markup — opsi self-host kini dapat digunakan, tanpa perlu membeli GPU.{{/1}} {{2}}Qwen3.8-Flash-Next belum dirutekan ke mana pun: bobot terbuka adalah satu-satunya jalur hingga Qwen3.8-Flash produksi dibuka di API QwenCloud dengan harga yang diumumkan $0,16/$0,47.{{/2}} {{3}}Saat API tersebut dibuka, pass-through yang sama akan menempatkan harga $0,16/$0,47 di sisi kami pada hari yang sama, dengan kunci yang sama seperti 27B, lengkap dengan failover otomatis di antara keduanya — jadi cara mengadopsi arsitektur yang baru berumur sehari bukanlah dengan mempertaruhkan produksi padanya, melainkan dengan mengarahkan sebagian lalu lintas ke arsitektur tersebut dan menggunakan model yang sudah terbukti sebagai cadangan.{{/3}} {{4}}Lapisan routing juga dapat menjadi pintu depan bagi model yang Anda jalankan sendiri, yang merupakan jalur praktis untuk mengevaluasi bobot terbuka Flash-Next hari ini tanpa integrasi kedua.{{/4}}

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

Yang mana yang harus dijalankan

Pilih Qwen3.8-Flash-Next jika Anda ingin mengikuti arah Qwen4 sekarang, jika beban kerja Anda cukup bervolume tinggi sehingga $0,16/$0,47 dibanding $0,33/$2,40 adalah angka yang nyata, atau jika Anda memiliki RAM untuk menjalankannya sendiri dan nyaman dengan lembar vendor. Pilih Qw​en3.8-27B jika Anda memerlukan ketentuan Apache-2.0, satu kartu 24GB, model yang dapat Anda hubungi hari ini, atau tingkat bukti independen apa pun — itulah satu-satunya dari keduanya yang telah dijalankan oleh siapa pun di luar Alibaba.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

Dua tangkapan layar di atas adalah permukaan publik dari masing-masing bagian: daftar OrcaRouter tempat Qw​en3.8-27B dapat dipanggil hari ini seharga $0,33/$2,40, dan kartu model Qwen/Qwen3.8-Flash-Next di Hugging Face.

Dan penutup yang jujur adalah sebuah pertanyaan, karena basis buktinya baru berumur satu hari: dapatkah model yang mengaktifkan 6 miliar parameternya mempertahankan sapuan 21-dari-22 dalam replikasi independen, atau apakah tabel N-gram yang membuatnya melayani secara ramping juga hal yang gagal pada beban kerja nyata? 27B telah bertahan dua minggu di bawah pengawasan komunitas. Flash-Next berada di posisi yang sama dengan 27B dua minggu lalu — yang merupakan argumen terbaik untuk menjalankannya berdampingan daripada memilih salah satu.