Kenali Qwen3.8-Flash — MoE multimodal berbobot terbuka yang mempratinjau arsitektur Qwen4. Ilustrasi regenerasi.
Guides & Insights

Meet Qwen3.8-Flash: model multimodal MoE open-weight yang mempratinjau arsitektur Qwen4 — $0,15/$0,47 per 1M token di QwenCloud

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 26 Agustus 2026, tim Qwen merilis bobot di balik Qwen3.8-Flash secara open-source — dirilis di Hugging Face dan ModelScope dengan nama Qwen3.8-Flash-Next — dan meluncurkan model produksi yang menyandang nama Qwen3.8-Flash di API QwenCloud, mengonfirmasi harga resminya keesokan harinya. Angka utamanya — yang secara resmi dikonfirmasi dalam pengumuman Alibaba sendiri pada 28 Agustus — adalah mixture-of-experts multimodal dengan 125 miliar parameter yang hanya mengaktifkan sekitar 6 miliar parameter per token, dengan sparsity sekitar 95%, dibangun di atas arsitektur yang Alibaba gambarkan secara eksplisit sebagai pratinjau awal dari generasi Qwen4. API produksinya telah aktif di QwenCloud dengan harga $0.15 per juta token input, $0.47 per juta token output, dan $0.016 per juta untuk cache hits — cara termurah untuk menjalankan sesuatu yang secara struktural merupakan turunan dari produk unggulan Alibaba berikutnya, dan pertama kalinya lab tersebut merilis pratinjau arsitektur sebagai bobot terbuka publik sebelum keluarga model lengkapnya ada.

Satu angka memiliki bobot lebih besar daripada seluruh lembar spesifikasi: 6B. Qwen3.8-Flash tidak mendapatkan kemampuannya dari ukuran besar — ia mendapatkannya dari tempat ia menempatkan komputasi. Badan MoE 125B, tabel embedding N-gram 51B, dan modul prediksi multi-token kecil menyimpan hampir 180B parameter di disk, namun setiap token hanya melewati 6B di antaranya. Itulah taruhan yang menjadi sandaran seluruh rilis ini, dan itulah alasan biaya pelatihan turun begitu jauh.

Apa yang sebenarnya dirilis

Qwen3.8-Flash, tanpa sufiks, adalah model produksi yang kini aktif di API QwenCloud dan di dalam produk Qw​en Office milik Alibaba; ia dilengkapi dengan konteks default 1M-token dan alat bawaan, dengan harga $0.15/$0.47 per juta token, dan cache hits sebesar $0.016. Pada 28 Agustus, daftar ketersediaan diperluas: menurut pengumuman Alibaba, Qwen3.8-Flash kini juga dapat diakses melalui OpenCode Go, langganan tarif tetap dari agen pengkodean terminal sumber terbuka — daftar model OpenCode sendiri mencantumkannya sebagai qwen3.8-flash dengan tarif per juta yang sama, $0.15/$0.47.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

Pengumuman resmi Qw​en Studio membingkai rilis open-weights ini sebagai undangan bagi ekosistem: kirimkan perubahan struktural lebih awal sehingga komunitas dan tumpukan inferensi dapat beradaptasi sebelum jajaran Qwen4 lengkap dibangun. Tanda pertama yang berhasil adalah SGLang — mesin inferensi yang didukung LMSYS — menerbitkan dukungan day-0 untuk Qwen3.8-Flash-Next pada hari yang sama, dengan model tersebut juga dikonfigurasi untuk Transformers, vLLM, dan TokenSpeed.

Arsitektur adalah ceritanya.

Ini bukan model generasi Qw​en 3.8 yang diperkecil. Qwen3.8-Flash memperkenalkan empat perubahan yang, menurut tim, akan diwarisi oleh keluarga Qwen4, dan masing-masing menargetkan hambatan yang berbeda.

• Atensi — Gated DeltaNet plus Qwen Sparse Attention. Gated DeltaNet (GDN) memampatkan riwayat menjadi status berukuran tetap di tiga dari setiap empat lapisan, sehingga model tidak membaca ulang semuanya di setiap langkah; QSA kemudian memperlakukan konteks panjang sebagai masalah pencarian — pengindeks ringan menggabungkan urutan menjadi blok-blok mikro, menilai tingkat kepentingan blok, dan mengarahkan perhatian ke wilayah yang paling relevan. Pada pengukuran Alibaba, kernel atensi QSA mencapai hingga 7,6× lebih cepat prefill dan 4,9× lebih cepat decode pada konteks 1M-token (dilaporkan vendor).

Residual — Residual Berpagar. Aliran residual tunggal menjadi empat cabang paralel dengan penggatingan per elemen, memungkinkan jaringan memutuskan per token berapa banyak yang dibaca dan ditulis pada setiap cabang; satu cabang berkembang menjadi saluran jarak jauh yang menghubungkan lapisan perhatian awal ke lapisan dalam. Status residual disimpan dalam FP8 untuk mengurangi bandwidth memori.

• Embedding — Embedding N-gram. Tabel pencarian berparameter 51B yang dikunci pada token saat ini serta beberapa token sebelumnya. Ini menambah kapasitas tanpa menambah komputasi per-token, dan karena tabel dapat berada di memori host serta di-prefetch secara asinkron, tabel ini tidak menempati memori GPU secara permanen.

• Optimizer — Muon. Parameter linear 2D yang besar (attention, GDN, ahli MoE) dilatih dengan Muon, sementara embedding, router, dan bagian low-rank Gated Residual tetap menggunakan AdamW; tim menyesuaikan kembali hukum penskalaan untuk arsitektur baru berdasarkan campuran tersebut.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Bagi pengembang, dua hal ini langsung penting: attention stack adalah alasan mengapa konteks 1M-token bisa menjadi bawaan standar, bukan sekadar target ambisius, dan tabel N-gram adalah alasan mengapa model 125B tetap bisa disajikan secara ramping. Sisanya adalah materi pratinjau untuk Qwen4 — persis seperti itulah cara Alibaba memposisikannya.

Lembar tolok ukur yang berlabel jujur

Setiap angka di bagian ini adalah evaluasi Alibaba sendiri, berumur satu hari dan belum direproduksi oleh laboratorium independen mana pun pada saat penulisan. Anggap saja sebagai klaim indikatif, bukan skor final. Pada rangkaian pengujian Alibaba, Qwen3.8-Flash-Next (6B aktif) mencatat SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5, dan MathVision 95.7, dengan skor JobBench 55.7 — dan varian dasarnya, Qwen3.8-Flash-Next-Base, dilaporkan sebagai model open-source terbaik pada 8 dari 14 benchmark dalam pengujian head-to-head, termasuk MMLU-Pro, SuperGPQA, BBH, dan MMMU.

Klaim Alibaba soal penempatan model dalam keluarga produknya harus diberi label sebagaimana adanya — klaim. Perusahaan mengatakan Qwen3.8-Flash mengalahkan Claude Opus 4.6 dengan 9,1 poin pada SWE-bench Pro dan sekitar 20 poin pada JobBench, serta mendekati Claude Opus 4.8. Semua dilaporkan oleh vendor, semua belum direproduksi. Yang bisa diverifikasi secara independen saat ini lebih sempit: bobot model sudah dirilis, tumpukan inferensi sudah bisa menjalankannya, dan SGLang meluncurkan dukungan pada hari yang sama. Reproduksi independen dari lembar tolok ukur tinggal beberapa hari lagi, bukan beberapa minggu.

Berapa biayanya

Penetapan harga adalah bagian termudah untuk diverifikasi, karena ini adalah harga yang dipublikasikan, bukan sebuah tolok ukur — dan pada 27 Agustus Alibaba mengonfirmasi tarif QwenCloud produksi secara resmi: $0,15 per juta token input, $0,47 per juta token output, dan $0,016 per juta untuk cache hits, dengan tarif domestik Tiongkok sebesar ¥0,8/¥2,7/¥0,1. Angka cache hit adalah yang penting untuk beban kerja agen: agen konteks panjang yang membaca ulang riwayat besar di setiap giliran hanya membayar sedikit untuk pembacaan berulang, yang merupakan beban kerja yang justru menjadi target dari tumpukan perhatian Qwen4-preview. Pemberitaan pers Tiongkok segera membandingkan harga utama dengan pesaing — kira-kira sepertiga dari tarif yang dikenakan DeepSeek-V4-Flash, dan hanya angka pembulatan dibandingkan dengan model tertutup kelas atas. Dalam perhitungan Alibaba sendiri, biaya pelatihan sekitar sepersembilan dari Qwen3.7-Plus, dan daya ungkit struktural itulah yang membuat harga API bisa berada di titik tersebut.

Di samping keluarga Qw​en 3.8 lainnya, kesenjangannya sangat mencolok: Qwen3.8-Max andalannya dikenakan biaya $2.00 dan $6.00 per juta token, dan sudah aktif di OrcaRouter dengan harga daftar penyedia tanpa markup. Sekarang API Qwen3.8-Flash produksi sudah terbuka, pass-through yang sama berlaku untuk tarif resmi $0.15/$0.47 dan tarif cache-hit $0.016 — lapisan routing adalah perbedaan antara membaca tentang penurunan harga dan memilikinya dalam konfigurasi. Kedua model di belakang satu kunci, failover di antara keduanya, tanpa kontrak kedua.

Apa arti "pratinjau Qwen4"

Baca pengumumannya secara harfiah dan taruhannya jelas: ini bukan tier baru dari Qwen 3.8 — ini arsitektur Qwen4 yang dirilis lebih awal, di bawah merek pelindung dari model yang lebih kecil dan lebih murah. Alasan untuk melakukan itu masuk akal: framework, kuantisasi, dan pola deployment butuh waktu untuk matang, dan model dengan 6B aktif adalah cara murah bagi komunitas untuk melakukan stress-test GDN + QSA dalam skala besar sebelum Alibaba membangun hal yang mahal di atasnya. Sisi sebaliknya adalah bahwa Qwen3.8-Flash produksi adalah API yang dibangun di atas arsitektur yang masih diaudit oleh ekosistem yang lebih luas. Pengadopsi awal, secara konstruksi, adalah set pengujian.

Jalur cepat untuk mencobanya

Hari ini Anda memiliki empat opsi realistis. {{1}}Self-host bobot terbuka melalui vLLM, SGLang, Transformers, atau TokenSpeed — build FP8 adalah pilihan pertama yang masuk akal untuk apa pun di bawah satu node penuh.{{/1}} {{2}}Panggil API QwenCloud, yang kini aktif dengan tarif resmi $0.15/$0.47 dan cache hit sebesar $0.016.{{/2}} {{3}}Gunakan di dalam OpenCode Go, langganan tarif datar dari agen pengkodean terminal sumber terbuka, yang menambahkan Qwen3.8-Flash minggu ini (diumumkan oleh Alibaba pada 28 Agustus, dikonfirmasi di daftar model OpenCode sendiri).{{/3}} {{4}}Atau panggil Flash produksi melalui router dengan cara yang sama seperti Anda memanggil Qwen3.8-Max, dengan tarif resmi diteruskan tanpa markup — tanpa integrasi khusus yang perlu dirawat.{{/4}}

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

Pertanyaan terbuka adalah pertanyaan yang jujur: dapatkah model yang mengaktifkan 6 miliar parameternya bertahan dalam produksi di berbagai macam beban kerja, atau akankah lembar patokan yang hari ini tampak baru masih akan tampak baru dalam sebulan? Itu bukan alasan untuk menunggu — itu adalah alasan untuk menaruhnya di belakang failover daripada di depan seluruh stack Anda. Bobotnya sudah dirilis, harganya sudah ditetapkan, dan arsitekturnya adalah arah yang dinyatakan Alibaba. Beberapa minggu ke depan akan menentukan apakah 6B sudah cukup.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube