Kartu judul hero untuk perbandingan 'MiniCPM5-2B-DSpark vs Qwen3-8B' dengan subjudul 'Tumpukan on-device 2.5B baru vs pekerja keras open-weights', menampilkan garis luar ponsel di kiri berisi chip kecil berlabel '2.5B + draft' dan rak server di kanan berlabel '8B workhorse', dengan meteran bandwidth memori di antara keduanya dan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

MiniCPM5-2B-DSpark vs Qwen3-8B: Stack On-Device 2.5B Terbaru vs Pekerja Andal Open-Weights

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Setiap perbandingan model menyembunyikan pertanyaan perangkat keras, dan MiniCPM5-2B-DSpark versus Qwen3-8B adalah pertanyaan itu yang mengenakan kostum tolok ukur. Qwen3-8B adalah kuda kerja open-weights andalan Alibaba pada April 2025 — sekitar 8,2 miliar parameter padat, 119 bahasa, konteks asli 32K yang dapat diperluas hingga 131K, mode berpikir hibrida, dan enam belas bulan bukti komunitas di belakangnya. MiniCPM5-2B-DSpark bukanlah model mandiri untuk disejajarkan dengannya: ia adalah checkpoint draf DSpark dengan 323,8 juta parameter yang OpenBMB unggah secara senyap ke Hugging Face pada 6 September 2026 untuk mempercepat MiniCPM5-2B, model on-device padat 2,52 miliar yang diumumkan ModelBest di WAIC pada 19 Juli 2026. Gabungkan pasangan itu dan pertanyaan sebenarnya muncul: haruskah beban kerja yang saat ini berjalan di 8B berjalan pada perangkat keras yang hanya mampu membawa 2B — dan apakah 2,5B dengan draf gratis cukup baik untuk melakukan perpindahan?

Jawaban singkatnya adalah belum untuk sebagian besar beban kerja, tetapi alasannya lebih sempit daripada yang disiratkan oleh kesenjangan ukuran, dan ada satu kelas penerapan di mana 8B tidak punya jawaban sama sekali. Semua hal kuantitatif dalam tulisan ini dilaporkan oleh vendor — angka MiniCPM adalah milik ModelBest sendiri yang belum direproduksi; angka Qwen3-8B adalah milik Alibaba yang sudah lama digunakan komunitas — jadi label lebih penting daripada angka-angkanya.

Dua model di tempat yang berbeda pada kurva memori.

MiniCPM5-2B adalah Transformer kausal padat dengan ukuran sepertiga dari model 8B — 42 lapisan, grouped-query attention, Apache-2.0 — dibangun untuk kelas perangkat yang tidak dapat dijangkau model besar: ponsel, kokpit pintar, dan kotak edge kecil yang bus memorinya akan tersedak oleh delapan miliar bobot. Materi peluncurannya menekankan kerja agenik dan konteks panjang daripada luas cakupan mentah: konteks native 128K, dan klaim ModelBest bahwa pada rangkaian evaluasinya sendiri model ini rata-rata 53.9 — SOTA open-source kelas 2B, menurut vendor, termasuk 46.4 pada SWE-bench Verified yang dijalankan vendor, yang akan menjadi luar biasa untuk model 2B jika mampu bertahan dalam pengujian independen. Draf DSpark adalah jawaban throughput atas keberatan yang jelas bahwa model padat kecil cepat dimuat tetapi lambat menghasilkan, karena setiap token menyeret bobotnya melintasi bus memori. Draf tersebut mengusulkan hingga tujuh token sekaligus untuk diverifikasi oleh target, dan repositori melaporkan penerimaan greedy sebanyak 5.52 token per langkah verifikasi secara agregat — 6.11 pada kode. Angka itu adalah kualitas draf; percepatannya belum diukur, dan tidak ada angka token per detik yang dipublikasikan.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Kartu openbmb/MiniCPM5-2B-DSpark di atas adalah seluruh permukaan publik dari rilis 6 September yang tenang: sebuah aksesori serving yang melaporkan panjang penerimaan, tanpa pengumuman dan tanpa percepatan waktu nyata.

Qwen3-8B adalah keluarga arsitektur yang sama, tiga kali lebih besar dan enam belas bulan lebih tua. Model ini merupakan Transformer kausal padat dengan grouped-query attention, dilatih pada korpus multibahasa 36-triliun-token, berlisensi Apache-2.0, dan salah satu model 8B yang paling banyak di-hosting sendiri dan disajikan di dunia open-weights. Ciri khasnya adalah mode penalaran hibrida Qwen3 — berpikir aktif atau nonaktif per permintaan — dan profilnya memang dirancang luas: MMLU di kisaran 70-an atas, hasil GSM8K dan coding yang kuat, 119 bahasa. Model ini membutuhkan GPU sungguhan atau perangkat edge yang tangguh: pada kuantisasi praktis, ia berjalan dalam kisaran beberapa gigabyte rendah, nyaman di satu kartu kelas menengah, tetapi tidak di ponsel.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

Kartu model Qwen3-8B milik Alibaba di atas adalah wajah dari pemain mapan: enam belas bulan perilaku terdokumentasi yang telah teruji oleh komunitas dalam 119 bahasa.

Di mana 8B masih menang

Turun satu kelas bobot dan Anda melepaskan tiga hal konkret. Bahasa dulu: Qwen3-8B mencakup 119 bahasa; kartu dan dataset MiniCPM5-2B berpusat pada bahasa Inggris dan Tionghoa, dan tidak ada klaim cakupan multibahasa. Untuk produk yang melayani banyak bahasa ekor panjang, itu adalah tembok keras, bukan tembok lunak. Kedua, bukti: angka-angka Qwen3-8B telah diuji, dikuantisasi, disetel halus, dan dilayani dalam skala besar selama enam belas bulan; mode kegagalannya diketahui, kuantisasinya ada, ekosistemnya ada di mana-mana. MiniCPM5-2B adalah rilis Juli 2026 dengan papan skor yang dikelola vendor dan tanpa reproduksi independen, dan drafnya baru berumur satu hari. Ketiga, tumpukan penyajian: semua yang sudah terhubung dengan Qwen3-8B — vLLM, SGLang, llama.cpp, ribuan fine-tune — terhubung dengan target yang matang, sedangkan draf MiniCPM memerlukan pembangunan mesin decoding spekulatif (algoritma DSPARK milik SGLang) yang didokumentasikan repositori tetapi belum diserap oleh ekosistem yang lebih luas.

Di mana stack 2B adalah satu-satunya opsi.

Semua itu tidak penting pada kelas perangkat di mana model 8B memang tidak muat. Di ponsel atau papan edge dengan DRAM beberapa gigabyte, Qwen3-8B tidak bersaing dengan MiniCPM5-2B — model itu sama sekali tidak dapat digunakan pada kecepatan yang berguna. Itulah seluruh alasan mengapa tumpukan 2B ada, dan itulah mengapa draf menjadi bagian penahan beban dari rilis ini, bukan sekadar hiasan. Decoding spekulatif paling efektif justru pada rezim padat yang terikat memori tempat model kecil hidup di silikon kecil: drafter yang ringkas mengusulkan sebuah blok, target memverifikasinya dalam satu lintasan, dan biaya pemuatan bobot dibayar sekali per blok, bukan sekali per token. Metode DSpark yang berasal dari DeepSeek (arXiv 2607.05147) dirancang untuk sistem penyajian dengan konkurensi tinggi, tetapi mekanismenya — dan angka penerimaan di repositori ini — adalah tuas yang relevan untuk model 2B yang harus terasa interaktif pada perangkat dengan sumber daya terbatas. Tetaplah ingat catatan jujur ini: OpenBMB mengukur penerimaan draf, bukan percepatannya, jadi perolehan token per detik aktual pada perangkat target Anda tetap menjadi tugas Anda untuk mengukurnya.

Papan skor, yang diberi label dengan jujur.

• Rilis — MiniCPM5-2B: 19 Juli 2026 (diumumkan); MiniCPM5-2B-DSpark: 6 September 2026, diam-diam. Qwen3-8B: April 2025, diumumkan.

• Ukuran — MiniCPM5-2B: 2.52B dense, ditambah draft 324M. Qwen3-8B: ~8.2B dense.

• Konteks — MiniCPM5-2B: 128K asli. Qwen3-8B: 32K asli, 131K melalui YaRN.

• Bahasa — MiniCPM5-2B: berpusat pada bahasa Inggris/Mandarin. Qwen3-8B: 119.

• Penalaran — MiniCPM5-2B: mode hibrida cepat/cermat sesuai materi peluncuran. Qwen3-8B: berpikir aktif atau nonaktif sesuai permintaan.

• Bukti — Angka MiniCPM adalah klaim pada kartu ModelBest (rata-rata 53.9 pada suite miliknya sendiri; tidak ada pengujian independen). Angka Qwen3-8B dilaporkan Alibaba dan telah terpapar komunitas selama enam belas bulan.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

Papan skor di atas adalah ketidaksesuaian yang digambarkan secara jujur: kolom-kolomnya berbeda pada hampir semua hal kecuali lisensi terbuka Apache-2.0, dan kelas perangkat yang Anda tuju menentukan kolom mana yang bahkan boleh Anda pilih.

Realita Routing

Saat ini, tidak satu pun dari kedua model ini berada dalam katalog yang di-hosting di OrcaRouter, sehingga perbandingan ini sepenuhnya berada dalam dunia self-hosted — tetapi justru di situlah lapisan perutean masih menunjukkan kegunaannya. Qwen3-8B dilayani oleh vendornya dan beberapa platform pihak ketiga; MiniCPM5-2B beserta drafnya adalah sesuatu yang Anda jalankan sendiri. Ketika sebuah tim ingin menguji apakah tumpukan 2.5B dapat mengemban sebagian beban kerja 8B, langkah yang dapat dibalik adalah mengarahkan jalur pengujian ke build SGLang MiniCPM5-2B-plus-draft yang di-hosting sendiri melalui satu API dengan failover otomatis — produksi tetap berada pada model yang sudah ada, tumpukan baru dapat berhenti tanpa menjatuhkan apa pun, dan harga daftar penyedia untuk keseluruhan perbandingan ini diteruskan dengan markup 0%, sehingga pengujian A/B ini murah dan dapat dibalik, bukan sebuah taruhan. Lapisan ini tidak meng-hosting model mana pun; ia membuat eksperimen tersebut aman untuk dijalankan.

Siapa yang harus bergerak, dan siapa yang harus menunggu.

Tetap gunakan Qwen3-8B untuk segala hal multibahasa, apa pun yang membutuhkan enam belas bulan perilaku yang diketahui, atau beban kerja apa pun yang sudah dilayani pada perangkat keras yang menjalankan 8B dengan nyaman — kesenjangan ukuran bukan alasan untuk migrasi, dan kesenjangan bukti justru menentangnya. Uji sungguh-sungguh tumpukan MiniCPM5-2B dengan draf DSpark-nya hanya jika perangkat target Anda tidak mampu menjalankan 8B sama sekali, atau jika 2.5B yang mampu mengimbangi tugas agentic dan konteks panjang dapat memangkas memori dan daya pada perangkat keras yang sudah Anda kirim. Dan sebelum Anda berkomitmen pada draf tersebut, jalankan pengukuran yang tidak dipublikasikan OpenBMB: panjang penerimaan bukanlah latensi, dan perolehan token per detik pada perangkat Anda adalah angka yang benar-benar menentukan apakah checkpoint kecil yang tenang di Hugging Face itu layak diunduh.