Kartu judul hero untuk 'MiniCPM5-2B vs Qwen 3 8B', dengan subjudul 'Bisakah beban kerja model andalan 8B diturunkan ke 2.5B?', tiga chip bertuliskan '2.5B vs ~8.2B', '119 bahasa vs EN/ZH', dan '16 bulan bukti vs 1 minggu', serta pita atas 'PERTARUNGAN OPEN-WEIGHTS · SEPT 2026'.
Guides & Insights

MiniCPM5-2B vs Qwen 3 8B: Haruskah Beban Kerja 8B Turun ke 2.5B?

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Setiap perbandingan model menyembunyikan pertanyaan tentang perangkat keras, dan MiniCPM5-2B versus Qwen 3 8B adalah pertanyaan itu yang mengenakan kostum tolok ukur. Qwen 3 8B adalah kuda kerja open-weights Alibaba dari April 2025 — sekitar 8,2 miliar parameter padat, 119 bahasa, mode berpikir hibrida yang bisa dinyalakan atau dimatikan per permintaan, dan enam belas bulan bukti dari komunitas di belakangnya. MiniCPM5-2B adalah model yang diumumkan ModelBest dan OpenBMB di Konferensi Kecerdasan Artifisial Dunia pada 19 Juli sebagai model sub-4B peringkat teratas di papan peringkat Artificial Analysis, yang open weights-nya secara diam-diam mulai tersedia di Hugging Face pada 6 dan 7 September. Pertanyaan yang sebenarnya mempertemukan keduanya dalam satu halaman adalah pertanyaan yang pada suatu titik pernah ditanyakan sebagian besar tim yang menjalankan open 8B: bisakah beban kerja yang saya layani di 8B dipindahkan ke 2,5B — dan jika bisa, apa yang akan saya korbankan?

Jawaban singkatnya adalah belum untuk sebagian besar beban kerja, tetapi alasannya lebih sempit daripada yang tersirat oleh kesenjangan ukuran empat kali lipat, dan ada satu kelas penerapan di mana 8B tidak punya jawaban sama sekali. Semua hal kuantitatif di bawah ini dilaporkan oleh vendor dan diberi label demikian: angka MiniCPM5-2B adalah klaim kartu milik ModelBest sendiri, baru berumur satu minggu dan belum direproduksi oleh siapa pun di luar lab; angka Qwen 3 8B adalah milik Alibaba, yang sejak lama telah diuji, dikuantisasi, dan dijalankan ulang oleh komunitas besar. Asimetri bukti itulah yang menjadi sorotan utama dalam perbandingan ini.

Enam belas bulan Qwen 3 8B

Qwen 3 8B berada dalam keluarga arsitektur yang sama, tiga kali lebih besar dan enam belas bulan lebih tua daripada lawannya. Model ini adalah transformer kausal padat dengan grouped-query attention, dilatih sebelumnya pada korpus multibahasa dengan sekitar 36 triliun token, berlisensi Apache-2.0, dan merupakan salah satu model 8B yang paling banyak di-host secara mandiri dan disajikan sebagai layanan di dunia open-weights. Ciri khasnya adalah mode penalaran hibrida Qwen3 — mode berpikir aktif atau nonaktif per permintaan, yang memungkinkan satu deployment menjawab pertanyaan cepat dengan sigap dan beralih ke rantai pemikiran yang cermat untuk matematika atau kode. Model ini menghadirkan Model Context Protocol native dan function calling, konteks native 32K yang divalidasi Alibaba hingga 131K melalui penskalaan YaRN, serta mencakup 119 bahasa dan dialek. Setelah enam belas bulan, mode kegagalannya telah terdokumentasi, kuantisasinya tersedia di mana-mana, dan tumpukan serving di sekitarnya — vLLM, SGLang, llama.cpp, seribu fine-tune — sudah matang. Pada kuantisasi yang praktis, model ini berjalan dalam hitungan gigabyte rendah, nyaman di satu GPU kelas menengah, bukan di ponsel.

Screenshot of the Hugging Face model card for Qwen/Qwen3-8B, showing the Qwen org header, the Apache-2.0 license tag, Transformers and Safetensors tags, and the opening of the model card describing Qwen3's seamless switching between thinking mode and non-thinking mode within a single model (captured September 7, 2026).

Apa yang diklaim MiniCPM5-2B ke dalam dunia itu

MiniCPM5-2B hadir dari arah yang berlawanan: kecil secara desain, bersifat agen melalui pelatihan. Ia adalah transformer padat dengan total 2,52 miliar parameter (1,98 miliar non-embedding), 42 lapisan dengan hidden size 2048, grouped-query attention, arsitektur LlamaForCausalLM standar tanpa kernel khusus, dan jendela konteks 131.072 token dalam konfigurasi yang dirilis (materi peluncuran Juli mengklaim 512K; konfigurasi rilis tidak memuatnya). Sementara Qwen 3 8B memperoleh keluasan dari pralatihan multibahasa dengan 36 triliun token, MiniCPM5-2B memperoleh bentuknya dari pasca-pelatihan: SFT pada 400 miliar token data pemikiran mendalam, lalu distilasi on-policy yang memadatkan enam belas model pakar RL, lima di antaranya bersifat agen, kembali menjadi satu jaringan padat kecil. Tawaran peluncurannya adalah basis agen on-device — pemanggilan alat asli melalui panggilan bergaya XML, adaptasi hari pertama di sembilan keluarga chip plus ARM, serta mode cepat/deliberatif hibrida — dan kartu model mengklaim rata-rata internal 53,9 pada set pembanding 2B-4B pilihan vendor, AIME 2025/2026 sebesar 86,5, serta skor 46,4 yang dijalankan vendor pada SWE-bench Verified, yang akan menjadi luar biasa untuk model 2,5 miliar jika ia bertahan dalam pengujian independen.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Ketidaksesuaian, dimensi demi dimensi

• Rilis — MiniCPM5-2B: diumumkan pada 19 Juli 2026; bobot tersedia pada 6-7 September. Qwen 3 8B: diumumkan pada April 2025.

• Ukuran — MiniCPM5-2B: total 2,52 miliar / non-embedding 1,98 miliar, padat. Qwen 3 8B: ~8,2 miliar padat.

• Konteks — MiniCPM5-2B: 131,072 token dalam konfigurasi bawaan. Qwen 3 8B: 32K asli, 131K tervalidasi melalui YaRN.

• Bahasa — MiniCPM5-2B: berpusat pada bahasa Inggris dan Tionghoa. Qwen 3 8B: 119 bahasa dan dialek.

Penalaran — MiniCPM5-2B: mode cepat/sengaja hibrida, sesuai materi peluncuran. Qwen 3 8B: pemikiran Qwen3 aktif atau nonaktif sesuai permintaan.

• Bukti — MiniCPM5-2B: kartu model dari vendor, belum diuji secara independen. Qwen 3 8B: dilaporkan oleh Alibaba, telah direproduksi dan diterapkan oleh komunitas selama enam belas bulan.

A comparison scoreboard titled 'MiniCPM5-2B vs Qwen 3 8B — the scoreboard', with left column rows 'Release: Announced Jul 19 · weights Sep 6', 'Params: 2.52B dense', 'Context: 128K in shipped config', 'Languages: English / Chinese centered', 'Reasoning: Hybrid fast / deliberate, claimed', 'Evidence: Vendor card · no independent run', and right column rows 'Release: April 2025 · mature', 'Params: ~8.2B dense', 'Context: 32K native · 131K YaRN', 'Languages: 119 languages', 'Reasoning: Thinking on / off per request', 'Evidence: 16 months community-tested', with a footer reading 'MiniCPM5-2B figures are ModelBest card claims; Qwen 3 8B figures are Alibaba's, community-exposed.'

Papan skor di atas adalah ketidaksesuaian yang digambarkan secara jujur: kolom-kolomnya berbeda pada hampir semua hal kecuali lisensi terbuka Apache-2.0, dan kelas perangkat yang Anda tuju menentukan kolom mana yang bahkan boleh Anda pilih.

Di mana 8B masih menang

Turun satu kelas bobot dan Anda menyerahkan tiga hal yang konkret. Pertama, bahasa: Qwen 3 8B mencakup 119 bahasa; kartu model dan data MiniCPM5-2B berpusat pada bahasa Inggris dan Mandarin, dan tidak ada klaim keluasan multibahasa. Bagi produk yang melayani ekor panjang bahasa, itu adalah tembok keras, bukan tembok lunak. Kedua, bukti: enam belas bulan pengujian komunitas berarti perilaku Qwen 3 8B sudah diketahui dan ekosistemnya ada di mana-mana, sementara MiniCPM5-2B adalah repositori berumur satu minggu dengan kartu model yang belum terverifikasi — dan angka-angka utamanya, jika tidak bertahan dalam pengujian independen, adalah jenis angka yang diam-diam direvisi. Ketiga, serving stack: semua yang sudah berbicara dengan Qwen 3 8B berbicara dengan target yang matang, sedangkan checkpoint kelas 2B yang benar-benar baru berarti memvalidasi ulang kuantisasi, konfigurasi serving, dan perilaku pemanggilan alat dari awal. Tidak satu pun dari ini adalah alasan 2B tidak bisa menang pada benchmark tertentu; ini adalah alasan mengapa 8B merupakan default berisiko lebih rendah di mana pun ia cocok.

Di mana 2B adalah satu-satunya jawaban.

Semua itu tidak relevan pada kelas perangkat yang memang tidak muat untuk model 8B. Di ponsel, papan smart-cockpit, atau edge box kecil dengan DRAM beberapa gigabyte, Qwen 3 8B tidak bersaing dengan MiniCPM5-2B — ia sama sekali tidak dapat dioperasikan pada kecepatan yang berguna. Itulah seluruh alasan mengapa 2B ada, dan itulah mengapa kerangka perbandingan yang jujur bukanlah "apakah 2B sebagus 8B", melainkan "deployment mana yang hanya bisa dilayani oleh salah satu dari keduanya." Jika Anda mengirimkan agen on-device yang bus memorinya akan kewalahan menangani delapan miliar bobot, MiniCPM5-2B adalah salah satu opsi kelas 2B dengan pelatihan paling agresif yang tersedia, dan satu-satunya pertanyaan yang layak diajukan adalah apakah klaim agentic-nya tetap bertahan saat Anda mereproduksinya sendiri. Jika beban kerja Anda sudah berjalan di perangkat keras yang mampu menjalankan 8B dengan nyaman, perbedaan ukuran saja bukan alasan untuk migrasi — dan kesenjangan bukti justru menentangnya.

Jika Anda sedang mempertimbangkan untuk berpindah

Cara aman untuk menguji perpindahan ini adalah dengan memperlakukannya sebagai eksperimen, bukan migrasi. Jalankan MiniCPM5-2B di perangkat keras Anda sendiri, arahkan sebagian lalu lintas nyata ke model tersebut melalui satu API dengan failover otomatis, dan ukur kinerjanya dibandingkan dengan 8B pada permintaan yang sama — lapisan routing di sini benar-benar berperan karena checkpoint yang baru berusia satu minggu bisa macet atau berputar tanpa menjatuhkan produksi, dan daftar harga penyedia di sekitar model hosted mana pun yang Anda bandingkan diteruskan tanpa markup 0%. Yang sebenarnya Anda uji adalah tiga hal: apakah akurasi 2B bertahan pada data Anda, apakah latensinya pada kelas perangkat Anda mengungguli 8B pada perangkat keras yang seharusnya Anda beli, dan apakah profil bahasa Inggris-Tionghoa mencakup pengguna yang sebenarnya Anda miliki. Reproduksi SWE-bench atau sebagian dari set eval Anda sendiri terlebih dahulu — dua jam yang dibutuhkan adalah asuransi termurah yang ditawarkan perbandingan ini.

Putusan

Tetaplah menggunakan Qwen 3 8B untuk apa pun yang multibahasa, apa pun yang membutuhkan perilaku yang sudah dikenal selama enam belas bulan, atau beban kerja apa pun yang sudah dilayani pada perangkat keras yang mampu menjalankan 8B dengan nyaman. Uji MiniCPM5-2B secara sungguh-sungguh hanya jika perangkat target Anda sama sekali tidak mampu menjalankan 8B, atau jika model 2.5B yang mampu mengimbangi pekerjaan agenik dan konteks panjang dapat memangkas memori dan daya pada perangkat keras yang sudah Anda produksi. Pemimpin peringkat sub-4B adalah pencapaian yang sesungguhnya, dan rilis open-weights-nya membuatnya dapat diuji saat ini; namun berdasarkan bukti yang tersedia, hal itu belum menjadi alasan untuk memensiunkan pekerja keras 8B yang telah membuktikan tempatnya.