
Weight MiniCPM5-2B Telah Rilis: Model Kecil yang Mengklaim Mahkota Sub-4B Kini Menjadi Open-Source
- openaiBARUOpenAI: GPT-6 Astra2026-09-0455Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0247Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0247Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0157Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2646Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1849Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1541Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1251Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0547Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0347Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Kecerdasan49Koding
Model itu sendiri baru berusia tujuh minggu. MiniCPM5-2B diluncurkan di Konferensi Kecerdasan Buatan Dunia 2026 pada 19 Juli, saat ModelBest dan OpenBMB menyebutnya sebagai model peringkat teratas dengan parameter di bawah 4B pada papan peringkat Artificial Analysis, dan menjanjikan bobotnya akan dirilis "dalam waktu dekat." Akhir pekan ini, "waktu dekat" itu pun tiba tanpa kemeriahan peluncuran apa pun: repositori MiniCPM5-2B mulai tayang di Hugging Face pada 6 September, dan changelog OpenBMB menandai rilis pada 7 September di bawah lisensi Apache-2.0, dengan paket lengkap — bobot BF16, kuantisasi GGUF, MLX, dan GPTQ, checkpoint dasar dan SFT, model draf DSpark untuk decoding spekulatif, serta dataset pelatihan yang mendasarinya.
Tidak ada siaran pers yang menyertainya dan tidak ada acara peluncuran. Ia begitu saja muncul: sebuah repositori Hugging Face pada suatu hari, sebuah baris changelog pada hari berikutnya. Hal itu menjadikan ini sebagai tulisan "apa-yang-kita-ketahui-sejauh-ini" — dengan satu pembaruan awal. Repositori tersebut memberi tahu kita banyak hal: model ini benar-benar dapat diunduh dan dijalankan saat ini, dan lembar spesifikasinya bersifat publik. Dan satu skor eksternal telah hadir: Artificial Analysis mencantumkan MiniCPM5-2B pada Intelligence Index v4.2 dengan nilai 15, hasil open-weights teratas di bawah 4B total parameter pada indeks tersebut, sehingga peringkat sub-4B tidak lagi bertumpu pada klaim vendor semata. Yang masih belum terkonfirmasi adalah angka-angka utama pada model card, yang oleh OpenBMB direproduksi dalam harness mereka sendiri dan belum ada pihak di luar lab yang menjalankan ulang. Berikut adalah apa yang dapat diketahui dari repositori, apa yang kini telah diukur secara independen, dan apa yang masih perlu verifikasi sebelum Anda membangun di atasnya.
Apa yang baru saja terjadi
MiniCPM5-2B adalah model kedua dalam seri MiniCPM5, menyusul MiniCPM5-1B yang dirilis OpenBMB sebagai sumber terbuka pada 19 Mei. Ketika 2B diluncurkan sebagai produk di WAIC, kisahnya sama besarnya mengenai chip dan model — ModelBest menggambarkannya sebagai basis agen on-device untuk ponsel, PC, dan kokpit pintar, serta menyebutkan sembilan chip dengan dukungan sejak hari pertama melalui komunitas FlagOS, mulai dari Huawei Ascend, NVIDIA, hingga beragam akselerator domestik. Rilis sumber terbukanya disebut sudah di depan mata. Tujuh minggu berlalu.
Pada 6 September, repositori openbmb/MiniCPM5-2B muncul. Hingga tulisan ini dibuat, kartu modelnya adalah pengumuman rilis, dan ia luar biasa lengkap untuk sebuah rilis yang tenang:
• Bobot — checkpoint akhir pasca-pelatihan RL + OPD dalam BF16, berlisensi Apache-2.0, dan tidak dibatasi — siapa pun dapat mengunduhnya.
• Checkpoint pendamping — MiniCPM5-2B-SFT, -Midtrain, dan -Base bagi mereka yang menginginkan model sebelum RL/OPD, ditambah model draf -GGUF, -MLX, -GPTQ, dan -DSpark, semuanya tercantum dalam koleksi MiniCPM5 di Hugging Face.
• Data — korpora pelatihan juga terbuka, dirilis sebagai bagian dari keluarga UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 dan UltraData-RL-2609.
• Cermin — README tersebut mengarah ke Hugging Face dan ModelScope.
Satu baris di kartu lebih penting daripada yang terlihat: "tanpa kernel khusus, tanpa fork kode model." MiniCPM5-2B menggunakan arsitektur standar LlamaForCausalLM, jadi mesin apa pun yang sudah melayani model keluarga Llama dapat memuatnya tanpa menunggu implementasi khusus.
Mengapa model 2.5B layak untuk dilihat kembali
Pitch WAIC adalah pitch peringkat. ModelBest mengatakan MiniCPM5-2B memperoleh Artificial Analysis Intelligence Index sebesar 17, menempatkannya di posisi pertama di antara model di bawah 4B parameter pada papan peringkat AA saat peluncuran. Ada dua catatan yang menyertai angka tersebut. Pertama, skor indeks hanya dapat dibandingkan dalam versi metodologi yang sama: skor 17,9 MiniCPM5-1B sebelumnya berasal dari snapshot AA yang lama, sehingga bukan bukti bahwa model yang lebih kecil "skornya lebih tinggi," dan dengan aturan yang sama, skor yang lebih baru pada metodologi yang lebih baru bukanlah regresi. Kedua, angka AA menjadi bahan untuk model card, tetapi rata-rata utama di card tersebut adalah milik OpenBMB sendiri, yang direproduksi dalam harness OpenBMB sendiri. Perbedaan ini penting karena AA sejak itu beralih ke metodologi yang lebih baru dan merilis skor terbaru — pemeriksaan eksternal pertama terhadap pitch tersebut sejak rilis open-weights.
Sebuah skor eksternal hadir di minggu yang sama dengan perilisan bobot model. Pada 4 September, Artificial Analysis meluncurkan Intelligence Index v4.2, revisi metodologi yang menaikkan bobot pengujian privat held-out menjadi 40% dan menambahkan dua komponen baru — AA-Briefcase, sebuah evaluasi agentik, serta GDP.pdf milik Surge, sebuah tugas penalaran dokumen berkonteks panjang. Entri indeks AA untuk MiniCPM5-2B kini membawa skor v4.2 sebesar 15: hasil terbaik di antara model open-weights dengan total parameter di bawah 4B, dan menempati urutan pertama dari 47 model terbuka dalam kelas ukuran tersebut pada daftar AA. Hal ini menjaga posisi model tetap seperti yang dipromosikan pada Juli, kali ini dengan metodologi yang lebih sulit untuk dimanipulasi dan dengan bobot yang dapat diunduh serta diperiksa ulang oleh siapa pun. Angka 15 tidak sebanding dengan 17 pada era peluncuran yang berasal dari v4.1 — metodologinya lebih ketat, bukan modelnya yang lebih lemah — dan skor kompositnya tidak memverifikasi ulang baris-baris individual pada model card, yang sebagian besar telah direproduksi oleh OpenBMB dalam harness pengujiannya sendiri. Yang justru dilakukannya adalah memvalidasi dua aspek yang OpenBMB sebut sebagai fokus optimalisasi: v4.2 lebih menitikberatkan pada tugas-tugas agentik, dan pelacakan verbositas AA menunjukkan MiniCPM5-2B menghasilkan 57M token output di seluruh tugas indeks — model paling ringkas di kelasnya dibandingkan median 72M. OpenBMB berterima kasih kepada AA atas pengujian tersebut dan membingkainya tepat dengan istilah itu — performa agentik dan efisiensi token pada 2.6B, demikian kata mereka, memang menjadi tujuan optimalisasi model ini.
Klaim substantifnya adalah kemampuan agensial dalam kemasan kecil: pemanggilan alat secara native, penelusuran mendalam, dan pembuatan kode yang ditanamkan lewat pelatihan dari awal, bukan ditempelkan di tahap akhir. Kartu model ini menjabarkan tiga tahap alur (pipeline) — pelatihan dasar, pelatihan menengah, lalu pasca-pelatihan: SFT pada 400 miliar token data berpikir mendalam, guru RL terspesialisasi, dan On-Policy Distillation (OPD), yang menggabungkan enam belas model ahli RL — lima di antaranya bersifat agenik — kembali menjadi satu jaringan padat yang kecil. OpenBMB mengaitkan tahap RL + OPD dengan kenaikan rata-rata 10,96 poin pada tugas penalaran dan tugas umum, serta 6,96 poin pada tugas agenik. Itu semua delta internal, tetapi menjelaskan bentuk model yang tidak biasa ini: jaringan berparameter 2,5 miliar yang dibangun seperti model penalaran dan diarahkan untuk penggunaan alat.

Apa yang sebenarnya terkandung dalam repo
Lembar spesifikasi tidak ambigu, karena lembar itu sendiri adalah file konfigurasi. MiniCPM5-2B memiliki 2.516.756.480 parameter, dengan 1.981.982.720 di antaranya non-embedding — vendor menghitung angka non-embedding saat menyebut “kelas 2B”. Ini adalah transformer padat dengan 42 lapisan pada ukuran tersembunyi 2048, attention kueri berkelompok dengan 16 kepala kueri dan hanya 2 kepala KV, kosakata 130.560, serta tensor BF16. Seluruhnya dirilis sebagai satu shard safetensors, cukup kecil untuk diunduh melalui koneksi laptop dan dijalankan pada satu GPU kelas menengah atau NPU kelas ponsel.
• Parameter — total 2.516.756.480; non-embedding 1.981.982.720.
Arsitektur — LlamaForCausalLM padat, 42 lapisan, hidden 2048, GQA 16 kepala kueri / 2 kepala KV, kosakata 130.560.
Konteks — 131.072 token dikonfigurasi (max_position_embeddings), tanpa penskalaan RoPE pada konfigurasi.
• Lisensi — Apache-2.0, untuk model dan data pelatihan yang dirilis.
• Format — BF16; GGUF, MLX, dan pendamping GPTQ diterbitkan secara terpisah.

Satu angka dari deck Juli tidak muncul di checkpoint. Materi WAIC mempromosikan jendela konteks 512K token, sedangkan konfigurasi yang dirilis menetapkan max_position_embeddings menjadi 131.072 (128K) tanpa entri rope_scaling. Kemungkinan angka 512K dimaksudkan untuk dicapai melalui ekstensi saat inferensi, seperti cara beberapa model kecil memperpanjang konteksnya — tetapi dalam bentuk rilisnya, repositori mencantumkan 131.072, dan itulah angka yang harus dijadikan acuan desain sampai OpenBMB menerbitkan resep ekstensi.
Angka-angka, diurutkan berdasarkan siapa yang mengukurnya.
Kartu model ini berhati-hati mengenai asal-usul data, dan membaca catatan kakinya sungguh bermanfaat. Skor yang ditandai dengan simbol † “berasal dari rilis resmi Artificial Analysis” — di antaranya baris seperti GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6, dan GDPval-AA v2 19.6. Semua hal lainnya dijelaskan sebagai “direproduksi secara internal,” yang berarti OpenBMB menjalankan evaluasi-evaluasi itu di dalam perangkat (harness) miliknya sendiri. Kategori tersebut mencakup angka-angka yang menarik perhatian: rata-rata internal 53.9 pada set pembanding kartu tersebut, AIME 2025/2026 sebesar 86.5, MATH-500 sebesar 94.6, LiveCodeBench v6 sebesar 69.1, SWE-bench Verified sebesar 46.4, BFCL v4 sebesar 66.6, τ²-Bench Telecom sebesar 97.1, GAIA (Text-103) sebesar 88.7, dan MMLU-Pro sebesar 70.8.
Ada tiga hal yang membuat angka-angka itu tetap jujur untuk dibaca. Rata-rata 53.9 adalah skor relatif, bukan skor absolut — kartu tersebut menormalkan setiap sumbu radar sehingga model terbaik dalam perbandingan mendapat skor 100. Set perbandingannya dipilih oleh vendor: model terbuka 2B-4B lainnya, termasuk Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B, dan LFM2.5-8B-A1B. Dalam set itu, kartu tersebut menunjukkan MiniCPM5-2B mengungguli peringkat kedua, Qwen3.5-4B, yang berada di 51.1 — hasil yang benar-benar mencolok untuk model yang ukurannya hanya setengah dari model peringkat kedua itu, dan justru jenis hasil yang perlu direproduksi secara independen sebelum siapa pun membangun di atasnya. Beberapa baris individual pun sulit diselaraskan dengan klaim pemasaran: skor SWE-bench Verified 46.4 dari model dense 2.5B akan menjadi luar biasa jika hasilnya dapat direproduksi, sementara HLE 8.9 adalah pengingat bahwa "pemimpin sub-4B" dan "frontier" berada di liga yang berbeda. Tidak satu pun dari hal-hal ini dibantah oleh repositori, dan komposit v4.2 milik AA telah mengonfirmasi posisi keseluruhan model di puncak kelas open-weights sub-4B — tetapi baris-baris spesifik ini adalah milik OpenBMB sendiri, yang masih belum diverifikasi oleh siapa pun di luar lab.
Menjalankan MiniCPM5-2B hari ini
Karena arsitekturnya adalah Llama biasa, mesin-mesin utama memuatnya secara langsung. README OpenBMB menyediakan panduan memulai cepat untuk vLLM (0.21 atau lebih baru), SGLang (0.5.16 atau lebih baru), dan Transformers (5.6 atau lebih baru), dengan sampling yang disarankan pada temperature 1.0 dan top-p 0.95, serta enable_thinking diaktifkan saat Anda menginginkan proses penalaran. Pendamping GGUF dan MLX mencakup llama.cpp, Ollama, LM Studio, dan Apple Silicon; kartu tersebut juga mencantumkan runtime ArcLight dan tumpukan fine-tuning yang umum (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
Dua detail penerapan yang perlu diketahui sebelum Anda memulai. Untuk pemanggilan tool dan fungsi, SGLang adalah backend yang direkomendasikan: model mengeluarkan panggilan tool bergaya XML, dan parser minicpm5 bawaan SGLang mengubahnya menjadi tool_calls yang kompatibel dengan OpenAI secara native, yang berarti klien pemanggilan tool standar dapat bekerja tanpa shim khusus. Dan model draft DSpark ada untuk membuat proses penalaran lebih murah: diluncurkan di SGLang dengan algoritma decoding spekulatif DSPARK, ia mempercepat decoding sambil membiarkan output model target tidak berubah — hal semacam itu yang menentukan apakah loop agen dengan konteks 128K di laptop dapat digunakan atau sekadar mungkin.

Jika Anda lebih suka mengevaluasi sekumpulan model terbuka kecil daripada menyetel satu model secara manual, lapisan perutean menjadi sangat berguna di sini: ketika sebuah penyedia menyertakan MiniCPM5-2B, router adalah cara murah untuk menguji A/B-nya terhadap Qwen3.5-2B dan checkpoint terbuka sub-4B lainnya pada tugas yang sama tanpa integrasi tambahan. Di OrcaRouter, itu berarti satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis jika checkpoint yang baru muncul macet atau berputar-putar pada jalur produksi. Repositori tersebut baru berumur dua hari dan belum ada API terhosting yang bisa kami rujuk menyertakan MiniCPM5-2B — jadi default yang jujur saat ini adalah memperlakukannya sebagai eksperimen self-host, bukan sebagai dependensi.
Siapa yang harus menarik beban-beban ini?
Unduh model-model itu hari ini jika pekerjaan Anda adalah pada agen on-device, pemanggilan alat di edge, atau eksperimen pengodean dan penalaran model kecil, dan Anda menginginkan opsi kelas 2B dengan pelatihan paling agresif yang tersedia. Lisensi Apache-2.0 dan data pelatihan terbuka menghilangkan dua alasan yang membuat sebagian besar tim ragu pada model kecil buatan laboratorium China — tidak ada pembatasan penggunaan komersial, dan tidak ada korpus kotak hitam. Unduh model-model itu dengan waspada jika Anda memilih model produksi hanya berdasarkan kekuatan tabel benchmark: baris-baris utama pada kartu model adalah reproduksi OpenBMB sendiri, dan komposit AA v4.2 — satu-satunya pengukuran dari luar sejauh ini — tidak menjamin baris-baris tersebut. Model 2.5B yang dilaporkan melampaui Qwen3.5-4B adalah klaim yang layak mendapat dua jam yang dibutuhkan untuk mereproduksi SWE-bench sendiri.
Yang perlu dipantau selanjutnya. Reponya baru berumur dua hari, jadi sinyal jangka pendeknya masih bersifat mekanis: apakah llama.cpp dan pustaka Ollama akan mengadopsi GGUF, apakah cermin ModelScope dan build chip FlagOS dapat rilis dengan lancar, dan apakah API yang di-hosting akan mencantumkan MiniCPM5-2B — itulah momen ketika model ini tidak lagi eksklusif untuk self-host. Sinyal substantif yang menurut artikel ini masih hilang — yakni pengujian independen oleh Artificial Analysis atau laboratorium universitas — kini telah tiba dalam bentuk skor indeks v4.2, dan skor tersebut menempatkan MiniCPM5-2B di posisi pertama di antara model open-weights di bawah 4B. Yang masih belum tuntas adalah verifikasi tingkat baris: belum ada seorang pun di luar OpenBMB yang mereproduksi angka-angka internal pada kartu model, terutama SWE-bench Verified di 46.4 dan rata-rata internal 53.9. Sampai baris-baris spesifik tersebut dijalankan ulang, perlakukan MiniCPM5-2B sebagaimana Anda memperlakukan model apa pun yang dirilis secara senyap dengan kartu spesifikasi yang mengesankan: sebagai hipotesis yang sangat menjanjikan yang dapat Anda jalankan secara lokal malam ini, dan sebagai model yang angka-angka paling mencoloknya perlu Anda verifikasi sebelum Anda memercayakannya untuk pekerjaan sungguhan.
