
MiniCPM5-2B-DSpark: OpenBMB Diam-diam Membuka Bobot MiniCPM5-2B dengan Model Draf yang Dirancang untuk Kecepatan
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Enam minggu lalu, MiniCPM5-2B hanyalah sebuah janji. Diperkenalkan di konferensi WAIC di Shanghai pada 19 Juli 2026 sebagai model sub-4B yang menempati peringkat teratas dalam Artificial Analysis Index, MiniCPM5-2B hadir dengan catatan peta jalan bahwa bobot terbuka akan "segera" datang. "Segera" itu tiba minggu ini tanpa gembar-gembor. Pada 6 September 2026, OpenBMB mengunggah repositori andalan MiniCPM5-2B ke Hugging Face dengan lisensi Apache-2.0. Dua puluh satu menit kemudian, OpenBMB mengunggah MiniCPM5-2B-DSpark — sebuah checkpoint draf dengan 323,8 juta parameter yang hanya bertugas mempercepat decoding MiniCPM5-2B melalui algoritma speculative-decoding DSpark. Build GPTQ pun menyusul pada 7 September 2026. Hingga tulisan ini dibuat, belum ada pengumuman, postingan peluncuran, maupun entri changelog yang dapat kami temukan; rilis ini muncul saat repositori-repositori tersebut diam-diam menjadi publik dalam rentang waktu sebelas hari.
Ini adalah artikel tentang apa yang kita ketahui sejauh ini, dan kerangka penyajiannya penting. MiniCPM5-2B-DSpark bukan chatbot mandiri atau flagship baru — ia adalah akselerator: model kecil dan cepat yang mengusulkan token di depan MiniCPM5-2B, yang kemudian memverifikasinya secara paralel. Ia tidak berguna tanpa targetnya, dan target itulah alasan untuk peduli. Rilis open-weight MiniCPM5-2B yang dijanjikan OpenBMB pada bulan Juli kini benar-benar sudah ada di Hugging Face, dan model draf yang dirilis bersamanya adalah mekanisme yang direkomendasikan vendor untuk menjalankannya pada kecepatan yang bermanfaat. Semua yang tidak secara eksplisit disebutkan di bawah ini dibaca langsung dari dua kartu model dan repositori mereka.
Apa yang dirilis, dan kapan
Keluarga 2B diluncurkan ke publik sebagai rilisan bertahap tanpa pengumuman, dengan entri terbaru lebih dulu:
• 2026-08-27 — MiniCPM5-2B-Base dan MiniCPM5-2B-SFT muncul, berupa checkpoint pra-terlatih mentah dan hasil fine-tuning terawasi.
• 2026-09-01 — MiniCPM5-2B-Midtrain, tahap pelatihan-menengah agentik.
• 2026-09-05 — MiniCPM5-2B-MLX dan MiniCPM5-2B-GGUF, format Apple-Silicon dan llama.cpp.
• 2026-09-06 — repositori unggulan MiniCPM5-2B, lalu MiniCPM5-2B-DSpark dua puluh satu menit kemudian.
• 2026-09-07 — MiniCPM5-2B-GPTQ, format penyajian terkuantisasi.
Semuanya membawa lisensi Apache-2.0 yang digunakan ModelBest untuk keluarga MiniCPM5-1B pada bulan Mei, dan checkpoint-checkpoint awal dalam urutan tersebut masih menunjukkan sinyal komunitas yang pada dasarnya nol — masing-masing hanya segelintir unduhan dan suka. Itu adalah penanda pelepasan bobot yang sedang berlangsung, bukan peluncuran yang terkoordinasi: artefak-artefak tersebut muncul sesuai urutan ketergantungan (base dan SFT lebih dulu, format terkuantisasi dan draft terakhir) tanpa ada satu hari pun yang menjadi tanggal rilisnya.
Apa sebenarnya MiniCPM5-2B-DSpark itu
Dekoding spekulatif membagi pembangkitan menjadi pengusul (proposer) yang murah dan verifikator yang mahal. Model draf kecil menebak beberapa token berikutnya; model besar memeriksa semua tebakan tersebut dalam satu forward pass dan menerima tebakan yang disetujuinya. Jika draf terkalibrasi dengan baik, Anda mendapatkan keluaran model besar hanya dengan sebagian kecil biaya; jika draf salah, Anda hanya membuang satu langkah verifikasi. DSpark adalah resep spesifik untuk gagasan itu, dari makalah yang diunggah pada 2026-07-06 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Dua pilihan desain yang membedakannya: ia menggabungkan backbone drafter paralel dengan modul sekuensial ringan sehingga token-token di dalam blok yang diusulkan saling bergantung satu sama lain, alih-alih akurasinya menurun menjelang akhir blok; dan ia menentukan ukuran setiap proses verifikasi per permintaan berdasarkan estimasi keyakinan serta throughput mesin, alih-alih selalu memverifikasi blok dengan panjang tetap.
Draf DSpark yang dirilis OpenBMB adalah Transformer lima lapis dengan 323,8 juta parameter dalam BF16 (sekitar 648MB). Ia berada dalam keluarga arsitektur Qwen3 tetapi membawa penambahan khusus DSpark: sebuah proyektor yang membaca status tersembunyi MiniCPM5-2B dari lima lapisan target (1, 10, 20, 30, dan 39), sebuah kepala kepercayaan, dan sebuah kepala Markov kecil yang memodelkan distribusi token berikutnya. Konfigurasinya mengusulkan blok tujuh token per forward pass. Dengan kira-kira seperdelapan dari 2,5 miliar parameter MiniCPM5-2B, model ini merupakan salah satu model draf terkecil yang dirilis untuk checkpoint terbuka arus utama — yang merupakan inti untuk model berorientasi edge, tempat draf harus cukup murah sehingga menjalankan dua model pada satu perangkat masih lebih baik daripada menjalankan satu.

Repositori di atas adalah seluruh permukaan publik model draf tersebut: sebuah README, sebuah konfigurasi, sebuah berkas safetensors, dan sebuah kartu model yang deskripsi pelatihannya menunjukkan 1.959.525 sekuens (7,05 miliar token) yang dihasilkan oleh MiniCPM5-2B dari perintah umum, matematika, dan kode, dilatih selama enam epoch dengan gabungan tujuan cross-entropy, L1, dan confidence. Tidak ada penggunaan checkpoint tersebut sebagai model generatif secara mandiri.
Angka-angka yang dipublikasikan OpenBMB, diberi label dengan jujur.
Kartu model draf melaporkan satu angka yang penting — panjang penerimaan, jumlah rata-rata token yang diusulkan yang diterima target dari setiap blok tujuh token. Evaluasi dijalankan pada keluaran MiniCPM5-2B di tiga domain, hingga 4.096 token yang dihasilkan:
• Matematika — 6.05 token diterima rata-rata secara greedy (T=0); 4.61 pada sampling T=1.0.
• Kode — 6.11 greedy; 4.44 sampling.
• Umum — 4.16 greedy; 3.10 sampled.
• Agregat — 5.52 greedy; 4.05 sampled, dari maksimum tujuh.
Angka-angka tersebut dilaporkan vendor dari model card dan belum direproduksi secara independen. Angka-angka itu juga menjelaskan hit rate draft, bukan percepatan wall-clock: kecepatan adalah ukuran saat serving yang bergantung pada biaya pass verifikasi target dibandingkan pass proposal draft, pada keterisian batch, dan pada confidence scheduler DSpark yang memangkas panjang verifikasi. OpenBMB tidak menerbitkan angka token per detik untuk pasangan tersebut. Untuk mengetahui batas atas metode ini, makalah DSpark melaporkan generasi per pengguna 60–85% lebih cepat pada throughput yang setara dibandingkan baseline MTP-1 dalam sistem serving langsung DeepSeek — titik referensi yang berguna untuk apa yang telah dicapai algoritma tersebut di tempat lain, bukan klaim tentang MiniCPM5-2B di perangkat keras Anda.

Papan skor di atas adalah lembar spesifikasi dari rilis itu sendiri. Baca angka penerimaan sebagai rasio hit draf; pengali pada throughput sebenarnya masih harus diukur oleh operasi SGLang yang independen.
Model yang dipercepat oleh draf
MiniCPM5-2B adalah Transformer padat dengan 2,5 miliar parameter — total 2.516.756.480 — dengan 42 lapisan, 16 kepala query dan 2 kepala KV, kosakata 130.560 token, dan jendela konteks 131.072 token, dalam BF16 sekitar 5GB. Secara arsitektur, model ini sengaja dibuat membosankan: LlamaForCausalLM standar tanpa kernel khusus dan tanpa cabang kode model, itulah sebabnya ia dapat dipindahkan ke begitu banyak runtime dan target chip. Pada rangkaian tolok ukur internal OpenBMB sendiri, kartu tersebut memberikan rata-rata 53,9 untuk penalaran, mengikuti instruksi, pengetahuan, konteks panjang, penggunaan alat, pengodean, dan tugas agen pencarian — di depan Qwen3.5-4B yang mencapai 51,1 dan granite-4.2-3B yang mencapai 42,7 pada tabel yang sama, dengan beberapa sel (GPQA-Diamond 70.2, HLE 8.9, serta berbagai baris konteks panjang dan agen) ditandai sebagai berasal dari Artificial Analysis, bukan direproduksi secara internal. Sel-sel unggulan per tugas mencakup MATH-500 pada 94,6, AIME 2025 dan 2026 pada 86,5, IFEval pada 86,7, MMLU-Pro pada 70,8, dan SWE-bench Verified pada 46,4. Ini adalah angka dari vendor pada rangkaian milik vendor itu sendiri, dan kartu tersebut secara eksplisit menyatakan bahwa beberapa baris bersumber dari pihak ketiga; perlakukan campuran tersebut sebagaimana mestinya.

Pada peluncuran bulan Juli, materi peluncuran ModelBest mengutip Artificial Analysis Index sebesar 17 — peringkat pertama di antara model di bawah 4B parameter — dan liputan bulan Juli merujuk pada jendela 512K token. Checkpoint yang benar-benar dirilis mengonfigurasi konteks 131.072 token. Jika angka pemasaran pada hari peluncuran dan konfigurasi yang dirilis tidak selaras, konfigurasi itulah angka yang menentukan apa yang dapat Anda jalankan, dan kesenjangan ini perlu diketahui sebelum Anda merencanakan beban kerja konteks panjang berdasarkan angka pemasaran tersebut.
Menjalankan MiniCPM5-2B dengan draft-nya
Jalur yang dimaksud adalah SGLang, yang telah mendukung algoritma DSpark di upstream sejak v0.5.16 — batas bawah versi yang diminta oleh kartu model. Perintah serving lengkap dari kartu tersebut:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Pada decoding greedy (T=0), verifikasi DSpark bersifat lossless: outputnya identik dengan melayani MiniCPM5-2B saja, yang menjadikan draft tersebut murni bernilai dari segi latensi. Dengan sampling diaktifkan, DSpark milik SGLang secara default melakukan sampling dari target saja, dengan opsi rejection sampling. OpenBMB juga mendokumentasikan pemuatan Transformers biasa (transformers ≥ 5.6) dan pelayanan target tersebut secara mandiri menggunakan vLLM ≥ 0.21, ditambah parser panggilan tool minicpm5 untuk beban kerja agen; jalur spekulatif DSPARK secara khusus adalah milik SGLang.
Perhitungan perangkat keras adalah inti persoalan untuk pasangan kelas edge: sekitar 5GB untuk MiniCPM5-2B dalam BF16 ditambah kira-kira 0,65GB untuk model draf. Kombinasi draf-plus-target ini muat dengan nyaman di mana pun model 2B saja sudah dapat dijalankan, dan itulah alasan utama mengirim model draf sekecil ini alih-alih model kedua yang lebih besar.
Apa yang tidak dikonfirmasi
Tidak ada pengumuman yang bisa kami temukan — tidak ada blog OpenBMB atau ModelBest, tidak ada postingan media sosial dalam bahasa Inggris atau Mandarin. Penggambaran "dirilis secara diam-diam" memang harfiah, dan satu-satunya permukaan publik adalah koleksi Hugging Face.
• Tidak ada evaluasi independen. Panjang penerimaan draf dan rata-rata suite 53.9 MiniCPM5-2B dilaporkan oleh vendor dan tidak direproduksi; sel-sel yang ditandai AA berasal dari pihak ketiga tetapi merupakan nilai snapshot, bukan hasil menjalankan bobot persis ini.
• Tidak ada API yang dihosting di mana pun yang dapat kami temukan, jadi adopsi saat ini berarti menjalankan checkpoint sendiri. Cermin ModelScope, yang dijanjikan dalam liputan peluncuran pada bulan Juli, tidak terlihat pada saat penulisan ini.
• Tidak ada angka percepatan waktu nyata untuk pasangan DSPARK. Panjang penerimaan 5,52 adalah tingkat keberhasilan yang kuat, tetapi "berapa kali lebih cepat" pada GPU tertentu adalah angka yang justru tidak dipublikasikan oleh OpenBMB.
• Ambiguitas jendela konteks di atas: materi pemasaran menyebutkan 512K, konfigurasi yang dirilis menyebutkan 131.072, dan tidak ada apa pun di repositori yang menjembatani keduanya.
Di mana posisi rilis senyap model open-weight dalam sebuah stack
{{1}}Pembacaan jujur terhadap MiniCPM5-2B saat ini adalah bahwa ia merupakan sebuah taruhan: angka vendor yang kuat, nol uji coba independen, tanpa riwayat pelayanan, dan model draft yang percepatan dunia nyatanya belum terukur.{{/1}} {{2}}Justru situasi inilah yang menjadi alasan keberadaan lapisan routing.{{/2}} {{3}}Tim yang ingin menguji apakah keluaran model open-source kecil dapat menggantikan model terhosting yang sudah mereka panggil dapat menjalankan perbandingan itu dari satu API — OrcaRouter menaungi 200+ model terhosting dengan harga daftar penyedia tanpa markup, sehingga satu minggu evaluasi tidak memerlukan biaya apa pun untuk disiapkan, dan failover otomatis berarti checkpoint yang berumur beberapa hari tidak perlu pernah menyandera jalur produksi selagi ia membuktikan dirinya.{{/3}} {{4}}Semua itu tidak mengharuskan MiniCPM5-2B untuk dihosting di mana pun; ia adalah jaring pengaman di sekitar model yang sudah Anda andalkan selagi Anda memutuskan apakah 2B yang dihosting sendiri sepadan dengan GPU.{{/4}}
Perhatikan, berdasarkan urutan kepentingannya: uji coba SGLang DSPARK independen yang melaporkan token per detik yang sebenarnya untuk pasangan tersebut, karena panjang penerimaan hanyalah proksi, bukan tolok ukur; pengumuman resmi atau cermin ModelScope yang mengonfirmasi bahwa rilisnya sudah final; dan penyedia hosting yang mengadopsi MiniCPM5-2B — jika ada yang melakukannya, harga yang Anda bayar di sisi kami adalah harga daftar milik penyedia tersebut, pada hari yang sama, karena itulah makna penerusan biaya. Sementara itu, model draf adalah artefak yang lebih menarik dari keduanya. Proposer lima lapis yang membuat target menerima lima setengah dari tujuh token adalah pembeda antara model edge kecil yang terasa kecil dan model yang terasa seperti model lebih besar yang berjalan di perangkat yang sama.
