
MiniCPM5-2B-DSpark vs Granite 4.2 3B: Dua Rilis Tenang Berlisensi Apache-2.0 untuk Serving Model yang Kecil, Cepat, dan Self-Hosted
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Agustus dan awal September 2026 melahirkan dua rilis Apache-2.0 yang tenang dengan sasaran yang sama — model kecil yang Anda host sendiri — dan keduanya menempuh arah yang berlawanan. Granite 4.2 3B adalah model penalaran seukuran laptop milik IBM yang bobotnya tersedia di Hugging Face pada awal Agustus, lalu kartu model dan blog teknisnya terbit pada 25 Agustus 2026. MiniCPM5-2B-DSpark sama sekali bukan model dalam arti yang sama: ia adalah checkpoint draf DSpark dengan 323,8 juta parameter yang diunggah OpenBMB pada 6 September 2026 tanpa pengumuman apa pun, yang dirancang untuk membuat MiniCPM5-2B — model on-device padat 2,52 miliar parameter yang diumumkan ModelBest di WAIC pada 19 Juli 2026 — menghasilkan token lebih cepat lewat speculative decoding. Rilis yang satu adalah model penalaran kecil yang berdiri sendiri; yang lainnya adalah aksesori akselerasi untuk model kecil. Keduanya menggunakan lisensi Apache-2.0, keduanya khusus self-host, dan belum ada satu pun yang diuji oleh benchmark independen.
Kupas lapisan pemasarannya, dan pertanyaan praktis yang dihadapi tim menjadi jelas: untuk beban kerja serving kecil yang di-host sendiri pada akhir 2026, apakah Anda menginginkan spesialis penalaran 3B milik IBM atau tumpukan berorientasi agen 2B milik ModelBest dengan draf gratis yang ditempelkan? Buktinya lebih tipis daripada yang disiratkan oleh lembar spesifikasi kedua vendor, jadi artikel ini memaparkan fakta-fakta rilis, satu set angka suite yang sama yang benar-benar ada, serta perbedaan beban kerja yang seharusnya menjadi dasar pengambilan keputusan.
Dua rilis tersebut, apa yang dapat diketahui
Granite 4.2 3B adalah model penalaran terkecil milik IBM, yang dilatih lanjut (post-training) dari Granite-4.1-3B-Base. Model ini padat (dense) dan murni teks — 40 lapisan, atensi grouped-query, konteks asli 128K yang meluas hingga 512K dalam fase pra-pelatihan kelima, serta tiga mode penalaran: berpikir penuh (full thinking) sebagai default, mode upaya rendah, dan jalur tanpa berpikir. Kartu model IBM secara eksplisit menyatakan bahwa 3B memang sengaja melewatkan blok pembelajaran penguatan berbasis agen yang diterima oleh model-model Granite 4.2 yang lebih besar; karena itu kartunya tidak mencantumkan hasil SWE-Bench dan model ini adalah model penalaran, bukan model agen. Model ini dilayani melalui vLLM, SGLang, Transformers, GGUF, dan Ollama (granite4.2:3b), serta tidak memiliki API yang dihosting. Angka utama pada kartunya — 78,33 pada AIME 2025, 54,80 GPQA, 69,71 LiveCodeBench v6 — masih merupakan laporan vendor yang belum direproduksi hingga saat ini.

Kartu ibm-granite/granite-4.2-3b di atas adalah wajah publik dari perilisan tersebut: 3B yang disetel untuk penalaran dengan cerita konteks panjang dan tanpa klaim agenik.
MiniCPM5-2B-DSpark, sebaliknya, hanya ada untuk melayani targetnya. Draf ini terdiri dari lima lapisan perhatian penuh dengan 323.776.001 parameter, ukuran blok tujuh token kandidat per forward pass, dilatih selama enam epoch pada 7,05 miliar token respons yang dihasilkan MiniCPM5-2B. Reponya melaporkan panjang penerimaan — 5,52 token yang diterima per langkah verifikasi secara agregat pada decoding serakah, 6,11 pada kode — tetapi tidak ada angka token per detik. Target yang dipercepatnya, MiniCPM5-2B, adalah produk yang lebih menarik: model padat 2,52B, 42 lapisan, dengan konteks 128K, yang materi peluncurannya menekankan kemampuan agen — pelatihan tengah agen skala 200B, set agen-SFT yang besar, dan penyelarasan RL agen, menurut pengumuman ModelBest bulan Juli — plus konteks panjang asli dan mode hibrida cepat/cermat. Pada rangkaian perbandingan milik ModelBest sendiri, target memperoleh skor rata-rata 53,9 melawan model terbuka sekelasnya. Setiap angka tersebut berasal dari vendor.

Kartu openbmb/MiniCPM5-2B-DSpark di atas adalah seluruh permukaan rilis: kartu model, konfigurasi, satu file Safetensors, dan tanpa pengumuman.
Satu-satunya perbandingan dalam suite yang sama yang ada.
Papan skor lintas vendor pada umumnya ibarat membandingkan apel dengan jeruk, tetapi ada satu tempat di mana Granite 4.2 3B dan MiniCPM5-2B diukur bersama: tabel evaluasi ModelBest sendiri untuk MiniCPM5-2B, yang mencantumkan granite-4.2-3B di antara baseline-nya. Pada suite tersebut, MiniCPM5-2B rata-rata mendapat 53.9 dibandingkan dengan 42.7 milik Granite 4.2 3B. Baca angka itu persis sebagaimana adanya—satu vendor menjalankan kedua model pada satu suite, belum direproduksi, dan dipilih untuk membuat modelnya sendiri terlihat bagus. Itu bukan vonis. Yang ditunjukkannya kepada Anda adalah bahwa ModelBest cukup percaya diri untuk mencantumkan 3B milik pesaing di tabel tersebut, dan selisih yang mereka klaim paling besar justru berada tepat di area yang menjadi fokus investasi pelatihan mereka: baris long-context dan agentic. Anggap saja itu sebagai klaim indikatif, verifikasi dengan data Anda sendiri, dan timbang klaim kartu terpisah milik IBM sendiri sebelum Anda memutuskan apa pun berdasarkan hal itu.
Papan skor, yang diberi label dengan jujur.
• Apa yang dirilis — MiniCPM5-2B-DSpark: sebuah draft 324M untuk MiniCPM5-2B (target dense 2.52B), tidak berdiri sendiri. Granite 4.2 3B: model penalaran dense ~3B yang berdiri sendiri.
• Peran — stack MiniCPM5-2B: penekanan pada agen di perangkat dan penggunaan alat, menurut ModelBest. Granite 4.2 3B: spesialis penalaran, yang secara sengaja non-agentik.
• Konteks — target MiniCPM5-2B: 128K native. Granite 4.2 3B: 128K native, dapat diperluas hingga 512K.
• Akselerasi — MiniCPM5-2B-DSpark: draf eksternal DSpark, tujuh token per pass, penerimaan greedy ~5,5 per langkah (dilaporkan di repo). Granite 4.2 3B: tidak ada yang disertakan dalam rilis ini.
• Lisensi — keduanya Apache-2.0.
• Bukti — Angka MiniCPM adalah klaim dari kartu ModelBest (suite-nya: 53.9 vs Granite 42.7); angka Granite adalah klaim dari kartu IBM (AIME 2025 78.33, GPQA 54.80). Tidak ada pengujian independen terhadap salah satu pun dari keduanya.

Papan skor di atas memiliki sumber yang sama dengan prosa: setiap angka di dalamnya dilaporkan oleh vendor, dan satu-satunya angka same-suite yang telah dipublikasikan oleh salah satu vendor adalah milik ModelBest sendiri.
Perbedaan yang melampaui setiap tolok ukur
Sebelum melihat skor, tentukan jenis model kecil apa yang dibutuhkan beban kerja Anda, karena kedua rilis ini menjawab pertanyaan yang berbeda. Granite 4.2 3B dirancang untuk penalaran dan konteks panjang pada perangkat keras yang terbatas: jendela native 128K yang membentang hingga 512K, tiga mode berpikir per-kueri, jejak yang dapat berjalan di laptop, dan keputusan eksplisit untuk melewatkan pelatihan agen. Jika pekerjaan Anda adalah analisis dokumen panjang, konteks skala repositori, atau penalaran andal pada perangkat kecil, itu adalah kecocokan yang masuk akal. MiniCPM5-2B dibangun dengan penekanan yang berlawanan: perilaku agen dan penggunaan alat di perangkat — keberadaan draft itu sendiri menandakan bahwa ModelBest mengharapkan target ini dilayani secara interaktif dan menginginkan token per detiknya kembali. Jika pekerjaan Anda adalah loop agen di perangkat yang memanggil alat dan menjaga percakapan panjang, itulah tumpukan yang ditujukan untuk Anda.
Draf tersebut mengubah ekonomi dari pilihan kedua itu dengan cara yang tidak disinggung rilis Granite. MiniCPM5-2B bersifat dense, dan decoding spekulatif paling menguntungkan justru pada rezim dense yang terikat memori — sebuah model tetap kecil mengusulkan token kepada model tetap yang sedikit lebih besar. Drafter eksternal yang menambah bobot BF16 sekitar 650MB ke target ~5GB, dengan jalur serving SGLang yang terdokumentasi dan tingkat penerimaan greedy sekitar lima setengah token per langkah verifikasi, merupakan pengungkit throughput yang kredibel untuk model yang Anda sajikan pada konkurensi satu permintaan. Akan tetapi, satu catatan tak terhindarkan: OpenBMB belum memublikasikan percepatan end-to-end, sehingga pengungkit tersebut belum terkalibrasi. IBM tidak menyertakan drafter eksternal yang setara untuk Granite 4.2 3B dalam rilis ini — Anda menjalankannya secara dense, dan cerita kecepatannya sederhana: model 3B itu memang kecil.
Siapa yang harus menjalankan yang mana
• Jalankan Granite 4.2 3B jika beban kerja Anda adalah penalaran konteks panjang pada perangkat kelas laptop — dokumen, repositori, analisis utas tunggal yang mendalam — dan Anda menginginkan tiga mode berpikir serta batas 512K pada model Apache-2.0 yang sepenuhnya Anda kendalikan. Terimalah bahwa tidak ada pelatihan agentik di baliknya dan tidak ada API yang di-host.
• Jalankan tumpukan MiniCPM5-2B dengan draf DSpark-nya jika beban kerja Anda adalah agen on-device yang interaktif dan memanggil alat, yang targetnya muat dalam anggaran memori Anda, dan Anda menginginkan throughput yang dapat diperoleh kembali oleh draf. Luangkan waktu untuk mengukur percepatan nyata draf pada build SGLang Anda sendiri, karena belum ada angka yang dipublikasikan untuk itu.
• Jalankan keduanya di belakang lapisan perutean jika Anda benar-benar tidak yakin. Tidak ada model yang ada dalam katalog terhosting saat ini, termasuk OrcaRouter — keduanya merupakan proposisi self-host — tetapi router yang menghadapkan endpoint Anda sendiri dengan failover otomatis memungkinkan tumpukan draf baru berada di jalur pengujian sementara produksi tetap pada yang sudah terbukti, dan markup 0% pass-through pada model terhosting di sekitarnya menjaga perbandingan A/B tetap murah. Intinya adalah reversibilitas: ganti nama model, ukur, dan kembalikan jika checkpoint yang berumur satu hari tersebut macet.
Tontonan Berikutnya
Dua hal akan menentukan pertarungan ini lebih cepat daripada opini apa pun. {{1}}Pertama, uji coba independen MiniCPM5-2B yang mengonfirmasi atau menggugurkan rata-rata 53.9 dan klaim-klaim agentik tersebut — model 2B yang mencetak skor sebagus itu pada tugas-tugas bergaya SWE-Bench akan menjadi titik data yang benar-benar baru bagi kelas on-device.{{/1}} {{2}}Kedua, angka model penalaran IBM sendiri yang tetap bertahan setelah direproduksi oleh komunitas; skor 78.33 pada AIME 2025 dari model 3B adalah jenis klaim yang bisa bergeser ketika orang lain menjalankannya.{{/2}} Sampai salah satu dari keduanya terjadi, posisi yang jujur adalah: Granite 4.2 3B adalah model kecil yang lebih aman dan terdokumentasi lebih baik saat ini, dan stack MiniCPM5-2B adalah taruhan yang lebih menarik — agen on-device yang lebih cepat jika klaimnya terbukti, dengan model draf yang manfaatnya bahkan belum diukur oleh vendor-nya sendiri.
