
MiniCPM5-2B vs Granite 4.2 3B: Spesialis Penalaran 3B vs Stack Agen 2.5B yang Baru
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest menaruh Granite 4.2 3B di papan skor MiniCPM5-2B miliknya sendiri sebelum ada yang memintanya. Kartu model MiniCPM5-2B yang diterbitkan OpenBMB saat bobotnya dirilis secara diam-diam di Hugging Face mencantumkan model penalaran terkecil IBM di antara baseline perbandingannya, dan pada rangkaian pengujian tersebut MiniCPM5-2B menunjukkan rata-rata 53,9 melawan Granite 4.2 3B yang mencapai 42,7. Itu satu-satunya angka head-to-head yang dipublikasikan salah satu vendor untuk pasangan ini, yang menjadikannya titik awal yang wajar — dan titik awal yang perlu dicermati. Kedua model sama-sama kecil, berlisensi Apache-2.0, dan dirilis sebagai open-weights yang dihosting sendiri, ditargetkan untuk pekerjaan yang sama pada akhir 2026; keduanya hanya menempuh jalan dari arah yang berlawanan, satu dilatih untuk bernalar dan satu dilatih untuk bertindak.
Kedua rilis ini lebih seirama daripada yang disarankan pemasaran vendor mereka. MiniCPM5-2B diperkenalkan di Konferensi Kecerdasan Buatan Dunia pada 19 Juli sebagai produk unggulan on-device dari ModelBest dan OpenBMB — model padat kelas 2B yang diposisikan sebagai basis agen untuk ponsel, PC, dan kokpit pintar — dan bobotnya muncul pada 6 dan 7 September tanpa acara peluncuran, di bawah Apache-2.0, bersama dengan checkpoint GGUF, MLX, GPTQ, base, SFT, dan draft serta data pelatihan di baliknya. Granite 4.2 3B adalah model penalaran seukuran laptop milik IBM, yang bobotnya muncul di Hugging Face pada awal Agustus dan kartu model serta blog teknisnya terbit pada 25 Agustus. Keduanya belum tersentuh benchmark independen, itulah sebabnya label sumber di bawah ini lebih penting daripada angkanya.
Dua rilis yang berima
Granite 4.2 3B adalah model penalaran padat yang berdiri sendiri, dilatih lanjut dari Granite-4.1-3B-Base. Model ini memiliki 40 lapisan dengan grouped-query attention, konteks asli 128K yang diperluas IBM menjadi 512K dalam fase pra-pelatihan kelima, dan tiga mode berpikir per-kueri — berpikir penuh secara default, mode upaya rendah, dan jalur non-berpikir. Kartu modelnya eksplisit tentang apa yang bukan: tidak seperti saudara Granite 4.2 8B dan 30B, 3B sengaja melewatkan blok pembelajaran penguatan agen khusus yang dilatih di lingkungan SWE-agent, terminal, dan pencarian, sehingga IBM tidak mencantumkan hasil SWE-bench dan membingkai model ini sebagai spesialis penalaran, bukan agen. Model ini dilayani melalui vLLM, SGLang, Transformers, GGUF, dan Ollama (granite4.2:3b), berjalan dalam sekitar 6-8GB dalam bfloat16 atau di bawah 2GB dalam bentuk kuantisasi, dan tidak memiliki API yang dihosting. Angka utamanya — AIME 2025 sebesar 78.33, GPQA sebesar 54.80, LiveCodeBench v6 sebesar 69.71, MMLU-Pro sebesar 67.84 — dilaporkan oleh IBM dan belum direproduksi hingga saat ini.

MiniCPM5-2B justru merupakan model berorientasi agen yang final. Kartu modelnya memaparkan transformer dense dengan total 2,52 miliar parameter (1,98 miliar parameter non-embedding), 42 lapisan dengan hidden size 2048, grouped-query attention dengan 16 kepala query dan dua kepala KV, serta arsitektur LlamaForCausalLM standar tanpa kernel kustom. Pitch peluncurannya menekankan kapabilitas agenik — mid-training agen berskala 200B, set data agent-SFT yang besar, dan penyelarasan RL agen, yang dituntaskan dengan On-Policy Distillation yang menggabungkan enam belas model pakar RL kembali menjadi satu jaringan dense kecil — plus konteks panjang native dan mode respons hibrida cepat/reflektif. Konfigurasi yang disertakan menetapkan jendela konteks 131.072 token (materi Juli menggembar-gemborkan 512K; konfigurasi yang dirilis tidak memuat angka tersebut), dan kartu model tersebut mengklaim panggilan alat bergaya XML dengan parser SGLang bawaan. Dalam tabel evaluasinya sendiri, model ini melaporkan rata-rata internal 53,9 pada himpunan pembanding pilihan vendor yang tercantum dalam kartu model, AIME 2025/2026 sebesar 86,5, MATH-500 sebesar 94,6, serta skor 46,4 untuk SWE-bench Verified yang dijalankan vendor — angka yang akan menjadi pencapaian luar biasa bagi model dense 2,5 miliar parameter jika skor tersebut bertahan dalam pengujian independen.

Perbandingan langsung yang sudah dicetak oleh seseorang
Because cross-vendor scoreboards are mostly apples-to-oranges, the single most useful artifact in this matchup is the one ModelBest printed itself: MiniCPM5-2B's card lists granite-4.2-3B among its baselines and reports MiniCPM5-2B averaging 53.9 to Granite's 42.7 on that suite. Read it exactly as what it is — one vendor running both models on one suite it selected, unreproduced, with every incentive for its own model to win. It is not a verdict. What it does tell you is that ModelBest was confident enough to put a competitor's 3B on its card, and the gap it claims is largest exactly where its own training invested: the agentic and long-context rows. Treat it as a directional claim, and weigh IBM's own separate card claims before you decide anything on it.
Papan skor, yang diberi label dengan jujur.
• Rilis — MiniCPM5-2B: diumumkan 19 Juli 2026; bobot tersedia 6–7 September, senyap. Granite 4.2 3B: bobot awal Agustus; kartu model dan blog teknis 25 Agustus 2026.
• Peran — MiniCPM5-2B: agen di perangkat dengan penekanan pada penggunaan tool, menurut ModelBest. Granite 4.2 3B: spesialis penalaran, yang sengaja non-agentik menurut IBM.
• Ukuran — MiniCPM5-2B: 2,52B total / 1,98B non-embedding, 42 lapisan. Granite 4.2 3B: ~3B padat, 40 lapisan.
• Konteks — MiniCPM5-2B: 131,072 token pada konfigurasi bawaan. Granite 4.2 3B: 128K native, dapat diperluas hingga 512K.
• Pasca-pelatihan — MiniCPM5-2B: SFT pemikiran mendalam, RL terspesialisasi, Distilasi On-Policy. Granite 4.2 3B: SFT penalaran, GRPO RL dan RLHF; tanpa blok RL-agentik.
• Bukti — MiniCPM5-2B: Klaim kartu ModelBest, tanpa pengujian independen. Granite 4.2 3B: Klaim kartu IBM, tidak dapat direproduksi; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

Papan skor di atas memiliki sumber yang sama dengan teks prosa: setiap angka di dalamnya dilaporkan oleh vendor, dan satu-satunya perbandingan dalam rangkaian yang sama yang dipublikasikan oleh salah satu vendor adalah yang ada di kartu ModelBest itu sendiri.
Spesialis penalaran vs tumpukan agen
Sebelum melihat skornya, tentukan dulu jenis model kecil yang dibutuhkan beban kerja Anda, karena keduanya menjawab pertanyaan yang berbeda. Granite 4.2 3B dibuat untuk penalaran dan konteks panjang pada perangkat keras yang terbatas: jendela native 128K yang dapat diperluas hingga 512K, tiga mode berpikir, jejak yang muat di laptop, dan keputusan eksplisit untuk melewatkan pelatihan agentik. Jika tugas Anda adalah analisis dokumen panjang, konteks skala repositori, atau penalaran multi-langkah yang andal pada perangkat kecil, itu adalah kecocokan yang koheren, dan keputusan IBM untuk tidak mencantumkan klaim agentik pada 3B adalah alasan untuk mempercayai kartu modelnya, bukan sebuah celah di dalamnya. MiniCPM5-2B dibangun dengan penekanan yang berlawanan: perilaku agentik dan penggunaan alat di perangkat — alur pelatihannya seperti daftar hal-hal yang sengaja ditinggalkan oleh Granite 4.2 3B. Jika tugas Anda adalah loop agen di perangkat yang memanggil alat, menjalankan percakapan panjang, dan berpindah antara respons cepat dan respons yang penuh pertimbangan, itulah tumpukan teknologi yang ditujukan untuk Anda, dan ia membawa ketidakpastian tambahan berupa checkpoint yang baru berusia satu minggu dengan kartu model yang belum terverifikasi.
OpenBMB membuka data tersebut, sementara IBM tidak.
Perbedaan yang paling tidak glamor adalah yang paling penting bagi tim yang ingin melakukan fine-tuning. OpenBMB merilis korpora pelatihan MiniCPM5-2B bersama dengan bobotnya — keluarga UltraData, termasuk Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, serta set SFT dan RL untuk agen — semuanya di bawah lisensi Apache-2.0. Ini mengubah model 2B dari kotak hitam menjadi resep yang dapat direproduksi: Anda dapat melihat dari apa post-training agen itu dibangun, lalu melanjutkannya di domain Anda sendiri. IBM merilis bobot Granite 4.2 3B sebagai open source dan memberikan penjelasan teknis yang rinci tentang bagaimana model tersebut dibangun, tetapi tidak dengan data pelatihannya. Bagi organisasi yang ingin memiliki modelnya sendiri alih-alih menyewanya, asimetri itu nyata. MiniCPM5-2B pun hadir dengan kemampuan penerapan yang tidak dapat ditandingi Granite pada ukuran ini: adaptasi sejak hari pertama rilis di sembilan keluarga chip melalui komunitas FlagOS milik ModelBest — mencakup Huawei Ascend, NVIDIA, berbagai akselerator domestik, serta ARM — sebuah sinyal bahwa ModelBest memperkirakan model 2B ini akan dijalankan di luar GPU NVIDIA.
Realita Routing
Tidak satu pun model berada dalam katalog terhosting saat ini, jadi perbandingan ini berlangsung di ranah self-hosted — tetapi justru di situlah lapisan routing masih mempertahankan nilainya sebagai jaring pengaman, bukan sebagai mekanisme pengiriman. Ketika sebuah tim ingin mencoba model agentic 2B yang baru berumur seminggu melawan model reasoning 3B pada beban kerja yang sudah dilayaninya, langkah yang dapat dibalik adalah mengarahkan jalur pengujian ke build MiniCPM5-2B self-hosted melalui satu API dengan failover otomatis, sementara produksi tetap berada di model yang sudah terbukti — tumpukan baru bisa macet tanpa merobohkan apa pun, dan harga daftar penyedia untuk model terhosting yang Anda bandingkan diteruskan dengan markup 0%, sehingga A/B tetap murah. Lapisan ini tidak menghosting salah satu model; lapisan ini membuat eksperimen aman untuk dijalankan dan mudah untuk dibalik.
Model kecil mana yang seharusnya benar-benar Anda jalankan
Jalankan Granite 4.2 3B jika beban kerja Anda adalah penalaran konteks panjang pada perangkat kelas laptop dan Anda menginginkan tiga mode berpikir, batas 512K, serta kartu model jujur yang memaparkan secara persis apa saja yang tidak dilatihkan pada model 3B tersebut. Jalankan MiniCPM5-2B jika beban kerja Anda adalah agen on-device interaktif pemanggil alat (tool-calling) dan model 2.5B muat dalam anggaran memori Anda — tetapi alokasikan waktu untuk mereproduksi angka-angka utamanya sebelum Anda memercayainya, karena rata-rata 53.9 dan klaim SWE-bench 46.4 itu baru klaim vendor, belum terverifikasi pihak lain. Dua hal akan menyelesaikan duel ini lebih cepat daripada opini mana pun: uji independen terhadap MiniCPM5-2B yang mengonfirmasi atau menggugurkan klaim agenik tersebut, serta ketahanan angka penalaran IBM saat direproduksi oleh komunitas. Sampai salah satunya terwujud, Granite 4.2 3B adalah model kecil yang lebih aman dan terdokumentasi lebih baik saat ini, dan MiniCPM5-2B adalah taruhan yang lebih menarik.
