Kartu judul utama untuk perbandingan 'MiniCPM5-2B-DSpark vs Gemma 4 12B' dengan subjudul 'Dua cara menyusun draf, dua kelas bobot AI lokal', yang menampilkan sebuah chip kecil berlabel '324M draf' yang mengalir ke sebuah blok berlabel 'target 2.5B pada perangkat' di sisi kiri, serta panel yang lebih lebar berlabel 'generalis multimodal 11.95B' di sisi kanan, dengan garis alur chip token di atasnya berlabel 'rancang lalu verifikasi', dan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

MiniCPM5-2B-DSpark vs Gemma 4 12B: Dua Cara Menulis, Dua Kelas Bobot AI Lokal

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara tercepat untuk melihat mengapa MiniCPM5-2B-DSpark dan Gemma 4 12B layak berada di halaman yang sama adalah dengan mengabaikan ukurannya sejenak dan memperhatikan bagaimana masing-masing menulis sebuah kalimat. Keduanya mengakali bus memori dengan drafter: model kecil mengusulkan beberapa token berikutnya sekaligus, lalu model yang sebenarnya memverifikasi blok tersebut dalam satu lintasan, sehingga silikon membayar biaya pemuatan bobot sekali per blok, bukan sekali per token. MiniCPM5-2B-DSpark adalah drafter yang diunggah OpenBMB ke Hugging Face pada 6 September 2026 tanpa banyak gembar-gembor — sebuah checkpoint pendamping berparameter 323,8 juta yang mempercepat MiniCPM5-2B, model on-device padat berparameter 2,52 miliar yang diumumkan ModelBest di WAIC pada 19 Juli 2026. Gemma 4 12B adalah model generalis multimodal tanpa encoder milik Google dengan 11,95 miliar parameter, diluncurkan pada 3 Juni 2026 dengan drafter bawaan sendiri dan konteks 256K. Yang satu menjual drafter sebagai checkpoint Apache-2.0 terpisah yang Anda muat sendiri; yang lain menyembunyikan trik serupa di dalam satu model besar yang tinggal Anda jalankan.

Catatan kejujuran yang menentukan bentuk artikel ini: {{1}}MiniCPM5-2B-DSpark{{/1}} bukanlah model yang bisa di-prompt. Ia tidak memiliki tokenizer, chat template, maupun keluaran mandiri — hanyalah kartu yang memuat {{2}}model.safetensors{{/2}}, {{3}}config{{/3}}, dan {{4}}README{{/4}}. Ia adalah aksesori lapisan serving untuk target kelas {{5}}2B{{/5}}, dan perbandingan yang sesungguhnya dilakukan pembaca adalah antara dua kelas bobot AI lokal: stack {{6}}2B{{/6}} seukuran ponsel yang menyusun draf token-tokennya, versus generalis {{7}}12B{{/7}} sebesar 16 gigabyte yang menyusun draf token-tokennya. Semua hal lain di bawah ini adalah perwujudan konkret dari keputusan itu.

Apa sebenarnya MiniCPM5-2B-DSpark itu

Kartu model adalah seluruh permukaan publik dari rilis tersebut, jadi inilah yang dapat diketahui darinya. MiniCPM5-2B-DSpark adalah checkpoint draf DSpark: lima lapisan atensi penuh, 323.776.001 parameter, atensi kueri terkelompok dengan 16 kepala kueri dan 2 kepala KV, serta ukuran blok tujuh — ia mengusulkan hingga tujuh token kandidat per forward pass untuk diverifikasi oleh target MiniCPM5-2B. Konfigurasi tersebut mendeklarasikan arsitektur Qwen3DSparkModel dengan auto-map DSparkDraftModel, dan checkpoint ini dilengkapi dengan kepala kepercayaan dan kepala Markov dari metode DSpark (arXiv 2607.05147, makalah D​eepSeek terbitan Juli 2026) yang masih aktif — yaitu verifikator sadar-beban yang memutuskan kapan sebuah sufiks tidak layak untuk diperiksa. Model ini dilatih selama enam epoch pada 7,05 miliar token dari respons yang dihasilkan MiniCPM5-2B untuk berbagai prompt umum, matematika, dan kode.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

Kartu openbmb/MiniCPM5-2B-DSpark di atas adalah keseluruhan dari yang dirilis: kartu model, konfigurasi, satu berkas Safetensors, dan tanpa pengumuman, tanpa postingan blog, tanpa siaran pers — sebuah rilis bobot yang tenang, baru berumur satu hari saat tulisan ini dibuat.

Apa yang tidak dimuat oleh kartu tersebut sama pentingnya dengan apa yang dimuatnya. Kartu itu melaporkan panjang penerimaan — pada evaluasi repo itu sendiri, agregat 5,52 token yang diterima per langkah verifikasi pada decoding serakah, dengan matematika 6,05 dan kode 6,11 dari batas tujuh token — tetapi tidak menerbitkan percepatan waktu dinding, tidak ada angka token per detik, dan tidak ada tolok ukur independen. Mesin DSPARK milik SGLang adalah jalur penyajian yang terdokumentasi, dengan draf dimuat di samping target MiniCPM5-2B. Dengan kata lain: kualitas draf telah terukur, tetapi keuntungannya belum, dan siapa pun yang mengadopsinya harus mengukur sebelum percaya.

Apa yang Gemma 4 12B bawa ke sisi lain

Gemma 4 12B adalah anak tengah dari keluarga Gemma 4 milik Google dan berada di titik yang sepenuhnya berbeda pada kurva AI lokal. Model ini merupakan satu model padat 11,95B yang menerima teks, gambar, audio, dan video sebagai masukan tanpa encoder terpisah, mengikuti panggilan alat secara langsung, serta memasangkan konteks native 256K dengan drafter prediksi multi-token yang menerapkan trik memory-bus yang sama secara internal — tetapi dari dalam checkpoint, sehingga tidak ada hal tambahan yang perlu Anda unduh atau rangkai. Model ini berlisensi Apache 2.0, dalam praktiknya berjalan di laptop 16GB, dan hadir dengan seluruh perlengkapan Google: evaluasi peluncuran, kartu model untuk varian dasar dan instruksi, dukungan ekosistem di Model Garden, LM Studio, dan Ollama. Model ini telah didukung oleh penerapan komunitas selama berbulan-bulan, sesuatu yang tidak dimiliki draf MiniCPM yang baru berusia satu hari itu.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

Kartu model Google untuk Gemma 4 12B di atas adalah kontras dalam satu bingkai: sebuah generalis multimodal yang matang yang para penyusunnya menjadi fitur dari rilis, bukan repositori terpisah.

Spesifikasinya, dilabeli dengan jujur

Bacalah ini dengan mempertimbangkan sumbernya: angka MiniCPM5-2B adalah klaim kartu ModelBest yang belum direproduksi; angka Gemma 4 12B adalah milik Google sendiri, yang sudah lama digunakan oleh komunitas.

• Apa yang Anda jalankan — MiniCPM5-2B-DSpark: draf 324M yang hanya berfungsi bila dipasangkan dengan MiniCPM5-2B (dense 2,52B, 42 lapisan). Gemma 4 12B: model dense mandiri 11,95B.

• Konteks — Target MiniCPM5-2B: 128K native. Gemma 4 12B: 256K native.

• Modalitas — MiniCPM5-2B stack: hanya teks. Gemma 4 12B: input teks, gambar, audio, dan video, tanpa encoder.

- Penyusunan draf — MiniCPM5-2B-DSpark: draf DSpark eksternal, tujuh token per lintasan, mesin SGLang DSPARK. Gemma 4 12B: pembuat draf prediksi multi-token internal, tidak perlu menginstal apa pun.

• Ukuran — MiniCPM5-2B menargetkan sekitar 5GB dalam BF16, ditambah file draft ~650MB; Gemma 4 12B sekitar 18GB dalam BF16, praktis dijalankan pada perangkat kelas 16GB bila dikuantisasi.

• Bukti — MiniCPM5-2B-DSpark: hanya angka durasi acceptance di repositori, baru berumur satu hari. Gemma 4 12B: evaluasi peluncuran ditambah berbulan-bulan pemakaian oleh komunitas.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Papan skor di atas merupakan potret yang sama dalam enam baris: kedua kolom tersebut tidak sepakat tentang hampir semua hal, kecuali strategi yang sama-sama mereka gunakan untuk menulis dengan cepat.

Kelas berat mana yang sesuai dengan silikon yang benar-benar Anda miliki?

Karena MiniCPM5-2B-DSpark bukanlah sebuah model, perbedaan yang bermakna adalah kelas bobot model target versus Gemma 4 12B — dan perbedaan itu sebagian besar adalah persoalan perangkat keras. Ponsel, papan kokpit pintar, atau kotak edge kecil dengan beberapa gigabyte DRAM tidak dapat menjalankan model 11.95B pada kecepatan yang berguna; bus memori justru adalah hambatan yang akan mencekiknya. Untuk dunia itulah tumpukan MiniCPM5-2B dibuat — model dense 2B yang bobotnya muat di memori perangkat, dengan draft yang ditempelkan untuk membeli kembali sebagian token per detik yang disia-siakan model dense kecil. Decoding spekulatif paling efektif justru dalam rezim yang dense dan terikat memori ini, sehingga draft adalah bagian yang menarik dari rilis ini, bukan sekadar gimmick.

Gemma 4 12B adalah jawaban satu kelas berat di atasnya. Jika perangkat Anda memiliki RAM 16GB atau lebih — laptop, workstation, server edge yang tangguh — Anda dapat membawa generalis multimodal ini, dan Anda mendapatkan tiga hal yang tidak bisa ditawarkan oleh tumpukan 2B: input gambar, audio, dan video tanpa encoder atau pipeline kedua; jendela 256K untuk pekerjaan skala repositori atau skala dokumen; dan kematangan yang tidak dimiliki oleh checkpoint draf yang baru berumur satu hari. Anda mengorbankan kemampuan untuk berjalan di perangkat terkecil dan membayar sekitar tiga kali lipat jejak memori.

Realitas perutean untuk keduanya.

Saat ini, tidak ada satu pun sisi dari perbandingan ini yang ada di katalog ter-hosting, termasuk OrcaRouter. MiniCPM5-2B-DSpark pada dasarnya adalah aksesori serving yang di-hosting sendiri — Anda menjalankan tumpukan SGLang sendiri, dan draf tersebut hanya ada dalam deployment lokal Anda. Gemma 4 12B adalah model open-weight, jadi Anda menyajikannya sendiri atau menggunakannya di tempat yang memang sudah menyediakannya. Justru di sinilah lapisan perutean berfungsi sebagai jaring pengaman, bukan sebagai mekanisme pengiriman: ketika Anda menguji build draf yang benar-benar baru terhadap beban kerja yang sudah Anda layani, mengarahkan jalur uji melalui satu API dengan failover otomatis berarti tumpukan yang belum teruji bisa macet tanpa menjatuhkan produksi, dan harga yang tertera oleh penyedia di sekitarnya diteruskan dengan markup 0%, sehingga perubahan harga pada model ter-hosting mana pun yang Anda bandingkan akan tampak di hari yang sama. Namun untuk perbandingan itu sendiri, rencana yang jujur untuk kedua model tetap sama: Anda melakukan self-hosting, jadi tolok ukur yang paling relevan adalah yang Anda jalankan di perangkat keras Anda sendiri.

Putusan

MiniCPM5-2B-DSpark dan Gemma 4 12B bukanlah pesaing dalam arti head-to-head — keduanya adalah dua kelas berat dari AI lokal yang kebetulan berbagi trik yang sama. Pilih tumpukan MiniCPM5-2B dengan draft DSpark-nya ketika perangkat Anda tidak sanggup membawa model 12B dan Anda menginginkan model berbasis teks, berlisensi Apache-2.0, berorientasi agen yang muat di memori perangkat; draft tersebut adalah percepatan gratis yang menjanjikan, tetapi ukur sendiri pada build SGLang Anda sebelum mempercayainya, karena keuntungannya masih belum terukur. Pilih Gemma 4 12B ketika perangkat keras Anda memiliki ruang yang cukup dan Anda menginginkan satu model multimodal dengan jendela 256K serta ekosistem yang mendukungnya. Pertanyaannya bukan model mana yang lebih pintar — melainkan mana yang benar-benar dapat dijalankan oleh silikon Anda.