
Kolibri vs MiniCPM5-2B: 78 Miliar Parameter Melawan 2,5, dan Mengapa yang Kecil Bukan Pilihan Murah
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 217 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Letakkan Kolibri di samping MiniCPM5-2B dan pembacaan instingtifnya adalah bahwa ini adalah perbandingan ukuran, dan bahwa model 2,5 miliar parameter adalah pilihan yang ekonomis. Pembacaan itu salah dengan cara yang mendidik. Kolibri adalah model mixture-of-experts 78,1 miliar parameter milik Aleph Alpha, yang dirilis pada 3 Oktober 2026, mengaktifkan 3,46 miliar parameter per token, dengan jejak FP8 sekitar 78 GB dan konfigurasi penyajian minimum dua kartu A100 80 GB. MiniCPM5-2B adalah model dense 2,52 miliar parameter dari ModelBest dan OpenBMB, yang diperkenalkan pada Konferensi Kecerdasan Buatan Dunia pada 19 Juli 2026 dengan bobot tiba di Hugging Face pada 6 September. MiniCPM5-2B tiga puluh satu kali lebih kecil berdasarkan jumlah parameter. Ia juga yang menuntut anggaran evaluasi sebelum Anda memercayainya, karena angka-angka yang paling banyak dikutip dijalankan vendor dan tidak direproduksi — yang justru merupakan kebalikan dari apa yang biasanya disiratkan oleh "model kecil" tentang risiko.
Keduanya dirilis secara diam-diam; hanya satu di antaranya yang dirilis baru-baru ini.
Mereka memiliki kisah asal-usul yang serupa dan usia yang sangat berbeda, dan usia itu penting. Repositori Aleph Alpha untuk Kolibri dibuat pada 2 Oktober 2026 dengan tanggal rilis yang dinyatakan yaitu 3 Oktober, dan pengumuman ruang berita milik vendor sendiri terbit pagi itu, pada Hari Reunifikasi Jerman. Pers AI umum sebagian besar melewatkannya pada hari itu, dan dari situlah kerangka "peluncuran senyap" berasal, tetapi kartu model, laporan teknis, dan unggahan vendor bukanlah peluncuran senyap. MiniCPM5-2B benar-benar lebih senyap: pengumuman WAIC pada Juli adalah peluncuran di konferensi berupa pitch dan spesifikasi, dan bobot aktualnya baru muncul pada 6 September, diterbitkan tanpa acara peluncuran, bersama dengan checkpoint GGUF, MLX, GPTQ, base, SFT, dan draft serta korpus pelatihan di baliknya.
Jeda lima minggu antara pengumuman dan bobot itu layak diingat, karena itulah sebabnya dua kumpulan angka yang berbeda beredar untuk model ini. Materi bulan Juli mengunggulkan jendela konteks 512K token. Konfigurasi yang dikirimkan menetapkan 131.072. Artefak yang dirilis itulah yang penting.
Untuk apa sebenarnya setiap model
Kolibri dibangun untuk pekerjaan dokumen berbahasa Jerman dan Inggris, dan Aleph Alpha luar biasa spesifik tentang mengapa hal itu membutuhkan rekayasa yang sungguhan. Eksperimen model proksi kecil menetapkan target sekitar 20 persen bahasa Jerman dalam campuran pelatihan, yang untuk proses 20 triliun token berarti menemukan 4 triliun token bahasa Jerman. Dataset Jerman terbuka yang telah dideduplikasi dan difilter menghasilkan 390 miliar — kurang satu orde besaran — sehingga lab tersebut menyetel ulang filter Common Crawl khusus untuk bahasa Jerman, menghasilkan 1,3 triliun token organik unik, dan menulis ulang dokumen Jerman yang sudah ada menjadi entri ensiklopedia, dialog, dan bagian teks untuk sekitar satu triliun token lagi, yang menjadi sumber tunggal terbesar bahasa Jerman. Terjemahan, yang digunakan untuk pendahulunya, Kolibri Origin, ditinggalkan untuk Kolibri. Detail filter itulah yang perlu diingat: pipeline data bahasa standar membuang dokumen dengan terlalu banyak kata panjang, dan prosa administratif bahasa Jerman rutin melampaui batas bahasa Inggris untuk rata-rata panjang kata, sehingga pengaturan bawaan diam-diam menghapus ragam bahasa yang digunakan administrasi publik untuk menulis.
MiniCPM5-2B dibangun untuk ujung yang berlawanan — agen on-device. Kartu tersebut menjelaskan transformer padat dengan total 2,52 miliar parameter, 1,98 miliar non-embedding, 42 lapisan pada ukuran tersembunyi 2048, attention grouped-query dengan 16 head query dan 2 head KV, serta arsitektur LlamaForCausalLM standar tanpa kernel kustom. Pipeline pelatihannya condong ke agentic: mid-training agen berskala 200 miliar, set agent-SFT yang besar, penyelarasan RL agen, dan tahap akhir On-Policy Distillation yang melipat enam belas model ahli RL kembali menjadi satu jaringan padat kecil. Model ini menyertakan pemanggilan alat bergaya XML dengan parser SGLang bawaan, dan konfigurasi yang dirilis menetapkan jendela 131.072 token.
• Parameter — Kolibri: total 78.103.074.560, aktif 3.457.573.120, sparsitas 22,6:1. MiniCPM5-2B: total 2.516.756.480, non-embedding 1,98 miliar, padat.
• Dirilis — Kolibri: 3 Oktober 2026. MiniCPM5-2B: diumumkan 19 Juli 2026, bobot 6 September 2026.
• Konteks — Kolibri: 16,384 terlatih, 65,536 terlatih-menengah, 262,144 asli, 1,048,576 divalidasi. MiniCPM5-2B: 131,072 dalam konfigurasi yang dikirim; klaim 512K dari Juli tidak ada di dalamnya.
• Jejak — Kolibri: sekitar 78 GB dalam FP8; minimal dua A100 80 GB, dua H100 SXM5, satu H200, satu B200, atau satu B300. MiniCPM5-2B: satu shard BF16, kelas laptop.
• Bahasa — Kolibri: Jerman dan Inggris, memang dirancang begitu dan tidak ada yang lain. MiniCPM5-2B: Inggris dan Tionghoa, dengan semua rangkaian evaluasi yang diterbitkan dalam bahasa Inggris.
• Pemanggilan alat — Kolibri: gaya Hermes dengan parser vLLM bawaan. MiniCPM5-2B: gaya XML dengan parser SGLang.
• Lisensi — keduanya Apache 2.0, keduanya tanpa adendum penggunaan yang dapat diterima.

Papan skor, dan sumber di baliknya
Tidak ada angka head-to-head untuk pasangan ini di mana pun, dalam materi kedua vendor, dan kami tidak akan menyusunnya dari dua harness yang berbeda lalu menyebutnya perbandingan. Apa yang dipublikasikan masing-masing pihak layak dipisahkan dengan hati-hati, karena kedua kumpulan angka itu membawa jumlah bukti yang sangat berbeda.
Angka-angka Kolibri berasal dari tabel perbandingan empat belas model milik Aleph Alpha sendiri, yang dijalankan pada satu harness dengan Kolibri pada reasoning effort high: 75,5 pada rata-rata bahasa Inggris, 70,8 pada rata-rata bahasa Jerman. Tabel itu tidak menyanjung subjeknya — Qwen3.8 27B mencetak 80,2 dan 79,9 pada dua rata-rata yang sama dan memimpin pada GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified dan kedua tolok ukur konteks panjang, sambil mengaktifkan kira-kira seperdelapan parameter Kolibri. Pembingkaian vendor untuk celah itu adalah frontier Pareto kualitas terhadap token terdekode per detik per GPU, yang tidak dilampaui oleh model mana pun yang dibandingkan. Ini argumen ekonomi penyajian, bukan argumen kemampuan, dan belum ada pihak ketiga yang mengukurnya: tidak ada entri Artificial Analysis untuk Kolibri dan tidak ada replikasi harness tersebut.
Angka-angka MiniCPM5-2B berasal dari kartu modelnya sendiri: rata-rata internal sebesar 53,9 pada kumpulan pembanding yang dipilih vendor, AIME 2025/2026 sebesar 86,5, MATH-500 sebesar 94,6, dan 46,4 yang dijalankan vendor pada SWE-bench Verified yang akan luar biasa untuk model dense 2,5 miliar parameter jika lolos pengujian independen. Pada kartu itu, Granite 4.2 3B milik IBM berada di 42,7 berhadapan dengan 53,9 milik MiniCPM5-2B — satu vendor menjalankan kedua model pada satu suite yang dipilihnya. Suite berbeda, harness berbeda, vendor berbeda. Tidak satu pun dari itu merupakan putusan atas pasangan ini.
Yang benar-benar berguna di sisi MiniCPM5-2B adalah pengungkapannya. OpenBMB merilis korpora pelatihan UltraData bersama bobotnya — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, set SFT dan RL agen — semuanya Apache 2.0, yang mengubah kotak hitam menjadi resep yang dapat diperiksa dan dilanjutkan pada domain Anda sendiri. Model ini juga hadir dengan adaptasi sejak hari nol di sembilan keluarga chip melalui komunitas FlagOS milik ModelBest, dari Huawei Ascend hingga NVIDIA dan ARM, yang merupakan pernyataan penerapan, bukan pernyataan tolok ukur. Sebaliknya, IBM menerbitkan bobot Granite 4.2 3B dan uraian teknis terperinci tentang pembuatannya, tetapi tidak data pelatihannya, dan Aleph Alpha menerbitkan pipeline data serta perhitungan energi Kolibri — 20 triliun token pra-pelatihan, 9,5×10² MWh termasuk overhead pusat data dan tidak termasuk fine-tuning terawasi serta pembelajaran penguatan — tetapi bukan korpusnya sendiri.
Di mana kesenjangan ukuran sebenarnya terlihat
Cara paling berguna untuk membandingkan keduanya secara berdampingan adalah pada dua sumbu yang menentukan penerapan nyata: apa yang harus ada di ruangan, dan apa yang terjadi ketika model salah.
Pada perangkat keras, MiniCPM5-2B menang dan selisihnya jauh. Model dense 2,52 miliar parameter dalam satu shard BF16 dapat berjalan di laptop, perangkat edge, atau satu GPU konsumen, dan dukungan FlagOS di sembilan keluarga chip berarti model ini dapat berjalan pada perangkat keras yang sama sekali bukan akselerator NVIDIA. Batas bawah Kolibri adalah dua kartu A100 80 GB atau satu B200, sekitar 78 GB bobot FP8, yang dilayani melalui plugin vLLM aleph-alpha-inference atau container yang dipublikasikan. Untuk beban kerja smart-cockpit atau yang terkait ponsel, 2B adalah satu-satunya dari keduanya yang memenuhi syarat, dan Kolibri tidak pernah dirancang untuk bersaing di sana.
Dalam hal keterverifikasian, Kolibri menang karena alasan yang lebih halus. Klaimnya yang paling banyak dikutip — ekonomi penyajian — belum diuji, tetapi angka kualitasnya setidaknya dipublikasikan terhadap tiga belas pesaing yang disebutkan namanya pada satu harness dengan pengaturannya diungkapkan, dan tabel milik vendor sendiri menyerahkan kemenangan pada sebagian besar baris kepada lawan. Angka utama MiniCPM5-2B berasal dari vendor pada suite milik vendor tanpa harness pembanding yang diungkapkan, dan model ini membawa ketidakpastian tambahan berupa checkpoint yang usianya berminggu-minggu, bukan beberapa hari. Kedua model belum diuji tolok ukur secara independen. Perbedaannya adalah satu vendor menuliskan perbandingan yang membuat modelnya sendiri kalah, dan vendor lain menuliskan perbandingan yang membuat modelnya sendiri menang dengan selisih besar.
Dengan sengaja, tidak ada persaingan sama sekali. Kolibri hadir untuk pemrosesan dokumen berbahasa Jerman secara on-premises, dengan tokenizer bilingual yang menurut laporan Aleph Alpha mencapai rata-rata 4,90 byte per token pada teks web berbahasa Jerman, dibandingkan dengan 4,35 milik GPT-5 dan 3,28 milik Kimi K3 — semuanya diukur oleh vendor, dan merupakan efek biaya per token, bukan klaim kualitas. MiniCPM5-2B hadir untuk agen pemanggil alat dalam bahasa Inggris dan Tionghoa pada perangkat keras terbatas. Tim dengan kontrak berbahasa Jerman dan persyaratan kepatuhan tidak sedang memilih di antara keduanya.

Realitas perutean, dan eksperimen yang layak dijalankan
Tidak ada dari kedua model ini yang berada di katalog terhosting saat ini, dan kami memeriksa keduanya, bukan sekadar berasumsi. Kolibri tidak memiliki SKU API dari vendor — rilisnya berupa bobot, laporan teknis, dan image kontainer — dan tidak ada di OrcaRouter: kami menelusuri katalog dengan setiap ejaan awalan vendor dan nama model, dan hasilnya tidak ditemukan. MiniCPM5-2B juga tidak memiliki endpoint terhosting dari ModelBest, dan tidak dirutekan di layanan kami. Keduanya adalah opsi self-hosted dan kami lebih memilih mengatakan demikian daripada menyiratkan bahwa kami melayani salah satunya.
Yang membuat ini menarik adalah eksperimennya. Model agentic 2,5 miliar parameter dan model dokumen 78 miliar parameter menyelesaikan masalah yang berbeda, dan satu-satunya cara untuk mengetahui mana yang dibutuhkan beban kerja Anda adalah dengan menjalankan keduanya terhadapnya — yang justru merupakan situasi yang memang dirancang untuk lapisan routing, bahkan ketika lapisan itu tidak membawa salah satu model pun. Arahkan jalur uji ke build MiniCPM5-2B yang di-hosting sendiri melalui satu endpoint yang kompatibel dengan OpenAI dengan failover otomatis, sementara produksi tetap pada model yang sudah teruji lewat routing, dan stack baru itu bisa macet atau menghasilkan omong kosong tanpa membuat apa pun tumbang. Harga daftar penyedia pada model yang Anda bandingkan diteruskan tanpa markup, sehingga A/B tetap murah dan bisa dibalik. Dan jika yang sebenarnya terungkap dari eksperimen itu adalah bahwa beban kerja bahasa Jerman Anda tidak membutuhkan kedua model yang di-hosting sendiri itu, kunci yang sama dapat menjangkau tier mixture-of-experts kecil yang sudah diarahkan — varian Gemma 4 26B-A4B dengan $0,06 per juta token input dan $0,33 per juta token output, dengan jendela 262.144 token serta input teks, gambar, dan video — yang merupakan cara termurah untuk mengetahuinya sebelum Anda membeli dua GPU.
Yang mana, dan apa yang akan mengubah jawabannya
Jalankan MiniCPM5-2B jika kendalanya adalah perangkat. Dengan 2,52 miliar parameter, ia satu-satunya dari keduanya yang muat di laptop, kokpit, atau edge box, dan jika beban kerja Anda adalah agen pemanggil alat interaktif dalam bahasa Inggris atau Mandarin, itulah model yang ditujukan untuk itu. Sisihkan waktu untuk mereproduksi angkanya terlebih dahulu — rata-rata 53,9 dan klaim SWE-bench 46,4 hanya milik ModelBest, dan terbukanya korpus pelatihan membuat reproduksi itu benar-benar mungkin, bukan sekadar teoretis.
Jalankan Kolibri jika korpusnya berbahasa Jerman, perangkat kerasnya tersedia, dan bobotnya tidak boleh meninggalkan gedung. Jendela native 262.144 token, cache KV FP8, empat tingkat upaya penalaran, dan pemanggilan alat Hermes adalah bentuk yang tepat untuk pekerjaan dokumen yang diatur regulasi, dan ketentuan Apache 2.0 plus pipeline data yang dipublikasikan adalah bagian yang bertahan dalam tinjauan pengadaan.
Dua hal akan menyelesaikan ini lebih cepat daripada argumen apa pun. Uji coba SWE-bench Verified independen pada MiniCPM5-2B akan mengonfirmasi atau menggugurkan klaim paling mengejutkan yang dibuat oleh kedua kartu tersebut. Dan pengukuran throughput independen Kolibri pada konfigurasi dua-H100 yang direkomendasikannya — atau entri Artificial Analysis, yang belum ada saat ini — akan mengubah "78 miliar parameter" dari spesifikasi menjadi biaya, yakni angka yang sebenarnya dicari oleh siapa pun yang menimbang perbandingan ini terhadap perangkat keras. Sampai saat itu, kesenjangan ukuran itu nyata, kesenjangan tujuan lebih besar, dan opsi yang tampak murah adalah yang membawa klaim yang belum terverifikasi.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
