
Kolibri vs Granite 4.2 3B: Taruhan Sparsitas 78B, dan Model 3B yang Menolak Bermain di Permainan yang Sama
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 217 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Letakkan Kolibri dan Granite 4.2 3B berdampingan dan observasi jujur pertama adalah bahwa ini bukan pertarungan yang adil, dan bukan ke arah yang Anda duga. Kolibri adalah model mixture-of-experts milik Aleph Alpha dengan 78,1 miliar parameter, dirilis pada 3 Oktober 2026, mengaktifkan 3,46 miliar parameter per token. Granite 4.2 3B adalah model penalaran dense milik IBM dengan sekitar tiga miliar parameter, yang bobotnya tiba di Hugging Face pada 7 Agustus 2026 dengan kartu model dan blog teknis menyusul pada 25 Agustus. Yang satu dua puluh enam kali lipat yang lain dalam hal total parameter. Alasan keduanya masuk dalam keputusan yang sama adalah karena keduanya Apache 2.0, keduanya hanya teks, keduanya dirancang untuk di-host sendiri, dan keduanya ditujukan pada pembeli yang sama: tim yang menginginkan kecerdasan dokumen pada perangkat keras yang dikendalikannya, dengan provenans untuk lolos tinjauan pengadaan. Pertanyaan yang menarik bukanlah mana yang lebih baik. Melainkan apa yang sebenarnya dibeli oleh anggaran parameter dua puluh enam kali lipat itu, dan berapa biaya untuk menanggungnya.
Ketidaksesuaian itu, dinyatakan secara lugas.
Granite 4.2 3B adalah model padat mandiri yang dilatih lanjut dari Granite-4.1-3B-Base, bagian dari keluarga Granite 4.2 yang dikirim IBM hingga Agustus. Model ini memiliki 40 lapisan dengan grouped-query attention, konteks asli 128K yang diperluas IBM menjadi 512K pada fase pra-pelatihan kelima, serta tiga mode berpikir per kueri: berpikir penuh secara default, jalur usaha rendah, dan jalur tanpa berpikir. Kartu IBM ini luar biasa terbuka tentang apa yang bukan merupakan 3B. Berbeda dari saudaranya 8B dan 30B, model ini sengaja melewatkan blok pembelajaran penguatan agentik khusus yang dilatih di lingkungan SWE-agent, terminal, dan pencarian; itulah sebabnya IBM sama sekali tidak mencantumkan angka SWE-bench untuknya dan menggambarkan model ini sebagai spesialis penalaran, bukan agen.
Kolibri mengambil arah sebaliknya pada setiap sumbu. Lima puluh layer, semuanya mixture-of-experts, 384 expert per layer dengan satu shared dan enam routed, serta rasio sparsitas sekitar 22,6 banding 1. Konteksnya secara native 262.144 token, tervalidasi hingga 1.048.576, dengan kartu merekomendasikan agar Anda tetap pada atau di bawah 262.144 untuk pekerjaan yang sensitif terhadap latensi. Empat tingkat upaya penalaran. Pemanggilan alat bergaya Hermes dengan parser vLLM yang disertakan dalam repositori yang sama dengan bobotnya. Dan footprint sekitar 78 GB dalam FP8, dengan konfigurasi minimum pada kartunya adalah dua kartu A100 80 GB, dua H100 SXM5, satu H200, satu B200, atau satu B300.
• Parameter — Kolibri: total 78.103.074.560, 3.457.573.120 aktif per token. Granite 4.2 3B: sekitar 3B dense, semua parameter aktif pada setiap token.
• Konteks — Kolibri: 16,384 terlatih, 65,536 terlatih menengah, 262,144 asli, 1,048,576 tervalidasi. Granite 4.2 3B: 128K asli, diperluas hingga 512K.
• Mode berpikir — Kolibri: tidak ada, rendah, sedang, tinggi, diatur melalui templat chat. Granite 4.2 3B: penuh, upaya rendah, dan tanpa berpikir, per kueri.
• Pemanggilan alat — Kolibri: gaya Hermes, dengan parser yang sudah disertakan. Granite 4.2 3B: ya, tetapi bukan jalur terlatih agentic-RL yang diperoleh saudara-saudaranya yang lebih besar.
• Bahasa — Kolibri: Jerman dan Inggris, memang dirancang begitu dan tidak ada yang lain. Granite 4.2 3B: mengutamakan bahasa Inggris, dengan pelatihan multibahasa IBM yang lebih luas di baliknya.
• Jejak — Kolibri: sekitar 78 GB dalam FP8, minimal dua GPU. Granite 4.2 3B: sekitar 6–8 GB dalam bfloat16, di bawah 2 GB terkuantisasi, kelas laptop.
• Lisensi — keduanya Apache 2.0, keduanya tanpa klausul penggunaan yang dapat diterima atau ambang batas pengguna aktif bulanan.
• Penyajian — Kolibri: plugin vLLM aleph-alpha-inference atau image kontainer yang dipublikasikan. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF dan Ollama di bawah granite4.2:3b.

Apa Manfaat dari 75 Miliar Parameter Ekstra
Tiga hal, dan penting untuk bersikap tepat mengenai mana di antaranya yang sudah mapan dan mana yang baru diklaim.
Yang pertama adalah bahasa Jerman. Inilah perbedaan nyata yang paling tajam antara kedua model dan ini bukan baris tolok ukur. Aleph Alpha membangun Kolibri di sekitar korpus bilingual Jerman-Inggris, menargetkan sekitar 20 persen bahasa Jerman dalam proses pra-pelatihan 20 triliun token, dan berakhir dengan kumpulan bahasa Jerman berisi 2,4 triliun token yang 80 persennya dikurasi atau dihasilkan sendiri oleh laboratorium itu. Kartu itu menjelaskan mengapa hal tersebut membutuhkan kerja keras: kumpulan data Jerman terbuka yang telah dideduplikasi hanya menyediakan 390 miliar token, kurang satu orde besaran, jadi laboratorium itu menyetel ulang filter Common Crawl khusus untuk bahasa Jerman dan memparafrasakan dokumen Jerman yang ada menjadi entri ensiklopedia, dialog, dan bagian teks. Detail tentang filter itulah yang perlu diingat. Pipeline data bahasa standar membuang dokumen dengan terlalu banyak kata panjang, dan prosa administratif Jerman secara rutin melampaui batas bahasa Inggris untuk panjang kata rata-rata — sehingga pengaturan default diam-diam menghapus register yang digunakan oleh administrasi publik. IBM tidak membangun Granite untuk korpus itu. Granite 4.2 3B akan menangani bahasa Jerman; model ini tidak dirancang di sekitar register hukum dan administratif Jerman, dan tidak ada leaderboard yang akan memberi tahu Anda perbedaannya.
Yang kedua adalah konteks panjang yang bertahan pada dokumen nyata. Plafon 512K Granite memang benar-benar besar, tetapi kedua model mencapainya dengan cara yang berbeda dan desain posisional Kolibri adalah argumen konteks panjang yang lebih konvensional. Perlakukan angka RULER IBM — 67,52 pada 64K dan 55,30 pada 128K dalam materi terbitan keluarga 4.2 — sebagai pengungkapan jujur tentang seberapa besar kualitas retrieval menurun pada 128K, dan ingatlah bahwa Kolibri sama sekali tidak memiliki kurva degradasi terbitan yang setara.
Yang ketiga adalah ruang gerak penalaran mentah, dan di sinilah jawaban jujurnya adalah "tidak sebanyak yang disiratkan oleh rasio parameter". Pipeline pelatihan Kolibri memberinya proses pra-pelatihan 20 triliun token pada 768 NVIDIA B200 selama 21 hari, dan tabel perbandingan Aleph Alpha sendiri, dengan Kolibri pada upaya penalaran tinggi, menempatkannya di 75,5 pada rata-rata bahasa Inggris dan 70,8 pada rata-rata bahasa Jerman dari perbandingan empat belas model — di mana ia kalah dari model padat 27 miliar parameter dari Alibaba pada sebagian besar baris. Klaim utama Granite 4.2 3B adalah miliknya sendiri: AIME 2025 di 78,33, GPQA di 54,80, LiveCodeBench v6 di 69,71, dan MMLU-Pro di 67,84, semuanya dilaporkan IBM dan belum direproduksi. Suite berbeda, harness berbeda, vendor berbeda. Tidak ada angka dengan harness yang sama untuk pasangan ini di mana pun, dan kami tidak akan mengarangnya.
Di mana masing-masing sebenarnya unggul
Jalankan Granite 4.2 3B jika kendala Anda adalah mesinnya. Pada 6–8 GB dalam bfloat16, atau di bawah 2 GB terkuantisasi, model ini muat di laptop, satu GPU workstation, atau kotak edge terisolasi yang tidak akan pernah melihat dua H100. Model ini melayani melalui lima runtime berbeda termasuk Ollama dan GGUF, yang penting ketika target penerapan adalah laptop orang lain, bukan rak Anda sendiri. Dan kartu modelnya luar biasa dapat dipercaya justru karena IBM menuliskan apa yang tidak disertakannya. Vendor yang menolak mengklaim hasil SWE-bench untuk model 3B sedang memberi tahu Anda di mana model itu berhenti.
Jalankan Kolibri jika korpusnya adalah intinya dan perangkat kerasnya tersedia. Tim dengan kontrak berbahasa Jerman, dokumentasi teknis, atau berkas administrasi, node dua-GPU yang sudah ada, dan persyaratan bahwa bobot tidak pernah keluar dari gedung adalah persis sasaran yang dirancang untuk rilis ini. Jendela native 262.144 token, cache KV FP8, empat tingkat upaya, dan jalur pemanggilan alat Hermes semuanya mengarah pada alur kerja dokumen, bukan obrolan. Tokenizer dwibahasa adalah bagian dari argumen yang sama: Aleph Alpha melaporkan rata-rata 4,90 byte per token pada teks web berbahasa Jerman, dibandingkan dengan 4,35 untuk GPT-5 dan 3,28 untuk Kimi K3, semuanya diukur oleh vendor pada korpus vendor, dan lebih banyak karakter per token adalah efek langsung pada biaya inferensi, bukan skor. Jika ini berlaku, efeknya berlipat ganda di setiap halaman yang Anda proses.
Asimetri yang tidak diiklankan siapa pun adalah data. IBM menerbitkan bobot Granite 4.2 3B dan uraian teknis terperinci tentang bagaimana model itu dibangun, tetapi bukan data pelatihannya. Aleph Alpha menerbitkan pipeline, asal-usul data, dan angka energi bersama bobot Kolibri — 20 triliun token pra-pelatihan, 9,5×10² MWh termasuk overhead pusat data dan tidak termasuk fine-tuning terawasi serta pembelajaran penguatan. Bagi tim yang harus menjawab "dari mana teks model ini berasal", perbedaan itu bukan sekadar kosmetik.

Realitas perutean untuk keduanya.
Tidak ada model yang berada dalam katalog terkelola saat ini. Kolibri sama sekali tidak memiliki SKU API vendor — rilisnya berupa bobot plus laporan teknis — dan Granite 4.2 3B dikirim sebagai bobot untuk lima tumpukan runtime tanpa endpoint terkelola dari IBM. Keduanya merupakan proposisi yang dihosting sendiri, dan pertanyaan praktis bagi sebagian besar tim bukanlah mana yang harus diadopsi, melainkan apakah beban kerja tersebut cukup membenarkan untuk memiliki salah satunya.
Di situlah lapisan routing membuktikan kegunaannya bahkan untuk model yang tidak dilayaninya. Kami menelusuri katalog OrcaRouter dengan setiap ejaan dari kedua nama model tersebut dan baik Kolibri maupun Granite 4.2 3B tidak ada di sana, jadi kami tidak akan berpura-pura sebaliknya. Yang diberikan OrcaRouter kepada Anda adalah cara murah untuk mengetahui apakah keputusan perangkat keras itu dapat dibenarkan sebelum Anda mengambilnya: arahkan jalur uji ke tier mixture-of-experts kecil yang sudah dirutekan — varian Gemma 4 26B-A4B dengan $0.06 per juta token masukan dan $0.33 per juta token keluaran, dengan jendela 262,144 token — dan lihat apakah beban kerja dokumen berbahasa Jerman Anda benar-benar membutuhkan apa yang disediakan Kolibri, pada satu kunci yang kompatibel dengan OpenAI, pada harga daftar penyedia tanpa tambahan apa pun. Jika ya, Anda membeli GPU dengan bukti, bukan firasat. Jika tidak, Anda baru saja menghemat satu pesanan perangkat keras.
Putusan itu, dan apa yang akan mengubahnya
Ini bukan pertandingan yang memiliki pemenang. Kolibri dan Granite 4.2 3B menjawab pertanyaan yang berbeda pada kisaran harga yang berbeda, dan satu-satunya peringkat yang jujur adalah berdasarkan batasan: jika batasannya adalah perangkat keras, Granite 4.2 3B adalah satu-satunya dari keduanya yang memenuhi syarat. Jika batasannya adalah pekerjaan dokumen register regulasi Jerman secara on-premises, Granite 4.2 3B tidak pernah masuk hitungan dan Kolibri adalah artefak yang lebih menarik — rilis open-weights 78B yang sah, Apache 2.0, dengan pipeline data dan tokenizer yang dipublikasikan berdampingan dengan bobotnya.
Dua hal akan menuntaskan perbandingan ini. Uji coba independen Kolibri pada tugas QA dokumen berbahasa Jerman akan menguji klaim yang sebenarnya ingin dibuktikan oleh rilis ini, karena belum ada papan peringkat yang mengukurnya saat ini. Dan reproduksi independen atas angka penalaran Granite 4.2 3B akan memberi tahu Anda apakah mesin kelas laptop mampu bersaing pada subset beban kerja Anda yang sejak awal tidak pernah membutuhkan 78 miliar parameter. Sampai salah satu dari itu terwujud, belilah berdasarkan kendala, bukan berdasarkan jumlah parameter.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
