
Kolibri vs Gemma 4 12B: 78 Miliar Parameter Berbanding 12, dan Hanya Salah Satunya yang Memiliki Skor
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 218 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Kolibri dan Gemma 4 12B adalah dua ujung spektrum yang biasanya tidak memungkinkan Anda membandingkan rilis open-weight secara setara. Kolibri dari Aleph Alpha dirilis pada 3 Oktober 2026: 78,1 miliar parameter total, 3,46 miliar aktif per token, jendela konteks 1.048.576 token yang tervalidasi, hanya bahasa Jerman dan Inggris, Apache 2.0. Gemma 4 12B dirilis pada 3 Juni 2026: 11,95 miliar parameter padat, jendela konteks 262.144 token, masukan teks, gambar, audio, dan video, Apache 2.0. Salah satunya memiliki skor independen yang dapat direproduksi secara publik. Yang lainnya memiliki tabel benchmark vendor. Asimetri itu bukan catatan kaki untuk perbandingan ini; itulah perbandingannya, karena semua hal lain yang diperhatikan pembeli — biaya per tugas, kualitas per watt, apakah ia akan berfungsi pada dokumen Anda — melewatinya.
Kita harus sama-sama lugas tentang bentuk perbandingannya, karena judul yang mempertemukan model 78B dengan model 12B mengundang kesimpulan yang salah. Keduanya bukan pesaing. Yang satu adalah deployment 78 GB yang ditujukan untuk pekerjaan dokumen sektor publik dan industri Jerman pada rak yang dimiliki pelanggan; yang lain adalah model multimodal terpadu berparameter 12 miliar yang berjalan di laptop dan membawa indeks independen 14. Berikut ini adalah uraian tentang untuk apa masing-masing sebenarnya, di mana angka-angka yang dipublikasikan memungkinkan dan tidak memungkinkan Anda memberi peringkat keduanya, dan apa biaya yang harus ditanggung jika tidak memiliki skor independen.
Satu angka yang bisa Anda percayai di sini, dan satu angka yang tidak bisa.
Artificial Analysis telah mengukur Gemma 4 12B, dalam konfigurasi penalarannya. Temuan, sebagaimana dipublikasikan di halaman model mereka, adalah yang harus dijadikan acuan:
• Kecerdasan — Artificial Analysis Intelligence Index sebesar 14, yang menempatkannya dalam band kelas teratas dengan posisi #21 dari 142 model dalam perbandingan tersebut, dibandingkan median 8 untuk model-model yang sebanding.
• Kecepatan — 112,5 token keluaran per detik, #21 dari 142 pada tampilan kecepatan, dan di atas median 91 token untuk model yang sebanding.
• Harga — $0,10 per juta token masukan dan $0,30 per juta token keluaran, yang halaman mereka tandai sebagai agak mahal dibandingkan median $0,03 dan $0,15 untuk model dengan ukuran dan kelas serupa.
• Spesifikasi — konteks 262.144 token, total parameter 12B, Apache 2.0, masukan teks, gambar, ucapan, dan video, keluaran teks.
Kesimpulan ringkasan Artificial Analysis sendiri terbilang tidak biasa blak-blakannya untuk sebuah halaman papan peringkat, dan layak untuk diulang: Gemma 4 12B termasuk di antara model-model terdepan dalam hal kecerdasan tetapi agak mahal dibandingkan model berbobot terbuka lain dengan ukuran serupa. Itu adalah penilaian yang nyata, independen, dan dapat direproduksi dari pihak ketiga yang tidak memiliki kepentingan pada vendor mana pun.
Kolibri tidak memiliki padanan. Tidak ada halaman model Artificial Analysis untuknya, dan pada saat penulisan ini tidak ada pihak ketiga yang telah mereproduksi rangkaian evaluasi tersebut. Yang ada adalah tabel perbandingan milik Aleph Alpha sendiri, di mana Kolibri mendapat skor 75.5 pada rata-rata bahasa Inggris dan 70.8 pada rata-rata bahasa Jerman di seluruh rangkaian tugasnya. Itu adalah rata-rata persentase tanpa bobot atas campuran tolok ukur yang dipilih vendor, pada harness yang ditulis vendor, dengan upaya penalaran tinggi. Angka-angka itu bukan Intelligence Index, dan kedua angka tersebut tidak dapat dikonversi satu sama lain atau disandingkan. Siapa pun yang menyajikan "Kolibri 75.5 versus Gemma 14" sebagai peringkat sedang membandingkan persentase pada satu skala dengan skor pada skala lain. Posisi yang jujur adalah bahwa kualitas Gemma 4 12B terukur dan kualitas Kolibri hanya diklaim.
Yang memungkinkan dilakukan tabel vendor adalah membaca lintas baris. Gemma 4 26B-A4B IT, kerabat mixture-of-experts milik Google sendiri bagi 12B, muncul di tabel Aleph Alpha pada 71,9 untuk bahasa Inggris dan 66,3 untuk bahasa Jerman, di bawah Kolibri pada keduanya. Itulah hal yang paling mendekati pemeriksaan silang yang tersedia, dan hal itu disertai peringatan yang sama: harness vendor, angka vendor. Ini sinyal lemah, bukan bukti.

Dense 12B melawan sparse 78B bukanlah ketidakseimbangan seperti yang terlihat.
Kesenjangan arsitektur lebih besar daripada kesenjangan parameter begitu Anda memperhitungkan apa yang sebenarnya dihitung per token.
• Komputasi per token — Gemma 4 12B mengaktifkan seluruh 11,95 miliar parameter pada setiap token. Kolibri mengaktifkan 3.457.573.120 dari 78.103.074.560 parameternya, kira-kira satu per dua puluh dua dari model, dengan satu pakar bersama dan enam pakar yang dirutekan per lapisan dari 384.
• Memori — trade-off-nya berjalan ke arah sebaliknya dan ini brutal. Gemma 4 12B dalam bfloat16 berada di kisaran 24 GB bobot. Kartu Kolibri menempatkan bobot FP8 pada sekitar 78 GB, dengan minimal dua kartu A100 80 GB, dua H100 SXM5, satu H200, satu B200, atau satu B300.
• Attention — Gemma 4 menggunakan hibrida dari attention sliding-window lokal dan attention global penuh, dengan lapisan terakhir selalu global. Kolibri menggunakan pemisahan 4:1 antara sliding-window dan grouped-query di seluruh 50 lapisan all-MoE.
• Konteks — 262,144 token untuk Gemma 4 12B; 262,144 native untuk Kolibri, divalidasi hingga 1,048,576 tanpa penskalaan posisi.
Jadi, cara jujur untuk membingkai "78B versus 12B" adalah bahwa Kolibri menang pada biaya aktivasi dan kalah pada jejak bobot, dan tidak ada keunggulan yang gratis. Model sparse yang mengaktifkan 3,46 miliar parameter per token tetap harus menyimpan seluruh 78 miliar di memori, itulah sebabnya batas bawah penerapannya adalah sepasang akselerator 80 GB, bukan satu kartu konsumen. Gemma 4 12B mengambil pertukaran sebaliknya: proporsi model yang lebih besar aktif setiap token, tetapi model ini muat pada perangkat keras yang bisa dibeli orang.
Ada satu kerumitan khusus Jerman di sisi Kolibri yang mengubah perhitungannya, bukan peringkatnya. Tokenizer-nya rata-rata 4,90 byte per token pada teks web Jerman, dibandingkan 4,13 untuk Gemini, 4,17 untuk keluarga Qwen3.5–3.8, dan 4,35 untuk GPT-5, menurut pengukuran Aleph Alpha sendiri. Lebih sedikit token per dokumen Jerman berarti pengurangan langsung dalam biaya inferensi, dan untuk beban kerja berupa teks administratif Jerman yang jumlahnya jutaan, efek itu bisa bernilai lebih dari beberapa poin indeks. Itu juga sepenuhnya dilaporkan oleh vendor.

Apa yang sebenarnya bisa dilihat oleh masing-masing
Inilah titik ketika perbandingannya tidak lagi ketat, dan ini merupakan fakta spesifikasi, bukan klaim kualitas. Gemma 4 12B adalah model multimodal terpadu: kartunya menjelaskan arsitektur tanpa encoder yang memproyeksikan patch gambar mentah dan bentuk gelombang audio secara langsung ke ruang embedding model bahasa, dengan masukan teks, gambar, ucapan, dan video serta keluaran teks. Model ini dirancang untuk berjalan pada perangkat konsumen tanpa encoder terpisah yang perlu disediakan.
Kolibri membaca teks, dalam dua bahasa, dan tidak ada yang lain. Aleph Alpha membingkai itu sebagai kedalaman di atas keluasan secara sengaja: dua bahasa, sangat terkurasi, alih-alih campuran multibahasa yang luas. Tidak ada menara visi, tidak ada jalur audio, tidak ada video. Jika beban kerja Anda mencakup formulir hasil pemindaian, panggilan yang direkam, atau foto peralatan, Gemma 4 12B adalah kandidat dan Kolibri bukan, apa pun yang dikatakan baris tolok ukur. Jika beban kerja Anda adalah korpus dokumen Jerman dan Inggris yang tidak boleh pernah meninggalkan gedung, kebalikannya lebih mendekati benar — tetapi perhatikan bahwa persyaratan "tidak pernah meninggalkan gedung" juga dipenuhi oleh Gemma 4 12B, karena bobotnya berlisensi Apache 2.0 dan dapat diunduh.
Mana yang lebih murah bergantung pada apa yang Anda beli.
Kedua model tersebut dihargai dalam mata uang yang tidak dapat dikonversi. Gemma 4 12B memiliki tarif pasar: $0,10 dan $0,30 per juta token sebagaimana diukur di berbagai penyedia oleh Artificial Analysis, dan lebih murah pada tier MoE di endpoint yang dirutekan. Kolibri tidak memiliki tarif sama sekali, karena Aleph Alpha tidak menjual inferensi untuknya — rilisnya adalah bobot, laporan teknis, dan kartu model.
• Gemma 4 12B pada rute hosted — $0,10 per juta token input dan $0,30 per juta token output menurut angka Artificial Analysis. Di katalog kami sendiri, saudara MoE-nya, Gemma 4 26B-A4B IT, terdaftar pada $0,06 untuk input dan $0,33 untuk output dengan jendela 262.144 token, dan Gemma 4 31B IT dense yang lebih besar pada $0,13 dan $0,38; itu adalah harga daftar penyedia yang diteruskan apa adanya, satu-satunya angka yang tidak kami beri tambahan apa pun.
• Kolibri di perangkat keras Anda sendiri — 78 GB bobot, plugin vLLM dari paket aleph-alpha-inference milik vendor, dan minimal satu H200 atau B200, atau sepasang H100 SXM5. Biayanya adalah pembelian modal, satu slot rak, dan satu orang yang dapat menjalankan deployment vLLM, diamortisasi seiring banyaknya token yang Anda hasilkan.
Itu bukan pembelian yang sama, dan perbandingannya bukanlah "mana yang lebih murah". Perbandingannya adalah apakah beban kerja tersebut punya bentuk yang membenarkan untuk memiliki perangkat kerasnya. Tim yang memproses korpus dokumen yang tetap dan sensitif dalam volume tinggi bisa jauh lebih unggul di sisi self-hosted. Tim yang membangun fitur produk yang memanggil model beberapa juta token sehari hampir tidak pernah demikian.
Satu jalan tengah yang praktis: tier Gemma ada di OrcaRouter hari ini, pada endpoint yang kompatibel dengan OpenAI yang sama seperti semua hal lainnya, dengan failover antar penyedia dan harga daftar penyedia diteruskan tanpa tambahan apa pun per token. Itu menjadikannya cara murah untuk mengukur volume token aktual Anda pada rute yang dihosting sebelum memutuskan apakah deployment sovereign 78 GB layak. Perlu dikatakan secara terang-terangan apa yang bukan: kami tidak merutekan Kolibri. Kami menyelidiki katalog dengan setiap ejaan nama vendor dan model, dan produk itu tidak ada di sana. Self-hosting saat ini adalah satu-satunya cara untuk memanggilnya.

Siapa yang harus memilih yang mana?
Aturan keputusannya cukup singkat untuk dinyatakan dalam tiga baris.
Pilih Gemma 4 12B jika Anda membutuhkan apa pun selain teks Jerman dan Inggris, jika Anda memerlukan angka kualitas terukur sebelum berkomitmen, jika model harus berjalan pada perangkat keras yang sudah Anda miliki, atau jika Anda lebih memilih menyewa token daripada memiliki rak. Ini satu-satunya dari keduanya dengan skor independen, kecepatan yang dipublikasikan, dan harga pasar.
Pilih Kolibri jika kebutuhan Anda adalah model penalaran 78 miliar parameter yang bobotnya, asal-usul data pelatihannya, konsumsi energinya, dan lisensinya semuanya terdokumentasi, digunakan di dalam perimeter Anda sendiri, dengan tokenizer yang dibuat untuk prosa administratif Jerman dan perilaku abstensi yang dapat diandalkan oleh alur kerja yang diatur. Itu target yang sempit dan Aleph Alpha dengan sengaja membidiknya.
Jangan memilih salah satu hanya berdasarkan baris benchmark yang Anda lihat di postingan peluncuran. Angka 14 milik Gemma 4 12B adalah pengukuran yang dilakukan orang lain dan dapat Anda periksa. Angka 75,5 milik Kolibri adalah klaim yang dibuat penulisnya, dan satu-satunya orang yang saat ini dapat memfalsifikasinya adalah pelanggan dengan dua H100 dan korpus dokumen.
