
Hari Pertama Kolibri: Aleph Alpha Membuka 78B Bobot Jerman-Inggris, dan Reaksi Sudah Mendahului Bukti
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 217 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua puluh empat jam setelah Aleph Alpha menerbitkan Kolibri, reaksinya telah mengeras menjadi satu kalimat, dan kalimat itu layak dibedah. Lab Heidelberg menempatkan model mixture-of-experts 78,1 miliar parameter di Hugging Face di bawah Apache 2.0 pada 3 Oktober 2026, mengumumkannya pada pagi yang sama di ruang berita miliknya sendiri dan dari akunnya sendiri, dan pada hari berikutnya ringkasan yang beredar di feed AI berbunyi: total parameter 78B, 3,46B aktif per token, bobot terbuka di bawah Apache 2.0, dibangun untuk bahasa Jerman dan Inggris. Setiap klausa dari kalimat itu dapat diperiksa dari repositori. Yang sebagian besar tidak dikatakan adalah bagian mana dari rilis ini yang merupakan fakta terukur dan mana yang merupakan klaim yang dibuat para penulis tentang model mereka sendiri yang belum dijalankan oleh siapa pun di luar Heidelberg. Kesenjangan itulah cerita hari pertama, dan itu lebih penting daripada angka utama.
Mulailah dari garis waktu, karena sejumlah besar reaksi menganggap ini sebagai peluncuran senyap yang misterius, padahal bukan. Repositori Hugging Face Aleph-Alpha/Kolibri-1 dibuat pada 2 Oktober 2026 pukul 05.54.02 UTC, kartu model mencantumkan tanggal rilis 3 Oktober, dan postingan ruang berita vendor terbit pada pagi yang sama pukul 08.43.53 GMT — pada Hari Reunifikasi Jerman, tanggal yang jelas dipilih oleh lab tersebut. Akun Aleph Alpha sendiri membahasnya dalam hitungan menit. Tidak ada embargo pers dan tidak ada acara peluncuran, yang mungkin menjadi asal pembingkaian "perilisan senyap", tetapi postingan ruang berita vendor, laporan teknis, dan pengumuman resmi bukanlah peluncuran senyap. Itu adalah perilisan normal yang sekadar tidak diliput oleh media AI umum pada hari itu.
Angka yang diulang oleh reaksi
Alasan di balik 3,46 miliar aktif sebagai angka yang dikutip semua orang adalah karena itu satu-satunya angka dalam rilis yang mengubah apa yang harus dimiliki seorang pembeli. Kolibri adalah transformer 50 lapis yang setiap lapisnya merupakan mixture-of-experts, dengan 384 pakar per lapis, satu pakar digunakan bersama dan enam pakar dirutekan, dengan total 78.103.074.560 parameter. Per token, model ini mengaktifkan 3.457.573.120 di antaranya — rasio sparsitas sekitar 22,6 banding 1. Itulah yang membuat model 78 miliar parameter dapat dilayani pada sepasang H100, alih-alih satu rak, dan itulah klaim paling berdampak dalam rilis tersebut.
Di sekelilingnya terdapat angka-angka utama lainnya, semuanya berasal dari kartu model, bukan dari eksekusi independen:
• Konteks — dilatih pada 16.384 token, dilatih tahap menengah pada 65.536, native pada 262.144, dan divalidasi hingga 1.048.576. Kartu ini merekomendasikan agar tetap berada pada atau di bawah 262.144 untuk pekerjaan yang sensitif terhadap latensi. Perhatikan dengan saksama bahwa "1M context" sederhana yang akan Anda lihat dalam ringkasan adalah batas maksimum yang divalidasi, bukan jendela native.
• Presisi — Bobot FP8 dalam blok 128x128 dengan aktivasi terkuantisasi secara dinamis, dievaluasi dengan cache KV FP8; embedding, LM head, norma, dan router MoE tetap dalam bfloat16.
• Penalaran — empat tingkat upaya — tidak ada, rendah, sedang, tinggi — diatur melalui templat chat, dengan pemanggilan alat bergaya Hermes dan parser vLLM yang disertakan dalam repositori yang sama dengan bobot.
• Bahasa — Jerman dan Inggris, dan tidak ada yang lain.
• Pelatihan — 20 triliun token prapelatihan pada korpus dwibahasa yang difilter yang kira-kira 62,5 persen bahasa Inggris, 23,9 persen bahasa Jerman, dan 13,6 persen kode, ditambah 3,44 triliun token pelatihan menengah dan 201 miliar untuk perluasan konteks panjang.
• Komputasi dan energi — 768 NVIDIA B200s di 96 node HGX, pra-pelatihan 21 hari selama 511 jam dan 392.000 jam-GPU pada 6.4x10^23 FLOPs yang dilaporkan, dan perkiraan 9.5x10^2 MWh termasuk overhead pusat data, tidak termasuk penyetelan halus terawasi dan pembelajaran penguatan.
• Lisensi — Apache 2.0. Tidak ada klausul tambahan penggunaan yang dapat diterima, tidak ada ambang batas pengguna aktif bulanan, tidak ada ketentuan komersial terpisah.
Dua klaim yang belum diperiksa siapa pun
Inilah bagian dari hari pertama yang terlewat oleh reaksi itu, dan inilah bagian yang menentukan apakah Kolibri itu penting atau sekadar menarik.
Yang pertama adalah klaim ekonomi penyajian. Pembingkaian Aleph Alpha bukanlah bahwa Kolibri adalah model terkuat yang tersedia — pada tabel perbandingan lab itu sendiri, Kolibri bukan yang terkuat, dan lab itu mengatakannya. Pembingkaiannya adalah bahwa tidak ada model yang dibandingkan yang menghasilkan kualitas lebih tinggi pada biaya penyajian yang sama, atau kualitas yang sama dengan biaya lebih rendah, di sepanjang frontier Pareto kualitas terhadap token yang didekode per detik per GPU. Itu adalah klaim tentang throughput pada perangkat keras tertentu, dan persis itulah jenis klaim yang hanya dapat diselesaikan oleh pihak ketiga dengan stopwatch dan dua H100s. Belum ada yang melakukannya. Tidak ada entri Artificial Analysis untuk Kolibri per 4 Oktober 2026 dan tidak ada replikasi pihak ketiga atas harness evaluasi.
Yang kedua adalah klaim tokenizer. Aleph Alpha melatih tokenizer bilingual Jerman-Inggris dengan kosakata 128.000 token menggunakan metode yang disebutnya UniBPE, dan melaporkan rata-rata 4,90 byte per token pada teks web berbahasa Jerman, dibandingkan GPT-5 pada 4,35, Gemini pada 4,13, Qwen 3.5-3.8 pada 4,17, GLM 5.3 pada 3,93, DeepSeek V4 pada 3,72, dan Kimi K3 pada 3,28. Semua angka itu berasal dari vendor sendiri, diukur pada korpus milik vendor sendiri, dibandingkan dengan pesaing yang dipilih sendiri oleh vendor. Teks yang lebih banyak per token adalah efek biaya inferensi yang nyata, bukan klaim kualitas, dan jika hal itu bertahan, efeknya akan berlipat di setiap beban kerja pemrosesan dokumen — tetapi ini adalah pengukuran satu lab, bukan hasil benchmark.
Jerman adalah intinya, dan itu adalah rekayasa paling menarik dalam rilis ini.
Sebagian besar kartu model "multibahasa" menggambarkan bauran pelatihan yang kebetulan menyertakan bahasa Jerman. Yang ini dibangun dengan pendekatan sebaliknya, dan kartunya luar biasa rinci soal mekanismenya.
Eksperimen model proksi skala kecil membawa Aleph Alpha pada target sekitar 20 persen data Jerman dalam campuran, yang untuk proses 20 triliun token berarti harus menemukan 4 triliun token Jerman. Kumpulan data Jerman terbuka yang telah dideduplikasi dan difilter menyediakan 390 miliar — kurang satu orde besaran. Laboratorium itu menutup kesenjangan dengan tiga cara: menyetel ulang filter Common Crawl khusus untuk bahasa Jerman, yang menghasilkan 1,3 triliun token organik unik; memparafrasekan dokumen Jerman yang ada menjadi entri ensiklopedia, dialog tanya jawab, dan bagian teks, yang menghasilkan sekitar satu triliun lagi dan menjadi sumber Jerman tunggal terbesar; dan penerjemahan, yang digunakan untuk model pendahulu dan sengaja dihentikan untuk Kolibri. Bahasa Jerman berakhir sebagai kumpulan unik 2,4 triliun token, 80 persennya dikurasi atau dihasilkan secara internal, terwakili sebesar 21,3 persen dari token pra-pelatihan setelah upsampling.
Detail filter adalah hal yang hanya muncul di laboratorium yang benar-benar dilatih dengan bahasa Jerman. Pipeline data bahasa standar membuang dokumen dengan terlalu banyak kata panjang — tetapi prosa administratif Jerman secara rutin melampaui batas bahasa Inggris untuk rata-rata panjang kata, sehingga pengaturan bawaan diam-diam menghapus register yang digunakan administrasi publik dalam menulis. Filter yang dilatih dengan bahasa Inggris standar tidak memiliki kosakata hukum-administratif Jerman yang berarti, dan tidak ada tolok ukur yang akan memberi tahu Anda hal itu.
Apa yang ditunjukkan tabel perbandingan
Aleph Alpha menerbitkan perbandingan pasca-pelatihan yang mencakup empat belas model, dan ini lebih berguna daripada sebagian besar tabel peluncuran karena tidak menyanjung subjeknya. Pada harness yang sama dengan Kolibri pada upaya penalaran tinggi, Qwen3.8 27B mencetak 80,2 pada rata-rata bahasa Inggris dibandingkan 75,5 milik Kolibri, dan 79,9 pada rata-rata bahasa Jerman dibandingkan 70,8, serta unggul pada GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified dan kedua tolok ukur konteks panjang. Nemotron 3 Super 120B-A12B mencetak 73,0 bahasa Inggris dibandingkan 75,5 milik Kolibri. Gemma 4 26B-A4B IT mencetak 71,9 dan 66,3 pada kedua rata-rata tersebut.
Jadi, ringkasan jujur dari rilis ini bukanlah "yang paling mutakhir". Melainkan bahwa Kolibri berada di tengah-tengah kancah model yang mengaktifkan antara tiga hingga dua belas miliar parameter per token, bahwa ia jelas mengalahkan model-model yang jauh lebih kecil, dan bahwa ia kalah dari model padat 27 miliar parameter dari Alibaba pada sebagian besar baris tabelnya sendiri sambil mengaktifkan sekitar seperdelapan parameter. Apakah faktor ekonominya menyelamatkan celah itu adalah klaim Pareto, dan klaim Pareto itu belum teruji.

Bagaimana Anda sebenarnya akan menyebutnya, hari ini
Tidak ada endpoint yang dihosting dari vendor — yang dirilis adalah bobot ditambah laporan teknis, tanpa SKU API Aleph Alpha untuk Kolibri dalam materi yang dipublikasikan. Tidak ada pula rute untuknya di OrcaRouter: kami menelusuri katalog dengan setiap ejaan awalan vendor dan nama model, dan Kolibri tidak ada di sana, jadi memanggilnya hari ini berarti mengunduh sekitar 78 GB bobot FP8 dan menjalankan endpoint vLLM sendiri dari aleph-alpha-inference paket atau image kontainer yang dipublikasikan.
Itu adalah keputusan pengadaan yang nyata, bukan catatan kaki, dan di situlah lapisan perutean membuktikan kelayakannya bahkan untuk model yang tidak dihostingnya. Perbandingan yang jujur bagi siapa pun yang mempertimbangkan penerapan 78B sovereign yang dihosting sendiri bukanlah baris-baris benchmark — melainkan 78 GB VRAM dan percakapan pengadaan versus pos biaya per token pada perangkat keras milik orang lain. Jika yang sebenarnya Anda butuhkan bulan ini adalah model mixture-of-experts kecil yang dapat Anda panggil tanpa membeli dua GPU, tier Gemma 4 26B-A4B adalah hal terdekat yang sudah ada di endpoint yang dirutekan, dengan $0,06 per juta token input dan $0,33 per juta output dengan jendela 262.144 token, dan OrcaRouter merutekan tier itu dengan satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia tanpa tambahan apa pun. Itu cara murah untuk mengetahui apakah beban kerja membenarkan memiliki perangkat keras tersebut sebelum perangkat keras itu tiba.

Apa yang perlu dicermati, dan apa yang akan mengubah putusan
Tiga hal, diurutkan berdasarkan seberapa besar dampaknya terhadap gambaran keseluruhan.
Pengukuran throughput independen pada konfigurasi dua H100 yang direkomendasikan kartu tersebut akan mengonfirmasi atau menggugurkan klaim Pareto, yang merupakan satu-satunya klaim dalam rilis ini yang benar-benar baru alih-alih sekadar pengulangan lembar spesifikasi. Reproduksi independen atas rata-rata rangkaian tugas Jerman dan Inggris akan memberi tahu Anda apakah kesenjangan terhadap Qwen3.8 27B sesempit yang disiratkan tabel vendor sendiri atau lebih sempit lagi. Dan evaluasi berbahasa Jerman pada teks administratif nyata — bukan tolok ukur umum hasil terjemahan — akan menguji hal yang sebenarnya menjadi tujuan rilis ini dibuat, yang saat ini tidak diukur oleh papan peringkat mana pun.
Sampai salah satu dari itu terwujud, pembingkaian yang tepat adalah yang didukung oleh repositori itu sendiri. Kolibri adalah rilis bobot terbuka yang sesungguhnya dari laboratorium Eropa, pada skala yang belum pernah dirilis laboratorium Eropa sebelumnya, dengan ketentuan Apache 2.0 yang tidak ditandingi pemain mapan mana pun, pipeline data yang diterbitkan bersama bobotnya, dan kisah iterasi dua model yang lebih menarik daripada angka utamanya. Untuk saat ini, ini juga merupakan model yang angka-angka paling banyak dikutip berasal dari penulisnya sendiri. Kedua kalimat itu benar sejak hari pertama, dan kalimat kedua itulah yang dihilangkan oleh reaksi tersebut.

