Kartu hero yang dihasilkan untuk penjelasan Kolibri, berjudul 'Kolibri: model open-weight 78B dari Jerman' dengan subbaris '78B total / 3,46B aktif / konteks 1M token / Apache 2.0' dan tiga ikon garis datar: burung kolibri, tumpukan lapisan, dan gembok di atas dokumen. Logo OrcaRouter berada di strip di bawah karya seni.
Guides & Insights

Kolibri, Dijelaskan: Aleph Alpha Merilis Model Jerman-Inggris 78B di Bawah Apache 2.0

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Aleph Alpha merilis Kolibri pada 3 Oktober 2026, model mixture-of-experts dengan 78,1 miliar parameter yang mengaktifkan 3,46 miliar parameter per token, memiliki jendela konteks tervalidasi 1.048.576 token, dan dirilis dengan bobot lengkap di Hugging Face di bawah lisensi Apache 2.0. Lab Heidelberg menerbitkannya pada Hari Reunifikasi Jerman, bersama laporan teknis, kartu model dalam bahasa Jerman dan Inggris, serta penjelasan yang luar biasa rinci tentang bagaimana model itu dilatih. Model yang dijadikan pembanding di seluruh dokumentasi Aleph Alpha sendiri adalah Kolibri Origin — pendahulu dengan 30,6 miliar parameter dan 3,27 miliar parameter aktif yang menyelesaikan pra-pelatihan pada 11 Juni 2026 dan tidak pernah dirilis secara publik. Dua model, berselang tiga bulan, dan jarak di antara keduanya adalah hal paling menarik dalam rilis ini.

Yang membuat Kolibri layak dibaca dengan cermat bukanlah karena ia model terkuat yang tersedia. Dalam tabel perbandingan Aleph Alpha sendiri, ia memang bukan, dan kita akan membahasnya nanti. Yang patut dicatat adalah bahwa sebuah lab Eropa benar-benar merilis model berbobot terbuka pada skala ini, dengan pipeline pelatihan, provenans data, dan angka energi yang dipublikasikan bersamanya, serta menetapkan lisensinya ke Apache 2.0 alih-alih lisensi riset khusus. Bagi tim yang aturan pengadaannya dimulai dengan "ke mana data pergi", kombinasi itulah produknya.

Lembar spesifikasi, dan dua angka yang penting

Semua yang di bawah ini berasal dari kartu model yang diterbitkan Aleph Alpha bersama bobotnya; belum ada satu pun yang direproduksi secara independen, dan tidak ada baris Artificial Analysis untuk Kolibri pada saat penulisan ini.

• Total parameter — 78.103.074.560, dengan 3.457.573.120 aktif per token, rasio sekitar 22,6 banding 1.

• Arsitektur — transformer 50 lapis, semua lapisnya mixture-of-experts, 384 expert per lapis dengan 1 shared dan 6 routed, serta campuran 4:1 sliding-window terhadap grouped-query attention di seluruh stack.

• Konteks — dilatih pada 16.384 token, dilatih tahap menengah pada 65.536, dan diperluas ke native 262.144. Karena pengodean posisi hanya diterapkan pada lapisan jendela geser, Aleph Alpha menyatakan jendela tersebut dapat diperluas tanpa penskalaan posisi, dan telah memvalidasi kualitas serta efisiensi penyajian hingga 1.048.576 token. Kartu ini merekomendasikan untuk tetap berada pada atau di bawah 262.144 untuk pekerjaan yang sensitif terhadap latensi dan untuk tugas kompleks.

• Presisi — Bobot FP8 dalam blok 128×128 dengan aktivasi terkuantisasi secara dinamis, dievaluasi dengan cache KV FP8; embedding, LM head, normalisasi, dan router MoE tetap dalam bfloat16.

• Penalaran — empat tingkat upaya, tidak ada, rendah, sedang, dan tinggi, diatur melalui templat obrolan.

• Pemanggilan alat — ya, gaya Hermes, dengan parser vLLM yang disertakan dalam repositori yang sama dengan bobotnya.

• Bahasa — Jerman dan Inggris, dan tidak ada yang lain. Hal itu dinyatakan sebagai pilihan desain, bukan sebagai kelalaian.

• Pelatihan — 20 triliun token pra-pelatihan pada korpus bilingual yang difilter, sekitar 62,5 persen bahasa Inggris, 23,9 persen bahasa Jerman, dan 13,6 persen kode, ditambah 3,44 triliun token pelatihan menengah dan 201 miliar untuk ekstensi konteks panjang.

• Komputasi — 768 NVIDIA B200 di 96 node HGX, 21 hari pra-pelatihan selama 511 jam dan 392.000 GPU-jam, dengan laporan 6,4×10²³ FLOPs. Pelatihan menengah menambahkan lima hari dan 90.000 GPU-jam; perpanjangan konteks panjang menambahkan 13 jam dan 10.000 GPU-jam.

• Energi — perkiraan 9,5×10² MWh termasuk overhead pusat data, mencakup pra-pelatihan, pelatihan menengah, dan pelatihan konteks panjang, tetapi tidak termasuk fine-tuning terawasi dan pembelajaran penguatan.

• Lisensi — Apache 2.0. Tidak ada klausul tambahan penggunaan yang dapat diterima, tidak ada ambang batas pengguna aktif bulanan, tidak ada ketentuan komersial terpisah.

Dua dari baris itu adalah baris yang sebaiknya dibaca dua kali oleh pembeli. Jumlah parameter aktif adalah yang Anda bayar saat inferensi, dan 3,46 miliar aktif dari total 78 miliar merupakan rasio sparsitas yang agresif — itulah alasan utama mengapa model sebesar ini dapat dilayani sama sekali di dua GPU. Dan angka konteksnya dinyatakan sebagai 262.144 native dengan 1.048.576 tervalidasi, yang merupakan klaim yang lebih hati-hati daripada klaim "konteks 1M" polos yang akan Anda lihat di sebagian besar liputan tentang rilis ini.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

Dua model, terpaut tiga bulan

Kolibri adalah model kedua dari apa yang Aleph Alpha sebut sebagai Model Factory, dan linimasa yang diterbitkannya adalah bagian dari rilis yang paling banyak dilewatkan oleh liputan.

Pengerjaan pipeline pelatihan dimulai pada Januari 2026. Kolibri Origin menyelesaikan pra-pelatihan pada skala target pada 11 Juni 2026 — 30,6 miliar parameter total, 3,27 miliar parameter aktif, jendela konteks 65.536 token, 7,51 triliun token pelatihan, 50 lapisan yang dua di antaranya padat dan 48 merupakan MoE, serta satu mode penalaran. Model ini divalidasi secara internal dan tidak pernah dirilis ke publik. Kolibri menyelesaikan pra-pelatihan pada 11 September 2026.

• Parameter — 30,6B total dan 3,27B aktif, dibandingkan dengan 78,1B total dan 3,46B aktif.

• Konteks — 8.192 token konteks pra-pelatihan pada Origin, dibandingkan dengan 16.384 pada Kolibri, berakhir pada 262.144 bawaan.

• Data — 7,51 triliun token pra-pelatihan di Origin, dibandingkan dengan 20 triliun, yang diambil dari kumpulan mentah lebih dari 200 triliun yang disaring, dideduplikasi, dan dikurasi oleh pipeline.

• Arsitektur — dua lapisan dense plus 48 lapisan MoE pada Origin, dibandingkan dengan 50 lapisan MoE, dengan desain attention yang diubah, tiga kali jumlah expert, sparsitas yang lebih tinggi dan algoritma routing yang diganti.

• Penalaran — satu mode di Origin, dibandingkan dengan tidak ada, rendah, sedang, dan tinggi di Kolibri.

• Rilis — tidak ada rilis publik untuk Origin, 3 Oktober 2026 untuk Kolibri.

Angka yang paling berubah adalah angka dari suite tugas, di mana harness evaluasi yang sama menilai kedua model. Pada rata-rata Jerman dari suite pasca-pelatihan, Origin mencetak 46,4 dan Kolibri mencetak 70,8; pada rata-rata Inggris, 54,1 melawan 75,5. Pada AIME 2025 dalam bahasa Jerman, 73,5 melawan 87,5. Pada benchmark proksi pelanggan internal yang diterbitkan vendor sebagai set vertikal, suite pemasok otomotif naik dari 0,72 menjadi 0,99, semikonduktor dari 0,35 menjadi 0,80, sektor publik Jerman dari 0,54 menjadi 0,75, teknologi penggerak industri dari 0,31 menjadi 0,60 dan kedirgantaraan dari 0,14 menjadi 0,59.

Angka-angka vertikal internal itu dijalankan oleh vendor pada rangkaian evaluasi yang dibangun oleh vendor dan dirancang untuk pelanggan vendor, jadi anggap itu sebagai deskripsi maksud, bukan skor. Inti dari mempublikasikannya adalah bahwa angka-angka itu menjelaskan untuk apa model dioptimalkan: bukan papan peringkat, melainkan sekumpulan dokumen industri teregulasi.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

Jerman adalah keputusan desain di sini, bukan tag bahasa.

Sebagian besar kartu model "multibahasa" berarti campuran pelatihan yang kebetulan menyertakan sedikit bahasa Jerman. Yang ini dibangun dengan cara sebaliknya, dan kartunya spesifik tentang mekanismenya.

Aleph Alpha menemukan dari eksperimen model proksi kecil bahwa sekitar 20 persen data Jerman dalam campuran tersebut menghasilkan hasil terbaik, yang untuk proses 20 triliun token berarti harus menemukan 4 triliun token bahasa Jerman. Kumpulan data Jerman terbuka yang telah dideduplikasi dan difilter memberinya 390 miliar — masih kurang satu orde besaran dari target. Kesenjangan itu ditutup melalui tiga cara: menyetel ulang filter Common Crawl khusus untuk bahasa Jerman, yang menghasilkan 1,3 triliun token organik unik; memparafrasekan dokumen Jerman yang ada menjadi entri bergaya ensiklopedia, dialog tanya-jawab, dan bagian teks, yang menghasilkan sekitar 1 triliun token lagi dan menjadi sumber bahasa Jerman terbesar; serta penerjemahan, yang hanya digunakan di Kolibri Origin dan dihilangkan untuk Kolibri. Bahasa Jerman akhirnya menjadi kumpulan unik berisi 2,4 triliun token, 80 persennya dikurasi atau dihasilkan secara internal, dan tercatat sebesar 21,3 persen dari token pra-pelatihan setelah upsampling.

Detail filter itu layak dikutip karena hal semacam itu hanya muncul di laboratorium yang benar-benar melatih model pada bahasa Jerman. Pipeline data bahasa standar membuang dokumen dengan terlalu banyak kata panjang — tetapi prosa administratif Jerman secara rutin melampaui batas bahasa Inggris untuk rata-rata panjang kata, sehingga pengaturan default diam-diam menghapus register yang digunakan administrasi publik dalam menulis. Konsekuensi komersial yang jelas adalah bahwa model yang dilatih dengan filter bahasa Inggris standar tidak memiliki kosakata hukum-administratif Jerman yang berarti, dan tidak ada benchmark yang akan memberi tahu Anda hal itu.

Tokenizer mendapat perlakuan yang sama. Aleph Alpha melatih tokenizer dwibahasa Jerman-Inggris dengan kosakata 128.000 token menggunakan metode baru yang disebutnya UniBPE, yang mempertahankan penggabungan bottom-up dari byte-pair encoding tetapi memilih penggabungan dengan objektif unigram. Pada teks web berbahasa Jerman, dilaporkan rata-rata 4,90 byte per token, unggul atas GPT-5 pada 4,35, Gemini pada 4,13, Qwen3.5–3.8 pada 4,17, GLM 5.3 pada 3,93, DeepSeek V4 pada 3,72 dan Kimi K3 pada 3,28 — semuanya angka yang dilaporkan vendor pada perbandingan vendor itu sendiri. Lebih banyak teks per token berarti lebih sedikit token per tugas, yang merupakan efek biaya inferensi langsung, bukan klaim kualitas, dan inilah jenis kemenangan efisiensi yang terakumulasi di seluruh beban kerja pemrosesan dokumen.

Apa yang tidak diselesaikan oleh tabel vendor

Aleph Alpha menerbitkan perbandingan pasca-pelatihan yang mencakup empat belas model, dan itu lebih berguna daripada sebagian besar tabel peluncuran karena tidak menyanjung subjeknya.

Pada harness yang sama, dengan Kolibri pada upaya penalaran tinggi, Qwen3.8 27B mencetak 80,2 pada rata-rata bahasa Inggris versus 75,5 milik Kolibri, dan 79,9 pada rata-rata bahasa Jerman versus 70,8. Model ini juga unggul pada GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified, dan dua tolok ukur konteks panjang. Nemotron 3 Super 120B-A12B mencetak 73,0 bahasa Inggris versus 75,5 milik Kolibri — lebih dekat, dan unggul pada AIME 2025. Gemma 4 26B-A4B IT mencetak 71,9 dan 66,3 pada kedua rata-rata tersebut.

Jadi, ringkasan jujur dari rilis ini bukanlah "yang paling canggih saat ini". Melainkan bahwa Kolibri berada di tengah-tengah kumpulan model yang mengaktifkan antara tiga hingga dua belas miliar parameter per token, bahwa ia jelas mengalahkan model-model yang jauh lebih kecil, dan bahwa ia kalah dari model padat 27 miliar parameter dari Alibaba pada sebagian besar baris di tabelnya sendiri sementara mengaktifkan sekitar seperdelapan parameter. Kerangka Aleph Alpha untuk itu adalah batas Pareto antara kualitas dan token terdekode per detik per GPU — tidak ada model yang dibandingkan yang memberikan kualitas lebih tinggi pada biaya penyajian yang sama, atau kualitas yang sama pada biaya yang lebih rendah. Itulah klaim yang perlu diperiksa secara kritis, dan ini adalah klaim ekonomi penyajian, bukan klaim kemampuan.

Tidak ada satu pun angka ini yang diverifikasi secara independen. Tidak ada entri Artificial Analysis untuk Kolibri, tidak ada replikasi pihak ketiga atas kerangka evaluasi, dan tolok ukur vertikalnya dibuat oleh vendor. Perbandingan ini juga secara struktural menguntungkan Kolibri dalam satu hal dan tidak menguntungkan dalam hal lain: keempat belas model dijalankan melalui harness milik Aleph Alpha sendiri dengan prompt dan pengaturan few-shot yang identik, yang merupakan cara yang benar untuk melakukannya, tetapi itu tetap harness satu laboratorium. Perlakukan setiap angka di bagian ini sebagai laporan vendor sampai ada pihak lain yang menjalankannya.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

Apa yang Anda butuhkan untuk menjalankannya

Kolibri bukan model yang bisa Anda coba di laptop. Bobot FP8 memiliki jejak memori model sekitar 78 GB, dan kartu minimumnya adalah dua kartu A100 80 GB, dua H100 SXM5, satu H200, satu B200, atau satu B300; konfigurasi yang direkomendasikan adalah dua H100 SXM5, dua H200, satu B200, atau satu B300.

Menyajikannya berarti menginstal paket aleph-alpha-inference, yang menyediakan plugin Kolibri vLLM dan mematok versi vLLM yang didukungnya, atau menarik image container ghcr.io/aleph-alpha/aleph-alpha-inference. Dari sana, ini adalah pemanggilan vLLM standar dengan cache KV FP8, parser penalaran Kolibri, dan parser panggilan alat Kolibri. Konteks yang melebihi 262.144 token memerlukan flag maximum-model-length eksplisit dan override penyematan posisi. Parameter sampling yang direkomendasikan adalah temperature 1.0, top-p 0.97, dan top-k 128.

Permukaan API-nya kompatibel dengan OpenAI, dan ini lebih penting daripada kedengarannya: reasoning effort diteruskan melalui templat chat sebagai nilai reasoning_effort, dan panggilan tool dikeluarkan dalam field tools standar. Tim yang sudah terbiasa dengan format chat-completions dapat mengarahkan kode yang ada ke endpoint Kolibri di mesin yang berada di gedung mereka sendiri tanpa lapisan wrapper.

Apa yang belum dimiliki Kolibri

Empat ketiadaan patut dinyatakan secara terang-terangan, karena liputan peluncuran cenderung melewatkannya.

• Tidak ada evaluasi independen. Artificial Analysis tidak memiliki halaman model untuk Kolibri, dan tidak ada pihak ketiga yang telah menerbitkan reproduksi tabel benchmark vendor tersebut.

• Tidak ada endpoint yang dihosting dari vendor. Rilis ini berupa bobot plus laporan teknis; tidak ada SKU API Aleph Alpha untuk Kolibri dalam materi yang dipublikasikan bersama model tersebut.

Tidak ada rute di OrcaRouter, dan tidak ada juga di aggregator mana pun yang mau kami sebutkan. Kami telah menelusuri katalog dengan setiap ejaan prefiks vendor dan nama model, dan Kolibri tidak ada di sana — jadi jika Anda ingin memanggilnya, Anda harus mengunduh 78 GB dan menjalankan endpoint vLLM sendiri. Kami lebih suka mengatakan itu daripada menyiratkan bahwa kami menyediakannya.

• Tidak ada input multimodal. Teks masuk, teks keluar, dua bahasa. Itulah kompromi yang dibuat lab ini demi kedalaman alih-alih keluasan, dan untuk penerapan pemrosesan dokumen itu mungkin pilihan yang tepat, tetapi itu tetap merupakan batas yang nyata.

Jika yang sebenarnya Anda butuhkan hari ini adalah model mixture-of-experts kecil yang dapat Anda panggil tanpa membeli dua GPU, tingkat Gemma 4 MoE adalah hal terdekat yang sudah ada di endpoint yang dirutekan, dengan $0,06 per juta token input dan $0,33 per juta output pada varian 26B-A4B, dengan jendela 262.144 token. Bagi siapa pun yang mempertimbangkan deployment sovereign 78B yang di-host sendiri dibandingkan dengan itu, perbandingan yang berguna bukanlah baris benchmark — melainkan 78 GB VRAM dan percakapan pengadaan versus pos biaya per token. OrcaRouter merutekan tingkat tersebut melalui satu kunci yang kompatibel dengan OpenAI, sementara harga daftar penyedia diteruskan apa adanya dan tidak ada yang ditambahkan, yang merupakan cara murah untuk mengetahui apakah beban kerja tersebut membenarkan kepemilikan perangkat kerasnya.

Kolibri sendiri adalah artefak yang lebih menarik. Model Jerman-Inggris dengan 78 miliar parameter di bawah Apache 2.0, dengan pipeline data, metode tokenizer, angka energi, dan kisah iterasi tiga bulan yang diterbitkan bersanding dengan bobotnya, adalah jenis rilis yang berbeda dari peluncuran bobot biasa — pengungkapannya adalah bagian dari produk, bukan postingan blog tentangnya. Apakah klaim Pareto dapat bertahan kini menjadi pertanyaan bagi orang-orang yang memiliki dua H100 dan stopwatch, dan jawabannya tidak akan datang dari siapa pun yang menulis kartu model itu.