
Kolibri vs Solar Mini 4: Anggaran Aktif 3B yang Sama, Dua Taruhan yang Sangat Berbeda
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 217 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua model dirilis dengan selisih tujuh belas hari, keduanya disetel untuk menghabiskan sekitar tiga miliar parameter aktif per token, dan untuk benar-benar diadopsi, keduanya nyaris tidak bisa lebih berbeda. Kolibri dari Aleph Alpha adalah 78,1 miliar parameter berupa bobot Apache-2.0 yang Anda unduh dan layani sendiri: tidak ada endpoint yang dihosting, dan hingga hari ini tidak ada satu pun skor independen untuknya di mana pun. Solar Mini 4 dari Upstage adalah 35 miliar parameter yang sama sekali tidak dapat Anda unduh — model ini hanya ada sebagai endpoint berbayar sesuai pemakaian, dan sudah mencantumkan Artificial Analysis Intelligence Index 24,05. Jumlah parameter aktif memberi tahu Anda berapa biaya untuk menjalankan masing-masing. Tidak ada hal lain tentang angka itu yang memberi tahu Anda berapa biaya yang harus Anda keluarkan untuk memulai.
Alasan totalnya berbeda sejauh ini — 78.1B dibandingkan 35B dengan slice aktif yang hampir sama — adalah bahwa keduanya merupakan desain sparse mixture-of-experts, dan kedua lab membuat keputusan yang berlawanan tentang berapa banyak kapasitas expert yang perlu disimpan sebagai cadangan. Kolibri membawa 384 expert dan merutekan ke 1 shared plus 6 di antaranya per token. Solar Mini 4 mengungkapkan pembagian 35B/3B dan tidak menyebutkan apa pun tentang jumlah expert-nya. Ketika dua model diiklankan dengan angka aktif yang sama, total parameter, bukan angka aktif, yang menentukan tagihan hardware Anda — dan di sini terdapat perbedaan 2.2× pada anggaran komputasi yang dinyatakan sama.
Apa sebenarnya masing-masing itu
• Total parameter — Kolibri 78.10B vs Solar Mini 4 35B
• Parameter aktif per token — Kolibri 3.46B vs Solar Mini 4 3B
• Bobot — Kolibri Apache 2.0, bobot lengkap di Hugging Face vs Solar Mini 4 tertutup; hanya API
• Konteks — Kolibri 1,048,576 token tervalidasi vs Solar Mini 4 512K menurut dokumentasi Upstage, 1,048,576 menurut kartu model Artificial Analysis
• Output maksimum — Kolibri tidak dibatasi oleh vendor vs Solar Mini 4 128.000 token
• Bahasa — Kolibri Jerman dan Inggris vs Solar Mini 4 Inggris, Korea, dan Jepang
• Batas pengetahuan — Kolibri 18 Juni 2026 vs Solar Mini 4 Februari 2026
• Penyampaian — Kolibri yang dihosting sendiri (vLLM) vs Solar Mini 4 yang dihosting di Console, Playground, dan on-premises milik Upstage
• Evaluasi independen — Kolibri tidak ada yang dipublikasikan vs Solar Mini 4 AA Intelligence Index 24.05
Kolibri: 78 miliar parameter, dan belum ada orang di luar lab yang menilainya
Aleph Alpha menerbitkan Kolibri pada 3 Oktober 2026, sengaja pada Hari Reunifikasi Jerman, sebagai yang pertama dari keluarga baru dan penerus Kolibri Origin. Kartu model tersebut secara tidak biasa terbuka tentang apa saja yang masuk ke dalamnya: 20 triliun token prapelatihan, 3,44 triliun pelatihan menengah, dan 201 miliar pelatihan konteks panjang, dijalankan di 768 GPU B200 selama 21 hari untuk sekitar 6,4×10²³ FLOPs dan sekitar 950 MWh. Vendor juga dengan sukarela menyebutkan jumlah kegagalannya — 38 interupsi tak terencana, sekitar satu per 10.000 jam-GPU — yang merupakan jenis angka yang biasanya dihilangkan oleh laboratorium.

Arsitektur ini adalah kisah sparse-MoE yang bersih. Lima puluh lapisan dengan rasio 4:1 antara atensi jendela geser (jendela 512 token) terhadap atensi global, yang hanya aktif pada setiap lapisan kelima. Bobot FP8 dengan penskalaan blok 128×128 dan cache KV FP8. Kolibri Origin, sebagai perbandingan, menggunakan 128 expert yang dirutekan selebar 8, dimensi tersembunyi expert selebar 768, dan atensi penuh pada setiap lapisan, pada data bahasa Inggris yang dipotong pada September 2024. Kolibri beralih ke 384 expert yang dirutekan selebar 6 dengan dimensi tersembunyi selebar 512, dan mendorong kedua batas data bahasa menjadi 18 Juni 2026.
Pipeline Jerman adalah bagian yang benar-benar sulit dibeli di tempat lain. Aleph Alpha melatih tokenizer UniBPE-nya sendiri dan melaporkan teks Jerman pada 4,90 byte per token, dibandingkan dengan 4,35 untuk GPT-5, 4,17 untuk Qwen3.5, dan 4,13 untuk Gemini. Itu adalah tokenizer yang mengklaim kompresi bahasa Jerman lebih baik daripada model multibahasa terdepan mana pun, dan itulah mekanisme konkret di balik tawaran penerapan berdaulat: lebih sedikit token per dokumen Jerman berarti lebih sedikit token yang ditagih dan jendela efektif yang lebih panjang pada perangkat keras yang sama.
Setiap angka performa yang ada untuk Kolibri berasal dari kartu model milik Aleph Alpha sendiri, dan memang harus dibaca seperti itu. Tabel yang dilaporkan vendor menempatkan Kolibri pada keseluruhan 75,5 untuk evaluasi bahasa Inggris dan 70,8 untuk bahasa Jerman, 84,3 pada GPQA Diamond dalam bahasa Inggris versus 81,3 dalam bahasa Jerman, 21,5 pada Humanity's Last Exam dalam bahasa Inggris versus 15,9 dalam bahasa Jerman, 66,4 pada SWE-Bench Verified, 85,9 pada LiveCodeBench v6, dan 68,3 pada AA-LCR. Itu adalah angka-angka yang belum diaudit. Tidak ada halaman Artificial Analysis untuk Kolibri — URL model pelacak tersebut mengembalikan 404 — jadi tidak ada apa pun di tabel itu yang telah direproduksi secara independen, dan artikel yang Anda baca tidak dapat membuatnya lebih kokoh daripada kondisinya.
Yang membuat kartu ini kokoh adalah cerita penyajiannya. Batas minimum perangkat kerasnya adalah dua A100 80GB, atau dua H100 SXM5, atau satu H200, B200, atau B300. Resep vLLM yang telah dipublikasikan menjalankannya dengan --kv-cache-dtype fp8 serta parser penalaran dan pemanggilan alat khusus, pada temperature 1.0, top-p 0.97, dan top-k 128, dengan reasoning_effort pengatur yang mencakup none, low, medium, dan high. Satu B300 yang melayani model 78B pada konteks tervalidasi 1 juta token adalah bentuk konkret dari tawaran ini: Anda membeli kotaknya, lalu Anda menanggung biaya marginal untuk setiap token.
Solar Mini 4: Anda menyewa slice aktif 3B alih-alih membelinya
Solar Mini 4 hadir pada 22 September 2026 — snapshot solar-mini4-260922, alias solar-mini4 — sebagai model kecil berorientasi agen milik Upstage: total 35B, aktif 3B, cutoff Februari 2026, bahasa Inggris, Korea, dan Jepang, dengan mode chat, penalaran, output terstruktur, dan pemanggilan alat. Model ini tersedia melalui Console dan Playground Upstage, serta untuk penerapan on-premises, tetapi tidak ada unduhan bobot dan tidak ada lisensi untuk diperiksa. Dokumentasi Upstage juga mencatat "Data tidak dikumpulkan" untuknya, yang merupakan pernyataan kepatuhan yang penting jika Anda menempatkannya di depan lalu lintas nyata.

Berbeda dengan Kolibri, Solar Mini 4 telah melalui harness independen. Artificial Analysis menempatkannya pada Indeks Kecerdasan 24,05, dengan hasil terukur 1,01% pada Terminal-Bench 4.0, 47,6% pada SciCode, 83,3% pada AA-LCR, dan 25,8% pada Humanity's Last Exam. Postingan peluncuran Upstage membingkai 24,1 sebagai Indeks tertinggi di antara model dengan 3B parameter aktif, di depan Qwen3.6 35B A3B pada 18 dan Nemotron 3.5 Lightning pada 13 — pembingkaian yang adil sejauh itu, dan yang patut dicatat adalah bahwa hal itu persis sesempit kedengarannya, karena ini adalah klaim tentang kelas 3B-aktif, bukan tentang model kecil secara umum.
Pengukuran yang seharusnya membentuk cara Anda menganggarkan biayanya bukanlah Indeks. Rincian biaya per tugas Artificial Analysis menempatkan Solar Mini 4 pada sekitar $0,36 per tugas Intelligence-Index, dan sekitar $0,30 dari jumlah itu — sekitar 82% — adalah penulisan cache prompt. Pembacaan cache adalah $0,03 dan output yang dihasilkan hanya $0,035. Model ini mengeluarkan sekitar 88.300 token output per tugas, yang sekitar 71.600 di antaranya adalah token penalaran. Dengan kata lain: ini adalah model murah yang tagihannya didominasi oleh penulisan ulang konteks panjang, bukan oleh token yang ditulisnya kembali. Biaya per evaluasi berkisar dari $1,63 untuk Terminal-Bench 4.0 hingga $0,95 untuk AA-Briefcase. Kecepatan output median adalah 198 token per detik pada waktu 1,58 detik ke chunk pertama.
Harga setiap jalur
Solar Mini 4 tidak dipatok pada harga daftar hari ini. Halaman harga Upstage sendiri menampilkan tangga bertanggal untuknya: $0,03 per juta input, $0,003 untuk input yang di-cache, dan $0,12 output — diskon peluncuran 70% — hingga 10 Oktober 2026 UTC, lalu $0,05 / $0,005 / $0,20 mulai 11 Oktober, dan akhirnya harga daftar $0,10 / $0,01 / $0,40 mulai 23 Oktober. Postingan peluncuran Upstage menggambarkan diskonnya lebih longgar daripada jadwal di halaman harga itu sendiri; tangga di atas adalah versi yang mencantumkan tanggal, dan itulah yang layak dijadikan acuan perencanaan. Perhatikan di mana diskon paling curam berada: input yang di-cache turun menjadi sepersepuluh dari tarif input, yang memberikan keuntungan tepat pada beban kerja konteks stabil panjang yang dibebani oleh profil biaya penulisan cache di atas.
Harga Kolibri adalah pesanan pembelian. Tidak ada tarif per juta token untuk dibandingkan karena tidak ada meteran terkelola — Anda membayar GPU dan listrik, dan satu-satunya sinyal biaya publik dari vendor adalah proses pelatihan itu sendiri: sekitar 950 MWh untuk menghasilkan model tersebut. Jika Anda sudah memiliki kapasitas inferensi, biaya marginal Kolibri per token mendekati biaya listrik; jika belum, tiket masuknya adalah mesin dengan dua A100 atau lebih baik. Itu adalah bentuk komitmen yang secara fundamental berbeda dari model yang dapat Anda panggil per juta token dan berhenti memanggilnya besok, dan itulah keputusan sebenarnya yang disajikan oleh kedua opsi tersebut.
Di mana keduanya tumpang tindih, dan di mana perbandingannya tidak lagi berlaku
• Komputasi aktif — hampir identik: 3,46B dibandingkan dengan 3B per token
• Segala sesuatu yang mengikutinya — tidak dapat dibandingkan, karena hanya satu dari keduanya yang memiliki bukti terverifikasi
• Skor terukur terbaik — Solar Mini 4 memiliki Indeks teraudit sebesar 24,05; Kolibri memiliki tabel vendor dan sama sekali tidak memiliki skor teraudit
• Jerman — Kolibri adalah satu-satunya dari keduanya yang dilatih untuk bahasa tersebut, pada 4,90 byte per token; Solar Mini 4 tidak mencantumkannya
• Bahasa Korea dan Jepang — Solar Mini 4 mencantumkan keduanya; Kolibri tidak mencantumkan keduanya
• Konteks panjang — Kolibri memvalidasi 1.048.576 token penuh; dokumentasi Solar Mini 4 sendiri menyebut 512K sementara kartu Artificial Analysis-nya menyebut 1M, jadi anggap batas atasnya bergantung pada vendor
• Waktu hingga token pertama — Solar Mini 4 hanya butuh hitungan menit, karena Anda cukup mendaftar; Kolibri butuh hitungan hari, karena Anda harus memasang kotaknya ke rak
• Model biaya — per token, menurun seiring tangga diskon, dibandingkan dengan modal ditambah daya
Ringkasan jujurnya adalah ini bukan pertandingan yang bisa diputuskan di papan peringkat. Tabel vendor Kolibri bahkan menyertakan kumpulan pembandingnya sendiri — GLM-4.7 Flash 30B-A3B pada 64,7 bahasa Inggris keseluruhan, Nemotron 3 Nano 30B-A3B pada 65,6, Qwen3.5 35B-A3B pada 74,7, Qwen3.6 35B-A3B pada 71,4, Gemma 4 26B-A4B IT pada 71,9, semuanya dibandingkan dengan 75,5 milik Kolibri sendiri — dan setiap baris itu adalah angka milik Aleph Alpha sendiri, dijalankan oleh lab yang sama dengan harness miliknya sendiri. Ini peta yang berguna untuk lingkungan 3B-aktif. Ini bukan peringkat independen.
Jika yang Anda inginkan adalah MoE dengan 3B aktif pada sebuah kunci hari ini
Tidak ada satu pun model dalam perbandingan ini yang ada di OrcaRouter, dan ada baiknya kita menjelaskan alasannya secara tepat. Kolibri belum memiliki inferensi yang dihosting dalam bentuk apa pun — ia hanyalah bobot dan resep vLLM, jadi tidak ada yang bisa dituju oleh router. Solar Mini 4 dilayani oleh Upstage dan oleh kanal on-premises milik Upstage sendiri; kami tidak merutekannya, dan kami tidak merutekan model Upstage mana pun. Jika Anda menginginkan salah satunya, Anda mendapatkannya dari vendor masing-masing.
Yang kami rutekan adalah kelas sekitarnya — segmen small-MoE sparse tempat kedua model ini bersaing. Gemma 4 26B-A4B IT ada di katalog dengan tarif $0.06 untuk input dan $0.33 untuk output per juta token dengan jendela 262,144 token. Qwen3.5 35B-A3B berada pada $0.057 / $0.459 dan Qwen3.6 35B-A3B pada $0.248 / $1.485 dengan jendela 262,144 token dan output maksimum 65,536 token. Itu sama dengan yang ditawarkan kedua model di atas — irisan aktif 3B-ke-4B yang dibeli dengan harga model kecil — tersedia di satu kunci API dengan harga daftar penyedia diteruskan pada markup 0%, sehingga perubahan harga vendor masuk ke tagihan Anda pada hari yang sama saat diumumkan, bukan pada perpanjangan kontrak berikutnya. Failover otomatis lebih penting di sini daripada biasanya: saat Anda mengevaluasi model sparse yang belum terbukti, rute kedua di balik kunci yang sama adalah yang mencegah sore buruk menjadi gangguan.

Apa yang harus dilakukan, dan apa yang perlu diperhatikan
Pilih Kolibri jika beban kerja Anda adalah bahasa Jerman atau Inggris, jika data tidak boleh meninggalkan rak Anda sendiri, dan jika Anda memiliki — atau bersedia membeli — GPU untuk melayani 78B pada FP8. Dalam konfigurasi itu, ini satu-satunya dari dua model ini yang bahkan menjadi opsi, dan konteks 1M-token tervalidasi dengan tokenizer Jerman 4,90 byte per token adalah keunggulan yang nyata, meskipun diukur oleh vendor. Pilih Solar Mini 4 jika Anda ingin sudah berada di produksi minggu ini, jika bahasa Korea atau Jepang ada dalam peta jalan, dan jika beban kerja Anda adalah konteks panjang yang stabil yang diuntungkan oleh diskon cache; anggarkan untuk penulisan cache, bukan token keluaran.
Pertanyaan terbukanya sama untuk keduanya, dan ini adalah pertanyaan bukti, bukan pertanyaan kemampuan. Angka 75,5 dan 84,3 Kolibri adalah angka Aleph Alpha sendiri pada perangkat uji milik Aleph Alpha sendiri, dan sampai ada pelacak independen yang menjalankannya, siapa pun yang mengutipnya sedang mengutip lab. Angka 24,05 Solar Mini 4 nyata dan sudah direproduksi, tetapi Index adalah snapshot dari model yang masih dalam tahap tangga diskon, dengan harga daftar baru akan berlaku pada 23 Oktober. Nantikan evaluasi independen pertama Kolibri, dan perhatikan berapa biaya Solar Mini 4 sebenarnya setelah tangga diskonnya habis — karena pada $0,10 / $0,40, ekonomi menyewa irisan 3B terlihat berbeda dari $0,03 / $0,12 yang ditawarkan kepada Anda hari ini.
