
Kolibri vs Intern-Decision 4B: Satu Menulis Dokumen, yang Lain Menolak Menulis Apa Pun Sama Sekali
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 217 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Hal yang paling berguna untuk diperhatikan tentang Kolibri dan Intern-Decision-4B adalah bahwa keduanya bukan jenis objek yang sama, dan menganggap ini sebagai perbandingan model versus model akan menjadi kesalahan kategori. Kolibri adalah model bahasa mixture-of-experts 78,1 miliar parameter milik Aleph Alpha, yang dirilis pada 3 Oktober 2026, yang mengaktifkan 3,46 miliar parameter per token dan menulis teks Jerman serta Inggris. Intern-Decision-4B adalah model keputusan terstruktur multimodal 4,54 miliar parameter dari tim InternLM, yang diunggah ke Hugging Face pada 26 September 2026, yang kartunya menyatakan dengan gamblang bahwa model ini "tidak memanggil generate() atau mengambil sampel teks bentuk bebas" sama sekali. Yang satu menghasilkan prosa. Yang lain menghasilkan distribusi probabilitas atas opsi yang Anda berikan, dalam satu forward pass, dan tidak memiliki kemampuan untuk menulis kalimat. Keduanya hanya menjadi pesaing dalam satu situasi sempit, dan mengetahui secara persis situasi mana itu justru merupakan hal yang paling berguna dari kedua rilis tersebut.
Dua rilis, dua klaim singkat yang sepenuhnya berbeda
Kartu Kolibri adalah spesifikasi model bahasa sparse besar: 50 lapisan, setiap lapisan merupakan mixture-of-experts, 384 pakar per lapisan dengan satu pakar shared dan enam pakar routed, konteks native 262.144 token yang divalidasi hingga 1.048.576, empat tingkat upaya penalaran, pemanggilan alat bergaya Hermes dengan parser vLLM yang disertakan, bobot FP8 dalam blok 128×128, dan ketentuan Apache 2.0. Pelatihannya memproses 20 triliun token pada 768 NVIDIA B200s selama 21 hari — 392.000 GPU-jam pada 6,4×10²³ FLOPs yang dilaporkan dan perkiraan 9,5×10² MWh termasuk overhead pusat data, tidak termasuk supervised fine-tuning dan reinforcement learning. Konfigurasi penyajian minimum pada kartu tersebut adalah dua kartu A100 80 GB, dua H100 SXM5, satu H200, satu B200 atau satu B300, dan jejak FP8 sekitar 78 GB. Ini adalah infrastruktur yang serius, dan ia menjawab pertanyaan dengan menghasilkan teks.
Intern-Decision-4B adalah jenis objek yang berlawanan, dan kartunya menyegarkan karena begitu blak-blakan tentang hal itu. Ini adalah fine-tune dari Qwen3.5-4B di mana menara visi dan proyektor dibekukan dan hanya tulang punggung bahasanya yang dilatih. Anda memberinya sebuah state, skema pertanyaan bernama, dan secara opsional hingga delapan gambar, lalu ia mengembalikan distribusi atas jawaban kandidat untuk setiap pertanyaan sekaligus. Mekanismenya tidak biasa dan layak dinyatakan secara tepat: opsi dipetakan ke simbol token tunggal yang mencakup A sampai Z, a sampai z, dan 0 sampai 9 — 62 kandidat, sehingga maksimum 62 opsi per pertanyaan — prompt dirender dengan satu placeholder per field, dan model membaca logit pada posisi tepat sebelum setiap placeholder. Softmax dijalankan hanya pada logit simbol yang diizinkan untuk field tersebut, suhu spesifik checkpoint mengkalibrasi hasilnya, dan simbol dipetakan kembali ke nilai opsi asli Anda sebagai JSON bertipe. Tidak ada loop decoding, tidak ada sampling, dan tidak ada prosa.
• Keluaran — Kolibri: teks Jerman atau Inggris yang dihasilkan secara bebas, panggilan alat, jejak penalaran. Intern-Decision-4B: jawaban JSON bertipe dengan probabilitas per opsi.
• Parameter — Kolibri: total 78.103.074.560, aktif 3.457.573.120. Intern-Decision-4B: 4,54 miliar di empat shard safetensors dalam bfloat16, dengan tower visi yang dibekukan.
• Input — Kolibri: hanya teks. Intern-Decision-4B: teks ditambah hingga delapan gambar.
• Kapasitas pertanyaan — Intern-Decision-4B: hingga 62 opsi per bidang, dalam satu forward pass, dengan jenis pertanyaan 'choice', 'score', dan 'noul' (ya/tidak). Kolibri: tidak terbatas secara prinsip, satu token pada satu waktu dalam praktik.
• Bahasa — Kolibri: Jerman dan Inggris secara konstruksi. Intern-Decision-4B: apa pun yang dibawa Qwen3.5-4B, dengan semua rangkaian evaluasi yang dipublikasikan dalam bahasa Inggris.
• Latensi — Intern-Decision-4B: 44,16 ms, median 44,03 ms, dan 44,60 ms P per kueri pada satu RTX 4090, berdasarkan pengukurannya sendiri. Kolibri: tidak ada angka per kueri yang dipublikasikan sama sekali.
• Lisensi — keduanya Apache 2.0; Intern-Decision-4B dikirimkan dengan file lisensi Qwen yang tetap dipertahankan di sampingnya.

Mengapa scorer 4B ada sama sekali
Argumen yang mendukung Intern-Decision-4B bukanlah bahwa model itu kecil. Argumennya adalah bahwa meminta probabilitas dari sebuah model generatif besar tidak sama dengan mengukurnya, dan perbedaannya dapat diukur.
Tabel benchmark milik kartu itu sendiri menyampaikan argumen dengan tingkat keterbukaan diri yang tidak biasa. Di tujuh suite akurasi, Intern-Decision-4B rata-rata 90,02 — dibandingkan 88,74 untuk baseline terkuat yang menjadi pembandingnya, sebuah model bernama Jev. Tetapi akurasi adalah bagian yang tidak menarik. Tabel itu juga melaporkan skor Brier dan kesalahan kalibrasi yang diharapkan, dan di situ gambarannya lebih ketat. Model 4B mencatat Brier 0,347 dan ECE 0,065, dibandingkan Jev dengan 0,358 dan 0,095. Varian yang lebih kecil justru menjadi tempat cerita kalibrasi benar-benar informatif. Intern-Decision-2B mencetak rata-rata 84,68, jauh di depan 0.8B pada 79,38 — namun ECE-nya 0,100 lebih buruk daripada 0.8B sebesar 0,066 dan lebih buruk daripada 4B sebesar 0,065, dengan Brier 0,437 dibandingkan 0.8B sebesar 0,530. Model paling akurat di antara dua model kecil itu adalah yang paling tidak jujur tentang keyakinannya sendiri. Jika Anda mengira kalibrasi membaik seiring akurasi, atau seiring jumlah parameter, tabel itu adalah contoh kontra untuk kedua anggapan tersebut.
Diagnostik kedua yang terpisah mencakup 96 kasus yang dibangun dengan distribusi referensi eksak alih-alih label keras yang disampel — pengambilan acak, peristiwa gabungan, riwayat bersyarat, teka-teki probabilitas. Kesalahan model 4B pada studi pilot itu turun dari 0,628 menjadi 0,550 pada metrik yang dilaporkan, sementara model pembanding berada di 0,595. Kartu tersebut secara eksplisit menyatakan bahwa studi pilot ini tidak digunakan untuk menyesuaikan atau memilih temperature yang dipublikasikan; temperature model 4B sebesar 1,992418 disesuaikan secara terpisah pada set kalibrasi. Tim InternLM juga menyertakan benchmark itu sendiri ke dalam repositori GitHub — generator deterministik, referensi, dan penilai offline — yang berarti klaim kalibrasi tersebut termasuk jenis langka yang benar-benar dapat dijalankan ulang oleh pihak ketiga alih-alih hanya diterima begitu saja.
Tidak ada apa pun dalam rilis Kolibri yang menawarkan padanan. Tabel perbandingannya melaporkan akurasi tugas pada empat belas model di satu harness vendor, dan akurasi adalah hal yang dapat diukur dari model generatif. Tidak ada angka kalibrasi, tidak ada Brier atau ECE di mana pun dalam materi tersebut, dan tidak ada cara untuk memintanya memberikan "probabilitas bahwa klausul kontrak ini dapat ditegakkan" yang tidak melibatkan pengambilan sampel kalimat dan membacanya.
Satu-satunya jahitan tempat mereka benar-benar bertemu
Letakkan keduanya berdampingan dalam pipeline nyata dan bentuknya menjadi jelas. Alur kerja dokumen berbahasa Jerman membutuhkan kedua bagiannya, dan tidak ada alat yang mencakup bagian alat lainnya.
Kolibri adalah bagian yang membaca dan menulis. Tim dengan kontrak atau dokumentasi teknis berbahasa Jerman mendapatkan jendela native 262.144 token, cache KV FP8, tokenizer bilingual yang menurut laporan Aleph Alpha mencapai rata-rata 4,90 byte per token pada teks web berbahasa Jerman, dan pemanggilan alat Hermes — yang berarti, model yang dapat merangkum berkas, menyusun balasan, dan menjalankan loop alat. Yang tidak dapat dilakukannya adalah memberi tahu Anda tingkat keyakinannya sendiri dengan cara yang dapat Anda audit, karena semua yang dihasilkannya adalah string hasil sampling.
Intern-Decision-4B adalah bagian yang mengambil keputusan. Diberi satu halaman teks Jerman dan serangkaian opsi tetap, model ini mengembalikan distribusi terkalibrasi dalam 44 milidetik pada satu GPU konsumen, tanpa langkah generasi dan karenanya sama sekali tanpa varians sampling. Yang tidak dapat dilakukannya adalah menghasilkan teks Jerman itu sejak awal, dan rangkaian evaluasinya yang dipublikasikan berbahasa Inggris — perilaku Jermannya diwarisi dari basis Qwen3.5-4B alih-alih dilatih untuk itu, yang merupakan keterbatasan nyata untuk penerapan berbahasa Jerman dan merupakan hal yang belum dievaluasi oleh siapa pun.
Jadi, jawaban engineering yang jujur untuk alur kerja berbahasa Jerman yang diatur adalah bahwa ini adalah dua tahap dari satu pipeline, bukan dua kandidat untuk satu slot. Pertanyaan praktisnya adalah di mana masing-masing dijalankan. Kolibri membutuhkan dua H100 atau satu B200 dan sekitar 78 GB. Intern-Decision-4B membutuhkan satu RTX 4090 dan menjalankan kueri dalam waktu kurang dari 45 milidetik. Asimetri biayanya kira-kira dua orde besaran pada perangkat keras, dan ini mengarah pada desain di mana scorer kecil berjalan terus-menerus pada setiap kasus dan generator besar hanya dipanggil ketika suatu kasus benar-benar membutuhkan prosa. Itu adalah bentuk yang lebih murah dan lebih ramah audit daripada mengarahkan setiap kasus melalui model 78B untuk mendapatkan jawaban yang kemudian harus Anda tafsirkan.

Realitas hosting untuk keduanya, dan untuk apa lapisan itu
Tidak satu pun dari kedua model itu tersedia sebagai API terhosting, dan kami memeriksanya, bukan mengasumsikan. Intern-Decision-4B tidak memiliki endpoint vendor; rilisnya berupa bobot, repositori GitHub, dan Hugging Face Space. Jumlah unduhan dan suka-nya telah berubah sejak pertengahan minggu, yang menunjukkan orang mulai menggunakannya, tetapi masih belum ada rute berbayar yang dapat dipanggil di mana pun yang akan kami sebutkan.
Kolibri juga tidak memiliki SKU API Aleph Alpha — rilisnya adalah bobot, laporan teknis, dan image kontainer di ghcr.io/aleph-alpha/aleph-alpha-inference. Dan ini tidak ada di OrcaRouter: kami telah menelusuri katalog dengan setiap ejaan prefiks vendor dan nama modelnya dan hasilnya tidak ditemukan, yang lebih kami pilih untuk katakan daripada menyiratkan sebaliknya.
Yang diubah oleh lapisan routing di sini bukanlah akses ke kedua model ini, melainkan ekonomi dalam memutuskan apakah akan membeli perangkat keras untuk salah satunya. Uji pra-pembelian yang jujur untuk bagian generatif adalah menjalankan beban kerja terhadap tier mixture-of-experts kecil yang sudah dirutekan — varian Gemma 4 26B-A4B pada $0,06 per juta token input dan $0,33 per juta output dengan jendela 262.144 token serta input teks, gambar, dan video — pada satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia tanpa tambahan apa pun, dan lihat apakah beban kerja dokumen bahasa Jerman benar-benar membutuhkan 78 miliar parameter sebelum GPU dipesan. Bagian keputusan tidak punya jalan pintas seperti itu, karena perilaku distribusi terkalibrasi adalah inti dari model tersebut dan tidak ada tier yang dirutekan yang melakukannya. Namun itu sendiri adalah temuannya: hal itu memberi tahu Anda bahwa penilai 4B adalah bagian yang benar-benar akan Anda hosting sendiri, dan generator adalah bagian yang layak diuji ulang terhadap sesuatu yang bisa Anda sewa sore ini.
Apa yang bisa menyelesaikannya
Dua pengukuran, dan keduanya belum ada.
Yang pertama adalah Intern-Decision-4B pada masukan bahasa Jerman. Setiap rangkaian yang diterbitkan berbahasa Inggris dan model ini adalah fine-tune dari basis multibahasa, sehingga kalibrasi bahasa Jermannya tidak diketahui — dan kalibrasi justru properti yang tidak berpindah begitu saja antar bahasa. Versi bahasa Jerman dari pilot distribusi 96 kasus akan menjadi artefak paling informatif yang bisa diterbitkan siapa pun tentang model ini.
Yang kedua adalah biaya per keputusan Kolibri. Klaim ekonomi penyajiannya adalah frontier Pareto kualitas terhadap token yang didekode per detik per GPU, dan tidak ada halaman Artificial Analysis untuk Kolibri dan tidak ada replikasi pihak ketiga atas harness tersebut. Sampai seseorang menjalankannya, "78 miliar parameter" adalah spesifikasi, bukan biaya, dan argumen untuk mempertahankan penilai 44 milidetik di depannya tetap merupakan argumen desain, bukan argumen yang terukur.
Sampai saat itu, cara yang tepat untuk membaca pasangan ini bukanlah sebagai kontes. Intern-Decision-4B adalah rilis yang lebih menarik secara teknis di antara keduanya, karena output terstruktur yang sadar kalibrasi adalah kemampuan yang hampir tidak ditawarkan model generatif mana pun dan kartu modelnya memungkinkan Anda memeriksa klaim tersebut. Kolibri adalah rilis yang lebih berdampak, karena lab Eropa yang merilis model Apache 2.0 dengan 78 miliar parameter bersama pipeline datanya yang diterbitkan berdampingan merupakan peristiwa rantai pasok, bukan peristiwa model. Tidak ada yang menggantikan yang lain. Tim yang membutuhkan keduanya harus merencanakan keduanya dan menyesuaikan ukuran perangkat kerasnya, dan harness di sekitar keduanya adalah tempat upaya rekayasa sebenarnya diarahkan.

