Kartu hero yang dihasilkan untuk Kolibri vs MathForm 8B, berjudul 'Kolibri vs MathForm 8B' dengan subbaris 'a generalist against a Lean 4 autoformalizer', ikon burung kolibri di sebelah kiri dan simbol kotak bukti di sebelah kanan, masing-masing di kedua sisi pembatas tipis. Logo OrcaRouter berada di strip di bawah karya seni.
Guides & Insights

Kolibri vs MathForm-8B: Salah Satu Klaim Akurasi Ini Dapat Diperiksa oleh Kompilator

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kolibri dan MathForm-8B hanya berbagi lisensi dan hampir tidak ada kesamaan lain. Keduanya Apache 2.0, keduanya berbobot terbuka, keduanya dirilis dalam tiga bulan terakhir — Kolibri milik Aleph Alpha pada 3 Oktober 2026, MathForm-8B milik OpenBMB pada 14 Agustus 2026 — dan keduanya menghabiskan sebagian besar kartu model mereka untuk membahas matematika. Di situlah kemiripannya berakhir. Kolibri adalah model campuran pakar Jerman-dan-Inggris dengan 78,1 miliar parameter yang mengaktifkan 3,46 miliar parameter per token dan dimaksudkan untuk berada dalam alur kerja dokumen yang diatur. MathForm-8B adalah model padat 8 miliar parameter yang merupakan hasil penyetelan halus dari Qwen3-8B dengan satu tugas: mengambil soal matematika yang ditulis dalam bahasa Inggris biasa dan menghasilkan pernyataan Lean 4 yang benar secara formal. Perbedaan yang penting bagi siapa pun yang mengevaluasi salah satunya bukanlah jumlah parameter. Perbedaannya adalah klaim akurasi MathForm-8B dapat dieksekusi. Anda dapat memeriksa keluarannya dengan kompilator. Klaim Kolibri tidak dapat diperiksa oleh apa pun selain menjalankan tolok ukur lain.

Asimetri itulah inti keseluruhan artikel ini, dan ia berlaku umum jauh melampaui kedua model ini. Tabel benchmark vendor adalah klaim. Asisten pembuktian yang menerima suatu formalisasi adalah hasil. Ketika seluruh ruang keluaran sebuah model adalah sesuatu yang dapat diverifikasi mesin, lapisan pemasaran lenyap — entah kompilator Lean menerima pernyataan itu atau tidak, dan sebanyak apa pun pembingkaian pos peluncuran, itu tidak mengubahnya.

Apa yang sebenarnya dihasilkan MathForm-8B

Autoformalisasi adalah tugas yang sempit, tidak glamor, dan benar-benar sulit, dan kartu modelnya menyegarkan karena spesifik soal pengaturannya.

• Input dan output — pernyataan matematika dalam bahasa alami masuk, formalisasi Lean 4 keluar, lengkap dengan header teorema.

• Model dasar — Qwen/Qwen3-8B, disetel halus; Apache 2.0 dengan bagian lain dari rilis OpenBMB.

• Pelatihan — fine-tuning terawasi yang diikuti dengan pembelajaran penguatan pada dataset FormalVerse, dengan kompilasi Lean dan umpan balik konsistensi semantik yang menggerakkan sinyal penguatan.

• Pipeline data — pengambilan pengetahuan Mathlib, kompilasi dan verifikasi semantik, penyempurnaan iteratif, lalu rekonstruksi lintasan. Diagram pipeline pada kartu model adalah hal yang paling informatif dalam rilis ini.

• Evaluasi — Tingkat kelulusan Pass@8 dalam dua pemeriksaan terpisah, Pemeriksaan Sintaks dan Pemeriksaan Konsistensi, di enam benchmark, dilaporkan sebagai rata-rata makro dengan bobot yang sama dalam sebuah gambar pada kartu, bukan sebagai tabel yang dapat kami kutip baris demi baris.

• Toolchain — Kimina Lean Server yang berjalan untuk pemeriksaan kompilasi, Lean 4.21.0 untuk eksperimen, dan sekuens maksimum 16,384 token dengan temperature 0.6 dan top-p 0.95.

• Penyajian — vLLM atau SGLang pada konteks 16.384 token, diekspos melalui antarmuka chat yang kompatibel dengan OpenAI. Detail terakhir itu lebih penting daripada kelihatannya, karena artinya model dapat langsung masuk ke pipeline yang sudah ada sebagai endpoint biasa.

Perhatikan dua pemeriksaan yang terpisah. Pemeriksaan Sintaks adalah apakah pernyataan Lean dapat diurai dan lolos pemeriksaan tipe sama sekali. Pemeriksaan Konsistensi adalah apakah pernyataan formal berarti hal yang sama dengan masalah bahasa alami — sifat yang jauh lebih sulit, karena pernyataan Lean yang valid secara sintaksis yang memformalkan teorema yang salah lebih buruk daripada kesalahan kompilasi. OpenBMB melaporkan keduanya, yang merupakan cara yang tepat untuk melakukannya dan merupakan alasan tugas ini memiliki cerita verifikasi yang tidak dimiliki oleh penalaran serba guna.

Apa yang Kolibri lakukan dengan matematika, dan mengapa itu adalah jenis angka yang berbeda

Kolibri unggul dalam matematika dalam arti benchmark. Pada harness pasca-pelatihan milik Aleph Alpha sendiri, pada tingkat upaya penalaran tinggi, ia mencetak 96,9 pada AIME 2025 dalam bahasa Inggris dan 87,5 dalam bahasa Jerman, 96,0 dan 90,0 pada AIME 2026, serta rata-rata bahasa Inggris 96,5 di seluruh rangkaian matematikanya dibandingkan 88,8 dalam bahasa Jerman. Sebagai konteks pada tabel yang sama, nilai 96,9 Kolibri pada AIME 2025 bahasa Inggris berada di atas Nemotron 3 Super 120B-A12B pada 91,7 dan Qwen3.6 35B-A3B pada 84,6, serta tepat di bawah Qwen3.8 27B pada 97,9.

Setiap angka tersebut dilaporkan vendor, pada harness milik vendor, tanpa reproduksi independen, dan tidak ada halaman Artificial Analysis untuk Kolibri yang bisa dijadikan pembanding. Itu bukan kritik terhadap angka-angkanya; itu pernyataan tentang objek jenis apa angka-angka itu. Skor AIME adalah persentase jawaban akhir yang benar pada ujian pilihan ganda. Itu memberi tahu Anda bahwa model dapat mencapai bilangan bulat. Itu tidak memberi tahu Anda apa pun tentang apakah penalaran yang menghasilkannya valid, dan tidak ada artefak yang ditinggalkan yang bisa diperiksa pihak ketiga.

Jika diletakkan di samping keluaran MathForm-8B, perbedaannya sangat mencolok. Jawaban Kolibri untuk soal AIME adalah sebuah angka. Keluaran MathForm-8B adalah pernyataan teorema Lean 4 yang entah berhasil dikompilasi terhadap Mathlib atau tidak. Jika Anda membangun sistem di mana klaim matematis harus dapat dipertanggungjawabkan — pipeline verifikasi formal, alur kerja asisten pembuktian, jejak audit — artefak kedua jauh lebih bernilai daripada yang pertama, dan tidak ada baris benchmark yang mengungkapkan hal itu.

Generated two-column scoreboard for Kolibri and MathForm-8B. Left column Kolibri: purpose 'general reasoning', output 'free-form text', checkable 'no, benchmark only', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', licence Apache 2.0. Right column MathForm-8B: purpose 'Lean 4 autoformalization', output 'Lean 4 theorem statements', checkable 'yes, a compiler checks it', parameters '8B dense', context 16,384, licence Apache 2.0. The footer reads 'Kolibri figures vendor-reported; MathForm-8B Pass@8 per its model card.'

Di mana keduanya sebenarnya akan bertemu

Jika dibingkai sebagai pertarungan, perbandingan ini tidak menarik: spesialis 8B mengalahkan generalis 78B dalam memformalkan matematika dan kalah dalam segala hal lainnya, termasuk prosa administratif Jerman, penalaran dokumen konteks panjang, dan pemanggilan alat di sepanjang lintasan agen seratus langkah. Tetapi keduanya bukan pengganti satu sama lain, dan pertanyaan yang berguna adalah seperti apa pipeline yang dibangun dari keduanya.

Komposisi alaminya adalah komposisi routing. Seorang generalis dengan penalaran kuat dan pemanggilan alat menangani ingesti, disambiguasi, dan pengambilan; seorang spesialis dipanggil untuk dua persen kasus yang memerlukan artefak formal. Melakukan itu secara manual berarti dua vendor, dua kontrak, dua SDK, dua set kredensial, dan lapisan dispatch yang dipelihara seseorang. Inilah kasus di mana satu endpoint membuktikan manfaatnya: satu kunci yang kompatibel dengan OpenAI, sebuah aturan routing yang mengirimkan permintaan berbentuk matematika ke endpoint formaliser dan segala hal lainnya ke generalis, serta failover ketika salah satunya lambat. Itu tugas DSL routing — menyusun beberapa model menjadi satu panggilan alih-alih menetapkan pilihan secara hard-wire pada waktu pengembangan — dan ketika panel model yang menjawab bersama berguna, model fusion menanganinya. Baik Kolibri maupun MathForm-8B tidak tersedia di OrcaRouter saat ini; kami menelusuri katalog untuk keduanya dengan setiap ejaan vendor dan model dan keduanya tidak ada di sana. Argumen komposisi ini tentang bentuk masalahnya, bukan tentang dua endpoint spesifik ini.

Yang ada di katalog adalah separuh generalis dari pola itu dengan harga yang bisa Anda ukur. Qwen3.8-27B tercantum pada $0.33 per juta token input dan $2.40 output dengan jendela 262.144 token, dan Qwen3.8-Max pada $2.00 dan $6.00 dengan jendela 1 juta token. Bagi tim yang sedang mengeksplorasi apakah langkah formalisasi layak ditambahkan ke pipeline dokumen, eksperimen murahnya adalah mengarahkan pekerjaan generalis ke sana, mengukur volume permintaan yang benar-benar membutuhkan artefak Lean, dan baru kemudian memutuskan apakah endpoint spesialis 16.384 token layak disediakan. Harga daftar penyedia diteruskan tanpa tambahan per token, jadi angkanya berubah pada hari vendor mengubahnya.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the 256K-token context badge, fine-tuning with self-serve deployment, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 1.88 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-13', the description as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure, with a dedicated vision tower, the pricing tiles $0.33 and $2.40, and the pricing block listing $0.330 per million input tokens and $2.40 per million output tokens.

Lisensi adalah satu-satunya baris di mana keduanya identik.

Keduanya adalah Apache 2.0, dan dalam kategori yang lazim memiliki lisensi riset khusus serta ketentuan tambahan penggunaan yang dapat diterima, itu adalah titik kesetaraan yang sungguh layak disebut — artinya tidak satu pun model memerlukan tinjauan hukum sebelum dapat digunakan secara komersial, dimodifikasi, atau didistribusikan ulang.

Kewajiban-kewajibannya berbeda di bagian lain. Kolibri membawa jejak bobot sekitar 78 GB dan batas minimum perangkat keras berupa dua kartu A100 80 GB, dua H100 SXM5, satu H200, satu B200, atau satu B300, ditambah paket aleph-alpha-inference dan plugin vLLM milik vendor. MathForm-8B dalam bfloat16 memiliki bobot sekitar 16 GB dan dapat dijalankan pada satu akselerator modern dengan konteks 16.384 token; dependensinya adalah toolchain Lean dan, untuk pipeline evaluasi, Kimina Lean Server yang berjalan. Salah satu penerapan tersebut muat di workstation. Yang lainnya tidak.

Angka konteks justru menunjukkan hal sebaliknya, dan dengan selisih yang besar. Jendela native Kolibri adalah 262.144 token, tervalidasi hingga 1.048.576, yang membuatnya menjadi model dokumen: berkas regulasi Jerman lengkap atau manual pemeliharaan kedirgantaraan muat dalam satu panggilan. MathForm-8B dibatasi pada 16.384 token secara desain, karena permintaan formalisasi hanyalah satu pernyataan masalah dan tidak ada alasan untuk membuatnya lebih panjang. Tidak ada dari angka-angka itu yang merupakan kekurangan. Keduanya sekadar menggambarkan pekerjaan yang berbeda.

Screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the apache-2.0 licence badge, the pipeline figure caption describing Mathlib knowledge retrieval, compilation and semantic verification, iterative refinement, trajectory reconstruction and training, and the start of the Results table with the MATHFORM-8B-SFT and MATHFORM-8B rows above the specialist autoformalizers including Goedel-Formalizer-V2-8B, StepFun-Formalizer-7B and Kimina-Autoformalizer-7B.

Memilih, dan pertanyaan verifikasi di bawahnya

• Pilih MathForm-8B jika output Anda harus dapat diperiksa. Jika sistem hilir menggunakan Lean 4, atau jika intinya adalah bahwa asisten pembuktian menyetujui hasilnya, tidak ada model generalis yang dapat menggantikannya, dan angka Pass@8 di bawah Syntax Check dan Consistency Check adalah yang perlu dipertanyakan, bukan baris AIME mana pun.

• Pilih Kolibri jika Anda memerlukan satu model yang membaca dokumen berbahasa Jerman dan Inggris pada konteks panjang, bernalar lintas dokumen tersebut, memanggil alat, menahan diri saat konteks tidak mendukung jawaban, dan dapat diterapkan di dalam perimeter Anda sendiri dengan lisensi yang dapat Anda nyatakan dalam satu baris. Matematika adalah kemampuan yang dimilikinya, bukan produk dirinya.

• Pertimbangkan keduanya jika Anda sedang membangun pipeline formalisasi. Bukan sebagai alternatif, melainkan sebagai dua titik ujung di balik satu aturan perutean, dengan spesialis dipanggil untuk irisan sempit permintaan yang membutuhkannya.

Dan jika Anda mengevaluasi salah satu dari keduanya berdasarkan kekuatan angka benchmark, terapkan satu uji terlebih dahulu: tanyakan artefak apa yang ditinggalkan angka itu. Untuk MathForm-8B ada file Lean dan kompilator yang entah menerimanya atau tidak, dan Anda bisa menjalankan keduanya sendiri sore ini. Untuk Kolibri ada persentase di tabel peluncuran, dilaporkan vendor, tidak direproduksi, tanpa halaman indeks independen untuk memeriksanya — dan satu-satunya cara untuk memfalsifikasinya adalah mengunduh 78 GB bobot, menyewa perangkat keras, dan menjalankan ulang harness. Asimetri itu lebih berharga daripada skor itu sendiri saat Anda memutuskan apa yang akan dipakai di produksi.