
Ember-1 vs MathForm-8B: Dua Model yang Dibangun dengan Mempersempit Basis yang Dipinjam
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Ember-1 dan MathForm-8B berbagi strategi yang tidak diakui oleh kedua lab sebagai sebuah strategi: keduanya adalah penyempitan dari model yang dilatih pihak lain. Ember-1 adalah turunan terspesialisasi dari Kimi K3 milik Moonshot AI yang dibuat Fireworks Research, dipublikasikan pada 23 September 2026, dan dilatih ulang sehingga mencapai akurasi K3 dengan sekitar 40% lebih sedikit token. MathForm-8B adalah model autoformalisasi 8B milik OpenBMB, dirilis diam-diam pada 14 Agustus 2026 sebagai fine-tune Apache-2.0 dari Qwen3-8B milik Alibaba yang mengubah matematika informal menjadi pernyataan teorema Lean 4 yang dapat diperiksa oleh kompilator. Satu penyempitan menghilangkan penalaran yang terbuang dan menjaga kapabilitas umum tetap utuh. Yang lain menghapus hampir semua kapabilitas umum dan sebagai gantinya memperoleh kemampuan verifikasi. Menyandingkan keduanya adalah cara paling jernih untuk melihat berapa biaya sebenarnya dari suatu spesialisasi, karena kedua model menghabiskan anggaran pelatihan mereka di sisi berlawanan dari buku besar itu.
Dua jenis penyempitan
Intervensi Fireworks Research bersifat perilaku. Ember-1 mempertahankan arsitektur Kimi K3 dan cakupannya — matematika, pengodean, pengikutan instruksi, percakapan, pencarian, penggunaan alat, dan rekayasa perangkat lunak semuanya muncul dalam campuran pelatihan — dan hanya mengubah berapa lama model itu bernalar sebelum menjawab. Hasil yang dilaporkan adalah bahwa panjang penalaran turun 35–50% tanpa kehilangan akurasi di tujuh tolok ukur dan dua uji A/B produksi pelanggan, dengan satu beban kerja pengodean produksi turun dari 49,3K menjadi 29,9K token keluaran sementara skornya bertahan di 0,753 versus 0,751. Setiap angka dilaporkan vendor dan belum direproduksi.
Intervensi OpenBMB bersifat kontraktual. MathForm-8B mengambil Qwen3-8B dan mengarahkan seluruh anggaran pelatihan pada satu bentuk keluaran: pernyataan Lean 4 dengan header imports dan teorema bernama. Pipeline-nya adalah fine-tuning terawasi pada FormalVerse — korpus berisi sekitar 367.000 contoh Lean 4 terverifikasi yang dibangun dan dirilis OpenBMB bersama model tersebut — lalu diikuti pembelajaran penguatan yang menggunakan kompilasi Lean dan umpan balik konsistensi semantik sebagai sinyal imbalan. Model ini tidak menyelesaikan pembuktian. Ia menulis pernyataan yang akan diselesaikan oleh pembukti, dan perumusan makalah itu sendiri menggambarkan evaluasi enam tolok ukur sebagai inti dari latihan tersebut.

Apa yang dikorbankan masing-masing
Ember-1 hanya mengorbankan sangat sedikit di atas kertas, dan itulah keseluruhan klaimnya. Lembar hasil publikasinya menunjukkan kemenangan pada Terminal Bench 2.1 dengan 82,0% melawan 80,9% milik Kimi K3 Max dan pada DeepSWE 1.1 dengan 75,2% melawan 66,4%, serta kekalahan tipis pada SWE-bench Verified dengan 92,2% melawan 93,2% dan SWE-Interact dengan 20,0% melawan 21,3%. Itu adalah angka dari vendor pada set yang dipilih vendor, tetapi polanya konsisten: sebuah model yang bukannya kehilangan kemampuan, melainkan mengalihkan ke mana ia mencurahkan usaha. Namun, penghematan tokennya berkisar dari 51,9% pada Terminal Bench hingga 5,9% pada τ-2 Bench Airline, jadi "sekitar 40%" adalah rata-rata dari rentang yang sangat lebar.
MathForm-8B melepaskan sebagian besar hal yang membuat Qwen3-8B dikenal. Model ini tidak dapat melakukan percakapan umum, tidak mencakup 119 bahasa dan dialek yang menjadi data pelatihan Qwen3-8B, dan tidak menerima gambar atau audio. Anggaran generasinya diperuntukkan bagi keluaran Lean, bukan untuk penalaran campuran yang diperluas. Yang dipertahankannya adalah lisensi permisif dan jejak kecil: empat shard safetensors dalam BF16, yang berjalan di bawah Transformers, vLLM, atau SGLang di balik endpoint yang kompatibel dengan OpenAI, dengan jalur kompilasi yang mengharapkan Kimina Lean Server pada Lean 4.21.0.
Angka-angka itu mengukur hal yang berbeda, dan selisihnya adalah intinya.
Angka utama Ember-1 adalah persentase tugas yang diselesaikan dengan benar oleh agen — Terminal Bench 2.1, 89 sampel, 82,0%. Angka utama MathForm-8B adalah skor rata-rata Pass@8 pada enam tolok ukur autoformalisasi: 88,06% dalam pemeriksaan sintaksis dan 72,37% dalam pemeriksaan konsistensi yang lebih ketat. Keduanya tidak berada pada sumbu yang sama. Yang satu mengukur apakah agen menyelesaikan pekerjaan di terminal; yang lain mengukur apakah pernyataan teorema yang dihasilkan dapat diparsing dan apakah maknanya sama dengan masalah informal asal yang menjadi sumbernya.
Sebaran 88,06 versus 72,37 di dalam hasil MathForm sendiri adalah angka yang lebih instruktif. Kesenjangan antara "ini dapat dikompilasi" dan "ini dapat dikompilasi dan menyatakan apa yang saya maksud" adalah sekitar enam belas poin, dan itulah mode kegagalan yang membuat autoformalisasi menjadi sulit: pernyataan yang lolos pemeriksaan tipe sambil diam-diam melemahkan klaim asli lebih buruk daripada kesalahan yang jelas, karena tidak ada proses hilir yang menandainya. Pada kumpulan tersulit, pemeriksaan konsistensi turun menjadi 63% pada FATE-H dan 37% pada FATE-X, sedangkan kumpulan yang mudah seperti FormalIMATH berada pada 95,06% dan ProverBench pada 94,83%. Itu adalah seorang spesialis yang jujur tentang di mana seorang spesialis lemah, dan itu lebih berguna daripada satu rata-rata.
Kontrasnya, dimensi demi dimensi
• Model dasar — Ember-1: Kimi K3. MathForm-8B: Qwen3-8B.
• Apa yang diubah oleh pelatihan — Ember-1: berapa lama model bernalar, dengan kapabilitas dijaga konstan. MathForm-8B: apa yang dikeluarkan model, dengan generalitas sebagian besar dikorbankan.
• Parameter — Ember-1: tidak diungkapkan. MathForm-8B: ~8B, padat, BF16.
• Kontrak keluaran — Ember-1: teks biasa dan panggilan alat, dengan kualitas tingkat K3. MathForm-8B: pernyataan Lean 4 dengan header dan teorema bernama.
• Lisensi dan bobot — Ember-1: tidak ada yang dipublikasikan; pratinjau riset melalui platform milik vendor sendiri. MathForm-8B: Apache 2.0, bobot dan dataset keduanya dapat diunduh.
• Headline yang dilaporkan — Ember-1: 82,0% Terminal Bench 2.1 dengan 51,9% lebih sedikit token. MathForm-8B: rata-rata 88,06% Pass@8 pada pemeriksaan sintaks, 72,37% pada pemeriksaan konsistensi.
• Verifikasi independen — tidak ada satu pun; keduanya dilaporkan oleh vendor dan tidak direproduksi.

Baris lisensi lebih menentukan daripada benchmark.
Terlepas dari semua perbedaan numeriknya, perbedaan praktis antara kedua rilis ini adalah distribusi. MathForm-8B adalah sebuah file. OpenBMB menerbitkan bobot, dataset FormalVerse, dan makalahnya pada hari yang sama, di bawah Apache 2.0, tanpa pengumuman dan tanpa API yang dihosting — kartu modelnya adalah peluncurannya. Anda dapat mengunduhnya sore ini dan menjalankannya di satu GPU, dan tidak ada yang bisa menariknya kembali. Ember-1 adalah sebuah layanan. Tidak ada bobot, tidak ada harga yang dipublikasikan, dan jendela aksesnya digambarkan sebagai periode serverless dua minggu yang kelanjutannya bergantung pada permintaan. Anda dapat memanggilnya hari ini dan Anda tidak dapat memastikan dapat memanggilnya pada bulan November.
Perbedaan itu juga menentukan untuk apa setiap model dapat digunakan. Komponen formalisasi seharusnya berada di dalam pipeline yang Anda kendalikan, dipatok ke versi tertentu, dengan toolchain Lean di mesin yang sama — itulah sebabnya checkpoint Apache-2.0 yang tidak dibatasi adalah bentuk yang tepat untuk tugas MathForm-8B, dan sebabnya tautan kode GitHub yang hilang di README-nya (masih placeholder saat penulisan ini) merupakan celah yang lebih menjengkelkan daripada angka benchmark mana pun. Model berbiaya penalaran seharusnya berada di balik API, di mana tagihan token adalah hal yang dioptimalkan, dan di mana vendor bersaing pada harga dan latensi. Bentuk Ember-1 juga cocok dengan tugasnya; hanya saja itu berarti ketergantungannya bersifat komersial, bukan teknis.
Di mana pipeline akan menggunakan keduanya
Kedua model ini saling melengkapi, bukan bersaing, dan komposisinya mudah dijelaskan: seorang spesialis formalisasi mengubah masalah menjadi pernyataan yang dapat diperiksa, dan model penalaran mengerjakan pernyataan tersebut atau rekayasa di sekitarnya. Tak satu pun dari keduanya ada di OrcaRouter — MathForm-8B hanya dapat dihosting sendiri, dan Ember-1 ada di pratinjau milik vendor sendiri — tetapi komposisi itu sendiri adalah pola yang menjadi alasan keberadaan DSL routing kami. Menggabungkan beberapa model menjadi satu panggilan adalah cara sebuah pipeline mendapatkan spesialis dan generalis tanpa memelihara dua jalur integrasi dan dua kontrak, dan fusi model melangkah lebih jauh dengan memungkinkan panel model menjawab bersama ketika mode kegagalan satu model saja berbiaya tinggi.
Khusus untuk tumpukan formalisasi, argumen untuk komposisi lebih kuat daripada biasanya. Mode kegagalan yang terlihat adalah pernyataan yang berhasil dikompilasi tetapi maknanya sedikit berbeda, dan pertahanan termurah terhadap kesalahan senyap adalah model kedua yang membaca masalah yang sama — yang merupakan keputusan perutean, bukan keputusan pelatihan.
Mana yang lebih baik untuk dibeli
Jika Anda membutuhkan matematika yang dapat diperiksa mesin, MathForm-8B adalah satu-satunya dari keduanya yang menghasilkannya, dan biaya utamanya adalah generalitas yang toh tidak akan Anda gunakan untuk tugas ini. Unduh saja, siapkan anggaran untuk server Lean, dan bangun evaluasi Anda sendiri — makalah OpenBMB tidak akan memberi tahu Anda bagaimana performanya pada distribusi Anda.
Jika Anda membutuhkan penalar umum dengan tagihan token yang lebih kecil, Ember-1 ditujukan untuk Anda, dan langkah berikutnya yang tepat adalah shadow traffic terhadap apa pun yang Anda jalankan saat ini, bukan perbandingan benchmark. Risikonya adalah ketersediaan, bukan kemampuan, dan itu adalah risiko yang dapat Anda lindungi dengan menjaga lapisan routing tetap berada di antara aplikasi Anda dan model.
Kesimpulan yang tidak nyaman bagi siapa pun yang berharap salah satu dari ini menyelesaikan pertanyaan itu adalah bahwa keduanya belum dievaluasi secara independen. MathForm-8B telah tersedia untuk publik selama enam minggu dan belum ada pihak ketiga yang menerbitkan reproduksi; Ember-1 baru tersedia untuk publik selama sehari. Keduanya meminta Anda menjadi evaluator, yang merupakan kondisi normal saat memilih model khusus pada 2026.

Yang mereka buktikan adalah bahwa strategi penyempitan itu berhasil di kedua arah. Model frontier dapat dibuat lebih murah tanpa menjadi lebih buruk, dan model dasar kecil dapat dibuat ketat dengan mengarahkan pelatihannya ke kompilator. Pertanyaan yang menarik bukanlah pendekatan mana dari kedua ini yang menang, melainkan berapa lama lagi salah satunya tetap diperlukan setelah teknik-teknik di dalamnya menjadi praktik standar.
