Kartu judul hasil generasi bertuliskan 'Clef vs MathForm-8B', dengan subjudul 'yang satu menjawab pertanyaan Anda, yang lain menulis bukti', disertai chip bertuliskan 'keduanya Apache 2.0' dan 'dua fine-tune Qwen'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Clef vs MathForm-8B: Satu Menjawab Pertanyaan Anda, yang Lain Menulis Bukti

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Alasan untuk menempatkan Cloudflare/clef di samping openbmb/MathForm-8B adalah bahwa keduanya merupakan dua hal yang paling mudah tertukar di ranah bobot terbuka saat ini, dan mengacaukan keduanya akan menghabiskan satu sesi pelatihan. Keduanya adalah hasil fine-tune yang dibangun di atas checkpoint Qwen3.8-27B dan Qwen3-8B, masing-masing. Keduanya Apache-2.0. Keduanya diterbitkan dalam sepuluh minggu terakhir. Keduanya berfokus sempit, dibuat untuk tujuan tertentu, dan digambarkan oleh pembuatnya sebagai terspesialisasi, bukan umum. Dan keduanya sama sekali tidak memiliki hubungan satu sama lain, karena yang satu menghasilkan angka yang dipilih dari daftar yang Anda berikan dan yang lain menghasilkan kode sumber Lean 4, token demi token, untuk diperiksa oleh asisten pembuktian.

Clef adalah model keputusan multimodal 27 miliar parameter milik Cloudflare: Anda memberinya suatu keadaan dan skema pertanyaan bertipe, dan ia mengembalikan probabilitas terkalibrasi untuk setiap jawaban yang diizinkan dalam satu lintasan non-autoregresif, tanpa pembuatan teks di mana pun dalam jalurnya. MathForm-8B, dari OpenBMB, adalah model autoformalisasi — pernyataan berbahasa alami masuk, Lean 4 keluar, dan pipeline yang menghasilkannya dijelaskan dalam prapublikasi arXiv yang diterbitkan bersama bobot-bobotnya pada 14 Agustus. Batas atas salah satu model adalah ukuran daftar opsi Anda. Batas atas model lainnya adalah kekuatan tipe Lean. Menanyakan mana yang mana adalah kekeliruan kategori, dan fakta bahwa keduanya adalah fine-tune bobot-terbuka Apache-2.0 berukuran delapan hingga dua puluh tujuh miliar parameter justru itulah yang membuat kekeliruan ini mudah terjadi.

Apa yang secara fisik dilarang oleh antarmuka masing-masing model

Cara tercepat untuk melihat perbedaannya adalah dengan membaca apa yang dapat dikembalikan oleh masing-masing.

• Masukan — Clef menerima sebuah state (teks, JSON, gambar, atau frame video) ditambah 1 hingga 64 pertanyaan bernama dan bertipe; MathForm-8B menerima pernyataan matematis berbahasa alami.

• Keluaran — Clef mengembalikan satu probabilitas per opsi yang diizinkan, di-softmax per pertanyaan. MathForm-8B mengembalikan kode sumber Lean 4.

• Jenis pertanyaan — Clef adalah noul (benar/salah, dengan probabilitas benar), pilihan (2 hingga 26 opsi bernama) dan skor (2 hingga 26 tingkat berurutan); MathForm-8B tidak memiliki konsep pertanyaan sama sekali.

• Kalibrasi — Clef menerbitkan bidang keyakinan per jawaban; MathForm-8B menerbitkan tingkat Pass@8 dalam pemeriksaan sintaksis dan konsistensi.

• Penyajian — Clef dilayani melalui POST /v1/systemone body yang kompatibel dengan Jev/SystemOne, dihosting atau dijalankan sendiri; MathForm-8B hadir dengan instruksi untuk Transformers, vLLM, dan SGLang, semuanya mengekspos endpoint completion yang kompatibel dengan OpenAI pada konteks 16.384 token dengan max_new_tokens diatur ke 16.384.

Konsekuensi praktisnya langsung terlihat. Jika Anda membutuhkan penilaian ya/tidak tentang sepotong teks, Clef adalah satu-satunya dari keduanya yang dapat menghasilkannya — tidak ada cara untuk mengajukan pertanyaan kepada MathForm-8B yang bukan "tuliskan Lean 4 untuk ini." Jika Anda membutuhkan Lean 4, Clef adalah satu-satunya dari keduanya yang secara kategoris tidak dapat menghasilkannya, dan bukan karena kelemahan: meminta penilai yang terikat skema untuk memformalkan sebuah teorema tidak sesuai dengan kontraknya, sehingga permintaan itu ditolak berdasarkan rancangannya, bukan dijawab dengan buruk.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Pipeline tempat keduanya berada

Ada arsitektur nyata di mana kedua model ini berdampingan, dan ini layak dibahas karena membuat pemisahan tersebut menjadi konkret, bukan abstrak. Bayangkan sebuah layanan yang memformalkan matematika untuk para peneliti dan pelajar.

Pernyataan datang dalam bahasa alami, tak terbatas jenisnya. Sebelum apa pun dapat diformalkan, sesuatu harus memutuskan apa yang datang. Apakah ini teorema untuk dibuktikan, definisi untuk ditambahkan, permintaan untuk memeriksa bukti yang ada, atau pertanyaan yang perlu klarifikasi sebelum siapa pun menyentuh Lean? Apakah ini mandiri, atau bergantung pada konteks yang tidak disediakan pengguna? Apakah simbol-simbolnya konvensional, atau notasi ini belum pernah dilihat sistem? Masing-masing adalah pertanyaan terbatas dengan set opsi kecil — bentuk persis Clef — dan probabilitas terkalibrasi yang melekat pada setiap jawaban itulah yang memungkinkan layanan melakukan sesuatu yang masuk akal dengan yang tidak pasti: mengarahkan apa pun di bawah ambang batas ke manusia alih-alih menebak.

Langkah kedua adalah milik MathForm-8B. Ambil pernyataan yang telah diklasifikasikan sebagai teorema mandiri dengan notasi yang diketahui lalu hasilkan Lean 4. Itu adalah masalah generasi, dan pertanyaan kualitasnya adalah seberapa sering keluaran tersebut dapat dikompilasi dan seberapa sering maknanya sama dengan aslinya — yang justru diukur oleh dua sumbu evaluasi vendor. Inilah pola umum yang layak diambil dari pemasangan ini: pengklasifikasi terbatas yang murah di depan generator khusus yang mahal biasanya lebih murah dan lebih andal daripada meminta generator memutuskan apakah ia seharusnya berjalan sama sekali.

Apa yang sebenarnya diukur oleh angka-angka di setiap sisi

Abstrak arXiv milik OpenBMB melaporkan bahwa MathForm-8B mencapai tingkat Pass@8 rata-rata 88,06% pada Syntax Check dan 72,37% pada Consistency Check di enam benchmark, dan bahwa pada subset FATE-H dan FATE-X model ini mencapai tingkat kelulusan konsistensi 63% dan 37%, keduanya di atas baseline khusus terkuat yang dibandingkan dalam makalah tersebut. Pipeline pelatihannya adalah bagian yang menarik dari klaim tersebut: sebuah perencana pengambilan menarik definisi relevan dan formalisasi yang sudah ada dari Mathlib sebelum generasi, lalu pernyataan yang dihasilkan direvisi menggunakan diagnostik kompilator dan umpan balik konsistensi semantik, yang merupakan cara dataset FormalVerse yang berisi sekitar 367.000 contoh Lean 4 terverifikasi dibangun sebelum supervised fine-tuning dan reinforcement learning. Ini adalah angka yang dilaporkan vendor dari sebuah makalah dan kartu model. Tidak ada pihak independen yang menjalankan ulang angka-angka tersebut.

Angka-angka Clef mengukur sesuatu yang sama sekali berbeda dan tidak dapat dibandingkan. Run Decision Index Cloudflare melaporkan macro-F1 intent BANKING77 sebesar 94.2, CLINC150 dengan penanganan out-of-scope pada 97.4, GPQA Diamond pada 48.0 — sedangkan Jev yang lebih lama mencetak 78.3 — dan latensi permintaan median sebesar 209.3 ms. Itu adalah tabel tentang klasifikasi dan perutean, dihasilkan oleh vendor pada suite milik vendor sendiri, dihosting di papan peringkat milik vendor sendiri, dan tidak direproduksi.

Kalimat jujur satu-satunya untuk ditulis tentang kedua kolom ini adalah bahwa keduanya tidak berbagi tolok ukur, satuan, maupun filosofi evaluasi. Angka 37% MathForm-8B pada subset formalisasi yang sulit dan 97,4 milik Clef pada deteksi maksud di luar cakupan sama-sama klaim nyata dari pembuatnya tentang pekerjaan yang berbeda, dan pembaca yang menyejajarkannya tidak mempelajari apa pun selain bahwa kedua angka itu ada.

Apa yang akan Anda jalankan, dan berapa biayanya

Tidak ada dari kedua model ini yang merupakan rute di OrcaRouter, dan artikel ini tidak membuat klaim ketersediaan apa pun — katalog mengembalikan 404 untuk cloudflare/clef dan untuk MathForm-8B. Repositori MathForm berukuran sekitar 16,4 GB, dan kedua model tersebut berlisensi Apache-2.0, sehingga keduanya dapat dihosting sendiri besok oleh siapa pun yang memiliki perangkat kerasnya.

• Clef di Cloudflare — $0,24 per juta token masukan di Workers AI, dengan latensi yang dipublikasikan diukur pada satu H200.

• MathForm-8B dihosting sendiri — tidak ada hosting vendor, tidak ada harga per token, dan konteks 16.384 token yang terdokumentasi, yang merupakan batasan yang patut diperhatikan: bagian paper yang panjang tidak akan muat dalam satu kali proses.

• Alternatif yang dirutekan untuk bagian pengklasifikasi — Jev 1.13 milik TypeSafe dengan $0,042 per juta token masukan pada konteks 65.536 token, dilayani melalui body POST /v1/systemone yang sama seperti yang digunakan Clef, yang membuatnya dapat langsung menggantikan langkah pertama pipeline di atas.

Di sinilah lapisan perutean membuktikan perannya dalam pasangan khusus ini. Polanya adalah decider dan generator, dan bagian decider-lah yang memiliki pengganti aktif — satu endpoint di depan 200+ model, harga daftar penyedia diteruskan tanpa markup per token, dan failover otomatis sehingga masa buruk penyedia tidak membuat pintu depan pipeline Anda macet. Bagian generator adalah artefak 16,4 GB yang Anda jalankan sendiri, dan tidak ada endpoint yang mengubah itu.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Satu hal lagi yang disembunyikan oleh ukuran

Jumlah parameter mengundang perbandingan yang tidak berlaku. Clef berukuran 27B dan MathForm-8B berukuran 8B, jadi wajar untuk mengasumsikan bahwa model yang lebih besar lebih mampu dan model yang lebih kecil adalah spesialisnya. Kenyataannya justru sebaliknya secara hakikat. Clef besar karena membawa backbone multimodal yang dibekukan yang diperlukannya untuk membaca tangkapan layar dan faktur; bagian yang dilatih di atasnya adalah head skema kecil dengan adapter rank-256. MathForm-8B kecil karena Lean 4 adalah target yang sempit dan basis Qwen3-8B sudah cukup untuk mencapainya, dengan rekayasa sesungguhnya terletak pada pipeline pengambilan dan verifikasi yang menghasilkan data pelatihannya, bukan pada jumlah parameternya.

Ukuran, dengan kata lain, memberi tahu Anda apa yang harus dibawa oleh setiap model, bukan seberapa sulit masalah yang dipecahkannya. Sebuah 27B yang membaca struk dan mengembalikan "billing, 0.98" dan sebuah 8B yang menghasilkan Lean yang dapat dikompilasi sama-sama melakukan tepat apa yang menjadi tujuan pembuatannya, dan cara membingkai delapan miliar versus dua puluh tujuh miliar akan membawa Anda ke pilihan yang salah sekitar setengah waktu.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

Keputusan itu, dan pertanyaan yang belum dijawab oleh kedua vendor.

Jika Anda memiliki pipeline yang menyerap bahasa alami tanpa batas dan perlu merutekannya sebelum menghabiskan komputasi untuknya, langkah pertama adalah pengklasifikasi terbatas — Clef ketika input multimodalnya penting dan angkanya terlihat bagus pada data Anda, atau Jev 1.13 ketika Anda menginginkan bentuk permintaan yang sama dengan harga daftar yang lebih rendah dan tanpa mengikat arsitektur Anda ke vendor yang evaluasinya belum direproduksi siapa pun. Langkah kedua adalah generator spesialis, dan jika generator itu adalah Lean 4, MathForm-8B adalah model terbuka yang dibuat tepat untuk itu, dengan pipeline yang dipublikasikan dan korpus di baliknya.

Yang hilang di kedua sisi adalah jenis bukti yang sama. Run Decision Index milik Clef adalah milik Cloudflare sendiri dan belum pernah diulang secara independen; angka Pass@8 MathForm-8B berasal dari makalahnya sendiri. Keduanya adalah klaim ambisius di area di mana uji yang jujur itu murah untuk dijelaskan dan mahal untuk dijalankan — ambil data yang tidak dipakai vendor mana pun untuk pelatihan, terapkan pipeline yang sama, dan publikasikan hasilnya. Sampai seseorang melakukannya untuk salah satu model, hal berguna yang dapat diberitahukan perbandingan ini kepada Anda adalah sebuah bentuk: salah satunya tempatnya di depan pipeline Anda untuk memutuskan apa yang masuk, dan yang lain tempatnya di belakangnya untuk melakukan pekerjaan yang sulit dan sempit, dan keduanya bukan pengganti satu sama lain pada jumlah parameter apa pun.