
TwIL-LM3-Pro vs MathForm 8B: Pernyataan dan Entailmen adalah Dua Bagian yang Berbeda dari Formalisasi
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
TwIL-LM3-Pro dan MathForm-8B ditujukan pada masalah besar yang sama — membuat mesin menghasilkan teks formal yang dapat diperiksa, bukan prosa yang tampak masuk akal — dan keduanya menyelesaikan separuh yang berbeda dari masalah itu. MathForm-8B adalah autoformalizer 8 miliar parameter dari OpenBMB, yang dirilis pada Agustus 2026: dengan diberi masalah matematika dalam bahasa biasa, ia mengeluarkan pernyataan Lean 4 dari masalah tersebut, membiarkan kewajiban pembuktian tetap terbuka untuk diperiksa oleh kompilator. TwIL-LM3-Pro adalah model logika formal 3,66B dari webAI pada September 2026, dan keluaran yang dituju adalah label entailment, terjemahan logika orde pertama, parse semantik, dan kritik pembuktian Lean. Yang satu menghasilkan hal yang akan diperiksa. Yang lain memberi tahu Anda apakah hal yang Anda miliki mengimplikasikan apa yang Anda klaim.
Karena keduanya hanya bertumpang tindih pada satu jalur — formalisasi Lean — halaman perbandingan menjadi menggoda sekaligus menyesatkan. Pertanyaan yang lebih berguna adalah untuk apa masing-masing dilatih agar diberi imbalan, karena sinyal imbalan adalah titik di mana kedua desain paling tajam berbeda dan di mana pilihan yang lebih cerdas sebenarnya berada.
Pernyataan versus entailmen
MathForm-8B dilatih pada FormalVerse, korpus Lean 4 yang makalah OpenBMB gambarkan sebagai sekitar 367.000 contoh terverifikasi, melalui fine-tuning terawasi yang diikuti pembelajaran penguatan. Pipeline di sekitarnya mengambil definisi relevan dan formalisasi yang sudah ada dari Mathlib sebelum generasi, lalu menyempurnakannya menggunakan diagnostik kompilator dan pemeriksaan konsistensi semantik. Keluarannya adalah pernyataan formal — impor, tipe, header teorema — yang diterima atau ditolak oleh kompilator eksternal. Kartu model secara eksplisit menyatakan bahwa model ini tidak menyelesaikan masalah tersebut dan tidak mengklaim demikian; pembuktian adalah tugas pihak lain.
TwIL-LM3-Pro mendekati domain yang sama dari sisi logika. Pipeline-nya ditujukan untuk enam tujuan: terjemahan logika orde pertama, pelabelan entailment, penguraian semantik, formalisasi Lean, kritik bukti Lean, dan induksi aturan. Jika MathForm dibangun untuk menghasilkan pernyataan, TwIL-LM3-Pro dibangun untuk membuat penilaian tentang pernyataan — apakah ini merupakan konsekuensi logis, apakah penguraian ini benar, apakah upaya pembuktian ini sah. Ia juga memformalkan, dan itulah satu-satunya tempat kedua model benar-benar dapat dibandingkan, bukan sekadar berdampingan.
Imbalan dari compiler versus imbalan dari scorer
Inilah perbedaan desain yang penting, dan kedua vendor mendokumentasikannya.
Imbalan pelatihan MathForm berasal dari kompilasi Lean dan umpan balik konsistensi semantik. Kompilator adalah oracle: ia menerima formalisasi itu atau tidak, dan tidak ada kredit parsial dan tidak ada yang bisa diperdebatkan. Itulah sinyal imbalan paling bersih di sudut pembelajaran mesin ini, dan itulah sebabnya tolok ukur autoformalisasi dilaporkan sebagai tingkat kelulusan — metriknya berada di hilir sebuah program yang tidak peduli pada apa yang dipercaya siapa pun.
Tahap akhir TwIL-LM3-Pro adalah eksekusi GRPO berbobot entropi terhadap verifier programatik, dengan kartu model itu sendiri menjelaskan kredit parsial untuk kecocokan longgar dan token-F1 sehingga kelompok prompt yang semuanya gagal tetap menghasilkan gradien. Gerbang makro utamanya adalah rata-rata berbobot sama dari empat jalur klasifikasi berbatas ditambah induksi aturan, dan dalam gerbang itu jalur pilihan ganda dan prosedural dikreditkan sebagai `max(exact_match, loose_match)` — sebuah aturan yang dinyatakan kartu secara gamblang, karena jawaban benar yang diformat berbeda adalah artefak pemformatan, bukan kegagalan penalaran.
Tidak ada desain yang lebih buruk. Keduanya disetel untuk konsekuensi yang berbeda. Reward yang dinilai kompilator menghasilkan model yang dapat Anda arahkan ke masalah formalisasi yang sulit dan percayai outputnya, karena outputnya dapat diverifikasi. Reward yang dinilai pemberi skor dengan kredit parsial menghasilkan model yang dapat dilatih pada penilaian yang lebih kabur — entailment, kritik, induksi aturan — di mana tidak ada kompilator yang dapat mengadili dan alternatifnya adalah tidak melatih pada jalur tersebut sama sekali. Biayanya adalah angka yang dihasilkan hanya sebaik harness-nya, dan webAI mengatakan demikian: baris strict-7-nya, yang menghilangkan setiap jejak kredit loose-match, ada tepat agar pembaca dapat melihat angka yang lebih keras di samping angka utama.
Skor-skor tersebut tidak berada pada skala yang sama
Kedua model menerbitkan angka-angka yang terkait dengan Lean dan angka-angka itu tidak dapat dikurangkan. Makalah MathForm melaporkan rata-rata Pass@8 sebesar 88,06% pada Syntax Check dan 72,37% pada Consistency Check di enam benchmark Lean, dengan tingkat kelulusan pemeriksaan konsistensi sebesar 63% dan 37% pada subset FATE-H dan FATE-X yang lebih sulit, serta mengklaim mengungguli beberapa autoformalisator 32B khusus. Kartu TwIL-LM3-Pro melaporkan token-F1 `lean_formalize` sebesar 0,5092 dan akurasi `lean_critic` sebesar 0,7950 pada harness Track A miliknya sendiri.
Pass@8 dalam pemeriksaan kompilator dan token-F1 terhadap string referensi mengukur hal yang berbeda. Pass@8 memberi model delapan percobaan dan menanyakan apakah salah satunya berhasil dikompilasi dan tetap konsisten; token-F1 menilai seberapa dekat satu generasi cocok dengan referensi. Sebuah model dapat memperoleh skor baik pada salah satunya dan buruk pada yang lain, dan tidak ada apa pun dalam kedua dokumen tersebut yang membenarkan membaca keduanya secara berdampingan.
Ringkasan jujur dari catatan benchmark adalah bahwa bukti MathForm-8B berasal dari makalah dengan compiler di dalam loop dan milik TwIL-LM3-Pro berasal dari harness vendor dengan scorer di dalam loop, dan belum ada pihak ketiga yang menjalankan keduanya melalui satu rubrik. Perlakukan halaman mana pun yang menempatkan "88.06%" di sebelah "0.5092" seolah-olah keduanya adalah skor pertandingan sebagai halaman yang belum membaca definisinya.
Spesifikasi, berdampingan
• Parameter — TwIL-LM3-Pro 3,66B dense vs MathForm-8B 8B, kira-kira 2,2 kali ukurannya.
• Model dasar — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.
• Data pelatihan — korpus logika formal sintetis yang mencakup enam objektif vs FormalVerse, sekitar 367.000 contoh Lean 4 terverifikasi.
• Reward — verifier programatik dengan kredit parsial dan toleransi kecocokan longgar vs kompilasi Lean dan umpan balik konsistensi semantik.
• Keluaran utama — label entailment, terjemahan FOL, parse semantik, pernyataan Lean, dan kritik bukti vs pernyataan Lean 4 untuk diperiksa oleh kompilator.
• Jendela konteks — 131.072 token untuk TwIL-LM3-Pro, diukur dalam 8.192 token; MathForm-8B dilayani dengan anggaran generasi hingga 16.384 token dalam contoh penggunaannya sendiri.
• Lisensi — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.
• Jejak terkuantisasi — TwIL-LM3-Pro menyediakan Q4_K_M GGUF berukuran 2,09 GiB untuk CPU atau VRAM 4 GB; MathForm-8B tidak menerbitkan GGUF apa pun di repositorinya sendiri.
Lisensi memutuskan pertanyaan produksi lagi
MathForm-8B berlisensi Apache 2.0. Anda dapat melakukan fine-tuning, mendistribusikannya kembali, dan menyajikannya di dalam produk komersial. TwIL-LM3-Pro bersifat non-komersial: penelitian dan penggunaan pribadi diizinkan, dan penerapan yang menghasilkan pendapatan memerlukan perjanjian terpisah dengan webAI, yang jalur komersialnya berupa pengaturan perusahaan alih-alih daftar harga yang dipublikasikan.
Bagi sebuah kelompok riset atau mahasiswa, perbedaan itu tidak relevan — keduanya dapat diunduh tanpa pembatasan di Hugging Face. Bagi sebuah perusahaan, hal itu menentukan, dan mengarah pada MathForm-8B untuk segala pekerjaan autoformalisasi produksi, terlepas dari model mana yang memperoleh skor lebih baik pada jalur yang tidak diukur dengan cara yang sama oleh kedua vendor.
Di mana router berada dalam alur ini
Baik Twig-LM3-Pro maupun MathForm-8B bukanlah rute dalam katalog OrcaRouter, dan alasannya berbeda: yang satu berlisensi non-komersial tanpa endpoint yang dihosting, yang lain diterbitkan sebagai checkpoint terbuka untuk self-hosting. Pertanyaan routing dalam pipeline formalisasi adalah lapisan di sekitar keduanya. Membangun korpus bergaya FormalVerse berarti menghasilkan ribuan masalah informal, memfilternya untuk keterbentukan yang baik, dan menulis pemeriksaan konsistensi semantik yang menilai keluaran — semuanya panggilan teks, dan semuanya jenis pekerjaan di mana Anda ingin menukar model yang menghasilkan data massal dengan model yang menilainya tanpa kontrak kedua. Pada satu endpoint yang kompatibel dengan OpenAI di depan 200 model pada harga daftar penyedia dengan tambahan markup 0%, pertukaran itu hanyalah perubahan konfigurasi, dan penurunan harga vendor pada model generasi berlaku pada hari yang sama. Failover otomatis sangat penting dalam pembangunan korpus secara khusus karena pekerjaan yang mati di dua pertiga jalan melalui satu proses generasi membuat seluruh proses terbuang.

Pembagian kerja
Jika pekerjaannya adalah mengubah matematika buku teks menjadi pernyataan Lean yang dapat dikompilasi dalam skala besar, dan hasilnya harus dirilis dalam produk komersial, MathForm-8B adalah alatnya dan lisensi Apache 2.0 adalah alasannya. Jika pekerjaannya adalah menentukan apakah suatu kumpulan teks mengimplikasikan sebuah klaim, memberi label entailment, mengurai semantik, atau mengkritik upaya pembuktian, TwIL-LM3-Pro mencakup ranah yang tidak pernah menjadi sasaran MathForm — dan lisensi nonkomersialnya merupakan batas mengenai di mana kemampuan itu dapat digunakan, bukan penilaian negatif terhadap kemampuan itu sendiri.
Kombinasi yang masuk akal adalah pipeline dua tahap, bukan sebuah pilihan: satu model menghasilkan pernyataan formal, model lainnya menilainya. Keduanya telah mempublikasikan pipeline yang menghasilkan mereka, yang tidak lazim pada ukuran ini dan menjadi alasan perbandingan ini dapat dilakukan sama sekali.


