Judul hero bertuliskan 'Inter-Decide-0.8B MathForm 8' dengan subjudul 'Salah satu dari ini dapat memeriksa pekerjaannya sendiri', membawa lencana 'terverifikasi kompilator Lean 4' dan 'hanya dilaporkan sendiri', dengan logo OrcaRouter di sudut.
Guides & Insights

Intern-Decision-0.8B vs MathForm 8B: Salah Satunya Dapat Memeriksa Pekerjaannya Sendiri

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pertanyaan paling berguna yang dapat Anda ajukan tentang model spesialis kecil mana pun adalah siapa yang memeriksanya. Intern-Decision-0.8B dan MathForm 8B sama-sama ada karena sebuah model umum disetel secara khusus menjadi model yang sempit, keduanya adalah turunan Apache-2.0 dari bobot Qwen, dan keduanya diletakkan di Hugging Face tanpa kampanye pemasaran — tetapi keduanya berada di sisi berlawanan dari sebuah garis yang menentukan bagaimana Anda akan menerapkannya. MathForm 8B adalah model autoformalisasi 8B milik OpenBMB, dirilis pada 14 Agustus 2026, yang menerjemahkan matematika dalam bahasa alami ke Lean 4 dan menyerahkan hasilnya kepada kompilator, yang menerimanya atau tidak. Intern-Decision-0.8B adalah kepala keputusan milik InternLM dengan 852.985.920 parameter, diunggah pada 26 September 2026, yang mengembalikan distribusi probabilitas terkalibrasi atas opsi yang Anda berikan sebelumnya — dan tidak ada apa pun di dunia ini yang secara independen memverifikasi apakah label yang dikembalikannya benar. Salah satu dari model ini menghasilkan keluaran dengan bukti. Model lainnya menghasilkan keluaran dengan skor keyakinan, dan perbedaan dalam apa yang dapat Anda lakukan dengan kedua hal itu adalah keseluruhan artikel ini.

Kerangka berpikir itu juga menjelaskan mengapa selisih ukuran — 8B versus 0.8B, faktor sepuluh — adalah angka yang paling tidak menarik dalam perbandingan tersebut. Tidak ada model yang berusaha unggul dalam hal yang dilakukan model lainnya, dan evaluasi salah satu pun tidak memberi tahu Anda apa pun tentang yang lain. Yang mereka miliki bersama adalah pola perilisan dan garis keturunan Qwen, dan keduanya kurang penting dibandingkan pertanyaan verifikasi.

Apa sebenarnya masing-masing itu

MathForm 8B adalah artefak yang dirilis dari resep dua tahap yang dijelaskan dalam makalah MathForm: Menskalakan Autoformalisasi Matematika dengan Pengambilan Pengetahuan dan Penyempurnaan yang Dipandu Verifikasi (arXiv 2608.14221). Perencana pengambilan menarik definisi relevan dan formalisasi yang sudah ada dari Mathlib sebelum generator dijalankan; pernyataan yang dihasilkan kemudian direvisi menggunakan diagnostik kompilator dan umpan balik konsistensi semantik; korpus yang dihasilkan, FormalVerse, berisi sekitar 367.000 contoh Lean 4 yang terverifikasi; dan MathForm 8B dilatih di atasnya melalui fine-tuning terawasi yang diikuti oleh pembelajaran penguatan dengan menggunakan kompilasi Lean dan sinyal konsistensi semantik sebagai reward. Ini adalah model khusus teks yang berbasis Qwen3-8B, dilayani melalui Transformers, vLLM, atau SGLang dengan API yang kompatibel dengan OpenAI, dengan panjang konteks 16.384 token yang direkomendasikan dan anggaran generasi maksimum 16.384 token. Alur evaluasinya, berkas benchmark, dan skrip Pass@k semuanya ada di repositori GitHub OpenBMB, dan dataset pelatihannya bersifat publik.

Intern-Decision-0.8B adalah artefak yang dirilis dari resep yang belum pernah dijelaskan oleh siapa pun. Kartu modelnya menyatakan bahwa ini adalah "model keputusan terstruktur multimodal yang di-fine-tune dari Qwen3.5-0.8B" dan berhenti di situ — tidak ada deskripsi data, tidak ada prosedur pelatihan, tidak ada makalah, tidak ada repositori. Yang didokumentasikannya secara menyeluruh adalah kontrak inferensi. Mesin yang disertakan memetakan opsi setiap pertanyaan ke simbol token tunggal, merender kerangka dengan satu <decision> placeholder per bidang, menjalankan satu lintasan maju kausal, membaca logit pada posisi sebelum setiap placeholder, melakukan softmax hanya atas simbol yang diizinkan untuk bidang itu, menerapkan kalibrasi yang telah disesuaikan, dan memetakan kembali simbol ke nilai opsi Anda. Tidak ada panggilan generate() dan tidak ada sampling di mana pun dalam alur. Model ini menerima teks ditambah hingga delapan gambar, menangani satu hingga enam belas pertanyaan dengan masing-masing hingga 62 opsi, dan menolak masukan yang melewati 8.192 token alih-alih memotongnya. Suhu kalibrasi bawaan adalah 2,747760550703, disesuaikan per checkpoint melalui minimisasi NLL atas 1.728 kasus.

Bacalah kedua paragraf itu secara berdampingan dan asimetrinya sangat mencolok. MathForm 8B hadir dengan makalah, dataset, pipeline evaluasi, dan repositori. Intern-Decision-0.8B hadir dengan deskripsi API dan tabel benchmark.

Asimetri verifikasi, yang merupakan inti cerita sebenarnya

Output MathForm 8B dapat diperiksa oleh sesuatu selain manusia. Ia menghasilkan Lean 4, dan Lean 4 bisa dikompilasi atau tidak. Angka-angka OpenBMB dilaporkan dalam dua rezim justru karena alasan ini: Pass@8 sebesar 88,06% di bawah Syntax Check, yang berarti output tersebut terkompilasi, dan 72,37% di bawah Consistency Check, yang berarti output tersebut terkompilasi dan pemeriksaan konsistensi semantik setuju bahwa pernyataan formal berarti apa yang dikatakan oleh pernyataan informal. Kedua angka tersebut adalah rata-rata dari enam benchmark, dan makalah tersebut juga melaporkan tingkat kelulusan CC sebesar 63% pada FATE-H dan 37% pada subset FATE-X yang lebih sulit, dengan klaim bahwa ini melampaui autoformalizer 32B khusus. Angka-angka tersebut dilaporkan oleh vendor — OpenBMB yang menjalankannya — tetapi sifat yang penting bersifat struktural, bukan statistik: sistem hilir yang mengonsumsi output MathForm 8B dapat menolak formalisasi yang buruk tanpa meminta model untuk menilainya. Kompilator adalah orakel.

Intern-Decision-0.8B memiliki kontrak tipe dan tidak punya oracle. Bentuk output dijamin — sebuah bidang yang dideklarasikan choice mengembalikan distribusi atas nilai opsi yang Anda cantumkan, sebuah score mengembalikan nilai ekspektasi berbobot probabilitas atas rubrik Anda, sebuah noul mengembalikan probabilitas ya. Tidak ada apa pun di luar model yang dapat memberi tahu Anda apakah argmax-nya benar. Nilai keyakinan adalah estimasi model itu sendiri atas kebenarannya sendiri, dan pekerjaan kalibrasi pada kartu adalah upaya jujur untuk membuat estimasi itu bermakna — suhu yang disesuaikan yang mempertahankan argmax sekaligus mempertajam atau melembutkan probabilitas, divalidasi pada kasus yang disisihkan — tetapi jawaban salah yang terkalibrasi dengan baik tetap saja jawaban salah. Jika pipeline Anda perlu mengetahui apakah suatu label benar, Anda memerlukan data berlabel, dan Anda perlu mengukurnya sendiri.

Itu bukan cacat yang unik pada Intern-Decision-0.8B. Itu adalah kondisi setiap pengklasifikasi, dan itu adalah masalah yang belum terselesaikan di seluruh kategori model keputusan yang mencakup Jev milik TypeSafe dan Laya milik Convai. Ini layak dinyatakan dengan jelas karena tabel tolok ukur dengan kolom skor Brier dapat menimbulkan kesan bahwa kalibrasi adalah verifikasi. Tidak demikian. Kalibrasi memberi tahu Anda bahwa ketika model ini mengatakan 80%, model ini benar sekitar 80% dari waktu di seluruh distribusi yang dievaluasi — yang memang berguna untuk menetapkan ambang batas dan menghitung nilai yang diharapkan, dan bukan jaminan kebenaran per item.

Papan skor, pada baris yang dimiliki kedua model

• Parameter — Intern-Decision-0.8B: 852.985.920 di seluruh shard bahasa 1,50 GB, shard visi 176 MB, dan proyektor 25 MB. MathForm 8B: 8B dense, berbasis Qwen3-8B.

• Model dasar — Intern-Decision-0.8B: Qwen3.5-0.8B, dirilis Februari 2026. MathForm 8B: Qwen3-8B.

• Tugas — Intern-Decision-0.8B: keputusan bertipe atas skema yang Anda tulis — pilihan, skor, biner. MathForm 8B: matematika bahasa alami ke formalisasi Lean 4.

• Keluaran — Intern-Decision-0.8B: distribusi terkalibrasi plus argmax per bidang, tidak ada teks yang dihasilkan. MathForm 8B: menghasilkan sumber Lean 4, biasanya panjang.

• Verifikasi — Intern-Decision-0.8B: tidak ada eksternal; keyakinan dilaporkan sendiri. MathForm 8B: kompiler Lean 4, ditambah pemeriksaan konsistensi semantik.

• Bukti yang dipublikasikan — Intern-Decision-0.8B: tabel benchmark vendor di tujuh benchmark, tidak direproduksi, tanpa makalah. MathForm 8B: sebuah makalah, dataset publik sekitar 367.000 contoh, pipeline evaluasi dan repositori, dijalankan oleh vendor.

• Lisensi — Keduanya Apache 2.0, dan Intern-Decision-0.8B juga menyertakan file lisensi Qwen yang dipertahankan untuk bobot upstream-nya.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Biaya dan latensi tidak dapat dibandingkan, dan itu bukan sebuah penghindaran.

InternLM mengukur Intern-Decision-0.8B pada 33,98 ms rata-rata dan 37,50 ms p95 per kueri pada satu RTX 4090 melalui jalur Hugging Face lokal, dengan saudara 2B-nya mencatat rata-rata 33,28 ms. Kartu MathForm 8B sendiri merekomendasikan hingga 16.384 token baru per formalisasi pada temperature 0,6 dan top_p 0,95. Kedua pengukuran itu bukan kuantitas yang sama. Yang satu adalah forward pass tunggal atas sebuah prompt; yang lain adalah generasi autoregresif yang dapat berjalan hingga ribuan token. Mengalikan anggaran formalisasi dengan keputusan 34 ms tidak memberi tahu Anda apa pun tentang efisiensi relatif, karena model-model tersebut tidak melakukan jumlah pekerjaan yang sama — yang satu membaca dan menilai, yang lain membaca dan menulis skrip bukti. Jika throughput adalah kendala Anda, fakta yang relevan lebih sederhana daripada sebuah rasio. MathForm 8B memformalkan satu pernyataan per generasi, dan pada 16K token per keluaran pada model dense 8B, itu adalah beban kerja yang menjenuhkan GPU dan kandidat untuk batching melalui vLLM atau SGLang, yang keduanya didokumentasikan oleh OpenBMB. Intern-Decision-0.8B menjawab enam belas pertanyaan yang mencakup seluruh record dalam satu pass, sehingga unit kerjanya adalah record, bukan field, dan anggaran record adalah plafon input 8.192 token — yang tiba lebih cepat daripada yang mungkin diperkirakan pembaca ketika Anda memasukkan state yang panjang, skema yang kaya, dan hingga delapan gambar.

Di mana masing-masing adalah alat yang tepat

MathForm 8B cocok berada dalam pipeline yang hambatannya adalah peninjauan manusia atas matematika. Autoformalisasi ada karena menulis Lean lebih lambat daripada membacanya, dan karena pernyataan yang dapat diperiksa mesin adalah pernyataan yang kemudian dapat diserang oleh asisten pembuktian. Properti yang membuatnya dapat dipercaya — keluaran yang diverifikasi kompilator — juga merupakan properti yang membuatnya sempit: ia memformalkan, ia tidak membuktikan, dan kartu model secara eksplisit menyatakan bahwa pemeriksaan kompilasi memerlukan Kimina Lean Server yang berjalan dan bahwa eksperimen tersebut menggunakan Lean 4.21.0. Siapa pun yang mengadopsinya berarti mengadopsi tumpukan tersebut. Seperti halnya model dengan bobot terbuka yang baru berumur beberapa hari atau beberapa minggu, mengarahkan jalur uji kepadanya dan beralih ke model yang sudah terbukti ketika macet adalah cara berisiko rendah untuk mengevaluasinya, itulah gunanya gateway dengan failover otomatis di seluruh rantai fallback — percobaan ulang yang terjadi sebelum respons dimulai, sehingga formalisasi yang macet tidak pernah mencapai pemanggil Anda.

Intern-Decision-0.8B cocok di mana pun kumpulan jawaban tertutup sudah ada dan biaya menghasilkan teks untuk memulihkannya sepenuhnya sia-sia. Triase, perutean, penilaian rubrik, mengadili suatu catatan berdasarkan kebijakan tertulis — kasus-kasus ketika model generatif digunakan sebagai cara mahal untuk memilih dari sebuah daftar. Keunggulannya adalah sifatnya deterministik, mengembalikan probabilitas yang dapat digunakan alih-alih string yang harus Anda parsing, dan pada 1,73 GB di disk ia berjalan dengan nyaman di bawah biaya memori peramban laptop. Kekurangannya adalah dokumentasinya berhenti pada permukaan API, tidak ada orang di luar InternLM yang telah menerbitkan hasil untuknya, dan satu kolom tolok ukur yang mengisyaratkan masalah keamanan — skor WildJailBreak 64,48 dibandingkan 96,29 milik Jev — tidak dijelaskan. Jangan menaruhnya di depan input adversarial tanpa menjalankan tes itu sendiri.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Kedua model berbagi garis keturunan yang patut dicatat karena hal itu mengubah apa yang "terbuka" berikan kepada Anda. Masing-masing adalah fine-tune dari checkpoint Qwen, dan masing-masing mempertahankan lisensi hulu dengan benar: MathForm 8B di bawah Apache 2.0 dengan asal-usul Qwen3-8B yang dinyatakan pada kartu, Intern-Decision-0.8B di bawah Apache 2.0 dengan LICENSE-QWEN sebagai berkas terpisah di repositori. Keduanya tidak menerapkan ambang pendapatan atau pembatasan bidang penggunaan — tidak seperti LFM Open License v1.0 milik Liquid AI, yang mengondisikan hak komersial pada entitas Anda yang tetap berada di bawah batas pendapatan tahunan $10 juta. Jika Anda membangun secara komersial, itu adalah perbedaan yang memisahkan kedua rilis ini dari sebagian ekosistem model kecil, dan hal itu berlaku untuk keduanya secara setara.

Jika Anda ingin lapisan keputusan tanpa checkpoint yang tidak terdokumentasi

Kesenjangan antara "sebuah kepala keputusan adalah bentuk yang tepat untuk masalah ini" dan "kepala keputusan tertentu ini adalah yang dapat Anda pertahankan di hadapan peninjau" adalah hal yang ditutup oleh alternatif terkelola. Jev 1.13 milik TypeSafe adalah model yang dijadikan tolok ukur oleh InternLM untuk keluarganya di Jevbench, pada Typed Decision dan pada ToolACE, dan model ini dapat dipanggil hari ini melalui satu endpoint yang kompatibel dengan OpenAI dengan tarif $0.042 per juta token masukan dan keluaran ditagih nol — tarif yang dipublikasikan vendor, diteruskan tanpa markup, bukan ditandai naik di sepanjang jalur. Bagi pembaca yang ingin mengukur apakah sebuah kepala keputusan membantu sama sekali sebelum berkomitmen pada checkpoint 0.8B dengan repositori yang hilang, itulah eksperimen pertama yang murah, dan evaluasi pihak ketiga milik Jev sendiri memberinya rekam jejak yang terdokumentasi yang belum dimiliki Intern-Decision-0.8B.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Jawaban singkatnya

Keduanya bukan alternatif satu sama lain. MathForm 8B adalah spesialis yang keluarannya dapat diverifikasi oleh program, ditujukan untuk tugas yang bagian sulitnya adalah verifikasi, dan disertai makalah, dataset, serta perangkat evaluasi untuk membuktikan klaim tersebut. Intern-Decision-0.8B adalah spesialis yang keluarannya hanya dapat diverifikasi oleh Anda, ditujukan untuk tugas-tugas yang jawabannya sudah dituliskan dan bagian sulitnya adalah mencapainya dengan cepat dan murah, dan disertai modul inferensi serta tabel. Jika Anda memerlukan formalisasi, hanya ada satu di antara keduanya yang perlu dipertimbangkan. Jika Anda memerlukan label dan siap membangun ground truth untuk memeriksanya, 0.8B adalah unduhan yang lebih menarik — cepat, deterministik, Apache 2.0, dan cukup kecil sehingga biaya untuk mengetahui apakah ia berguna hanyalah satu sore, bukan satu pos anggaran.