Kartu judul hasil generasi berjudul "AesCode-8B vs MathForm-8B" dengan dua kartu bersudut membulat yang berdampingan. Kartu kiri AesCode-8B memuat ikon jendela peramban yang merender slide dan baris "Microsoft, belum diumumkan" serta "Menghasilkan HTML dan CSS yang dapat diedit"; kartu kanan MathForm-8B memuat ikon rumus di samping tanda centang hijau dan baris "OpenBMB, bertanggal 2026-08-14" serta "Menghasilkan pernyataan Lean 4". Pembatas di antara keduanya bertuliskan "output keduanya diperiksa oleh mesin" dan strip keterangan di bagian atas bertuliskan "dua fine-tune 8B, berjarak delapan minggu, keduanya tidak di-hosting di mana pun". Logo OrcaRouter dikomposisikan di kanan bawah.
Guides & Insights

AesCode-8B vs MathForm-8B: Keduanya Adalah Fine-Tune 8B yang Outputnya Dapat Diperiksa oleh Mesin

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

AesCode-8B dan MathForm-8B muncul dalam rentang delapan minggu satu sama lain, keduanya dari repositori, bukan siaran pers, dan kebetulan itu lebih menarik daripada yang terlihat pada pandangan pertama. Keduanya dimulai dari checkpoint keluarga Qwen3. Keduanya menghabiskan seluruh anggaran pelatihan mereka pada satu bentuk keluaran yang sempit. Dan keduanya dibangun di sekitar sebuah pemeriksa: MathForm-8B dilatih berdasarkan putusan kompilator Lean 4, dan AesCode-8B dinilai dengan merender setiap halaman kandidat di peramban sandbox dan membaca kembali DOM, gaya terhitung, serta tangkapan layar. Tidak satu pun dari keduanya adalah chatbot dan tidak satu pun berusaha menjadi chatbot. Yang membedakan keduanya adalah apa yang dapat diverifikasi mesin dan apa yang tidak — dan, dalam kasus yang lebih baru dari keduanya, apa yang terjadi ketika separuh skor datang dari penilai yang tak seorang pun menyebut namanya.

Catatan publikasinya tidak simetris. MathForm-8B berasal dari OpenBMB dan kartu modelnya mencantumkan tanggal rilis 2026-08-14; model ini dibangun di atas Qwen3-8B dan dilatih pada FormalVerse, korpus yang berisi sekitar 367.000 contoh Lean 4 terverifikasi, dengan penyempurnaan terarah (supervised fine-tuning) yang diikuti oleh pembelajaran penguatan yang menggunakan kompilasi Lean dan pemeriksaan konsistensi semantik sebagai sinyal imbalannya. AesCode-8B tidak mencantumkan tanggal rilis di mana pun dalam berkas-berkasnya. Microsoft membuat repositori Hugging Face pada 2026-09-29, melakukan commit pada bobotnya pukul 03.35 UTC tanggal 2026-10-07 dengan pesan "Release AesCode-8B", dan menerbitkan kode pelatihannya di GitHub pada 2026-10-08. Tidak ada pengumuman yang menyertai kedua peristiwa tersebut, sitasi di kartu modelnya berbunyi "Under review, 2027", dan repositori itu menunjukkan dua unduhan pada saat penulisan ini. Model ini disempurnakan dari Qwen3-VL-8B-Instruct, yang patut dicatat justru karena nenek moyangnya tidak sama dengan nenek moyang MathForm-8B.

Keturunan itu menjelaskan sebagian besar perpecahan tersebut.

Qwen3-8B dan Qwen3-VL-8B-Instruct berbagi generasi dan nama keluarga tetapi bukan pekerjaan. Qwen3-8B adalah generalis khusus teks: sekitar 8,2 miliar total parameter, sekitar 7 miliar di antaranya non-embedding, grouped-query attention, konteks native 32K token yang dapat diperluas hingga 131K melalui YaRN, dan pelatihan di 119 bahasa dan dialek. Qwen3-VL-8B-Instruct adalah saudara vision-language, dan itulah checkpoint yang menjadi titik awal AesCode-8B — konfigurasi AesCode yang dipublikasikan adalah resep Qwen3-VL langsung dengan 36 lapisan tersembunyi, ukuran tersembunyi 4.096, 32 kepala attention dengan 8 kepala key-value dan kosakata 151.936 token.

Percabangan itu menentukan sisi masukan dari kedua spesialis sebelum keduanya dilatih. MathForm-8B menerima teks dan menghasilkan teks dalam sintaksis formal. AesCode-8B menerima teks beserta gambar referensi opsional dan menghasilkan dokumen.

• Base — MathForm-8B: Qwen3-8B, hanya teks. AesCode-8B: Qwen3-VL-8B-Instruct, gambar dan teks masuk.

• Parameter — MathForm-8B: sekitar 8,2B. AesCode-8B: sekitar 8,8B dalam bf16 yang tersebar di empat shard, yang oleh Hugging Face dibulatkan menjadi 9B.

• Data pelatihan — MathForm-8B: FormalVerse, sekitar 367K contoh Lean 4 terverifikasi. AesCode-8B: 3.000 demonstrasi cold-start, lalu pembelajaran penguatan GDPO atas 7.408 prompt selama 400 langkah.

• Apa yang memeriksa output — MathForm-8B: kompiler Lean 4, plus pemeriksaan konsistensi semantik terhadap soal aslinya. AesCode-8B: render Playwright dalam sandbox dengan enam verifikator deterministik dan satu rubrik yang dinilai model.

• Lisensi — keduanya Apache 2.0, keduanya tanpa pembatasan, keduanya mewarisi dari backbone keluarga Qwen3.

• Dihosting di mana saja — tidak keduanya, sejauh yang dapat kami temukan.

Dua makna berbeda dari "verifiable"

Inilah perbedaan yang pantas untuk kita cermati dengan perlahan, karena "dapat diperiksa mesin" dipakai untuk keduanya, padahal maknanya tidak sama.

Pemeriksa MathForm-8B adalah asisten pembuktian. Lean 4 menerima suatu pernyataan atau tidak, dan putusannya bukan soal opini, rubrik, atau selera penilai. Loop pelatihannya diarahkan pada sinyal itu: tahap SFT pada FormalVerse mengajarkan pemetaan dari masalah informal ke pernyataan teorema formal dengan header imports dan teorema bernama, dan tahap RL mempertajamnya menggunakan kompilasi plus pemeriksaan konsistensi yang menanyakan apakah formalisasi tersebut masih menyatakan hal yang dinyatakan masalah aslinya. Kompilasi bersifat biner dan dapat direproduksi oleh siapa pun dengan versi Lean yang sama. Pemeriksaan konsistensi adalah separuh yang lebih lunak, dan itulah separuh tempat angka-angka yang dilaporkan menjadi lemah — yang persis ditunjukkan oleh hasil yang dipublikasikan.

Pemeriksa AesCode-8B adalah sebuah perender. Kandidat dirender di browser Playwright yang di-sandbox dengan permintaan eksternal diblokir, dan harness membaca kembali DOM, gaya terhitung, kotak pembatas, status konsol, dan tangkapan layar. Enam kanal deterministik menilai hal-hal yang dapat diurai — eksekusi, teks persis, perilaku batas, data tabel dan bagan, tata letak semantik, spasi — dan kanal ketujuh, Visual Graph Rubric, menilai geometri dan penempatan melalui pertanyaan ya/tidak yang terikat grafik. Tabel harus berupa tabel HTML sungguhan dan bagan harus berupa spesifikasi ECharts, yang merupakan batasan yang benar-benar berfungsi: ini memaksa keluaran ke bentuk yang dapat diurai oleh pemverifikasi. Separuh deterministiknya benar-benar dapat direproduksi. Separuh visualnya dinilai oleh model visi-bahasa yang identitasnya tidak disebutkan oleh dokumentasi, yang berarti tidak seorang pun di luar lab dapat mereproduksinya.

Jadi, perbandingan yang jujur bukanlah "yang satu terverifikasi dan yang satu tidak." Melainkan bahwa sinyal utama MathForm-8B adalah kompilator dan sinyal sekundernya adalah pemeriksaan konsistensi, sedangkan sinyal utama AesCode-8B adalah sekumpulan asersi DOM deterministik dan sinyal sekundernya adalah opini model, yang dikemas di dalam skor keseluruhan yang sama.

A generated two-column scoreboard titled "AesCode-8B vs MathForm-8B - the scoreboard". Left column AesCode-8B reads Base Qwen3-VL-8B-Instruct, Parameters 8.8B, Output HTML and CSS page, Checked by a browser render, Headline 82.94 Overall, Evidence vendor and unreproduced. Right column MathForm-8B reads Base Qwen3-8B, Parameters 8.2B, Output Lean 4 statements, Checked by the Lean 4 compiler, Headline 88.06% Pass@8 syntax, Evidence vendor and unreproduced. A footer line reads "Both sets of figures are vendor-reported on the vendors' own benchmarks; neither has been independently reproduced." The OrcaRouter logo is composited bottom-right.

Apa yang dilaporkan masing-masing, dan apa nilainya

MathForm-8B melaporkan rata-rata Pass@8 sebesar 88,06% di bawah pemeriksaan sintaks dan 72,37% di bawah pemeriksaan konsistensi pada enam tolok ukur. Sebaran per tolok ukur adalah bagian yang menarik: konsistensi 95,06% pada FormalIMATH dan 94,83% pada ProverBench, lalu 63% pada FATE-H dan 37% pada FATE-X. Dua yang terakhir adalah pernyataan yang sulit dan realistis, dan penurunan dari pertengahan sembilan puluhan ke pertengahan tiga puluhan adalah bentuk jujur dari kemampuan tersebut. Semua angka ini dilaporkan vendor dan tidak direproduksi, dan campuran tolok ukurnya berbobot ke arah kumpulan yang lebih mudah.

AesCode-8B melaporkan nilai Keseluruhan 82,94 pada rubrik infografis 300 sampel milik Microsoft — Teks 94,06, Batas 88,36, Bagan 87,79, Aturan 90,07, Konten 86,41, Tata Letak 87,80, Gaya 53,21, Visual 75,80 — dengan tiga generasi per prompt dan tanpa seleksi. Microsoft juga melaporkan bahwa ia mengalahkan GPT-5.5 yang dikondisikan referensi pada 81,28 dan Claude Opus 4.8 pada 80,39 pada rubrik yang sama, bahwa kegagalan luapan kanvas yang parah berulang pada 4,3% dari 300 sampel, dan bahwa 22,4 poin Visual memisahkan pendamping 32B dari backbone-nya sendiri. Setiap angka adalah milik vendor, pada tugas vendor, dinilai terhadap kanal yang dirancang vendor.

Kedua kumpulan angka itu sama sekali tidak dapat dibandingkan satu sama lain. Tidak ada tugas bersama, tidak ada metrik bersama, dan tidak ada penilai bersama. Menempatkan 88,06% di samping 82,94% berarti membandingkan tingkat kelulusan formalisasi Lean dengan skor keseluruhan infografis, dan tidak ada model pun yang pernah dievaluasi berdasarkan apa yang dilakukan model lainnya.

Satu asimetri layak disebut karena hal itu berlawanan dengan model yang lebih baru. Metrik utama MathForm-8B memiliki penilai eksternal yang sudah terpasang di dalamnya: siapa pun dapat memasang Lean, memuat tolok ukur yang sama, dan memeriksa apakah pernyataan-pernyataan itu dapat dikompilasi. Metrik utama AesCode-8B tidak demikian — verifikator deterministik dapat dijalankan ulang oleh pihak luar yang gigih, tetapi separuh visual dari skor bergantung pada juri yang tidak diidentifikasi oleh makalah tersebut. Tingkat kelulusan kompilator yang tidak direproduksi adalah klaim yang lebih lemah daripada tabel tolok ukur, dan tetap lebih kuat daripada skor rubrik yang tidak direproduksi dengan penilai anonim di dalamnya.

Menjalankannya adalah pertanyaan yang berbeda dari kedua skor itu.

Keduanya adalah keputusan self-host saat ini. MathForm-8B adalah pilihan yang lebih murah dengan selisih yang lebar: checkpoint khusus teks berukuran sekitar 8,2B dengan anggaran generasi sekitar 16K token keluaran Lean, yang dapat dikuantisasi ke satu kartu kelas menengah. AesCode-8B adalah model vision-language 8,8B yang jalur penyajiannya membawa gambar sekaligus teks; perintah kartunya sendiri adalah vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, dan bobot bf16 sebesar 17,5 GB ditambah KV cache untuk 24.576 token serta dua gambar berarti kartu 24 GB terasa sempit dan 40-48 GB adalah batas bawah yang realistis. Anggarkan juga tumpukan rendering jika Anda ingin menilai keluaran Anda sendiri, karena itulah cara setiap klaim kualitas tentang model ini dibuat.

Biaya tersembunyi yang lebih besar adalah bahwa kedua model tersebut merupakan spesialis yang akan Anda adopsi secara permanen. Tim yang membutuhkan formalisasi dan pembuatan dokumen kini menjalankan dua jalur penyajian 8B, dua set format prompt, dua profil kegagalan, dan tidak ada satu pun model yang dapat menyerap pekerjaan model lainnya. Itulah kasus yang menjadi alasan sebuah lapisan routing ada: pertahankan para spesialis di tempat yang secara ekonomi dan dari sisi penanganan data membenarkan kepemilikan GPU, lalu kirim lalu lintas umum ke sesuatu yang dihosting di balik endpoint yang sama. Secara konkret, saudara generalis dari kedua basis ini dapat dipanggil — Qwen3-VL-8B-Instruct dengan $0,18 per juta token input dan $0,70 per juta token output pada konteks 131.072 token, bersama keluarga Qwen 3.8 dan checkpoint terbuka lainnya — semuanya melalui satu API OrcaRouter yang mencakup lebih dari 200 model, dengan harga daftar penyedia diteruskan pada markup 0% dan failover otomatis antar penyedia. Tidak ada spesialis yang dapat dirutekan di sini atau di tempat lain yang dapat kami temukan; yang dapat dirutekan adalah generalis yang Anda gunakan sebagai cadangan saat pekerjaan sempit telah selesai, yang merupakan perbedaan antara mencoba sebuah checkpoint riset dan menjadikannya dependensi yang menanggung beban.

A Hugging Face screenshot of the microsoft/AesCode-8B model card showing the Image-Text-to-Text, Transformers, Safetensors and English tags, the qwen3_vl and code-generation tags, an Apache-2.0 licence badge, 1 like and a Microsoft follower count, and the card opening with the statement that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS and the line "AesCode-8B starts from Qwen3-VL-8B-Instruct and is trained with cold-start SFT followed by GDPO across seven reward channels."

Memilih di antara keduanya, jika kamu benar-benar harus

Pilih MathForm-8B ketika artefaknya harus dikompilasi. Konversi bank soal, korpus formal untuk prover, pra-pemformatan pernyataan untuk perkakas berbasis Lean — itulah seluruh deskripsi pekerjaannya, dan hanya itulah di antara keduanya yang dilatih untuk itu. Tanggapi angka FATE dengan serius saat Anda menentukan cakupan: pada pernyataan realistis tersulit, sekitar sepertiganya konsisten, dan Anda tetap akan membangun langkah tinjauan manusia apa pun yang terjadi.

Pilih AesCode-8B ketika artefak harus dirender. Sebuah brief masuk, dokumen HTML yang dapat diedit keluar, tabel tetap tabel dan bagan menjadi spesifikasi bagan, dan keseluruhannya dapat di-diff di Git. Terima plafon Style — 53.21, dimensi yang didefinisikan sebagai tidak memerlukan revisi visual lebih lanjut sebelum pengiriman — sebagai ukuran jujur dari seberapa banyak pengeditan yang tersisa, dan terimalah bahwa konteks 24.576 token baru divalidasi pada halaman infografis tunggal, bukan pada dek multi-slide yang sebenarnya diinginkan orang.

Namun, pilihan yang sebenarnya akan dihadapi sebagian besar tim bukanlah keduanya. Pilihannya adalah apakah salah satu spesialis sempit ini layak di-deploy sama sekali, atau apakah generalis di baliknya, yang dipanggil melalui API, sudah cukup mendekati untuk volume yang Anda miliki. Itu hanya sesi pengujian prompt selama satu sore, bukan pembelian GPU, dan angka dari kedua kartu itu sendiri memberi Anda alasan untuk menjalankannya: konsistensi hard-set MathForm-8B berada di 37%, dan skor Style AesCode-8B berada di 53%, jadi keduanya bukan model yang akan Anda masukkan ke dalam pipeline tanpa pengawasan.

A Hugging Face screenshot of the openbmb/MathForm-8B model card showing the TextGeneration, Transformers and Safetensors tags, openbmb/Formalverse as the dataset, an English tag, an arXiv identifier 2608.14221, an Apache-2.0 licence badge, and the card opening with "MathForm-8B is an autoformalization model that translates natural-language mathematical statements into Lean 4" and the note that it is trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation.

Apa yang diungkapkan kedua rilis ini tentang bagaimana model dirilis sekarang

Dua fine-tune 8B, berjarak delapan minggu, dari dua laboratorium berbeda, dirilis tanpa pengumuman, tanpa halaman produk, dan tanpa evaluasi independen, keduanya dibangun di sekitar loop verifikasi, keduanya Apache 2.0, dan tidak ada yang menyajikan keduanya. Pola itu lebih menjadi ceritanya daripada masing-masing modelnya. Metode penelitian telah berpindah ke dalam fungsi reward — sinyal compiler OpenBMB, kanal lintas-modal terpisah Microsoft — dan artefak yang dipublikasikan telah menjadi resep pelatihan plus bobot, dengan makalahnya menyusul belakangan, jika memang ada.

Apa artinya bagi siapa pun yang membaca perbandingan seperti ini adalah bahwa angka dari vendor sendiri adalah satu-satunya yang Anda dapatkan untuk sementara waktu, dan pertanyaan yang berguna bukanlah seberapa tinggi angka itu, melainkan seberapa dapat diperiksa. Tingkat overflow AesCode-8B dan plafon Style-nya adalah klaim yang dapat diperiksa yang disajikan sebagai kegagalan. Angka konsistensi FATE-X milik MathForm-8B sama saja. Itulah angka-angka yang perlu dibaca, dan yang perlu Anda jalankan kembali sendiri begitu alat pemeriksanya dapat direproduksi secara ujung ke ujung.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari