Kartu judul hero untuk perbandingan 'AuK-Flash vs MathForm-8B' dengan subjudul 'Dua spesialis tenang dengan otak Qwen pinjaman', menampilkan chip pusat berlabel 'otak Qwen pinjaman' yang bercabang ke panel keluaran ucapan AuK-Flash dan panel keluaran Lean-4 MathForm-8B, dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

AuK-Flash vs MathForm-8B: Dua Spesialis Senyap dengan Otak Pinjaman Qwen

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

{{1}}AuK-Flash dan MathForm-8B memiliki lebih banyak kesamaan daripada yang mungkin disadari kedua laboratorium, dan tidak ada satu pun dari kesamaan itu yang berkaitan dengan tugas yang mereka kerjakan. MathForm-8B adalah model autoformalization 8B milik OpenBMB — sebuah fine-tune Apache-2.0 dari Qwen3-8B yang mengubah matematika bahasa alami menjadi pernyataan Lean 4 yang dapat diperiksa oleh kompiler. AuK-Flash adalah model wicara terdistilasi milik Tencent — sebuah generator difusi berlisensi MIT untuk sintesis dan penyuntingan wicara yang mengarahkan instruksinya melalui encoder Qwen2.5-Omni-3B sebelum menghasilkan suara.{{/1}} {{2}}Yang satu mengubah prosa matematika menjadi teks formal yang dapat diverifikasi pembuktiannya; yang lain mengubah teks dan instruksi menjadi audio.{{/2}} {{3}}Mereka berbagi strategi arsitektur yang sama dari arah yang berlawanan: tidak ada satu pun yang melatih otak bahasa umum dari nol — masing-masing membungkus model sumber terbuka yang sudah ada dan mencurahkan upaya sesungguhnya pada modalitas keluarannya.{{/3}} {{4}}Keduanya juga dirilis dengan cara yang sama — bobot (weights) diunggah secara senyap ke Hugging Face, tanpa siaran pers — dan keduanya persis jenis rilis sempit dan self-hosted yang tidak dapat ditangkap oleh tolok ukur model perbatasan (frontier-model).{{/4}}

Pola yang menyatukan mereka

Lihatlah dua jalur rilis tersebut berdampingan dan keduanya hampir seperti cermin. Repositori AuK-Flash milik Tencent bertanggal 21 Agustus di Hugging Face (AuK base saudaranya, 18 Agustus); pengumuman open-source — kode, bobot, dan tautan demo — baru tiba minggu ini, bertanggal 7 September di kartu Hugging Face dan 9 September di repositori GitHub yang tertaut. Repositori MathForm-8B milik OpenBMB muncul pada 14 Agustus tanpa pengumuman sama sekali. Dalam kedua kasus, kartu model adalah peluncurannya, bobot tidak dikunci di bawah lisensi permisif, dan tidak ada API yang dihosting untuk dicoba — Anda mengunduh checkpoint dan menjalankannya di perangkat keras yang Anda kendalikan. Bagi pembaca yang memutuskan apa yang akan diadopsi, bentuk yang sama ini lebih penting daripada perbedaan domain: keduanya adalah taruhan bahwa model open-source yang terfokus erat dapat melayani ceruk yang kurang dilayani oleh model generalis, dan keduanya meminta Anda untuk menyediakan evaluasi yang tidak disediakan oleh vendor.

Papan skor yang jujur

Karena kedua model tidak tumpang tindih pada tolok ukur mana pun, papan skor tersebut lebih merupakan gambaran dari dua taruhan yang berbeda, bukan peringkat. Sumber data menjadi hal yang penting di setiap baris — klaim AuK-Flash berupa pernyataan kartu Tencent yang sudah berumur beberapa hari dan belum direproduksi; angka-angka MathForm-8B dilaporkan OpenBMB dari arXiv 2608.14221 dan belum direproduksi:

• Apa itu — AuK-Flash: model pembangkitan dan penyuntingan ucapan ~1.5B milik Tencent, disuling menjadi varian difusi 4 langkah. MathForm-8B: autoformalizer 8B milik OpenBMB yang mengubah matematika informal menjadi Lean 4.

• Keluaran — AuK-Flash: audio 24 kHz — ucapan, ucapan yang disunting, sumber yang terpisah. MathForm-8B: pernyataan Lean 4 dengan header dan teorema bernama.

• Konstruksi — AuK-Flash: transformer difusi yang didistilasi ke NFE tetap 4 / CFG 0, dengan Qwen2.5-Omni-3B sebagai encoder instruksi. MathForm-8B: Qwen3-8B yang di-fine-tune dengan SFT lalu RL pada dataset FormalVerse yang berisi sekitar 367 ribu contoh.

• Bahasa input — AuK-Flash: Mandarin dan Inggris (sesuai dengan kartu model). MathForm-8B: Inggris, dalam ragam pernyataan soal matematika.

• Rilis — AuK-Flash: repos 18/21 Agustus; sumber terbuka diumumkan 7–9 September. MathForm-8B: repo 14 Agustus; belum ada pengumuman hingga saat penulisan.

• Bukti — AuK-Flash: belum ada apa pun selain daftar kemampuan kartu. MathForm-8B: vendor melaporkan 88.06% Pass@8 pada pemeriksaan sintaks dan 72.37% pada pemeriksaan konsistensi, dengan FATE-H 63% dan FATE-X 37% pada set konsistensi sulit.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

Papan skor dalam enam baris: keduanya adalah spesialis bobot terbuka dengan otak Qwen pinjaman dan bukti independen yang tipis — mereka berbeda dalam apa yang mereka buat, bukan dalam cara mereka dirilis.

AuK-Flash: ucapan sebagai keluaran spesialis

Klaim "otak yang dipinjam" untuk AuK-Flash bersifat harfiah, bukan retoris. Checkpoint yang diterbitkan Tencent berisi diffusion transformer dan bobot layer-fusion; model yang benar-benar memahami instruksi Anda — Qwen2.5-Omni-3B — diunduh secara terpisah dan dimuat saat runtime, begitu pula BigVGANFlowVAE yang mengubah laten kembali menjadi gelombang 24 kHz. Jadi, apa yang dilatih Tencent sebenarnya bukanlah model bahasa sama sekali, melainkan generator conditional flow-matching: diberikan rencana semantik dari encoder Qwen, generator tersebut merender audio dalam beberapa langkah. AuK-Flash adalah versi destilasi empat langkah dari generator itu, dan repositorinya — sekitar 6,1 GB untuk checkpoint Flash dalam BF16 ditambah VAE 637 MB — dilengkapi dengan CLI, mesin Python, node Gradio dan ComfyUI, serta skrip fine-tuning. Daftar kemampuannya luas untuk model wicara: TTS zero-shot dan berbasis instruksi, penyuntingan konten dan lirik, perubahan pitch/kecepatan/volume serta emosi/timbre, penghilangan aksen, konversi bisikan, peningkatan kualitas, dan pemisahan sumber, semuanya lewat satu antarmuka instruksi bahasa alami dalam bahasa Mandarin dan Inggris. Entah masing-masing bekerja seperti yang dijelaskan belum teruji di luar Tencent; klaim arsitektur — Qwen kecil yang memahami, model diffusion terdestilasi yang menghasilkan suara — terlihat jelas di dalam repositori itu sendiri.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

Halaman repositori tencent/AuK-Flash — bobot berlisensi MIT untuk model ucapan distilasi 4-langkah, dengan encoder Qwen2.5-Omni-3B dan VAE yang dimuat dari file terpisah saat runtime.

MathForm-8B: bukti formal sebagai output spesialis

MathForm-8B adalah pola yang sama, hanya bergeser satu domain. OpenBMB mengambil Qwen3-8B — model generalis yang dilatih pada 119 bahasa — dan memfokuskan seluruh kemampuannya pada satu bentuk keluaran: pernyataan teorema Lean 4 yang diturunkan dari soal bahasa alami. Tahap SFT pada FormalVerse mengajarkan pemetaan dari informal ke formal; tahap RL kemudian mempertajamnya berdasarkan keputusan kompiler Lean, sebab itu model ini melaporkan bukan skor kualitas yang samar, melainkan Pass@8 pada pemeriksaan sintaks dan kelulusan yang lebih ketat pada pemeriksaan konsistensi semantik. Angka dari vendor memang kuat — 88,06% dan 72,37% pada enam benchmark, mengalahkan baseline khusus 7B–32B dari makalah — dan sama belum direproduksinya dengan klaim AuK-Flash. Reponya berlisensi Apache-2.0, dilayani melalui Transformers, vLLM, atau SGLang, dan sebagai gantinya melepaskan hampir semua hal yang membuat Qwen3-8B dikenal: tidak ada obrolan umum dalam 119 bahasa, batas keluaran sekitar 16K token untuk Lean, dan tidak ada kemampuan terdokumentasi di luar formalisasi.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

Repositori openbmb/MathForm-8B — bobot berlisensi Apache-2.0 untuk autoformalizer, mencantumkan Qwen3-8B sebagai model dasarnya. Inilah seluruh jejak publik MathForm-8B.

Verifikasi adalah tema yang tidak ditangkap oleh kedua benchmark tersebut.

Letakkan kedua keluaran bersebelahan dan simetri yang aneh muncul. Seluruh desain MathForm-8B ada karena matematika dalam bahasa alami tidak memiliki sinyal kebenaran — compiler Lean menyediakannya, sehingga model dilatih berdasarkan keputusan lulus/gagal yang benar-benar dapat dirasakannya. Domain AuK-Flash memiliki masalah yang sama dengan solusi berbeda: tidak ada compiler untuk "apakah klip ini terdengar seperti pembicara, dalam bisikan, dengan batuk yang dihilangkan," jadi sinyal lulus/gagalnya adalah telinga manusia. Tidak ada satu pun tolok ukur agregat yang mengukur hal itu — Elo pada teks atau skor kualitas pada ucapan sintetis hanya memberi sedikit informasi tentang apakah janji inti spesialis tersebut (Lean yang terverifikasi, atau ucapan yang dapat diedit dan dikloning) berlaku dalam alur kerja Anda. Konsekuensi praktisnya adalah kedua model harus dievaluasi dengan cara yang tidak dapat dilakukan vendor: MathForm-8B dengan menjalankan keluarannya melalui Lean, AuK-Flash dengan mendengarkan keluarannya pada data Anda sendiri. Sampai seseorang melakukan itu, klaim utama di kedua kartu tersebut hanyalah arah, bukan hasil.

Untuk siapa masing-masing, dan siapa yang sebaiknya menunggu.

• Pilih MathForm-8B ketika beban kerja Anda berakhir pada formalisasi — mengonversi bank soal, membangun korpora Lean, memberi makan otomatisasi pembuktian — dan Anda menginginkan spesialis open-source terkuat pada bobot ini. Ini bukan model umum, jadi pasangkan dengan model lain untuk segala hal di sekitar langkah formal.

• Pilih AuK-Flash saat beban kerja Anda berakhir pada audio — suara untuk membacakan teks Anda, rekaman untuk diedit, campuran untuk dipisahkan — dan Anda menginginkan model terbuka yang memperlakukan pembuatan dan penyuntingan sebagai satu operasi. Siapkan anggaran untuk Qwen encoder di sampingnya, dan untuk uji dengar Anda sendiri.

• Tunggu keduanya jika Anda membutuhkan infrastruktur yang terbukti dan didukung: keduanya belum memiliki hasil independen, keduanya tidak memiliki API yang di-host, dan keduanya baru berumur hitungan hari hingga minggu. Pola yang layak ditiru adalah arsitekturnya — otak bahasa pinjaman yang kecil plus kepala keluaran spesialis jauh lebih murah untuk dilatih dan diiterasi daripada generalis penuh — dan itu adalah pola yang dapat Anda adopsi dalam fine-tuning Anda sendiri, baik Anda pernah menjalankan dua checkpoint ini atau tidak.

Kedua rilis tersebut juga mengilustrasikan mengapa lapisan perutean layak mendapatkan tempatnya dalam tumpukan campuran: ketika pipeline Anda berpindah dari model penalaran umum ke spesialis seperti salah satu dari model ini, inti dari router adalah Anda tidak mengikat arsitektur pada satu jawaban. Satu API untuk 200+ model, failover otomatis jika penyedia mengalami penurunan kinerja, dan harga daftar penyedia diteruskan dengan markup 0% berarti Anda dapat menjaga generalis di jalur default dan memanggil spesialis hanya untuk bagian permintaan yang membutuhkannya — dan mengganti spesialis begitu model yang lebih baik dirilis.

Perbandingan yang perlu dipegang bukanlah AuK-Flash melawan MathForm-8B — keduanya tidak akan pernah bersaing untuk permintaan yang sama. Yang menjadi taruhan adalah keduanya melawan asumsi bahwa model umum kelas frontier adalah satu-satunya model yang layak dijalankan. Penyuntingan ucapan dan formalisasi terverifikasi sama-sama merupakan ranah di mana model kecil, terfokus, dan terbuka dengan otak pinjaman dapat mengalahkan model yang jauh lebih besar yang tidak pernah diarahkan pada masalah tersebut — dan itulah tepatnya taruhan yang baru saja dipublikasikan oleh Tencent dan OpenBMB, sekaligus hal yang masih membutuhkan pembuktian independen.