Kartu judul yang dihasilkan untuk perbandingan Laya versus von, membawa subjudul artikel ini sendiri dan baris footer yang menyebutkan pihak mana yang angkanya dilaporkan vendor dan pihak mana yang berasal dari pihak ketiga.
Engineering & Research

Laya vs von: Ketika Tolok Ukur Vendor Tidak Dapat Ditransfer

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tugas klasifikasi jenis commit dengan enam kemungkinan label, di mana menebak saja menghasilkan 8,3% dan von mencetak 26,7%. Tugas perutean file di mana model yang sama mencetak 8,8%, hanya sedikit di atas tebakan acak. Tugas biner luas perubahan dengan AUC 0,513, yang setara lempar koin. Angka-angka itu berasal dari evaluasi pihak ketiga terhadap von — model System One open-source dari wfzyx, encoder ModernBERT-Large 395M yang dirilis di bawah Apache 2.0 pada 18 September 2026, hari yang sama dengan Laya dari Convai Innovations. Pada tolok ukur jabr v2 milik von sendiri, gambarnya justru sebaliknya: akurasi makro 71,5% di 49 tugas dan 869 kasus, perutean pilihan 83,4%, dan hasil ViZDoom berupa 9,38 rata-rata kill pada waktu di bawah 18 ms melawan Jev dari TypeSafe AI dengan 5,62 kill dan sekitar 115 ms. Kedua rangkaian angka itu nyata. Jarak di antara keduanya adalah hal paling berguna yang pernah diterbitkan siapa pun tentang kategori model ini, dan itu juga berlaku untuk Laya.

Dua model, dua backbone, satu mode kegagalan bersama

von dan Laya secara arsitektural merupakan tetangga dekat, itulah sebabnya masalah transfer menjadi lensa yang tepat untuk membandingkan keduanya. Keduanya adalah encoder non-autoregresif yang dibangun di atas ModernBERT: von dengan 395M parameter, checkpoint bahasa Inggris milik Laya dengan 421M. Keduanya mengekspos tiga primitif yang sama — pilihan dari daftar yang disediakan, skor pada rubrik terurut, noul sebagai probabilitas ya yang terkalibrasi — dan keduanya mengimplementasikan /v1/systemone format wire sehingga klien yang ditulis untuk Jev milik TypeSafe dapat mengarah ke server lokal sebagai gantinya. Keduanya Apache 2.0. Keduanya mengembalikan probabilitas alih-alih teks, dan tidak satu pun memiliki loop decoding untuk berhalusinasi.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Perbedaannya ada pada cerita pelatihannya. von dipralatih pada 2 triliun token teks web umum, literatur teknis, dan kode, lalu disetel halus pada korpus multi-domain seimbang berisi sekitar 290.000 contoh yang mencakup alur kerja operasional dan perusahaan, keamanan dan DevOps, moderasi keselamatan dan kebijakan, linguistik, triase, dan penalaran adversarial. Pasca-pelatihan menggunakan Pembelajaran Penguatan dengan Distribusi Kalibrasi, meminimalkan komposit entropi silang dan skor Brier dengan lambda pada 0,5, dan penskalaan suhu konvergen pada T=1,1692. Checkpoint bahasa Inggris Laya adalah ModernBERT-large yang disetel halus untuk bentuk keputusan bertipe, dengan jendela 512 token, bersama checkpoint multibahasa mmBERT-base 322M yang mencakup 100+ bahasa di balik router, dan p50 32,8 ms per keputusan yang dipublikasikan pada Tesla T4.

Mode kegagalan bersama adalah bahwa keduanya merupakan encoder yang dilatih untuk menghasilkan readout, bukan penalar. README von sendiri secara eksplisit menyatakan bahwa ia menyasar pipeline yang sensitif terhadap latensi, tempat model autoregresif memasukkan penundaan 500–2.000 ms dan error penguraian skema yang nondeterministik. Pembingkaian itu memberi tahu Anda untuk apa ia digunakan: klasifikasi yang cepat, deterministik, dan terkalibrasi secara statistik. Itu tidak memberi tahu Anda bahwa ia akan berhasil pada klasifikasi Anda, dan benchmark independen adalah apa yang terjadi ketika seseorang memeriksanya.

Membaca tolok ukur milik von sendiri secara jujur

Hasil jabr v2 diterbitkan oleh pemilik dan belum diaudit secara independen, dan bentuk tolok ukurnya sama pentingnya dengan skornya. Empat puluh sembilan tugas dan 869 kasus adalah cakupan yang wajar untuk evaluasi model keputusan, dan akurasi makro 71,5% adalah angka yang kuat untuk encoder 395M. Rincian per domain-lah yang membuatnya informatif: triase gejala 100,0%, layanan rumah 95,7%, perutean kota 94,7%, perutean pilihan secara keseluruhan 83,4%. Itulah tugas-tugas yang menjadi dasar korpus pelatihan dibangun — README mendeskripsikan data fine-tuning sebagai alur kerja operasional dan perusahaan, keamanan dan DevOps, moderasi keselamatan dan kebijakan, linguistik, triase, dan penalaran adversarial. Skor tinggi pada triase gejala adalah pernyataan bahwa model mempelajari domain triase, bukan bahwa model belajar mengklasifikasikan.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

Hasil ViZDoom adalah yang paling sering dikutip, dan layak dibaca dengan cermat. Rata-rata 9,38 kill dalam "Defend the Center," delapan seed, zero-shot dari teks adegan terstruktur, pada latensi di bawah 18ms, dibandingkan 5,62 kill milik Jev pada sekitar 115ms — peningkatan +66,9%. Ini adalah hasil yang mencolok dan juga merupakan lingkungan game yang digerakkan oleh teks terstruktur, di mana kebijakan refleksif yang cepat adalah bentuk yang tepat. Cara proyek membingkai paradigma System One — refleksif, paralel, deterministik, terkalibrasi secara statistik — adalah deskripsi yang wajar tentang apa yang dihargai oleh tugas tersebut.

Lalu evaluasi pihak ketiga menjalankan von pada klasifikasi tipe commit, perutean file, deteksi fitur, dan penilaian luas perubahan, dan von kalah dari baseline kata kunci dan regex pada beberapa di antaranya. AUC 0,513 pada tugas biner adalah angka yang paling tajam: lemparan koin, dari model yang kalibrasinya disetel ke T=1.1692 dan yang README-nya mengklaim expected calibration error yang mendekati ideal. Kedua hal itu bisa sama-sama benar. Sebuah model bisa terkalibrasi dengan baik pada distribusi tempat ia dilatih dan tidak berguna pada distribusi yang belum pernah dilihatnya — dan sebenarnya, kalibrasi yang baik pada distribusi yang salah lebih buruk daripada kalibrasi yang jelas-jelas buruk, karena angka keyakinannya terlihat dapat dipercaya.

Tes yang sama diterapkan pada Laya

Laya telah menjalani versi perlakuan ini, dan hasilnya konsisten dengan milik von. Pada tolok ukur typed-decisions milik TypeSafe, Laya memperoleh skor 0,362 secara zero-shot dibandingkan 0,318 untuk acak dan 0,461 untuk baseline kelas mayoritas — lebih dekat ke peluang acak daripada ke jawaban trivial. Kartu modelnya sendiri menyatakan kesimpulannya: "Laya adalah basis yang cepat untuk dispesialisasi, bukan mesin keputusan zero-shot." Setelah sekitar dua puluh opsi, performanya menurun tajam, dengan skor 0,425 pada Banking77 dibandingkan 0,870 milik Jev. Pada 100 pesan urgensi Mars-base dalam satu pengujian pihak ketiga, Jev mencetak 100/100 dan Laya 53/100. Dalam tolok ukur agen peramban, ia menyelesaikan 0 dari 50 tugas, menyatakan selesai secara prematur dalam 33 upaya, 17 di antaranya sebelum mengambil tindakan apa pun — meskipun penulis tolok ukur mencatat bahwa ia dilatih untuk pekerjaan penilaian seperti tiket dukungan dan faktur, bukan navigasi, yang merupakan pernyataan cakupan alih-alih putusan.

Apa yang membedakan Laya dari von terletak pada apa yang diklaimnya untuk dirinya sendiri. Convai menerbitkan angka zero-shot yang tidak menyanjung dan expected calibration error 0,466 di kartu, di samping 0,081 yang dihasilkan oleh penyetelan ulang temperature per jenis pertanyaan. README von menerbitkan angka jabr v2 yang menyanjung dan kemenangan ViZDoom. Kedua proyek jujur tentang apa yang mereka lakukan; hanya satu di antaranya yang mengedepankan benchmark tempat modelnya tampil buruk. Itu adalah pengamatan tentang sumber, bukan tuduhan — tetapi jika Anda memilih di antara keduanya berdasarkan bukti yang diterbitkan, perhatikan bahwa Anda membandingkan proyek yang menunjukkan angka lemahnya kepada Anda dengan proyek yang angka lemahnya harus Anda cari di tempat lain.

Perbandingan spesifikasi, dimensi demi dimensi

• Backbone — Laya: ModernBERT-large 421M bahasa Inggris, mmBERT-base 322M multibahasa. dari: ModernBERT-Large 395M.

• Bahasa — Laya: 100+ melalui checkpoint multibahasa dan sebuah router. von: Bahasa Inggris, tanpa checkpoint multibahasa yang dipublikasikan.

• Jendela konteks — Laya: 512 token untuk bahasa Inggris, 1.024 untuk multibahasa. von: tidak dipublikasikan dengan ketentuan yang sama; kasus-kasus jabr v2 adalah keputusan terstruktur yang singkat.

• Latensi — Laya: 32,8ms p50 pada T4, 7,2ms per pertanyaan pada batch 10. von: diklaim sub-15ms hingga sub-25ms, sub-18ms dalam uji ViZDoom.

• Akurasi yang dilaporkan — Laya: 0,362 zero-shot, 0,766 fine-tuned pada split benchmark itu sendiri, 0,425 pada Banking77. von: 71,5% makro di seluruh 49 tugas jabr v2, 83,4% perutean pilihan, dan 26,7% pada jenis commit dalam uji independen.

• Kalibrasi — Laya: ECE 0,466 saat dirilis, 0,081 setelah penyetelan ulang suhu per jenis pertanyaan. von: suhu diskalakan ke T=1,1692 selama pasca-pelatihan RLCD, diklaim memiliki ECE hampir ideal pada distribusinya sendiri.

• Penyajian — Laya: pip install laya, plus ONNX, Go dan Apple MLX port komunitas. von: SDK Python dan TypeScript, server HTTP melalui von serve, preset siap pakai untuk triase tiket, keamanan email, moderasi, dan triase peristiwa keamanan.

• Perangkat keras — Laya: CPU, CUDA, dan Apple MPS. dari: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS, dan CPU multithread.

• Lisensi — Apache 2.0 untuk keduanya.

Bagian dari von yang benar-benar khas

Pola komposit von adalah hal yang paling jarang dibahas di repositorinya. Confidence gating, route dispatch, composite scoring, dan two-stage routing dikirim sebagai pola bernama bersama preset — triase tiket, keamanan email, moderasi, triase peristiwa keamanan — dan semuanya menyandikan arsitektur yang benar-benar dibutuhkan model keputusan di produksi. Satu panggilan choice jarang menjadi keseluruhan sistem; bentuk yang berguna adalah router tahap pertama yang murah yang mengirim ke tahap kedua yang terspesialisasi, dengan confidence gate yang mengeskalasi kasus-kasus yang tidak pasti. von mengirimkannya sebagai pola yang terdokumentasi alih-alih menyerahkannya kepada Anda.

Itu cocok secara rapi dengan apa yang dilakukan OrcaRouter di sisi generatif, yang layak dikatakan secara terus terang karena kedua belahan pola ini biasanya dibangun oleh tim yang berbeda. Baik von maupun Laya tidak di-hosting di OrcaRouter — keduanya adalah bobot yang Anda unduh dan jalankan — dan tidak ada apa pun di sini yang boleh dibaca sebagai klaim bahwa kami menyajikannya. Yang ada dalam daftar kami adalah belahan lainnya: 200+ model generatif di balik satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga pemotongan harga vendor mencapai tagihan Anda pada hari yang sama, bukan saat perpanjangan. Jika gerbang keyakinan von memutuskan bahwa 4% permintaan memerlukan model frontier, DSL perutean itulah yang menyusun keputusan itu menjadi satu panggilan alih-alih dua kontrak dan dua SDK, dan failover otomatis itulah yang menjaga cabang mahal agar tidak menjadi titik kegagalan tunggal.

Apa yang harus dilakukan dengan dua model yang keduanya gagal di luar distribusi pelatihannya

Kesimpulan praktis dari evaluasi von bukanlah bahwa von adalah model yang buruk. Kesimpulannya adalah bahwa akurasi yang dipublikasikan sebuah model pengambilan keputusan merupakan klaim tentang distribusi pelatihannya, dan satu-satunya cara untuk mengetahui apakah masalah Anda berada di dalam distribusi tersebut adalah dengan mengujinya. Tabel benchmark README milik von sendiri membandingkan dirinya dengan GLiNER2, Qwen3.5 4B yang di-fine-tuning, Laya, dan Jev milik TypeSafe dalam hal ukuran, akurasi, latensi, dan hosting — yang merupakan tabel yang berguna, dan juga tabel di mana setiap entri akurasi kecuali satu berasal dari harness milik penulisnya sendiri.

Di antara keduanya: pilih von jika Anda menginginkan kumpulan domain yang dipublikasikan lebih luas, jejak yang sedikit lebih kecil, pola penyajian siap pakai untuk triase dan moderasi, serta bukti ViZDoom bahwa ia menangani keputusan teks terstruktur dengan cepat dan baik. Pilih Laya jika Anda memerlukan input multibahasa — von tidak punya checkpoint multibahasa dan varian mmBERT 322M milik Laya mencakup 100+ bahasa — atau jika angka 32,8 ms pada T4 dan jendela bahasa Inggris 512 token cocok dengan beban kerja Anda. Jangan memilih salah satu pun tanpa menghabiskan satu sore untuk melabeli beberapa ratus contoh dari lalu lintas Anda sendiri dan menjalankan keduanya terhadap contoh-contoh itu. Dokumentasi kedua proyek itu sendiri mengarahkan Anda ke eksperimen tersebut, dan hasil pihak ketiga von adalah apa yang terjadi ketika tidak ada yang menjalankannya.

Satu hal yang akan mengubah perbandingan ini adalah evaluasi berpasangan pada input yang identik dengan diagram reliabilitas untuk setiap model. Hal itu tidak ada. Sampai hal itu ada, peringkat yang jujur adalah berdasarkan kualitas bukti, bukan berdasarkan skor: Laya telah menerbitkan angka terburuknya, von telah menerbitkan angka terbaiknya, dan uji independen atas von adalah hal yang paling mendekati pemeriksaan eksternal yang dimiliki keduanya.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."