Kartu judul yang dihasilkan bertuliskan "Jev vs Laya" dengan subjudul "33 milidetik pada T4, dan baseline acak", membandingkan Jev (tertutup, dihosting, mesin keputusan zero-shot, 0.727) dengan Laya (Apache 2.0, 421M ModernBERT, berjalan secara lokal, 0.362 zero-shot).
Engineering & Research

Jev vs Laya: 33 Milidetik pada T4, dan Baseline Acak

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kartu model Laya memuat kalimat yang menentukan perbandingan ini, dan kalimat itu ditulis oleh orang-orang yang membuat Laya. "Laya adalah basis yang cepat untuk dispesialisasi, bukan mesin keputusan zero-shot." Convai Innovations merilis Laya pada 18 September 2026, tiga hari setelah TypeSafe AI meluncurkan Jev, di bawah Apache 2.0, dengan bobot di Hugging Face dan titik masuk pip install laya. Model ini menjawab pertanyaan bertipe dalam satu forward pass tanpa decoding token demi token, yakni taruhan arsitektural yang sama yang diambil Jev. Klaim utamanya adalah latensi p50 sebesar 32,8 milidetik per keputusan pada Tesla T4, yang dibingkai sebagai sekitar 7,8 kali lebih cepat daripada p50 236–276ms Jev yang dipublikasikan melalui API terkelolanya. Klaim itu nyata dan klaim itu juga mengukur dua hal yang berbeda — GPU lokal versus panggilan jaringan — dan gambaran akurasi di baliknya adalah bagian yang seharusnya menentukan apakah Anda mengunduhnya. Secara zero-shot, Laya mencetak 0,362 pada benchmark keputusan bertipe milik TypeSafe. Tebakan acak mencetak 0,318. Baseline kelas mayoritas mencetak 0,461. Laya, apa adanya, lebih dekat ke acak daripada ke baseline sepele.

Apa sebenarnya Laya itu

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya hadir sebagai dua checkpoint di balik router bawaan yang mengarahkan setiap masukan ke checkpoint yang tepat. Checkpoint bahasa Inggris adalah ModernBERT-large dengan 421 juta parameter dan konteks 512 token. Varian multibahasanya adalah mmBERT-base dengan 322 juta parameter dan jendela 1.024 token di lebih dari 100 bahasa. Keduanya non-autoregresif: satu forward pass mengembalikan jawaban, jadi tidak ada loop decoding, tidak ada JSON yang harus diurai, dan tidak ada ruang untuk mengeluarkan teks di luar tipe yang dideklarasikan. Properti terakhir itu adalah jaminan struktural yang sama seperti yang ditawarkan Jev, yang dicapai dari arah berbeda, dan itu sungguh bernilai bagi siapa pun yang pernah menulis logika percobaan ulang untuk model yang kadang lupa menutup kurung kurawal.

Jev adalah padanan tertutupnya: model System One pertama dari TypeSafe AI, diluncurkan pada 15 September 2026, dihosting dan bersifat akses awal, dengan tiga primitif bertipe — Choice dari daftar yang Anda sediakan, Score pada rubrik berurutan, dan Noul, klaim ya/tidak dengan probabilitas terkalibrasi. Semua pertanyaan dievaluasi secara paralel terhadap satu pembacaan status yang sama, output gratis karena tidak ada token output, dan input seharga $0,042 per juta token. Arsitektur, jumlah parameter, dan komputasi pelatihannya tidak diungkapkan, dan TypeSafe mengatakan detailnya dirahasiakan rapat-rapat dengan kemungkinan makalah menyusul nanti.

Klaim latensi, diukur dengan benar

p50 32,8 ms milik Laya pada T4 adalah angka yang nyata dan angka yang bagus. Perbandingan 7,8x terhadap 236–276 ms milik Jev adalah bagian yang perlu kehati-hatian, dan kartu milik Laya sendiri luar biasa jujur tentang alasannya: angka-angka Jev adalah angka terbitan pihak ketiga yang tidak pernah diukur sendiri oleh Convai, dan perbandingan itu mempertemukan forward pass GPU lokal dengan panggilan API terkelola yang mencakup round-trip jaringan dan pengantrean. Jika faktor jaringan disingkirkan, perbandingan arsitekturalnya adalah antara dua model single-pass, satu dengan 421 juta parameter dan satu lagi dengan ukuran yang tidak diungkapkan yang belum pernah dipublikasikan oleh TypeSafe.

Ada juga angka batching yang perlu diketahui: pada batch berisi sepuluh, Laya melaporkan 7,2 ms per pertanyaan. Itulah bentuk produknya. Laya dirancang untuk dijalankan secara lokal dalam volume besar, dan port komunitas di perangkat seperti laya-mlx memperluasnya ke Apple Silicon. Klaim viral bahwa "50x lebih cepat daripada Jev" tidak didukung oleh tolok ukur resmi yang diterbitkan proyek itu sendiri, dan kerangka yang jujur adalah kesenjangan besar antara lokal dan cloud yang sebagian bersifat arsitektural dan sebagian lagi sekadar perbedaan antara GPU Anda dan API milik orang lain.

Apa yang dikatakan angka akurasi, secara berurutan

Di sinilah perbandingan itu tidak lagi menyanjung, dan ada baiknya diuraikan secara berurutan karena urutannya penting.

Zero-shot pada tolok ukur typed-decisions milik TypeSafe — Laya 0.362, acak 0.318, kelas-mayoritas 0.461, Jev 0.727. Laya berada di atas tebakan acak dan di bawah baseline trivial.

• Di-fine-tune pada split pelatihan milik benchmark itu sendiri — Laya 0,766 melawan Jev 0,727. Laya menang, dan kemenangan itu berasal dari checkpoint yang telah melihat data pelatihan benchmark, yang menjadikannya pernyataan tentang fine-tuning, bukan tentang model dasar.

• Klasifikasi intent Banking77, yang kumpulan opsinya besar — Laya 0.425 dibandingkan Jev 0.870. Laya menurun tajam setelah sekitar 20 opsi, dan field Choice milik Jev didokumentasikan mampu menangani hingga 255 sebelum pola penilaian dua tahap diperlukan.

• Kalibrasi — Laya hadir dengan mean expected calibration error sebesar 0,466, yang membaik menjadi 0,081 hanya setelah penyetelan ulang suhu per jenis pertanyaan. Jev dilatih dengan metode yang oleh TypeSafe disebut RLCD, Reinforcement Learning for Calibrated Decisions, dan menyertakan distribusi probabilitas pada setiap jawaban — meskipun TypeSafe juga menyarankan pengguna untuk memvalidasi ambang batas pada data berlabel mereka sendiri, dan satu audit independen menemukan kalibrasi Jev sangat bervariasi menurut tugas.

Polanya tidak ambigu. Laya adalah basis yang kuat untuk penyetelan halus dan mesin keputusan zero-shot yang lemah, dan ia sendiri mengatakan demikian. Jev adalah mesin keputusan zero-shot yang kuat yang kalibrasinya masih harus diperiksa per penerapan. Itu adalah produk yang berbeda dengan struktur harga yang berbeda, dan memilih di antara keduanya sebagian besar adalah pertanyaan apakah Anda memiliki data berlabel dan siklus pelatihan.

Aritmetika biaya tidak sama bentuknya dengan milik Jev.

Jev adalah $0,042 per juta token masukan dengan keluaran gratis, yang setara dengan $42 per miliar, dan panggilan berukuran maksimum pada anggaran permintaan ~32.000 token yang didokumentasikan berbiaya jauh di bawah satu sen. Uji independen Every menghasilkan 777 penilaian di 37 dokumen dengan biaya sekitar seperempat sen.

Biaya per panggilan Laya nol secara marginal dan tidak nol secara agregat, dan agregatnya tidak kecil. Model 421M parameter di T4 murah untuk dijalankan tetapi tetap membuat Anda mengeluarkan biaya GPU, dan langkah fine-tuning yang membuat Laya kompetitif adalah tempat pengeluaran riil berada — pelabelan data, proses pelatihan, rangkaian evaluasi, dan penyesuaian ulang temperature per jenis pertanyaan yang menurunkan galat kalibrasinya dari 0,466 ke 0,081. Untuk taksonomi tetap yang tidak pernah berubah, itu adalah biaya satu kali yang terbayar kembali pada volume. Untuk taksonomi yang bergeser, itu adalah biaya berulang, dan baseline zero-shot Jev sebesar 0,727 menjadi pilihan yang jauh lebih menguntungkan.

Ada biaya ketiga yang mudah terlewatkan: checkpoint bahasa Inggris milik Laya memiliki jendela konteks 512 token. Itu bukan model keputusan dengan anggaran konteks yang kecil — itu model keputusan yang ukurannya hanya untuk satu paragraf. Anggaran permintaan Jev yang sekitar 32.000 token enam puluh kali lebih besar, dan bahkan itu masih satu orde magnitudo di bawah model generatif yang menjadi acuan harga keduanya. Jika state Anda adalah utas dukungan, bukan pesan dukungan, jendela kedua model itu bukanlah batasan yang seharusnya Anda optimalkan.

Pertanyaan deployment adalah perbedaan yang sesungguhnya.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

Argumen terkuat Laya bukanlah latensi. Argumennya adalah bahwa bobot Apache 2.0 di Hugging Face berarti keputusan tersebut tidak pernah meninggalkan infrastruktur Anda dan endpoint tersebut tidak pernah memiliki batas laju. Untuk keputusan perutean yang dibuat berdasarkan rekam medis, dokumen hukum, atau riwayat akun pelanggan, itu bukan sekadar preferensi — itu adalah faktor penentu, dan tidak ada endpoint terkelola pada harga berapa pun yang memenangkan argumen itu. Jev milik TypeSafe masih dalam akses awal dan memiliki daftar tunggu, dan dokumentasinya sendiri mencatat bahwa batas laju dapat berubah tanpa pemberitahuan.

Argumen tandingannya adalah apa yang Anda relakan. Arsitektur lebih besar Jev yang tidak diungkapkan melakukan pekerjaan yang tidak bisa dilakukan oleh 421M parameter Laya: selisih zero-shot sebesar 0.727 versus 0.362 dan selisih Banking77 sebesar 0.870 versus 0.425 keduanya mengukur seberapa banyak pengetahuan yang ada di dalam model sebelum Anda melatihnya. Jawaban Laya adalah bahwa Anda sendiri yang menyediakan pengetahuan itu melalui fine-tuning, dan pada domain tetap yang sempit jawaban itu berhasil — hasil fine-tuned 0.766 adalah buktinya.

Di mana lapisan keputusan berada dalam stack nyata

Tidak satu pun dari kedua model itu menghasilkan teks, jadi tidak satu pun merupakan keseluruhan dari alur kerja mana pun. Pola yang dirancang untuk keduanya adalah dua model: lapisan keputusan yang melakukan panggilan bertipe, dan model generatif yang menangani bagian yang membutuhkan prosa, kode, atau penjelasan. OrcaRouter tidak melayani Jev atau Laya — Jev adalah endpoint akses awal milik TypeSafe dan Laya adalah bobot yang Anda jalankan sendiri — tetapi separuh generatif dari pola itu persis yang kami cakup: 200+ model di balik satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama. Arsitektur dua model dapat diuji tanpa kontrak vendor kedua, dan dengan failover otomatis jalur generatif tidak menjadi titik kegagalan tunggal saat Anda memutuskan apakah lapisan keputusan murah itu terkalibrasi cukup baik untuk dijadikan dasar otomatisasi.

Putusan

Jika Anda memiliki taksonomi yang tetap dan sempit, contoh berlabel, dan persyaratan privasi atau latensi yang menyingkirkan API yang dihosting, Laya adalah pilihan yang lebih dapat dipertahankan dan angka hasil fine-tuning mendukungnya. Jika Anda memerlukan keputusan yang langsung dapat digunakan, jika kumpulan opsi Anda melebihi dua puluh kategori, atau jika keadaan lebih panjang dari satu paragraf, kartu model Laya sendiri memberi tahu Anda bahwa ini bukan produk untuk pekerjaan itu — dan skor zero-shot sebesar 0.362 terhadap baseline mayoritas 0.461 adalah angka yang perlu diperhatikan ketika seseorang mengutip angka latensi 7.8x kepada Anda.

Apa yang dimiliki keduanya secara bersama lebih berguna daripada apa yang memisahkan keduanya. Keduanya menghilangkan kelas kesalahan yang berasal dari pemformatan keluaran dan tidak melakukan apa pun terhadap kelas kesalahan yang berasal dari pertimbangan. Keduanya menyertakan probabilitas, dan tidak ada satu pun yang memiliki diagram reliabilitas terbitan yang bisa Anda percaya tanpa memeriksanya. Uji kalibrasi pada kasus berlabel Anda sendiri sebelum Anda mengotomatiskan berdasarkan salah satunya — latensi sudah menjadi komoditas dan nilai keyakinan adalah bagian yang harus diperoleh per penerapan.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."