Kartu judul yang dihasilkan untuk perbandingan Laya versus Kev, yang memuat subjudul artikel ini sendiri dan baris footer yang menyebutkan sisi mana angkanya dilaporkan vendor dan mana yang pihak ketiga.
Engineering & Research

Laya vs Kev: Dua Resep untuk Model Keputusan Lokal

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Angka paling berguna dalam perbandingan Laya-versus-Kev adalah sebuah kwitansi. Jared Palmer melatih keluarga Kev dengan biaya sekitar $95 untuk waktu H100 di Modal, ditambah sekitar tiga sen panggilan API untuk data evaluasi, dan menerbitkan resepnya bersama bobotnya. Convai Innovations mengambil jalur lain dengan Laya: dirilis 18 September 2026, tiga hari setelah Jev milik TypeSafe AI, Apache 2.0, bobot di Hugging Face, sebuah pip install laya titik masuk, dan tanpa pipeline pelatihan — checkpoint bahasa Inggris 421M ModernBERT-large, checkpoint multibahasa 322M mmBERT-base, dan router yang memilih di antara keduanya. Kev adalah keluarga dari tiga model kecil pada 0.8B, 4B dan 9B, masing-masing berupa basis yang dibekukan plus adaptor LoRA rank-16 dan kepala pointer kecil. Keduanya menjawab pertanyaan bertipe dalam satu forward pass dan tidak ada yang menghasilkan teks. Keputusan di antara keduanya sebenarnya adalah keputusan tentang artefak mana yang ingin Anda miliki: checkpoint atau resep.

Apa yang sebenarnya sedang dirilis oleh setiap proyek

Laya menyediakan inferensi. Checkpoint bahasa Inggris adalah encoder dua arah dengan jendela 512 token; versi multibahasa mencakup 100+ bahasa pada jendela 1.024 token dan berjalan sekitar dua kali lebih cepat; router mendeteksi aksara dalam waktu kurang dari setengah milidetik. Ia menjawab pilihan, skor dan noul — pilihan dari daftar, tingkat yang diharapkan pada rubrik berurutan, dan probabilitas terkalibrasi bahwa suatu klaim benar. Ada checkpoint ketiga, laya-typed-decisions, yang merupakan backbone 421M yang sama yang di-fine-tune pada split pelatihan dari benchmark typed-decisions. Kartu model Convai sendiri memuat kalimat yang seharusnya memandu cara Anda membaca setiap angka Laya: "Laya adalah basis cepat untuk dispesialisasikan, bukan mesin keputusan zero-shot."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev merilis sebuah metode. Repositori mendokumentasikan decision-v7: dua epoch pada 10.000 contoh yang diambil dari sepuluh dataset publik, 896 contoh kebijakan yang dihasilkan, dan 1.680 contoh yang dibangun dari 60 struktur aturan yang dihasilkan. Head menilai setiap opsi yang diberikan terhadap decide token milik pertanyaan dan menerapkan softmax pada hasilnya. Karena checkpoint Qwen3.5 mencampur attention dengan layer Gated DeltaNet rekuren yang mengabaikan attention mask, setiap pertanyaan berjalan sebagai barisnya sendiri dengan state bersama dihitung sekali dan di-cache — begitulah cara model menjaga pertanyaan tetap terisolasi satu sama lain tanpa harus membayar prefill baru untuk setiap pertanyaan. Kev meniru kontrak publik /v1/systemone milik TypeSafe, sehingga klien SDK TypeSafe yang sudah ada dapat mengarah ke server Kev lokal dengan mengubah base URL. README menyatakan bahwa tidak ada output Jev yang digunakan dalam pelatihan.

Kedua mode kegagalan itu berbeda, dan itulah inti ceritanya.

Kedua model kalah dari Jev pada tugas-tugas yang memerlukan pengetahuan, tetapi mereka kalah dengan cara yang menuntut mitigasi berbeda.

Kelemahan Laya yang dipublikasikan berkaitan dengan bentuk masukannya. Pada benchmark typed-decisions milik TypeSafe, ia mencetak 0,362 secara zero-shot, dibandingkan 0,318 untuk tebakan acak dan 0,461 untuk baseline kelas mayoritas — lebih dekat ke peluang daripada ke jawaban trivial. Setelah sekitar dua puluh opsi, ia berantakan: 0,425 pada Banking77 melawan 0,870 milik Jev. Ia cukup sensitif terhadap urutan sehingga pembalikan murni urutan opsi menurunkan akurasi 13,75 poin dalam satu uji pihak ketiga, menyisakan tingkat jawaban sama 42,5%. Dan checkpoint yang dikirimkan hadir dengan temperatur tidak valid — pustaka memperingatkan saat impor, yang berarti angka kalibrasi pada kartu, yaitu kesalahan kalibrasi yang diharapkan sebesar 0,466, adalah angka yang sebenarnya Anda dapatkan sebelum Anda melakukan refit. Refit per jenis pertanyaan membawanya ke 0,081, tetapi itu pekerjaan yang Anda lakukan, bukan pekerjaan yang dilakukan oleh unduhan. Ada kegagalan multibahasa yang dipublikasikan yang layak dibaca selengkapnya: pada aksara non-Latin, checkpoint bahasa Inggris terlalu percaya diri secara katastrofik, dengan contoh Khmer yang menunjukkan akurasi 0,000 pada keyakinan rata-rata 0,952.

Kelemahan Kev yang dipublikasikan berkaitan dengan pengetahuan dan aritmetika. Kev-9B mencetak 0.837 pada uji sumber baru terkunci miliknya sendiri — 0.832 untuk 4B dan 0.668 untuk 0.8B — dan sekitar 0.822 di luar domain pada split dev dibandingkan 0.857 milik Jev. Kesenjangan terbuka di tempat pengetahuan dunia diperlukan: MMLU sekitar 70% berbanding 90% milik Jev, MMLU-Pro 0.515 berbanding 0.840, dan aritmetika tanggal presisi hari 60% berbanding 93%. Pada kumpulan perutean label tetap yang sempit, ia menang — evaluasi perutean tiket dukungan menempatkan Kev-9B pada 0.952 berbanding 0.897 milik Jev — tetapi penulisnya secara eksplisit menyatakan bahwa ini adalah harness miliknya sendiri, bahwa data pelatihan Jev tidak diungkapkan, dan bahwa oleh karena itu tidak ada perbandingan terkontrol yang dapat dibangun. Kev juga tetap terlalu percaya diri pada sumber baru; menyetel KEV_TEMPERATURE=2.0 memangkas kesalahan dengan keyakinan tinggi dari 8.7% menjadi 4.4% dalam pengujian proyek itu sendiri, yang menunjukkan bahwa pengaturan bawaan bukanlah pengaturan yang aman.

Terjemahan praktisnya: Kegagalan Laya dipicu oleh set opsi Anda dan pemformatan prompt Anda, dan Anda memperbaikinya dengan fine-tuning dan refitting. Kegagalan Kev dipicu oleh pertanyaan yang membutuhkan fakta, dan Anda memperbaikinya dengan membatasi model pada perutean dan klasifikasi serta menempatkan panggilan yang bergantung pada pengetahuan di tempat lain. Tidak ada perbaikan yang merupakan flag konfigurasi.

Apa yang dibutuhkan untuk melayani mereka

• Perangkat keras — Laya: encoder 421M/322M, kredibel di CPU untuk throughput rendah dan berada di bawah satu gigabyte resident untuk port MLX pada Apple silicon. Kev: 0,8B hingga 9B, membutuhkan GPU CUDA BF16 untuk 9B, dengan arsitektur Qwen3.5 yang memerlukan flash-linear-attention pada CUDA dan ROCm.

• Latensi — Laya: 32,8ms p50 per keputusan pada Tesla T4, 7,2ms per pertanyaan pada batch 10. Kev: sekitar 300ms untuk lima pertanyaan yang diketik dari model 4B pada Mac 32GB dalam bf16, kira-kira 40ms pada H100.

• Batas — Laya: jendela bahasa Inggris 512 token, 1.024 multibahasa. Kev: pilihan dari 1–255 opsi, skor dari 2–255 level, 384 token keadaan pelatihan dengan 8.192 saat penyajian.

• Server — Laya: Python in-process, plus port komunitas ONNX, Go, dan Apple MLX. Kev: server lokal yang terikat ke 127.0.0.1 tanpa autentikasi, SDK npm, serta adaptor LangChain dan LlamaIndex.

• Lisensi — Apache 2.0 untuk keduanya.

Dua catatan operasional yang tidak muncul dalam angka utama. Server Kev hanya melayani satu permintaan dan tanpa autentikasi secara desain — ini adalah sidecar lokal, bukan sesuatu yang Anda ekspos. Dan latensi Mac Kev jauh lebih buruk daripada latensi H100-nya karena kernel DeltaNet yang cepat belum ada untuk MLX, yang justru merupakan jenis detail yang mengubah klaim "berjalan secara lokal" menjadi klaim "berjalan secara lokal pada perangkat keras yang tepat".

Bagian generatif dari pola tersebut

Kedua model ini ada untuk menggantikan satu panggilan spesifik: pemanggilan LLM yang Anda lakukan semata-mata untuk mendapatkan label atau probabilitas kembali. Keduanya tidak menggantikan panggilan yang benar-benar membutuhkan prosa. Sistem dukungan yang menggunakan Kev-9B untuk mengarahkan tiket tetap membutuhkan model untuk meringkas utas dan menyusun draf balasan, dan model itu tidak akan menjadi LoRA 9B dengan head pointer.

Itulah celah tempat OrcaRouter berada, bukan klaim tentang menghosting salah satu dari keduanya. Baik Laya maupun Kev tidak ada dalam daftar model kami — keduanya adalah bobot yang Anda unduh — dan artikel tersebut akan menyesatkan jika menyiratkan sebaliknya. Yang ada dalam daftar adalah 200+ model generatif di balik satu kunci yang kompatibel dengan OpenAI dengan harga daftar penyedia yang diteruskan dengan markup 0%. Jika Anda menggunakan Kev untuk memutuskan ke tingkat peringkasan mana dari tiga tingkatan sebuah permintaan termasuk, atau menggunakan Laya untuk menilai apakah jawaban draf dapat diterima, sisi generatif dari kedua loop tersebut adalah satu endpoint dengan failover otomatis alih-alih kontrak kedua dan SDK kedua. DSL routing adalah bagian yang paling alami cocok dengan arsitektur model keputusan: gabungkan model murah dan model mahal ke dalam satu panggilan dan biarkan output model keputusan memilih cabangnya.

Tontonan Berikutnya

Celah dalam bukti itu sama bagi keduanya, dan tidak akan ditutup oleh proyek mana pun. Tidak ada yang menjalankan Laya dan Kev pada masukan yang identik byte dengan prompt yang sama, urutan opsi yang sama, dan penyapuan ambang keyakinan yang sama. Kemenangan utama Laya berasal dari harness miliknya sendiri; klaim hampir setara Kev berasal dari harness penulisnya; audit kalibrasi yang menemukan kalibrasi Jev bervariasi tajam menurut tugas — akurasi 44,7% dan kesalahan kalibrasi yang diharapkan 0,325 pada tugas prioritas kebijakan tersembunyi — adalah milik pihak ketiga, dan baik Laya maupun Kev belum menerima perlakuan itu. Sampai seseorang melakukannya, angka-angka di atas adalah yang terbaik yang tersedia dan tidak dapat dibandingkan satu sama lain.

Jika Anda mengambil keputusan hari ini: pilih Kev jika Anda ingin model perutean yang berfungsi minggu ini di GPU yang sudah Anda sewa, dan terimalah bahwa model itu tidak akan mengetahui banyak hal. Pilih Laya jika input Anda multibahasa atau anggaran perangkat keras Anda adalah laptop, dan anggarkan fine-tuning sebagai bagian dari proyek, bukan sebagai optimisasi belakangan. Apa pun pilihannya, ukur pada data berlabel Anda sendiri sebelum Anda menempatkan ambang keyakinan di depan lalu lintas produksi — kedua proyek, dalam dokumentasi mereka masing-masing, menyuruh Anda melakukannya.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."