Kartu judul yang dihasilkan bertuliskan "Laya Dijelaskan" di atas subjudul "Model keputusan yang menjawab tanpa menulis satu token pun", dengan footer bertuliskan "Semua angka mengacu pada kartu model Laya kecuali dinyatakan lain."
Engineering & Research

Laya Dijelaskan: Model Keputusan yang Menjawab Tanpa Menulis Satu Token pun

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal yang paling menarik tentang Laya bukanlah kecepatannya. Yang menarik adalah bahwa setiap opsi yang Anda tawarkan kepadanya dinilai pada [MASK] token miliknya sendiri, dan probabilitasnya kemudian di-softmax atas opsi-opsi untuk pertanyaan tersebut. Convai Innovations menerbitkan bobot Laya di Hugging Face pada 18 September 2026, di bawah Apache 2.0 — tiga checkpoint, satu repositori, 421M parameter untuk model bahasa Inggrisnya. Tidak ada token keluaran. Tidak ada loop decoding, tidak ada JSON untuk diurai, tidak ada kurung kurawal yang lupa ditutup. Anda memberinya state dan sekumpulan pertanyaan bertipe, dan satu forward pass kemudian Anda mendapatkan pilihan di antara opsi bernama, skor ordinal dengan level yang diharapkan, atau probabilitas bahwa suatu pernyataan benar. Desain itu punya konsekuensi yang sering dilewatkan orang: karena ruang jawaban disusun per permintaan alih-alih ditanamkan ke vocabulary head, skema yang Anda ciptakan sore ini tidak perlu pelatihan ulang. Desain itu juga punya batas, dan proyek tersebut menyatakannya dengan gamblang di kartu modelnya sendiri: checkpoint dasar mencetak 0,362 pada benchmark typed-decisions, dibandingkan 0,318 untuk tebakan acak dan 0,461 untuk selalu menjawab kelas mayoritas. Kalimat Convai sendiri adalah yang perlu Anda ingat — "Laya adalah basis yang cepat untuk dispesialisasi, bukan mesin keputusan zero-shot." Titik pembanding yang jelas adalah Jev milik TypeSafe AI, model System One yang dihosting tanpa bobot yang dipublikasikan, tanpa jumlah parameter yang dipublikasikan, dan tanpa model dasar yang dipublikasikan. Laya adalah jawaban open-weights untuk itu. Apakah jawaban itu berguna bagi Anda hampir sepenuhnya bergantung pada separuh pipeline mana yang Anda coba ganti.

Apa sebenarnya Laya itu, dan apa yang bukan

Mulailah dari sisi negatifnya, karena di situlah sebagian besar tulisan keliru. Laya bukan LLM. Model ini non-autoregresif: satu forward pass menghasilkan jawaban, dan model tidak pernah mengeluarkan teks. Membandingkan latensinya dengan token per detik model chat berarti membandingkan dua operasi yang berbeda — yang satu mengklasifikasikan, yang lain menghasilkan. Jika Anda membutuhkan paragraf, ringkasan, rencana, atau rantai penalaran, Laya tidak dapat memberikannya dan tidak berusaha melakukannya.

Apa itu: encoder dua arah dengan head keputusan yang dipasang di atasnya. Checkpoint bahasa Inggrisnya adalah ModernBERT-large — 395 juta parameter, di-fine-tune sepenuhnya — ditambah head yang dilatih dari awal yang terdiri dari dua layer transformer, penskor penanda opsi, dan head act/escalate, dengan total 421 juta. Checkpoint multibahasanya mengganti backbone dengan mmBERT-base, 22 layer dan kosakata 256k, dengan total 322 juta. Tiga checkpoint tersedia dalam satu repositori, dan hanya yang Anda minta yang diunduh:

convaiinnovations/laya — ModernBERT-large, 421 juta parameter, konteks 512 token, bahasa Inggris, sekitar 808 MB di disk.

convaiinnovations/laya-multilingual — mmBERT-base, 322M parameter, konteks 1.024 token (encoder mendukung hingga 8.192 dengan RoPE), 100+ bahasa, sekitar 2,2x lebih cepat, sekitar 647 MB.

convaiinnovations/laya-typed-decisions — ModernBERT-large, 421 juta parameter, konteks 1.024 token, dan satu-satunya dari ketiga model tersebut yang membawa angka 0,766 yang akan Anda lihat dikutip di mana-mana.

Sebuah Router berada di depan dan memilih checkpoint per permintaan dengan mendeteksi skrip dan bahasa dalam waktu kurang dari setengah milidetik, dalam Python murni, sebelum forward pass apa pun terjadi. Itu bukan fitur kenyamanan. Itu fitur kebenaran, dan bukti dari proyek itu sendiri menunjukkan alasannya: checkpoint bahasa Inggris mendapat akurasi 0,000 pada bahasa Khmer namun melaporkan keyakinan 0,952. Model yang tetap yakin meskipun sepenuhnya salah adalah justru kasus ketika pembatasan berdasarkan keyakinan tidak dapat menyelamatkan Anda, sehingga keputusan routing harus dibuat sebelum model melihat input. Dalam sapuan 51 bahasa, router membuat 45 dari 51 bahasa dapat digunakan — yang didefinisikan sebagai mengalahkan tiga kali acak — dibandingkan 23 dari 51 untuk checkpoint bahasa Inggris saja.

A screenshot of the Laya model card on Hugging Face, showing the three checkpoints (convaiinnovations/laya, laya-multilingual and laya-typed-decisions) with their parameter counts and context windows, the choice, score and noul primitives, the Apache 2.0 licence, and the zero-shot and fine-tuned accuracy figures.

Fakta desain yang perlu dipahami: satu token [MASK] per opsi

Jika Anda hanya mengambil satu hal dari artikel ini, ambil ini. Dalam kepala klasifikasi normal, kumpulan label ditetapkan pada waktu pelatihan: lapisan akhir memiliki satu keluaran per kelas, dan menambahkan kelas berarti perlu pelatihan ulang. Laya tidak melakukan itu. Laya merender setiap opsi sebagai teks dengan penanda, dan penilai penanda opsi membaca skor dari opsi itu sendiri pada posisi [MASK]. Lalu ia melakukan softmax di antara opsi-opsi yang termasuk dalam pertanyaan itu.

Oleh karena itu, ruang jawaban didefinisikan pada waktu permintaan. Anda menulis opsi, model menilainya. Skema baru tidak memerlukan pelatihan ulang dan tidak memerlukan penyetelan halus, karena tidak ada apa pun dalam bobot yang mengodekan "billing" atau "technical" sebagai kelas — hanya mekanisme untuk membandingkan satu opsi yang dirender dengan opsi lainnya dalam konteks keadaan.

Dua anggaran menentukan seberapa baik hal itu bekerja, dan keduanya digunakan bersama. Setiap sekuens terbagi menjadi anggaran prompt opsi (head_max_len, 192 token pada checkpoint bahasa Inggris dan 256 pada dua lainnya) dan anggaran dokumen (berapa pun yang tersisa dari max_len). Setiap pertanyaan dalam satu panggilan dijawab dalam satu forward pass yang sama, jadi panggilan dengan enam pertanyaan bukan enam pemanggilan model. Namun opsi berbagi anggaran opsi, itulah sebabnya pertanyaan dengan 77 opsi seperti Banking77 mengalokasikan sekitar tiga hingga empat token per label dan akurasinya jatuh drastis — 0,425 dibandingkan 0,870 yang dipublikasikan Jev. Perbaikannya didokumentasikan, bukan disembunyikan: naikkan head_max_len dan max_len, atau bagi kumpulan opsi besar menjadi pilihan dua langkah kasar-ke-halus.

Ketiga primitif

Segala yang dilakukan Laya adalah salah satu dari tiga jenis pertanyaan, dan masing-masing mengembalikan bentuk yang berbeda:

pilihan — probabilitas per opsi bernama, ditambah label teratas dan keyakinan. Ini adalah primitif perutean dan klasifikasi maksud.

skor — distribusi atas rubrik terurut plus tingkat yang diharapkan. Ini adalah primitif ordinal: urgensi, frustrasi, tingkat keparahan.

noul — probabilitas terkalibrasi bahwa suatu pernyataan itu benar, dari 0,0 hingga 1,0. Phishing, risiko churn, injeksi prompt.

Tipe datanya ketat dengan cara yang penting secara operasional. Sebuah pertanyaan pilihan tidak dapat mengembalikan opsi yang tidak Anda sediakan, karena satu-satunya opsi yang dapat dinilainya adalah opsi yang Anda render. Itu menghilangkan satu kelas kegagalan produksi — nilai enum yang dikarang, JSON yang terpotong, loop percobaan ulang di sekitar parser. Itu tidak menghilangkan kesalahan semantik. Model yang mengembalikan billing: 0.94 untuk tiket yang seharusnya dialihkan ke dukungan teknis itu salah, dan salahnya dengan penuh keyakinan. Output bertipe menjamin bentuk jawabannya, tidak pernah kebenarannya.

RLCD, atau mengapa probabilitas seharusnya berarti sesuatu

Sebagian besar pengklasifikasi dilatih untuk benar. Laya dilatih untuk jujur tentang seberapa benar dirinya, dan resep pelatihan adalah asal dari semua itu.

Metode ini disebut RLCD — Reinforcement Learning for Calibrated Decisions. Kebijakannya mengeluarkan distribusi, bukan argmax; eksplorasi menambahkan derau Gaussian dengan rata-rata nol ke logit; dan imbalannya adalah aturan penilaian strictly proper — log plus spherical, dengan skor probabilitas berperingkat ditambahkan untuk pertanyaan ordinal. Kata "proper" itulah yang memegang peranan. Aturan penilaian strictly proper hanya dimaksimalkan secara ekspektasi dengan melaporkan keyakinan Anda yang sebenarnya, sehingga bersikap tidak tegas atau mengklaim berlebihan kehilangan imbalan karena konstruksinya, bukan karena instruksi. Pembaruannya adalah REINFORCE dengan baseline rata-rata grup, bergaya GRPO, dan percakapan multi-giliran menggunakan TD(λ=1.0) pada irisan prefiks.

Konsekuensi praktisnya adalah bahwa ambang batas keyakinan adalah hal yang bermakna untuk membangun logika aplikasi di atasnya — klaim yang tidak dapat Anda buat tentang softmax dari pengklasifikasi yang dilatih dengan entropi silang. Ini juga merupakan klaim dengan peringatan yang disampaikan secara terbuka oleh proyek: checkpoint yang dikirimkan terlalu percaya diri, dan Anda diharapkan untuk menyesuaikan ulang suhu pada data Anda sendiri sebelum mempercayai angka-angka tersebut. Menyesuaikan ulang satu suhu per jenis pertanyaan dan jumlah opsi memindahkan rata-rata ECE dari 0,466 menjadi 0,081 pada checkpoint bahasa Inggris dan 0,314 menjadi 0,106 pada checkpoint multibahasa. Ambang batas awal yang disarankan proyek untuk persetujuan otomatis versus tinjauan manusia adalah sekitar 0,85.

Berapa biaya untuk menjalankannya

Angka latensi ini milik proyek itu sendiri, diukur pada Tesla T4, dengan setiap checkpoint menjawab pertanyaan yang identik secara byte dalam eksekusi yang sama:

• Satu pertanyaan — 39,5 ms pada laya, 32,8 ms pada laya-multilingual.

• Lima pertanyaan — 84,5 ms dan 40,1 ms.

• Sepuluh pertanyaan dikelompokkan — 158,6 ms (15,9 ms per pertanyaan) dan 72,3 ms (7,2 ms per pertanyaan).

• Lima puluh pertanyaan — 771 ms dan 337 ms, atau 6,8 ms per pertanyaan pada checkpoint multibahasa.

• Throughput berkelompok pada satu T4 — 103 hingga 332 pertanyaan per detik.

Jika Anda pernah melihat klaim "50x lebih cepat daripada Jev" beredar, itu bukan angka proyek ini dan benchmark proyek ini sendiri tidak mendukungnya. Perbandingan yang diterbitkan Convai adalah 7,8x pada latensi p50 untuk satu pertanyaan: 32,8 ms dibandingkan 236–276 ms. Perbandingan itu juga yang perlu dibaca dengan saksama, karena kartu Laya memberi label pada sisi Jev sebagai angka terbitan pihak ketiga yang tidak pernah diukur Convai — ia tidak memiliki akses API TypeSafe — dan karena perbandingan itu mempertemukan forward pass GPU lokal dengan panggilan API yang dihosting yang mencakup round-trip jaringan dan antrean. Bagian arsitektural dari selisih itu nyata. Bagian infrastrukturnya bukan properti dari model.

Dari sisi memori, jejaknya beberapa ratus megabita per checkpoint, dan tabel deployment perlu diketahui sebelum Anda menentukan ukuran host. Default lazy menyimpan dua checkpoint tetap resident (Inggris dan multibahasa, satu-satunya dua yang dipilih router secara otomatis), jadi setelah pemuatan pertama tiap bahasa, pergantian hanya memerlukan deteksi. Router(max_loaded=1) pada mesin dengan memori terbatas akan memuat ulang setiap kali pergantian bahasa, terukur 7,4 detik median di CPU dan 10,3 detik di T4. Router(preload=True) adalah konfigurasi server: tidak ada yang dimuat ulang, dan latensi per permintaan adalah angka GPU 32,8 ms atau 193–464 ms di CPU.

Separuh yang jujur

Di sinilah perangkat ini membuktikan kegunaannya, karena permukaan di sekitar Laya mencolok dan keterbatasannya spesifik.

Pertama, angka utamanya adalah angka hasil fine-tuning. Akurasi 0,766 dimiliki oleh laya-typed-decisions, checkpoint yang di-fine-tune pada split pelatihan benchmark itu sendiri. Checkpoint dasar mendapat skor 0,362 dan 0,342 secara zero-shot terhadap baseline acak 0,318 dan baseline kelas mayoritas 0,461 — dengan kata lain, di bawah baseline trivial. Proyek ini menyatakannya dalam daftar keterbatasannya sendiri alih-alih menyembunyikannya, dan checkpoint hasil fine-tuning melampaui batas atas kesepakatan-diri guru sebesar 0,735, yang merupakan hasil yang benar-benar kuat untuk encoder 421M pada empat alur kerja sempit (pemrosesan faktur 0,804, insiden keamanan 0,766, layanan pelanggan 0,764, observabilitas jejak agen 0,730). Namun, ini adalah hasil tentang spesialisasi, bukan tentang model dasar, dan siapa pun yang mengutip 0,766 sebagai kemampuan umum salah membaca kartu tersebut.

Kedua, primitif-primitif tersebut tidak sama baiknya. Berdasarkan akurasi pada checkpoint yang telah di-fine-tune: noul 0.857, choice 0.733, score 0.723. Proyek tersebut menyebut ordinal score "primitif terlemah" secara terang-terangan, dengan SST-5 pada 0.372. Jika permukaan keputusan Anda adalah peringkat keparahan 1 sampai 5, itulah primitif yang paling tidak layak Anda percayai begitu saja.

Ketiga, dua perilaku didokumentasikan sebagai bug di pelacak masalah proyek itu sendiri, dan keduanya akan merugikan Anda di produksi jika Anda tidak membacanya. action.act_probability belum membawa sinyal yang dapat digunakan — issue #185 — karena output decision head tidak dinormalisasi pada sekitar 300x skala encoder, yang menjenuhkan act head sehingga membaca 1.0 untuk hampir setiap input. Logit mentahnya bertentangan dengan kebenaran, dengan AUROC 0,30 pada 396 keputusan berlabel. Gerbang pada confidence sebagai gantinya, yang mencapai AUROC 0,77 pada item yang sama. Secara terpisah, noul dapat mengikuti label opsinya sendiri alih-alih state — issue #156 — karena render_options meng-hardcode label noul menjadi false: / true:, dan pasangan label itu dapat mendominasi jawaban, mengembalikan "no" yang percaya diri untuk input yang jelas positif. Solusi yang didokumentasikan adalah mengajukan pertanyaan yang sama sebagai dua opsi pilihan dengan kunci netral dan kata-kata ya/tidak Anda sebagai deskripsinya.

Keempat, detail kalibrasi yang mudah terlewat dan layak dinyatakan secara tepat. Checkpoint ini menyertakan temperature hasil fit sebesar 0.1006 untuk bucket choice:11+, dan loader membatasi setiap temperature ke dalam rentang [0.5, 5.0]. Pembatasan itu justru menguntungkan Anda. Temperature yang setajam itu bisa mengambil distribusi yang benar-benar terbelah dan melaporkannya sebagai hampir pasti; pembatasan tersebut berarti kasus terburuknya adalah jawaban yang lebih lunak daripada yang dimaksudkan oleh hasil fit, dan loader memunculkan peringatan yang menyebut bucket yang terdampak serta memberi tahu Anda untuk menganggap keyakinan itu sebagai tidak terkalibrasi. Bacalah peringatan saat memuat, bukan menekannya.

Kelima, hanya bahasa Inggris di root repo, dan mode kegagalan di luar bahasa Inggris tidaklah mulus — karena itulah router, dan karena itulah rekomendasi untuk menggunakan laya-multilingual untuk apa pun yang bukan prosa bahasa Inggris.

Gambaran independen, jika memang ada, lebih sempit daripada gambaran vendor dan tidak bertentangan dengannya. Uji head-to-head independen — sysone-bench, 751 states di sembilan suite, bertanggal 2026-09-21, dijalankan pada input yang identik byte dengan hash pertanyaan yang diverifikasi identik sebelum perbandingan — menempatkan Jev unggul pada triage, guardrails, moderasi, banking77, dan multilingual intent, serta Laya unggul pada AG News (0.940 vs 0.910) dan MNLI (0.983 vs 0.867). Hasil confidence-gating-nya adalah yang benar-benar akan saya jadikan dasar perencanaan: gating pada keyakinan 0.85 mempertahankan 58% trafik Laya pada akurasi 0.878, dibandingkan 78% trafik Jev pada 0.917. Itulah bentuk pertukarannya — Laya mengotomatiskan lebih sedikit trafik pada akurasi yang lebih rendah pada porsi yang dipertahankannya, dan uji router-nya sendiri menaikkan multilingual intent dari 0.360 ke 0.840.

Permukaan di sekitarnya, yang luar biasa lebar

Untuk proyek yang bobotnya baru berumur beberapa hari, permukaan integrasinya adalah bagian yang mengejutkan. Semua ini ada di repositori hulu di NandhaKishorM/laya, yang mencatat 19.871 bintang di GitHub saat tulisan ini dibuat, dan seluruhnya berlisensi Apache 2.0:

laya-serve — server HTTP yang mengekspos Router pada bentuk permintaan dan respons POST /v1/systemone yang sama dengan API Jev yang dihosting TypeSafe, sehingga klien TypeSafe yang sudah ada dapat berpindah hanya dengan mengubah URL dasarnya. Perhatikan default keamanannya secara jujur: server ini mengikat 0.0.0.0 tanpa autentikasi kecuali LAYA_API_KEY diatur, yang dalam hal ini mengharuskan token bearer. Ada varian modul NixOS yang diperketat yang berjalan di bawah unit systemd DynamicUser dan meneruskan token melalui LoadCredential alih-alih menaruhnya di store.

• Port TypeScript lengkap di laya-ts/ untuk Node dan browser, plus jalur agen ONNX (laya.onnx_agent.ONNXAgent) untuk menjalankan model yang diekspor pada ONNX Runtime tanpa PyTorch saat runtime.

• Server MCP di balik fitur tambahan opsional, yang mengekspos laya_predict, laya_route, laya_preset dan laya_status sebagai alat.

• Integrasi LangChain dan LangGraph — LayaRouter untuk perutean tepi bersyarat dengan ambang batas keyakinan dan fallback, dan LayaGuardrail.

• Nix flake dengan nix run .#laya-serve dan sebuah modul services.laya-serve, empat file compose, jalur image Docker dengan quickstart yang terdokumentasi, dan notebook Kaggle yang menjalankan loop fine-tuning RLCD lengkap pada GPU 2xT4 gratis dalam empat hingga lima jam pada sekitar 30 ribu pertanyaan.

A screenshot of the Laya repository on GitHub, showing the repository description, the three-checkpoint table, the Route Mode quickstart, the 23-of-51 versus 45-of-51 language sweep, the Khmer 0.000 accuracy at 0.952 confidence, the self-hosting curl example with the note that the server binds 0.0.0.0 with no authentication unless LAYA_API_KEY is set, the architecture and RLCD training sections, the speed and Laya-versus-Jev benchmark tables, and the honest limits list.

Apache 2.0 adalah rincian lisensi yang menentukan apakah Anda dapat mengirimkan ini di dalam sebuah produk: lisensi ini mengizinkan penggunaan komersial, modifikasi, dan redistribusi, serta tidak mewajibkan Anda mempublikasikan perubahan Anda atau bobot hasil fine-tuning Anda. Kewajibannya adalah atribusi dan pelestarian pemberitahuan yang biasa, ditambah tidak adanya secara eksplisit pemberian paten atau merek dagang di luar apa yang dinyatakan oleh lisensi. Untuk lapisan keputusan yang berada di depan lalu lintas pelanggan, itu adalah proposisi yang berbeda secara material dari endpoint yang dihosting dengan akses awal yang bobot, arsitektur, dan resep pelatihannya semuanya tidak diungkapkan — yang merupakan kondisi Jev saat ini, pada $0.042 per juta token masukan dengan keluaran gratis dan antarmuka masukan yang hanya teks.

Di mana ini sebenarnya cocok: head keputusan di depan, LLM yang dirutekan di belakang

Pola yang layak diinternalisasi bukanlah "model keputusan sebagai pengganti LLM". Ini adalah pipeline dua tahap, dan kedua tahap itu ada karena tahap yang lain buruk dalam suatu hal.

Tempatkan Laya di depan untuk penilaian bervolume tinggi, sempit, dan dapat dicerna mesin: rutekan tiket, klasifikasikan maksud, beri skor urgensi, putuskan apakah dokumen ini relevan dengan kueri, periksa apakah draf ini melanggar kebijakan. Panggilan-panggilan itu memiliki himpunan jawaban tetap, terjadi ribuan kali per jam, dan forward pass lokal 33 milidetik dengan nol token keluaran lebih cocok untuknya daripada perjalanan bolak-balik generatif. Lalu tempatkan model generatif di belakangnya untuk panggilan yang benar-benar membutuhkan prosa, sintesis, atau penalaran atas konteks yang panjang — penyusunan draf, penjelasan, ringkasan eskalasi.

Di situlah OrcaRouter berada, dan penting untuk tepat soal batasnya. Kami tidak menyediakan Laya; itu encoder 421M yang Anda jalankan sendiri, dan intinya adalah ia berjalan di tempat data Anda sudah berada. Kami juga tidak menyediakan Jev — itu endpoint akses awal TypeSafe. Yang kami cakup adalah separuh generatif dari pipeline yang sama: 200+ model di balik satu kunci yang kompatibel dengan OpenAI, pada harga daftar penyedia yang diteruskan dengan markup 0%, dengan failover otomatis antar penyedia. Alasan praktis yang penting di sini adalah sambungan antara kedua bagian. Begitu Anda mulai mengarahkan keputusan ke model generatif untuk kasus-kasus yang ditolak oleh decision head, Anda punya integrasi kedua, tagihan kedua, dan mode kegagalan kedua. Satu kunci untuk sisi generasi, dengan failover jika penyedia mengalami degradasi, berarti jalur eskalasi lapisan keputusan menjadi perubahan konfigurasi alih-alih hubungan vendor kedua. Itu klaim kecil, dan itulah yang benar.

Siapa yang harus mengadopsinya, dan siapa yang harus menunggu

Adopsi Laya sekarang jika Anda memiliki data berlabel dan loop pelatihan, serta permukaan keputusan yang cukup stabil sehingga layak untuk dikhususkan. Notebook Kaggle ada justru agar langkah fine-tuning bukanlah proyek riset, checkpoint dasar dimuat dalam sekitar dua detik di CPU, dan lisensinya memungkinkan Anda merilis hasilnya secara komersial tanpa mempublikasikan bobot Anda. Beban kerja yang paling cocok adalah yang sudah di-benchmark oleh proyek ini: triase tiket, pemrosesan faktur, klasifikasi insiden keamanan, guardrails dan moderasi, serta observabilitas jejak agen. Jaga pertanyaan pilihan di bawah sekitar 20 opsi, kalibrasi temperatur pada data held-out Anda sendiri sebelum Anda menetapkan ambang batas di produksi, dan gunakan keyakinan sebagai gerbang, jangan pernah pada act_probability.

Tunggu jika keputusan Anda harus langsung tepat sejak awal tanpa data berlabel. Checkpoint dasar yang berada di bawah baseline kelas mayoritas pada benchmark yang digunakan dalam publikasinya bukanlah mesin zero-shot, dan pembacaan yang jujur atas angka vendor versus independen adalah bahwa API keputusan hosted yang dikelola dengan baik saat ini merupakan pilihan zero-shot yang lebih kuat. Tunggu juga jika set opsi Anda besar dan Anda tidak bersedia menyetel anggaran head, jika penskoran ordinal Anda perlu dapat dipercaya segera, atau jika Anda memerlukan masukan gambar, audio, atau dokumen panjang — Laya hanya untuk teks dan anggaran konteksnya secara default adalah 512 hingga 1.024 token, yang merupakan seleksi bukti, bukan dokumen utuh.

Yang akan menentukan kategori ini bukanlah angka latensi, yang sudah cukup baik untuk berhenti menjadi argumen. Yang menentukan adalah apakah sebuah model kecil yang melaporkan probabilitas secara jujur pada permukaan keputusan yang Anda tentukan, dan yang dapat Anda latih ulang dengan label Anda sendiri, mengalahkan memanggil model generatif besar dan mengurai outputnya. Laya adalah upaya serius pertama yang kredibel untuk versi bobot terbuka dari pertanyaan itu — dan usianya paling lama beberapa hari, yang merupakan cara yang tepat untuk membaca semua di atas. Model dasarnya adalah titik awal, bukan produknya.

A generated single-column scoreboard titled "Laya - the scoreboard" with six labelled rows reading Architecture: non-autoregressive encoder plus decision head; Parameters: 421M total; Output tokens: zero, one forward pass; Zero-shot accuracy: 0.362 versus 0.461 majority class; Fine-tuned accuracy: 0.766 on typed-decisions; Licence: Apache 2.0, weights published; with a footer reading "All figures vendor-reported by Convai Innovations on its own harnesses."