
Laya vs Nimble: Data Kontrastif Versus Encoder yang Lebih Cepat
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Laya dan Nimble adalah dua model keputusan dengan bobot terbuka yang para penulisnya paling banyak menjelaskan bagaimana keduanya dibangun, dan penjelasan mereka tidak sepakat tentang di mana letak kesulitannya. Convai Innovations merilis Laya pada 18 September 2026 di bawah Apache 2.0 — sebuah checkpoint ModernBERT-large berbahasa Inggris berukuran 421M, checkpoint multibahasa mmBERT-base berukuran 322M yang mencakup 100+ bahasa, sebuah router sub-milidetik di antara keduanya, dan 32,8ms p50 per keputusan yang dipublikasikan pada Tesla T4. Bespoke Labs membangun Nimble sebagai fine-tune LoRA pada Qwen3.5-9B, Apache 2.0, dan mendeskripsikannya sebagai "the open-source Jev" — terinspirasi oleh Jev dari TypeSafe AI tetapi tidak menggunakan bobotnya, arsitekturnya, maupun hasil distilasi keluarannya. Jawaban Convai atas masalah akurasi adalah kecepatan dan basis yang dapat di-fine-tune. Jawaban Bespoke adalah data pelatihannya. Perbedaan itu lebih layak mendapat perhatian daripada selisih akurasi tiga poin yang muncul di tabel-tabel utama.
Klaim yang sebenarnya dibuat oleh setiap proyek
Klaim Laya bersifat arsitektural. Model ini non-autoregresif dalam arti ketat — encoder dua arah, tanpa loop dekode, tanpa JSON yang harus diurai, tanpa ruang untuk mengeluarkan teks di luar tipe yang dideklarasikan. Jaminan struktural itu sama dengan yang ditawarkan Jev, yang dicapai dari arah berbeda, dan benar-benar bernilai bagi siapa pun yang pernah menulis logika percobaan ulang untuk model yang kadang lupa menutup kurung kurawal. Biayanya adalah bahwa encoder 421M dengan jendela 512 token dan tanpa prapelatihan generatif di belakangnya tidak tahu banyak. Convai mengatakan demikian di kartu model: "Laya adalah basis cepat untuk dispesialisasi, bukan mesin keputusan zero-shot."


Klaim Nimble adalah tentang data. Metode Bespoke adalah kurasi kontrastif, yang diadaptasi dari pekerjaan Bespoke-MiniCheck tim sebelumnya: tulis dua contoh yang hampir identik yang berbeda dalam satu "fakta fokus," sehingga label yang benar berbalik. Pipa ini memiliki empat langkah yang dinyatakan — periksa bahwa aturan keputusan benar-benar dapat menghasilkan jawaban yang berbeda, bangun pasangan dengan mengubah paling banyak delapan kata, verifikasi kedua contoh dengan panggilan model terpisah plus pemeriksaan hapus-setiap-kalimat, dan hasilkan label dalam kode sambil hanya menyimpan pasangan yang labelnya benar-benar berbeda. Tujuannya bukan lebih banyak contoh melainkan contoh yang lebih tajam: paksa model untuk mempelajari bukti mana yang seharusnya mengubah keputusan. Itu adalah teori yang berbeda tentang mengapa model keputusan kecil gagal, dan itu lebih menarik daripada sekadar poin akurasi lain.
Apa yang sebenarnya didukung oleh angka-angka yang dipublikasikan
Nimble melaporkan kesesuaian 90,12% dengan label referensi pada 324 sampel yang disisihkan, dibandingkan dengan 93,21% untuk Jev, 66,36% untuk basis Qwen3.5-9B yang belum disetel, dan 84,88% untuk Qwen3.8 27B yang belum disetel. Ia melaporkan median sekitar 106 ms pada H100 dan 444 ms pada M5 Pro dengan 64GB. Itu adalah angka harness milik Bespoke sendiri. Kumpulan evaluasi 324 sampel adalah bagian yang perlu ditimbang dengan hati-hati, dan proyek itu sendiri menyebutkan alasannya: sampel-sampel tersebut mencakup enam dari sepuluh keluarga sumber pelatihan, sampel-sampel itu dihasilkan dan divalidasi oleh model tanpa tinjauan manusia, dan generalisasi ke kategori yang belum terlihat karena itu belum terbukti. Ketika sebuah model dilatih dengan metode kurasi data lalu dievaluasi pada pemisahan yang disisihkan dari distribusi terkurasi yang sama, angka akurasi adalah pernyataan tentang konsistensi internal metode tersebut, bukan tentang lalu lintas Anda.
Angka-angka Laya berasal dari ujung yang lain. Pada benchmark typed-decisions milik TypeSafe, ia mencetak 0.362 secara zero-shot — acak adalah 0.318, baseline kelas mayoritas adalah 0.461 — dan 0.766 saat di-fine-tune pada split pelatihan benchmark itu sendiri. Pada Banking77, 77 label, ia mencetak 0.425 melawan 0.870 milik Jev, yang merupakan ilustrasi paling tajam dari plafon banyak-opsi-nya. Pada AG News dengan empat label, ia mencetak 0.950 melawan 0.910 milik Jev; pada DAIR Emotion dengan enam label, 0.595 melawan 0.480. Kesalahan kalibrasinya dikirim pada 0.466 dan turun menjadi 0.081 setelah penyetelan ulang suhu per jenis pertanyaan. Satu uji pihak ketiga terhadap 100 pesan urgensi Mars-base mencatat Jev pada 100/100 dan Laya pada 53/100. Dan dalam evaluasi panggilan alat agen independen, Laya mencapai recall penolakan 100% pada panggilan berbahaya tetapi hanya dengan menandai semuanya, yang merupakan kegagalan presisi yang tampak seperti kemenangan keselamatan.
Letakkan kedua kumpulan angka itu berdampingan, dan bacaan yang jujur adalah bahwa keduanya diukur pada hal yang berbeda. Angka 90,12% Nimble adalah tingkat kesesuaian dengan label referensi yang dikurasinya sendiri. Angka 0,362 Laya adalah tolok ukur yang tidak ia bangun sendiri. Tidak satu pun angka itu bisa digeneralisasi.
Kalibrasi: satu-satunya tempat di mana kedua proyek sama-sama luar biasa terbuka.
Di sinilah kedua proyek paling dekat dalam semangat namun paling jauh berbeda dalam hasil.
README Bespoke secara eksplisit memperingatkan bahwa probabilitas Nimble adalah logit yang dinormalisasi softmax atas kandidat yang disediakan, bukan tingkat kebenaran yang terkalibrasi — nilai 0,9 tidak berarti 90% benar. Ia merekomendasikan menambahkan opsi "tidak satu pun di atas", karena jika jawaban yang benar tidak ada di antara kandidat, salah satunya tetap menang. Pada evaluasi yang lebih baru dengan 3.880 catatan yang mencakup 13 subset, Jev memiliki galat kalibrasi yang dilaporkan lebih rendah pada 11 dari 13 subset dan skor Brier yang lebih rendah pada 10 dari 13. Jadi kesesuaian label yang serupa tidak menyiratkan kualitas probabilitas yang serupa, dan Bespoke menyatakan hal itu.
Pengungkapan Convai adalah cerminan sebaliknya: galat kalibrasi yang diharapkan sebesar 0,466 ada di kartu, di samping 0,081 yang dihasilkan oleh penyetelan ulang suhu per jenis pertanyaan. Tidak ada proyek yang merilis model yang keyakinannya dapat Anda gunakan untuk bertindak tanpa kerja. Keduanya memberi tahu Anda hal itu secara tertulis. Jika Anda sedang membangun ambang keyakinan — rilis otomatis di atas 0,95, eskalasi di bawah 0,7 — dokumentasi dari kedua penulis memberi tahu Anda hal yang sama: latih ambang itu pada data berlabel Anda sendiri terlebih dahulu.
Perbandingannya, dimensi demi dimensi
• Backbone — Laya: encoder ModernBERT-large 421M, bidirectional, tanpa pra-pelatihan generatif. Nimble: Qwen3.5-9B dengan fine-tune LoRA, basis generatif dipertahankan.
• Bahasa — Laya: 100+ melalui checkpoint multibahasa 322M. Nimble: Inggris.
• Anggaran prompt — Laya: 512 token bahasa Inggris, 1.024 multibahasa. Nimble: maksimum 2.048 token per prompt, hanya skema datar, enum dibatasi hingga 26 opsi per bidang.
• Kecepatan — Laya: 32,8ms p50 pada T4, 7,2ms per pertanyaan bila di-batch 10 sekaligus. Nimble: sekitar 106ms median pada H100, 444ms pada M5 Pro 64GB.
• Perangkat keras — Laya: CPU, CUDA, dan Apple MPS; memori residen di bawah satu gigabyte pada port MLX. Nimble: GPU CUDA BF16 untuk angka yang disebutkan, dengan jalur MLX dan CUDA yang didukung.
• Akurasi yang dilaporkan — Laya: 0,362 zero-shot, 0,766 fine-tuned, 0,425 pada Banking77. Nimble: 90,12% pada 324 sampel held-out terkurasi dibandingkan dengan 93,21% milik Jev.
• Metode — Laya: arsitektur terlebih dahulu, penyempurnaan per penerapan. Nimble: kurasi data kontrastif, diterbitkan sebagai resep.
• Lisensi — Apache 2.0 untuk keduanya.
Dua batasan dalam daftar itu layak dibaca dua kali sebelum Anda memutuskan. Batas 26 opsi per enum milik Nimble dan plafon prompt 2.048 token adalah batas skema yang keras, bukan penurunan performa — jika taksonomi Anda memiliki empat puluh label atau prompt Anda membawa dokumen yang panjang, Nimble adalah alat yang salah terlepas dari akurasinya. Dan Nimble menilai setiap bidang secara independen, jadi aturan konsistensi antarbidang apa pun — "jika A benar maka B harus salah" — harus berada di dalam kode Anda, bukan di dalam model.
Mengapa resep data adalah artefak yang lebih portabel
Berikut argumen untuk Nimble yang luput dari tabel akurasi. Bespoke menerbitkan pipeline kurasi, bukan hanya bobotnya. Jika masalah keputusan Anda memiliki taksonomi tetap dan Anda dapat menuliskan aturannya, metode kontrastif adalah sesuatu yang dapat Anda jalankan pada data Anda sendiri dengan fakta fokus Anda sendiri, di atas model dasar apa pun yang Anda sukai. LoRA 9B adalah demonstrasi metode ini sekaligus produk.
Portabilitas Laya berbeda dan saling melengkapi. Karena ukurannya kecil, karena berjalan di CPU, dan karena port ONNX dan MLX tersedia, Laya adalah model yang dapat Anda tempatkan di dalam proses yang tidak memiliki GPU dan jaringan. Dalam tolok ukur agen peramban pihak ketiga, Laya menyelesaikan 0 dari 50 tugas dan menyatakan penyelesaian secara prematur dalam 33 percobaan — tetapi penulis tolok ukur mencatat bahwa model ini dilatih untuk pekerjaan penilaian seperti tiket dukungan, faktur, dan tinjauan jejak agen, bukan navigasi. Bacalah hasil itu sebagai pernyataan cakupan, bukan putusan, dan itu konsisten dengan kerangka kedua proyek: ini adalah komponen untuk kelas keputusan tertentu, bukan agen umum.
Baik Laya maupun Nimble bukanlah model yang dihosting di OrcaRouter. Keduanya adalah bobot yang Anda jalankan sendiri, dan tidak ada bagian dalam tulisan ini yang boleh ditafsirkan sebagai klaim bahwa kami melayani keduanya. Alasan produk routing muncul sama dengan alasan ia muncul dalam arsitektur decision-model mana pun: model keputusan menjawab satu panggilan, dan aplikasi di sekitarnya tetap membutuhkan prosa. Pipeline yang menggunakan Nimble untuk menilai apakah sebuah draf sudah patuh dan Laya untuk merutekan pengecualian tetap akan membutuhkan model generatif untuk menulis draf tersebut. Menjaga separuh generatif itu pada satu endpoint yang kompatibel dengan OpenAI — 200+ model, harga daftar penyedia diteruskan dengan markup 0% sehingga pemotongan harga vendor langsung berlaku pada hari yang sama, failover otomatis antar penyedia — berarti lapisan keputusan dapat diganti tanpa menyentuh kontrak lapisan generatif.
Putusan itu, dan eksperimen yang akan mengubahnya
Pilih Nimble jika taksonomi Anda tetap dan sempit, input Anda berbahasa Inggris dan pendek, Anda memiliki GPU, dan Anda menginginkan resep data sama seperti modelnya. Pilih Laya jika Anda memerlukan input multibahasa, anggaran di bawah 40ms, atau proses tanpa GPU sama sekali — dan perhitungkan fine-tuning sejak awal, karena checkpoint zero-shot berada di bawah baseline trivial dan kartu model menyatakannya.
Eksperimen yang akan menyelesaikannya adalah evaluasi berpasangan pada trafik nyata: input yang sama, kumpulan opsi yang sama, ambang batas keyakinan yang sama, dievaluasi terhadap label manusia, dengan diagram reliabilitas untuk masing-masing. Dokumentasi Nimble sendiri memperingatkan bahwa probabilitasnya bukanlah tingkat kebenaran dan kartu Laya melaporkan kesalahan kalibrasi sebesar 0,466 sebelum refitting, jadi diagram itulah artefak yang benar-benar akan memberi tahu Anda model mana yang harus ditempatkan di depan produksi. Tak satu pun dari proyek itu telah menerbitkannya, dan tak satu pun telah menerbitkan milik yang lain. Bangunlah itu pada data Anda sendiri sebelum Anda menetapkan ambang batas.

