
RSI-Jev vs Laya: Dua Model Keputusan Terbuka, Taruhan yang Bertolak Belakang
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.
Taruhan pertama adalah tentang skala. Checkpoint bahasa Inggris Laya adalah ModernBERT-large dengan 421M parameter dan konteks 512 token, dan checkpoint multibahasanya adalah mmBERT-base dengan 322M parameter dan jendela 1.024 token yang mencapai 8.192 saat encoder disetel lebar. RSI-Jev v6.1-VL menjalankan seluruh menara Qwen3.5-4B-Base — 4,69B parameter, 3,57B di antaranya berada di 32 lapisan decoder, ditambah menara visi dan tiga kepala keputusan pada lapisan 16, 20, dan 32. Laya adalah model yang dapat Anda pramuat tiga buah dalam beberapa gigabita; RSI-Jev adalah checkpoint bf16 9,7 GB. Taruhan kedua mengikuti yang pertama: Laya hampir tidak menghabiskan apa pun per panggilan dan mengharapkan Anda mengajari model itu domain Anda, sedangkan RSI-Jev menghabiskan empat setengah miliar parameter untuk mencoba menjawab pertanyaan Anda tanpa pelatihan sama sekali.
Apa sebenarnya kegunaan masing-masing
Kartu model milik Laya sendiri memuat kalimat yang membingkai perbandingan ini lebih baik daripada yang bisa dilakukan pengulas mana pun: "Laya adalah basis cepat untuk dispesialisasi, bukan mesin keputusan zero-shot." Pada tolok ukur typed-decisions — 2.000 keputusan di empat alur kerja — checkpoint dasar berbahasa Inggris mencetak skor 0,362, dibandingkan 0,318 untuk tebakan acak dan 0,461 untuk selalu memilih kelas mayoritas. Pada keputusan yang sama, checkpoint Convai yang di-fine-tune pada split pelatihan milik tolok ukur itu sendiri mencetak skor 0,766, melewati batas atas kesepakatan guru sebesar 0,735. Kesenjangan itulah produknya: Laya adalah encoder 421M yang Anda fine-tune pada taksonomi sempit, dan Convai menyertakan notebook Kaggle yang menjalankan seluruh siklus — membangun dataset, melatih, menyesuaikan suhu kalibrasi, mengevaluasi — di dua T4 gratis.
RSI-Jev adalah pilihan lainnya. Rilis v6.1-VL-nya mencetak 50,98 pada Decision Index 0.3 publiknya sendiri, sebuah uji coba 140.178 permintaan dengan konfigurasi default, yang pada papan proyek bertanggal 2026-10-06 menyamai model 4B terbaik di sana dan berada di peringkat ke-27 dari 113 secara keseluruhan. Suite lima belas tolok ukurnya adalah 0,793 dan himpunan held-out-nya adalah 0,729. Itu adalah angka zero-shot — meskipun proyek tersebut berhati-hati untuk mengatakan bahwa sepuluh dari lima belas tolok ukur menyumbang data pelatihan dalam beberapa bentuk, jadi "zero-shot" berlaku untuk pencarian rilis tersebut, bukan untuk setiap angka di halaman itu. Yang Anda dapatkan dari angka-angka itu adalah model yang menjawab pertanyaan tentang dokumen yang belum pernah Anda tunjukkan kepadanya dan tidak memerlukan proses pelatihan terlebih dahulu.
• Ukuran — Laya 421M Inggris / 322M multibahasa vs RSI-Jev 4,69B, menjalankan seluruh tower Qwen3.5-4B-Base.
• Akurasi zero-shot — Laya 0.362 pada typed-decisions, di bawah baseline mayoritas 0.461, sementara RSI-Jev 50.98 pada Decision Index 0.3 miliknya sendiri, menyamai entri 4B terbaik di sana.
• Akurasi hasil fine-tuning — Laya 0,766 dengan checkpoint yang dilatih pada split milik benchmark itu sendiri, sedangkan angka RSI-Jev bersifat tingkat rilis, bukan per domain.
• Bahasa — Laya 45 dari 51 bahasa yang dapat digunakan di atas tiga kali perutean sisi server acak vs teks berpusat bahasa Inggris RSI-Jev.
• Modalitas — Laya hanya teks vs teks RSI-Jev ditambah hingga empat gambar per permintaan.
• Konteks — Laya 512 token untuk bahasa Inggris, 1.024 untuk multibahasa, dan hingga 8.192 untuk dokumen panjang vs RSI-Jev 32.768 token, ditolak, bukan dipotong.
• Latensi — Laya 32,8 ms p50 pada T4, 7,2 ms per pertanyaan pada batch sepuluh vs RSI-Jev 22,5 ms pada tingkat upaya rendah dan sekitar 40 ms pada kedalaman penuh, di H200.
Tebing jumlah opsi adalah perbedaan yang paling tajam.
Kedua model mendefinisikan ruang jawaban pada waktu permintaan, sehingga skema baru tidak perlu pelatihan ulang — itulah keunggulan struktural bersama dari seluruh keluarga ini. Namun keduanya mengalokasikan ruang jawaban secara berbeda, dan perbedaannya muncul tepat pada tugas-tugas yang biasanya menjadi ranah perutean perusahaan. Laya memberi skor setiap opsi pada token termask masing-masing, dan opsi-opsi tersebut berbagi anggaran head tetap: 192 token pada checkpoint Inggris, 256 pada multibahasa. Pada Banking77, dengan 77 intent, itu berarti sekitar tiga atau empat token per label, dan akurasi turun menjadi 0,425. Kartu Convai sendiri mendokumentasikan penurunan tajam ini dan menawarkan solusinya — naikkan head_max_len menjadi 512 dan konteksnya menjadi 1.024 atau lebih agar setiap label punya ruang, atau bagi kumpulan opsi yang besar menjadi pilihan dua langkah dari kasar ke halus.
Jalur penyajian RSI-Jev menerima hingga 5.120 opsi per pertanyaan. Itu bukan tolok ukur setara terhadap 0,425 milik Laya — keduanya diukur pada harness yang berbeda, dan plafon opsi adalah batas konfigurasi, bukan skor. Ini adalah pernyataan tentang model mana yang tidak akan tumbang saat taksonomi Anda memiliki seratus entri. Jika pertanyaan pilihan Anda adalah "penagihan / teknis / penjualan / lainnya," keduanya bisa dipakai. Jika itu sekitar seratusan label intent, salah satu dari keduanya perlu penyetelan sebelum bisa digunakan dan yang lain tidak.

Latensi, pertanyaan bahasa, dan gambar-gambar
Klaim latensi Laya adalah yang paling lantang, dan itu nyata: 32,8 ms p50 untuk satu pertanyaan di Tesla T4, 72,3 ms untuk batch sepuluh, dan 337 ms untuk lima puluh — 103 hingga 332 pertanyaan per detik di satu GPU sederhana. Angka RSI-Jev sendiri, yang diukur pada H200, adalah 22,5 ms pada upaya rendah, 26,8 ms pada sedang, 39,9 ms secara default dan 40,4 ms pada kedalaman penuh. Itu berada dalam orde besaran yang sama, dan keduanya adalah forward pass lokal alih-alih panggilan jaringan, yang merupakan perbandingan yang benar-benar penting setelah endpoint yang dihosting tidak lagi menjadi pertimbangan. Perhatikan apa yang keduanya lakukan dengan waktu: RSI-Jev dapat dengan sengaja berhenti di lapisan 16 untuk mendapatkan 22,5 ms itu dan menjalankan seluruh 32 lapisan saat pertanyaannya sulit, sedangkan Laya tidak memiliki tombol pengatur semacam itu — ia selalu menjalankan seluruh encoder-nya (yang kecil).
Kisah bahasanya berjalan ke arah sebaliknya dan menentukan bagi siapa pun di luar bahasa Inggris. Laya menyertakan router yang mendeteksi aksara dalam waktu jauh di bawah satu milidetik dan mengarahkannya ke checkpoint multibahasa, dan tabel terbitannya menunjukkan 45 dari 51 bahasa dapat digunakan di atas tiga kali tingkat acak, dibandingkan 23 untuk checkpoint bahasa Inggris saja. Kartunya juga jujur tentang mengapa itu penting: checkpoint bahasa Inggris runtuh pada aksara non-Latin — Khmer mencetak akurasi 0,000 pada keyakinan 0,952 — sehingga penyaringan berdasarkan keyakinan tidak dapat menyelamatkan rute yang salah. RSI-Jev tidak memiliki kisah bahasa semacam ini; ini adalah model teks yang berpusat pada bahasa Inggris yang kebetulan dapat membaca gambar.
Untuk gambar, keadaannya justru terbalik. RSI-Jev menerima satu hingga empat per permintaan sebagai URL data base64 dan memperoleh skor 0,834 pada set gambar yang disisihkan dalam rilis ini; checkpoint yang dirilis Laya adalah pengklasifikasi teks, dan meskipun port komunitas seperti laya-vision ada di Hub, itu bukan produk vendor. Jika keputusan Anda menyangkut sebuah foto, bagan, atau tangkapan layar, itu adalah kolom milik satu model dan bukan milik model lainnya.
Keduanya belum pernah diuji banding satu sama lain.
Inilah bagian yang diam-diam disembunyikan oleh perbandingan spesifikasi demi spesifikasi: tidak ada adu langsung antara kedua model ini. Yang ada adalah adu langsung antara masing-masingnya dan model tertutup yang sama — Jev 1.13 milik TypeSafe — dan tak satu pun dapat disandingkan dengan yang lain.
Convai menerbitkan satu: pada typed-decisions, Jev 1.13.0 pada 0.727 versus routed Laya 0.766; pada Banking77, Jev 0.870 versus Laya 0.425; pada kalibrasi, Jev 0.246 versus 0.081 Laya setelah perbaikan suhu. Convai menyoroti keterbatasannya sendiri di tabel yang sama — angka Jev diterbitkan pihak ketiga, mereka tidak pernah punya akses API untuk mengukurnya, dan ukuran sampel serta promptnya berbeda. Perbandingan RSI-Jev adalah Decision Index, yang merupakan papan publik RSI-Jev sendiri dan sama sekali tidak memuat entri Jev. Jadi satu-satunya angka eksternal yang terkait dengan kedua model ini berasal dari harness yang dibuat oleh pihak yang menjualnya, dan pembacaan yang masuk akal atas angka mana pun di atas adalah "inilah yang diukur oleh pembuatnya, pada tugas pembuatnya."
Apa yang kedua proyek ini lakukan dengan baik, dan jarang, adalah mempublikasikan kelemahan mereka sendiri. RSI-Jev menyebutkan lima sumber gambar non-komersial di balik rilis visinya dan mengatakan terus terang bahwa apakah bobot yang dilatih pada sumber-sumber itu mewarisi ketentuan tersebut belum pasti; proyek ini melaporkan regresi kalibrasi dalam rilis terbarunya dan menyebut ambang batas keluar defaultnya belum terkonfirmasi. Laya mendokumentasikan bahwa checkpoint dasarnya berada di bawah baseline mayoritas, bahwa ordinal skor pertanyaan adalah primitif terlemahnya, bahwa noul-nya dapat mengikuti label opsinya sendiri alih-alih state, dan bahwa salah satu bidang responsnya tidak membawa sinyal yang dapat digunakan. Kejujuran itu adalah hal paling berguna untuk diwarisi dari salah satu proyek: periksa nilai keyakinan pada kasus berlabel Anda sendiri sebelum Anda mengotomatiskan berdasarkan nilai tersebut.

Di mana kontrak yang mereka salin sebenarnya berada
Kedua model ini ada karena satu format wire layak untuk disalin. Jev milik TypeSafe mendefinisikan bentuk permintaan — state, pertanyaan, tiga primitif bertipe — dan bentuk jawaban, dan baik Laya maupun RSI-Jev mengimplementasikannya sehingga klien yang sudah ada dapat berfungsi hanya dengan mengubah base URL. Model referensi itu, typesafe/jev-1.13, adalah satu dari tiga yang kami layani: model itu ada di katalog kami pada endpoint systemone khusus, sebuah POST ke /v1/systemone, non-streaming, terhadap konteks 65.536 token, dengan harga $0,042 per juta token masukan dan keluaran ditagih nol. Baik Laya maupun RSI-Jev tidak ada di katalog kami — keduanya adalah unduhan, dan itulah intinya.
Versi praktis dari hal itu lebih penting daripada perbandingannya. Lapisan keputusan hampir tidak pernah sendirian dalam satu stack; mereka berada di samping model generatif yang menulis balasan, ringkasan, atau kode. Memiliki kontrak referensi pada kunci yang sama dengan 200+ model lain, pada harga daftar penyedia yang diteruskan dengan markup 0%, berarti perubahan tarif vendor sampai kepada Anda pada hari yang sama, dan failover otomatis berarti separuh generatif dari pasangan itu bukan satu titik kegagalan saat Anda mencari tahu apakah separuh keputusan yang murah sudah cukup baik. Jika Anda memutuskan encoder 421M yang di-host sendiri atau checkpoint 4.69B adalah pilihan yang tepat, Anda tetap ingin kontrak yang digunakan olehnya dapat dijangkau dari tempat yang sama — dan jika Anda lebih memilih untuk tidak menjalankan keduanya, model yang disalin oleh keduanya hanya berjarak satu permintaan.
Yang mana yang harus diunduh
Pilih Laya jika Anda memiliki data berlabel, taksonomi yang tidak banyak berubah, dan campuran bahasa yang tidak hanya bahasa Inggris. Model ini cukup kecil untuk menjalankan banyak instansnya, cukup cepat untuk diletakkan di depan setiap permintaan, dan dirancang sejak awal untuk di-fine-tune — skor fine-tuned 0,766 versus 0,362 zero-shot adalah seluruh argumennya. Anggarkan untuk proses pelatihan, pelabelan, dan penyetelan ulang suhu per jenis pertanyaan yang menurunkan galat kalibrasinya dari 0,466 menjadi 0,081, serta jaga agar kumpulan opsi berada di bawah sekitar dua puluh label atau naikkan anggaran head sebelum Anda mempercayai klasifikasi besar.
Pilih RSI-Jev v6.1-VL jika Anda ingin sebuah keputusan berfungsi tanpa pelatihan apa pun terlebih dahulu, jika pertanyaan Anda kadang-kadang tentang gambar, jika kumpulan opsi Anda besar, atau jika Anda ingin menukar latensi dengan kedalaman per permintaan. Perkirakan akan menjalankan checkpoint 9,7 GB alih-alih yang 400M, perkirakan sebuah proyek yang telah menerbitkan delapan rilis dalam tiga belas hari dan mungkin menerbitkan satu lagi saat Anda mengevaluasi yang ini, dan perkirakan untuk memeriksa kalibrasinya sendiri — kartu rilis ini sendiri mengatakan bahwa hasilnya menjadi lebih buruk, bukan lebih baik.
Apa pun yang Anda pilih, dua hal yang sama tetap berlaku. Tidak ada model yang menghasilkan teks, jadi tidak ada yang bisa gagal karena mengeluarkan field yang cacat; keduanya mengembalikan probabilitas, dan probabilitas adalah bagian yang harus divalidasi per deployment alih-alih diambil dari kartu. Dan keduanya telah memindahkan pertanyaan menarik tentang lapisan keputusan dari "API siapa" ke "bobot siapa" — pertanyaan yang lebih baik untuk diajukan, dan yang dijawab pasangan ini dengan cara yang sangat berbeda.

