
Laya vs Decider: Encoder 421M Melawan Campuran 35B
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Laya dan Decider sama-sama model keputusan open-weight non-autoregresif yang menjawab pertanyaan bertipe — pilihan dari daftar yang disediakan, skor pada rubrik terurut, probabilitas ya/tidak — dalam satu forward pass, dan keduanya berada di ujung berlawanan spektrum ukuran. Convai Innovations merilis Laya pada 18 September 2026 di bawah Apache 2.0: encoder ModernBERT-large berukuran 421 juta parameter untuk bahasa Inggris dengan jendela 512 token, checkpoint multibahasa mmBERT-base berukuran 322 juta parameter dengan jendela 1.024 token yang mencakup 100+ bahasa, serta router yang mendeteksi sistem tulisan dan mengarahkannya ke model yang tepat. Keluarga Decider dari Mapika berkisar dari decider-0.8b dan decider-2b pada basis generatif kecil hingga decider-35b-a3b, sebuah mixture-of-experts 35 miliar parameter dengan sekitar 3 miliar parameter aktif. Keduanya gratis diunduh dan keduanya mengembalikan probabilitas, bukan teks. Alasan keduanya tidak dapat dipertukarkan bukanlah angka akurasi yang paling sering dijadikan pembuka dalam sebagian besar ulasan.
Dua keluarga, satu taruhan arsitektural

Taruhan bersama di sini adalah bahwa sebuah keputusan tidak memerlukan loop decoding. Model generatif yang ditanya "apakah tiket ini permintaan pengembalian dana?" harus mengeluarkan token, dan begitu ia mengeluarkan token, Anda bertanggung jawab atas parsing, validasi skema, dan jalur percobaan ulang untuk satu kali dari dua ratus saat ia lupa menutup kurung kurawal. Laya dan Decider keduanya melewati itu dengan membaca jawaban langsung dari satu forward pass — Laya dari encoder bidireksional, Decider dari logit token opsi berhuruf pada slot jawaban khusus di dalam prompt.
Di situlah kemiripannya berakhir. Laya adalah dua encoder kecil di belakang sebuah router bahasa, yang memberinya jendela bahasa Inggris 512 token dan jendela multibahasa 1.024 token pada jumlah parameter 421M dan 322M. Decider mempertahankan tulang punggung generatif dan menambahkan readout di atasnya: decider-2b adalah fine-tune terawasi dari Qwen3.5-2B-Base yang diikuti oleh pass penguatan yang sadar kalibrasi pada tugas browser langsung dan permainan eksak, sementara decider-35b-a3b membekukan para pakar yang dirutekan dan melatih matriks blok dengan Muon. Konsekuensi praktisnya adalah bahwa Decider mewarisi pengetahuan dunia model bahasa dan Laya tidak. Konsekuensi lainnya adalah bahwa Decider mewarisi jejak model bahasa.

Dokumentasi Mapika sendiri menempatkan decider-2b pada median 18ms per keputusan di B300 dalam bf16, batch satu, tanpa CUDA graphs atau kompilasi, dan decider-35b-a3b pada 41ms dengan penyiapan yang sama. Pada GH200 dengan konteks tiket dukungan sekitar 230 token dan tiga hingga lima pertanyaan bertipe, proyek yang sama melaporkan 49ms eager, 4.0ms dengan CUDA graphs dan torch.compile, serta sekitar 1.370 keputusan per detik pada batch 32. Angka-angka itu adalah angka yang diterbitkan vendor dari tulisan proyek itu sendiri, bukan pengukuran independen. Angka utama Laya juga diterbitkan vendor: 32,8ms p50 per keputusan pada Tesla T4, dan 7,2ms per pertanyaan pada ukuran batch 10.
Pertanyaan kalibrasi, yang dijawab oleh kedua proyek pada skala yang berbeda
Kalibrasi adalah angka yang paling penting bagi model keputusan, karena inti dari mengembalikan probabilitas adalah bahwa seseorang di hilir akan menetapkan ambang batas padanya. Di sinilah juga membandingkan Laya dan Decider secara langsung akan menyesatkan Anda.
Laya dirilis dengan kesalahan kalibrasi yang diharapkan sebesar 0,466 pada kartu modelnya sendiri, dan kartu tersebut menyatakan secara gamblang bahwa menyetel ulang suhu per jenis pertanyaan menggeser angka itu menjadi 0,081. Itu adalah pengungkapan yang luar biasa jujur, dan itu juga berarti checkpoint yang dikirimkan bukanlah artefak yang telah dikalibrasi. Angka yang Anda dapatkan dengan pengaturan bawaan adalah 0,466.
Decider melaporkan pada instrumen yang sama sekali berbeda. Decision Index — papan peringkat terbuka yang menjalankan setiap reproduksi terbuka Jev atas 132.422 permintaan — menempatkan decider-35b-a3b di peringkat keempat secara keseluruhan pada 54,3 di belakang 59,5 milik Jev, dan melaporkannya sebagai yang terkalibrasi terbaik dari 32 entri dengan galat kalibrasi 3,1 poin dan 0,4% jawaban salah pada keyakinan yang dinyatakan 95%+. decider-2b melaporkan 8,8 poin dan 0,9%. Itu adalah angka yang diterbitkan papan peringkat, dan 3,1 poin pada ECE sepuluh-bin milik Index bukan pengukuran yang sama dengan 0,466 milik Laya pada eval-nya sendiri. Menempatkan keduanya berdampingan dalam sebuah tabel akan menjadi kesalahan membandingkan apel dengan jeruk yang berdandan sebagai ketelitian. Yang dapat Anda katakan adalah bahwa penulis Decider memilih diukur pada papan peringkat pihak ketiga dan penulis Laya memilih menerbitkan sendiri angka kalibrasi terlemahnya; tidak satu pun telah diaudit oleh harness milik yang lain.
Di mana masing-masing unggul, dimensi demi dimensi
• Tulang punggung — Laya: encoder ModernBERT-large 421M, dua arah. Penentu: basis generatif Qwen3.5, 0,8B hingga 35B-A3B.
• Bahasa — Laya: 100+ melalui checkpoint multibahasa 322M di balik router. Decider: hanya bahasa Inggris, dinyatakan sebagai keterbatasan.
• Jendela konteks — Laya: 512 token bahasa Inggris, 1.024 multibahasa. Decider: menerima input hingga 32k, dilatih hingga 16k pada generasi v6, diuji hingga 30k.
• Batas atas kumpulan opsi — Laya: menurun tajam setelah sekitar 20 opsi, 0,425 pada Banking77 dibandingkan 0,870 milik Jev. Decider: Choice untuk 2 hingga 255 opsi bernama, Score untuk 2 hingga 10 tingkat yang dideskripsikan.
• Akurasi zero-shot — Laya: 0.362 pada tolok ukur typed-decisions, di bawah baseline kelas mayoritas 0.461. Decider: tidak dipublikasikan sebagai angka zero-shot; proyek tersebut melaporkan hasil spesifik tugas sebagai gantinya.
• Kalibrasi — Laya: ECE 0,466 saat dikirim, 0,081 setelah penyetelan ulang suhu per jenis pertanyaan. Decider: 3,1 poin pada Decision Index untuk 35B, terbaik dari 32 entri.
• Penalaran — Laya: tidak ada, berdasarkan konstruksi. Decider: tidak ada, dinyatakan secara eksplisit — ini adalah pembacaan pencocokan pola, bukan penalar.
• Lisensi — Apache 2.0 untuk keduanya.
Satu lagi detail Decider yang perlu diketahui sebelum Anda memilihnya: proyek tersebut memperingatkan bahwa memilih satu record dari array JSON yang panjang berdasarkan posisi adalah kasus yang lemah, dan merekomendasikan untuk mengakses record berdasarkan key. Itulah jenis keterbatasan yang hanya bisa Anda pelajari dengan menjalankannya.
Berapa biaya yang Anda keluarkan untuk menjalankan salah satunya
Profil biaya Laya adalah proyek fine-tuning. Model ini cukup kecil untuk dijalankan di CPU laptop untuk pekerjaan dengan throughput rendah, tetapi skor zero-shot dari checkpoint bahasa Inggris yang dikirimkan berada di bawah baseline trivial, yang berarti mengadopsi Laya berarti mengadopsi pekerjaan membangun set berlabel, fine-tuning, dan menyesuaikan ulang suhu per jenis pertanyaan. Imbalannya adalah setelah Anda melakukannya, artefaknya adalah 421 juta parameter dan menjawab dalam puluhan milidetik di T4. Hasil fine-tuning Convai sendiri: laya-typed-decisions checkpoint mencapai 0,766 pada split pelatihan benchmark — angka yang lebih banyak berbicara tentang fine-tuning daripada tentang model dasar, dan kartunya mengatakan demikian.
Profil biaya Decider adalah keputusan serving. Anda memilih berapa banyak GPU yang akan disewa, dan keluarga model ini memberi Anda penyesuaian yang nyata: 18 ms pada model 2B versus 41 ms pada 35B-A3B, dengan model yang lebih besar memberi ruang tambahan untuk pengetahuan dan penalaran pada GPQA, GSM8K, CRUXEval, dan MMLU yang tidak dimiliki model-model kecil. Jika tugas Anda sempit dan label Anda tetap, decider-2b adalah mesin yang lebih murah. Jika tugas Anda mengharuskan model mengetahui banyak hal, Anda membayar untuk campuran tersebut.
Di mana OrcaRouter cocok — dan di mana tidak
Baik Laya maupun Decider bukan model yang dihosting di OrcaRouter. Anda mengunduh bobotnya dan menjalankannya sendiri, dan tidak ada apa pun di sini yang mengubah itu. Yang berubah adalah separuh lainnya dari pola tersebut. Model keputusan bertipe hampir tidak pernah menjadi keseluruhan aplikasi: ada sesuatu yang harus membaca tiket, meringkas utas, atau menyusun draf balasan yang digerbangi oleh keputusan itu. Separuh itu adalah panggilan generatif, dan itulah separuh yang menjadi fokus OrcaRouter — 200+ model di balik satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga pemotongan harga vendor langsung terlihat pada tagihan Anda di hari yang sama, bukan pada perpanjangan kontrak berikutnya. Jika Anda melakukan fine-tuning checkpoint Laya terhadap keluaran model frontier, atau melakukan routing antara decider-2b untuk triase dan model besar untuk 4% kasus yang sulit, menjaga sisi generatif pada satu endpoint berarti sisi keputusan dan sisi generasi tidak memerlukan dua kontrak dan dua SDK. Failover otomatis mencakup kasus ketika model besar justru menjadi bagian yang tumbang.
Mana yang harus dipilih
Pilih Laya jika masukan Anda multibahasa, label Anda sedikit, anggaran latensi Anda adalah puluhan milidetik pada perangkat keras sederhana, dan Anda siap melakukan fine-tuning — karena Anda memang harus melakukannya. Pilih Decider jika masukan Anda berbahasa Inggris, Anda perlu model untuk membawa sebagian pengetahuan dunia ke dalam keputusan, dan Anda lebih suka memilih ukuran model daripada menjalankan pipeline pelatihan. Jika kumpulan opsi Anda melebihi dua puluh label, baca angka Banking77 milik Laya sebelum Anda memutuskan; jika masukan Anda adalah dokumen JSON panjang yang Anda akses berdasarkan posisi, baca keterbatasan yang dinyatakan Decider sebelum Anda memutuskan.
Perbandingan yang benar-benar dapat menyelesaikan ini — kedua model pada input yang identik secara byte, prompt yang sama, urutan opsi yang sama, penyapuan ambang yang sama — belum ada. Sampai hal itu ada, posisi yang jujur adalah bahwa Laya memiliki kurva biaya yang lebih baik dan Decider memiliki bukti kalibrasi yang lebih baik, dan bahwa keduanya masih cukup awal sehingga evaluasi yang Anda bangun pada data Anda sendiri akan lebih bernilai daripada angka yang dipublikasikan oleh kedua proyek tersebut.

