Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Laya dengan subjudul 'cakupan bahasa versus panjang konteks', dengan chip bertuliskan 25 bahasa yang didukung vs 100+ bahasa, konteks 32.768 token vs jendela 1.024 token, hanya API yang dihosting vs bobot Apache-2.0, dan catatan kaki yang menyatakan bahwa angka kedua vendor dilaporkan sendiri.
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 Bahasa di Balik API, 100+ di Balik Unduhan 322MB

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hitung jumlah bahasanya dan perbandingannya tampak sudah ditentukan. Microsoft-Decision-1, yang tersedia secara umum di Microsoft Foundry sejak 8 Oktober 2026, mencantumkan 25 bahasa yang didukung dan menyatakan dengan jelas bahwa cakupan, kualitas, dan kalibrasi "dapat bervariasi menurut bahasa," serta menyebut bahasa non-Inggris dan terutama bahasa dengan sumber daya lebih rendah sebagai area dengan kinerja di bawah standar. Laya, yang diterbitkan oleh Convai Innovations pada 18 September 2026 di bawah Apache 2.0, menggambarkan dirinya sebagai multibahasa di lebih dari 100 bahasa dan melaporkan bahwa 45 dari 51 bahasa yang diuji tetap dapat digunakan dengan routing, dibandingkan dengan 23 dari 51 untuk saudara kandungnya yang hanya berbahasa Inggris. Yang satu adalah model 9B di balik endpoint Azure dengan konteks 32.768 token; yang lain adalah pengklasifikasi 421 juta parameter yang berjalan pada 32,8 milidetik per keputusan di satu Tesla T4 secara gratis. Keduanya menolak menuliskan satu token pun dan keduanya mengembalikan probabilitas atas opsi yang Anda tentukan.

Tetapi bacalah kedua kartu model itu secara lengkap, dan jumlah bahasa tidak lagi menjadi angka yang menarik. Yang menarik adalah kisah kalibrasi di baliknya, dan kedua proyek menceritakan kisah itu ke arah yang berlawanan.

Laya menerbitkan angka yang membuat pemasarannya sendiri jadi canggung

Kartu model Laya menyatakan, di bagian batasannya sendiri, bahwa checkpoint dasar mencetak 0,362 zero-shot pada benchmark typed-decisions — di bawah baseline kelas mayoritas 0,461. Itu adalah kartu yang memberi tahu Anda bahwa modelnya lebih buruk daripada menebak "jawaban paling umum" pada tes tersebut. Kartu itu juga menyatakan bahwa checkpoint dasar nyaris setara tebakan secara zero-shot, bahwa angka typed-decisions utama 0,766 memerlukan fine-tuning pada split benchmark itu sendiri, bahwa pertanyaan skor ordinal adalah primitif terlemah (SST-5 0,372), bahwa pertanyaan pilihan berkardinalitas tinggi terdampak buruk karena 77 opsi hanya menyisakan sekitar tiga atau empat token masing-masing, bahwa noul dapat mengikuti labelnya sendiri, dan bahwa bidang action.act_probability tersebut "belum membawa sinyal yang dapat digunakan" pada AUROC 0,30. Kalimat ringkasan Convai sendiri adalah yang harus dibawa ke evaluasi apa pun: Laya adalah basis cepat untuk dispesialisasi, bukan mesin keputusan zero-shot.

Keterusterangan itu lebih berharga daripada kedengarannya, karena ia memberi tahu Anda dengan tepat untuk apa Laya digunakan. Ini adalah encoder yang Anda fine-tune pada label Anda sendiri — seluruh arsitekturnya dibangun agar skema baru tidak perlu pelatihan ulang, tetapi untuk tampil baik pada suatu tugas, pelatihan ulang diperlukan. Jika digunakan dengan cara itu, angka yang dipublikasikan kuat: 0,766 dibandingkan 0,727 milik Jev pada keputusan bertipe setelah fine-tuning, AG News 0,950 dibandingkan 0,910, DAIR Emotion 0,595 dibandingkan 0,480, dan ECE 0,081 dibandingkan 0,246 milik Jev — dengan catatan jujur bahwa ia dirilis dalam kondisi terlalu percaya diri dan memerlukan penyetelan ulang temperature, yang menggeser ECE rata-rata dari 0,466 ke 0,081.

Microsoft menerbitkan metodologi dan tidak mengungkapkan hasilnya

Halaman Foundry Microsoft-Decision-1 menjalankan latihan yang sama dalam arah sebaliknya. Dokumen ini menjelaskan evaluasinya secara terperinci — tolok ukur keputusan publik dan komunitas serta kumpulan internal yang disisihkan, metrik termasuk akurasi dan kesalahan kalibrasi, urutan opsi divariasikan, uji statistik berpasangan, harness identik untuk model yang dibandingkan — dan melaporkan bahwa model tersebut "berkinerja setara dengan model pengambilan keputusan terkemuka dan lebih unggul daripada model pengambilan keputusan terbuka lain yang dievaluasi dengan metodologi yang sama." Dokumen ini menyebutkan area kuatnya (penalaran, penerapan aturan, ketahanan terhadap pemformatan prompt) dan area lemahnya (pengetahuan domain khusus, non-Inggris).

Dan kemudian ia tidak mencetak apa pun. Tidak ada angka akurasi, tidak ada kesalahan kalibrasi, tidak ada tabel per tolok ukur. Keterbatasan yang dilaporkan sendiri itu nyata dan berguna — skor berubah seiring pilihan kata dan urutan opsi, pertanyaan yang dibingkai dengan buruk tetap mengembalikan skor, kalibrasi paling kuat pada jenis tugas yang familier, tidak ada penjelasan yang dihasilkan — tetapi daftar keterbatasan bukanlah sebuah pengukuran. Jadi pertukarannya luar biasa bersih: Laya memberi Anda angka yang dapat Anda coba dipalsukan pada data Anda sendiri, dan Microsoft memberi Anda postur kepatuhan serta konteks 32K tempat Anda dapat memasukkan dokumen panjang.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

Apa yang sebenarnya didapat dari perbedaan ukuran

Kecilnya Laya di sini bukanlah kompromi, melainkan desainnya. Karena setiap opsi dinilai pada [MASK] token miliknya sendiri dan di-softmax atas opsi pertanyaan itu, ruang jawaban disusun saat permintaan alih-alih dipanggang ke dalam kepala kosakata — itulah sebabnya skema yang Anda ciptakan sore ini tidak perlu pelatihan ulang, dan mengapa modelnya muat dalam 322 hingga 421 juta parameter. Checkpoint multibahasa berjalan sekitar 2,2 kali lebih cepat daripada versi bahasa Inggris, router mendeteksi aksara dalam waktu kurang dari setengah milidetik, dan throughput batch mencapai 103 hingga 332 pertanyaan per detik pada satu T4. Untuk beban kerja yang menilai setiap tiket, setiap dokumen yang diambil, atau setiap tindakan yang diusulkan, throughput itulah fiturnya, bukan jumlah parameternya.

Biaya dari desain itu sama spesifiknya dan layak dikemukakan dibandingkan alternatif Microsoft. Checkpoint bahasa Inggris menggunakan jendela 512 token; yang multibahasa 1.024, dapat diperluas menuju 8K. Microsoft-Decision-1 menggunakan 32.768. Utas dukungan yang panjang, kontrak lengkap, atau dokumen kebijakan berhalaman banyak sama sekali tidak muat dalam jendela Laya, dan tidak ada kecepatan yang dapat mengimbangi pemotongan. Laya menjawab satu set pertanyaan per forward pass dengan anggaran token yang terdokumentasi per opsi; Microsoft mendokumentasikan satu invokasi atas hingga 32K token tanpa batas atas per pertanyaan. Dan titik lemah kompetitif Laya sebagai pengklasifikasi patut diketahui: skornya 0,425 pada Banking77 versus 0,870 milik Jev, yaitu jenis masalah intent berbutir halus dan berkardinalitas tinggi yang paling membutuhkan tahap spesialisasi.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

Perbandingan biaya yang tidak dihitung per token

Laya gratis pada titik penggunaan — di-hosting sendiri, Apache 2.0, tercantum dengan biaya self-hosted "$0" — dan harga sebenarnya adalah proses fine-tuning yang harus Anda lakukan sebelum model itu mahir pada tugas Anda. Microsoft-Decision-1 adalah API Foundry terkelola dengan tarif per token yang tidak dicantumkan di halaman model, tidak ada bobot untuk diunduh, tidak ada jalur fine-tuning, dan inferensi batch dinonaktifkan. Yang satu adalah proyek pelabelan data di muka, yang lain adalah panggilan terukur. Mana yang lebih murah sepenuhnya bergantung pada volume, dan titik persilangannya tinggi: encoder 421M yang memproses 300 item per detik pada T4 sewaan sangat sulit dikalahkan per keputusan setelah dilatih.

Di sinilah OrcaRouter memperoleh tempatnya dalam pipeline yang dibangun di atas salah satu dari kedua model itu, dan hanya pada sisi generatif. Kami tidak menghosting Microsoft-Decision-1 maupun Laya: keduanya mengembalikan probabilitas, bukan teks, keduanya tidak ada dalam katalog kami, dan endpoint penilaian bukan target chat-completions. Yang kami sediakan adalah model yang menghasilkan hal yang dinilai — balasan draf, panggilan alat yang diusulkan, jawaban kandidat yang kemudian dinilai oleh head fine-tuned milik Laya. Itu berarti lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia yang diteruskan dengan markup 0%, dengan failover otomatis saat salah satu jalur penyajian menurun. Dalam loop yang menilai semua yang dihasilkannya, panggilan generasi adalah bagian yang bisa gagal, dan failover-lah yang menjaga antrean penilaian tetap terisi.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Mana yang harus dipilih

Pilih Laya jika keputusan Anda datang dalam banyak bahasa, jika volume Anda cukup tinggi sehingga penetapan harga per token menjadi penting, jika Anda memiliki label dan waktu seminggu untuk penyempurnaan, atau jika Anda perlu menjalankan penilaian pada perangkat keras di dalam batas Anda sendiri. Terimalah jendela 512-hingga-1.024 token dan fakta bahwa checkpoint dasar akan hampir setara tebakan acak sampai Anda mengkhususkan model itu, dan Anda mendapatkan model keputusan yang jujur sebagai titik awal.

Pilih Microsoft-Decision-1jika input Anda berupa dokumen panjang, bukan tiket, jika gerbang penerapan Anda adalah autentikasi Azure, penagihan terpadu, dan paket Responsible AI, bukan unduhan, jika 25 bahasa sudah mencakup trafik Anda, atau jika Anda lebih memilih untuk tidak memiliki model itu sama sekali. Terimalah bahwa Anda akan menggambar sendiri kurva kalibrasi pertamanya, dan alokasikan satu sore pada sampel berlabel untuk melakukannya — karena tidak seperti Laya, yang ini tidak akan memberi Anda angka ECE untuk diperdebatkan.