
Microsoft-Decision-1 vs Laya: 25 Bahasa di Balik API, 100+ di Balik Unduhan 322MB
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Hitung jumlah bahasanya dan perbandingannya tampak sudah ditentukan. Microsoft-Decision-1, yang tersedia secara umum di Microsoft Foundry sejak 8 Oktober 2026, mencantumkan 25 bahasa yang didukung dan menyatakan dengan jelas bahwa cakupan, kualitas, dan kalibrasi "dapat bervariasi menurut bahasa," serta menyebut bahasa non-Inggris dan terutama bahasa dengan sumber daya lebih rendah sebagai area dengan kinerja di bawah standar. Laya, yang diterbitkan oleh Convai Innovations pada 18 September 2026 di bawah Apache 2.0, menggambarkan dirinya sebagai multibahasa di lebih dari 100 bahasa dan melaporkan bahwa 45 dari 51 bahasa yang diuji tetap dapat digunakan dengan routing, dibandingkan dengan 23 dari 51 untuk saudara kandungnya yang hanya berbahasa Inggris. Yang satu adalah model 9B di balik endpoint Azure dengan konteks 32.768 token; yang lain adalah pengklasifikasi 421 juta parameter yang berjalan pada 32,8 milidetik per keputusan di satu Tesla T4 secara gratis. Keduanya menolak menuliskan satu token pun dan keduanya mengembalikan probabilitas atas opsi yang Anda tentukan.
Tetapi bacalah kedua kartu model itu secara lengkap, dan jumlah bahasa tidak lagi menjadi angka yang menarik. Yang menarik adalah kisah kalibrasi di baliknya, dan kedua proyek menceritakan kisah itu ke arah yang berlawanan.
Laya menerbitkan angka yang membuat pemasarannya sendiri jadi canggung
Kartu model Laya menyatakan, di bagian batasannya sendiri, bahwa checkpoint dasar mencetak 0,362 zero-shot pada benchmark typed-decisions — di bawah baseline kelas mayoritas 0,461. Itu adalah kartu yang memberi tahu Anda bahwa modelnya lebih buruk daripada menebak "jawaban paling umum" pada tes tersebut. Kartu itu juga menyatakan bahwa checkpoint dasar nyaris setara tebakan secara zero-shot, bahwa angka typed-decisions utama 0,766 memerlukan fine-tuning pada split benchmark itu sendiri, bahwa pertanyaan skor ordinal adalah primitif terlemah (SST-5 0,372), bahwa pertanyaan pilihan berkardinalitas tinggi terdampak buruk karena 77 opsi hanya menyisakan sekitar tiga atau empat token masing-masing, bahwa noul dapat mengikuti labelnya sendiri, dan bahwa bidang action.act_probability tersebut "belum membawa sinyal yang dapat digunakan" pada AUROC 0,30. Kalimat ringkasan Convai sendiri adalah yang harus dibawa ke evaluasi apa pun: Laya adalah basis cepat untuk dispesialisasi, bukan mesin keputusan zero-shot.
Keterusterangan itu lebih berharga daripada kedengarannya, karena ia memberi tahu Anda dengan tepat untuk apa Laya digunakan. Ini adalah encoder yang Anda fine-tune pada label Anda sendiri — seluruh arsitekturnya dibangun agar skema baru tidak perlu pelatihan ulang, tetapi untuk tampil baik pada suatu tugas, pelatihan ulang diperlukan. Jika digunakan dengan cara itu, angka yang dipublikasikan kuat: 0,766 dibandingkan 0,727 milik Jev pada keputusan bertipe setelah fine-tuning, AG News 0,950 dibandingkan 0,910, DAIR Emotion 0,595 dibandingkan 0,480, dan ECE 0,081 dibandingkan 0,246 milik Jev — dengan catatan jujur bahwa ia dirilis dalam kondisi terlalu percaya diri dan memerlukan penyetelan ulang temperature, yang menggeser ECE rata-rata dari 0,466 ke 0,081.
Microsoft menerbitkan metodologi dan tidak mengungkapkan hasilnya
Halaman Foundry Microsoft-Decision-1 menjalankan latihan yang sama dalam arah sebaliknya. Dokumen ini menjelaskan evaluasinya secara terperinci — tolok ukur keputusan publik dan komunitas serta kumpulan internal yang disisihkan, metrik termasuk akurasi dan kesalahan kalibrasi, urutan opsi divariasikan, uji statistik berpasangan, harness identik untuk model yang dibandingkan — dan melaporkan bahwa model tersebut "berkinerja setara dengan model pengambilan keputusan terkemuka dan lebih unggul daripada model pengambilan keputusan terbuka lain yang dievaluasi dengan metodologi yang sama." Dokumen ini menyebutkan area kuatnya (penalaran, penerapan aturan, ketahanan terhadap pemformatan prompt) dan area lemahnya (pengetahuan domain khusus, non-Inggris).
Dan kemudian ia tidak mencetak apa pun. Tidak ada angka akurasi, tidak ada kesalahan kalibrasi, tidak ada tabel per tolok ukur. Keterbatasan yang dilaporkan sendiri itu nyata dan berguna — skor berubah seiring pilihan kata dan urutan opsi, pertanyaan yang dibingkai dengan buruk tetap mengembalikan skor, kalibrasi paling kuat pada jenis tugas yang familier, tidak ada penjelasan yang dihasilkan — tetapi daftar keterbatasan bukanlah sebuah pengukuran. Jadi pertukarannya luar biasa bersih: Laya memberi Anda angka yang dapat Anda coba dipalsukan pada data Anda sendiri, dan Microsoft memberi Anda postur kepatuhan serta konteks 32K tempat Anda dapat memasukkan dokumen panjang.

Apa yang sebenarnya didapat dari perbedaan ukuran
Kecilnya Laya di sini bukanlah kompromi, melainkan desainnya. Karena setiap opsi dinilai pada [MASK] token miliknya sendiri dan di-softmax atas opsi pertanyaan itu, ruang jawaban disusun saat permintaan alih-alih dipanggang ke dalam kepala kosakata — itulah sebabnya skema yang Anda ciptakan sore ini tidak perlu pelatihan ulang, dan mengapa modelnya muat dalam 322 hingga 421 juta parameter. Checkpoint multibahasa berjalan sekitar 2,2 kali lebih cepat daripada versi bahasa Inggris, router mendeteksi aksara dalam waktu kurang dari setengah milidetik, dan throughput batch mencapai 103 hingga 332 pertanyaan per detik pada satu T4. Untuk beban kerja yang menilai setiap tiket, setiap dokumen yang diambil, atau setiap tindakan yang diusulkan, throughput itulah fiturnya, bukan jumlah parameternya.
Biaya dari desain itu sama spesifiknya dan layak dikemukakan dibandingkan alternatif Microsoft. Checkpoint bahasa Inggris menggunakan jendela 512 token; yang multibahasa 1.024, dapat diperluas menuju 8K. Microsoft-Decision-1 menggunakan 32.768. Utas dukungan yang panjang, kontrak lengkap, atau dokumen kebijakan berhalaman banyak sama sekali tidak muat dalam jendela Laya, dan tidak ada kecepatan yang dapat mengimbangi pemotongan. Laya menjawab satu set pertanyaan per forward pass dengan anggaran token yang terdokumentasi per opsi; Microsoft mendokumentasikan satu invokasi atas hingga 32K token tanpa batas atas per pertanyaan. Dan titik lemah kompetitif Laya sebagai pengklasifikasi patut diketahui: skornya 0,425 pada Banking77 versus 0,870 milik Jev, yaitu jenis masalah intent berbutir halus dan berkardinalitas tinggi yang paling membutuhkan tahap spesialisasi.

Perbandingan biaya yang tidak dihitung per token
Laya gratis pada titik penggunaan — di-hosting sendiri, Apache 2.0, tercantum dengan biaya self-hosted "$0" — dan harga sebenarnya adalah proses fine-tuning yang harus Anda lakukan sebelum model itu mahir pada tugas Anda. Microsoft-Decision-1 adalah API Foundry terkelola dengan tarif per token yang tidak dicantumkan di halaman model, tidak ada bobot untuk diunduh, tidak ada jalur fine-tuning, dan inferensi batch dinonaktifkan. Yang satu adalah proyek pelabelan data di muka, yang lain adalah panggilan terukur. Mana yang lebih murah sepenuhnya bergantung pada volume, dan titik persilangannya tinggi: encoder 421M yang memproses 300 item per detik pada T4 sewaan sangat sulit dikalahkan per keputusan setelah dilatih.
Di sinilah OrcaRouter memperoleh tempatnya dalam pipeline yang dibangun di atas salah satu dari kedua model itu, dan hanya pada sisi generatif. Kami tidak menghosting Microsoft-Decision-1 maupun Laya: keduanya mengembalikan probabilitas, bukan teks, keduanya tidak ada dalam katalog kami, dan endpoint penilaian bukan target chat-completions. Yang kami sediakan adalah model yang menghasilkan hal yang dinilai — balasan draf, panggilan alat yang diusulkan, jawaban kandidat yang kemudian dinilai oleh head fine-tuned milik Laya. Itu berarti lebih dari 200 model di balik satu kunci yang kompatibel dengan OpenAI pada harga daftar penyedia yang diteruskan dengan markup 0%, dengan failover otomatis saat salah satu jalur penyajian menurun. Dalam loop yang menilai semua yang dihasilkannya, panggilan generasi adalah bagian yang bisa gagal, dan failover-lah yang menjaga antrean penilaian tetap terisi.

Mana yang harus dipilih
Pilih Laya jika keputusan Anda datang dalam banyak bahasa, jika volume Anda cukup tinggi sehingga penetapan harga per token menjadi penting, jika Anda memiliki label dan waktu seminggu untuk penyempurnaan, atau jika Anda perlu menjalankan penilaian pada perangkat keras di dalam batas Anda sendiri. Terimalah jendela 512-hingga-1.024 token dan fakta bahwa checkpoint dasar akan hampir setara tebakan acak sampai Anda mengkhususkan model itu, dan Anda mendapatkan model keputusan yang jujur sebagai titik awal.
Pilih Microsoft-Decision-1jika input Anda berupa dokumen panjang, bukan tiket, jika gerbang penerapan Anda adalah autentikasi Azure, penagihan terpadu, dan paket Responsible AI, bukan unduhan, jika 25 bahasa sudah mencakup trafik Anda, atau jika Anda lebih memilih untuk tidak memiliki model itu sama sekali. Terimalah bahwa Anda akan menggambar sendiri kurva kalibrasi pertamanya, dan alokasikan satu sore pada sampel berlabel untuk melakukannya — karena tidak seperti Laya, yang ini tidak akan memberi Anda angka ECE untuk diperdebatkan.
