Kartu judul yang dihasilkan untuk Microsoft-Decision-1 vs Kev dengan subjudul 'pemberi skor yang dihosting versus resep yang bisa Anda latih ulang', dengan chip bertuliskan API hosted 9B vs basis beku plus adaptor LoRA rank-16 33.8M, tanpa tolok ukur yang dipublikasikan vs ECE 0.017 pada transfer-v4, tanpa bobot yang didistribusikan vs Apache-2.0, dan footer sumber yang mencatat bahwa kedua kumpulan angka tersebut dilaporkan sendiri.
Engineering & Research

Microsoft-Decision-1 vs Kev: Membeli Skor, atau Memiliki Resep yang Menghasilkan Skor Itu

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jared Palmer meletakkan bukti di samping modelnya. Keluarga Kev — Kev-0.8B, Kev-4B dan Kev-9B, yang dibangun di atas checkpoint dasar berbobot terbuka yang dibekukan dengan adaptor LoRA rank-16 dan sebuah kepala pointer kecil — dirilis pada 24 September 2026 dengan resep pelatihannya, jumlah data tahap demi tahap dan angka evaluasinya semuanya dipublikasikan, dan ringkasan jujur bagi siapa pun yang membandingkannya dengan Microsoft-Decision-1 adalah bahwa Kev memberi tahu Anda jauh lebih banyak tentang cara mereproduksi dirinya sendiri. Penilai Microsoft tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026: basis Qwen3.5-9B yang di-post-train oleh Microsoft, konteks 32.768 token, hanya teks, bobot tidak didistribusikan, metodologi evaluasi yang dipublikasikan dan tidak ada hasil yang dipublikasikan. Keduanya menerima sebuah state dan serangkaian pertanyaan bertipe dan mengembalikan distribusi terkalibrasi alih-alih teks hasil generasi. Yang satu adalah layanan, yang lain adalah metode yang dapat Anda jalankan di notebook malam ini.

Alasannya bahwa perbedaan itulah yang menentukan pertarungan ini alih-alih kemampuan: Kev-4B melaporkan ECE 0.017 pada uji terkunci di luar domainnya dan Microsoft-Decision-1 tidak melaporkan apa pun, sehingga argumen kalibrasi yang biasanya menyelesaikan perbandingan skorer versus skorer hanya memiliki satu pihak yang menyatakan posisinya.

Apa yang sebenarnya Kev terbitkan

Kartu Kev-4B luar biasa spesifik, dan kekhususan itulah intinya. Backbone-nya adalah Qwen3.5-4B-Base, dibekukan pada revisi bernama, dengan 24 lapisan linear-attention Gated DeltaNet dan 8 lapisan full-attention pada hidden size 2.560. Di atasnya terdapat adaptor LoRA rank-16 — 33,8 juta parameter yang dapat dilatih, diterapkan pada proyeksi attention, MLP, dan DeltaNet — dan pointer head yang memberi skor token penutup setiap opsi terhadap token akhir pertanyaan dan melakukan softmax. Satu temperature, T = 2,41, disimpan dalam file head dan diterapkan saat dimuat, dan kartu tersebut memberikan nilai yang di-fit dan hash file. Pelatihan berjalan dalam beberapa tahap dengan jumlah record yang dipublikasikan: resep dasar sebanyak 12.576 record, 1.425 untuk tanggal dan bukti yang hilang, 5.219 narasi keluhan CFPB asli, 6.000 record keterampilan dan 5.320 record perkakas pengembang, dengan tahap selanjutnya memutar ulang tahap sebelumnya. Kartu tersebut juga menyatakan apa yang tidak digunakan: "Tidak ada output dari Jev (model keputusan terhosting milik TypeSafe) yang digunakan."

Tabel benchmark dinyatakan di halaman yang sama, dan disertai kasus-kasus kegagalan, yang lebih jarang daripada keberhasilan. Transfer-v4 uji terkunci di luar domain: akurasi 0,838, Brier 0,224, ECE 0,017. Breadth-v1 pada 14 dataset held-out dan 3.089 pertanyaan: akurasi 0,690, ECE 0,029. Uji Hard-v1: 0,803. Uji Documents-v1: 0,903. MMLU-Pro dengan sepuluh opsi: 0,565. Aritmetika tanggal: 0,65, disebut oleh penulis sebagai area terlemah, dengan flag preprocessor ditawarkan sebagai perbaikan sebagian dan catatan eksplisit bahwa hal itu tidak diukur ulang. Bagian keterbatasan menambahkan bahwa kalibrasi adalah suhu in-distribusi tunggal sehingga cakupan menurun di luar domain, bahwa urutan opsi dapat membalik jawaban, dan bahwa panjang melebihi 8.192 token dilayani tetapi tidak divalidasi. Angka penyajian juga dipublikasikan: 18,1 ms untuk enam pertanyaan atas state pendek pada H100, 12,9 ms dengan cache, memori GPU residen 14,3 GB.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

Apa yang Microsoft terbitkan sebagai gantinya

Microsoft-Decision-1 mencakup sebagian besar hal yang sama dengan pendekatan yang berbeda. Ia menilai pertanyaan ya/tidak, pilihan ganda, rating, klasifikasi, dan rubrik, mendukung opsi abstensi eksplisit seperti "tidak dapat memastikan", mengembalikan probabilitas JSON, dan berjalan dalam satu pemanggilan untuk hingga 32K token — empat kali konteks yang divalidasi Kev. Ini didistribusikan sebagai API yang dihosting di Microsoft Foundry dalam portofolio Direct from Azure, dengan penerapan serverless dan endpoint terpadu, SKU standar, autentikasi Azure, serta jalur penagihan terpadu. Inferensi batch dinonaktifkan, dan tidak ada unduhan bobot maupun jalur fine-tuning.

Bagian evaluasi menjelaskan tolok ukur keputusan publik dan komunitas serta set internal yang disisihkan, metrik yang mencakup akurasi dan kesalahan kalibrasi, urutan opsi yang divariasikan, uji statistik berpasangan, dan klaim bahwa model tersebut "berkinerja setara dengan model keputusan terdepan dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama." Tidak ada tabel. Kartu model menyebutkan keterbatasannya sendiri secara jujur — skor berubah seiring pilihan kata dan urutan opsi, kalibrasi paling kuat pada jenis tugas yang familier, tidak ada penjelasan yang dihasilkan, dan cakupan non-Inggris paling lemah — tetapi daftar keterbatasan bukanlah pengukuran kalibrasi. Siapa pun yang menetapkan ambang penerimaan otomatis 0,9 pada Microsoft-Decision-1 menetapkannya berdasarkan keyakinan dan menyesuaikannya di produksi.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

Bagian dari perbandingan yang memakan biaya

Ekonomi Kev adalah alasan pertarungan ini benar-benar ketat. Resepnya adalah basis yang dibekukan plus adaptor 33,8M, yang berarti model marginal yang Anda latih membutuhkan komputasi seukuran adaptor, bukan komputasi seukuran model fondasi. Anda dapat menyimpan basis di memori sekali dan memuat beberapa adaptor — satu per domain keputusan — sebuah bentuk penerapan yang sama sekali tidak dapat diungkapkan oleh API terhosting Microsoft. Jika aturan perutean Anda berbeda dari penilai generik, Kev memungkinkan Anda melatih perbedaannya; Microsoft-Decision-1 memungkinkan Anda menulis prompt yang lebih baik dan berharap.

Sebaliknya, API yang dihosting tidak menimbulkan beban operasional apa pun. Tidak ada adapter yang perlu dilacak, tidak ada tumpukan penyajian yang perlu dijaga tetap hangat, tidak ada kesenjangan konteks antara yang divalidasi dan yang disajikan untuk dipertimbangkan, dan tidak ada risiko bahwa temperatur yang disesuaikan pada satu dataset berperilaku berbeda pada dataset Anda. Bagi tim yang volume keputusannya moderat, layanan ini adalah artefak yang lebih murah dalam hal jam rekayasa meskipun tokennya memakan biaya; bagi tim yang melakukan penskoran jutaan item sehari, adapter yang dihosting sendiri unggul dalam biaya per unit begitu GPU-nya sudah terbayar.

Ada jalur ketiga yang tidak menggunakan satu pun dari kedua model itu untuk bagian yang paling lemah, dan di situlah OrcaRouter berada. Kami tidak menghosting Microsoft-Decision-1 atau Kev — scorer yang mengembalikan probabilitas bukanlah target chat-completions dan tidak ada satu pun dari model tersebut yang ada dalam katalog kami. Separuh generatif dari pipeline keputusan adalah yang kami sediakan: model yang menyusun draf jawaban kandidat, menulis rubrik, atau mengeluarkan panggilan tool yang akan diberi skor. Semua itu berada di balik satu kunci yang kompatibel dengan OpenAI dengan lebih dari 200 model di dalamnya pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama. Jika Anda sedang membangun loop penilaian atau triase, panggilan penulisan dapat dirutekan dan panggilan pemberian skor tidak, dan menjaga batas itu tetap jelas adalah yang mencegah pipeline penilaian diam-diam menjadi pipeline chat.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

Cara memutuskan

Pilih Kev ketika Anda membutuhkan angka sebelum merilis, ketika Anda ingin melakukan fine-tuning pada label keputusan Anda sendiri, ketika Anda ingin menjalankan penilaian di dalam batas Anda sendiri dengan biaya marginal nol, atau ketika Anda ingin beberapa domain keputusan berbagi satu model dasar residen. Angka ECE yang diterbitkannya masih merupakan pengukuran penulis sendiri pada harness milik penulis sendiri — anggap itu sebagai penilaian diri yang kredibel, bukan hasil pihak ketiga yang diaudit — tetapi setidaknya itu adalah skala yang dinyatakan yang dapat Anda coba reproduksi, dan resepnya ada tepat di sana untuk mereproduksinya.

Pilih Microsoft-Decision-1ketika faktor penentunya adalah pengadaan atau panjang konteks: endpoint Azure terkelola dengan penagihan terpadu dan paket Responsible AI, input 32K untuk dokumen panjang, serta vendor tempat Anda dapat melakukan eskalasi. Tabel benchmark-nya yang tidak ada bukanlah skandal — banyak model hosted diluncurkan tanpa tabel itu — tetapi itu berarti kurva kalibrasi pertama untuk model ini akan digambar oleh para penggunanya, dan Anda harus berencana menjadi salah satunya, dengan data berlabel Anda sendiri, sebelum Anda menerapkan ambang batas produksi padanya.