Kartu judul yang dihasilkan untuk Microsoft-Decision-1 dengan subjudul 'model penilaian keputusan yang mengembalikan probabilitas alih-alih kalimat', dengan lencana bertuliskan Microsoft Foundry, tersedia secara umum 8 Oktober 2026, dan chip bertuliskan model dasar 9B, konteks 32.768 token, bobot tidak didistribusikan, dan hanya teks tanpa generasi.
Guides & Insights

Microsoft-Decision-1: Model Microsoft yang Menjawab dengan Angka, Bukan Kalimat

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Microsoft-Decision-1 memiliki satu baris dalam kartu modelnya yang belum pernah dimiliki model Microsoft mana pun: tidak dirancang untuk generasi teks. Model ini tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026, dan ini adalah penyempitan yang disengaja atas tujuan sebuah model bahasa. Anda memberinya sebuah situasi dan pertanyaan dengan daftar jawaban tetap — ya/tidak, kumpulan pilihan ganda, skala penilaian, rubrik — dan model mengembalikan probabilitas terkalibrasi untuk setiap opsi. Tanpa prosa. Tanpa penjelasan. Tanpa bidang alasan. Outputnya adalah angka JSON dan tidak ada yang lain. Model ini dibangun di atas berbobot terbuka Qwen3.5-9B, dilatih lanjut oleh Microsoft, dan Microsoft mengatakan akan mengganti basis model ini ke backbone lain nanti, dengan menyebut MAI dan model mitra lainnya.

Produk itu lebih aneh daripada yang terdengar pada awalnya. Posisi kompetitif Microsoft pada 2026 bertumpu pada model chat terdepan dan pada Copilot, dan Microsoft-Decision-1 adalah kebalikan dari keduanya: penilai berukuran menengah dengan tujuan tunggal yang seluruh tugasnya adalah memberi tahu aplikasi mana dari opsi Anda sendiri yang paling mungkin benar, dan seberapa yakin ia. Pertanyaan yang menarik bukanlah apakah ia bagus dalam menulis — ia secara eksplisit buruk dalam hal itu dan tidak berusaha — melainkan apakah distribusi probabilitas atas opsi merupakan primitif yang lebih berguna untuk beban kerja yang benar-benar dijalankan perusahaan daripada model serbaguna lain dengan mode JSON.

Apa yang dilakukannya, secara tepat

Kontraknya adalah satu panggilan masuk, satu distribusi keluar. Microsoft mencantumkan format pertanyaan yang didukung sebagai ya/tidak, pilihan ganda, rating, klasifikasi, dan berbasis rubrik. Setiap opsi mendapat skor. Model berjalan dalam satu pemanggilan atas input hingga 32K token — 32.768 adalah jendela konteks yang dinyatakan — dan batas praktisnya adalah input ditambah kumpulan opsi, bukan anggaran generasi, karena tidak ada generasi.

Kasus penggunaan yang dipublikasikan adalah kasus yang akan langsung dikenali oleh tim platform:

• Evaluasi keluaran AI — nilai respons yang dihasilkan berdasarkan rubrik yang diberikan, atau tentukan apakah respons itu berpijak pada bukti yang diberikan kepadanya.

• Klasifikasi dan perutean — klasifikasikan permintaan, nilai relevansi, lakukan triase pada antrean, pilih cabang alur kerja.

• Pagar pengaman agen — beri skor pada panggilan alat atau tindakan agen yang diusulkan sebelum aplikasi yang mengintegrasikan mengizinkannya dieksekusi.

• Penyaringan keamanan konten — tandai konten terhadap ambang batas yang ditentukan aplikasi, bukan kebijakan vendor yang tetap.

• Relevansi pencarian dan dokumen — menilai apakah dokumen yang diambil menjawab pertanyaan yang diberikan.

• Otomatisasi berbasis keyakinan — terima otomatis hasil dengan keyakinan tinggi dan eskalasi sisanya ke manusia.

Opsi abstain adalah detail yang patut diperhatikan. Microsoft secara eksplisit mendukung opsi seperti "tidak dapat menentukan" ketika bukti yang diberikan tidak memadai, yang merupakan perbedaan antara pemberi skor yang terkalibrasi dan pemberi skor yang sekadar percaya diri. Dan karena skor kembali dalam bentuk angka, ambang eskalasi adalah keputusan yang ada di tangan Anda — Anda yang menentukan pada titik mana 0,7 mengirimkan sesuatu kepada manusia dan 0,95 tidak.

Apa yang tidak akan dilakukannya

Microsoft secara tidak biasa eksplisit tentang pengecualian, dan itu lebih penting daripada daftar fitur bagi siapa pun yang menilai ini untuk pipeline nyata. Microsoft-Decision-1 tidak dirancang untuk pembuatan teks, menjawab pertanyaan terbuka, percakapan, terjemahan, atau peringkasan. Ini tidak dimaksudkan untuk tugas tanpa pertanyaan tertutup dan serangkaian opsi jawaban yang ditentukan, atau untuk tugas yang memerlukan pengetahuan yang tidak ada dalam input. Ini hanya teks: tidak ada gambar, audio, atau video yang masuk, tidak ada yang keluar. Ini tidak memberikan penjelasan atau alasan.

Bacalah semuanya bersama-sama dan muncul sebuah batas yang mudah terlanggar. Ini bukan chatbot yang dapat Anda minta untuk sekaligus mengklasifikasikan berbagai hal, dan ini bukan peringkas yang bisa Anda tempelkan skor padanya. Ini adalah fungsi penilaian dengan anggaran token. Kerangka dari tim itu sendiri — bahwa ini tidak boleh menjadi satu-satunya pengambil keputusan otomatis dalam keputusan konsekuensial tentang orang, dan tidak boleh menjadi satu-satunya dasar untuk keputusan yang melibatkan kredit, pekerjaan, perumahan, asuransi, pendidikan, layanan kesehatan, hak hukum "atau domain yang sama konsekuensialnya" — mengarah ke arah yang sama. Ini dirancang untuk berada di samping sebuah keputusan, bukan menjadi keputusan itu sendiri.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

Situasi benchmark adalah cerita yang tidak ingin dicetak oleh siapa pun

Tidak ada angka. Halaman katalog Microsoft Foundry untuk Microsoft-Decision-1 memiliki tab Benchmarks, dan tab itu kosong dari angka. Yang ada di dalamnya sebagai gantinya adalah paragraf metodologi dan klaim kualitatif: model tersebut "dievaluasi pada tolok ukur keputusan publik dan komunitas serta pada set uji internal yang disisihkan yang tidak digunakan dalam pelatihan," Microsoft melaporkan bahwa model itu "berkinerja setara dengan model keputusan terdepan dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama," dan metrik yang digunakan adalah akurasi, kesalahan kalibrasi, recall keselamatan, tingkat positif palsu, dan konsistensi keadilan, dengan urutan opsi divariasikan dan uji statistik berpasangan diterapkan.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

Itu adalah deskripsi metodologi yang serius yang dilampirkan pada nol hasil yang dipublikasikan. Artinya, setiap klaim kinerja tentang Microsoft-Decision-1 saat ini dilaporkan oleh vendor dan belum direproduksi, dan posisi jujur bagi siapa pun yang mengevaluasinya adalah bahwa kalibrasi — satu-satunya properti yang membuat sebuah probabilitas berguna sama sekali — belum diverifikasi di luar Microsoft. Perusahaan memang menyebutkan di mana menurut mereka model ini paling kuat dan paling lemah, yang lebih berguna daripada skor utama: paling kuat dalam penalaran, penerapan aturan, dan ketahanan terhadap format prompt; kompetitif dalam klasifikasi, retrieval, keadilan, penggunaan alat, dan sebagian besar tugas multibahasa; lebih lemah dalam tugas pengetahuan domain khusus.

Batasan yang dilaporkan sendiri patut dibaca sebelum daftar fiturnya. Skor dapat bergeser bergantung pada susunan kata dan urutan opsi, dan pertanyaan yang dirumuskan dengan buruk tetap mengembalikan skor. Kalibrasi paling kuat pada jenis tugas yang familier. Model ini mungkin mengandalkan pengetahuan yang sudah usang, dan tidak memberikan penjelasan. Tentang cakupan multibahasa: 25 bahasa terdaftar sebagai didukung termasuk Jepang, Korea, Arab, Vietnam, Thailand, Turki, Hindi, Bengali, Swahili, Ibrani, Persia, dan Ukraina, tetapi Microsoft menyatakan bahwa cakupan, kualitas, dan kalibrasi "dapat bervariasi menurut bahasa," dan mencantumkan bahasa non-Inggris — terutama bahasa dengan sumber daya lebih rendah — sebagai area yang kurang berkinerja. Qwen3.5-9B yang mendasarinya mendukung lebih dari 200 bahasa; model pasca-pelatihan mendukung seperempat dari itu.

Bagaimana Anda mendapatkannya, dan berapa biayanya

Microsoft-Decision-1 didistribusikan sebagai API yang dihosting di Microsoft Foundry dalam portofolio "Direct from Azure". Bobot model tidak didistribusikan — ini bukan rilis open-weights, dan tidak ada repositori Hugging Face untuk mengunduhnya. Aplikasi apa pun yang dapat mengirimkan permintaan HTTPS dapat berintegrasi menggunakan endpoint Foundry dan autentikasi Azure standar. Daftar deployment menunjukkan opsi serverless dan endpoint terpadu dengan skema bayar sesuai penggunaan atau throughput terprovisi yang dipesan, SKU standar, dengan inferensi batch dinonaktifkan, dan pengungkapan pelatihan melaporkan bahwa set data pelatihan pertama kali digunakan pada September 2026 dengan pengumpulan yang masih berlangsung.

Harga tidak dipublikasikan di halaman model. Kolom harga katalog menautkan ke halaman harga model Microsoft alih-alih mencantumkan tarif input dan output, jadi biaya per token untuk panggilan Decision-1 harus Anda cari di halaman harga Azure atau baca dari tagihan. Ini adalah celah nyata bagi siapa pun yang mencoba memodelkan biaya per keputusan dalam volume besar, dan penting untuk dikatakan secara gamblang alih-alih diperkirakan. Dua hal perlu diketahui saat Anda menetapkan harganya: 0% dari biaya adalah token output, karena tidak ada token output, dan inferensi batch dinonaktifkan, jadi Anda tidak dapat mengamortisasi proses penilaian massal melalui kanal batch seperti yang akan Anda lakukan dengan model generatif.

Posisi OrcaRouter dalam hal ini adalah di sisi lain dari panggilan. Kami tidak menghosting Microsoft-Decision-1, dan model itu tidak ada dalam katalog kami — model yang mengembalikan probabilitas alih-alih teks bukanlah model yang Anda gunakan untuk merutekan chat completions. Yang kami bawa adalah separuh pola yang memang menghasilkan: model-model yang menulis rubrik, menyusun draf respons kandidat, atau menghasilkan tool call yang kemudian dinilai oleh Decision-1. Model-model itu berada di balik satu kunci yang kompatibel dengan OpenAI dengan lebih dari 200 model di dalamnya, pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga penurunan harga vendor pada model juri berlaku di sisi kami pada hari yang sama. Jika Anda membangun loop evaluasi di mana satu model menulis dan model lain menilai, panggilan penilaian ditujukan ke Microsoft dan panggilan generasi bisa ke mana saja — termasuk melalui DSL perutean, yang menggabungkan beberapa model menjadi satu panggilan saat Anda menginginkan panel alih-alih satu juri.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Mengapa pemberi skor adalah taruhan yang berbeda dari chatbot yang lebih baik

Pola yang dijual Microsoft di sini sudah ada di ranah terbuka. Intern-Decision-4B dari InternLM, d1-3B dari Liquid AI, Laya dari Convai Innovations, dan keluarga Kev dari Jared Palmer semuanya mengembalikan distribusi terkalibrasi atas opsi yang diberikan tanpa menghasilkan teks, dan sebagian besar merupakan bobot Apache-2.0 yang dapat Anda jalankan di perangkat keras Anda sendiri secara gratis. Entri Microsoft berbeda dalam tiga hal yang tidak bergantung pada benchmark: ini adalah API terkelola dengan autentikasi, penagihan, dan tata kelola Azure yang menyertainya, sehingga cocok dengan jalur pengadaan perusahaan yang tidak dipenuhi oleh unduhan Hugging Face; basisnya adalah model 9B, lebih besar daripada sebagian besar model di bidang tersebut; dan disertai dengan penilaian Responsible AI serta metodologi evaluasi yang terdokumentasi, yang sering kali menjadi persyaratan penentu sebenarnya untuk penerapan yang diatur.

Yang tidak disertakannya adalah sebuah angka. Dibandingkan pesaing terbuka yang menerbitkan skor Brier dan kesalahan kalibrasi yang diharapkan — dua angka yang memberi tahu Anda apakah 0,8 berarti 0,8 — Microsoft telah menerbitkan metodologi dan tanpa hasil. Sampai ada pengujian kalibrasi independen, cara yang dapat dipertahankan untuk menggunakan Microsoft-Decision-1 adalah cara yang direkomendasikan dokumentasinya sendiri: validasi pada data yang representatif untuk kasus penggunaan Anda, tetapkan ambang dari biaya kesalahan Anda, selalu sertakan opsi abstensi, acak urutan opsi jika urutan dapat membuat jawaban bias, dan pertahankan manusia dalam proses untuk segala hal yang berkonsekuensi. Itu saran yang baik untuk penilai mana pun. Terutama saran yang baik untuk penilai yang kalibrasinya belum pernah diukur oleh siapa pun di luar perusahaan.