
Microsoft-Decision-1 Sudah Live di Foundry. Tab Benchmarks-nya Kosong.
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 55 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Hal yang paling menarik tentang rilis Microsoft minggu ini bukanlah apa yang Microsoft-Decision-1 dapat lakukan. Justru apa yang Microsoft pilih untuk tidak diterbitkan tentangnya. Model ini sudah aktif: model ini tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026, dua hari sebelum ini ditulis. Ini adalah model penilaian keputusan — Anda memberinya suatu keadaan dan pertanyaan dengan serangkaian jawaban tetap, dan model ini mengembalikan probabilitas terkalibrasi per jawaban — dilatih lanjut oleh Microsoft pada model berbobot terbuka Qwen3.5-9B, menjalankan satu lintasan atas hingga 32.768 token dan mengeluarkan nol token keluaran karena model ini tidak pernah menghasilkan apa pun sama sekali. Halaman katalog memiliki tab Benchmarks. Tab itu berisi paragraf metodologi dan tidak memuat angka apa pun.
Celah itulah inti ceritanya, dan ini lebih berguna daripada berita lain bertema "Microsoft merilis sebuah model". Setiap pertanyaan serius tentang pemberi skor adalah pertanyaan kalibrasi — apakah nilai 0.8 yang dikembalikan berarti 0.8 — dan peluncuran yang hadir tanpa satu pun skor Brier atau angka galat kalibrasi yang diharapkan membiarkan satu angka yang penting untuk diukur oleh siapa pun yang mengadopsinya. Berikut ini adalah apa yang sebenarnya didokumentasikan halaman Foundry, apa yang dengan mencolok dihilangkannya, dan apa yang dapat dilakukan tim evaluasi tentang hal itu minggu ini.
Apa yang dirilis, tepatnya
Microsoft-Decision-1 adalah API yang dihosting. Kontraknya adalah satu panggilan masuk, satu distribusi keluar, tanpa loop decoding di mana pun dalam alurnya: permintaan membawa materi yang akan dinilai plus pertanyaan dengan kumpulan jawaban yang terbatas, dan respons membawa probabilitas untuk setiap opsi. Microsoft mencantumkan bentuk pertanyaan yang didukung sebagai ya/tidak, pilihan ganda, penilaian, klasifikasi, dan berbasis rubrik, semuanya dalam satu invokasi hingga 32K token. Ini hanya teks — tidak ada masukan gambar, audio, atau video, dan keluarannya tidak lain hanya angka.
Pengecualiannya dinyatakan sejelas fiturnya, dan semuanya layak dibaca sebelum hal lain: tidak dirancang untuk pembuatan teks, penjawaban pertanyaan terbuka, percakapan, penerjemahan, atau peringkasan, dan tidak dimaksudkan untuk tugas yang memerlukan pengetahuan yang tidak ada dalam input. Model ini tidak menghasilkan rasional. Kasus penggunaan yang dipublikasikan semuanya adalah situasi ketika tim platform sudah memiliki keputusan berlabel yang harus dibuat — menilai jawaban yang dihasilkan terhadap rubrik, menilai relevansi pengambilan, menriase antrean, menggerbangi usulan pemanggilan alat agen, menyaring konten terhadap ambang batas yang ditentukan aplikasi alih-alih kebijakan vendor yang tetap, dan menerima secara otomatis hasil dengan keyakinan tinggi sambil mengeskalasi sisanya.
Dua detail operasional menonjol dari daftar deployment. Yang pertama adalah bahwa Microsoft secara eksplisit mendukung opsi abstensi seperti "tidak dapat memastikan" ketika bukti yang diberikan tidak memadai — itulah perbedaan antara scorer yang terkalibrasi dan yang sekadar yakin, dan itulah yang membuat thresholding berfungsi. Yang kedua adalah inferensi batch dinonaktifkan. Anda tidak dapat mengamortisasi proses scoring besar melalui kanal batch seperti yang akan Anda lakukan dengan model generatif, sehingga latensi per panggilan adalah latensi pipeline Anda, bukan masalah tugas offline.
Distribusi hanya melalui Foundry, dalam portofolio "Direct from Azure" sebagai deployment serverless atau endpoint terpadu pada SKU standar — bayar sesuai pemakaian atau throughput terprovisi yang direservasi. Bobot tidak didistribusikan. Tidak ada repositori Hugging Face, tidak ada unduhan, tidak ada jalur fine-tuning, dan tidak ada opsi self-hosting. Aplikasi terintegrasi melalui HTTPS dengan autentikasi Azure standar. Pengungkapan pelatihan melaporkan bahwa dataset pertama kali digunakan pada September 2026 dengan pengumpulan yang masih berlangsung, yang merupakan jarak terpendek yang mungkin antara data pelatihan dan tanggal GA dan normal untuk pasca-pelatihan pada basis yang telah dirilis pihak lain.
Tab tolok ukur, dikutip secara lengkap
Berikut adalah keseluruhan yang telah Microsoft publikasikan tentang seberapa baik performa model tersebut. Evaluasi menggunakan "tolok ukur keputusan publik dan komunitas serta set pengujian internal yang disisihkan yang tidak digunakan dalam pelatihan." Metriknya adalah akurasi, kesalahan kalibrasi, recall keamanan, tingkat positif palsu, dan konsistensi keadilan. Urutan opsi divariasikan. Uji statistik berpasangan diterapkan. Klaimnya bersifat kualitatif: Microsoft-Decision-1 "berkinerja setara dengan model keputusan terkemuka dan lebih unggul daripada model keputusan terbuka lain yang dievaluasi dengan metodologi yang sama."

Itu adalah desain evaluasi yang kompeten yang dijelaskan tanpa hasil. Bukanlah sebuah tuduhan untuk menunjukkan hal itu — paragraf metodologi tanpa tabel adalah pilihan yang spesifik dan dapat diperiksa, dan itu adalah pilihan yang berbeda dari yang telah dibuat oleh bagian lain kategori kecil ini. Model-model keputusan terbuka yang secara implisit dibandingkan oleh Microsoft menerbitkan angka-angka mereka: keluarga Intern-Decision milik InternLM mencantumkan angka Brier dan expected-calibration-error pada kartu modelnya, Jev milik TypeSafe menerbitkan keduanya, dan lini d1 milik Liquid AI menyertakan tabel akurasi bersama bobotnya. Microsoft adalah perusahaan terbesar di grup ini dan satu-satunya yang meminta untuk dipercaya begitu saja.
Perusahaan memang menyebutkan di mana menurut keyakinannya model ini kuat dan lemah, yang lebih dapat ditindaklanjuti daripada skor utama. Terkuat: penalaran, penerapan aturan, dan ketahanan terhadap format prompt. Kompetitif: klasifikasi, pengambilan informasi, keadilan, penggunaan alat, dan sebagian besar tugas multibahasa. Terlemah: pengetahuan domain khusus. Keterbatasan yang dilaporkan sendiri juga jujur dengan cara yang sama — skor dapat berubah tergantung frasa dan urutan opsi, pertanyaan yang dirumuskan dengan buruk tetap menghasilkan skor, kalibrasi paling kuat pada jenis tugas yang familier, dan tidak ada penjelasan untuk diaudit ketika jawaban tampak salah.
Cakupan bahasa membawa bentuk kaveat yang sama. 25 bahasa terdaftar sebagai didukung, mencakup bahasa Jepang, Korea, Arab, Vietnam, Thai, Turki, Hindi, Bengali, Swahili, Ibrani, Persia, dan Ukraina di antara bahasa-bahasa lain, dengan peringatan eksplisit bahwa cakupan, kualitas, dan kalibrasi "dapat berbeda menurut bahasa" dan bahwa bahasa non-Inggris, khususnya bahasa dengan sumber daya rendah, merupakan area yang berkinerja kurang baik. Basis Qwen3.5-9B mendukung jauh lebih dari 200 bahasa. Pasca-pelatihan mempertahankan sekitar seperempat dari jumlah itu, dan seperempat itulah tempat kalibrasi dipasang.

Tidak ada harga di halaman itu juga
Bidang harga di katalog tidak mencantumkan tarif. Bidang ini menautkan ke halaman harga model milik Microsoft sendiri, jadi biaya per keputusan adalah sesuatu yang Anda baca dari Azure atau dari tagihan, bukan dari kartu model. Bagi siapa pun yang memodelkan biaya per keputusan dalam volume besar, ini adalah celah yang nyata, dan sebaiknya dinyatakan secara terang-terangan alih-alih diperkirakan. Ada dua hal yang memang mengikuti arsitektur ini dan layak dibawa ke dalam estimasi tersebut: 0% dari biaya sebuah panggilan adalah token keluaran, karena tidak ada token keluaran, dan kumpulan opsi merupakan bagian dari input, sehingga pertanyaan dengan enam puluh dua opsi deskriptif lebih mahal per panggilan daripada pertanyaan ya/tidak — Anda membayar untuk rubrik yang Anda tulis, bukan untuk jawabannya.
Mengapa bentuk rilis ini adalah bagian yang menarik
Pemberi skor keputusan adalah taruhan bahwa yang sebenarnya dibutuhkan perusahaan-perusahaan primitif bukanlah penulis yang lebih baik, melainkan penilai yang lebih murah dan lebih andal. Taruhan itu hanya membuahkan hasil jika probabilitasnya dapat dipercaya, karena semua yang berada di hilir seorang pemberi skor adalah ambang batas: 0,7 dieskalasi ke seseorang, 0,95 diterima otomatis, dan biaya salah menetapkan garis itu dibayar dalam bentuk keputusan otomatis yang buruk, bukan dalam token. Vendor yang mengirimkan pemberi skor tanpa tabel kalibrasi meminta setiap pelanggan menurunkannya ulang pada data mereka sendiri.
Dokumentasi Microsoft sendiri justru merekomendasikan hal itu, yang sekaligus melembutkan kritik dan menajamkan kesimpulan praktisnya. Validasi dengan data yang representatif untuk kasus penggunaan Anda. Tetapkan ambang batas berdasarkan biaya kesalahan Anda, bukan dari nilai bawaan. Selalu sertakan opsi abstain. Acak urutan opsi jika urutan dapat membuat jawaban bias. Libatkan manusia dalam proses untuk hal apa pun yang berdampak penting. Itu adalah saran yang bijak untuk pemberi skor apa pun. Itulah satu-satunya saran yang tersedia untuk yang ini.
Mencobanya minggu ini tanpa
Evaluasi termurah adalah memilih keputusan yang sudah Anda buat secara manual, menyusun dua ratus kasus berlabel dengan kumpulan jawaban yang benar-benar akan disediakan aplikasi Anda, lalu menjalankannya melalui deployment Foundry. Hitung expected calibration error pada output dan Anda akan mengetahui lebih banyak tentang Microsoft-Decision-1 daripada apa pun yang telah dipublikasikan Microsoft tentangnya, karena Anda telah mengukurnya pada distribusi Anda sendiri alih-alih pada set pengujian internal yang disisihkan. Itu pekerjaan satu sore dan ini menutup seluruh pertanyaan benchmark.
Posisi OrcaRouter ada pada separuh lain dari siklus penilaian, dan itulah separuh yang menghasilkan. Kami tidak menghosting Microsoft-Decision-1 dan model itu tidak ada dalam katalog kami — model yang mengembalikan probabilitas alih-alih teks bukanlah hal yang Anda tuju untuk chat completions, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan. Yang berada di balik satu kunci kami yang kompatibel dengan OpenAI adalah kumpulan lebih dari 200 model yang melakukan penulisan: model yang menyusun draf rubrik, dua model yang menghasilkan jawaban kandidat, dan satu model yang memancarkan panggilan alat yang kemudian dinilai Decision-1 sebelum dijalankan. Harga daftar penyedia diteruskan dengan markup 0%, sehingga penurunan harga di sisi generator langsung berlaku di sisi kami pada hari yang sama, dan failover otomatis menjaga kaki generasi tetap berjalan ketika satu penyedia mengalami degradasi — hal ini lebih penting dalam pipeline yang menilai segala hal yang dilihatnya daripada pipeline yang hanya menjawab pengguna sesekali. Jika Anda lebih suka tidak memilih satu juri tunggal, DSL routing menggabungkan beberapa model menjadi satu panggilan, dan fusi model melaporkan tingkat kesepakatan mereka sebagai bidang yang dinilai, bukan sebagai prosa yang harus Anda baca.

Apa yang akan mengubah artikel ini adalah sebuah tabel. Publikasikan skor Brier dan ECE, atau biarkan uji independen masuk ke papan peringkat, dan evaluasi di atas menjadi konfirmasi alih-alih satu-satunya bukti yang ada. Sampai saat itu, deskripsi akurat tentang Microsoft-Decision-1 bersifat sempit: bobotnya nyata, kontraknya terdokumentasi lebih baik daripada yang berhasil dilakukan sebagian besar rilis terhosting, opsi abstensi dirancang sejak awal alih-alih ditambahkan belakangan, dan klaim performanya hanyalah satu kalimat — kalimat yang ditulis dengan baik, tanpa disertai angka sama sekali.
Intinya
Microsoft-Decision-1 mencapai ketersediaan umum di Microsoft Foundry pada 8 Oktober 2026 sebagai penilai keputusan khusus teks dengan 32.768 token yang dibangun di atas Qwen3.5-9B, yang mengembalikan probabilitas terkalibrasi atas kumpulan opsi Anda sendiri dengan nol token keluaran dan tanpa bobot yang perlu diunduh. Kekuatannya adalah kontrak satu lintasan yang bersih, jalur abstensi yang dirancang sejak awal, serta autentikasi, penagihan, dan tata kelola Azure yang menyertainya; kelemahannya adalah tidak ada pihak di luar Microsoft yang memiliki angka terbitan tentang seberapa baik kalibrasinya, termasuk Microsoft. Perlakukan peluncuran ini sebagai API yang menjadi tersedia, bukan sebagai kemampuan yang sedang mapan, dan ujikan kasus berlabel Anda sendiri melaluinya sebelum apa pun di hilir bergantung pada suatu ambang batas.
