
Decision 3.0 vs Microsoft-Decision-1: Satu Adalah Unduhan, yang Lain Adalah SKU
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 71 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Tingkat 9B dari Decision 3.0 dan Microsoft-Decision-1 secara teori adalah produk yang sama. Keduanya melakukan pelatihan lanjutan pada Qwen3.5-9B menjadi penskor yang menjawab serangkaian jawaban kandidat tetap dengan probabilitas terkalibrasi untuk masing-masing, tanpa pernah menghasilkan token. Keduanya ditujukan untuk pekerjaan yang sama — merutekan permintaan, menilai keluaran terhadap rubrik, menggerbangi tindakan agen, melakukan triase antrean. Keduanya dirilis hanya berselang satu minggu: Microsoft-Decision-1 tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026 dan diumumkan keesokan harinya, dan d3-flash dipush ke Hugging Face pukul 17.23 UTC pada 10 Oktober 2026.
Perbedaannya bukan pada modelnya. Melainkan pada apa yang boleh Anda lakukan dengannya. d3-flash adalah checkpoint Apache-2.0 berparameter 8,39 miliar yang Anda unduh dan jalankan, berada di posisi ketiga dalam keluarga yang dimulai dari 0,59B dan mencapai puncak pada 26,09B. Microsoft-Decision-1 adalah endpoint yang dihosting di Foundry, dengan bobot yang sama sekali tidak didistribusikan, dalam lini yang menurut Microsoft nantinya akan di-rebase ke model MAI miliknya sendiri. Salah satunya adalah artefak; yang lain adalah layanan. Hampir setiap pertanyaan praktis tentang pasangan ini mengikuti dari fakta tunggal itu, termasuk pertanyaan-pertanyaan yang tampak seolah-olah tentang benchmark.
Dua keputusan tentang tujuan suatu model keputusan
Postingan Microsoft eksplisit tentang cakupan dengan cara yang jarang dilakukan kartu model. Bentuk pertanyaan yang didukung adalah ya/tidak, pilihan ganda, rating, klasifikasi, dan penilaian berbasis rubrik. Pengecualiannya dicantumkan sama gamblangnya: tidak dirancang untuk pembuatan teks, menjawab pertanyaan terbuka, percakapan, penerjemahan, atau peringkasan, dan tidak ditujukan untuk tugas yang membutuhkan pengetahuan yang tidak ada dalam input. Ini menjalankan satu lintasan atas hingga 32.768 token dan menghasilkan nol token keluaran karena tidak ada loop dekode. Microsoft juga mendukung opsi abstensi seperti "tidak dapat menentukan" ketika bukti yang diberikan tidak memadai, yang merupakan detail yang membuat penetapan ambang batas pada output menjadi benar-benar bermakna.
d3-flash berada di dalam kotak konseptual yang sama — pertanyaan Choice, Noul (ya/tidak), dan Score, satu forward pass per pertanyaan, satu probabilitas per opsi, tanpa generasi — lalu memperluas sisi masukan. Sementara Microsoft-Decision-1 hanya teks berdasarkan desainnya, d3-flash menerima teks atau JSON, beberapa gambar per permintaan hingga 1,6 megapiksel per gambar, dan beberapa video yang dibaca pada 2 frame per detik. Setiap pertanyaan dalam sebuah permintaan melihat setiap gambar dan video yang dilampirkan padanya. Ini adalah model yang lebih kecil yang melakukan lebih banyak dengan input yang diberikan.
Itu adalah pemisahan nyata yang pertama, dan ini bukan soal selera. Jika keputusan yang perlu Anda buat berkaitan dengan tangkapan layar, tanda terima, bagan, atau klip dari kamera, Microsoft-Decision-1 tidak dapat membuatnya. Itu adalah batas kemampuan, bukan kesenjangan kualitas, dan sebanyak apa pun upaya peningkatan akurasi tidak akan menutupnya.
Apa yang masing-masing terbitkan, dan bagaimana
Di sini kedua rilis tersebut benar-benar melakukan jenis pembuktian yang berbeda, dan ada baiknya memisahkan keduanya alih-alih menyejajarkan angka-angkanya.
Microsoft menjalankan perbandingan 36 tolok ukur yang mencakup hampir 150.000 pertanyaan yang dijaga tidak terlihat selama pelatihan, mencakup perutean, pemeringkatan, konteks panjang, tugas multibahasa dan di luar distribusi, penalaran, dan keamanan, serta menyatakan modelnya tampil paling baik di seluruh rangkaian tersebut. Perusahaan melaporkan latensi sebagai rasio, bukan angka — p50 sekitar 35 kali lebih cepat daripada GPT-6 Sol, dan 2,5 kali lebih cepat daripada H2O-Lightning-4B v1.1, yang disebutnya sebagai peringkat kedua. Perusahaan mendokumentasikan ketangguhan sebagai prosedur: permintaan yang sama diberi gangguan dengan delapan cara, tingkat perubahan keputusan rata-rata 1,3%, dan nol perubahan ketika deskripsi opsi diparafrasekan atau opsi dibalik maupun diacak. Perusahaan menguji keamanan pada 5.250 permintaan di 11 tolok ukur yang mencakup konten berbahaya, jailbreaking, dan injeksi prompt. Perusahaan menyatakan standar kalibrasi yang diberlakukan pada dirinya sendiri — prediksi 90% seharusnya benar sekitar sembilan dari sepuluh kali pada kasus representatif.
vLLM-SR menerbitkan sebuah indeks. Jev Decision Index 0.3.1 menempatkan d3 pada 64,7 dengan d3-flash pada public-suite 57,79, klaim kenaikan sebesar 11,0 dibandingkan model 9B Decision 2.0 pada 46,76. Indeks ini juga mengklaim semua 140.178 permintaan publik terjawab tanpa ada yang tidak didukung, yang merupakan pernyataan cakupan, bukan pernyataan akurasi. Kartu tersebut mengungkapkan bahwa baris d3 sendiri merupakan evaluasi internal, sedangkan baris-baris pembanding di sampingnya — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — adalah data papan langsung. Dan di sisi multimodal, model-model keluarga d3 melaporkan skor Perception Test pada seluruh 19.140 pertanyaan validasi, dengan d3-flash pada 73,3 dibandingkan dasar peluang tiga opsi sebesar 33,3.
Jadi: Microsoft menerbitkan klaim cakupan dengan metode yang didokumentasikan dan angka ketangguhan, dan tanpa angka kalibrasi per-checkpoint. vLLM-SR menerbitkan posisi papan peringkat dengan kesenjangan provenans yang dinyatakan antara barisnya sendiri dan baris-baris lainnya, plus hasil video, dan juga tanpa angka kalibrasi. Tidak ada kartu yang membawa skor Brier atau angka expected calibration error untuk model yang dijelaskannya. Bagi dua produk yang seluruh proposisi nilainya adalah bahwa angka yang dikembalikan itu bermakna, itulah lubang bersama mereka, dan itu adalah hal paling berguna yang bisa dirilis oleh vendor mana pun berikutnya.

Distribusi lebih menentukan daripada lembar spesifikasi.
Di sinilah perbandingan tidak lagi tentang model.
Dengan d3-flash, Anda mendapatkan bobot, sebuah decision_config.json yang menyematkan revisi basis, manifes SHA-256 per file, kode pemodelan kustom, kepala readout, dan kumpulan dependensi terdokumentasi yang mencakup transformers==5.17.0 dan paket kernel CUDA opsional untuk lapisan linear-attention. Anda dapat menjalankannya di perangkat keras Anda sendiri, melakukan fine-tuning, mengkuantisasinya, meng-air-gap-nya. Anda juga mengambil alih pekerjaan operasional: kelas Python bukanlah endpoint, dan kartu tersebut tidak menyatakan anggaran token untuk state ditambah pertanyaan ditambah deskripsi kandidat — max_length adalah null dalam konfigurasi yang dikirim, jadi batas atas itu harus Anda temukan sendiri.
Dengan Microsoft-Decision-1 Anda mendapatkan endpoint di dalam akun cloud yang sudah ada, lengkap dengan autentikasi, ketersediaan regional, dan kontrol penyediaan yang menyertainya, dan Anda tidak mendapatkan pekerjaan operasional sama sekali. Anda juga tidak mendapatkan kendali apa pun. Tidak ada repositori untuk diunduh, tidak ada jalur fine-tuning, dan tidak ada opsi self-hosting; siklus hidup model sepenuhnya milik Microsoft, bukan milik Anda, dan pemberitahuan penghentian atau rebase ke backbone yang berbeda adalah perubahan yang Anda serap, bukan yang Anda jadwalkan. Microsoft telah mengatakan bahwa rebase ke model MAI mereka sendiri akan segera hadir, yang merupakan roadmap wajar untuk model yang intinya adalah penilaian single-pass yang cepat, dan juga berarti checkpoint spesifik yang Anda benchmark belum tentu yang akan Anda panggil dalam setahun.
Kisah latensi juga perlu dibaca dengan cermat. Angka utama Microsoft adalah rasio terhadap model serbaguna yang jauh lebih besar, yang merupakan perbandingan tepat untuk argumennya — tugas model keputusan adalah menggantikan panggilan generatif yang mahal dengan panggilan penilaian yang murah, dan 35x terhadap GPT-6 Sol pada p50 adalah seperti apa argumen itu ketika berhasil. Angka vLLM-SR bersifat absolut, permintaan tunggal dan GPU tunggal, dan jelas menunjukkan pajak modalitas: pada satu AMD Instinct MI325X, permintaan teks ke d3-flash membutuhkan median 19,1 ms, permintaan yang sama dengan gambar membutuhkan 149,4 ms, dan dengan video sepuluh detik 407,6 ms. Kedua kumpulan angka dilaporkan vendor, pada perangkat keras yang berbeda, dan keduanya belum direproduksi di luar lab yang menghasilkannya.

Cara memilih
Aturan keputusannya singkat, yang merupakan pertanda baik bahwa kedua produk tersebut sebenarnya tidak bersaing untuk slot yang sama.
Ambil Microsoft-Decision-1 jika keputusannya hanya teks, jika Anda sudah berjalan di Foundry, dan jika menjadi panggilan alih-alih deployment adalah intinya — tidak ada GPU untuk dibeli, tidak ada kontainer untuk dioperasikan, tidak ada siklus hidup model yang harus dimiliki. Materi pendukung Microsoft juga merupakan yang lebih mudah digunakan dari keduanya untuk tim platform: perturbasi, jumlah uji keamanan, dan pernyataan bahwa opsi abstensi didukung adalah hal-hal yang Anda butuhkan untuk menulis kebijakan ambang batas, dan batas 32.768 token dinyatakan alih-alih dibiarkan kosong.
Ambil Decision 3.0, secara realistis d3-flash atau d3-mini, jika ada bagian dari keputusan yang bergantung pada gambar atau klip, jika Anda perlu menjalankannya di tempat yang tidak dapat dijangkau oleh API yang dihosting, atau jika Anda ingin melakukan fine-tuning pada pemberi skor dengan kasus berlabel Anda sendiri. Lisensi Apache-2.0 dan manifes hash tingkat file membuat itu menjadi nyata, bukan sekadar teoretis. Yang Anda terima sebagai gantinya adalah anggaran input yang tidak dinyatakan, tidak ada kalibrasi yang dipublikasikan, dan fakta bahwa keluarga ini baru berumur beberapa hari dengan praktis tidak ada penggunaan dari luar yang menjadi dasarnya.
Jika Anda membutuhkan keduanya — scorer yang dihosting untuk jalur teks rutin dan yang dihosting sendiri untuk kasus multimodal atau air-gapped, dipanggil melalui antarmuka yang sama — maka posisi yang jujur adalah tidak ada vendor yang saat ini memberi Anda itu, dan kedua format permintaan itu cukup mirip untuk disatukan tetapi tidak identik.
Di mana OrcaRouter berada, dan di mana tidak
typesafe/jev-1.13 adalah model keputusan di katalog kami, dilayani melalui POST /v1/systemone dengan kontrak state dan pertanyaan bernama yang sama yang diimplementasikan kedua model di atas: teks masuk, JSON terstruktur keluar, hingga sekitar 64K token masukan, non-streaming, $0,042 per juta token masukan tanpa biaya completion karena tidak pernah menghasilkannya. Yang patut dicatat, pertanyaan anggaran token bergaya Android yang tidak dijawab secara penuh oleh kedua kartu di atas dijawab di sini.
Kami tidak menyediakan kedua model dalam perbandingan ini. Checkpoint Decision 3.0 dikirimkan sebagai jalur inferensi lokal di repositori Hugging Face, bukan sebagai endpoint yang dapat dirutekan, dan Microsoft-Decision-1 didistribusikan melalui platform Microsoft sendiri serta beberapa platform pihak ketiga — bukan melalui kami. Tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan untuk keduanya.
Yang sebenarnya bernilai dari lapisan routing dalam keputusan ini ada di separuh loop yang lain. Scorer itu murah secara desain; model yang bertindak atas outputnya tidak, dan memasangkan model keputusan dengan model generatif biasanya berarti dua integrasi, dua hubungan penagihan, dan dua mode kegagalan. Memanggil keduanya melalui satu kunci di lebih dari 200 model — dengan failover otomatis saat penyedia bermasalah, dan harga daftar penyedia diteruskan dengan markup 0% sehingga perubahan harga vendor langsung berlaku di hari yang sama — berarti Anda dapat menukar scorer tanpa menyentuh call site. Ini lebih penting dari biasanya di sini, karena kedua model ini masih cukup baru sehingga keputusan yang Anda buat minggu ini adalah keputusan yang seharusnya bisa Anda balik bulan depan.

Pertanyaan yang menentukan ini dalam enam bulan
Dua tim melatih lanjut checkpoint dasar yang sama menjadi bentuk produk yang sama pada minggu yang sama dan menarik kesimpulan yang berlawanan tentang bagaimana produk itu seharusnya sampai ke pelanggan. Itu bukan kebetulan waktu, melainkan sebuah percabangan dalam cara kategori ini dijual: sebagai bobot atau sebagai layanan, sebagai sesuatu yang Anda miliki atau sesuatu yang Anda panggil.
Perhatikan tiga sinyal. Apakah rebase Microsoft ke MAI atau ke modelnya sendiri mengubah perilaku akurasi dan latensi yang saat ini dijualnya — dan seberapa besar pemberitahuan yang diterima pelanggan. Apakah vLLM-SR menerbitkan anggaran input dan angka kalibrasi untuk Decision 3.0, menutup kesenjangan yang membuat indeksnya tidak dapat ditindaklanjuti. Dan apakah ada pihak di luar kedua lab yang menjalankan suite publik pada bobot d3 yang telah dirilis, karena saat ini satu-satunya angka yang dapat menyelesaikan perbandingan ini adalah angka yang belum dihasilkan oleh vendor mana pun.
