Kartu judul yang dihasilkan untuk perbandingan Decision 3.0 dan Microsoft-Decision-1, dengan subjudul 'backbone Qwen3.5-9B yang sama, cara membelinya yang berlawanan', dengan chip bertuliskan 'bobot Apache-2.0 vs hanya hosted', 'gambar dan video vs hanya teks', 'diterbitkan 10 Okt vs GA 8 Okt', dan footer bertuliskan 'angka Decision 3.0 milik vLLM-SR sendiri; angka Microsoft-Decision-1 milik Microsoft sendiri; tidak ada yang direproduksi secara independen.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Decision 3.0 vs Microsoft-Decision-1: Satu Adalah Unduhan, yang Lain Adalah SKU

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tingkat 9B dari Decision 3.0 dan Microsoft-Decision-1 secara teori adalah produk yang sama. Keduanya melakukan pelatihan lanjutan pada Qwen3.5-9B menjadi penskor yang menjawab serangkaian jawaban kandidat tetap dengan probabilitas terkalibrasi untuk masing-masing, tanpa pernah menghasilkan token. Keduanya ditujukan untuk pekerjaan yang sama — merutekan permintaan, menilai keluaran terhadap rubrik, menggerbangi tindakan agen, melakukan triase antrean. Keduanya dirilis hanya berselang satu minggu: Microsoft-Decision-1 tersedia secara umum di Microsoft Foundry pada 8 Oktober 2026 dan diumumkan keesokan harinya, dan d3-flash dipush ke Hugging Face pukul 17.23 UTC pada 10 Oktober 2026.

Perbedaannya bukan pada modelnya. Melainkan pada apa yang boleh Anda lakukan dengannya. d3-flash adalah checkpoint Apache-2.0 berparameter 8,39 miliar yang Anda unduh dan jalankan, berada di posisi ketiga dalam keluarga yang dimulai dari 0,59B dan mencapai puncak pada 26,09B. Microsoft-Decision-1 adalah endpoint yang dihosting di Foundry, dengan bobot yang sama sekali tidak didistribusikan, dalam lini yang menurut Microsoft nantinya akan di-rebase ke model MAI miliknya sendiri. Salah satunya adalah artefak; yang lain adalah layanan. Hampir setiap pertanyaan praktis tentang pasangan ini mengikuti dari fakta tunggal itu, termasuk pertanyaan-pertanyaan yang tampak seolah-olah tentang benchmark.

Dua keputusan tentang tujuan suatu model keputusan

Postingan Microsoft eksplisit tentang cakupan dengan cara yang jarang dilakukan kartu model. Bentuk pertanyaan yang didukung adalah ya/tidak, pilihan ganda, rating, klasifikasi, dan penilaian berbasis rubrik. Pengecualiannya dicantumkan sama gamblangnya: tidak dirancang untuk pembuatan teks, menjawab pertanyaan terbuka, percakapan, penerjemahan, atau peringkasan, dan tidak ditujukan untuk tugas yang membutuhkan pengetahuan yang tidak ada dalam input. Ini menjalankan satu lintasan atas hingga 32.768 token dan menghasilkan nol token keluaran karena tidak ada loop dekode. Microsoft juga mendukung opsi abstensi seperti "tidak dapat menentukan" ketika bukti yang diberikan tidak memadai, yang merupakan detail yang membuat penetapan ambang batas pada output menjadi benar-benar bermakna.

d3-flash berada di dalam kotak konseptual yang sama — pertanyaan Choice, Noul (ya/tidak), dan Score, satu forward pass per pertanyaan, satu probabilitas per opsi, tanpa generasi — lalu memperluas sisi masukan. Sementara Microsoft-Decision-1 hanya teks berdasarkan desainnya, d3-flash menerima teks atau JSON, beberapa gambar per permintaan hingga 1,6 megapiksel per gambar, dan beberapa video yang dibaca pada 2 frame per detik. Setiap pertanyaan dalam sebuah permintaan melihat setiap gambar dan video yang dilampirkan padanya. Ini adalah model yang lebih kecil yang melakukan lebih banyak dengan input yang diberikan.

Itu adalah pemisahan nyata yang pertama, dan ini bukan soal selera. Jika keputusan yang perlu Anda buat berkaitan dengan tangkapan layar, tanda terima, bagan, atau klip dari kamera, Microsoft-Decision-1 tidak dapat membuatnya. Itu adalah batas kemampuan, bukan kesenjangan kualitas, dan sebanyak apa pun upaya peningkatan akurasi tidak akan menutupnya.

Apa yang masing-masing terbitkan, dan bagaimana

Di sini kedua rilis tersebut benar-benar melakukan jenis pembuktian yang berbeda, dan ada baiknya memisahkan keduanya alih-alih menyejajarkan angka-angkanya.

Microsoft menjalankan perbandingan 36 tolok ukur yang mencakup hampir 150.000 pertanyaan yang dijaga tidak terlihat selama pelatihan, mencakup perutean, pemeringkatan, konteks panjang, tugas multibahasa dan di luar distribusi, penalaran, dan keamanan, serta menyatakan modelnya tampil paling baik di seluruh rangkaian tersebut. Perusahaan melaporkan latensi sebagai rasio, bukan angka — p50 sekitar 35 kali lebih cepat daripada GPT-6 Sol, dan 2,5 kali lebih cepat daripada H2O-Lightning-4B v1.1, yang disebutnya sebagai peringkat kedua. Perusahaan mendokumentasikan ketangguhan sebagai prosedur: permintaan yang sama diberi gangguan dengan delapan cara, tingkat perubahan keputusan rata-rata 1,3%, dan nol perubahan ketika deskripsi opsi diparafrasekan atau opsi dibalik maupun diacak. Perusahaan menguji keamanan pada 5.250 permintaan di 11 tolok ukur yang mencakup konten berbahaya, jailbreaking, dan injeksi prompt. Perusahaan menyatakan standar kalibrasi yang diberlakukan pada dirinya sendiri — prediksi 90% seharusnya benar sekitar sembilan dari sepuluh kali pada kasus representatif.

vLLM-SR menerbitkan sebuah indeks. Jev Decision Index 0.3.1 menempatkan d3 pada 64,7 dengan d3-flash pada public-suite 57,79, klaim kenaikan sebesar 11,0 dibandingkan model 9B Decision 2.0 pada 46,76. Indeks ini juga mengklaim semua 140.178 permintaan publik terjawab tanpa ada yang tidak didukung, yang merupakan pernyataan cakupan, bukan pernyataan akurasi. Kartu tersebut mengungkapkan bahwa baris d3 sendiri merupakan evaluasi internal, sedangkan baris-baris pembanding di sampingnya — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — adalah data papan langsung. Dan di sisi multimodal, model-model keluarga d3 melaporkan skor Perception Test pada seluruh 19.140 pertanyaan validasi, dengan d3-flash pada 73,3 dibandingkan dasar peluang tiga opsi sebesar 33,3.

Jadi: Microsoft menerbitkan klaim cakupan dengan metode yang didokumentasikan dan angka ketangguhan, dan tanpa angka kalibrasi per-checkpoint. vLLM-SR menerbitkan posisi papan peringkat dengan kesenjangan provenans yang dinyatakan antara barisnya sendiri dan baris-baris lainnya, plus hasil video, dan juga tanpa angka kalibrasi. Tidak ada kartu yang membawa skor Brier atau angka expected calibration error untuk model yang dijelaskannya. Bagi dua produk yang seluruh proposisi nilainya adalah bahwa angka yang dikembalikan itu bermakna, itulah lubang bersama mereka, dan itu adalah hal paling berguna yang bisa dirilis oleh vendor mana pun berikutnya.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

Distribusi lebih menentukan daripada lembar spesifikasi.

Di sinilah perbandingan tidak lagi tentang model.

Dengan d3-flash, Anda mendapatkan bobot, sebuah decision_config.json yang menyematkan revisi basis, manifes SHA-256 per file, kode pemodelan kustom, kepala readout, dan kumpulan dependensi terdokumentasi yang mencakup transformers==5.17.0 dan paket kernel CUDA opsional untuk lapisan linear-attention. Anda dapat menjalankannya di perangkat keras Anda sendiri, melakukan fine-tuning, mengkuantisasinya, meng-air-gap-nya. Anda juga mengambil alih pekerjaan operasional: kelas Python bukanlah endpoint, dan kartu tersebut tidak menyatakan anggaran token untuk state ditambah pertanyaan ditambah deskripsi kandidat — max_length adalah null dalam konfigurasi yang dikirim, jadi batas atas itu harus Anda temukan sendiri.

Dengan Microsoft-Decision-1 Anda mendapatkan endpoint di dalam akun cloud yang sudah ada, lengkap dengan autentikasi, ketersediaan regional, dan kontrol penyediaan yang menyertainya, dan Anda tidak mendapatkan pekerjaan operasional sama sekali. Anda juga tidak mendapatkan kendali apa pun. Tidak ada repositori untuk diunduh, tidak ada jalur fine-tuning, dan tidak ada opsi self-hosting; siklus hidup model sepenuhnya milik Microsoft, bukan milik Anda, dan pemberitahuan penghentian atau rebase ke backbone yang berbeda adalah perubahan yang Anda serap, bukan yang Anda jadwalkan. Microsoft telah mengatakan bahwa rebase ke model MAI mereka sendiri akan segera hadir, yang merupakan roadmap wajar untuk model yang intinya adalah penilaian single-pass yang cepat, dan juga berarti checkpoint spesifik yang Anda benchmark belum tentu yang akan Anda panggil dalam setahun.

Kisah latensi juga perlu dibaca dengan cermat. Angka utama Microsoft adalah rasio terhadap model serbaguna yang jauh lebih besar, yang merupakan perbandingan tepat untuk argumennya — tugas model keputusan adalah menggantikan panggilan generatif yang mahal dengan panggilan penilaian yang murah, dan 35x terhadap GPT-6 Sol pada p50 adalah seperti apa argumen itu ketika berhasil. Angka vLLM-SR bersifat absolut, permintaan tunggal dan GPU tunggal, dan jelas menunjukkan pajak modalitas: pada satu AMD Instinct MI325X, permintaan teks ke d3-flash membutuhkan median 19,1 ms, permintaan yang sama dengan gambar membutuhkan 149,4 ms, dan dengan video sepuluh detik 407,6 ms. Kedua kumpulan angka dilaporkan vendor, pada perangkat keras yang berbeda, dan keduanya belum direproduksi di luar lab yang menghasilkannya.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Cara memilih

Aturan keputusannya singkat, yang merupakan pertanda baik bahwa kedua produk tersebut sebenarnya tidak bersaing untuk slot yang sama.

Ambil Microsoft-Decision-1 jika keputusannya hanya teks, jika Anda sudah berjalan di Foundry, dan jika menjadi panggilan alih-alih deployment adalah intinya — tidak ada GPU untuk dibeli, tidak ada kontainer untuk dioperasikan, tidak ada siklus hidup model yang harus dimiliki. Materi pendukung Microsoft juga merupakan yang lebih mudah digunakan dari keduanya untuk tim platform: perturbasi, jumlah uji keamanan, dan pernyataan bahwa opsi abstensi didukung adalah hal-hal yang Anda butuhkan untuk menulis kebijakan ambang batas, dan batas 32.768 token dinyatakan alih-alih dibiarkan kosong.

Ambil Decision 3.0, secara realistis d3-flash atau d3-mini, jika ada bagian dari keputusan yang bergantung pada gambar atau klip, jika Anda perlu menjalankannya di tempat yang tidak dapat dijangkau oleh API yang dihosting, atau jika Anda ingin melakukan fine-tuning pada pemberi skor dengan kasus berlabel Anda sendiri. Lisensi Apache-2.0 dan manifes hash tingkat file membuat itu menjadi nyata, bukan sekadar teoretis. Yang Anda terima sebagai gantinya adalah anggaran input yang tidak dinyatakan, tidak ada kalibrasi yang dipublikasikan, dan fakta bahwa keluarga ini baru berumur beberapa hari dengan praktis tidak ada penggunaan dari luar yang menjadi dasarnya.

Jika Anda membutuhkan keduanya — scorer yang dihosting untuk jalur teks rutin dan yang dihosting sendiri untuk kasus multimodal atau air-gapped, dipanggil melalui antarmuka yang sama — maka posisi yang jujur adalah tidak ada vendor yang saat ini memberi Anda itu, dan kedua format permintaan itu cukup mirip untuk disatukan tetapi tidak identik.

Di mana OrcaRouter berada, dan di mana tidak

typesafe/jev-1.13 adalah model keputusan di katalog kami, dilayani melalui POST /v1/systemone dengan kontrak state dan pertanyaan bernama yang sama yang diimplementasikan kedua model di atas: teks masuk, JSON terstruktur keluar, hingga sekitar 64K token masukan, non-streaming, $0,042 per juta token masukan tanpa biaya completion karena tidak pernah menghasilkannya. Yang patut dicatat, pertanyaan anggaran token bergaya Android yang tidak dijawab secara penuh oleh kedua kartu di atas dijawab di sini.

Kami tidak menyediakan kedua model dalam perbandingan ini. Checkpoint Decision 3.0 dikirimkan sebagai jalur inferensi lokal di repositori Hugging Face, bukan sebagai endpoint yang dapat dirutekan, dan Microsoft-Decision-1 didistribusikan melalui platform Microsoft sendiri serta beberapa platform pihak ketiga — bukan melalui kami. Tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim ketersediaan untuk keduanya.

Yang sebenarnya bernilai dari lapisan routing dalam keputusan ini ada di separuh loop yang lain. Scorer itu murah secara desain; model yang bertindak atas outputnya tidak, dan memasangkan model keputusan dengan model generatif biasanya berarti dua integrasi, dua hubungan penagihan, dan dua mode kegagalan. Memanggil keduanya melalui satu kunci di lebih dari 200 model — dengan failover otomatis saat penyedia bermasalah, dan harga daftar penyedia diteruskan dengan markup 0% sehingga perubahan harga vendor langsung berlaku di hari yang sama — berarti Anda dapat menukar scorer tanpa menyentuh call site. Ini lebih penting dari biasanya di sini, karena kedua model ini masih cukup baru sehingga keputusan yang Anda buat minggu ini adalah keputusan yang seharusnya bisa Anda balik bulan depan.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

Pertanyaan yang menentukan ini dalam enam bulan

Dua tim melatih lanjut checkpoint dasar yang sama menjadi bentuk produk yang sama pada minggu yang sama dan menarik kesimpulan yang berlawanan tentang bagaimana produk itu seharusnya sampai ke pelanggan. Itu bukan kebetulan waktu, melainkan sebuah percabangan dalam cara kategori ini dijual: sebagai bobot atau sebagai layanan, sebagai sesuatu yang Anda miliki atau sesuatu yang Anda panggil.

Perhatikan tiga sinyal. Apakah rebase Microsoft ke MAI atau ke modelnya sendiri mengubah perilaku akurasi dan latensi yang saat ini dijualnya — dan seberapa besar pemberitahuan yang diterima pelanggan. Apakah vLLM-SR menerbitkan anggaran input dan angka kalibrasi untuk Decision 3.0, menutup kesenjangan yang membuat indeksnya tidak dapat ditindaklanjuti. Dan apakah ada pihak di luar kedua lab yang menjalankan suite publik pada bobot d3 yang telah dirilis, karena saat ini satu-satunya angka yang dapat menyelesaikan perbandingan ini adalah angka yang belum dihasilkan oleh vendor mana pun.