
Decision 3.0 vs Microsoft-Decision-1: De een is een download, de andere is een SKU
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 71 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
De 9B-klasse van Decision 3.0 en Microsoft-Decision-1 zijn op papier hetzelfde product. Beide post-trainen Qwen3.5-9B tot een scorer die een vaste set kandidaatantwoorden beantwoordt met elk een gekalibreerde waarschijnlijkheid, zonder ooit een token te genereren. Beide zijn gericht op dezelfde taken — het routeren van een verzoek, het beoordelen van een output aan de hand van een rubric, het gate-en van een agentactie, het triëren van een wachtrij. Beide kwamen binnen een week van elkaar uit: Microsoft-Decision-1 werd op 8 oktober 2026 algemeen beschikbaar op Microsoft Foundry en werd de volgende dag aangekondigd, en d3-flash werd op 10 oktober 2026 om 17:23 UTC naar Hugging Face gepusht.
Het verschil zit niet in het model. Het zit in wat je ermee mag doen. d3-flash is een Apache-2.0-checkpoint met 8,39 miljard parameters dat je downloadt en uitvoert, en staat derde in een familie die begint bij 0,59B en eindigt bij 26,09B. Microsoft-Decision-1 is een gehoste endpoint op Foundry, met gewichten die helemaal niet worden gedistribueerd, in een lijn waarvan Microsoft zegt dat die later opnieuw op zijn eigen MAI-modellen zal worden gebaseerd. Een van deze is een artefact; de andere is een dienst. Bijna elke praktische vraag over het tweetal volgt uit dat ene feit, inclusief de vragen die eruitzien alsof ze over benchmarks gaan.
Twee beslissingen over waarvoor een beslissingsmodel dient
De post van Microsoft is expliciet over de scope, iets wat modelkaarten zelden zijn. De ondersteunde vraagvormen zijn ja/nee, meerkeuze, beoordeling, classificatie en rubric-gebaseerde beoordeling. De uitsluitingen worden even duidelijk vermeld: niet ontworpen voor tekstgeneratie, open vraagbeantwoording, conversatie, vertaling of samenvatting, en niet bedoeld voor taken die kennis vereisen die niet in de input aanwezig is. Het voert één pass uit over maximaal 32.768 tokens en produceert nul outputtokens, omdat er geen decoderingslus is. Microsoft ondersteunt ook een abstentiemogelijkheid zoals "kan niet zeggen" wanneer het aangeleverde bewijs onvoldoende is, wat het detail is dat het stellen van een drempel op de output überhaupt zinvol maakt.
d3-flash zit in hetzelfde conceptuele kader — Choice-, Noul (ja/nee)- en Score-vragen, één forward pass per vraag, een waarschijnlijkheid per optie, geen generatie — en verbreedt vervolgens de invoerkant. Waar Microsoft-Decision-1 door zijn ontwerp alleen tekst aankan, accepteert d3-flash tekst of JSON, meerdere afbeeldingen per verzoek van elk maximaal 1,6 megapixel, en meerdere video's die met 2 frames per seconde worden uitgelezen. Elke vraag in een verzoek ziet elke afbeelding en video die eraan zijn gekoppeld. Het is een kleiner model dat meer doet met de invoer die het krijgt.
Dat is de eerste echte scheidslijn, en het is geen kwestie van smaak. Als de beslissing die je moet nemen over een screenshot, een bon, een grafiek of een clip van een camera gaat, kan Microsoft-Decision-1 die niet nemen. Dat is een capaciteitsgrens, geen kwaliteitskloof, en geen enkele hoeveelheid nauwkeurigheidswerk dicht die.
Wat elk van hen publiceert, en hoe
Hier leveren de twee releases werkelijk verschillende soorten bewijs, en het is de moeite waard om ze te scheiden in plaats van getallen naast elkaar te leggen.
Microsoft heeft een vergelijking van 36 benchmarks over bijna 150.000 vragen uitgevoerd, waarbij de vragen tijdens de training verborgen bleven. De vergelijking bestrijkt routering, ranking, lange context, meertalige en out-of-distribution-taken, redeneren en veiligheid, en Microsoft zegt dat zijn model op al die sets het beste uit de bus kwam. Het rapporteert latentie als een verhouding in plaats van een getal — p50 ongeveer 35 keer sneller dan GPT-6 Sol, en 2,5 keer sneller dan H2O-Lightning-4B v1.1, dat het als nummer twee aanwijst. Het documenteert robuustheid als een procedure: dezelfde aanvraag op acht manieren verstoord, een gemiddeld beslissingsflip-percentage van 1,3%, en nul flips wanneer beschrijvingen van opties worden geparafraseerd of opties in omgekeerde of willekeurige volgorde worden gezet. Het testte veiligheid op 5.250 verzoeken verdeeld over 11 benchmarks die schadelijke inhoud, jailbreaking en promptinjectie behandelen. Het vermeldt de kalibratiestandaard waaraan het zichzelf houdt — een voorspelling van 90% zou op representatieve gevallen ongeveer negen van de tien keer juist moeten zijn.
vLLM-SR heeft een index gepubliceerd. De Jev Decision Index 0.3.1 plaatst d3 op 64,7, met d3-flash op public-suite 57,79, een geclaimde winst van 11,0 ten opzichte van Decision 2.0's 9B-model op 46,76. Het beweert ook dat alle 140.178 publieke verzoeken zijn beantwoord, met geen enkele niet-ondersteunde, wat een dekkingsclaim is in plaats van een nauwkeurigheidsclaim. De kaart onthult dat d3's eigen rij een interne evaluatie is, terwijl de vergelijkingsrijen ernaast — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — live boardgegevens zijn. En aan de multimodale kant rapporteren d3-familiemodellen Perception Test-scores op alle 19.140 validatievragen, met d3-flash op 73,3 tegen een kansondergrens van 33,3 bij drie opties.
Dus: Microsoft publiceert een breedteclaim met een gedocumenteerde methode en een robuustheidsgetal, en geen calibratiecijfer per checkpoint. vLLM-SR publiceert een positie op een leaderboard met een vermelde herkomstkloof tussen zijn eigen rij en de andere rijen, plus een videoresultaat, en ook geen calibratiecijfer. Geen van beide kaarten bevat een Brier-score of een getal voor de verwachte calibratiefout voor het model dat ze beschrijven. Voor twee producten waarvan de hele waardepropositie is dat het geretourneerde getal iets betekent, is dat de gedeelde lacune, en het is het nuttigste dat een van beide leveranciers hierna zou kunnen uitbrengen.

Distributie bepaalt meer dan het specificatieblad.
Dit is waar de vergelijking niet meer over modellen gaat.
Met d3-flash krijg je gewichten, een decision_config.json die de basisrevisie vastpint, een SHA-256-manifest per bestand, aangepaste modelleercode, een readout-head, en een gedocumenteerde set afhankelijkheden die onder meer het volgende omvat: transformers==5.17.0 en een optioneel CUDA-kernelpakket voor de linear-attention-lagen. Je kunt het op je eigen hardware draaien, fine-tunen, kwantiseren, air-gappen. Je neemt ook het operationele werk op je: een Python-klasse is geen endpoint, en de modelkaart vermeldt geen tokenbudget voor toestand plus vragen plus kandidaatbeschrijvingen — max_length is null in de meegeleverde config, dus dat plafond is aan jou om te ontdekken.
Met Microsoft-Decision-1 krijg je een endpoint binnen een bestaand cloudaccount, met de authenticatie, regionale beschikbaarheid en provisioning-controles die daarbij horen, en je krijgt niets van het operationele werk. Ook krijg je geen enkele controle. Er is geen repository om te downloaden, geen pad voor fine-tuning en geen selfhostingoptie; de levenscyclus van het model is die van Microsoft, niet die van jou, en een deprecatieaankondiging of een rebase op een andere backbone is een verandering die je ondergaat in plaats van er een die je inplant. Microsoft heeft gezegd dat er een rebase naar zijn eigen MAI-modellen aankomt, wat een redelijke roadmap is voor een model waarvan het hele punt snelle single-pass scoring is, en wat ook betekent dat het specifieke checkpoint dat je hebt gebenchmarkt niet noodzakelijk hetzelfde is als het model dat je over een jaar aanroept.
Het latencyverhaal moet ook zorgvuldig worden gelezen. Microsofts kopcijfer is een ratio ten opzichte van een veel groter model voor algemene doeleinden, wat de juiste vergelijking is voor zijn argument — de taak van een beslissingsmodel is om een kostbare generatieve aanroep te vervangen door een goedkope score-aanroep, en 35x ten opzichte van GPT-6 Sol bij p50 is hoe dat argument eruitziet wanneer het aanslaat. De cijfers van vLLM-SR zijn absoluut, voor één verzoek en één GPU, en ze tonen de modaliteitsheffing onverbloemd: op één AMD Instinct MI325X heeft een tekstverzoek aan d3-flash een mediane latentie van 19,1 ms, hetzelfde verzoek met een afbeelding 149,4 ms, en met een video van tien seconden 407,6 ms. Beide reeksen zijn door de leverancier gerapporteerd, op verschillende hardware, en geen van beide is gereproduceerd buiten het lab dat ze heeft geproduceerd.

Hoe te kiezen
De beslissingsregel is kort, wat een goed teken is dat de twee producten niet echt om dezelfde plek concurreren.
Kies Microsoft-Decision-1 als de beslissing alleen tekst betreft, als je al op Foundry draait, en als het feit dat het een aanroep is in plaats van een deployment het hele punt is — geen GPU om te kopen, geen container om te beheren, geen modellifecycle om te bezitten. Het ondersteunende materiaal van Microsoft is voor een platformteam ook het bruikbaardere van de twee: de perturbaties, de aantallen veiligheidstests en de verklaring dat een abstentieoptie wordt ondersteund, zijn precies wat je nodig hebt om een drempelbeleid te schrijven, en het plafond van 32.768 tokens wordt vermeld in plaats van leeggelaten.
Kies Decision 3.0 — realistisch gezien d3-flash of d3-mini — als enig deel van de beslissing afhangt van een afbeelding of een clip, als je het ergens moet draaien waar een gehoste API niet bij kan, of als je de scorer wilt fine-tunen op je eigen gelabelde gevallen. De Apache-2.0-licentie en het hashmanifest op bestandsniveau maken dat een echte optie in plaats van een theoretische. Wat je ervoor terugkrijgt, is een niet nader gespecificeerd inputbudget, geen gepubliceerde kalibratie, en het feit dat de familie pas een paar dagen oud is en er vrijwel geen extern gebruik achter zit.
Als je beide nodig hebt — een gehoste scorer voor de routine en een self-hosted voor de multimodale of air-gapped gevallen, aangeroepen via dezelfde interface — dan is het eerlijke antwoord dat geen enkele leverancier je dat momenteel biedt, en de twee aanvraagformaten lijken genoeg op elkaar om te verenigen, maar zijn niet identiek.
Waar OrcaRouter staat, en waar niet.
typesafe/jev-1.13 is het beslissingsmodel in onze catalogus, aangeboden via POST /v1/systemone met hetzelfde contract voor state en benoemde vragen dat beide bovenstaande modellen implementeren: tekst erin, gestructureerde JSON eruit, tot ongeveer 64K inputtokens, niet-streaming, $0,042 per miljoen inputtokens, zonder kosten voor completions omdat het er nooit een produceert. Opvallend genoeg wordt de Android-achtige vraag over het tokenbudget, die geen van beide bovenstaande kaarten volledig beantwoordt, hier beantwoord.
Wij bieden geen van beide modellen in deze vergelijking aan. De checkpoints van Decision 3.0 worden geleverd als een lokaal inferentiepad in een Hugging Face-repository in plaats van als een routeerbaar endpoint, en Microsoft-Decision-1 wordt gedistribueerd via Microsofts eigen platform en verschillende platforms van derden — niet via ons. Niets hierin mag worden opgevat als een beschikbaarheidsclaim voor een van beide.
Wat de routeringslaag in deze beslissing werkelijk waard is, zit in de andere helft van de lus. Een scorer is per definitie goedkoop; het model dat op zijn output reageert niet, en een beslissingsmodel koppelen aan een generatief model betekent normaal gesproken twee integraties, twee factureringsrelaties en twee storingsmodi. Beide aanroepen via één sleutel over meer dan 200 modellen — met automatische failover wanneer een provider hapert, en de lijstprijs van de provider doorgegeven tegen 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag live is — betekent dat je de scorer kunt vervangen zonder de aanroepzijde aan te raken. Dat is hier meer dan gebruikelijk van belang, omdat beide modellen zo vroeg in hun ontwikkeling zijn dat de beslissing die je deze week neemt er een is die je volgende maand moet kunnen terugdraaien.

De vraag die dit over zes maanden beslist
Twee teams hebben in dezelfde week hetzelfde basischeckpoint na-getraind tot hetzelfde type product en kwamen tot tegenovergestelde conclusies over hoe het bij een klant terecht zou moeten komen. Dat is niet zozeer een toevalligheid van timing als wel een splitsing in hoe de categorie wordt verkocht: als gewichten of als een dienst, als iets dat je bezit of iets dat je aanroept.
Let op drie signalen. Of Microsofts overstap naar MAI of naar zijn eigen modellen het nauwkeurigheids- en latentiegedrag verandert dat het momenteel verkoopt — en hoeveel voorafgaande kennisgeving klanten krijgen. Of vLLM-SR een inputbudget en een kalibratiecijfer voor Decision 3.0 publiceert, waarmee de kloof wordt gedicht die maakt dat zijn index niet bruikbaar is. En of iemand buiten een van beide labs de publieke suite draait op de vrijgegeven d3-gewichten, want op dit moment is het enige getal dat deze vergelijking zou beslechten er een dat geen van beide leveranciers heeft geproduceerd.
