
Microsoft-Decision-1: Het Microsoft-model dat antwoordt met een getal in plaats van een zin
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Microsoft-Decision-1 heeft een regel in zijn modelkaart die geen enkel ander Microsoft-model ooit heeft gehad: niet ontworpen voor tekstgeneratie. Het model werd op Microsoft Foundry algemeen beschikbaar op 8 oktober 2026, en het is een bewuste vernauwing van waarvoor een taalmodel dient. Je geeft het een situatie en een vraag met een vaste lijst antwoorden — ja/nee, een meerkeuzeset, een beoordelingsschaal, een rubric — en het retourneert een gekalibreerde waarschijnlijkheid voor elke optie. Geen proza. Geen uitleg. Geen motivatieveld. De uitvoer bestaat uit JSON-getallen en niets anders. Het is gebouwd op het open-weightmodel Qwen3.5-9B, post-getraind door Microsoft, en Microsoft zegt dat het het model later op andere backbones opnieuw zal baseren, waarbij het MAI en andere partnermodellen noemt.
Dat is een vreemder product dan het in eerste instantie klinkt. De concurrentiepositie van Microsoft in 2026 berust op frontier-chatmodellen en op Copilot, en Microsoft-Decision-1 is het tegenovergestelde van beide: een middelgrote scorer voor één enkel doel, wiens hele taak erin bestaat een applicatie te vertellen welke van jouw eigen opties het meest waarschijnlijk correct is, en hoe zeker hij daarvan is. De interessante vraag is niet of hij goed is in schrijven — dat is hij expliciet niet en hij probeert het ook niet — maar of een kansverdeling over opties een bruikbaarder primitief is voor de workloads die bedrijven daadwerkelijk draaien dan nog een general-purpose model met een JSON-modus.
Wat het precies doet
Het contract is één aanroep erin, één distributie eruit. Microsoft vermeldt de ondersteunde vraagformaten als ja/nee, meerkeuze, beoordeling, classificatie en rubric-gebaseerd. Elke optie krijgt een score. Het model draait in één enkele aanroep op invoer van maximaal 32K tokens — 32.768 is het opgegeven contextvenster — en het praktische plafond is de invoer plus de optieset, niet een generatiebudget, want er is geen generatie.
De gepubliceerde use cases zijn precies degene die een platformteam meteen zou herkennen:
• Evaluatie van AI-uitvoer — beoordeel een gegenereerd antwoord aan de hand van een aangeleverde rubric, of bepaal of het gegrond is in het bewijsmateriaal dat het heeft gekregen.
• Classificatie en routering — een verzoek classificeren, de relevantie beoordelen, een wachtrij triageren, een workflow-tak kiezen.
• Agent-guardrails — beoordeel een voorgestelde toolaanroep of agentactie voordat de integrerende applicatie deze laat uitvoeren.
• Screening op inhoudsveiligheid — markeer inhoud op basis van drempelwaarden die de applicatie zelf bepaalt, in plaats van een vast leveranciersbeleid.
• Zoeken en documentrelevantie — beoordeel of een document een vraag beantwoordt.
• Automatisering op basis van betrouwbaarheid — resultaten met hoge betrouwbaarheid automatisch accepteren en de rest escaleren naar een mens.
De abstentieoptie is het detail dat het opmerken waard is. Microsoft ondersteunt expliciet opties zoals "cannot tell" wanneer het aangeleverde bewijs onvoldoende is, en dat is het verschil tussen een scorer die gekalibreerd is en een die slechts zelfverzekerd is. En omdat scores als getallen terugkomen, is de escalatiedrempel een beslissing die je zelf neemt — jij bepaalt waar 0,7 iets naar een persoon stuurt en 0,95 niet.
Wat het niet zal doen
Microsoft is ongewoon expliciet over de uitsluitingen, en die zijn belangrijker dan de functielijst voor iedereen die dit voor een echte pipeline inschat.niet ontworpen voor tekstgeneratie, open vraagbeantwoording, gesprekken, vertaling of samenvatting. Het is niet bedoeld voor taken zonder een gesloten vraag en een gedefinieerde set antwoordopties, of voor taken die kennis vereisen die niet in de invoer aanwezig is. Het is alleen tekst: geen afbeeldingen, audio of video erin, niets eruit. Het geeft geen uitleg of onderbouwing.
Lees je die samen, dan verschijnt er een grens die gemakkelijk te overtreden is. Dit is geen chatbot die je ook kunt vragen om dingen te classificeren, en het is geen samenvatter waar je een score aan kunt koppelen. Het is een scoringsfunctie met een tokenbudget. De eigen framing van het team — dat het niet de enige geautomatiseerde besluitvormer mag zijn bij beslissingen over mensen, en niet de enige basis mag zijn voor beslissingen met betrekking tot krediet, huisvesting, verzekeringen, onderwijs, gezondheidszorg, juridische "of gerechtelijke domeinen" — wijst dezelfde kant op. Het is bedoeld om naast een beslissing te staan, niet om de beslissing te zijn.

De benchmarksituatie is het verhaal dat niemand wil publiceren
Er zijn geen cijfers. De cataloguspagina van Microsoft Foundry voor Microsoft-Decision-1 heeft een tabblad Benchmarks, en dat bevat geen enkel cijfer. Wat er in plaats daarvan staat, is een alinea over methodologie en een kwalitatieve bewering: het model is "geëvalueerd op publieke en community-beslissingsbenchmarks en op interne, achtergehouden testsets die niet in de training zijn gebruikt," Microsoft meldt dat het "presteert op het niveau van toonaangevende beslissingsmodellen en voorloopt op andere open beslissingsmodellen die met dezelfde methodologie zijn geëvalueerd," en de gebruikte metrieken waren nauwkeurigheid, kalibratiefout, veiligheidsrecall, percentages fout-positieven en eerlijkheidsconsistentie, waarbij de optievolgorde werd gevarieerd en gepaarde statistische toetsen werden toegepast.

Dat is een serieuze methodologiebeschrijving die aan nul gepubliceerde resultaten is gekoppeld. Het betekent dat elke prestatieclaim over Microsoft-Decision-1 vandaag door de leverancier is gerapporteerd en niet is gereproduceerd, en de eerlijke positie voor iedereen die het beoordeelt, is dat de kalibratie — de enige eigenschap die een waarschijnlijkheid überhaupt nuttig maakt — buiten Microsoft niet is geverifieerd. Het bedrijf noemt wel waar het model het sterkst en het zwakst is, wat nuttiger is dan een opvallende totaalscore: het sterkst in redeneren, toepassing van regels en robuustheid tegen de opmaak van prompts; competitief in classificatie, retrieval, eerlijkheid, toolgebruik en de meeste meertalige taken; zwakker in gespecialiseerde domeinkennistaken.
De zelfgerapporteerde beperkingen zijn het lezen waard voordat je de functielijst bekijkt. Scores kunnen verschuiven met formulering en optiebeperkingen. Kalibratie is het sterkst op de functielijst. Het kan afhankelijk zijn van verouderde kennis, en het geeft geen uitleg. Over meertalige dekking: er worden 25 talen als ondersteund vermeld, waaronder Japans, Koreaans, Arabisch, Vietnamees, Thai, Turks, Hindi, Bengaals, Swahili, Hebreeuws, Perzisch en Oekraïens, maar Microsoft stelt dat dekking, kwaliteit en kalibratie "per taal kunnen verschillen", en noemt niet-Engels — vooral laagresource-talen — als een gebied van onderprestatie. Het onderliggende Qwen3.5-9B ondersteunt meer dan 200 talen; het nagetrainde model ondersteunt een kwart daarvan.
Hoe je het krijgt, en wat het kost
Microsoft-Decision-1 wordt gedistribueerd als een gehoste API in Microsoft Foundry binnen het portfolio "Direct from Azure". Modelgewichten worden niet gedistribueerd — dit is geen open-weights-release, en er is geen Hugging Face-repository om het te downloaden. Elke applicatie die HTTPS-verzoeken kan verzenden, kan integreren met behulp van de Foundry-eindpunten en standaard Azure-authenticatie. De implementatievermelding toont serverloze en unified-endpointopties op pay-as-you-go of gereserveerde ingerichte doorvoer, standaard-SKU, met batch-inferentie uitgeschakeld, en de trainingsopenbaarmaking meldt dat de trainingsdataset voor het eerst is gebruikt in september 2026, terwijl de verzameling nog gaande is.
Prijzen worden niet gepubliceerd op de modelpagina. Het prijsveld van de catalogus linkt naar de modelprijspagina van Microsoft in plaats van een invoer- en uitvoertarief te vermelden, dus de kosten per token van een Decision-1-aanroep moet je opzoeken in de prijsomgeving van Azure of aflezen van een factuur. Dat is een echt gat voor iedereen die kosten per beslissing op volume wil modelleren, en het is de moeite waard om het gewoon te zeggen in plaats van te schatten. Twee dingen zijn het weten waard wanneer je het wel prijst: 0% van de kosten zijn outputtokens, omdat die er niet zijn, en batch-inferentie is uitgeschakeld, dus je kunt een bulk-scoringsrun niet via het batchkanaal amortiseren zoals je bij een generatief model zou doen.
Waar OrcaRouter hierin past, is aan de andere kant van de call. Wij hosten Microsoft-Decision-1 niet, en het staat niet in onze catalogus — een model dat waarschijnlijkheden teruggeeft in plaats van tekst is geen model waar je chat completions naartoe routeert. Wat wij wél aanbieden is de helft van het patroon die genereert: de modellen die de rubric schrijven, de kandidaat-antwoorden opstellen, of de tool call produceren die Decision-1 vervolgens beoordeelt. Die zitten achter één OpenAI-compatibele sleutel met meer dan 200 modellen erop, tegen de lijstprijs van de provider, doorgegeven met 0% markup, dus een prijsverlaging van een leverancier voor een judge-model is dezelfde dag bij ons actief. Als je een evaluatielus bouwt waarin het ene model schrijft en het andere beoordeelt, gaat de beoordelingscall naar Microsoft en kan de generatiecall overal naartoe — ook via de routing-DSL, die meerdere modellen samenvoegt tot één call wanneer je een panel wilt in plaats van een enkele judge.

Waarom een scorer een andere inzet is dan een betere chatbot
Het patroon dat Microsoft hier verkoopt, bestaat al in het openbaar. InternLM's Intern-Decision-4B, Liquid AI's d1-3B, Convai Innovations' Laya en de Kev-familie van Jared Palmer geven allemaal gekalibreerde verdelingen over aangeleverde opties terug zonder tekst te genereren, en de meeste ervan zijn Apache-2.0-gewichten die je gratis op je eigen hardware kunt draaien. De oplossing van Microsoft verschilt op drie punten die niet van benchmarks afhangen: het is een managed API met Azure-authenticatie, facturering en governance eraan gekoppeld, zodat het in een enterprise-inkooppad past waarin een Hugging Face-download niet past; de basis is een 9B-model, groter dan de meeste in dat veld; en het wordt geleverd met een Responsible AI-assessment en een gedocumenteerde evaluatiemethodologie, wat vaak de werkelijke drempelvoorwaarde is voor een gereguleerde implementatie.
Wat er niet bij zit, is een getal. Tegenover open concurrenten die Brier-scores en verwachte kalibratiefout publiceren — de twee cijfers die je vertellen of een 0,8 ook 0,8 betekent — heeft Microsoft een methodologie gepubliceerd en geen resultaten. Zolang er geen onafhankelijke kalibratietests bestaan, is de verdedigbare manier om Microsoft-Decision-1 te gebruiken de manier die de eigen documentatie aanbeveelt: valideer op data die representatief zijn voor jouw gebruiksscenario, stel drempelwaarden in op basis van de kosten van je fouten, neem altijd een optie om je te onthouden op, randomiseer de volgorde van opties waar de volgorde het antwoord zou kunnen vertekenen, en houd een mens in de lus voor alles met ingrijpende gevolgen. Dat is goed advies voor elke scorer. Het is vooral goed advies voor een scorer waarvan niemand buiten het bedrijf de kalibratie heeft gemeten.
