
Decision 3.0 vs Microsoft-Decision-1: Den ena är en nedladdning, den andra är en SKU
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 71 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
9B-nivån av Decision 3.0 och Microsoft-Decision-1 är på papperet samma produkt. Båda eftertränar Qwen3.5-9B till en poängsättare som besvarar en fast uppsättning kandidatsvar med en kalibrerad sannolikhet vardera, utan att någonsin generera en token. Båda är inriktade på samma uppgifter – att routa en förfrågan, att betygsätta utdata mot en bedömningsmall, att gate:a en agentåtgärd, att triagera en kö. Båda släpptes inom en vecka från varandra: Microsoft-Decision-1 blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026 och tillkännagavs dagen därpå, och d3-flash laddades upp till Hugging Face kl. 17:23 UTC den 10 oktober 2026.
Skillnaden är inte modellen. Det är vad du får göra med den. d3-flash är en Apache-2.0-checkpoint med 8,39 miljarder parametrar som du laddar ner och kör, och den ligger på tredje plats i en familj som börjar på 0,59B och toppar på 26,09B. Microsoft-Decision-1 är en hostad slutpunkt på Foundry, med vikter som inte distribueras alls, i en serie som Microsoft säger att de senare kommer att rebasa över på sina egna MAI-modeller. En av dessa är en artefakt; den andra är en tjänst. Nästan varje praktisk fråga om paret följer av det enda faktumet, inklusive de som ser ut att handla om benchmarks.
Två beslut om vad en beslutsmodell är till för
Microsofts inlägg är explicit om omfattningen på ett sätt som modellkort sällan är. De frågeformat som stöds är ja/nej, flerval, betygssättning, klassificering och rubrikbaserad bedömning. De uteslutna uppgifterna listas lika tydligt: inte för textgenerering, besvarande av öppna frågor, konversation, översättning eller sammanfattning, och inte avsedda för uppgifter som kräver kunskap som saknas i indata. Den gör en enda genomkörning över upp till 32 768 och avger noll utdatatokens eftersom det inte finns någon avkodningsslinga. Microsoft har också ett alternativ för att avstå, såsom "kan inte avgöra", när det underlag som tillhandahålls är otillräckligt, vilket är detaljen som överhuvudtaget gör det möjligt att tillämpa tröskelvärden på utdata.
d3-flash sitter i samma konceptuella box — Choice-, Noul- (ja/nej) och Score-frågor, en framåtpassning per fråga, en sannolikhet per alternativ, ingen generering — och breddar sedan ingångssidan. Där Microsoft-Decision-1 är enbart text till sin design, tar d3-flash emot text eller JSON, flera bilder per begäran på upp till 1,6 megapixlar vardera, och flera videor som läses med 2 bildrutor per sekund. Varje fråga i en begäran ser alla bilder och videor som är bifogade till den. Det är en mindre modell som gör mer med den input den får.
Det är den första verkliga skiljelinjen, och det är inte en fråga om tycke och smak. Om beslutet du behöver fatta handlar om en skärmbild, ett kvitto, ett diagram eller ett klipp från en kamera, kan Microsoft-Decision-1 inte fatta det. Det är en kapacitetsgräns, inte ett kvalitetsgap, och ingen mängd noggrannhetsarbete kan stänga den.
Vad var och en publicerar, och hur
Här utför de två utgåvorna genuint olika typer av bevis, och det är värt att hålla dem åtskilda snarare än att rada upp siffror.
Microsoft genomförde en jämförelse av 36 benchmarks som omfattade nästan 150 000 frågor som hölls undan från träningen, och täckte routing, rangordning, lång kontext, flerspråkiga och out-of-distribution-uppgifter, resonemang och säkerhet, och uppger att dess modell kom ut bäst i dessa uppsättningar. Den rapporterar latens som ett förhållande i stället för ett tal – p50 omkring 35 gånger snabbare än GPT-6 Sol, och 2,5 gånger snabbare än H2O-Lightning-4B v1.1, som den utser till tvåan. Den dokumenterar robusthet som en procedur: samma förfrågan perturberad på åtta sätt, en genomsnittlig beslutsvändningsfrekvens på 1,3 %, och noll vändningar när alternativbeskrivningar parafraseras eller alternativ omkastas eller blandas. Den testade säkerheten på 5 250 förfrågningar över 11 benchmarks som täckte skadligt innehåll, jailbreaking och prompt injection. Den anger den kalibreringsstandard som den håller sig till – en förutsägelse på 90 % bör stämma ungefär nio gånger av tio i representativa fall.
vLLM-SR publicerade ett index. Jev Decision Index 0.3.1 placerar d3 på 64,7 med d3-flash på public-suite 57,79, en påstådd förbättring på 11,0 jämfört med Decision 2.0:s 9B-modell på 46,76. Det hävdar också att alla 140 178 offentliga förfrågningar besvarades utan att någon saknade stöd, vilket är ett påstående om täckning snarare än om noggrannhet. Kortet avslöjar att d3:s egen rad är en intern utvärdering medan jämförelseraderna bredvid — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — är livedata från resultattavlan. Och på den multimodala sidan rapporterar modeller i d3-familjen Perception Test-poäng på alla 19 140 valideringsfrågor, med d3-flash på 73,3 mot en slumpnivå på 33,3 för tre alternativ.
Så: Microsoft publicerar ett anspråk på bredd med en dokumenterad metod och ett robusthetstal, och ingen kalibreringssiffra per checkpoint. vLLM-SR publicerar en topplisteposition med ett uttalat proveniensgap mellan sin egen rad och de andras, plus ett videoresultat, och inte heller någon kalibreringssiffra. Inget av korten innehåller en Brier-poäng eller ett värde för förväntat kalibreringsfel för den modell det beskriver. För två produkter vars hela värdeerbjudande är att det returnerade talet betyder något, är det det gemensamma hålet, och det är det enskilt mest användbara som endera leverantören skulle kunna släppa härnäst.

Distributionen avgör mer än vad databladet gör.
Det är här jämförelsen slutar handla om modeller.
Med d3-flash får du vikter, en decision_config.json som låser basrevisionen, ett SHA-256-manifest per fil, anpassad modelleringskod, ett utläsningshuvud och en dokumenterad uppsättning beroenden som inkluderar transformers==5.17.0 och ett valfritt CUDA-kärnpaket för linjära uppmärksamhetslager. Du kan köra det på din egen hårdvara, finjustera det, kvantisera det, luftgapa det. Du tar också på dig det operativa arbetet: en Python-klass är inte en endpoint, och kortet anger inte en tokenbudget för tillstånd plus frågor plus kandidatbeskrivningar — max_length är null i den medföljande konfigurationen, så det taket är ditt att upptäcka.
Med Microsoft-Decision-1 får du en slutpunkt i ett befintligt molnkonto, med autentiseringen, den regionala tillgängligheten och de provisioneringskontroller som ingår, och du slipper allt det operativa arbetet. Du får inte heller någon kontroll. Det finns inget arkiv att ladda ner, ingen väg för finjustering och inget alternativ för egen hosting; modellens livscykel är Microsofts, inte din, och ett avvecklingsbesked eller en ombasering till en annan stomme är en förändring du får absorbera i stället för en du kan schemalägga. Microsoft har sagt att en ombasering till Microsofts egna MAI-modeller är på väg, vilket är en rimlig färdplan för en modell vars hela poäng är snabb poängsättning i ett enda pass, och innebär också att den specifika checkpoint du benchmarkade inte nödvändigtvis är den du kommer att anropa om ett år.
Latensberättelsen behöver också läsas noggrant. Microsofts rubriksiffra är en kvot mot en mycket större allmänmodell, vilket är den korrekta jämförelsen för deras argument – en beslutsmodells uppgift är att ersätta ett kostsamt generativt anrop med ett billigt scoringsanrop, och 35x mot GPT-6 Sol vid p50 är hur det argumentet ser ut när det landar. vLLM-SR:s siffror är absoluta, för enskild begäran och enskild GPU, och de visar modalitetsskatten tydligt: på en AMD Instinct MI325X tar en textbegäran till d3-flash i median 19,1 ms, samma begäran med en bild tar 149,4 ms, och med en tio sekunder lång video 407,6 ms. Båda uppsättningarna är leverantörsrapporterade, på olika hårdvara, och ingen av dem har reproducerats utanför laboratoriet som tog fram den.

Hur man väljer
Beslutsregeln är kort, vilket är ett gott tecken på att de två produkterna faktiskt inte konkurrerar om samma plats.
Välj Microsoft-Decision-1 om beslutet enbart är textbaserat, om du redan kör på Foundry, och om själva poängen är att det är ett anrop snarare än en driftsättning — ingen GPU att köpa, ingen container att driva, ingen modellivscykel att äga. Microsofts stödmaterial är också det mer användbara av de två för ett plattformsteam: perturbationerna, antalet säkerhetstester och uppgiften att ett alternativ för att avstå stöds är det du behöver för att skriva en tröskelpolicy, och taket på 32 768 token anges i stället för att lämnas tomt.
Välj Decision 3.0 — realistiskt sett d3-flash eller d3-mini — om någon del av beslutet beror på en bild eller ett klipp, om du behöver köra det någonstans dit ett hostat API inte når, eller om du vill finjustera scorern på dina egna märkta fall. Apache-2.0-licensen och hashmanifestet på filnivå gör det till ett verkligt alternativ snarare än ett teoretiskt. Vad du accepterar i utbyte är en oredovisad indatabudget, ingen publicerad kalibrering och det faktum att familjen är några dagar gammal med i stort sett ingen extern användning bakom sig.
Om du behöver båda – en hostad scorer för den rutinmässiga textvägen och en egenhostad för de multimodala eller luftgapade fallen, som anropas via samma gränssnitt – så är den ärliga ståndpunkten att ingen leverantör för närvarande ger dig det, och de två förfrågningsformaten är tillräckligt lika för att kunna förenas men inte identiska.
Var OrcaRouter passar in, och var det inte gör det
typesafe/jev-1.13 är beslutsmodellen i vår katalog, som tillhandahålls via POST /v1/systemone med samma kontrakt för tillstånd och namngivna frågor som båda modellerna ovan implementerar: text som indata, strukturerad JSON som utdata, upp till ungefär 64K indatatokener, icke-strömmande, 0,042 USD per miljon indatatokener utan avgift för completion eftersom den aldrig producerar någon. Anmärkningsvärt nog besvaras här den Android-liknande frågan om tokenbudget som ingen av korten ovan besvarar fullt ut.
Vi tillhandahåller inte någon av modellerna i den här jämförelsen. Decision 3.0:s checkpoints levereras som en lokal inferensväg i ett Hugging Face-arkiv snarare än en dirigerbar slutpunkt, och Microsoft-Decision-1 distribueras via Microsofts egen plattform och flera tredjepartsplattformar – inte via oss. Ingenting här bör tolkas som ett tillgänglighetsanspråk för någon av dem.
Vad routningslagret faktiskt är värt i det här beslutet ligger på den andra halvan av loopen. En scorer är billig till sin konstruktion; modellen som agerar på dess utdata är det inte, och att para ihop en beslutsmodell med en generativ sådan innebär normalt två integrationer, två faktureringsrelationer och två felmoder. Att anropa båda via en enda nyckel över 200-plus modeller — med automatisk redundansväxling när en leverantör vacklar, och leverantörens listpris som förs vidare med 0 % påslag så att en ändring i leverantörspriset slår igenom samma dag — innebär att du kan byta ut scorern utan att röra anropsstället. Det spelar större roll än vanligt här, eftersom båda dessa modeller är tillräckligt tidiga för att beslutet du fattar den här veckan bör gå att ångra nästa månad.

Frågan som avgör detta om sex månader
Två team eftertränade samma bas-checkpoint till samma typ av produkt under samma vecka och drog motsatta slutsatser om hur den borde nå en kund. Det är inte så mycket ett sammanträffande i tajmingen som en klyvning i hur kategorin säljs: som vikter eller som en tjänst, som något du äger eller något du anropar.
Håll utkik efter tre signaler. Om Microsofts ombasering till MAI eller till Microsofts egna modeller förändrar det noggrannhets- och latensbeteende som man för närvarande säljer — och hur mycket förvarning kunderna får. Om vLLM-SR publicerar en indatabudget och ett kalibreringsvärde för Decision 3.0, vilket stänger gapet som gör att dess index inte går att agera på. Och om någon utanför de två labben kör den offentliga sviten på de släppta d3-vikterna, eftersom den enda siffra som just nu skulle avgöra den här jämförelsen är en som ingen av leverantörerna har tagit fram.
