Ett genererat titelkort för jämförelsen av Decision 3.0 och Microsoft-Decision-1, med undertexten ”samma Qwen3.5-9B-ryggrad, motsatta sätt att köpa den”, med brickor som lyder ”vikter Apache-2.0 vs endast hostad”, ”bilder och video vs endast text”, ”publicerad 10 okt vs GA 8 okt”, och en sidfot som lyder ”siffrorna för Decision 3.0 är vLLM-SR:s egna; siffrorna för Microsoft-Decision-1 är Microsofts egna; ingen av dem är oberoende reproducerad.” OrcaRouter-logotypen är sammansatt i det nedre högra hörnet.
Engineering & Research

Decision 3.0 vs Microsoft-Decision-1: Den ena är en nedladdning, den andra är en SKU

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

9B-nivån av Decision 3.0 och Microsoft-Decision-1 är på papperet samma produkt. Båda eftertränar Qwen3.5-9B till en poängsättare som besvarar en fast uppsättning kandidatsvar med en kalibrerad sannolikhet vardera, utan att någonsin generera en token. Båda är inriktade på samma uppgifter – att routa en förfrågan, att betygsätta utdata mot en bedömningsmall, att gate:a en agentåtgärd, att triagera en kö. Båda släpptes inom en vecka från varandra: Microsoft-Decision-1 blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026 och tillkännagavs dagen därpå, och d3-flash laddades upp till Hugging Face kl. 17:23 UTC den 10 oktober 2026.

Skillnaden är inte modellen. Det är vad du får göra med den. d3-flash är en Apache-2.0-checkpoint med 8,39 miljarder parametrar som du laddar ner och kör, och den ligger på tredje plats i en familj som börjar på 0,59B och toppar på 26,09B. Microsoft-Decision-1 är en hostad slutpunkt på Foundry, med vikter som inte distribueras alls, i en serie som Microsoft säger att de senare kommer att rebasa över på sina egna MAI-modeller. En av dessa är en artefakt; den andra är en tjänst. Nästan varje praktisk fråga om paret följer av det enda faktumet, inklusive de som ser ut att handla om benchmarks.

Två beslut om vad en beslutsmodell är till för

Microsofts inlägg är explicit om omfattningen på ett sätt som modellkort sällan är. De frågeformat som stöds är ja/nej, flerval, betygssättning, klassificering och rubrikbaserad bedömning. De uteslutna uppgifterna listas lika tydligt: inte för textgenerering, besvarande av öppna frågor, konversation, översättning eller sammanfattning, och inte avsedda för uppgifter som kräver kunskap som saknas i indata. Den gör en enda genomkörning över upp till 32 768 och avger noll utdatatokens eftersom det inte finns någon avkodningsslinga. Microsoft har också ett alternativ för att avstå, såsom "kan inte avgöra", när det underlag som tillhandahålls är otillräckligt, vilket är detaljen som överhuvudtaget gör det möjligt att tillämpa tröskelvärden på utdata.

d3-flash sitter i samma konceptuella box — Choice-, Noul- (ja/nej) och Score-frågor, en framåtpassning per fråga, en sannolikhet per alternativ, ingen generering — och breddar sedan ingångssidan. Där Microsoft-Decision-1 är enbart text till sin design, tar d3-flash emot text eller JSON, flera bilder per begäran på upp till 1,6 megapixlar vardera, och flera videor som läses med 2 bildrutor per sekund. Varje fråga i en begäran ser alla bilder och videor som är bifogade till den. Det är en mindre modell som gör mer med den input den får.

Det är den första verkliga skiljelinjen, och det är inte en fråga om tycke och smak. Om beslutet du behöver fatta handlar om en skärmbild, ett kvitto, ett diagram eller ett klipp från en kamera, kan Microsoft-Decision-1 inte fatta det. Det är en kapacitetsgräns, inte ett kvalitetsgap, och ingen mängd noggrannhetsarbete kan stänga den.

Vad var och en publicerar, och hur

Här utför de två utgåvorna genuint olika typer av bevis, och det är värt att hålla dem åtskilda snarare än att rada upp siffror.

Microsoft genomförde en jämförelse av 36 benchmarks som omfattade nästan 150 000 frågor som hölls undan från träningen, och täckte routing, rangordning, lång kontext, flerspråkiga och out-of-distribution-uppgifter, resonemang och säkerhet, och uppger att dess modell kom ut bäst i dessa uppsättningar. Den rapporterar latens som ett förhållande i stället för ett tal – p50 omkring 35 gånger snabbare än GPT-6 Sol, och 2,5 gånger snabbare än H2O-Lightning-4B v1.1, som den utser till tvåan. Den dokumenterar robusthet som en procedur: samma förfrågan perturberad på åtta sätt, en genomsnittlig beslutsvändningsfrekvens på 1,3 %, och noll vändningar när alternativbeskrivningar parafraseras eller alternativ omkastas eller blandas. Den testade säkerheten på 5 250 förfrågningar över 11 benchmarks som täckte skadligt innehåll, jailbreaking och prompt injection. Den anger den kalibreringsstandard som den håller sig till – en förutsägelse på 90 % bör stämma ungefär nio gånger av tio i representativa fall.

vLLM-SR publicerade ett index. Jev Decision Index 0.3.1 placerar d3 på 64,7 med d3-flash på public-suite 57,79, en påstådd förbättring på 11,0 jämfört med Decision 2.0:s 9B-modell på 46,76. Det hävdar också att alla 140 178 offentliga förfrågningar besvarades utan att någon saknade stöd, vilket är ett påstående om täckning snarare än om noggrannhet. Kortet avslöjar att d3:s egen rad är en intern utvärdering medan jämförelseraderna bredvid — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — är livedata från resultattavlan. Och på den multimodala sidan rapporterar modeller i d3-familjen Perception Test-poäng på alla 19 140 valideringsfrågor, med d3-flash på 73,3 mot en slumpnivå på 33,3 för tre alternativ.

Så: Microsoft publicerar ett anspråk på bredd med en dokumenterad metod och ett robusthetstal, och ingen kalibreringssiffra per checkpoint. vLLM-SR publicerar en topplisteposition med ett uttalat proveniensgap mellan sin egen rad och de andras, plus ett videoresultat, och inte heller någon kalibreringssiffra. Inget av korten innehåller en Brier-poäng eller ett värde för förväntat kalibreringsfel för den modell det beskriver. För två produkter vars hela värdeerbjudande är att det returnerade talet betyder något, är det det gemensamma hålet, och det är det enskilt mest användbara som endera leverantören skulle kunna släppa härnäst.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

Distributionen avgör mer än vad databladet gör.

Det är här jämförelsen slutar handla om modeller.

Med d3-flash får du vikter, en decision_config.json som låser basrevisionen, ett SHA-256-manifest per fil, anpassad modelleringskod, ett utläsningshuvud och en dokumenterad uppsättning beroenden som inkluderar transformers==5.17.0 och ett valfritt CUDA-kärnpaket för linjära uppmärksamhetslager. Du kan köra det på din egen hårdvara, finjustera det, kvantisera det, luftgapa det. Du tar också på dig det operativa arbetet: en Python-klass är inte en endpoint, och kortet anger inte en tokenbudget för tillstånd plus frågor plus kandidatbeskrivningar — max_length är null i den medföljande konfigurationen, så det taket är ditt att upptäcka.

Med Microsoft-Decision-1 får du en slutpunkt i ett befintligt molnkonto, med autentiseringen, den regionala tillgängligheten och de provisioneringskontroller som ingår, och du slipper allt det operativa arbetet. Du får inte heller någon kontroll. Det finns inget arkiv att ladda ner, ingen väg för finjustering och inget alternativ för egen hosting; modellens livscykel är Microsofts, inte din, och ett avvecklingsbesked eller en ombasering till en annan stomme är en förändring du får absorbera i stället för en du kan schemalägga. Microsoft har sagt att en ombasering till Microsofts egna MAI-modeller är på väg, vilket är en rimlig färdplan för en modell vars hela poäng är snabb poängsättning i ett enda pass, och innebär också att den specifika checkpoint du benchmarkade inte nödvändigtvis är den du kommer att anropa om ett år.

Latensberättelsen behöver också läsas noggrant. Microsofts rubriksiffra är en kvot mot en mycket större allmänmodell, vilket är den korrekta jämförelsen för deras argument – en beslutsmodells uppgift är att ersätta ett kostsamt generativt anrop med ett billigt scoringsanrop, och 35x mot GPT-6 Sol vid p50 är hur det argumentet ser ut när det landar. vLLM-SR:s siffror är absoluta, för enskild begäran och enskild GPU, och de visar modalitetsskatten tydligt: på en AMD Instinct MI325X tar en textbegäran till d3-flash i median 19,1 ms, samma begäran med en bild tar 149,4 ms, och med en tio sekunder lång video 407,6 ms. Båda uppsättningarna är leverantörsrapporterade, på olika hårdvara, och ingen av dem har reproducerats utanför laboratoriet som tog fram den.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Hur man väljer

Beslutsregeln är kort, vilket är ett gott tecken på att de två produkterna faktiskt inte konkurrerar om samma plats.

Välj Microsoft-Decision-1 om beslutet enbart är textbaserat, om du redan kör på Foundry, och om själva poängen är att det är ett anrop snarare än en driftsättning — ingen GPU att köpa, ingen container att driva, ingen modellivscykel att äga. Microsofts stödmaterial är också det mer användbara av de två för ett plattformsteam: perturbationerna, antalet säkerhetstester och uppgiften att ett alternativ för att avstå stöds är det du behöver för att skriva en tröskelpolicy, och taket på 32 768 token anges i stället för att lämnas tomt.

Välj Decision 3.0 — realistiskt sett d3-flash eller d3-mini — om någon del av beslutet beror på en bild eller ett klipp, om du behöver köra det någonstans dit ett hostat API inte når, eller om du vill finjustera scorern på dina egna märkta fall. Apache-2.0-licensen och hashmanifestet på filnivå gör det till ett verkligt alternativ snarare än ett teoretiskt. Vad du accepterar i utbyte är en oredovisad indatabudget, ingen publicerad kalibrering och det faktum att familjen är några dagar gammal med i stort sett ingen extern användning bakom sig.

Om du behöver båda – en hostad scorer för den rutinmässiga textvägen och en egenhostad för de multimodala eller luftgapade fallen, som anropas via samma gränssnitt – så är den ärliga ståndpunkten att ingen leverantör för närvarande ger dig det, och de två förfrågningsformaten är tillräckligt lika för att kunna förenas men inte identiska.

Var OrcaRouter passar in, och var det inte gör det

typesafe/jev-1.13 är beslutsmodellen i vår katalog, som tillhandahålls via POST /v1/systemone med samma kontrakt för tillstånd och namngivna frågor som båda modellerna ovan implementerar: text som indata, strukturerad JSON som utdata, upp till ungefär 64K indatatokener, icke-strömmande, 0,042 USD per miljon indatatokener utan avgift för completion eftersom den aldrig producerar någon. Anmärkningsvärt nog besvaras här den Android-liknande frågan om tokenbudget som ingen av korten ovan besvarar fullt ut.

Vi tillhandahåller inte någon av modellerna i den här jämförelsen. Decision 3.0:s checkpoints levereras som en lokal inferensväg i ett Hugging Face-arkiv snarare än en dirigerbar slutpunkt, och Microsoft-Decision-1 distribueras via Microsofts egen plattform och flera tredjepartsplattformar – inte via oss. Ingenting här bör tolkas som ett tillgänglighetsanspråk för någon av dem.

Vad routningslagret faktiskt är värt i det här beslutet ligger på den andra halvan av loopen. En scorer är billig till sin konstruktion; modellen som agerar på dess utdata är det inte, och att para ihop en beslutsmodell med en generativ sådan innebär normalt två integrationer, två faktureringsrelationer och två felmoder. Att anropa båda via en enda nyckel över 200-plus modeller — med automatisk redundansväxling när en leverantör vacklar, och leverantörens listpris som förs vidare med 0 % påslag så att en ändring i leverantörspriset slår igenom samma dag — innebär att du kan byta ut scorern utan att röra anropsstället. Det spelar större roll än vanligt här, eftersom båda dessa modeller är tillräckligt tidiga för att beslutet du fattar den här veckan bör gå att ångra nästa månad.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

Frågan som avgör detta om sex månader

Två team eftertränade samma bas-checkpoint till samma typ av produkt under samma vecka och drog motsatta slutsatser om hur den borde nå en kund. Det är inte så mycket ett sammanträffande i tajmingen som en klyvning i hur kategorin säljs: som vikter eller som en tjänst, som något du äger eller något du anropar.

Håll utkik efter tre signaler. Om Microsofts ombasering till MAI eller till Microsofts egna modeller förändrar det noggrannhets- och latensbeteende som man för närvarande säljer — och hur mycket förvarning kunderna får. Om vLLM-SR publicerar en indatabudget och ett kalibreringsvärde för Decision 3.0, vilket stänger gapet som gör att dess index inte går att agera på. Och om någon utanför de två labben kör den offentliga sviten på de släppta d3-vikterna, eftersom den enda siffra som just nu skulle avgöra den här jämförelsen är en som ingen av leverantörerna har tagit fram.