Una title card generata per il confronto tra Decision 3.0 e Microsoft-Decision-1, con il sottotitolo «stesso backbone Qwen3.5-9B, modi opposti di acquistarlo», con chip che recitano «pesi Apache-2.0 vs solo hosted», «immagini e video vs solo testo», «pubblicato il 10 ott vs GA l'8 ott», e un piè di pagina che recita «i dati di Decision 3.0 sono di vLLM-SR stesso; i dati di Microsoft-Decision-1 sono di Microsoft stessa; nessuno dei due è riprodotto in modo indipendente». Il logo OrcaRouter è composto nell'angolo in basso a destra.
Engineering & Research

Decision 3.0 vs Microsoft-Decision-1: uno è un download, l'altro è uno SKU

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il livello 9B di Decision 3.0 e Microsoft-Decision-1 sono, sulla carta, lo stesso prodotto. Entrambi eseguono il post-training di Qwen3.5-9B per trasformarlo in uno scorer che risponde a un insieme fisso di risposte candidate con una probabilità calibrata ciascuna, senza mai generare un token. Entrambi sono pensati per gli stessi compiti — instradare una richiesta, valutare un output rispetto a una rubrica, decidere se consentire un'azione di un agente, smistare una coda. Entrambi sono usciti a una settimana di distanza l'uno dall'altro: Microsoft-Decision-1 è diventato disponibile in generale su Microsoft Foundry l'8 ottobre 2026 ed è stato annunciato il giorno successivo, e d3-flash è stato caricato su Hugging Face alle 17:23 UTC del 10 ottobre 2026.

La differenza non è il modello. È ciò che ti è consentito fare con esso. d3-flash è un checkpoint Apache-2.0 da 8,39 miliardi di parametri che scarichi ed esegui, e si colloca al terzo posto in una famiglia che parte da 0,59 miliardi e arriva fino a 26,09 miliardi. Microsoft-Decision-1 è un endpoint ospitato su Foundry, con pesi che non vengono affatto distribuiti, in una linea che Microsoft dice che rebaserà sui propri modelli MAI in seguito. Uno di questi è un artefatto; l'altro è un servizio. Quasi ogni domanda pratica sulla coppia deriva da quel singolo fatto, comprese quelle che sembrano riguardare i benchmark.

Due decisioni su a cosa serve un modello decisionale

Il post di Microsoft è esplicito riguardo all'ambito in un modo in cui le schede modello raramente lo sono. Le tipologie di domanda supportate sono sì/no, scelta multipla, rating, classificazione e valutazione basata su rubriche. Le esclusioni sono elencate altrettanto chiaramente: non progettato per la generazione di testo, la risposta a domande aperte, la conversazione, la traduzione o il riepilogo, e non destinato a compiti che richiedono conoscenze assenti dall'input. Esegue una singola passata su un massimo di 32.768 token ed emette zero token di output perché non esiste un ciclo di decodifica. Microsoft supporta anche un'opzione di astensione come "non posso dirlo" quando le prove fornite sono insufficienti, ed è questo il dettaglio che rende davvero significativa l'applicazione di una soglia all'output.

d3-flash si trova nello stesso riquadro concettuale — domande Choice, Noul (sì/no) e Score, un passaggio in avanti per domanda, una probabilità per opzione, nessuna generazione — e poi amplia il lato dell'input. Dove Microsoft-Decision-1 è solo testo per progettazione, d3-flash accetta testo o JSON, più immagini per richiesta fino a 1,6 megapixel ciascuna, e più video letti a 2 fotogrammi al secondo. Ogni domanda in una richiesta vede ogni immagine e video ad essa allegati. È un modello più piccolo che fa di più con l'input che gli viene fornito.

Questa è la prima vera separazione, e non è una questione di gusti. Se la decisione che devi prendere riguarda uno screenshot, uno scontrino, un grafico o una clip proveniente da una telecamera, Microsoft-Decision-1 non può prenderla. Questo è un confine di capacità, non un divario di qualità, e nessuna quantità di lavoro sull'accuratezza può colmarlo.

Che cosa pubblica ciascuno, e come

Qui le due release forniscono tipi di prova genuinamente diversi, e vale la pena separarle anziché allineare i numeri.

Microsoft ha condotto un confronto su 36 benchmark che copre quasi 150.000 domande tenute cieche rispetto al training, coprendo routing, ranking, contesto lungo, compiti multilingue e out-of-distribution, ragionamento e sicurezza, e afferma che il suo modello è risultato il migliore in tutti questi set. Riporta la latenza come rapporto anziché come numero — p50 circa 35 volte più veloce di GPT-6 Sol, e 2,5 volte più rapido di H2O-Lightning-4B v1.1, che indica come secondo classificato. Documenta la robustezza come procedura: la stessa richiesta perturbata in otto modi, un tasso medio di inversione di decisione dell'1,3%, e zero inversioni quando le descrizioni delle opzioni sono parafrasate o le opzioni sono invertite o mescolate. Ha testato la sicurezza su 5.250 richieste attraverso 11 benchmark che coprono contenuti dannosi, jailbreaking e prompt injection. Dichiara lo standard di calibrazione a cui si attiene — una previsione del 90% dovrebbe essere corretta circa nove volte su dieci su casi rappresentativi.

vLLM-SR ha pubblicato un indice. Il Jev Decision Index 0.3.1 colloca d3 a 64,7 con d3-flash a 57,79 nella public-suite, un guadagno dichiarato di 11,0 rispetto al modello 9B di Decision 2.0 a 46,76. Dichiara inoltre che tutte le 140.178 richieste pubbliche hanno ricevuto risposta senza nessuna non supportata, il che è un'affermazione di copertura più che di accuratezza. La scheda rivela che la riga di d3 è una valutazione interna, mentre le righe di confronto accanto ad essa — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — sono dati del board dal vivo. E sul fronte multimodale, i modelli della famiglia d3 riportano punteggi del Perception Test su tutte le 19.140 domande di validazione, con d3-flash a 73,3 contro una soglia casuale di 33,3 su tre opzioni.

Dunque: Microsoft pubblica un'affermazione di ampiezza con un metodo documentato e un numero di robustezza, ma nessun dato di calibrazione per singolo checkpoint. vLLM-SR pubblica una posizione in classifica con una dichiarata lacuna di provenienza tra la propria riga e le altre, più un risultato video, e nemmeno un dato di calibrazione. Nessuna delle due schede riporta un punteggio di Brier o un numero di errore di calibrazione atteso per il modello che descrive. Per due prodotti la cui intera proposta di valore è che il numero restituito significhi qualcosa, questo è il buco condiviso, ed è la cosa più utile che l'uno o l'altro fornitore potrebbe rilasciare in seguito.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

La distribuzione è più decisiva della scheda tecnica

È qui che il confronto smette di riguardare i modelli.

Con d3-flash ottieni i pesi, un decision_config.json che fissa la revisione di base, un manifest SHA-256 per file, codice di modellazione personalizzato, una testa di readout e un insieme documentato di dipendenze che include transformers==5.17.0 e un pacchetto opzionale di kernel CUDA per i layer di attenzione lineare. Puoi eseguirlo sul tuo hardware, metterlo a punto, quantizzarlo, isolarlo in air gap. Ti assumi anche il lavoro operativo: una classe Python non è un endpoint, e la scheda non indica un budget di token per stato più domande più descrizioni dei candidati — max_length è null nella configurazione distribuita, quindi spetta a te scoprire quel limite.

Con Microsoft-Decision-1 ottieni un endpoint all'interno di un account cloud esistente, con l'autenticazione, la disponibilità regionale e i controlli di provisioning che ne fanno parte, e non devi svolgere alcun lavoro operativo. Inoltre, non hai alcun controllo. Non c'è alcun repository da scaricare, nessun percorso di fine-tuning e nessuna opzione di self-hosting; il ciclo di vita del modello è di Microsoft, non tuo, e un avviso di deprecazione o un rebase su un backbone diverso è un cambiamento che subisci anziché uno che pianifichi. Microsoft ha affermato che è in arrivo un rebase sui suoi modelli MAI, il che è una roadmap ragionevole per un modello il cui scopo principale è lo scoring rapido in un'unica passata, e significa anche che lo specifico checkpoint su cui hai eseguito il benchmark non è necessariamente quello che chiamerai tra un anno.

Anche la questione della latenza va letta con attenzione. Il dato di punta di Microsoft è un rapporto rispetto a un modello generico molto più grande, che è il confronto corretto per la sua argomentazione — il compito di un modello decisionale è sostituire una costosa chiamata generativa con una chiamata di scoring economica, e 35x rispetto a GPT-6 Sol al p50 è l'aspetto che quell'argomentazione assume quando funziona. I numeri di vLLM-SR sono assoluti, su singola richiesta e singola GPU, e mostrano chiaramente il costo aggiuntivo della modalità: su un AMD Instinct MI325X, una richiesta di testo a d3-flash richiede una mediana di 19,1 ms, la stessa richiesta con un'immagine richiede 149,4 ms e con un video di dieci secondi 407,6 ms. Entrambi i set sono dichiarati dal fornitore, su hardware diverso, e nessuno dei due è stato riprodotto al di fuori del laboratorio che li ha prodotti.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Come scegliere

La regola decisionale è breve, il che è un buon segno che i due prodotti non competono davvero per lo stesso slot.

Scegli Microsoft-Decision-1 se la decisione è solo testuale, se operi già su Foundry e se il fatto che sia una chiamata anziché un deployment è l'intero punto: nessuna GPU da acquistare, nessun container da gestire, nessun ciclo di vita del modello da possedere. Il materiale di supporto di Microsoft è anche il più utilizzabile dei due per un team di piattaforma: le perturbazioni, i conteggi dei test di sicurezza e l'affermazione che è supportata un'opzione di astensione sono gli elementi che servono per scrivere una politica di soglia, e il limite di 32.768 token è dichiarato anziché lasciato in bianco.

Scegli Decision 3.0 — realisticamente d3-flash o d3-mini — se una qualsiasi parte della decisione dipende da un'immagine o da una clip, se devi eseguirlo in un contesto che un'API ospitata non può raggiungere, o se vuoi fare il fine-tuning dello scorer sui tuoi casi etichettati. La licenza Apache-2.0 e il manifest di hash a livello di file rendono questa un'opzione concreta, non teorica. Quello che accetti in cambio è un budget di input non dichiarato, nessuna calibrazione pubblicata e il fatto che la famiglia ha pochi giorni di vita e praticamente nessun utilizzo esterno alle spalle.

Se hai bisogno di entrambi — uno scorer ospitato per il percorso di testo routine e uno self-hosted per i casi multimodali o air-gapped, chiamati attraverso la stessa interfaccia — allora la posizione onesta è che nessun fornitore attualmente te lo offre, e i due formati di richiesta sono abbastanza simili da poter essere unificati ma non identici.

Dove si colloca OrcaRouter e dove no

typesafe/jev-1.13 è il modello decisionale nel nostro catalogo, servito tramite POST /v1/systemone con lo stesso contratto di stato e domande denominate che entrambi i modelli sopra implementano: testo in ingresso, JSON strutturato in uscita, fino a circa 64K token di input, non in streaming, $0,042 per milione di token di input senza costi di completamento perché non ne produce mai. In particolare, la questione del budget di token in stile Android, a cui nessuna delle due schede sopra risponde in modo completo, trova qui risposta.

Non offriamo nessuno dei due modelli in questo confronto. I checkpoint di Decision 3.0 vengono forniti come percorso di inferenza locale all'interno di un repository Hugging Face anziché come endpoint instradabile, e Microsoft-Decision-1 è distribuito tramite la piattaforma di Microsoft stessa e diverse piattaforme di terze parti — non tramite noi. Nulla di quanto qui riportato deve essere interpretato come un'affermazione sulla disponibilità di uno dei due.

Ciò che il livello di routing vale effettivamente in questa decisione sta nell'altra metà del ciclo. Uno scorer è economico per costruzione; il modello che agisce sul suo output non lo è, e abbinare un modello decisionale a uno generativo normalmente significa due integrazioni, due rapporti di fatturazione e due modalità di guasto. Chiamare entrambi tramite un'unica chiave su oltre 200 modelli — con failover automatico quando un provider vacilla, e il prezzo di listino del provider passato con markup dello 0%, così una variazione di prezzo del fornitore è attiva lo stesso giorno — significa che puoi sostituire lo scorer senza toccare il punto di chiamata. Questo, qui, conta più del solito, perché entrambi questi modelli sono ancora abbastanza agli inizi che la decisione che prendi questa settimana è una che dovresti poter annullare il mese prossimo.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

La domanda che deciderà questo tra sei mesi

Due team hanno addestrato con post-training lo stesso checkpoint di base fino a ottenere lo stesso tipo di prodotto nella stessa settimana e hanno tratto conclusioni opposte su come dovrebbe raggiungere un cliente. Non è tanto una coincidenza di tempistica quanto un bivio nel modo in cui la categoria viene venduta: come pesi o come servizio, come qualcosa che possiedi o qualcosa che chiami.

Tieni d'occhio tre segnali. Se il rebase di Microsoft su MAI o sui propri modelli cambi il comportamento in termini di accuratezza e latenza che sta attualmente vendendo — e quanto preavviso ricevono i clienti. Se vLLM-SR pubblichi un budget di input e un valore di calibrazione per Decision 3.0, colmando il divario che impedisce al suo indice di essere concretamente utilizzabile. E se qualcuno al di fuori di entrambi i laboratori esegua la suite pubblica sui pesi d3 rilasciati, perché al momento l'unico numero che risolverebbe questo confronto è quello che nessuno dei due fornitori ha prodotto.