Una scheda del titolo generata per Microsoft-Decision-1, con sottotitolo "un modello di scoring decisionale che restituisce una probabilità invece di una frase", con un badge che riporta Microsoft Foundry, disponibilità generale dall'8 ottobre 2026, e chip che riportano modello base 9B, contesto da 32.768 token, pesi non distribuiti e solo testo, nessuna generazione.
Guides & Insights

Microsoft-Decision-1: il modello Microsoft che risponde con un numero invece di una frase

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Microsoft-Decision-1 ha una riga nella sua scheda del modello che nessun altro modello Microsoft ha mai riportato: non progettato per la generazione di testo. Il modello è stato reso disponibile a livello generale su Microsoft Foundry il 8 ottobre 2026, ed è un restringimento deliberato di ciò a cui serve un modello linguistico. Gli si fornisce una situazione e una domanda con un elenco fisso di risposte — sì/no, una serie a scelta multipla, una scala di valutazione, una rubrica — e restituisce una probabilità calibrata per ogni opzione. Niente prosa. Nessuna spiegazione. Nessun campo per la motivazione. L'output è numeri JSON e nient'altro. È costruito sul modello open-weight Qwen3.5-9B, sottoposto a post-training da Microsoft, e Microsoft afferma che in seguito ri-baserà il modello su altri backbone, citando MAI e altri modelli partner.

Questo è un prodotto più strano di quanto sembri a prima vista. La posizione competitiva di Microsoft nel 2026 si basa su modelli di chat di frontiera e su Copilot, e Microsoft-Decision-1 è l'opposto di entrambi: uno scorer di medie dimensioni e monouso il cui intero compito è dire a un'applicazione quale delle tue stesse opzioni è più probabilmente corretta, e quanto è sicuro. La domanda interessante non è se sia bravo a scrivere — è esplicitamente scarso in questo e non ci prova — ma se una distribuzione di probabilità sulle opzioni sia una primitiva più utile per i carichi di lavoro che le imprese eseguono effettivamente rispetto a un altro modello generico con una modalità JSON.

Cosa fa, precisamente

Il contratto è una chiamata in ingresso, una distribuzione in uscita. Microsoft elenca i formati di domanda supportati come sì/no, scelta multipla, valutazione, classificazione e basato su rubriche. Ogni opzione riceve un punteggio. Il modello viene eseguito in una singola invocazione su input fino a 32K token — 32.768 è la finestra di contesto dichiarata — e il limite pratico è l'input più l'insieme delle opzioni, non un budget di generazione, perché non c'è generazione.

I casi d'uso pubblicati sono quelli che un team di piattaforma riconoscerebbe immediatamente:

• Valutazione degli output dell'IA — valutare una risposta generata rispetto a una rubrica fornita, oppure stabilire se è fondata sulle evidenze che le sono state fornite.

• Classificazione e instradamento — classificare una richiesta, valutarne la pertinenza, smistare una coda, scegliere un ramo del flusso di lavoro.

• Guardrail per agenti — assegna un punteggio a una chiamata a uno strumento o a un'azione dell'agente proposte prima che l'applicazione di integrazione ne consenta l'esecuzione.

• Controllo di sicurezza dei contenuti — contrassegna i contenuti in base alle soglie definite dall'applicazione, anziché a una politica fissa del fornitore.

• Pertinenza della ricerca e del documento — valuta se un documento recuperato risponde a una domanda fornita.

• Automazione basata sulla confidenza — accetta automaticamente i risultati ad alta confidenza e inoltra gli altri a un operatore.

L'opzione di astensione è il dettaglio che vale la pena notare. Microsoft supporta esplicitamente opzioni come "non è possibile determinarlo" quando le prove fornite sono insufficienti, ed è questa la differenza tra un valutatore calibrato e uno semplicemente sicuro di sé. E poiché i punteggi tornano come numeri, la soglia di escalation è una decisione che ti appartiene: sei tu a stabilire dove 0,7 fa arrivare qualcosa a una persona e 0,95 no.

Cosa non farà

Microsoft è insolitamente esplicita riguardo alle esclusioni, e queste contano più dell'elenco delle funzionalità per chiunque debba dimensionare questo sistema per una pipeline reale. Microsoft-Decision-1 non è progettato per la generazione di testo, la risposta a domande aperte, la conversazione, la traduzione o il riassunto. Non è destinato a compiti privi di una domanda chiusa e di un insieme definito di opzioni di risposta, né a compiti che richiedono conoscenze assenti dall'input. È solo testo: niente immagini, audio o video in ingresso, nessuno in uscita. Non fornisce spiegazioni o motivazioni.

Leggete insieme e appare un confine su cui è facile inciampare. Questo non è un chatbot a cui potete chiedere di classificare anche le cose, e non è un riassuntore a cui potete attaccare un punteggio. È una funzione di punteggio con un budget di token. L'inquadramento stesso del team — che non dovrebbe essere l'unico decisore automatizzato in decisioni consequenziali sulle persone, e non dovrebbe essere l'unica base per decisioni che coinvolgono credito, occupazione, alloggio, assicurazione, istruzione, assistenza sanitaria, diritti legali "o ambiti parimenti consequenziali" — punta nella stessa direzione. È progettato per affiancare una decisione, non per essere la decisione.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

La situazione dei benchmark è la storia che nessuno vuole pubblicare

Non ci sono numeri. La pagina del catalogo di Microsoft Foundry per Microsoft-Decision-1 ha una scheda Benchmarks, ed è priva di cifre. Ciò che contiene invece è un paragrafo di metodologia e un'affermazione qualitativa: il modello è stato "valutato su benchmark decisionali pubblici e della community e su set di test interni tenuti da parte non utilizzati durante l'addestramento", Microsoft riferisce che "ha prestazioni in linea con i principali modelli decisionali e supera altri modelli decisionali aperti valutati con la stessa metodologia", e le metriche utilizzate erano accuratezza, errore di calibrazione, recall di sicurezza, tassi di falsi positivi e coerenza di equità, con l'ordine delle opzioni variato e test statistici appaiati applicati.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

Questa è una seria descrizione metodologica associata a zero risultati pubblicati. Significa che ogni affermazione sulle prestazioni di Microsoft-Decision-1 oggi è dichiarata dal fornitore e non riprodotta, e la posizione onesta per chiunque lo valuti è che la calibrazione — l'unica proprietà che rende una probabilità utile in assoluto — non è verificata al di fuori di Microsoft. L'azienda indica effettivamente dove ritiene che il modello sia più forte e più debole, il che è più utile di un punteggio di sintesi: più forte nel ragionamento, nell'applicazione di regole e nella robustezza alla formattazione dei prompt; competitivo nella classificazione, nel recupero, nell'equità, nell'uso degli strumenti e nella maggior parte dei compiti multilingue; più debole nei compiti specialistici di conoscenza del dominio.

Le limitazioni autodichiarate meritano di essere lette prima dell'elenco delle funzionalità. I punteggi possono variare in base alla formulazione e all'ordine delle opzioni, e una domanda mal formulata restituisce comunque un punteggio. La calibrazione è più solida sui tipi di attività familiari. Potrebbe basarsi su conoscenze obsolete e non fornisce spiegazioni. Sulla copertura multilingue: 25 lingue sono elencate come supportate, tra cui giapponese, coreano, arabo, vietnamita, thai, turco, hindi, bengalese, swahili, ebraico, persiano e ucraino, ma Microsoft dichiara che copertura, qualità e calibrazione "possono variare da lingua a lingua" e indica le lingue non inglesi — in particolare quelle con meno risorse — come un'area di prestazioni inferiori. Il modello sottostante Qwen3.5-9B supporta più di 200 lingue; il modello post-addestrato ne supporta un quarto.

Come ottenerlo e quanto costa

Microsoft-Decision-1 è distribuito come API ospitata in Microsoft Foundry nell'ambito del portfolio "Direct from Azure". I pesi del modello non vengono distribuiti: non si tratta di un rilascio con pesi aperti e non esiste un repository Hugging Face da cui scaricarlo. Qualsiasi applicazione in grado di inviare richieste HTTPS può integrarsi usando gli endpoint di Foundry e l'autenticazione Azure standard. L'elenco delle distribuzioni mostra opzioni serverless e con endpoint unificato con pagamento in base al consumo o velocità effettiva con provisioning riservata, SKU standard, con inferenza batch disabilitata, e l'informativa sull'addestramento riporta che il dataset di addestramento è stato utilizzato per la prima volta a settembre 2026, con raccolta in corso.

Il prezzo non è pubblicato sulla pagina del modello. Il campo del prezzo nel catalogo rimanda alla pagina dei prezzi dei modelli di Microsoft invece di indicare una tariffa di input e output, quindi il costo per token di una chiamata a Decision-1 è qualcosa che devi cercare nell'area dei prezzi di Azure o leggere da una fattura. Questa è una vera lacuna per chiunque provi a modellare il costo per decisione su larga scala, e vale la pena dirlo chiaramente anziché fare stime. Due cose è utile sapere quando lo si valuta in termini di prezzo: lo 0% del costo è costituito da token di output, perché non ce ne sono, e l'inferenza in batch è disattivata, quindi non puoi ammortizzare un'esecuzione di scoring in blocco attraverso il canale batch come faresti con un modello generativo.

Il punto in cui OrcaRouter si inserisce è dall'altra parte della chiamata. Non ospitiamo Microsoft-Decision-1, e non è nel nostro catalogo — un modello che restituisce probabilità anziché testo non è un modello a cui instradare le chat completion. Quello che offriamo è la metà dello schema che genera davvero: i modelli che scrivono la rubrica, redigono le risposte candidate o producono la tool call che Decision-1 poi valuta. Questi stanno dietro un'unica chiave compatibile con OpenAI con più di 200 modelli, al prezzo di listino del provider passato con markup 0%, così un taglio di prezzo del fornitore su un modello giudice è attivo dalla nostra parte lo stesso giorno. Se stai costruendo un ciclo di valutazione in cui un modello scrive e un altro valuta, la chiamata di valutazione va a Microsoft e la chiamata di generazione può andare ovunque — anche attraverso il routing DSL, che compone diversi modelli in un'unica chiamata quando vuoi un panel invece di un singolo giudice.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Perché uno scorer è una scommessa diversa da un chatbot migliore

Il pattern che Microsoft sta vendendo qui esiste già in open source. Intern-Decision-4B di InternLM, d1-3B di Liquid AI, Laya di Convai Innovations e la famiglia Kev di Jared Palmer restituiscono tutti distribuzioni calibrate sulle opzioni fornite senza generare testo, e la maggior parte di essi sono pesi Apache-2.0 che puoi eseguire sul tuo hardware senza spendere nulla. L'offerta di Microsoft si differenzia in tre modi che non dipendono dai benchmark: è un'API gestita con autenticazione, fatturazione e governance di Azure incluse, quindi si adatta a un percorso di approvvigionamento aziendale che un download da Hugging Face non offre; la sua base è un modello da 9B, più grande della maggior parte di quel campo; e viene fornita con una valutazione di Responsible AI e una metodologia di valutazione documentata, che spesso è il vero requisito di accesso per un deployment regolamentato.

Ciò che non include è un numero. Rispetto ai concorrenti aperti che pubblicano punteggi di Brier ed errore di calibrazione atteso — le due cifre che ti dicono se uno 0,8 significa 0,8 — Microsoft ha pubblicato una metodologia e nessun risultato. Finché non esisteranno test di calibrazione indipendenti, il modo difendibile di usare Microsoft-Decision-1 è quello raccomandato dalla sua stessa documentazione: convalidare su dati rappresentativi del proprio caso d'uso, fissare le soglie in base al costo dei propri errori, includere sempre un'opzione di astensione, randomizzare l'ordine delle opzioni laddove l'ordine potrebbe introdurre un bias nella risposta, e mantenere un essere umano nel processo per qualsiasi cosa abbia conseguenze. È un buon consiglio per qualsiasi sistema di scoring. È un consiglio particolarmente buono per uno la cui calibrazione non è stata misurata da nessuno al di fuori dell'azienda.