
Microsoft-Decision-1 vs Intern-Decision-0.8B: Mezza oncia di guai da jailbreak contro un vuoto ospitato
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token · 55 tok/s
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Comincia dalla colonna che un post di lancio avrebbe omesso. Intern-Decision-0.8B — il modello decisionale da 852.985.920 parametri di InternLM, messo a punto a partire da Qwen3.5-0.8B e caricato su Hugging Face il 26 settembre 2026 senza alcun annuncio, senza paper e con un link a GitHub che dà ancora 404 — è misurato a 64,48 su WildJailBreak rispetto a un riferimento di 96,29 per Jev 1.13 di TypeSafe. Non è una differenza di arrotondamento. È un collasso della robustezza ai rifiuti in un modello il cui unico compito è giudicare gli input, pubblicato sulla card del fornitore stesso, in una tabella il cui benchmark appartiene a un concorrente. Metti questo accanto a Microsoft-Decision-1, diventato disponibile in generale su Microsoft Foundry l'8 ottobre 2026 come scorer solo testo post-addestrato su Qwen3.5-9B con una metodologia di valutazione documentata e non un singolo risultato riportato sotto di essa, e hai la vera sostanza di questo confronto. Uno di questi modelli ti dirà un numero che lo fa sembrare scarso. L'altro ti dice quali metriche avrebbe usato.
Quell'inversione vale più della scheda tecnica. Entrambi i modelli prendono uno stato e un insieme limitato di domande e restituiscono probabilità sulle tue opzioni — nessuno dei due genera testo, e su quell'asse sono lo stesso tipo di strumento. Le differenze che contano sono chi lo esegue, quanto è grande, quanto puoi verificare e una colonna di sicurezza che il modello più piccolo, più silenzioso e completamente scaricabile ha scelto comunque di pubblicare.
Cosa restituisce effettivamente ciascuno
Microsoft-Decision-1 è un'API ospitata, e questa è la prima differenza strutturale. I pesi non vengono distribuiti — nessun download, nessun repository, nessun percorso di fine-tuning — e l'integrazione significa una distribuzione Foundry con autenticazione, fatturazione e governance Azure. Esegue una passata su un massimo di 32.768 token, supporta domande sì/no, a scelta multipla, di valutazione, di classificazione e con rubriche, ed è solo testo in ingresso e numerico in uscita. Supporta esplicitamente un'opzione di astensione come "non so dire" quando le prove sono insufficienti, ed è ciò che rende significativa una soglia.
Intern-Decision-0.8B è la disposizione opposta. Sono pesi Apache 2.0 con la licenza Qwen upstream conservata accanto ad essi come LICENSE-QWEN, circa 1,73 GB di repository su tre shard — uno shard linguistico da 1,50 GB, uno shard vision da 176 MB e un proiettore da 25 MB — che entra su una singola GPU consumer o su un portatile ben equipaggiato. Accetta uno stato, uno schema da una a sedici domande denominate con fino a 62 opzioni ciascuna e, facoltativamente, fino a otto immagini, e il suo inference.py incluso documenta il contratto in modo più dettagliato di quanto la maggior parte dei modelli lanciati si prenda la briga di fare: le opzioni vengono mappate su simboli a token singolo A–Z, poi a–z, poi 0–9; i logits vengono letti nella posizione immediatamente precedente a ciascun <decision> segnaposto in uno scheletro pre-renderizzato; viene eseguito un softmax soltanto sui candidati legali di quel campo; viene applicata una temperatura calibrata.
Le due licenze non corrispondono allo stesso acquisto. Microsoft-Decision-1 ti offre un endpoint gestito e nessun artefatto di tua proprietà. Intern-Decision-0.8B ti offre un artefatto di tua proprietà, senza endpoint, senza contratto di supporto e senza documentazione oltre al repository stesso.

Il tetto, e la calibrazione che puoi verificare
Due numeri decidono la maggior parte delle integrazioni reali, ed entrambi appartengono al modello piccolo.
Il primo è 8.192 token. Il motore di inferenza di Intern-Decision-0.8B rifiuta input di dimensioni eccessive invece di troncarlo, il che è il comportamento corretto per uno scorer e anche un muro invalicabile: non esiste alcuna strategia di chunking che preservi il contratto, perché lo stato, lo schema e lo scheletro devono essere tutti in una sola passata. Il tetto di Microsoft-Decision-1 è quattro volte più alto, a 32.768, ed è un limite di un servizio hosted che puoi alzare eseguendo il provisioning in modo diverso, non una costante in un file Python.
La seconda è la calibrazione, e qui la direzione si inverte. InternLM pubblica una temperatura stimata di 2,747760550703 per il modello 0.8B, selezionata mediante minimizzazione della NLL su 1.728 casi di calibrazione designati, con 1.693 riservati alla validazione, con la scheda che specifica esplicitamente che le etichette della suite di test non sono state utilizzate per selezionarla. La trasformazione applicata è una softmax sui logit candidati del campo, seguita da una seconda softmax sul logaritmo di quella distribuzione diviso per la temperatura. Poiché la trasformazione viene eseguita dopo la prima softmax e preserva l'ordinamento, non può modificare affatto l'argmax — sposta la confidenza, la probabilità del sì e il valore atteso di una domanda con punteggio, e lascia l'etichetta identica. Se la pipeline legge l'etichetta, la temperatura è un'operazione a vuoto. Se legge la probabilità, le applica una soglia o la inserisce in un calcolo del valore atteso, la temperatura è la differenza tra un numero che significa qualcosa e uno che non significa nulla. Passando temperature=1 si ottiene la distribuzione non calibrata, se preferisci stimare la tua.
Microsoft-Decision-1 non ha un artefatto equivalente. La sua scheda Benchmarks afferma che accuratezza, errore di calibrazione, richiamo di sicurezza, tassi di falsi positivi e coerenza di equità sono stati misurati su benchmark decisionali pubblici e della comunità, oltre a set di test interni tenuti da parte, che l'ordine delle opzioni è stato variato, che sono stati applicati test statistici appaiati e che il modello "si comporta allo stesso livello dei principali modelli decisionali e davanti ad altri modelli decisionali aperti valutati con la stessa metodologia". Non viene stampato alcun errore di calibrazione, non c'è alcuna temperatura da ispezionare e non viene descritta alcuna suddivisione di validazione. L'unica proprietà che rende utile una probabilità — se 0,8 significhi 0,8 — viene affermata e non quantificata.
Leggi quei due paragrafi mettendoli a confronto e il confronto smette di riguardare la dimensione. Un checkpoint da 0,8 miliardi di parametri di cui puoi ispezionare la calibrazione e di cui puoi eseguire il software è, per un team di valutazione, un oggetto più maneggevole di un'API ospitata la cui calibrazione è una frase. Il modello piccolo ha anche un dato di latenza documentato — 33,98 ms di media, 33,44 ms di mediana, 37,50 ms p95 per query su una singola RTX 4090 tramite il percorso locale di Hugging Face, nella misurazione di InternLM stesso — mentre quella di Microsoft è qualcosa che misuri attraverso il tuo deployment, dove la scelta tra serverless e throughput con provisioning sposterà il numero più di quanto farà il modello.

Dove perde il modello piccolo
Nessuna delle opzioni precedenti rende Intern-Decision-0.8B la scelta sicura, e la stessa tabella pubblicata ne spiega il motivo. WildJailBreak a 64,48contro il 96,29 di Jev è un divario di robustezza al rifiuto di trenta punti nella categoria esatta in cui uno scorer incontra input non attendibili. Un modello decisionale è spesso il componente che decide se un'azione proposta è consentita; uno che è facile da aggirare con le parole è un rischio in quel ruolo. Se il deficit derivi dalla base Qwen3.5-0.8B, dall'obiettivo di decision-tuning o dal numero ridotto di parametri non è qualcosa che il repository ti dica, e non esiste alcun paper, alcuna ricetta di addestramento né alcuna divulgazione dei dati che lo farebbe.
Il resto della tabella di InternLM è più lusinghiero di quella colonna e resta comunque modesto. La media su sette suite è 79,38 per il modello 0,8B contro 84,68 per il suo fratello 2B e 90,02 per il 4B — la famiglia sale ripidamente con la dimensione, il che è un tenue segnale che la tabella non è stata ingegnerizzata a ritroso per lusingare il modello di punta. AG News si attesta a 88,61 contro 89,57 di Jev, di fatto allo stesso livello nella classificazione di argomenti a quattro classi. Sulla calibrazione, il modello 0,8B riporta un Brier di 0,530 e un errore di calibrazione atteso di 0,066, contro 0,358 e 0,095 di Jev — ECE migliore, accuratezza significativamente peggiore. È un profilo plausibile per un modello piccolo con una temperatura deliberatamente adattata, e non è una combinazione che un team di marketing sceglierebbe di pubblicare per caso.
Non c'è inoltre alcuna data di rilascio, nessun annuncio, nessuna raccolta che riunisca i tre checkpoint, nessun endpoint ospitato da nessuna parte e nessuna valutazione indipendente di alcun tipo. Lo Space demo risponde 401. La descrizione corretta di Intern-Decision-0.8B è un checkpoint rilasciato con dichiarazioni non verificate — il che è una situazione migliore rispetto a un'API in lista d'attesa, perché puoi misurarlo in un pomeriggio, ma significa che l'onere della validazione è interamente tuo.
Scegliere, e dove si colloca OrcaRouter
Scegli Microsoft-Decision-1 se l'ostacolo è l'approvvigionamento o la scalabilità: hai bisogno dell'autenticazione Azure, di una fatturazione unificata e di una valutazione Responsible AI prima che qualsiasi cosa arrivi in produzione; hai bisogno di un contesto da 32K; hai bisogno di un endpoint che non gestisci; oppure hai bisogno che il percorso di astensione sia previsto fin dalla progettazione anziché costruito a mano. Accetta in cambio che non puoi eseguirlo, non puoi eseguirne il fine-tuning, non puoi ispezionarne la calibrazione e dovrai misurare tu stesso la sua affermazione centrale.
Scegli Intern-Decision-0.8B se l'ostacolo è il costo, la memoria o il controllo: vuoi uno scorer con licenza Apache-2.0 che stia in 1,73 GB, giri su hardware che possiedi già, produca sempre la stessa etichetta e possa essere sostituito con il suo gemello da 2B o 4B cambiando un percorso di checkpoint. Accetta in cambio il limite di 8.192 token, la colonna WildJailBreak e il fatto che nessuno al di fuori di InternLM abbia riprodotto qualcosa sulla scheda.
La raccomandazione onesta è fare entrambe le cose, perché costano abbastanza poco che la discussione è quasi priva di senso. La chiamata di scoring in sé non è qualcosa che instradiamo — un modello che restituisce probabilità invece di testo non è un chat completion, e nessuna delle due è nel nostro catalogo. Ciò che OrcaRouter offre è l'altra metà del ciclo: più di 200 modelli dietro un'unica chiave compatibile con OpenAI che redigono la rubrica, generano le risposte candidate o emettono la tool call che il tuo scorer sta per valutare, al prezzo di listino del provider passato con 0% di markup, così un taglio di prezzo di un fornitore su un generatore è attivo dalla nostra parte lo stesso giorno. Il failover automatico conta più del solito qui, perché una pipeline che valuta tutto ciò che vede non ha margine per ritentare una chiamata bloccata, e il DSL di routing ti consente di inviare un unico prompt di giudizio a diversi writer e fondere il loro accordo invece di fidarti di uno solo.

Il risultato finale
Microsoft-Decision-1 ha raggiunto la disponibilità generale su Microsoft Foundry l'8 ottobre 2026: ospitato, solo testo, 32.768 token, basato su Qwen3.5-9B, con un paragrafo di metodologia al posto di una tabella di benchmark. Intern-Decision-0.8B è un checkpoint Apache-2.0 da 1,73 GB caricato il 26 settembre 2026 che pubblica un Brier di 0,530, un ECE di 0,066, una temperatura di fitting di 2,747760550703, 33,98 ms su una 4090 — e un punteggio WildJailBreak di 64,48 che nessuno gli ha chiesto di stampare. Se puoi validare solo una cosa prima di adottare l'uno o l'altro, valida la calibrazione sui tuoi casi etichettati; è il numero che entrambi i fornitori ti hanno lasciato da trovare.
