Un cartello del titolo generato per Microsoft-Decision-1 vs Intern-Decision-2B, sottotitolato «il checkpoint intermedio che è il più rapido a rispondere e il peggiore nel dire quanto è sicuro», con chip che riportano 2.213.241.664 parametri, una temperatura di 2,100509348278, ECE 0,100, 33,28 ms su una 4090 e un tetto di 8.192 token.
Engineering & Research

Microsoft-Decision-1 vs Intern-Decision-2B: nove millisecondi più veloce e con una calibrazione misurabilmente peggiore

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

C'è un numero nella tabella di InternLM stessa che non dovrebbe esistere, ed è il motivo per cui questo confronto vale più della scheda tecnica. Intern-Decision-2B — 2.213.241.664 parametri, fine-tuned a partire da Qwen/Qwen3.5-2B, caricato su Hugging Face il 26 settembre 2026 alle 05:36:19 UTC senza alcun annuncio — registra 33,28 ms di latenza media per query su una singola RTX 4090, il che è marginalmente più veloce del suo stesso fratello da 852 milioni di parametri, a 33,98 ms. Registra anche la peggiore calibrazione della sua famiglia: un errore di calibrazione atteso di 0,100 contro lo 0,066 del modello da 0,8B, con una temperatura stimata di 2,100509348278 contro il 2,747760550703 del modello da 0,8B. Nel frattempo Microsoft-Decision-1, disponibile in generale su Microsoft Foundry a partire dal 8 ottobre 2026, non pubblica affatto né un valore di latenza né un errore di calibrazione — solo un paragrafo di metodologia che descrive come sono stati misurati entrambi. Quindi la domanda che questo confronto pone davvero non è quale dei due sia migliore. È che cosa si sta comprando quando si compra la taglia intermedia di qualsiasi cosa.

Entrambi i modelli sono scorer decisionali: stato in ingresso, insieme limitato di domande in ingresso, probabilità calibrate in uscita, nessun testo generato e nessun token da analizzare. È quel contratto condiviso a rendere leggibili le differenze. Microsoft-Decision-1 è un'API Foundry ospitata, solo testo, su una base Qwen3.5-9B con una finestra di 32.768 token, nessun peso distribuito e nessun percorso di fine-tuning. Intern-Decision-2B è un checkpoint Apache-2.0 con la licenza Qwen upstream conservata come LICENSE-QWEN, circa 4,46 GB di repository, codice di inferenza personalizzato e nessun endpoint ospitato da nessuna parte.

A cosa serve davvero la taglia media

InternLM ha pubblicato tre checkpoint in quaranta secondi: il modello 0.8B alle 05:35:57, questo alle 05:36:19, il 4B alle 05:36:37. Sulla media delle sette suite dello stesso fornitore, la famiglia sale nell'ordine che spereresti — 79,38, 84,68, 90,02 — che è l'unico punto in cui il 2B sembra un acquisto sensato. In ogni altro caso sembra la dimensione che nessuno avrebbe scelto di proposito.

L'elaborazione del prompt domina una chiamata decisionale, e questa è la spiegazione meccanica dell'inversione di latenza, non un mistero. Uno scorer esegue esattamente un forward pass su un prompt la cui lunghezza è determinata dallo stato, dallo schema e dalle descrizioni delle opzioni — mai da qualcosa che il modello scrive, perché non scrive nulla. In quel regime il numero di parametri è un costo di secondo ordine, quindi il motivo abituale per ricorrere al checkpoint più piccolo non vale: non stai risparmiando tempo, stai risparmiando memoria. L'intero repository del modello 0.8B è di circa 1,73 GB contro i 4,46 GB di questo modello, ed è questa la ragione onesta per preferirlo. L'unico vero motivo d'interesse del 2B è che capita di essere il più veloce tra quelli veloci, con un margine abbastanza piccolo da essere rumore.

Se rapportata a Microsoft-Decision-1, quell'affermazione è quasi irrilevante, perché i due modelli non si collocano nello stesso regime di latenza. La velocità di un endpoint ospitato è funzione della configurazione di deployment — serverless rispetto a throughput provisioned sullo stesso SKU standard — prima ancora che del modello, e Microsoft non pubblica alcuna cifra per singola chiamata con cui confrontarla. Ciò che Microsoft pubblica è invece un vincolo operativo rigido che gioca in senso opposto: l'inferenza batch è disabilitata. Non esiste alcun canale offline attraverso cui ammortizzare un'esecuzione di scoring massiva, perciò una pipeline Microsoft-Decision-1 paga il costo interattivo di ogni decisione, mentre un checkpoint self-hosted paga in ore GPU indipendentemente dal fatto che stia effettuando scoring o meno.

La colonna di calibrazione, dove il centro perde

Leggi insieme le tre schede Intern-Decision e la famiglia smette di comportarsi in modo prevedibile. L'accuratezza è monotona rispetto alla dimensione; la calibrazione non lo è. Il 2B ha un ECE di 0,100 — il più debole dei tre — e una temperatura adattata di 2,100509348278, ben al di sotto del 2,747760550703 dell'0.8B. La scheda ti indica di usare il modulo di inferenza fornito con la dimensione che hai scaricato, perché le calibrazioni predefinite sono specifiche per checkpoint; chiunque copi un wrapper da un modello fratello a un altro applica silenziosamente la temperatura sbagliata.

Vale la pena capire la trasformazione stessa prima di considerare quel 0,100 come un verdetto sui pesi. È una softmax sui logit candidati del campo, seguita da una seconda softmax sul logaritmo di quella distribuzione diviso per la temperatura. Poiché viene eseguita dopo la prima softmax e ne preserva l'ordinamento, non può cambiare affatto l'argmax. Sposta la confidenza, la probabilità del sì e il valore atteso di una domanda con punteggio, e lascia l'etichetta identica. Se la tua pipeline legge etichette, la temperatura è un no-op e l'ECE è una curiosità. Se la tua pipeline legge probabilità — applica loro delle soglie, le ordina, le immette in un calcolo di valore atteso — allora un ECE di 0,100 è la differenza tra una soglia che significa ciò che hai scritto e una che non lo significa. La risposta giusta è calibrare la tua temperatura sui tuoi casi etichettati, non concludere che i pesi siano scadenti.

Microsoft-Decision-1 chiede esattamente lo stesso lavoro, con meno da cui partire. La sua scheda Benchmarks afferma che accuratezza, errore di calibrazione, richiamo di sicurezza, tassi di falsi positivi e coerenza di equità sono stati misurati su benchmark decisionali pubblici e della community più set di test interni tenuti da parte, che l'ordine delle opzioni è stato variato, che sono stati applicati test statistici appaiati e che il modello "si comporta allo stesso livello dei principali modelli decisionali e davanti ad altri modelli decisionali aperti valutati con la stessa metodologia". Nessun ECE. Nessun Brier. Nessuna temperature. Nessuna tabella di accuratezza. Il modello la cui intera proposta di valore è una probabilità affidabile è proprio quello, in questo confronto, senza alcun numero di calibrazione pubblicato.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

Limiti del contratto: quattro cose che il modello ospitato non farà

I due modelli ricevono quella che sembra essere la stessa chiamata, e le divergenze vivono ai suoi margini.

• Modalità — Microsoft-Decision-1 è esplicitamente solo testo e non accetta immagini, audio o video. Intern-Decision-2B accetta fino a otto immagini insieme allo stato, il che lo rende un candidato per il triage degli screenshot e i controlli di layout che l'API ospitata non è in grado di fornire con alcuna accuratezza.

• Limite massimo di input e modalità di errore — Microsoft-Decision-1 esegue una singola invocazione su un massimo di 32.768 token. Intern-Decision-2B dichiara DecisionEngine(max_length=8192) e rifiuta input di dimensioni eccessive anziché troncarlo, il che è un comportamento corretto per uno scorer ed è anche un muro invalicabile, perché lo stato, lo schema e lo scheletro devono essere tutti presenti in una sola passata; nessuna strategia di suddivisione in blocchi preserva il contratto.

• Forma della domanda — InternLM documenta da una a sedici domande per chiamata, con fino a 62 opzioni ciascuna, distribuite su tre tipi di campo (choice, score, noul), dove noul è un sì/no binario che restituisce una probabilità e score restituisce un valore atteso ponderato per la probabilità su una scala da te definita. Microsoft documenta i formati — sì/no, scelta multipla, valutazione, classificazione, rubrica — più un'opzione di astensione esplicitamente supportata, come "non è possibile dirlo", quando le prove sono insufficienti: è la riga più utile della pagina per chiunque scriva una logica di escalation.

• Prezzo — la pagina del modello Microsoft-Decision-1 non riporta una tariffa; i prezzi rimandano alla superficie dei prezzi di Microsoft, quindi il costo per decisione è qualcosa che si legge da Azure o da una fattura, con lo 0% attribuibile ai token di output perché non ce ne sono. Intern-Decision-2B non costa nulla per chiamata e tutto in tempo GPU, e non ha un provider ospitato. Il suo spazio di archiviazione è di circa 4,46 GB tra uno shard linguistico da 3,76 GB, una torre vision da 612,5 MB e un proiettore da 50,3 MB.

Cosa è confermato e cosa è solo il fornitore che parla

Tenere distinte quelle due categorie è tutta la disciplina di questa famiglia. Confermato da un elenco di file o da una risposta HTTP: il conteggio dei parametri, la mappa degli shard, la coppia di licenze, il modello di base, l'architettura sottostante — una Qwen3_5ForConditionalGeneration con 24 layer, una dimensione nascosta di 2.048, 8 teste di query contro 2 teste chiave-valore, una dimensione di testa di 256, un pattern ricorrente di tre layer di attenzione lineare a uno di attenzione completa, un layer di previsione multi-token mantenuto e un tetto di embedding di 262.144 posizioni che il tetto di 8.192 token del motore rende praticamente irrilevante.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Riportati dal fornitore e non riprodotti: ogni numero di accuratezza, ogni valore di latenza e la temperatura. Non c'è alcun paper, nessuna voce su arXiv, nessun post di lancio, nessun changelog e nessuna valutazione indipendente. La demo Space risponde 401, il che significa che non è pubblica anziché rotta. Il repository GitHub che è apparso dopo il modello — tre commit, codice di training, due backend di inferenza, un pacchetto di valutazione con 10.751 righe di test, un benchmark di calibrazione a 96 casi e una guida alla riproduzione — è più documentazione di quanta ne ricevano la maggior parte delle release silenziose, e non include pesi, dati di training né licenza del codice. Microsoft si trova in una posizione diversa ma adiacente: la sua metodologia è reale e la sua affermazione è qualitativa, e nessuna delle due aziende è attualmente in una posizione tale da poter far verificare il proprio numero centrale da chiunque tranne te.

Dove si colloca OrcaRouter in una pipeline come questa

Nessuno dei due modelli è nel nostro catalogo, e nulla di quanto qui scritto deve essere interpretato come una dichiarazione di disponibilità. Un modello che restituisce probabilità invece di testo non è qualcosa a cui instradare le chat completion, e questo vale per entrambi. Quello che offriamo è la metà generativa del ciclo che quei valutatori esistono per servire: gli oltre 200 modelli dietro un'unica chiave compatibile con OpenAI che scrivono la rubrica, redigono le risposte candidate ed emettono la chiamata allo strumento che un valutatore poi valuta prima che venga eseguita. Il prezzo di listino del fornitore viene trasferito a 0% di ricarico, quindi un taglio di prezzo del fornitore sul lato generativo è attivo sul nostro lo stesso giorno, e se preferisci non puntare la tua soglia su un solo giudice, il DSL di routing compone diversi modelli in un'unica chiamata e la fusione dei modelli riporta il loro accordo come un campo che puoi valutare. Il failover automatico mantiene vivo quel lato quando un singolo provider si degrada, il che conta di più in un ciclo che valuta tutto ciò che vede che in uno che risponde a un utente ogni tanto.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Il risultato finale

Microsoft-Decision-1 è in disponibilità generale su Microsoft Foundry dall'8 ottobre 2026: ospitato, solo testo, 32.768 token, una base Qwen3.5-9B post-addestrata da Microsoft, nessun peso distribuito e una sezione di benchmark che documenta la sua metodologia senza riportare una cifra — compresa l'assenza di latenza, con l'inferenza in batch disattivata. Intern-Decision-2B è un checkpoint Apache-2.0 da 2.213.241.664 parametri del 26 settembre 2026 che è il più veloce dei suoi tre fratelli a 33,28 ms su una 4090 e il peggio calibrato con un ECE di 0,100, con una temperatura fittata di 2,100509348278 che non può cambiare un'etichetta ma cambierà ogni confidenza sulla quale imposti una soglia. Se vuoi la dimensione intermedia, la giustificazione onesta a suo favore è debole: paga i 2,7 GB in più per l'accuratezza del 4B o accetta il footprint dello 0,8B, e in entrambi i casi esegui la tua calibrazione prima che una soglia si avvicini anche solo alla produzione.

Ciò che invece forniamo è la metà generativa del ciclo al cui servizio esistono quei sistemi di valutazione: gli oltre 200 modelli dietro un'unica chiave compatibile con OpenAI che scrivono la rubrica, redigono le risposte candidate ed emettono la chiamata allo strumento che un valutatore poi giudica prima che venga eseguita.