Una scheda del titolo generata per Microsoft-Decision-1 vs Intern-Decision-4B con sottotitolo 'due valutatori, uno con numeri e uno senza', con chip che riportano 9B vs 4B, API ospitata vs pesi aperti, nessun benchmark pubblicato vs Brier 0.347 ed ECE 0.065, e un piè di pagina sulle fonti che segnala che le cifre di Microsoft non sono riprodotte e che quelle di InternLM sono dichiarate dal fornitore.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: uno pubblica la sua calibrazione, l'altro pubblica la sua metodologia

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Microsoft-Decision-1 accanto a Intern-Decision-4Be ottieni un confronto che è deciso meno dalla capacità che da ciò che ciascun fornitore era disposto a pubblicare. Il modello di Microsoft ha raggiunto la disponibilità generale su Microsoft Foundry l'8 ottobre 2026: una base Qwen3.5-9B, post-addestrata da Microsoft, solo testo, contesto di 32.768 token, pesi non distribuiti, una metodologia di valutazione che descrive accuratezza, errore di calibrazione e test statistici appaiati — e nemmeno un risultato. L'Intern-Decision-4B di InternLM è comparso su Hugging Face il 26 settembre 2026 alle 05:36:37 UTC senza alcun annuncio alle spalle, è fine-tuned da Qwen3.5-4B, accetta sia immagini che testo, viene eseguito in 44 millisecondi su una singola RTX 4090 e stampa una tabella completa di valori di Brier e di errore di calibrazione atteso. Entrambi restituiscono una distribuzione di probabilità sulle opzioni che fornisci. Solo uno dei due ti dice quanto bene lo faccia.

Quell'inversione — il modello più grande e meglio finanziato che è quello opaco — è l'intera forma di questo confronto, e determina la scelta per la maggior parte dei team più in fretta di qualsiasi riga di specifiche.

L'unico numero che li separa

InternLM riporta Brier 0,347 ed ECE 0,065 per Intern-Decision-4B su tutta la sua suite di benchmark, con un punteggio medio di 90,02 su Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) e WildJailBreak (89,86). Si tratta di cifre riportate dal fornitore sull'harness proprietario del fornitore stesso, e in particolare le righe Jevbench appartengono alla famiglia di benchmark del progetto stesso: leggile come autovalutazione, non come verifica indipendente. Ma sono numeri con una scala dichiarata, e l'ECE in particolare è il valore che ti dice se un 0,8 restituito vale la pena di essere preso in considerazione.

Microsoft non pubblica nulla di equivalente. La scheda Benchmarks della pagina di catalogo di Microsoft-Decision-1 descrive ciò che è stato misurato e afferma che il modello "si comporta alla pari dei principali modelli decisionali e supera altri modelli decisionali open valutati con la stessa metodologia", con le aree più forti indicate nel ragionamento, nell'applicazione delle regole e nella robustezza al formato dei prompt, e le più deboli nella conoscenza specialistica di dominio. Nessun Brier, nessun ECE, nessuna tabella di accuratezza. Se la tua decisione di adozione richiede un dato di calibrazione prima di poter dimensionare una soglia di escalation, uno di questi due modelli te lo fornisce e l'altro ti chiede di misurarlo da solo.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Dove i due contratti effettivamente differiscono

A prima vista, questi modelli accettano la stessa chiamata. Fornisci uno stato, uno schema di domande denominate e un insieme fisso di opzioni; ricevi indietro una probabilità per ogni opzione senza un token di testo generato. Le differenze emergono ai margini di quel contratto.

• Modalità — Microsoft-Decision-1 è esplicitamente solo testo e non accetta né produce contenuti immagine, audio o video. Intern-Decision-4B accetta immagini opzionali insieme allo stato, fino a otto per chiamata, il che lo rende un candidato per il triage degli screenshot, i controlli sul layout dei documenti e l'instradamento del QA visivo.

• Cardinalità delle domande — InternLM documenta da 1 a 16 domande per chiamata, fino a 62 opzioni ciascuna, su tre tipi di campo (scelta, punteggio, noul). Microsoft documenta i formati — sì/no, scelta multipla, valutazione, classificazione, rubrica — e una singola invocazione con un massimo di 32K token, ma non un limite massimo di domande per chiamata.

• Contesto — Microsoft dichiara 32.768 token. La scheda di Intern-Decision-4B esprime i suoi limiti in domande, opzioni e immagini anziché come un unico numero di contesto, quindi non è possibile confrontarli su una singola cifra.

• Distribuzione — Microsoft-Decision-1 è un'API Foundry ospitata; i pesi del modello non vengono distribuiti e non è disponibile alcun download. Intern-Decision-4B è Apache-2.0 su Hugging Face con la licenza Qwen upstream conservata come LICENSE-QWEN, il che significa conservare tale licenza e gli avvisi upstream se lo ridistribuisci.

• Struttura dei costi — i pesi di InternLM non costano nulla da eseguire e sono dichiarati a 44,16 ms di media, 44,60 ms P95, su una RTX 4090. Il prezzo per token di Microsoft non è riportato affatto nella pagina del modello.

• Governance — Microsoft fornisce una valutazione di IA responsabile, deployment documentato, esclusioni esplicite (non per la generazione di testo, QA aperto, conversazione, traduzione o riassunto; non per essere l'unico decisore automatizzato in decisioni consequenziali sulle persone). InternLM fornisce una model card che è sincera sulla provenienza — pesi "modificati dal decision tuning" — e nulla che assomigli a un pacchetto di conformità.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Due ragioni molto diverse per cui i numeri di latenza sono difficili da confrontare

Microsoft-Decision-1 non pubblica un dato di latenza, quindi non c'è nulla da mettere accanto alla media di 44,16 ms di InternLM. Non è una piccola omissione per questo carico di lavoro. Questi modelli esistono per essere chiamati molte volte all'interno di una pipeline — una volta per ogni documento recuperato, una volta per ogni chiamata di strumento proposta, una volta per ogni risposta da valutare — e la differenza tra quattro decisioni al secondo e quaranta è la differenza tra valutare un campione e valutare tutto. Il valore di InternLM è raggiungibile oggi su hardware che puoi noleggiare a ore; quello di Microsoft deve essere misurato attraverso la tua distribuzione Foundry, e la forma di distribuzione che scegli (serverless con pagamento a consumo rispetto al throughput con provisioning) cambierà il risultato più di quanto lo faccia il modello.

È anche qui che diventa rilevante la metà dello schema che spetta a OrcaRouter, e si tratta unicamente della metà generativa. Non ospitiamo Microsoft-Decision-1 né Intern-Decision-4B — un modello che restituisce probabilità invece di testo non è qualcosa verso cui instradare le chat completion, e nessuno dei due compare nel nostro catalogo. Ciò che sta dietro la nostra unica chiave compatibile con OpenAI è il pool di oltre 200 modelli che si occupa della scrittura: il prompt del giudice redatto da un modello, le risposte candidate prodotte da altri due, la chiamata di tool che viene valutata prima di essere eseguita. Il prezzo di listino del provider viene passato con markup 0%, quindi un taglio di prezzo su un generatore è attivo dalla nostra parte lo stesso giorno, e il failover automatico mantiene in vita il lato generativo di un ciclo di valutazione quando un singolo provider si degrada — cosa che qui conta più del solito, perché una pipeline che valuta tutto ciò che vede non ha margine per ritentare una chiamata bloccata.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Chi dovrebbe prendere quale

Scegli Intern-Decision-4B se una qualsiasi di queste condizioni è vera: devi assegnare un punteggio sia alle immagini sia al testo, ti serve un numero di calibrazione prima di poter rilasciare, vuoi l'opzione di eseguire il modello sul tuo hardware all'interno di un confine che controlli, oppure vuoi eseguirne il fine-tuning. L'ultimo punto merita enfasi: uno scorer da 4B con pesi aperti e un wrapper documentato è un modello che puoi adattare alle tue etichette, mentre Microsoft-Decision-1 è un'API ospitata senza percorso di fine-tuning e senza pesi da adattare.

Scegli Microsoft-Decision-1 se l'ostacolo è l'approvvigionamento anziché le prestazioni: ti servono autenticazione Azure, fatturazione unificata, governance e una valutazione Responsible AI del fornitore prima che qualsiasi cosa arrivi in produzione, e ti serve un contesto da 32K per documenti lunghi che i limiti per chiamata del 4B complicano. La sua mancanza di benchmark pubblicati è un costo reale, ma è un costo che puoi estinguere in un pomeriggio facendo passare il tuo set etichettato attraverso entrambi i modelli e confrontando l'ECE — cosa che faresti comunque prima di fidarti della tabella di uno dei due fornitori.

La risposta scomoda è che entrambi sono abbastanza economici da testare che il dibattito vale a malapena la pena. Intern-Decision-4B richiede una GPU che probabilmente hai già. Microsoft-Decision-1 richiede un deployment Foundry e un campione delle tue decisioni etichettate. Fai passare i tuoi dati attraverso entrambi, calcola la calibrazione sul sottoinsieme che ti interessa e lascia che siano i numeri a decidere — il che, opportunamente, è esattamente ciò per cui questi modelli esistono.