Una scheda del titolo generata per Intern-Decision-4B, con il sottotitolo 'un modello decisionale strutturato che risponde senza scrivere un token', con tre chip che recitano 'nessun annuncio', 'tre checkpoint in 40 secondi' e 'nessuna valutazione indipendente', con un piè di pagina che recita 'Cifre secondo la model card di InternLM; nulla qui è riprodotto in modo indipendente.' Il logo di OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Intern-Decision-4B: InternLM ha rilasciato un modello decisionale che risponde senza scrivere un token

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tre repository di modelli sono apparsi sulla pagina Hugging Face di InternLM nel giro di quaranta secondi il 26 settembre 2026: Intern-Decision-0.8B alle 05:35:57 UTC, Intern-Decision-2B alle 05:36:19, e internlm/Intern-Decision-4B alle 05:36:37. Il 4B è quello interessante. È un fine-tune di Qwen3.5-4B che accetta uno stato condiviso, uno schema di domande denominate e immagini opzionali, e restituisce una distribuzione di risposte calibrata per ogni domanda in un singolo forward pass. Non genera mai testo. Le sue stesse note di rilascio lo dichiarano apertamente: "Questa API esegue una valutazione strutturata dei candidati. Non chiama generate() o campiona testo libero." Quaranta secondi di upload e nemmeno una riga di annuncio da nessuna parte — niente post sul blog, niente tweet, niente changelog, nessuna pagina di lancio. Ciò che esiste è una model card, un inference.py, e quattro shard safetensors.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

Cosa è stato rilasciato e cosa no

La famiglia è la prima cosa da sistemare, perché la scheda del 4B la porta silenziosamente. La sua tabella di benchmark pubblica righe per Intern-Decision-0.8B e Intern-Decision-2B accanto alla propria, e tutti e tre i checkpoint sono arrivati sull'hub nello stesso minuto. Il repository del 2B non è mai collegato dalla scheda del 4B — devi trovarlo tramite il feed di caricamento dell'organizzazione.

Quello che non è stato rilasciato è quasi tutto ciò che un rilascio normalmente porta:

• Nessun annuncio — zero copertura web, nessuna dichiarazione del fornitore in nessuna lingua che siamo riusciti a trovare.

• Nessuna demo — la card rimanda a uno Space all'indirizzo huggingface.co/spaces/internlm/intern-decision; quell'endpoint risponde HTTP 401, il che significa che non è pubblico, non che sia rotto.

• Nessuna collezione — la collezione di modelli pubblicizzata all'indirizzo huggingface.co/collections/internlm/intern-decision restituisce anch'essa 401.

• Nessun repository di codice — il link GitHub della scheda, github.com/internlm/Intern-Decision, restituisce un 404, e l'elenco dei repository dell'organizzazione InternLM non contiene alcun progetto di questo tipo.

• Nessuna adozione — al momento in cui scrivo, il 4B mostra un like e zero download.

Questa è tutta la superficie conoscibile. Considera ogni numero qui sotto come dato dal fornitore stesso, perché nessun altro ha ancora eseguito questa cosa.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

Il contratto di inferenza è il prodotto

La maggior parte della scheda è dedicata a una procedura in cinque passaggi, che ti dice dove è stato investito l'impegno ingegneristico. Le domande e le opzioni mantengono il loro ordine. Le opzioni di ogni domanda vengono mappate su simboli a token singolo — da A a Z, poi da a a z, poi da 0 a 9. Sono 62 simboli, ed è esattamente il motivo per cui la scheda limita una domanda a 62 opzioni. Il prompt viene renderizzato dal prompt di sistema originale, dallo stato, dallo schema decisionale e da uno scheletro JSON completo dell'assistente con un <decision> segnaposto per campo, mantenendo il template di chat del checkpoint e un blocco di pensiero vuoto. Poi un singolo forward pass causale. I logit vengono letti nella posizione immediatamente prima di ciascun segnaposto, una softmax viene eseguita solo sui logit dei simboli candidati consentiti per quel campo, viene applicata la calibrazione e i simboli vengono rimappati ai valori delle tue opzioni.

La conseguenza è una forma fissa: nessun ciclo di decodifica, nessun campionamento, nessun parser, nessuna superficie di allucinazione, e un tetto massimo rigido di una decisione per domanda per passaggio. Sono supportati tre tipi di domanda — scelta con una mappa ordinata di criteri, punteggio con un elenco o una mappa con chiavi numeriche, e noul, un no/sì binario.

Il dettaglio della scheda tecnica che conta di più

La scheda è esplicita sul fatto che gli input vengono "rifiutati senza troncamento" al di sopra di DecisionEngine(max_length=8192). Leggilo accanto alla configurazione e qualcosa di strano affiora: la torre testuale sottostante dichiara max_position_embeddings pari a 262.144. Il backbone può indirizzare un quarto di milione di token; il wrapper rilasciato rifiuta qualsiasi cosa oltre 8.192. Questo non è un modello a contesto lungo con un default conservativo — è un modello di valutazione delle decisioni il cui stesso harness limita le evidenze che puoi sottoporgli. Se la tua domanda di routing dipende da più di circa ottomila token di stato, questo checkpoint così come distribuito non risponderà, e rifiuterà invece di ridurre il tuo input.

Sono ammesse fino a otto immagini e la scheda specifica che i token delle immagini concorrono a quello stesso limite di 8.192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

Dentro i pesi

Quattro shard, 4,54 miliardi di parametri BF16 e una configurazione che spiega il nome della dimensione: c'è una torre di testo, una torre di visione di circa due dozzine di layer con una dimensione di patch di 16 pixel, e un proiettore tra loro. Il lato testo è di 32 layer con dimensione nascosta 2.560, con 16 teste di attenzione contro 4 teste key/value, un vocabolario di 248.320 token e embedding legati. I tipi di layer si alternano a un intervallo fisso — tre layer di attenzione lineare, poi un layer di attenzione completa, ripetuto. Solo i layer di attenzione completa portano attenzione globale, e l'embedding rotatorio è parziale a un fattore di 0,25. Per caricarlo servono Python 3.12 o versioni successive, PyTorch 2.9.1 e Transformers 5.14.1, e l'elenco dei file contiene ancora il tokenizer, i merges e i file di vocabolario invece di affidarsi a un tokenizer lato hub.

I numeri, e chi li ha prodotti

Tutto in questa sezione è stato misurato da InternLM e pubblicato sulla scheda del modello. Nessuno di questi dati è stato riprodotto da terze parti, e non esiste alcuna voce su Artificial Analysis, alcun rating arena e alcuna riga di classifica per questo modello da nessuna parte.

Su sette set di valutazione, il 4B ha una media di 90,02, con un punteggio di Brier di 0,347 e un errore di calibrazione atteso di 0,065. La stessa tabella elenca Intern-Decision-0.8B a 79,38 e Intern-Decision-2B a 84,68, quindi la famiglia ha un andamento crescente all'aumentare della dimensione — 4,7 punti da 0,8B a 2B, poi altri 5,3 fino al 4B. La tabella riporta anche cinque righe che il fornitore non ha addestrato: Jev a 88,74, JevK5 a 85,16, SemIf a 84,23, Kev a 79,56 e Laya a 57,77. Sono stati eseguiti da InternLM sull'harness di InternLM rispetto al checkpoint di InternLM. Non sono i numeri propri di quei progetti, e leggerli come tali è l'errore più facile che si possa commettere qui.

La latenza è misurata su una singola RTX 4090 lungo il percorso locale di Hugging Face, e la scheda segnala i valori come dipendenti dal carico di lavoro e dall'hardware. Il 4B registra 44,16 ms di media, 44,03 ms di mediana e 44,60 ms al P95 — una differenza ben inferiore a un millisecondo tra mediana e coda, che è proprio l'andamento di un forward pass a forma fissa. I due checkpoint più piccoli sono entrambi intorno ai 33 ms, con il 2B marginalmente davanti allo 0.8B sulla media e sulla mediana, cosa che vale la pena notare invece di passarci sopra: questi due sono abbastanza vicini da rientrare l'uno nel rumore di misurazione dell'altro.

La calibrazione, e le oneste avvertenze che contiene

Il checkpoint viene fornito con una temperatura predefinita di 1,99241824, adattata separatamente per questo modello tramite minimizzazione della log-verosimiglianza negativa su 1.728 casi di calibrazione designati, con 1.693 tenuti da parte per la validazione. La scheda dichiara che le etichette della suite di test non sono state utilizzate per sceglierla. L'implementazione è una calibrazione della probabilità dei candidati, non una temperatura di campionamento: modifica la confidenza, la probabilità binaria e il punteggio atteso, lasciando invariata la decisione argmax.

Una diagnostica separata su 96 casi riporta poi l'effetto. Nelle colonne prima e dopo di InternLM stesso, il Brier e l'ECE complessivi del 4B passano da 0,628 / 0,213 a 0,550 / 0,089, contro 0,595 / 0,130 per Jev. Due letture oneste di quella tabella: la calibrazione funziona chiaramente, e la colonna "prima" non è ciò che un utente vedrebbe mai, dato che il default fornito è la temperatura adattata. Vale anche la pena segnalare che due delle sei categorie diagnostiche sono peggiori per il 4B che per Jev, e la peggiore di esse, evidenza quotidiana e bias di osservazione, migliora a 0,575 / 0,210 pur restando dietro al 0,603 / 0,114 di Jev. Su quella porzione, la calibrazione riduce il divario senza colmarlo.

Dove un router è adatto, e dove non lo è ancora

L'ostacolo pratico all'uso di questo modello non è l'accuratezza, è il packaging. La release fornisce una classe Python da importare dopo aver scaricato quattro shard, non un endpoint HTTP che puoi chiamare. È esattamente il divario che un livello di routing esiste per colmare — una sola chiave per oltre 200 modelli, con il prezzo di listino del provider passato senza alcun ricarico (0% di markup) e failover automatico quando un provider vacilla — ma dobbiamo essere schietti: al momento OrcaRouter non offre Intern-Decision-4B né alcun modello del suo genere. Il nostro catalogo non lo elenca, e nulla di quanto scritto qui va interpretato come una dichiarazione di disponibilità. Quello che possiamo offrire è la decisione più economica: se vuoi provare uno scorer decisionale da 4,5 miliardi di parametri davanti a un percorso di produzione, puoi integrarlo in un router con un fallback a un modello generale, così una brutta giornata di calibrazione ti costa un nuovo tentativo invece di un'interruzione del servizio.

Cosa cambierebbe il quadro

Tre cose, in ordine di importanza. Qualcuno al di fuori di InternLM deve riprodurre la media di 90,02 e l'errore di calibrazione atteso di 0,065 — le affermazioni di calibrazione che non hanno mai incontrato un set di test esterno sono i numeri meno trasferibili nel machine learning. L'impronta della card stessa deve comparire: lo Space, la collection, il repository GitHub. E il fornitore deve dire se questo è un prodotto o un artefatto di un paper, perché una licenza di sola ricerca e una licenza Apache-2.0 non sono lo stesso impegno, e il 4B ha scelto Apache-2.0 con la licenza Qwen preservata accanto. Fino ad allora, l'inquadramento corretto è quello suggerito dall'upload stesso: questo è un checkpoint reale con un contratto di inferenza reale e una scorecard completamente non verificata, pubblicato senza che nessuno ne fosse informato.

Per ora il riassunto onesto è limitato e utile. Se il tuo problema è "scegli una tra cinque etichette di routing e dimmi quanto sei sicuro", un modello da 4,5B che emette 62 logit e nessuna prosa è una forma difendibile da valutare. Se il tuo problema coinvolge un documento lungo, più di otto immagini, o qualsiasi necessità di spiegare la risposta a parole, questo checkpoint così come viene distribuito è lo strumento sbagliato, e nessuna quantità di rifinitura dei benchmark del fornitore cambia questo.