
Intern-Decision-2B è stato rilasciato in sordina su Hugging Face. Il link GitHub sulla sua scheda ha appena smesso di restituire 404.
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 584 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Poco fa oggi la scheda del modello di internlm/Intern-Decision-2B indicava tre luoghi per maggiori informazioni, e due di essi non funzionavano: lo Space demo restituiva HTTP 401, e github.com/internlm/Intern-Decision restituiva 404 a chiunque ci facesse clic. A partire dalle 08:58 UTC, il repository dietro quel secondo link esiste — pubblico, con tre commit, con codice di addestramento, due backend di inferenza, un bundle di valutazione con 10.751 righe di test, un benchmark di calibrazione da 96 casi e la guida alla riproduzione. Questa è l'unica cosa che è cambiata in questo modello da quando è apparso su Hugging Face alle 05:36 UTC del 26 settembre 2026, ed è sufficiente per spostare Intern-Decision-2B da "un checkpoint con un README inaccessibile" a "un checkpoint che puoi davvero ispezionare, riprodurre e con cui discutere."
I pesi in sé sono invariati e inequivocabili. Intern-Decision-2B è un modello decisionale strutturato multimodale da 2.213.241.664 parametri, ottenuto tramite fine-tuning da Qwen/Qwen3.5-2B — la base Alibaba del 28 febbraio 2026 — rilasciato con licenza Apache-2.0, con la licenza Qwen upstream conservata accanto come LICENSE-QWEN. È la dimensione intermedia delle tre che InternLM ha pubblicato in quaranta secondi: Intern-Decision-0.8B alle 05:35:57, questo alle 05:36:19 e Intern-Decision-4B alle 05:36:37. Non c'è ancora alcun tipo di annuncio dietro nessuno di essi.
Ciò che rende la dimensione intermedia meritevole di un articolo a sé è che è il punto in cui la famiglia smette di comportarsi in modo prevedibile. Secondo i dati stessi di InternLM, è la più veloce delle tre e la peggio calibrata delle tre, ed entrambi i fatti valgono la pena di essere compresi prima di scaricare quattro gigabyte e mezzo di qualsiasi cosa.
Cosa è confermato e cosa è solo il fornitore che parla
Due categorie, e vanno tenute separate.
Confermato, perché si tratta di un elenco di file o di una risposta HTTP: il numero di parametri (2.592 F32 più 2.213.239.072 pesi BF16); la mappa degli shard (uno shard linguistico da 3,76 GB, una torre visiva da 612,5 MB, un proiettore da 50,3 MB, circa 4,43 GB di tensori e all'incirca 4,46 GB di repository); la coppia di licenze; il modello base; l'architettura sottostante (un Qwen3_5ForConditionalGeneration con 24 strati, dimensione nascosta 2.048, 8 teste di query contro 2 teste chiave-valore, dimensione della testa 256, un pattern ripetuto di tre strati di attenzione lineare per uno strato di attenzione completa, uno strato di previsione multi-token conservato, e un limite di embedding di 262.144 posizioni); l'esistenza del repository; e il fatto che la collezione di modelli su huggingface.co/collections/internlm/intern-decision ora si risolve ed elenca tutti e tre i checkpoint.
Riportati dal fornitore e non riprodotti: ogni valore di accuratezza, ogni dato di latenza e la temperatura di calibrazione. Non esiste un paper, nessuna voce arXiv, nessun post di lancio, nessun changelog e nessuna valutazione indipendente — una ricerca della stringa "Intern-Decision" non restituisce nulla che riguardi questo modello. Lo Space demo risponde ancora 401, il che significa che non è pubblico, non che sia rotto. Il checkpoint 2B ha un like e zero download. Nessuno al di fuori di InternLM l'ha eseguito.

Il contratto di inferenza, nell'ordine in cui avviene
Il file più informativo del repository non è la card. È src/inference/engine.py e il file incluso inference.py sull'Hub, perché tra loro documentano un contratto anziché un prompt.
• Fornisci stato — il materiale da valutare — uno schema di domande, e facoltativamente fino a otto immagini. Da una a sedici domande, fino a 62 opzioni ciascuna.
• Le opzioni di ogni domanda sono mappate su simboli a token singolo: A–Z, poi a–z, poi 0–9. Il limite di 62 opzioni non è una preferenza di progettazione, è esattamente il numero di simboli a token singolo che il contratto può indirizzare.
• Il prompt di sistema, lo stato, lo schema e uno scheletro JSON completo dell'assistente vengono renderizzati con un segnaposto <decision> per campo. Il template della chat del checkpoint e il blocco di pensiero vuoto vengono preservati così come sono.
• Viene eseguita una singola passata forward causale. I logit vengono letti nella posizione immediatamente precedente a ciascun segnaposto — non dopo, né in corrispondenza di un token generato.
• Una softmax viene calcolata solo sui simboli candidati validi di quel campo, viene applicata la calibrazione del checkpoint e i simboli vengono rimappati ai valori originali delle tue opzioni.
La scheda è schietta su cosa sia: "Questa API esegue uno scoring strutturato dei candidati. Non chiama generate() né campiona testo libero." Un DecisionEngine(max_length=8192) rifiuta input di dimensioni eccessive invece di troncarlo, così una richiesta che non rientra fallisce in modo evidente anziché perdere silenziosamente il suo ultimo paragrafo. Anche l'elenco dei backend è onesto — backend="hf" è quello predefinito e l'unico implementato nel repository di Hugging Face, cosa che vale la pena sapere perché la release su GitHub include anche un backend XTuner e i due non sono numericamente identici. La guida di valutazione di InternLM lo dice: "Le differenze di kernel e BF16 possono modificare le probabilità e occasionalmente le etichette."
L'anomalia nel mezzo
Metti i tre checkpoint fianco a fianco sulla tabella di InternLM e la forma è abbastanza strana da essere la storia stessa.
• Media su sette suite — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02. In ordine, come ci si aspetterebbe aumentando i pesi.
• Latenza su una singola RTX 4090 — 33,98 ms di media per il modello 0,8B, 33,28 ms per il 2B, 44,16 ms per il 4B. La dimensione intermedia è la più veloce delle tre, per un margine abbastanza piccolo da poter essere rumore su una singola GPU, ma coerente tra media, mediana (33,15 ms) e P95 (33,55 ms).
• Punteggio di Brier, più basso è meglio — 0,530, 0,437, 0,347. Monotono rispetto alla dimensione, come di solito accade per una regola di punteggio propria.
• Errore di calibrazione atteso, più basso è meglio — 0,066 per il modello 0.8B, 0,100 per questo 2B, 0,065 per il 4B. La dimensione intermedia è la peggiore, ed è peggiore del modello che ha metà della sua dimensione.
Quell'ultima riga è quella interessante, e le temperature adattate la corroborano anziché spiegarla. Ogni checkpoint porta la propria temperatura adattata tramite NLL: 2,747760550703 per il modello da 0,8B, 2,100509348278 per quello da 2B, 1,992418 per quello da 4B. Ognuna è stata adattata su 1.728 casi di calibrazione designati, con 1.693 tenuti fuori, minimizzando la log-verosimiglianza negativa su una ricerca di temperatura inversa nell'intervallo [0,01, 100], con le etichette della suite di test deliberatamente escluse dall'adattamento. La temperatura del 2B si colloca tra quelle dei suoi due fratelli, che è ciò che ci si aspetterebbe se l'anomalia fosse un artefatto dell'adattamento. Non è così: il valore adattato è monotono rispetto alla dimensione, mentre l'errore post-calibrazione non lo è. Secondo la stessa misurazione di InternLM, il checkpoint da 2,2 miliardi di parametri è il meno affidabile dei tre quando ti dice quanto è sicuro.
Due avvertenze prima che questo diventi una conclusione. L'ECE con dieci bin di uguale ampiezza e la confidenza basata sulla probabilità massima è una statistica rumorosa sul piccolo insieme utilizzato da questa tabella — Jevbench-Hard, 111 elementi, quindi l'intera colonna ECE si basa su un centinaio scarso di domande e su una scelta di binning. E internlm/Intern-Decision-2B è l'unica scheda delle tre che non riporta la sezione di calibrazione aggiuntiva presente nella scheda 4B, quindi qui la documentazione è minore, non maggiore. Leggi lo 0.100 come un motivo per adattare la tua temperatura piuttosto che come un verdetto sui pesi.

Ciò che il repository aggiunge e ciò che ancora non rivela
La release di GitHub è più completa della scheda del modello, che di per sé è informativa — un laboratorio che intendeva realizzare un artefatto per un paper di solito non distribuisce un generatore deterministico di calibrazione e un pacchetto di valutazione con verifica hash insieme al lanciatore di addestramento.
Ciò che ora è pubblico: il codice di addestramento e l'obiettivo masked-next-token (i simboli di risposta ground-truth compaiono solo nelle etichette, mai nell'input; la risposta di ogni campo è prevista dal logit immediatamente prima del suo marcatore, e tutti i campi condividono un'unica forward pass); le sette suite di accuratezza con hash verificati tramite SHA-256 e conteggi delle righe; il codice di scoring; gli script di temperature-fitting e replay, dove si afferma che il replay cambia zero decisioni; il benchmark di calibrazione della distribuzione a 96 casi con il suo generatore e scorer offline; e una demo browser servita su loopback con POST /v1/decisions (alias /v1/jev).
Che cosa è esplicitamente escluso, secondo le parole del repository stesso: «I dati di addestramento, i record privati di calibrazione/validazione, le immagini, le pipeline di preparazione e i pesi del modello non sono inclusi». Il repository non contiene alcun file di licenza, quindi i termini del codice non sono dichiarati anche se i pesi sono Apache-2.0. E la composizione dello split di calibrazione — quali 1.728 casi, da dove — resta non divulgata, ed è l'unica omissione che limita fino a che punto si possano verificare i numeri ECE.
Le dimensioni che instradiamo effettivamente, e quella che non instradiamo
Intern-Decision-2B non è su OrcaRouter. La nostra pagina del modello per esso restituisce un 404, non esiste alcun endpoint ospitato da nessuna parte per esso che siamo riusciti a trovare, e nulla qui dovrebbe essere interpretato come un'affermazione di disponibilità. L'unico modo per chiamarlo oggi è scaricare il checkpoint ed eseguire inference.py accanto ai pesi.
Questo conta per la decisione di cui questo articolo parla davvero, perché uno scorer che nessuno eroga è uno scorer che devi gestire tu. Se la decisione a insieme chiuso che stai cercando di prendere è simile per forma a ciò che fa questa famiglia — uno stato, domande tipizzate, probabilità calibrate — il confronto in hosting è TypeSafe's Jev 1.13, che è il modello contro cui InternLM ha eseguito il benchmark di proposito e che è disponibile su OrcaRouter a $0.042 per milione di token di input con un contesto da 65K e un tempo al primo token P50 di 178 ms.

Eseguire localmente un checkpoint da 2,2 miliardi di parametri e chiamare un classificatore ospitato non sono lo stesso acquisto, ma sono lo stesso problema, e averli entrambi su un'unica chiave con il prezzo di listino del fornitore passato con un ricarico dello 0%è il motivo per tenere aperto il confronto anziché puntare l'architettura su uno dei due.
Cosa cambierebbe questo quadro?
Tre cose, in ordine.
Qualcuno al di fuori di InternLM deve riprodurre la media di 84,68 e l'ECE di 0,100, e il repository è ora ciò che rende possibile tutto questo — che è la vera notizia qui. L'esame è pubblico e verificato tramite hash; manca solo il foglio delle risposte, e il foglio delle risposte è il checkpoint che ora chiunque può scaricare.
Il fornitore deve dire a cosa serve. Un modello con uno stack di addestramento funzionante, un pacchetto di valutazione pubblicato e nessun annuncio, nessuna licenza sul suo codice e nessun endpoint ospitato si presenta come un rilascio di ricerca su cui non è ancora stata presa la decisione di farne un prodotto. I pesi Apache-2.0 depongono in una direzione; l'assenza di licenza sul codice e lo Space 401 depongono in quella opposta.
E la taglia intermedia ha bisogno di una ragione per esistere. Se il vantaggio di velocità del 2B rispetto allo 0,8B è reale ma marginale, e la sua calibrazione è la più debole delle tre a ogni metrica pubblicata da InternLM, allora la raccomandazione onesta per la maggior parte dei lettori è pagare 2,6 volte lo spazio su disco per il 4B o accettare l'accuratezza inferiore del modello più piccolo. L'argomento a favore del 2B è che è il più veloce tra i veloci — e si tratta di un argomento più debole di quanto suggerisca l'inquadratura modellata sul marketing della famiglia.
