
Intern-Decision-0.8B è arrivato senza alcun annuncio: cosa ha messo silenziosamente InternLM su Hugging Face
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 592 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Il link GitHub sulla model card restituisce 404. La Space demo restituisce 401. Non esiste alcuna collezione, alcun post di blog, alcun rapporto tecnico e alcun risultato di ricerca da nessuna parte per la stringa "Intern-Decision" che non sia un annuncio di tirocinio — eppure Intern-Decision-0.8B è lì su Hugging Face in questo momento come checkpoint completo, scaricabile, Apache-2.0, fine-tuned da Qwen3.5-0.8B, caricato nelle prime ore del 26 settembre 2026 insieme a due fratelli più grandi comparsi negli stessi tre minuti: Intern-Decision-2B e Intern-Decision-4B. InternLM ha già rilasciato in questo modo in passato, ed è per questo che tutto ciò che segue è messo insieme dal repository stesso anziché da un post di lancio. La distinzione qui conta più del solito: un repo ti dice cosa esiste, e solo il fornitore può dirti a cosa serve.
Ciò che il repository effettivamente dice, nel dettaglio, è abbastanza insolito da valere la pena di leggerlo. Questi non sono modelli di chat e non sono piccoli modelli linguistici nel senso usuale. Intern-Decision-0.8B prende un pezzo di stato, uno schema di domande denominate che si scrivono in anticipo e, facoltativamente, fino a otto immagini, e restituisce una distribuzione di risposte per ogni domanda in un solo passaggio in avanti. Non chiama mai generate(). Non esegue mai campionamento. Non c'è output testuale da analizzare, nessun JSON da riparare, nessun ciclo di nuovi tentativi attorno a una parentesi graffa che non si è mai chiusa. La ristrettezza è l'intera architettura, e colloca questo modello nella stessa piccola categoria di Jev 1.13 di TypeSafe e Laya di Convai — una categoria su cui InternLM ha evidentemente fatto benchmark di proposito, perché Jevbench è il benchmark di TypeSafe stesso ed è la prima colonna della tabella.
Ecco ciò che è conoscibile dal checkpoint, ciò che è solo rivendicato dal checkpoint, e ciò che nessuno al di fuori di InternLM può attualmente dire in alcun modo.
Cosa c'è effettivamente nel repository
La scheda è breve e schietta riguardo alla discendenza. Intern-Decision-0.8B è descritto come "un modello decisionale strutturato multimodale fine-tuned a partire da Qwen3.5-0.8B" — la base Qwen rilasciata il 28 febbraio 2026 — e il repository contiene un secondo file di licenza, LICENSE-QWEN, accanto ai termini Apache-2.0, che è ciò che un modello derivato dovrebbe fare ed è di per sé un piccolo segnale di onestà. L'indice di Hugging Face riporta 852.985.920 parametri distribuiti su tre shard: uno shard linguistico da 1,50 GB, uno shard di visione da 176 MB e un proiettore da 25 MB. Lo spazio totale del repository è di circa 1,73 GB, compresi i file del tokenizer, il che rende l'intera cosa comodamente collocabile su una singola GPU consumer o su un laptop ben equipaggiato.
La configurazione rivela un'architettura che Qwen ha distribuito lungo l'intera generazione 3.5, piuttosto che una rete decisionale su misura. Si tratta di un Qwen3_5ForConditionalGeneration con 24 layer disposti secondo uno schema ripetuto di tre layer ad attenzione lineare ogni un layer ad attenzione completa, dimensione nascosta 1.024, 8 attention head contro 2 key-value head, dimensione della head pari a 256 e un embedding di posizione massimo di 262.144 token. È mantenuto un singolo layer di multi-token prediction. Il percorso visivo è reale: il testo della scheda descrive la gestione delle immagini, il processore accetta immagini e il checkpoint include una vision tower e un projector per servirle — quindi il tag multimodale sul repository è supportato dai pesi, non solo dai tag.
Vale la pena notare il quadro della famiglia perché condiziona il modo in cui interpretare tutto il resto. InternLM ha caricato tre dimensioni in 40 secondi: 0,8B, poi 2B, poi 4B. I conteggi dei parametri sono 852.985.920, 2.213.241.664 e 4.539.265.536. La scheda del modello 4B contiene una sezione extra — uno studio pilota di calibrazione a distribuzione nota con 96 casi e punteggi prima e dopo — che la scheda del modello 0,8B non ha. Questa asimmetria non è prova di un difetto nel modello piccolo; è prova che la documentazione del modello piccolo è stata scritta con un budget più ridotto, che è il tipo di cosa che caratterizza un rilascio silenzioso.
Come funziona davvero il percorso di inferenza
Il file inference.py incluso è il file più informativo del repository, perché documenta un contratto anziché un prompt. La sequenza è questa:
• Fornisci una richiesta con uno stato (l'elemento da valutare), delle domande (uno schema) e, facoltativamente, delle immagini.
• Le opzioni di ogni domanda sono mappate a simboli a token singolo — da A a Z, poi lettere minuscole, poi cifre, fino a 62 opzioni per domanda.
• Il prompt di sistema, lo stato, lo schema e uno scheletro JSON completo dell'assistente vengono renderizzati con un segnaposto <decision> per campo.
• Viene eseguito un singolo forward pass causale. I logits vengono letti nella posizione immediatamente prima di ciascun segnaposto.
• Una softmax viene calcolata solo sui simboli candidati consentiti di quel campo, viene applicata la calibrazione del checkpoint e i simboli vengono rimappati sui valori originali delle opzioni.
Il motore espone tre tipi di domanda. choice accetta un oggetto ordinato che mappa i valori delle opzioni alle descrizioni. score accetta un elenco — che diventa i valori stringa "0", "1", "2" e così via — oppure un oggetto ordinato con chiavi stringa numeriche finite, consentendo al modello di restituire un valore atteso ponderato per la probabilità e non solo una categoria. noul è una decisione binaria con no prima di sì. La risposta restituisce, per campo, la distribuzione di probabilità calibrata, una confidenza pari alla probabilità massima del candidato, la decisione argmax con risoluzione dei pareggi lessicografica, e per le domande score il valore numerico atteso e una legenda. I limiti sono espliciti: da una a sedici domande per richiesta, fino a 62 opzioni ciascuna, un tetto massimo predefinito di input di 8.192 token che viene rifiutato anziché troncato, e un massimo di otto immagini i cui token contano ai fini di tale tetto.
Due dettagli in quell'elenco meritano attenzione, perché determinano se ci si può fidare dell'output. Il primo è che nel prompt non viene inserita alcuna risposta gold: il modello valuta candidati di cui non gli è stata mostrata la risposta. Il secondo è che usage.output_tokens non è un conteggio di token di testo; conta i campi valutati. Chiunque lo colleghi a un calcolo esistente del budget di token ne resterà sorpreso, e la scheda lo dichiara invece di lasciarlo scoprire.

La tabella dei benchmark, e quanto crederci
Avvertenza per il lettore su questa sezione: ogni numero qui sotto è dichiarato dal fornitore e non riprodotto. InternLM ha selezionato i benchmark, selezionato i modelli di confronto, eseguito le valutazioni e pubblicato la tabella. Non esiste alcuna esecuzione indipendente di Intern-Decision-0.8B su nessuna classifica pubblica, e una ricerca di Artificial Analysis non restituisce assolutamente nulla per il modello. Questo non rende falsa la tabella. La rende non verificata, e significa che le colonne sono più utili per leggere la forma del risultato che il suo livello.

• Jevbench, tre split — Intern-Decision-0.8B registra 97,92 su Easy, 80,56 su Original e 52,25 su Hard. Jev di TypeSafe si attesta a 100,00, 98,61 e 72,07 sugli stessi split.
• Decisione tipizzata — il modello 0.8B ottiene 77,35 contro il 73,35 di Jev. Questa è l'unica colonna in cui il modello più piccolo del campo batte il modello da cui il benchmark prende il nome.
• ToolACE — 94,52 per il modello 0,8B contro 91,29 di Jev. ToolACE è un benchmark di function calling, e un decision head che supera Jev sulla selezione degli strumenti è l'affermazione più sostanziale della tabella.
• AG News — 88,61 contro l'89,57 di Jev. Di fatto allo stesso livello della frontiera di questa categoria nella classificazione di argomenti a quattro classi.
• WildJailBreak — 64,48 contro il 96,29 di Jev. Questo è il collasso. Probabilmente la colonna che conta di più per un modello che punteresti a input non attendibili, e quella in cui il modello 0.8B è più lontano dal riferimento.
• Media — 79,38 per il modello 0.8B, 84,68 per il suo stesso fratello 2B, 90,02 per il 4B. La famiglia cresce ripidamente, il che è esattamente ciò che ci si aspetterebbe ed è di per sé un tenue argomento a favore del fatto che la tabella non sia stata costruita a ritroso per lusingare il modello di punta.
• Calibrazione — Brier 0,530 ed errore di calibrazione atteso 0,066 per il modello 0,8B. Jev riporta 0,358 e 0,095. Leggendo i due valori insieme emerge un quadro più chiaro di quanto ciascun numero offra da solo: il modello 0,8B è meglio calibrato di Jev nel senso dell'ECE — le sue confidenze dichiarate seguono più da vicino la sua accuratezza — pur essendo sensibilmente meno accurato nel complesso. È un profilo plausibile per un modello piccolo con una temperatura deliberatamente adattata, e non è una combinazione lusinghiera da pubblicare per caso.
L'insieme di confronto ha una proprietà evidente: è dominato dai modelli decisionali. Jev, Laya, SemIf, Kev e JevK5 compaiono tutti; il benchmark della tabella stessa è di TypeSafe. InternLM ha scelto di farsi misurare sul terreno di un concorrente, usando l'infrastruttura di valutazione di un concorrente, e poi ha pubblicato le colonne in cui il suo modello più piccolo perde. È il tipo di decisione che un team prende quando non ha in programma una campagna di marketing attorno al rilascio — il che è coerente con tutto il resto del modo in cui è stato rilasciato.
La temperatura di calibrazione è la più interessante
Intern-Decision-0.8B adotta una temperatura predefinita di 2,747760550703, mediante minimizzazione della NLL su 1.728 casi di calibrazione designati con 1.693 casi di validazione separati. La scheda è esplicita sul fatto che le etichette della suite di test non sono state utilizzate per selezionarla. La trasformazione applicata è p = softmax(candidate_logits.float()) seguita da calibrated_p = softmax(log(p) / T).
Quella è calibrazione della probabilità del candidato, non una temperatura di campionamento, e la distinzione non è pedanteria. Poiché la trasformazione viene applicata dopo il softmax e ne preserva l'ordinamento, non può cambiare affatto la decisione dell'argmax. Sposta la confidenza, la noul probabilità di "sì" e il valore atteso di una domanda a punteggio — e lascia identica la decisione principale. Se il tuo flusso di lavoro legge l'etichetta, la temperatura è un'operazione a vuoto. Se il tuo flusso di lavoro legge la probabilità — la sottopone a soglia, la ordina in base a essa o la immette in un calcolo del valore atteso a valle — la temperatura è la differenza tra un numero che significa qualcosa e un numero che non significa nulla. Passare temperature=1 restituisce la distribuzione non calibrata, il che è una comoda via di fuga per chiunque voglia applicarvi sopra una propria calibrazione.
La temperatura viene adattata per singolo checkpoint anziché essere condivisa. Il modello 4B usa un valore diverso, 1.99241824, e la scheda ti indica di usare il modulo di inferenza fornito con la dimensione che hai scaricato, in modo che la sua calibrazione predefinita corrisponda. Chiunque copi un wrapper di inferenza da un modello affine a un altro applicherà silenziosamente la temperatura sbagliata.
Trentaquattro millisecondi, e un risultato che non dovrebbe essere possibile
InternLM ha misurato la latenza end-to-end per query su una singola RTX 4090 utilizzando il percorso locale di Hugging Face — una misurazione reale, ma anche la configurazione di serving più lenta possibile, dato che un deployment in produzione utilizzerebbe un runtime compilato o con batching. Jev è indicato a 109,70 ms di media e 106,30 ms di mediana con un p95 di 146,70 ms. Intern-Decision-0.8B si attesta a 33,98 / 33,44 / 37,50 ms.
Il dato su cui vale la pena soffermarsi è l'omologo 2B: 33,28 ms di media, 33,15 ms di mediana. Il 2B è più velocedel 0,8B, con un margine abbastanza piccolo da poter essere rumore, ma non nella direzione che il numero di parametri lascerebbe prevedere. Non è un errore nella tabella e non riguarda davvero i modelli. Un modello decisionale esegue esattamente un forward pass su un prompt la cui lunghezza è determinata dallo stato, dallo schema e dalle descrizioni delle opzioni — non da qualcosa che il modello scrive, perché non scrive nulla. Per prompt in quel regime, l'elaborazione del prompt domina e il numero di parametri è un costo di secondo ordine. La conseguenza pratica è che il motivo abituale per cui si sceglie il checkpoint più piccolo — si paga per token — qui non vale. La vera ragione per scegliere il 0,8B invece del 2B è l'occupazione di memoria e il fatto che l'intero repository sta in 1,73 GB, non il throughput.
Cosa non può ancora essere stabilito
Questa è la parte a cui avrebbe risposto un post di lancio e che un repository non può.
Non c'è una data di rilascio dichiarata, nessun annuncio e nulla sui canali pubblici di InternLM che descriva la famiglia. L'URL di GitHub stampato sulla scheda del modello non è raggiungibile. Lo Space demo a cui si fa riferimento nella scheda non è pubblicamente leggibile. Non c'è una collezione che raccolga i tre checkpoint, il che significa che l'unico modo per trovare il 2B o il 4B è guardare la lista dei modelli dell'organizzazione. Non c'è un paper, quindi i dati di addestramento, la ricetta di tuning, il numero di passi di addestramento e ciò che "decision tuning" ha modificato nei pesi sono tutti non indicati. Non c'è una valutazione indipendente, nessuna replica della latenza da parte di terzi e nessuna prova che qualcuno al di fuori di InternLM abbia eseguito il checkpoint.
Ci sono anche due domande che la scheda solleva senza rispondere. La prima è che cosa significhi in pratica il divario di WildJailBreak: un deficit di robustezza al rifiuto di quella portata è una proprietà del fine-tune, e se rifletta il modello di base, l'obiettivo di decision-tuning o il piccolo numero di parametri non è qualcosa che il repository ti dica. La seconda è che cosa succede al tetto massimo di input. Le richieste oltre 8.192 token vengono rifiutate anziché troncate, il che è il comportamento corretto per un modello di scoring, ma significa che la finestra di contesto pratica non è quella di 262.144 pubblicizzata dalla configurazione: è quella che rientra in 8.192 token tra stato, schema, opzioni e patch di immagini. Per documenti lunghi con schemi ricchi, quel tetto arriva prima di quanto suggerisca il diagramma dell'architettura.
Dove si colloca, e come provarlo senza scommetterci sopra
L'inquadramento onesto è che Intern-Decision-0.8B è un checkpoint rilasciato con affermazioni non verificate e nessuna documentazione a supporto. Questa combinazione non è un motivo per ignorarlo — un rilascio di pesi Apache-2.0 che puoi scaricare e misurare in un pomeriggio è una situazione migliore di un'API in lista d'attesa — ma significa che l'onere della validazione ricade su di te. Il motore si carica da una directory locale, gira su una GPU di classe 4090 o inferiore, e la scheda fornisce una richiesta di esempio che puoi incollare. Una giornata di valutazione rispetto ai tuoi casi etichettati ti dirà più sulla colonna WildJailBreak di quanto possa fare la tabella del fornitore.
Se il livello decisionale è la parte che stai valutando, il termine di confronto utile è una soluzione ospitata. Jev 1.13 di TypeSafe è il modello rispetto al quale InternLM ha eseguito il benchmark, ed è richiamabile oggi tramite un unico endpoint compatibile con OpenAI a $0,042 per milione di token di input, con l'output fatturato a zero — lo stesso prezzo pubblicato dal fornitore, perché OrcaRouter trasferisce il prezzo di listino del fornitore senza alcun ricarico invece di aggiungere un margine. Mettere sulla stessa chiave, nello stesso pomeriggio, un head decisionale self-hosted da 0,8B e un'API decisionale ospitata è un esperimento decisamente più economico che stipulare due contratti separati per rispondere alla stessa domanda.

Ciò che cambierebbe questo quadro non è un benchmark. È la comparsa del repository GitHub, o la pubblicazione della ricetta di tuning da parte di InternLM, o una prima esecuzione indipendente del checkpoint che arriva su una classifica. Finché non accade una di queste cose, la descrizione accurata di Intern-Decision-0.8B è limitata e poco lusinghiera e del tutto a suo favore: i pesi sono reali, il contratto di inferenza è documentato meglio di quanto riesca a fare la maggior parte dei modelli lanciati, e il marketing non è ancora iniziato.
