
Intern-Decision-0.8B vs Qwen 3.8: 853 milioni di parametri e un insieme chiuso di risposte
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 592 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Intern-Decision-0.8B è il più piccolo di tre modelli decisionali che InternLM ha pubblicato su Hugging Face la mattina del 26 settembre 2026, e non è il più veloce tra loro. Questa è la prima cosa da sapere. Secondo le misurazioni interne del laboratorio, il modello gemello 2B risulta marginalmente più rapido — 33,28 ms contro 33,98 ms — e totalizza sei punti in più sulla stessa media di sette suite, quindi il motivo abituale per scegliere un checkpoint sotto il miliardo di parametri, la velocità grezza, qui non si applica. Quello che conta è la dimensione: 852.985.920 parametri, 1,71 GB di pesi bf16, abbastanza piccolo da trovare posto in modo permanente in un angolo di una macchina che ha altro da fare. Confrontate questo con Qwen3.8-Max — la versione ospitata del nucleo sparse mixture-of-experts da 2,4 trilioni di parametri pubblicato dal fornitore ad agosto, al prezzo di 2,00 $ e 6,00 $ per milione di token — e i due non competono per lo stesso lavoro. Uno restituisce una distribuzione di probabilità sulle opzioni fornite in anticipo. L'altro scrive.
La risposta breve: Intern-Decision-0.8B vale la pena averlo se ti serve una decisione a insieme chiuso valutata su hardware che già possiedi, e se 1,71 GB invece di 4,43 GB è la differenza tra il rilasciare e il non rilasciare. Non vale la pena averlo se vuoi lo scorer piccolo più accurato che InternLM ha rilasciato questa settimana — cioè il 4B — o se la tua risposta non è già enumerata nel tuo prompt, nel qual caso nessuno di questi due è lo strumento giusto e Qwen 3.8 è l'unico dei due che possa fare il lavoro.
Quello che dice il repository, e quello che nient'altro fa
Iniziamo dalle prove, perché ce ne sono molto poche. InternLM non ha fatto alcun annuncio per questo modello. Nessun post di lancio, nessun paper, nessuna descrizione del repository. La scheda Hugging Face collega uno Space demo e un repository GitHub, e al momento in cui scriviamo lo Space restituisce 401 e il link GitHub restituisce 404 — i due luoghi a cui la scheda ti indirizza per maggiori informazioni sono chiusi. Tre checkpoint sono apparsi a distanza di quaranta secondi l'uno dall'altro intorno alle 05:36 UTC del 26 settembre: Intern-Decision-0.8B, Intern-Decision-2B e Intern-Decision-4B, tutti con gli stessi tag — processo decisionale, multimodale, predizione strutturata — e tutti fine-tune di checkpoint Qwen, in questo caso Qwen3.5-0.8B.
Ciò che si può sapere dal repository è insolitamente preciso per una release non annunciata, perché il laboratorio ha distribuito il proprio modulo di inferenza insieme ai pesi. Il modello 0.8B viene caricato tramite un file da 16 KB, inference.py, nella directory del modello, richiede Python 3.12 o versione successiva e torch 2.9.1 con transformers 5.14.1, ed espone una classe DecisionEngine che si istanzia una volta e si riutilizza. Un dizionario Python in ingresso, un dizionario di risposta in uscita. Ciò che non si può sapere: se questa sia una release finita o un push anticipato, se sia in arrivo un endpoint ospitato, e se i due checkpoint tra cui si trova siano pensati per essere lo stesso prodotto a dimensioni diverse o tre prodotti diversi che si trovano a condividere un nome. Nessuno al di fuori di InternLM ne ha eseguito alcuno.

Il problema dei fratelli: la s è più veloce e migliore
Ecco la parte della tabella pubblicata da InternLM stesso che rende difficile collocare il modello 0.8B. Leggendo le tre dimensioni lungo le stesse sette suite:
• Velocità — 0,8B: 33,98 ms in media, 33,44 ms di mediana, 37,50 ms al p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Tutti misurati per query su una singola RTX 4090 tramite il percorso locale di Hugging Face.
• Media delle sette suite — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.
• Calibrazione — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.
• Occupazione su disco in bf16 — 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.
Il 2B è più rapido sulla media, drasticamente più contenuto sulla coda e più accurato, tutto allo stesso tempo. Quindi “più piccolo significa più veloce” è falso in questa famiglia — due volte, dato che il 4B è più lento di entrambi. L’unico asse su cui il modello 0.8B vince nettamente è quello su cui nessuno esegue benchmark: 1,71 GB contro i 4,43 GB del 2B e i 9,08 GB del 4B. Se devi collocare un modello di scoring in un budget di memoria fisso — un piccolo box sempre acceso, una GPU condivisa con altri tenant, un nodo edge con un modello linguistico che occupa già gran parte della scheda — questa è tutta la motivazione, ed è una motivazione concreta.
Il resto della tabella è uno studio su dove i modelli piccoli cedono in modo disomogeneo. Il punteggio Typed Decision del modello da 0,8B è 77,35 contro 80,55 di quello da 4B — tre punti di distanza con un quinto del numero di parametri. Ma Jevbench-Original scende da 98,61 a 80,56 e WildJailBreak crolla da 89,86 a 64,48. Qualunque cosa misurino quelle due suite — la scheda non lo dice, e la scheda non fornisce alcuna definizione delle suite — sono quelle che puniscono più duramente il checkpoint piccolo. Un modello che regge su un asse e precipita da un dirupo su altri due non è un modello uniformemente più debole. È un modello con un confine di competenza specifico, e vorresti sapere dove si colloca il tuo carico di lavoro prima di affidargli l'intera flotta.
Un'ulteriore cautela sulla riga di calibrazione. L'ECE di 0,066 del 0.8B è il suo numero migliore — migliore di quello di Jev, 0,095, sulla stessa suite — mentre il suo punteggio Brier di 0,530 è peggiore di quello di Jev, 0,358. L'errore calibrato e l'errore quadratico medio di probabilità non sono la stessa misura, e una tabella che ne mostra uno forte e l'altro debole ti sta dicendo che la distribuzione è ben sagomata vicino ai suoi picchi di confidenza e più grassa del dovuto nel mezzo. Se il tuo sistema applica soglie sulla confidenza, questa distinzione conta più della media.
Cosa ti compri davvero con 1,71 GB
Il percorso di inferenza in questo modello è uno scorer, non un generatore, e la differenza di costo è strutturale, non incrementale. Gli si passa uno stato condiviso, uno schema di domande denominate e, facoltativamente, fino a otto immagini. Ogni domanda è di uno di tre tipi: choice (uno di un insieme ordinato di opzioni), score (una scala ordinale, restituita come valore atteso ponderato per la probabilità), oppure noul (binario no/sì). Lo stato, lo schema e uno scheletro JSON completo dell'assistente vengono renderizzati con un segnaposto per campo, il modello esegue un singolo passaggio in avanti causale e i logit vengono letti nella posizione immediatamente precedente a ciascun segnaposto. Si applica una softmax solo sui simboli candidati ammessi per quel campo, si applica la calibrazione adattata del checkpoint e i simboli vengono rimappati ai valori delle vostre opzioni.
Da ciò derivano tre conseguenze. Non esiste alcun token di output e quindi nessun prezzo di output — un milione di decisioni non costa nulla in token. Non esiste alcun ciclo di decodifica né alcuna parentesi graffa da dimenticare, quindi un JSON malformato non è una modalità di errore. E poiché lo spazio delle risposte di ogni campo viene assemblato per ogni richiesta, uno schema che inventi questo pomeriggio non richiede alcun riaddestramento: aggiungi una domanda e le sue opzioni diventano simboli candidati per quel campo.
I limiti sono dichiarati altrettanto chiaramente. Da una a sedici domande, fino a 62 opzioni ciascuna, fino a otto immagini e un limite predefinito di 8.192 token — con gli input che lo superano rifiutati anziché troncati. Quest'ultima clausola è una decisione di progettazione sulla quale vale la pena soffermarsi, perché il troncamento silenzioso è il modo in cui un classificatore inizia silenziosamente a rispondere a una domanda diversa da quella che hai posto. InternLM fallisce in modo rumoroso, il che è corretto e anche una trappola operativa: un lungo thread di ticket più uno schema più immagini supererà quota 8.192 prima di quanto ti aspetti, e non esiste un percorso agevole quando accade.
E gli 1,71 GB comprano un’economia di runtime che puoi moltiplicare. A 33,98 ms per decisione, un milione di decisioni equivale a 9,44 ore di una RTX 4090. Il 4B impiega 12,3 ore per lo stesso milione e rinuncia a dieci punti e mezzo di accuratezza in cambio dei 7,37 GB che non avevi. Nessuno dei due numeri include il costo della macchina, e nessuno dei due include la parte che la gente dimentica: stai gestendo un servizio, e non c’è nessun server nel repository.

Qwen 3.8 non è un solo modello, e la fascia economica è quella da tenere d'occhio
Qwen 3.8, se considerato come nome a sé stante, è Qwen3.8-2.4T-A95B: il nucleo sparse mixture-of-experts da 2,4 trilioni di parametri che Alibaba ha pubblicato come pesi aperti il 12 agosto 2026, con circa 95 miliardi di parametri attivi per token e una licenza personalizzata anziché Apache 2.0. L'offerta ospitata di quello stesso nucleo è Qwen3.8-Max, disponibile in generale tramite un'API a pagamento dal 3 agosto e aggiornato come snapshot datato 2 settembre. Sono un unico cervello venduto in due modi, e la seconda offerta è quella che la maggior parte delle persone chiamerà effettivamente.
Su dati indipendenti, Artificial Analysis misura lo snapshot di settembre di Qwen3.8-Max a un Intelligence Index di 45,4 — quindicesimo su 145 modelli indicizzati — con un punteggio AA Coding di 76,2 al nono posto su 138, GPQA Diamond a 92,8, Humanity's Last Exam a 43,1 e un punteggio di recall a contesto lungo di 80,3. Il checkpoint aperto resta indietro rispetto all'API da cui è stato distillato, fermo a 39,9. Nella nostra finestra playground di sette giorni, Qwen3.8-Max si attesta a un p50 di 2.578 ms e un p95 di 9.539 ms a 55,5 token di output al secondo, con un tasso di errore dell'1,57%. Qwen3.8-Max è invocabile su OrcaRouter al prezzo di listino del provider con 0% di ricarico aggiunto, così un cambiamento di prezzo di Alibaba è effettivo dalla nostra parte lo stesso giorno anziché al ciclo di fatturazione successivo.
Il fratello denso è quello da confrontare con un checkpoint locale da 1,71 GB, però, perché è il modo più economico per acquistare capacità generale in questa famiglia. Qwen3.8-27B è Apache 2.0, ha una finestra di contesto nativa di 262.144 token, e Qwen3.8-27B si colloca a 0,33 $ e 2,40 $ per milione di token nel nostro catalogo. Il suo Artificial Analysis Intelligence Index è 33,7. Ha all'incirca trentadue volte il numero di parametri di Intern-Decision-0.8B, è ancora generativo, ed è ancora lo strumento sbagliato per una decisione a insieme chiuso su larga scala — ma è l'onesta opzione intermedia, e l'unico membro di questo confronto che sia davvero economico e davvero generale allo stesso tempo.
Scorer contro generatore, detto chiaramente
• Contesto — Qwen3.8-Max dispone di una finestra di 1.000.000 di token. Intern-Decision-0.8B rifiuta tutto ciò che supera 8.192. Un fattore di 122, imposto anziché troncato.
• Input — Qwen3.8-Max accetta testo, immagini e video. Intern-Decision-0.8B accetta testo e fino a otto immagini, e i token delle immagini rientrano nello stesso budget di 8.192.
• Output — Qwen3.8-Max scrive, ragiona, chiama strumenti ed emette JSON su richiesta. Intern-Decision-0.8B non è in grado di produrre un paragrafo, una motivazione o un piano. Può solo valutare le opzioni che hai già pensato di elencare.
• Costo per chiamata — una chiamata di triage realistica di 800 token di input e 150 token di output costa circa 0,0025 $ su Qwen3.8-Max, prima di qualsiasi token di ragionamento, e il suo lato output è ottimisticamente piccolo perché è un modello di ragionamento. Un milione di tali chiamate costa all'incirca 2.500 $. Intern-Decision-0.8B non ha alcun prezzo per token: un milione di decisioni equivale a 9,44 ore di una 4090 che possiedi o noleggi.
• Latenza — 2.578 ms alla mediana su Qwen3.8-Max negli ultimi sette giorni, includendo rete e accodamento. I 33,98 ms di Intern-Decision-0.8B sono un semplice forward pass su una scheda locale e non sono la stessa misurazione; il confronto onesto è un ordine di grandezza, non ottanta volte.
• Prove — ogni dato di Intern-Decision-0.8B riportato qui è dichiarato dal fornitore sui sistemi di valutazione di InternLM e non è stato riprodotto da nessuno, latenza inclusa. Ogni dato di Qwen 3.8 è di Alibaba stessa oppure una misurazione di Artificial Analysis, ed è etichettato separatamente sopra.
• Punteggio indipendente — Qwen3-Max ne ha uno. Intern-Decision-0.8B non ne ha di alcun tipo, e nessun provider lo distribuisce.

Due modi per eseguire questa pipeline
Il bivio operativo è più netto del bivio del benchmark. Intern-Decision-0.8B è un modulo, non un servizio. Non esiste un endpoint compatibile con OpenAI, nessun server di batching, nessun health check, nessuna policy di retry e nessuna seconda replica: te la costruisci tu. Si carica in un processo e risponde a un dizionario alla volta, e se ti serve il failover, il failover sei tu. Questa è una descrizione equa di un checkpoint di ricerca da 853 milioni di parametri pubblicato senza una nota di lancio, e di conseguenza se ne dovrebbe tenere conto nella decisione.
La metà generativa della stessa pipeline è una chiamata di rete, e una chiamata di rete è ciò per cui esiste un router. Sia Qwen3.8-Max sia Qwen3.8-27B sono raggiungibili dietro un'unica chiave compatibile con OpenAI, e il failover automatico significa che un upstream degradato non diventa il tuo incidente — vale la pena menzionarlo qui perché il tasso di errore live su sette giorni di Qwen3.8-Max dalla nostra parte è dell'1,57%, che è basso finché non è la tua richiesta. Il pattern che ha senso è quello che questo abbinamento sta descrivendo silenziosamente: esegui localmente lo scorer economico a insieme chiuso perché è veloce e non costa nulla per chiamata, e instrada il passo di ragionamento perché è lì che le riduzioni di prezzo, il ricambio dei modelli e le interruzioni avvengono davvero.
Due cose che non affermeremo. Intern-Decision-0.8B non è una delle nostre route e non lo sarà finché InternLM non lo ospiterà da qualche parte — non abbiamo intenzione di lasciar intendere il contrario. E oggi non ospitiamo alcun modello InternLM, quindi nulla in questo articolo è un invito a far girare il soggetto attraverso di noi.
Cosa cambierebbe la risposta
Tre domande aperte, tutte a cui si può rispondere nel giro di giorni. InternLM pubblica il repository GitHub a cui rimanda la sua stessa scheda, e con esso una descrizione di come questi pesi sono stati messi a punto? Un post di lancio segue i checkpoint, trasformando un push silenzioso in una release documentata con una storia di deployment dichiarata? E qualcuno indipendente riproduce la media di 79,38 o l'errore di calibrazione di 0,066 su hardware che non è di InternLM?
Finché uno di questi non arriva, la lettura onesta di Intern-Decision-0.8B è ristretta e specifica: è il classificatore a insieme chiuso più economico di una famiglia di tre, su un footprint che entra dove il suo stesso fratello più veloce e più accurato non entra, pubblicato senza un annuncio e senza quell'unico artefatto che ti direbbe per che cosa è stato messo a punto. Se la tua decisione è di tipo closed-set, le tue risposte sono enumerabili in un prompt, e 1,71 GB è il numero da cui il tuo deployment dipende davvero, è la scelta giusta e non c'è nient'altro di simile a quella dimensione. Se la tua risposta non è enumerabile in anticipo, o il tuo stato supera 8.192 token, o hai bisogno di una motivazione che puoi mostrare a un essere umano, allora non c'è mai stata partita — e il modello che vuoi non è mai stato quello da 853 milioni di parametri.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
