Una card di titolo per un articolo di confronto che recita Intern-Decision-4B vs Qwen 3.8, con il sottotitolo Un forward pass da 44 millisecondi contro 2,4 trilioni di parametri, con tre icone a linea piatta che suggeriscono un piccolo scorer veloce, un grande modello di ragionamento e un confronto dei costi.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: un forward pass da 44 millisecondi contro 2,4 trilioni di parametri

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

InternLM ha pubblicato Intern-Decision-4B su Hugging Face la mattina del 26 settembre 2026 — nessun post di lancio, nessun articolo di blog, un link a GitHub sulla sua stessa model card che restituisce 404 e uno Space demo che restituisce 401. I pesi sono reali e scaricabili; l'annuncio non c'è. E il modello che ne sta alla base è un fine-tune di Qwen3.5-4B, ed è ciò che rende il confronto con il modello di punta ospitato qualcosa di più di una scheda tecnica. Questi due non sono rivali. Sono le due estremità di un'unica pipeline, e tutta la questione è dove cade la linea di demarcazione tra loro. Il nucleo sottostante è il modello da 2,4 trilioni di parametri che il fornitore ha pubblicato ad agosto e che ora viene servito come Qwen3.8-Max, fatturato a $2,00 e $6,00 per milione di token; Intern-Decision-4B è una ricostruzione da 4,54 miliardi di parametri di quel modello base vecchio di sette mesi, che non emette alcun token, risponde fino a sedici domande tipizzate in un singolo forward pass e non costa nulla per chiamata perché non c'è alcun output da fatturare.

La risposta in una riga: se il tuo compito è una decisione con un insieme chiuso di risposte, Intern-Decision-4B è circa cinquanta volte più veloce per decisione e strutturalmente più economico, e nessun modello di frontiera riuscirà a batterlo su quell'asse così ristretto. Se il tuo compito è qualsiasi altra cosa — ragionamento, contesto lungo, uso di strumenti, qualunque cosa in cui la risposta non sia già elencata nel tuo prompt — Qwen 3.8 non è semplicemente migliore, è l'unico dei due in grado di svolgere il lavoro. Tutto quanto segue serve a individuare con precisione quella linea.

Ciò che è effettivamente confermato e ciò che non lo è

Partiamo dalle prove, perché l'inquadramento conta. Non esiste alcun annuncio del fornitore per Intern-Decision-4B. Nessun comunicato stampa, nessun paper, nessuna descrizione del repository da leggere. Ciò che esiste oggi è un repository Hugging Face pubblicato questa mattina sotto l'organizzazione internlm — Intern Large Models, il gruppo Shanghai AI Laboratory — che porta la licenza Apache 2.0 con la licenza Qwen upstream conservata accanto come LICENSE-QWEN. Due checkpoint fratelli sono comparsi a quaranta secondi di distanza l'uno dall'altro: Intern-Decision-0.8B con 853 milioni di parametri e Intern-Decision-2B con 2,21 miliardi. Tutti e tre portano gli stessi tag — processo decisionale, multimodale, predizione strutturata — e tutti e tre si trovano sotto un'unica collezione di modelli che non si risolve ancora pubblicamente.

Ciò che non è confermato: se questa sia la versione finale o un push anticipato. Il repository è stato creato alle 05:36 UTC e modificato di nuovo prima delle 08:00 UTC dello stesso giorno, mentre ulteriori attività pubbliche sui checkpoint gemelli sono proseguite oltre le 09:00. InternLM non ha detto quale sia la strategia di deployment prevista, non ha pubblicato il repository a cui rimanda e non ha detto se arriverà un endpoint ospitato. Considerate ogni cifra di benchmark in questo articolo come dichiarata dal fornitore e non riprodotta — perché al momento in cui scriviamo non è stato scritto letteralmente nient'altro su questo modello, da nessuna parte. Tre percorsi di ricerca separati non restituiscono nulla sul nome.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

La scommessa architetturale: uno scorer, non un generatore

La frase più importante nella documentazione stessa di Intern-Decision-4B è una negazione: il percorso di inferenza "non chiama generate() né campiona testo libero". Questo non è un dettaglio implementativo, è l'intero design, ed è ciò che lo distingue dal chiamare Qwen3.8-Max con uno schema JSON e sperare che la parentesi graffa si chiuda.

Ecco il meccanismo, come lo descrive la scheda. Si fornisce al modello uno stato condiviso, uno schema di domande con nome e, facoltativamente, fino a otto immagini. Ogni domanda è di uno di tre tipi: scelta (scegli una tra un insieme ordinato di opzioni), punteggio (valuta su una scala ordinale, restituito come valore atteso ponderato per la probabilità), noul (una scelta binaria no/sì). Il prompt di sistema, lo stato, lo schema e uno scheletro JSON completo dell'assistente vengono renderizzati con un segnaposto per campo. Poi — e questo è il trucco — il modello esegue un singolo passaggio in avanti causale, e i logit vengono letti nella posizione immediatamente prima di ciascun segnaposto. Si calcola una softmax solo sui simboli candidati consentiti per quel campo, si applica la calibrazione del checkpoint e i simboli vengono rimappati sui valori originali delle tue opzioni.

Le conseguenze sono concrete. Poiché lo spazio delle risposte di ciascun campo viene assemblato per richiesta anziché essere incorporato in una testa di vocabolario, uno schema che inventi questo pomeriggio non richiede alcun riaddestramento — aggiungi una domanda, e le opzioni diventano simboli candidati per quel campo. Poiché non c'è alcun ciclo di decodifica, non c'è token di output, nessuna parentesi graffa da dimenticare e nessuna logica di retry attorno a JSON malformato. E poiché tutte le domande vengono valutate a partire dalla stessa lettura dello stato, sedici domande costano un solo forward pass, non sedici.

I limiti sono altrettanto concreti, e la scheda li dichiara senza mezzi termini. Da una a sedici domande, fino a 62 opzioni per domanda, fino a otto immagini. Un massimo predefinito di 8.192 token — e gli input che lo superano vengono rifiutati senza troncamento. Quest'ultima clausola è una scelta di progettazione su cui vale la pena soffermarsi: il troncamento silenzioso è il modo in cui un classificatore inizia silenziosamente a rispondere a una domanda diversa da quella che gli è stata posta, e InternLM ha scelto invece di fallire in modo rumoroso. È la decisione giusta, ed è anche una trappola operativa, perché un lungo thread di ticket più uno schema più le immagini supereranno quota 8.192 prima di quanto ci si aspetti e non esiste un percorso indolore — si ottiene un errore.

Dove vince Intern-Decision-4B, e non c'è partita

Due assi, ed entrambi sono strutturali anziché incrementali.

Latenza per decisione — 44,16 ms di media, 44,03 ms di mediana, 44,60 ms al p95, misurata su una singola RTX 4090 tramite il percorso locale di Hugging Face. Rispetto a Qwen3.8-Max, la cui finestra live di sette giorni sul nostro playground mostra un p50 di 2.474 ms e un p95 di 9.789 ms a 55,4 token di output al secondo. Si tratta di circa 56× alla mediana, e il confronto non è tanto ingiusto quanto piuttosto un confronto tra due operazioni diverse: un modello classifica, l'altro ragiona e poi scrive. Il divario è reale e altrettanto lo è la ragione che lo determina.

• Costo per decisione — e questo è aritmetica, non un'opinione. Prendi una chiamata realistica di triage del supporto: 800 token di input tra stato e schema, e 150 token di output in JSON strutturato. Su Qwen3.8-Max sono 800 × $2,00/M più 150 × $6,00/M, ossia circa $0,0025 per decisione, prima ancora di un singolo token di ragionamento — e Qwen3.8-Max è un modello di ragionamento, quindi il lato output è ottimisticamente piccolo. Un milione di decisioni costa all'incirca $2.500. Lo stesso milione di decisioni su Intern-Decision-4B costa zero in token e circa 12,3 ore di tempo su RTX 4090. Intern-Decision-4B non ha un prezzo di output perché non ha output.

Lo scambio è onesto e ovvio: il 4B ha bisogno di una GPU che possiedi o noleggi, la occupa e può fare soltanto una cosa. Ma se quell’unica cosa è ciò che il tuo prodotto fa milioni di volte al giorno, l’aritmetica di cui sopra è l’intero business case, e nessuna capacità di un modello di frontiera può cambiarlo.

Il numero che Qwen 3.8 non pubblica: calibrazione

Questo è il differenziatore silenzioso, ed è quello che la maggior parte dei confronti non coglierà, perché non ha l'aspetto di un benchmark.

Intern-Decision-4B restituisce una distribuzione sui valori delle tue opzioni, non solo un'etichetta — più una confidenza, e per le domande noul la probabilità calibrata di sì. InternLM riporta un Brier score di 0,347 e un errore di calibrazione atteso di 0,065 sulla propria suite, e include la temperatura adattata nel checkpoint: 1,99241824, adattata separatamente per questa dimensione tramite minimizzazione della log-verosimiglianza negativa su 1.728 casi di calibrazione designati con 1.693 casi di validazione tenuti da parte. Le etichette della suite di test non sono state utilizzate per selezionarla. Nella scheda è presente una seconda diagnostica indipendente su 96 casi che utilizza distribuzioni di riferimento esatte invece di etichette campionate, e mostra che Brier/ECE complessivi passano da 0,628 / 0,213 prima della calibrazione a 0,550 / 0,089 dopo — con il passo di calibrazione che riduce l'errore atteso di ben oltre la metà.

Ora cerca lo stesso dato sul versante Qwen 3.8. Non c’è. Alibaba pubblica punteggi Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking e long-context recall — tutte misure di capacità. Non pubblica alcuna metrica di calibrazione per nessun membro della famiglia Qwen 3.8, perché la confidenza di un modello generativo non è una quantità che il fornitore distribuisce. Se il tuo sistema ha bisogno di una probabilità su cui applicare una soglia o su cui instradare, anziché di una risposta di cui deve fidarsi, quella differenza non è una questione di grado. Un modello ti dà un numero con un tasso di errore documentato; l’altro ti dà testo, e costruisci attorno a esso la tua stima di confidenza.

Dove Qwen 3.8 vince, e non c’è nemmeno partita

Metti i due a confronto su ciò che si può chiedere loro di fare e i confini smettono di essere sottili.

• Contesto — Qwen3.8-Max dispone di una finestra da 1.000.000 di token. Intern-Decision-4B rifiuta qualsiasi cosa oltre 8.192. Si tratta di un fattore 122, e non esiste alcuna soluzione alternativa, perché il limite di input viene applicato anziché troncato.

• Modalità di input — Qwen3.8-Max accetta testo, immagini e video. Intern-Decision-4B accetta testo e immagini, fino a un massimo di otto, e i token delle immagini rientrano nello stesso budget di 8.192.

• Ragionamento e strumenti — Qwen3.8-Max include tra le proprie capacità dichiarate l'uso di strumenti, la modalità JSON e il ragionamento, e registra un Artificial Analysis Intelligence Index di 45,4, quindicesimo su 145 modelli indicizzati, con un punteggio AA Coding di 76,2, nono su 138. Si tratta di cifre indipendenti pubblicate da Artificial Analysis, non di dichiarazioni dei fornitori. Intern-Decision-4B non ha alcuna voce in Artificial Analysis, nessun punteggio indipendente di alcun tipo e nessuna capacità di ragionare, pianificare o chiamare alcunché.

• Output aperto — Qwen3.8-Max scrive. Intern-Decision-4B non può produrre un paragrafo, una motivazione o un piano. Può solo assegnare un punteggio alle opzioni che hai già pensato di elencare.

Da notare anche sul fronte open-weights: se vuoi il core di Qwen 3.8 stesso e non la via ospitata, Qwen3.8-27B è il fratello dense — 27,8 miliardi di parametri, Apache 2.0, una finestra di contesto di 262.144 token e circa $0,33 / $2,40 per milione di token dove viene servito. Ottiene 33,7 sull'AA Intelligence Index. È ancora un ordine di grandezza più grande di Intern-Decision-4B, ancora generativo e ancora lo strumento sbagliato per una decisione a insieme chiuso ad alto volume — ma è l'onesta opzione intermedia, e l'unica delle tre a essere davvero economica e davvero capace allo stesso tempo.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Leggere onestamente la tabella di benchmark di InternLM

La scheda di Intern-Decision-4B contiene una tabella comparativa, e ciò che ne è assente è più informativo di ciò che contiene. Le righe sono Jev, Laya, SemIf, Kev, JevK5 e gli 0.8B e 2B di InternLM stessa. Ognuna di queste è un'altra voce di System One o di modello decisionale — Jev di TypeSafe AI, Laya di Convai Innovations, e altre tre. Ogni cifra è dichiarata dal fornitore sugli harness di InternLM stessa. Non c'è proprio alcun modello di frontiera nella tabella.

Non è una svista. È l'ambito onesto della rivendicazione. La media di punta di 90,02 di Intern-Decision-4B su sette suite — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — è una rivendicazione di leadership nella categoria decision-model, cosa che fa in questa tabella, superando l'88,74 di Jev e il 57,77 di Laya. Non è una rivendicazione di competere con Qwen 3.8, e InternLM non avanza questa rivendicazione da nessuna parte. La model card è circoscritta alla propria categoria, e leggere una vittoria di categoria come una vittoria di capacità è l'errore che questa sezione ha lo scopo di prevenire.

Altre due avvertenze. I dati sulla latenza — 44 ms di media su una 4090 — sono misurati dal fornitore, dipendono dal carico di lavoro e dall'hardware, e un forward pass su singola GPU non è la stessa misurazione di una chiamata API ospitata che include round-trip di rete e accodamento. E il pilot di calibrazione è di 96 casi: una diagnostica, non un benchmark, e la scheda lo dice.

La questione del deployment, che è il vero bivio

Dimentica per un momento i benchmark e chiediti cosa ciascuno ti chiede sul piano operativo.

Intern-Decision-4B occupa circa 9,1 GB su disco in bf16 — due shard linguistici da 4,26 GB e 4,15 GB, una torre di visione da 612 MB e un proiettore da 54 MB. Si carica tramite un file da 16 KB inference.py fornito nel repository stesso, con una classe DecisionEngine che istanzi una volta e riutilizzi. Un dict Python in ingresso, un dict di risposta in uscita, con un requisito di Python 3.12+. Gira a 44 ms su una 4090, e il gemello 0.8B è abbastanza piccolo da poterci ragionare con molto meno. Ma il modulo è l'interfaccia — non c'è alcun server, nessun endpoint compatibile con OpenAI e nessuna API ospitata. Stai costruendo il servizio attorno ad esso, e se te ne servono due per il failover stai costruendo anche quello.

Il lato generativo della stessa pipeline è una decisione del tutto diversa, ed è quella per cui un router esiste davvero. Qwen3.8-Max e Qwen3.8-27B sono entrambi richiamabili su OrcaRouter dietro la stessa chiave compatibile con OpenAI, al prezzo di listino del provider, con 0% di markup passato così com'è — quindi quando Alibaba modifica il prezzo di un Qwen, sul nostro lato è attivo lo stesso giorno, non al ciclo di fatturazione successivo. Intern-Decision-4B non è una delle nostre rotte e non lo sarà finché InternLM non lo ospiterà da qualche parte; non abbiamo intenzione di far finta del contrario. Ciò che copriamo è la metà di questa pipeline che consiste in una chiamata di rete: una chiave per oltre 200 modelli, failover automatico se Qwen3.8-Max degrada — il suo tasso di errore live a sette giorni è 1,78% — e la possibilità di fare A/B tra i due livelli di Qwen 3.8 nello stesso percorso di richiesta prima di impegnarti su uno dei due.

Questo è il pattern che vale la pena portare via. Esegui lo scorer in locale, perché è economico e veloce e fa bene una sola cosa specifica. Instrada il passo di reasoning, perché è lì che avvengono davvero il ricambio dei fornitori, i tagli di prezzo e le interruzioni.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Quale dovresti scegliere davvero

Scegli Intern-Decision-4B se la tua decisione è a insieme chiuso, le tue risposte sono enumerabili in un prompt, esegui la stessa decisione su larga scala e ti interessa la probabilità quanto l'etichetta. Instradamento dei ticket, moderazione dei contenuti rispetto a una tassonomia fissa, estrazione strutturata in uno schema che controlli, rubriche di valutazione, gate binari — qualsiasi cosa in cui un umano avrebbe potuto scrivere in anticipo l'elenco delle opzioni. I 4,54 miliardi di parametri sono onesti riguardo al tetto: la scheda stessa mostra il 4B a 73,87 su Jevbench-Hard contro 100,00 su Easy, quindi più difficile è la forma della decisione, più il modello piccolo rinuncia.

Scegli Qwen 3.8 — ossia Qwen3.8-Max se vuoi il core ospitato, Qwen3.8-27B se vuoi pesi che puoi tenere — se la risposta non è enumerabile in anticipo, se l'input è più lungo di 8.192 token, se ti serve una motivazione che puoi mostrare a un essere umano, se ti servono chiamate a strumenti o se ti serve il video. Scegli Qwen 3.8 anche se semplicemente non vuoi gestire una GPU: 12,3 ore di tempo su 4090 per milione di decisioni sono economiche solo se hai già la 4090 e qualcos'altro da farci negli altri 363 giorni.

Scegli entrambi se la tua pipeline ha la forma che hanno in realtà la maggior parte delle pipeline — un classificatore closed-set economico davanti, un modello di frontiera dietro per i casi in cui il classificatore non è sicuro. È la configurazione per cui è stata creata la confidenza calibrata di Intern-Decision-4B, ed è il motivo per cui il numero ECE sopra conta più della media principale.

Cosa guardare

Tre domande aperte, tutte con risposta possibile nel giro di pochi giorni. InternLM pubblica il repository GitHub a cui rimanda la sua stessa scheda — attualmente un 404 — e con esso una descrizione dell'addestramento? A un rilascio dei pesi fa seguito un annuncio, che trasforma un push silenzioso in una release documentata? E qualcosa di indipendente riproduce la media di 90,02, o il Brier di 0,347, su hardware che non è quello di InternLM?

C'è una piccola incoerenza da segnalare mentre aspetti, perché è il tipo di cosa che conta quando si dimensiona un deployment. Il modello si chiama 4B. Il numero di parametri è 4.539.265.536 — 4,54 miliardi. Il gemello 0.8B è da 853 milioni e il gemello 2B è da 2,21 miliardi, entrambi arrotondati per eccesso o per difetto di un soffio. Solo il 4B arrotonda per difetto di oltre mezzo miliardo. Non è un problema. È un promemoria del fatto che, in un rilascio non annunciato, il documento è l'unica specifica che hai, e persino il documento è ancora in fase di modifica.