
Intern-Decision-0.8B vs Gemma 4 12B: una testa di scoring contro un generalista multimodale
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 592 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Il modo più economico per capire che cos'è Intern-Decision-0.8B — e che cosa non è — consiste nel metterlo accanto a Gemma 4 12B e notare poi che il confronto riguarda quasi interamente ciò che ciascun modello fa con il proprio strato di output. Gemma 4 12B, il modello multimodale senza encoder da 11,95 miliardi di parametri di DeepMind, rilasciato il 3 giugno 2026 con licenza Apache 2.0, è un generalista generativo: gli si forniscono testo, immagini, audio o video e scrive una risposta. Intern-Decision-0.8B, caricato silenziosamente da InternLM su Hugging Face il 26 settembre 2026 senza alcun annuncio, è un fine-tune del molto più piccolo Qwen3.5-0.8B che non produce alcun testo: riceve uno stato, uno schema di domande denominate e fino a otto immagini, e restituisce una distribuzione di probabilità calibrata per ciascuna domanda dopo un singolo passaggio in avanti. Uno scrive. L'altro assegna punteggi. Tutto quanto segue deriva da questo.
Questo rende strano inquadrare questo confronto come una gara, e vale la pena dirlo chiaramente prima delle righe delle specifiche: questi due non sono sostituti, e chiunque scelga tra loro ha già posto male il problema. Gemma 4 12B risponde alla domanda "quale dovrebbe essere la risposta". Intern-Decision-0.8B risponde alla domanda "quale di queste sedici opzioni è, e quanto sei sicuro" — e lo fa senza un ciclo di decodifica, ed è da lì che derivano le differenze di latenza e costo. Il confronto utile, quindi, riguarda come collegare ciascuno in un unico flusso di lavoro, non quale dei due vince.
La differenza più grande in assoluto è il lato di output della fattura.
Gemma 4 12B viene fatturato come qualsiasi modello generativo: sia i token di input sia quelli di output. Quando gli si chiede JSON strutturato, ognuno di quei token viene generato, campionato e fatturato, e più il tuo schema è lungo e annidato, più token ci sono. Non è una critica al modello — è ciò che fa un decoder — ma è la voce di costo che le teste decisionali hanno lo scopo di eliminare. Intern-Decision-0.8B non ha token di output. La sua scheda è esplicita sul perché: il percorso di inferenza non chiama mai generate()/, leggendo i logit nelle posizioni immediatamente precedenti a ciascun <decision>/ segnaposto in uno scheletro pre-renderizzato e applicando una softmax soltanto sui simboli candidati consentiti per quel campo. Il contatore di utilizzo chiamato output_tokens/ conta i campi valutati, non il testo.
La conseguenza si amplifica su larga scala. Una pipeline che etichetta diecimila record con Gemma 4 12B paga per diecimila documenti JSON; la stessa pipeline su Intern-Decision-0.8B paga per i prompt e nient'altro. Se il numero assoluto sia elevato dipende interamente dal vostro volume e dal vostro schema, e chiunque abbia un budget per token può calcolarlo in un foglio di calcolo in dieci minuti. Ma la direzione non è in discussione, ed è il motivo per cui è nata una categoria di piccoli modelli decisionali.
Latenza, e perché il divario dei parametri è fuorviante
• Modello di throughput — Intern-Decision-0.8B: un solo forward pass, nessun ciclo di decodifica. Gemma 4 12B: generazione autoregressiva, un token alla volta.
• Latenza misurata — Intern-Decision-0.8B: 33,98 ms di media / 37,50 ms p95 su una singola RTX 4090 tramite il percorso locale di Hugging Face, secondo la misurazione effettuata da InternLM stesso. Gemma 4 12B: non esiste un valore comparabile per il passaggio singolo, perché non c'è alcun passaggio singolo da misurare.
• Ingombro — Intern-Decision-0.8B: circa 1,73 GB di spazio di archiviazione del repository, 852.985.920 parametri distribuiti su uno shard linguistico da 1,50 GB, uno shard di visione da 176 MB e un proiettore da 25 MB. Gemma 4 12B: i materiali di lancio di Google lo indicano a 16 GB di VRAM o memoria unificata.
• Determinismo dell'output — Intern-Decision-0.8B: argmax sui logit candidati, quindi lo stesso input produce sempre la stessa etichetta. Gemma 4 12B: campionamento a meno che non si imposti la temperatura a zero, e anche in quel caso l'etichetta arriva come testo che si deve analizzare.
Il divario di parametri di 14x tra questi due modelli non si traduce in nulla di simile a un divario di runtime di 14x su un compito decisionale, perché il lavoro è di natura diversa. Intern-Decision-0.8B impiega la sua unica passata a leggere il prompt — lo stato, lo schema, le descrizioni delle opzioni — e poi si ferma. Gemma 4 12B impiega quella stessa lettura del prompt e poi vi aggiunge ogni token della risposta. Per uno schema a sedici campi con etichette descrittive delle opzioni, la fase di generazione non è un errore di arrotondamento; è la maggior parte del tempo effettivo. La tabella di InternLM stessa lo dimostra involontariamente: il suo gemello 2B registra una media di 33,28 ms, marginalmente più veloce dei 33,98 ms del 0.8B. Quando l'elaborazione del prompt domina, il numero di parametri smette di essere la leva. img src="2.png">

Dove Gemma 4 12B è semplicemente in una categoria a parte
Sarebbe disonesto fermare la scheda tecnica all’inquadramento dei compiti decisionali, perché al di fuori di esso Gemma 4 12B non è semplicemente in vantaggio — sta praticando uno sport diverso.
Intern-Decision-0.8B accetta testo più fino a otto immagini, e questa è tutta la sua superficie di input. Il suo tetto di input predefinito è di 8.192 token, rifiutati anziché troncati, che è ben al di sotto del massimo di position embedding di 262.144 pubblicizzato dalla sua configurazione — il tetto, non l'architettura, è la finestra pratica. Gemma 4 12B accetta nativamente testo, immagini, audio e video attraverso un design senza encoder che proietta patch e forme d'onda grezze direttamente nello spazio di embedding, mantiene una finestra di contesto di 256K e restituisce testo. La scheda pubblicata da Google lo valuta al 77,2% su MMLU Pro, 77,5% su AIME 2026 senza strumenti, 72,0% su LiveCodeBench v6, 78,8% su GPQA Diamond, 69,1% su MMMU Pro e 79,7% su MATH-Vision. Quelli sono dati del fornitore provenienti dalla scheda di valutazione di Google stessa e, a differenza della tabella di Intern-Decision-0.8B, hanno alle spalle un anno di utilizzo da parte di terzi, perché Gemma 4 è stato rilasciato in un ecosistema — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — fin dal primo giorno.
Le release inoltre non si somigliano per niente, e il contrasto è istruttivo. Gemma 4 12B aveva un blog di lancio, un rapporto tecnico su arXiv, una pagina di famiglia con cinque modelli, una scheda di valutazione e un link per il download il giorno stesso in cui è apparsa. Intern-Decision-0.8B aveva una model card con un URL di GitHub che restituisce 404 e uno Space demo che restituisce 401, ed è apparsa entro quaranta secondi da due fratelli più grandi ugualmente non documentati. Una di queste è un prodotto. L'altra è un checkpoint che qualcuno ha deciso di mettere su internet.
Entrambi sono Apache 2.0, e non è una riga condivisa banale.
L'unica dimensione in cui i due si incontrano davvero è quella delle licenze, e vale un paragrafo perché è il punto in cui la decisione cambia per gli utenti commerciali. Entrambi sono Apache 2.0. Gemma 4 12B viene distribuito con i termini di licenza Gemma 4 ospitati presso Google, che la model card identifica come Apache 2.0; Intern-Decision-0.8B riporta Apache-2.0 insieme a un secondo LICENSE-QWEN/ file, che è la gestione corretta per un modello derivato dai pesi Qwen e un segnale del fatto che InternLM ha fatto le carte in regola anche per una release che non ha annunciato.
Ciò distingue entrambi dalla famiglia LFM2.5 di Liquid AI, la cui LFM Open License v1.0 subordina i diritti commerciali alla condizione che la tua entità giuridica rimanga al di sotto di una soglia di ricavi annui di 10 milioni di dollari: un vincolo reale che un acquirente di modelli decisionali che confronta le opzioni dovrebbe leggere prima di dare per scontato che "pesi aperti" significhi la stessa cosa ovunque. Se il tuo caso d'uso è commerciale e i tuoi ricavi superano quella soglia, Apache 2.0 e la licenza LFM non sono intercambiabili, e né Gemma 4 12B né Intern-Decision-0.8B comportano tale restrizione.
Il rendiconto onesto sui numeri di Intern-Decision-0.8B
Ogni dato prestazionale di Intern-Decision-0.8B è dichiarato dal fornitore e non riprodotto. Non è una formalità: è lo stato attuale delle prove, e dovrebbe determinare quanto peso abbia la tabella. InternLM ha selezionato i benchmark, ha selezionato i concorrenti, ha eseguito le valutazioni e ha pubblicato i risultati, e non esiste alcuna esecuzione indipendente su nessuna classifica pubblica. Una ricerca di Artificial Analysis per il modello non restituisce assolutamente nulla. img src="3.png">

Con quell'etichetta apposta, la forma del risultato resta comunque informativa. Il modello 0.8B registra 77,35 sul benchmark Typed Decision di TypeSafe contro 73,35 di Jev 1.13 — il modello da cui il benchmark prende il nome — e 94,52 su ToolACE contro 91,29. Ha una media di 79,38 sull'intera suite, con i suoi modelli fratelli 2B e 4B a 84,68 e 90,02. La colonna che dovrebbe far esitare un acquirente è WildJailBreak, dove segna 64,48 contro il 96,29 di Jev: un divario di robustezza ai rifiuti di quella entità è una proprietà del fine-tune, e se derivi dalla base Qwen3.5-0.8B, dall'obiettivo di decision-tuning o dal numero di parametri non è documentato da nessuna parte. Il suo profilo di calibrazione è la lettura più interessante — un Brier di 0,530 e un errore di calibrazione atteso di 0,066, contro 0,358 e 0,095 di Jev — il che significa che è meno accurato nel complesso, ma le sue confidenze dichiarate seguono più da vicino la sua accuratezza. Per un flusso di lavoro basato su soglie, questa distinzione conta più dell'accuratezza grezza, ed è il tipo di cosa che InternLM non aveva alcun incentivo a pubblicare.
Di contro, anche la scheda di valutazione di Gemma 4 12B è dichiarata dal fornitore — anche Google ha eseguito quei benchmark — ma è in circolazione da giugno, è stata distribuita attraverso ogni principale runtime locale, e qualsiasi discrepanza sarebbe emersa. Il divario probatorio tra «non riprodotto per una settimana» e «non riprodotto per quattro mesi e nessuno l'ha contraddetto» è la vera differenza tra queste due colonne.
Come li combineresti effettivamente
Il pattern che ha senso non è una scelta. Una testa decisionale gestisce le chiamate strutturate — routing, triage, classificazione, scoring rispetto a una rubrica — dove l'insieme delle risposte è chiuso, la latenza conta e i token di output sono puro overhead. Un generalista gestisce tutto ciò che richiede prosa, codice, sintesi o contesto lungo: il riepilogo di escalation, la spiegazione del perché il ticket è andato alla fatturazione, la bozza che un umano modifica.
Se stai cercando di capire dove si colloca il confine, l'esperimento più economico è mettere entrambe le metà dietro un unico endpoint. OrcaRouter instrada oltre 200 modelli attraverso un'unica API compatibile con OpenAI, con failover automatico e prezzi di listino dei provider passati senza alcun ricarico, il che significa che testare un modello decisionale ospitato e un generalista ospitato nello stesso script costa una chiave e un pomeriggio. Vale la pena essere precisi su un confine qui: Intern-Decision-0.8B non è uno dei nostri — è un checkpoint Apache-2.0 che scarichi ed esegui da te, e il motivo principale per scegliere un modello da 1,73 GB è che vive dove già vivono i tuoi dati. La metà generativa del pattern è la parte che dista una riga. Per quanto riguarda specificamente Gemma 4 12B, non è nemmeno nel nostro catalogo; le dimensioni di Gemma 4 che instradiamo sono 31B e 26B A4B, e il 12B è un download locale. img src="4.png">

Il verdetto, quindi, non è un vincitore. Intern-Decision-0.8B è una testa di scoring economica, veloce e deterministica, proveniente da un laboratorio che non l’ha ancora spiegata, con una tabella di benchmark che nessuno ha riprodotto e una colonna di robustezza ai rifiuti che dovrebbe essere testata prima che si avvicini a input non attendibili. Gemma 4 12B è un generalista multimodale maturo a pesi aperti, con una scheda pubblicata, un report tecnico e quattordici volte i parametri, ed è lo strumento sbagliato per una chiamata di classificazione a sedici campi — non perché sia peggiore, ma perché generare una risposta a una domanda il cui insieme di risposte hai già scritto è un modo costoso di ottenere un’etichetta.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
