Una card con titolo hero che recita 'Intern-Decision-0.8B vs Gemma 4 12B' con il sottotitolo 'Uno scrive una risposta, l'altro la valuta', che porta i badge 'testa di scoring da 0,8B, nessun token di output' e 'generalista multimodale da 11,95B', con il logo OrcaRouter composto nell'angolo.
Guides & Insights

Intern-Decision-0.8B vs Gemma 4 12B: una testa di scoring contro un generalista multimodale

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modo più economico per capire che cos'è Intern-Decision-0.8B — e che cosa non è — consiste nel metterlo accanto a Gemma 4 12B e notare poi che il confronto riguarda quasi interamente ciò che ciascun modello fa con il proprio strato di output. Gemma 4 12B, il modello multimodale senza encoder da 11,95 miliardi di parametri di DeepMind, rilasciato il 3 giugno 2026 con licenza Apache 2.0, è un generalista generativo: gli si forniscono testo, immagini, audio o video e scrive una risposta. Intern-Decision-0.8B, caricato silenziosamente da InternLM su Hugging Face il 26 settembre 2026 senza alcun annuncio, è un fine-tune del molto più piccolo Qwen3.5-0.8B che non produce alcun testo: riceve uno stato, uno schema di domande denominate e fino a otto immagini, e restituisce una distribuzione di probabilità calibrata per ciascuna domanda dopo un singolo passaggio in avanti. Uno scrive. L'altro assegna punteggi. Tutto quanto segue deriva da questo.

Questo rende strano inquadrare questo confronto come una gara, e vale la pena dirlo chiaramente prima delle righe delle specifiche: questi due non sono sostituti, e chiunque scelga tra loro ha già posto male il problema. Gemma 4 12B risponde alla domanda "quale dovrebbe essere la risposta". Intern-Decision-0.8B risponde alla domanda "quale di queste sedici opzioni è, e quanto sei sicuro" — e lo fa senza un ciclo di decodifica, ed è da lì che derivano le differenze di latenza e costo. Il confronto utile, quindi, riguarda come collegare ciascuno in un unico flusso di lavoro, non quale dei due vince.

La differenza più grande in assoluto è il lato di output della fattura.

Gemma 4 12B viene fatturato come qualsiasi modello generativo: sia i token di input sia quelli di output. Quando gli si chiede JSON strutturato, ognuno di quei token viene generato, campionato e fatturato, e più il tuo schema è lungo e annidato, più token ci sono. Non è una critica al modello — è ciò che fa un decoder — ma è la voce di costo che le teste decisionali hanno lo scopo di eliminare. Intern-Decision-0.8B non ha token di output. La sua scheda è esplicita sul perché: il percorso di inferenza non chiama mai generate()/, leggendo i logit nelle posizioni immediatamente precedenti a ciascun <decision>/ segnaposto in uno scheletro pre-renderizzato e applicando una softmax soltanto sui simboli candidati consentiti per quel campo. Il contatore di utilizzo chiamato output_tokens/ conta i campi valutati, non il testo.

La conseguenza si amplifica su larga scala. Una pipeline che etichetta diecimila record con Gemma 4 12B paga per diecimila documenti JSON; la stessa pipeline su Intern-Decision-0.8B paga per i prompt e nient'altro. Se il numero assoluto sia elevato dipende interamente dal vostro volume e dal vostro schema, e chiunque abbia un budget per token può calcolarlo in un foglio di calcolo in dieci minuti. Ma la direzione non è in discussione, ed è il motivo per cui è nata una categoria di piccoli modelli decisionali.

Latenza, e perché il divario dei parametri è fuorviante

• Modello di throughput — Intern-Decision-0.8B: un solo forward pass, nessun ciclo di decodifica. Gemma 4 12B: generazione autoregressiva, un token alla volta.

• Latenza misurata — Intern-Decision-0.8B: 33,98 ms di media / 37,50 ms p95 su una singola RTX 4090 tramite il percorso locale di Hugging Face, secondo la misurazione effettuata da InternLM stesso. Gemma 4 12B: non esiste un valore comparabile per il passaggio singolo, perché non c'è alcun passaggio singolo da misurare.

• Ingombro — Intern-Decision-0.8B: circa 1,73 GB di spazio di archiviazione del repository, 852.985.920 parametri distribuiti su uno shard linguistico da 1,50 GB, uno shard di visione da 176 MB e un proiettore da 25 MB. Gemma 4 12B: i materiali di lancio di Google lo indicano a 16 GB di VRAM o memoria unificata.

• Determinismo dell'output — Intern-Decision-0.8B: argmax sui logit candidati, quindi lo stesso input produce sempre la stessa etichetta. Gemma 4 12B: campionamento a meno che non si imposti la temperatura a zero, e anche in quel caso l'etichetta arriva come testo che si deve analizzare.

Il divario di parametri di 14x tra questi due modelli non si traduce in nulla di simile a un divario di runtime di 14x su un compito decisionale, perché il lavoro è di natura diversa. Intern-Decision-0.8B impiega la sua unica passata a leggere il prompt — lo stato, lo schema, le descrizioni delle opzioni — e poi si ferma. Gemma 4 12B impiega quella stessa lettura del prompt e poi vi aggiunge ogni token della risposta. Per uno schema a sedici campi con etichette descrittive delle opzioni, la fase di generazione non è un errore di arrotondamento; è la maggior parte del tempo effettivo. La tabella di InternLM stessa lo dimostra involontariamente: il suo gemello 2B registra una media di 33,28 ms, marginalmente più veloce dei 33,98 ms del 0.8B. Quando l'elaborazione del prompt domina, il numero di parametri smette di essere la leva. img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Dove Gemma 4 12B è semplicemente in una categoria a parte

Sarebbe disonesto fermare la scheda tecnica all’inquadramento dei compiti decisionali, perché al di fuori di esso Gemma 4 12B non è semplicemente in vantaggio — sta praticando uno sport diverso.

Intern-Decision-0.8B accetta testo più fino a otto immagini, e questa è tutta la sua superficie di input. Il suo tetto di input predefinito è di 8.192 token, rifiutati anziché troncati, che è ben al di sotto del massimo di position embedding di 262.144 pubblicizzato dalla sua configurazione — il tetto, non l'architettura, è la finestra pratica. Gemma 4 12B accetta nativamente testo, immagini, audio e video attraverso un design senza encoder che proietta patch e forme d'onda grezze direttamente nello spazio di embedding, mantiene una finestra di contesto di 256K e restituisce testo. La scheda pubblicata da Google lo valuta al 77,2% su MMLU Pro, 77,5% su AIME 2026 senza strumenti, 72,0% su LiveCodeBench v6, 78,8% su GPQA Diamond, 69,1% su MMMU Pro e 79,7% su MATH-Vision. Quelli sono dati del fornitore provenienti dalla scheda di valutazione di Google stessa e, a differenza della tabella di Intern-Decision-0.8B, hanno alle spalle un anno di utilizzo da parte di terzi, perché Gemma 4 è stato rilasciato in un ecosistema — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — fin dal primo giorno.

Le release inoltre non si somigliano per niente, e il contrasto è istruttivo. Gemma 4 12B aveva un blog di lancio, un rapporto tecnico su arXiv, una pagina di famiglia con cinque modelli, una scheda di valutazione e un link per il download il giorno stesso in cui è apparsa. Intern-Decision-0.8B aveva una model card con un URL di GitHub che restituisce 404 e uno Space demo che restituisce 401, ed è apparsa entro quaranta secondi da due fratelli più grandi ugualmente non documentati. Una di queste è un prodotto. L'altra è un checkpoint che qualcuno ha deciso di mettere su internet.

Entrambi sono Apache 2.0, e non è una riga condivisa banale.

L'unica dimensione in cui i due si incontrano davvero è quella delle licenze, e vale un paragrafo perché è il punto in cui la decisione cambia per gli utenti commerciali. Entrambi sono Apache 2.0. Gemma 4 12B viene distribuito con i termini di licenza Gemma 4 ospitati presso Google, che la model card identifica come Apache 2.0; Intern-Decision-0.8B riporta Apache-2.0 insieme a un secondo LICENSE-QWEN/ file, che è la gestione corretta per un modello derivato dai pesi Qwen e un segnale del fatto che InternLM ha fatto le carte in regola anche per una release che non ha annunciato.

Ciò distingue entrambi dalla famiglia LFM2.5 di Liquid AI, la cui LFM Open License v1.0 subordina i diritti commerciali alla condizione che la tua entità giuridica rimanga al di sotto di una soglia di ricavi annui di 10 milioni di dollari: un vincolo reale che un acquirente di modelli decisionali che confronta le opzioni dovrebbe leggere prima di dare per scontato che "pesi aperti" significhi la stessa cosa ovunque. Se il tuo caso d'uso è commerciale e i tuoi ricavi superano quella soglia, Apache 2.0 e la licenza LFM non sono intercambiabili, e né Gemma 4 12B né Intern-Decision-0.8B comportano tale restrizione.

Il rendiconto onesto sui numeri di Intern-Decision-0.8B

Ogni dato prestazionale di Intern-Decision-0.8B è dichiarato dal fornitore e non riprodotto. Non è una formalità: è lo stato attuale delle prove, e dovrebbe determinare quanto peso abbia la tabella. InternLM ha selezionato i benchmark, ha selezionato i concorrenti, ha eseguito le valutazioni e ha pubblicato i risultati, e non esiste alcuna esecuzione indipendente su nessuna classifica pubblica. Una ricerca di Artificial Analysis per il modello non restituisce assolutamente nulla. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Con quell'etichetta apposta, la forma del risultato resta comunque informativa. Il modello 0.8B registra 77,35 sul benchmark Typed Decision di TypeSafe contro 73,35 di Jev 1.13 — il modello da cui il benchmark prende il nome — e 94,52 su ToolACE contro 91,29. Ha una media di 79,38 sull'intera suite, con i suoi modelli fratelli 2B e 4B a 84,68 e 90,02. La colonna che dovrebbe far esitare un acquirente è WildJailBreak, dove segna 64,48 contro il 96,29 di Jev: un divario di robustezza ai rifiuti di quella entità è una proprietà del fine-tune, e se derivi dalla base Qwen3.5-0.8B, dall'obiettivo di decision-tuning o dal numero di parametri non è documentato da nessuna parte. Il suo profilo di calibrazione è la lettura più interessante — un Brier di 0,530 e un errore di calibrazione atteso di 0,066, contro 0,358 e 0,095 di Jev — il che significa che è meno accurato nel complesso, ma le sue confidenze dichiarate seguono più da vicino la sua accuratezza. Per un flusso di lavoro basato su soglie, questa distinzione conta più dell'accuratezza grezza, ed è il tipo di cosa che InternLM non aveva alcun incentivo a pubblicare.

Di contro, anche la scheda di valutazione di Gemma 4 12B è dichiarata dal fornitore — anche Google ha eseguito quei benchmark — ma è in circolazione da giugno, è stata distribuita attraverso ogni principale runtime locale, e qualsiasi discrepanza sarebbe emersa. Il divario probatorio tra «non riprodotto per una settimana» e «non riprodotto per quattro mesi e nessuno l'ha contraddetto» è la vera differenza tra queste due colonne.

Come li combineresti effettivamente

Il pattern che ha senso non è una scelta. Una testa decisionale gestisce le chiamate strutturate — routing, triage, classificazione, scoring rispetto a una rubrica — dove l'insieme delle risposte è chiuso, la latenza conta e i token di output sono puro overhead. Un generalista gestisce tutto ciò che richiede prosa, codice, sintesi o contesto lungo: il riepilogo di escalation, la spiegazione del perché il ticket è andato alla fatturazione, la bozza che un umano modifica.

Se stai cercando di capire dove si colloca il confine, l'esperimento più economico è mettere entrambe le metà dietro un unico endpoint. OrcaRouter instrada oltre 200 modelli attraverso un'unica API compatibile con OpenAI, con failover automatico e prezzi di listino dei provider passati senza alcun ricarico, il che significa che testare un modello decisionale ospitato e un generalista ospitato nello stesso script costa una chiave e un pomeriggio. Vale la pena essere precisi su un confine qui: Intern-Decision-0.8B non è uno dei nostri — è un checkpoint Apache-2.0 che scarichi ed esegui da te, e il motivo principale per scegliere un modello da 1,73 GB è che vive dove già vivono i tuoi dati. La metà generativa del pattern è la parte che dista una riga. Per quanto riguarda specificamente Gemma 4 12B, non è nemmeno nel nostro catalogo; le dimensioni di Gemma 4 che instradiamo sono 31B e 26B A4B, e il 12B è un download locale. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Il verdetto, quindi, non è un vincitore. Intern-Decision-0.8B è una testa di scoring economica, veloce e deterministica, proveniente da un laboratorio che non l’ha ancora spiegata, con una tabella di benchmark che nessuno ha riprodotto e una colonna di robustezza ai rifiuti che dovrebbe essere testata prima che si avvicini a input non attendibili. Gemma 4 12B è un generalista multimodale maturo a pesi aperti, con una scheda pubblicata, un report tecnico e quattordici volte i parametri, ed è lo strumento sbagliato per una chiamata di classificazione a sedici campi — non perché sia peggiore, ma perché generare una risposta a una domanda il cui insieme di risposte hai già scritto è un modo costoso di ottenere un’etichetta.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno