Una card del titolo generata che recita 'Intern-Decision-2B vs Gemma 4 12B', con il sottotitolo '8.192 token contro 256.000', con i badge 'un valutatore che rifiuta' e 'un generalista che scrive', con il logo OrcaRouter sovrapposto nell'angolo.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B: un tetto di 8.192 token contro una finestra di 256K

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Supponi che la cosa da giudicare sia un fascicolo di sinistro assicurativo di quaranta pagine. internlm/Intern-Decision-2B lo rifiuterà. Non lo troncherà, non lo riassumerà — lo rifiuterà, perché il motore di inferenza incluso dichiara DecisionEngine(max_length=8192) e la model card afferma in linguaggio chiaro che gli input di dimensioni eccessive vengono «rifiutati senza troncamento». google/gemma-4-12B-it — Gemma 4 12B Unified — prenderà lo stesso documento, più le fotografie scansionate allegate, più la telefonata registrata, e ti scriverà una risposta. Questo contrasto è l'intero confronto, e non ha quasi nulla a che fare con i conteggi dei parametri — 2.213.241.664 contro 11.959.730.224 — che una lettura da scheda tecnica metterebbe al primo posto.

Intern-Decision-2B è il secondo di tre checkpoint decisionali che InternLM ha caricato su Hugging Face il 26 settembre 2026 senza alcun annuncio, fine-tuned da Qwen/Qwen3.5-2B e con licenza Apache-2.0, mantenendo accanto i termini di Qwen. Gemma 4 12B Unified è il modello multimodale senza encoder di Google DeepMind di maggio 2026, un sistema any-to-any che accetta testo, immagini, audio e video e genera testo su una finestra di 256.000 token in oltre 140 lingue. Uno dei due è uno scorer. L'altro è un generalista che, se lo si istruisce con attenzione, può anche assegnare punteggi male. Scegliere tra i due è meno una questione di benchmark che una domanda su quale forma abbia già la tua risposta.

Laddove i due non siano realmente comparabili

Vale la pena essere schietti su questo prima di passare ai numeri, perché il confronto invita a una falsa simmetria.

Intern-Decision-2B non produce alcun token. Riceve uno stato, da una a sedici domande denominate con un massimo di 62 opzioni ciascuna e, facoltativamente, fino a otto immagini; genera uno scheletro JSON dell'assistente con un segnaposto <decision> per campo; esegue un singolo passaggio forward causale; legge i logit nella posizione immediatamente precedente a ciascun segnaposto; applica la softmax solo sui simboli legali di quel campo; e applica una temperatura calibrata di 2,100509348278. L'output è una distribuzione calibrata e un argmax per campo. La scheda dichiara apertamente il lato negativo: "Questa API esegue uno scoring strutturato dei candidati. Non chiama generate() né campiona testo libero."

Gemma 4 12B genera. Tutto ciò che fa — ragionare con pensiero configurabile, chiamata di funzioni, OCR, comprensione di grafici, riconoscimento vocale, copertura di 140 lingue — passa attraverso un ciclo di decodifica su un vocabolario di 262.144 voci. Chiedile una decisione di instradamento con probabilità e otterrai prosa contenente un numero, e il numero sarà quello che il campionatore ha prodotto, non un softmax sul tuo insieme di opzioni.

Quindi la domanda pratica non è «quale sia più accurato». È «la mia risposta è già un insieme chiuso?». Se lo è, il 12B è un modo dispendioso di scegliere da un elenco. Se non lo è, Intern-Decision-2B non può aiutarti a nessun livello di accuratezza.

Il tetto di input è la linea più netta tra loro

Ecco la dimensione da soppesare al di sopra di tutte le altre, perché produce guasti totali anziché degradati.

• Lunghezza dell'input — Intern-Decision-2B accetta 8.192 token e rifiuta qualsiasi input più lungo, a gran voce; Gemma 4 12B accetta 256.000 token e, sulla scheda ufficiale di Google, ottiene il 43,4% su MRCR v2 eight-needle a 128k.

• Immagini — fino a otto per Intern-Decision-2B, e contano sullo stesso budget di 8.192 token; proporzioni e risoluzione variabili per Gemma 4 12B, con input di testo e immagini interlacciati in qualsiasi ordine.

• Modalità di input — testo e immagine per uno; testo, immagine, audio e video per l'altro.

• Lingua — non viene fatta alcuna affermazione multilingue in nessuna parte della documentazione di Intern-Decision; Gemma 4 copre 140+ lingue pre-addestrate con un punteggio multilingue valutato di 83.4 su MMMLU per il 12B.

• Output — una distribuzione di risposte JSON tipizzata per uno; testo generato per l'altro.

Il limite di 8.192 non è arbitrario, ed è proprio questo che lo rende difficile da aggirare. L'obiettivo decisionale legge un logit in una posizione fissa per campo, quindi il prompt deve contenere lo stato, lo schema e lo scheletro completo in un'unica passata; non esiste alcuna strategia di chunking che preservi il contratto. Un ticket, un'email, uno stato JSON breve, uno o due screenshot — questo è il centro del design. Un documento che richiede retrieval è un documento per cui questo modello non è pensato.

Quanto ti costa ciascuno, onestamente contato

Intern-Decision-2B non ha un endpoint ospitato né un provider. La pagina del modello di OrcaRouter per esso restituisce un 404, e nulla in questo articolo costituisce un'affermazione di disponibilità. Invocarlo significa scaricare circa 4,46 GB di repository — uno shard linguistico da 3,76 GB, una torre di visione da 612,5 MB, un proiettore da 50,3 MB — ed eseguire inference.py accanto ai pesi in un ambiente Python 3.12 con torch 2.9.1 e transformers 5.14.1, su una GPU che stai pagando indipendentemente dal fatto che stia o meno assegnando punteggi alle decisioni.

Non è uno svantaggio in ogni caso, e vale la pena fare i calcoli invece di darli per scontati. A 33,28 ms di media per richiesta su una singola RTX 4090, nella stessa misurazione di InternLM, un Intern-Decision-2B ospitato localmente non costa nulla per decisione. Un generalista ospitato fattura per token, compresi i token che spende per pensare prima di rispondere. Su larga scala, un valutatore che già possiedi è lo strumento meno costoso: il costo è la GPU e l'ingegneria, non la chiamata.

Anche Gemma 4 12B Unified non è nel nostro catalogo; se lo vuoi, scarichi 11,96 miliardi di parametri in BF16 e lo servi da solo. Dove il nostro catalogo ha davvero route Gemma 4 è sulle altre due dimensioni, ed economiche: Gemma 4 26B A4B a 0,06 $ per milione di token in input e 0,33 $ per milione in output, e Gemma 4 31B a 0,13 $ e 0,38 $, entrambi elencati con contesti da 262.144 token e un time-to-first-token P50 che il catalogo indica a 1,73 secondi. Se il tuo problema si rivela essere di ragionamento generale anziché una decisione a insieme chiuso, è questo che devi confrontare con uno scorer eseguito localmente — due modelli in più su una sola chiave, prezzo di listino del provider passato senza markup, e failover automatico così che un modello che stai ancora valutando non diventi mai un singolo punto di fallimento in un percorso di produzione.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Tabellone, con le avvertenze allegate

• Parametri — Intern-Decision-2B 2.213.241.664 in BF16 più una torre di visione e un proiettore; Gemma 4 12B Unified 11.959.730.224 in BF16.

• Contesto — 8.192 token, rifiutati sopra, rispetto a 256.000 token.

• Output — probabilità calibrate e un argmax, nessun testo; testo generato, un token alla volta.

• Modalità — testo più fino a otto immagini rispetto a testo, immagine, audio e video in ingresso, testo in uscita.

• Prove pubblicate — una tabella del fornitore a sette suite con una media di 84,68, un punteggio di Brier di 0,437 e un ECE di 0,100, non riprodotta da nessuno al di fuori del laboratorio; una scheda di valutazione Google con MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 senza strumenti 77,5% e LiveCodeBench v6 72,0, più una classificazione indipendente con un Artificial Analysis Intelligence Index di 14,2.

• Adozione — un like e zero download sul checkpoint 2B rispetto a una famiglia in circolazione da maggio con quantizzazioni, fine-tune e derivati che si contano a centinaia.

Leggi le righe di evidenza in modo asimmetrico, perché è ciò che sono. I numeri di Google sono stati indicizzati e riprodotti in modo indipendente da terzi; quelli di InternLM non sono stati eseguiti da nessuno al di fuori del laboratorio, e il dato di calibrazione in particolare va trattato come un'intenzione ben documentata finché non incontra un test set esterno. Il riassunto onesto non è che la tabella del fornitore sia sbagliata. È che le due colonne non hanno lo stesso peso probatorio, e un confronto che stampa 84,68 accanto a 77,2 senza dirlo sta ingannando il lettore.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Cosa fare con questo

Scegli Intern-Decision-2B quando la decisione è davvero chiusa, lo stato rientra comodamente in ottomila token, vuoi una probabilità a cui applicare una soglia invece di un paragrafo che devi interpretare, e hai l'hardware e la voglia di eseguire un checkpoint che nessuno supporta ancora. È proprio la taglia intermedia a portare la calibrazione pubblicata più debole delle tre distribuite da InternLM — ECE 0,100 contro 0,066 per il modello grande la metà e 0,065 per quello quasi il doppio — quindi, se stai scegliendo all'interno di questa famiglia, il 2B è quello su cui tarare la tua temperatura, non quello di cui fidarti a scatola chiusa.

Scegli Gemma 4 12B — o, più praticamente, una delle due dimensioni di Gemma 4 che instradiamo effettivamente — quando l'input è più lungo di una pagina, quando sono coinvolti audio o video o una lingua diversa dall'inglese, quando la risposta deve essere spiegata anziché semplicemente selezionata, oppure quando non vuoi occuparti in prima persona dello stack di inferenza. Il 12B è il più piccolo dei modelli Gemma 4 con audio nativo; il 26B A4B attiva circa quattro miliardi di parametri per token ed è il modo più economico per entrare nella famiglia.

E se quello che in realtà hai è un problema di punteggio con un lungo documento allegato, nessuno di questi è lo strumento giusto: quello è un problema di recupero che indossa i panni di un articolo di confronto.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.