
Intern-Decision-2B vs Gemma 4 12B: un tetto di 8.192 token contro una finestra di 256K
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 584 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Supponi che la cosa da giudicare sia un fascicolo di sinistro assicurativo di quaranta pagine. internlm/Intern-Decision-2B lo rifiuterà. Non lo troncherà, non lo riassumerà — lo rifiuterà, perché il motore di inferenza incluso dichiara DecisionEngine(max_length=8192) e la model card afferma in linguaggio chiaro che gli input di dimensioni eccessive vengono «rifiutati senza troncamento». google/gemma-4-12B-it — Gemma 4 12B Unified — prenderà lo stesso documento, più le fotografie scansionate allegate, più la telefonata registrata, e ti scriverà una risposta. Questo contrasto è l'intero confronto, e non ha quasi nulla a che fare con i conteggi dei parametri — 2.213.241.664 contro 11.959.730.224 — che una lettura da scheda tecnica metterebbe al primo posto.
Intern-Decision-2B è il secondo di tre checkpoint decisionali che InternLM ha caricato su Hugging Face il 26 settembre 2026 senza alcun annuncio, fine-tuned da Qwen/Qwen3.5-2B e con licenza Apache-2.0, mantenendo accanto i termini di Qwen. Gemma 4 12B Unified è il modello multimodale senza encoder di Google DeepMind di maggio 2026, un sistema any-to-any che accetta testo, immagini, audio e video e genera testo su una finestra di 256.000 token in oltre 140 lingue. Uno dei due è uno scorer. L'altro è un generalista che, se lo si istruisce con attenzione, può anche assegnare punteggi male. Scegliere tra i due è meno una questione di benchmark che una domanda su quale forma abbia già la tua risposta.
Laddove i due non siano realmente comparabili
Vale la pena essere schietti su questo prima di passare ai numeri, perché il confronto invita a una falsa simmetria.
Intern-Decision-2B non produce alcun token. Riceve uno stato, da una a sedici domande denominate con un massimo di 62 opzioni ciascuna e, facoltativamente, fino a otto immagini; genera uno scheletro JSON dell'assistente con un segnaposto <decision> per campo; esegue un singolo passaggio forward causale; legge i logit nella posizione immediatamente precedente a ciascun segnaposto; applica la softmax solo sui simboli legali di quel campo; e applica una temperatura calibrata di 2,100509348278. L'output è una distribuzione calibrata e un argmax per campo. La scheda dichiara apertamente il lato negativo: "Questa API esegue uno scoring strutturato dei candidati. Non chiama generate() né campiona testo libero."
Gemma 4 12B genera. Tutto ciò che fa — ragionare con pensiero configurabile, chiamata di funzioni, OCR, comprensione di grafici, riconoscimento vocale, copertura di 140 lingue — passa attraverso un ciclo di decodifica su un vocabolario di 262.144 voci. Chiedile una decisione di instradamento con probabilità e otterrai prosa contenente un numero, e il numero sarà quello che il campionatore ha prodotto, non un softmax sul tuo insieme di opzioni.
Quindi la domanda pratica non è «quale sia più accurato». È «la mia risposta è già un insieme chiuso?». Se lo è, il 12B è un modo dispendioso di scegliere da un elenco. Se non lo è, Intern-Decision-2B non può aiutarti a nessun livello di accuratezza.
Il tetto di input è la linea più netta tra loro
Ecco la dimensione da soppesare al di sopra di tutte le altre, perché produce guasti totali anziché degradati.
• Lunghezza dell'input — Intern-Decision-2B accetta 8.192 token e rifiuta qualsiasi input più lungo, a gran voce; Gemma 4 12B accetta 256.000 token e, sulla scheda ufficiale di Google, ottiene il 43,4% su MRCR v2 eight-needle a 128k.
• Immagini — fino a otto per Intern-Decision-2B, e contano sullo stesso budget di 8.192 token; proporzioni e risoluzione variabili per Gemma 4 12B, con input di testo e immagini interlacciati in qualsiasi ordine.
• Modalità di input — testo e immagine per uno; testo, immagine, audio e video per l'altro.
• Lingua — non viene fatta alcuna affermazione multilingue in nessuna parte della documentazione di Intern-Decision; Gemma 4 copre 140+ lingue pre-addestrate con un punteggio multilingue valutato di 83.4 su MMMLU per il 12B.
• Output — una distribuzione di risposte JSON tipizzata per uno; testo generato per l'altro.
Il limite di 8.192 non è arbitrario, ed è proprio questo che lo rende difficile da aggirare. L'obiettivo decisionale legge un logit in una posizione fissa per campo, quindi il prompt deve contenere lo stato, lo schema e lo scheletro completo in un'unica passata; non esiste alcuna strategia di chunking che preservi il contratto. Un ticket, un'email, uno stato JSON breve, uno o due screenshot — questo è il centro del design. Un documento che richiede retrieval è un documento per cui questo modello non è pensato.
Quanto ti costa ciascuno, onestamente contato
Intern-Decision-2B non ha un endpoint ospitato né un provider. La pagina del modello di OrcaRouter per esso restituisce un 404, e nulla in questo articolo costituisce un'affermazione di disponibilità. Invocarlo significa scaricare circa 4,46 GB di repository — uno shard linguistico da 3,76 GB, una torre di visione da 612,5 MB, un proiettore da 50,3 MB — ed eseguire inference.py accanto ai pesi in un ambiente Python 3.12 con torch 2.9.1 e transformers 5.14.1, su una GPU che stai pagando indipendentemente dal fatto che stia o meno assegnando punteggi alle decisioni.
Non è uno svantaggio in ogni caso, e vale la pena fare i calcoli invece di darli per scontati. A 33,28 ms di media per richiesta su una singola RTX 4090, nella stessa misurazione di InternLM, un Intern-Decision-2B ospitato localmente non costa nulla per decisione. Un generalista ospitato fattura per token, compresi i token che spende per pensare prima di rispondere. Su larga scala, un valutatore che già possiedi è lo strumento meno costoso: il costo è la GPU e l'ingegneria, non la chiamata.
Anche Gemma 4 12B Unified non è nel nostro catalogo; se lo vuoi, scarichi 11,96 miliardi di parametri in BF16 e lo servi da solo. Dove il nostro catalogo ha davvero route Gemma 4 è sulle altre due dimensioni, ed economiche: Gemma 4 26B A4B a 0,06 $ per milione di token in input e 0,33 $ per milione in output, e Gemma 4 31B a 0,13 $ e 0,38 $, entrambi elencati con contesti da 262.144 token e un time-to-first-token P50 che il catalogo indica a 1,73 secondi. Se il tuo problema si rivela essere di ragionamento generale anziché una decisione a insieme chiuso, è questo che devi confrontare con uno scorer eseguito localmente — due modelli in più su una sola chiave, prezzo di listino del provider passato senza markup, e failover automatico così che un modello che stai ancora valutando non diventi mai un singolo punto di fallimento in un percorso di produzione.

Tabellone, con le avvertenze allegate
• Parametri — Intern-Decision-2B 2.213.241.664 in BF16 più una torre di visione e un proiettore; Gemma 4 12B Unified 11.959.730.224 in BF16.
• Contesto — 8.192 token, rifiutati sopra, rispetto a 256.000 token.
• Output — probabilità calibrate e un argmax, nessun testo; testo generato, un token alla volta.
• Modalità — testo più fino a otto immagini rispetto a testo, immagine, audio e video in ingresso, testo in uscita.
• Prove pubblicate — una tabella del fornitore a sette suite con una media di 84,68, un punteggio di Brier di 0,437 e un ECE di 0,100, non riprodotta da nessuno al di fuori del laboratorio; una scheda di valutazione Google con MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 senza strumenti 77,5% e LiveCodeBench v6 72,0, più una classificazione indipendente con un Artificial Analysis Intelligence Index di 14,2.
• Adozione — un like e zero download sul checkpoint 2B rispetto a una famiglia in circolazione da maggio con quantizzazioni, fine-tune e derivati che si contano a centinaia.
Leggi le righe di evidenza in modo asimmetrico, perché è ciò che sono. I numeri di Google sono stati indicizzati e riprodotti in modo indipendente da terzi; quelli di InternLM non sono stati eseguiti da nessuno al di fuori del laboratorio, e il dato di calibrazione in particolare va trattato come un'intenzione ben documentata finché non incontra un test set esterno. Il riassunto onesto non è che la tabella del fornitore sia sbagliata. È che le due colonne non hanno lo stesso peso probatorio, e un confronto che stampa 84,68 accanto a 77,2 senza dirlo sta ingannando il lettore.

Cosa fare con questo
Scegli Intern-Decision-2B quando la decisione è davvero chiusa, lo stato rientra comodamente in ottomila token, vuoi una probabilità a cui applicare una soglia invece di un paragrafo che devi interpretare, e hai l'hardware e la voglia di eseguire un checkpoint che nessuno supporta ancora. È proprio la taglia intermedia a portare la calibrazione pubblicata più debole delle tre distribuite da InternLM — ECE 0,100 contro 0,066 per il modello grande la metà e 0,065 per quello quasi il doppio — quindi, se stai scegliendo all'interno di questa famiglia, il 2B è quello su cui tarare la tua temperatura, non quello di cui fidarti a scatola chiusa.
Scegli Gemma 4 12B — o, più praticamente, una delle due dimensioni di Gemma 4 che instradiamo effettivamente — quando l'input è più lungo di una pagina, quando sono coinvolti audio o video o una lingua diversa dall'inglese, quando la risposta deve essere spiegata anziché semplicemente selezionata, oppure quando non vuoi occuparti in prima persona dello stack di inferenza. Il 12B è il più piccolo dei modelli Gemma 4 con audio nativo; il 26B A4B attiva circa quattro miliardi di parametri per token ed è il modo più economico per entrare nella famiglia.
E se quello che in realtà hai è un problema di punteggio con un lungo documento allegato, nessuno di questi è lo strumento giusto: quello è un problema di recupero che indossa i panni di un articolo di confronto.

