Una scheda del titolo generata per Microsoft-Decision-1 vs Gemma 4 12B, con il sottotitolo "un valutatore senza token di output contro uno scrittore senza insieme chiuso", con chip che leggono probabilità contro prosa, contesto di 32.768 token contro 256.000, solo testo contro testo immagine audio e video, e API ospitata contro pesi aperti.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: Uno sceglie dalla tua lista, l'altro te ne scrive una nuova

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Microsoft-Decision-1 e Gemma 4 12B fianco a fianco e la differenza che decide tutto non è la dimensione, la precisione o la licenza — è ciò che accade dopo che il modello ha letto il tuo input. Gemma 4 12B, il modello multimodale senza encoder di DeepMind con 11,96 miliardi di parametri, rilasciato il 3 giugno 2026 con licenza Apache 2.0, legge testo, immagini, audio o video e poi ti scrive una risposta, token per token, su una finestra di 256.000 token e oltre 140 lingue. Microsoft-Decision-1 è diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026 come scorer solo testuale post-addestrato su Qwen3.5-9B: gli si fornisce uno stato e una domanda le cui risposte hai già enumerato, e restituisce una probabilità calibrata per ciascuna opzione in un'unica passata su un massimo di 32.768 token, senza generare nulla. Un modello ti dice quale delle tue opzioni è giusta. L'altro ti dice quali avrebbero dovuto essere le opzioni — e ti fattura ogni parola di tutto questo.

Inquadrare questa cosa come una gara sarebbe un errore di categoria, e vale la pena dirlo prima delle righe delle specifiche anziché dopo. Questi due non sono sostituti; si collocano agli estremi opposti di un flusso di lavoro. La domanda utile è quale estremo stai effettivamente costruendo, perché la risposta determina se stai comprando un giudice o uno scrittore.

Il conto è il punto in cui la differenza smette di essere filosofica.

Gemma 4 12B viene fatturato come ogni modello generativo: token di input e token di output, entrambi. Quando gli chiedi JSON strutturato, ogni carattere di quel JSON viene generato, campionato e pagato — e più il tuo schema è annidato, più lunga è la risposta e più grande è quella voce. Non è un difetto del modello. È ciò che fa un decoder, ed è precisamente la voce che i decision head esistono per eliminare.

Microsoft-Decision-1 non ha un lato di output da fatturare. Esegue un singolo forward pass sul tuo stato, sulla tua domanda e sul tuo insieme di opzioni, legge un punteggio per ciascun candidato e restituisce. La conseguenza si accumula con il volume anziché con la dimensione del prompt: una pipeline che etichetta diecimila record con Gemma 4 12B produce diecimila documenti JSON, e la stessa pipeline su un decision scorer produce diecimila prompt e nient'altro. Che il risparmio assoluto sia consistente dipende interamente dal tuo volume e da quanto è pesante il tuo schema, e chiunque abbia un budget per token può risolverlo in un foglio di calcolo. La direzione non è in discussione.

C'è una seconda asimmetria, più piccola: Microsoft non pubblica una tariffa sulla pagina del modello Microsoft-Decision-1. Il prezzo rimanda alla pagina dei prezzi di Microsoft stessa, quindi il costo per decisione è qualcosa che si legge su Azure anziché sulla scheda. Ciò che la pagina stabilisce è che lo 0% della chiamata è costituito da token di output e che l'inferenza in batch è disabilitata — non è possibile ammortizzare un'esecuzione di scoring in blocco attraverso un canale batch come si farebbe con un modello generativo.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Stesso input, due risposte diverse

Fornisci a entrambi i modelli un ticket di supporto clienti e una domanda. Microsoft-Decision-1 restituisce qualcosa come 0,83 per "fatturazione", 0,11 per "tecnico", 0,04 per "cancellazione", 0,02 per "non so". Hai un'etichetta denominabile, un numero su cui puoi applicare una soglia e un percorso di astensione — Microsoft documenta che un'opzione in stile "non so" è supportata quando le prove fornite sono insufficienti, ed è ciò che fa funzionare la logica di escalation. Quello che non ottieni è una motivazione.

Affida il ticket a Gemma 4 12B e ottieni un paragrafo. Può ragionare sulla richiesta con un pensiero configurabile, chiamare funzioni, leggere una fattura scansionata allegata al ticket, trascrivere il messaggio vocale agganciato ad esso e rispondere nella lingua del cliente. Ognuna di queste cose è qualcosa che Decision-1 non è in grado di fare con alcun livello di accuratezza: la sua superficie di input è testo e nient'altro, ed è esplicitamente non progettato per rispondere a domande aperte, conversare, tradurre o riassumere.

Nessun output di Gemma 4 12B è una probabilità. Chiedigli una decisione di routing con un livello di confidenza e otterrai prosa che contiene un numero, e quel numero è qualunque cosa abbia prodotto il sampler, non un softmax sull'insieme di opzioni che hai fornito. Se una soglia a valle dipende dal fatto che quel numero significhi qualcosa, hai per le mani un progetto di calibrazione, non uno scorer.

Che la tua domanda abbia un insieme chiuso è l'intera decisione.

Questo è il test da applicare prima di ogni altra cosa, e richiede circa dieci minuti con una lavagna bianca.

• Se la tua risposta proviene da un elenco che puoi enumerare in anticipo — un'etichetta, una valutazione, un sì/no, un punteggio di una rubrica, un percorso — Microsoft-Decision-1 è lo strumento corretto, e Gemma 4 12B è un modo dispendioso e meno affidabile di scegliere da quell'elenco. Pagheresti un decoder per indovinare un numero che hai già delimitato.

• Se la tua risposta non è un insieme chiuso — riassumi questo, spiega quello, scrivi la replica, descrivi il grafico — Microsoft-Decision-1 non può aiutare a nessun prezzo. Non ha alcun percorso verso la prosa, nessun campo di motivazione e nessun meccanismo per produrre qualsiasi cosa tu non abbia enumerato come opzione.

• Se è entrambe le cose, hai una pipeline a due modelli anziché una scelta, e l'interessante questione di progettazione diventa quale dei due possiede la soglia di escalation. Lo scorer la fissa; il writer riempie ciò che accade al di sopra e al di sotto di essa.

Dove Gemma 4 12B è semplicemente un altro sport

Al di fuori della cornice decisionale, Gemma 4 12B non è avanti su una linea: sta giocando a un gioco diverso, e fingere il contrario sarebbe disonesto.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modalità — Microsoft-Decision-1 accetta solo testo e restituisce valori numerici. Gemma 4 12B gestisce nativamente testo, immagini, audio e video attraverso un design senza encoder che proietta patch grezze e forme d'onda direttamente nello spazio degli embedding, con input interlacciato in qualsiasi ordine.

• Contesto — 32.768 token per Microsoft-Decision-1 contro 256.000 per Gemma 4 12B, che totalizza il 43,4% su MRCR v2 eight-needle a 128k nella scheda di Google stessa.

Lingua — 25 lingue supportate per Microsoft-Decision-1, con Microsoft che avverte che copertura, qualità e calibrazione "possono variare da lingua a lingua" e indica le lingue non inglesi a basse risorse come punto debole; oltre 140 per Gemma 4 12B, con un valore MMMLU valutato di 83,4 per questa dimensione.

• Prestazioni pubblicate — la scheda Benchmarks di Microsoft-Decision-1 contiene una metodologia e nessun dato numerico; Google pubblica 77,2% MMLU Pro, 77,5% AIME 2026 senza strumenti, 72,0% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMMU Pro e 79,7% MATH-Vision per Gemma 4 12B.

• Distribuzione — Microsoft-Decision-1 è un'API ospitata solo su Foundry, senza pesi, senza download e senza percorso di fine-tuning. Gemma 4 12B è costituito da pesi Apache 2.0 rilasciati in un ecosistema disponibile fin dal primo giorno con LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang e Unsloth.

• Runtime — la valutazione delle decisioni avviene in un'unica passata, senza ciclo di decodifica, perciò la latenza scala con il prompt anziché con la lunghezza della risposta; Gemma 4 12B genera token per token, e i materiali di lancio di Google lo collocano a 16 GB di VRAM o memoria unificata.

La riga del benchmark è quella su cui vale la pena soffermarsi, nella direzione che lusinga Microsoft meno. Anche i numeri di Gemma 4 12B sono dichiarati dal fornitore, ma alle loro spalle ci sono mesi di utilizzo da parte di terzi, in harness pubblici, su hardware di proprietà altrui. La voce di Microsoft in questa categoria è la più recente e la meno verificabile delle due, nonostante provenga dall'azienda più grande.

Quanto ti costa davvero chiamare ciascuno

Gemma 4 12B nella sua versione da 12B non è nel nostro catalogo — se è quella la dimensione che vuoi, scarichi 11,96 miliardi di parametri in BF16 e lo servi da solo. Quello che il nostro catalogo offre è il resto della linea Gemma 4, ed è economico: Gemma 4 26B A4B a $0.06 per milione di token di input e $0.33 per milione di output, e Gemma 4 31B a $0.13 e $0.38, entrambi elencati con contesti da 262.144 token. Quelli sono prezzi di listino del fornitore trasferiti senza alcun ricarico aggiunto da parte nostra, dietro un'unica chiave compatibile con OpenAI insieme a più di 200 altri modelli. Se il tuo problema si rivela essere di ragionamento generale anziché una decisione su un insieme chiuso, una di quelle due dimensioni è la soluzione economica da misurare rispetto a uno scorer gestito in proprio — e se preferisci non impegnarti con un singolo writer, il failover automatico mantiene vivo il ramo di generazione di un ciclo di scoring quando un fornitore degrada.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 è una distribuzione Foundry di cui esegui il provisioning autonomamente, e non è disponibile tramite noi. Nulla in questo articolo costituisce un'affermazione di disponibilità al riguardo, né da una parte né dall'altra della chiamata.

Il risultato finale

Microsoft-Decision-1 è diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026: un modello di scoring solo testuale, da 32.768 token, basato su Qwen3.5-9B che restituisce probabilità calibrate sulle opzioni che enumeri, con zero token di output, nessun peso e nessun dato di benchmark pubblicato. Gemma 4 12B è un generalista multimodale senza encoder da 11,96B, rilasciato il 3 giugno 2026 con licenza Apache 2.0, che ragiona, legge immagini e audio e scrive risposte in una finestra di 256.000 token. Scegli in base alla forma della tua risposta, non al numero di parametri: un insieme chiuso spetta allo scorer, uno aperto spetta al generatore, e pagare un decoder per selezionare da un elenco che hai già scritto è il modo più comune in cui i team spendono dieci volte quanto costa una decisione.

Quello che il nostro catalogo offre davvero è il resto della linea Gemma 4, ed è economico: Gemma 4 26B A4B a 0,06 $ per milione di token di input e 0,33 $ per milione di output, e Gemma 4 31B a 0,13 $ e 0,38 $.