
Microsoft-Decision-1 vs Gemma 4 12B: Uno sceglie dalla tua lista, l'altro te ne scrive una nuova
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token · 69 tok/s
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Metti Microsoft-Decision-1 e Gemma 4 12B fianco a fianco e la differenza che decide tutto non è la dimensione, la precisione o la licenza — è ciò che accade dopo che il modello ha letto il tuo input. Gemma 4 12B, il modello multimodale senza encoder di DeepMind con 11,96 miliardi di parametri, rilasciato il 3 giugno 2026 con licenza Apache 2.0, legge testo, immagini, audio o video e poi ti scrive una risposta, token per token, su una finestra di 256.000 token e oltre 140 lingue. Microsoft-Decision-1 è diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026 come scorer solo testuale post-addestrato su Qwen3.5-9B: gli si fornisce uno stato e una domanda le cui risposte hai già enumerato, e restituisce una probabilità calibrata per ciascuna opzione in un'unica passata su un massimo di 32.768 token, senza generare nulla. Un modello ti dice quale delle tue opzioni è giusta. L'altro ti dice quali avrebbero dovuto essere le opzioni — e ti fattura ogni parola di tutto questo.
Inquadrare questa cosa come una gara sarebbe un errore di categoria, e vale la pena dirlo prima delle righe delle specifiche anziché dopo. Questi due non sono sostituti; si collocano agli estremi opposti di un flusso di lavoro. La domanda utile è quale estremo stai effettivamente costruendo, perché la risposta determina se stai comprando un giudice o uno scrittore.
Il conto è il punto in cui la differenza smette di essere filosofica.
Gemma 4 12B viene fatturato come ogni modello generativo: token di input e token di output, entrambi. Quando gli chiedi JSON strutturato, ogni carattere di quel JSON viene generato, campionato e pagato — e più il tuo schema è annidato, più lunga è la risposta e più grande è quella voce. Non è un difetto del modello. È ciò che fa un decoder, ed è precisamente la voce che i decision head esistono per eliminare.
Microsoft-Decision-1 non ha un lato di output da fatturare. Esegue un singolo forward pass sul tuo stato, sulla tua domanda e sul tuo insieme di opzioni, legge un punteggio per ciascun candidato e restituisce. La conseguenza si accumula con il volume anziché con la dimensione del prompt: una pipeline che etichetta diecimila record con Gemma 4 12B produce diecimila documenti JSON, e la stessa pipeline su un decision scorer produce diecimila prompt e nient'altro. Che il risparmio assoluto sia consistente dipende interamente dal tuo volume e da quanto è pesante il tuo schema, e chiunque abbia un budget per token può risolverlo in un foglio di calcolo. La direzione non è in discussione.
C'è una seconda asimmetria, più piccola: Microsoft non pubblica una tariffa sulla pagina del modello Microsoft-Decision-1. Il prezzo rimanda alla pagina dei prezzi di Microsoft stessa, quindi il costo per decisione è qualcosa che si legge su Azure anziché sulla scheda. Ciò che la pagina stabilisce è che lo 0% della chiamata è costituito da token di output e che l'inferenza in batch è disabilitata — non è possibile ammortizzare un'esecuzione di scoring in blocco attraverso un canale batch come si farebbe con un modello generativo.

Stesso input, due risposte diverse
Fornisci a entrambi i modelli un ticket di supporto clienti e una domanda. Microsoft-Decision-1 restituisce qualcosa come 0,83 per "fatturazione", 0,11 per "tecnico", 0,04 per "cancellazione", 0,02 per "non so". Hai un'etichetta denominabile, un numero su cui puoi applicare una soglia e un percorso di astensione — Microsoft documenta che un'opzione in stile "non so" è supportata quando le prove fornite sono insufficienti, ed è ciò che fa funzionare la logica di escalation. Quello che non ottieni è una motivazione.
Affida il ticket a Gemma 4 12B e ottieni un paragrafo. Può ragionare sulla richiesta con un pensiero configurabile, chiamare funzioni, leggere una fattura scansionata allegata al ticket, trascrivere il messaggio vocale agganciato ad esso e rispondere nella lingua del cliente. Ognuna di queste cose è qualcosa che Decision-1 non è in grado di fare con alcun livello di accuratezza: la sua superficie di input è testo e nient'altro, ed è esplicitamente non progettato per rispondere a domande aperte, conversare, tradurre o riassumere.
Nessun output di Gemma 4 12B è una probabilità. Chiedigli una decisione di routing con un livello di confidenza e otterrai prosa che contiene un numero, e quel numero è qualunque cosa abbia prodotto il sampler, non un softmax sull'insieme di opzioni che hai fornito. Se una soglia a valle dipende dal fatto che quel numero significhi qualcosa, hai per le mani un progetto di calibrazione, non uno scorer.
Che la tua domanda abbia un insieme chiuso è l'intera decisione.
Questo è il test da applicare prima di ogni altra cosa, e richiede circa dieci minuti con una lavagna bianca.
• Se la tua risposta proviene da un elenco che puoi enumerare in anticipo — un'etichetta, una valutazione, un sì/no, un punteggio di una rubrica, un percorso — Microsoft-Decision-1 è lo strumento corretto, e Gemma 4 12B è un modo dispendioso e meno affidabile di scegliere da quell'elenco. Pagheresti un decoder per indovinare un numero che hai già delimitato.
• Se la tua risposta non è un insieme chiuso — riassumi questo, spiega quello, scrivi la replica, descrivi il grafico — Microsoft-Decision-1 non può aiutare a nessun prezzo. Non ha alcun percorso verso la prosa, nessun campo di motivazione e nessun meccanismo per produrre qualsiasi cosa tu non abbia enumerato come opzione.
• Se è entrambe le cose, hai una pipeline a due modelli anziché una scelta, e l'interessante questione di progettazione diventa quale dei due possiede la soglia di escalation. Lo scorer la fissa; il writer riempie ciò che accade al di sopra e al di sotto di essa.
Dove Gemma 4 12B è semplicemente un altro sport
Al di fuori della cornice decisionale, Gemma 4 12B non è avanti su una linea: sta giocando a un gioco diverso, e fingere il contrario sarebbe disonesto.

• Modalità — Microsoft-Decision-1 accetta solo testo e restituisce valori numerici. Gemma 4 12B gestisce nativamente testo, immagini, audio e video attraverso un design senza encoder che proietta patch grezze e forme d'onda direttamente nello spazio degli embedding, con input interlacciato in qualsiasi ordine.
• Contesto — 32.768 token per Microsoft-Decision-1 contro 256.000 per Gemma 4 12B, che totalizza il 43,4% su MRCR v2 eight-needle a 128k nella scheda di Google stessa.
Lingua — 25 lingue supportate per Microsoft-Decision-1, con Microsoft che avverte che copertura, qualità e calibrazione "possono variare da lingua a lingua" e indica le lingue non inglesi a basse risorse come punto debole; oltre 140 per Gemma 4 12B, con un valore MMMLU valutato di 83,4 per questa dimensione.
• Prestazioni pubblicate — la scheda Benchmarks di Microsoft-Decision-1 contiene una metodologia e nessun dato numerico; Google pubblica 77,2% MMLU Pro, 77,5% AIME 2026 senza strumenti, 72,0% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMMU Pro e 79,7% MATH-Vision per Gemma 4 12B.
• Distribuzione — Microsoft-Decision-1 è un'API ospitata solo su Foundry, senza pesi, senza download e senza percorso di fine-tuning. Gemma 4 12B è costituito da pesi Apache 2.0 rilasciati in un ecosistema disponibile fin dal primo giorno con LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang e Unsloth.
• Runtime — la valutazione delle decisioni avviene in un'unica passata, senza ciclo di decodifica, perciò la latenza scala con il prompt anziché con la lunghezza della risposta; Gemma 4 12B genera token per token, e i materiali di lancio di Google lo collocano a 16 GB di VRAM o memoria unificata.
La riga del benchmark è quella su cui vale la pena soffermarsi, nella direzione che lusinga Microsoft meno. Anche i numeri di Gemma 4 12B sono dichiarati dal fornitore, ma alle loro spalle ci sono mesi di utilizzo da parte di terzi, in harness pubblici, su hardware di proprietà altrui. La voce di Microsoft in questa categoria è la più recente e la meno verificabile delle due, nonostante provenga dall'azienda più grande.
Quanto ti costa davvero chiamare ciascuno
Gemma 4 12B nella sua versione da 12B non è nel nostro catalogo — se è quella la dimensione che vuoi, scarichi 11,96 miliardi di parametri in BF16 e lo servi da solo. Quello che il nostro catalogo offre è il resto della linea Gemma 4, ed è economico: Gemma 4 26B A4B a $0.06 per milione di token di input e $0.33 per milione di output, e Gemma 4 31B a $0.13 e $0.38, entrambi elencati con contesti da 262.144 token. Quelli sono prezzi di listino del fornitore trasferiti senza alcun ricarico aggiunto da parte nostra, dietro un'unica chiave compatibile con OpenAI insieme a più di 200 altri modelli. Se il tuo problema si rivela essere di ragionamento generale anziché una decisione su un insieme chiuso, una di quelle due dimensioni è la soluzione economica da misurare rispetto a uno scorer gestito in proprio — e se preferisci non impegnarti con un singolo writer, il failover automatico mantiene vivo il ramo di generazione di un ciclo di scoring quando un fornitore degrada.

Microsoft-Decision-1 è una distribuzione Foundry di cui esegui il provisioning autonomamente, e non è disponibile tramite noi. Nulla in questo articolo costituisce un'affermazione di disponibilità al riguardo, né da una parte né dall'altra della chiamata.
Il risultato finale
Microsoft-Decision-1 è diventato disponibile a livello generale su Microsoft Foundry l'8 ottobre 2026: un modello di scoring solo testuale, da 32.768 token, basato su Qwen3.5-9B che restituisce probabilità calibrate sulle opzioni che enumeri, con zero token di output, nessun peso e nessun dato di benchmark pubblicato. Gemma 4 12B è un generalista multimodale senza encoder da 11,96B, rilasciato il 3 giugno 2026 con licenza Apache 2.0, che ragiona, legge immagini e audio e scrive risposte in una finestra di 256.000 token. Scegli in base alla forma della tua risposta, non al numero di parametri: un insieme chiuso spetta allo scorer, uno aperto spetta al generatore, e pagare un decoder per selezionare da un elenco che hai già scritto è il modo più comune in cui i team spendono dieci volte quanto costa una decisione.
Quello che il nostro catalogo offre davvero è il resto della linea Gemma 4, ed è economico: Gemma 4 26B A4B a 0,06 $ per milione di token di input e 0,33 $ per milione di output, e Gemma 4 31B a 0,13 $ e 0,38 $.
