
Liquid AI d1-3B vs Gemma 4 12B: un modello decisionale contro un generalista
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il modo più rapido per sbagliare questo confronto è mettere Liquid AI d1-3B e Gemma 4 12B sullo stesso benchmark e aspettare un vincitore. Non rispondono alla stessa domanda. Liquid AI d1-3B è un modello decisionale da 3,12B pubblicato come pesi aperti il 7 ottobre 2026: gli fornisci uno stato e una serie di domande con nome e restituisce probabilità, un'etichetta scelta e una confidenza, con zero token di output e nessuna fase di generazione. Gemma 4 12B è il generalista any-to-any senza encoder di Google, un checkpoint da 11,96B che accetta testo, immagini, audio e video e scrive una risposta su una finestra di 256.000 token in più di 140 lingue. Uno dei due ti dice quale di quattro cose è una scheda elettronica. L'altro ti dice perché. Confrontali solo sulla qualità e non impari nulla, perché gli output non sono commensurabili — e i fornitori non li hanno mai messi a confronto in un benchmark. Confrontali su ciò che una chiamata restituisce effettivamente, quanto costa e dove ciascuno esaurisce la strada, e l'abbinamento diventa un test di confine davvero utile.
Due diversi contratti di output
La distinzione che qui fa tutto il lavoro è ciò che ritorna sulla rete.
Liquid AI d1-3Brestituisce un oggetto di risposta strutturato. Ogni domanda in una richiesta dichiara un tipo — noul per sì/no con P(sì), choice per una tra un insieme di opzioni denominate, con una confidenza e una probabilità per opzione, oppure score per una posizione su una scala ordinata da due a dieci livelli, con il livello atteso e la sua distribuzione. Il modello riporta output_tokens: 0 perché non viene scritto nulla. Più domande su un unico stato vengono lette da un'unica passata in avanti, e lo stato e le sue immagini vengono codificati una sola volta per tutte.
Gemma 4 12B restituisce prosa. A volte restituisce il JSON che hai chiesto, a volte un JSON diverso da quello che avevi chiesto, e può ragionare prima di rispondere. È prima di tutto un modello linguistico: qualunque cosa sappia classificare, la esprime come testo. Questo è un punto di forza quando la risposta deve essere spiegata a una persona o inviata a uno step successivo che si aspetta del linguaggio, ed è un costo quando l'unica cosa che ti serviva era una probabilità.
Tutto ciò che sta a valle consegue da questo. Il parsing di una risposta di d1-3B non può fallire. Inoltre non può spiegarsi da sola, e la scheda del modello lo dice direttamente: non è un modello conversazionale e non scrive testo.
A che punto sono le piste delle prove
La provenienza dei due insiemi di numeri non è equivalente, e qui ciò conta più dei numeri stessi.
• Decision Index 0.2.1 — Liquid AI d1-3B ottiene 48.57, valutato dal fornitore con lo scorer ufficiale, primo tra i modelli sotto i 10B e davanti a Decider 35B-A3B a 47.11. Gemma 4 12B non è affatto valutato sul Decision Index, quindi questa riga non ha un corrispondente.
• Benchmark di ragionamento — Gemma 4 12B ottiene 77,5 su AIME 2026, 78,8 su GPQA Diamond e 1.659 Codex ELO, e un Artificial Analysis Intelligence Index di 22 in modalità ragionamento e 13 con ragionamento disattivato. Liquid AI d1-3B non ha un benchmark di ragionamento, perché un modello decisionale non produce una traccia di ragionamento da valutare.
• {{1}}Contesto lungo{{/1}} — Gemma 4 12B accetta 256.000 token e ottiene il 43,4% su MRCR v2 eight-needle a 128k sulla scheda di Google stessa. Liquid AI d1-3B accetta 32.768 token. Se il tuo {{2}}"stato"{{/2}} è un documento di quaranta pagine più scansioni, quel divario è l'intera decisione e non c'è partita.
• Visione — Liquid AI d1-3B registra una media di 74,1 su undici benchmark pubblici di immagini, interpretati come decisioni sull'insieme di opzioni di ciascun benchmark, a fronte di 73,9 per il backbone LFM2.5-VL-3B da cui è stato costruito; il fornitore riferisce che rimuovendo le immagini le stesse domande scendono a 45,1. Le capacità visive di Gemma 4 12B sono più forti e più ampie, ma vengono riportate come qualità di generazione, non come accuratezza decisionale su opzioni denominate.
• Lingue — sedici documentate per Liquid AI d1-3B; più di 140 per Gemma 4 12B.
• Velocità — Liquid AI d1-3B risponde a una domanda in 8 ms su una RTX 4090, 16 ms su un Jetson AGX Thor, 26 ms su un Jetson AGX Orin 64 GB e 50 ms su un Jetson Orin Nano, e impacchetta 64 stati in una singola passata a 475 al secondo sulla 4090. Gemma 4 12B genera, quindi la sua latenza è una funzione di quanti token scrive.
• Qualità dell'evidenza — I risultati di Gemma 4 12B sono di Google, pubblicati a giugno 2026 e da allora presi in esame, quantizzati e rieseguiti da una vasta comunità. Quelli di Liquid AI d1-3B sono di Liquid, pubblicati due giorni fa, riprodotti da nessuno al di fuori del laboratorio. Leggere la seconda colonna di conseguenza.

L'unico ambito in cui competono davvero
C'è una sovrapposizione reale, e non è su una classifica. È la chiamata LLM-as-a-judge.
Moltissime pipeline di produzione usano già un generalista di medie dimensioni come livello di valutazione: attribuire un punteggio all'urgenza di questo ticket, decidere se questo output supera una rubrica, scegliere quale strumento l'agente dovrebbe chiamare successivamente, verificare se un passaggio recuperato risponde alla domanda. Oggi la maggior parte di queste chiamate va a un modello generativo a cui viene chiesto di emettere un numero o un'etichetta sotto forma di testo, e il numero che emette è quello che ha prodotto il campionatore, non un softmax sul tuo insieme di opzioni. È il flusso di lavoro che Liquid AI d1-3B è stato post-addestrato a sostituire, e le demo pubblicate ne sono tutte versioni — un predicato SQL che risponde sì o no per 150 ticket di supporto, un ciclo di compattazione del contesto dell'agente che mantiene, taglia o scarta l'output di ogni strumento ed elimina il 52% dei token, un'app di ispezione visiva che ha selezionato pezzi buoni e difettosi da quattro linee di produzione con un'accuratezza dall'85 al 97% su un compito per cui non era mai stata addestrata.
Gemma 4 12B svolge tutti quei compiti, e ne svolge più di quelli. Può anche scrivere il riassunto, tenere a vista un documento da 256K, accettare in input una chiamata telefonica registrata e rispondere in una delle oltre 140 lingue. Se la tua pipeline necessita di una valutazione e di una narrazione, il 12B svolge due lavori con una sola chiamata e il modello decisionale 3B ne svolge uno.
Il confine è la lunghezza del contesto e la forma dell'output. Stato lungo, input vocale, molte lingue o una spiegazione che il lettore si aspetta — Gemma 4 12B, non c'è partita. Stato breve, un insieme fisso di opzioni, un budget di latenza per richiesta in millisecondi a una cifra, o una garanzia assoluta che la risposta venga analizzata correttamente — quella è la colonna d1-3B, e il generalista sta pagando per qualcosa che non userai.
Quanto costa chiamare ciascuno
Nessuno dei due modelli è nel nostro catalogo, quindi non c'è un prezzo di instradamento da quotare per nessuno dei due — Gemma 4 12B non è tra le dimensioni Gemma che serviamo, e Liquid AI d1-3B è a pesi aperti: puoi ospitarlo tu stesso o raggiungerlo tramite l'API del fornitore stesso e piattaforme di terze parti. Per contesto sul lato adiacente a Gemini di quella famiglia, le due dimensioni Gemma 4 che instradiamo sono elencate a $0,06 per milione di input e $0,33 per milione di output per Gemma 4 26B A4B, e $0,13 e $0,38 per Gemma 4 31B, entrambe con contesti da 262.144 token e input di testo, immagini e video. Il prezzo mediano dei fornitori quotato per Gemma 4 12B altrove si aggira intorno a $0,10 e $0,30.
L'hosted di Liquid d1 fattura solo i token di input, a $0,04 per milione, con le immagini conteggiate come input a 1,5 token per patch da 32×32 pixel. Una richiesta di decisione non ha quindi alcuna riga di token di output, che è la ragione strutturale per cui il confronto dei costi del fornitore stesso con modelli molto più grandi arriva dove arriva. I pesi aperti non hanno un prezzo per chiamata; paghi in hardware. Entrambi devono stare nella stessa pipeline di tutto il resto che chiami, che è il livello per cui esiste un router — un'unica API su oltre 200 modelli, prezzi di listino dei provider passati con markup 0%, e failover automatico così un singolo problema a monte non diventa il tuo disservizio. Questa è l'infrastruttura attorno al confronto, non il confronto.

Come decidere, onestamente
Parti dal formato della risposta anziché dal modello. Se il sistema a valle può consumare una probabilità, un'etichetta e una confidenza, e l'insieme delle risposte è piccolo e noto, Liquid AI d1-3B non è un downgrade rispetto a un 12B — è uno strumento diverso, e i numeri di latenza lo rendono un deployment categoricamente differente: 50 ms su un Jetson Orin Nano è un dispositivo che non ha alcun motivo di eseguire un 12B.
Se la risposta deve essere una frase, o lo stato supera i trentaduemila token, o qualcuno la pronuncerà, o la lingua di output è il bengalese, allora Gemma 4 12B è l'unico dei due che può svolgere il compito e il confronto è finito prima ancora di iniziare.
La posizione realmente utile per la maggior parte dei team è entrambe, in punti diversi. Un modello decisionale davanti alla chiamata costosa, che si occupa del triage, del routing e dei controlli di guardrail che non richiedono il linguaggio; un generalista dietro, per il lavoro che invece lo richiede. Sono la stessa pipeline, uno è un filtro e l'altro è il payload — e i team che trarranno il massimo dal rilascio d1 sono quelli che già pagano un 12B per rispondere sì o no.

