Una card di titolo hero intitolata "Liquid AI d1-3B vs Gemma 4 12B" con il sottotitolo "un modello decisionale contro un generalista", che mostra una piccola card checklist da 3,12B con un chip di probabilità accanto a una card più grande da 11,96B con icone di documento, forma d'onda e fotogramma e un chip di risposta scritta.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: un modello decisionale contro un generalista

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modo più rapido per sbagliare questo confronto è mettere Liquid AI d1-3B e Ge​mma 4 12B sullo stesso benchmark e aspettare un vincitore. Non rispondono alla stessa domanda. Liquid AI d1-3B è un modello decisionale da 3,12B pubblicato come pesi aperti il 7 ottobre 2026: gli fornisci uno stato e una serie di domande con nome e restituisce probabilità, un'etichetta scelta e una confidenza, con zero token di output e nessuna fase di generazione. Ge​mma 4 12B è il generalista any-to-any senza encoder di Goo​gle, un checkpoint da 11,96B che accetta testo, immagini, audio e video e scrive una risposta su una finestra di 256.000 token in più di 140 lingue. Uno dei due ti dice quale di quattro cose è una scheda elettronica. L'altro ti dice perché. Confrontali solo sulla qualità e non impari nulla, perché gli output non sono commensurabili — e i fornitori non li hanno mai messi a confronto in un benchmark. Confrontali su ciò che una chiamata restituisce effettivamente, quanto costa e dove ciascuno esaurisce la strada, e l'abbinamento diventa un test di confine davvero utile.

Due diversi contratti di output

La distinzione che qui fa tutto il lavoro è ciò che ritorna sulla rete.

Liquid AI d1-3Brestituisce un oggetto di risposta strutturato. Ogni domanda in una richiesta dichiara un tipo — noul per sì/no con P(sì), choice per una tra un insieme di opzioni denominate, con una confidenza e una probabilità per opzione, oppure score per una posizione su una scala ordinata da due a dieci livelli, con il livello atteso e la sua distribuzione. Il modello riporta output_tokens: 0 perché non viene scritto nulla. Più domande su un unico stato vengono lette da un'unica passata in avanti, e lo stato e le sue immagini vengono codificati una sola volta per tutte.

Ge​mma 4 12B restituisce prosa. A volte restituisce il JSON che hai chiesto, a volte un JSON diverso da quello che avevi chiesto, e può ragionare prima di rispondere. È prima di tutto un modello linguistico: qualunque cosa sappia classificare, la esprime come testo. Questo è un punto di forza quando la risposta deve essere spiegata a una persona o inviata a uno step successivo che si aspetta del linguaggio, ed è un costo quando l'unica cosa che ti serviva era una probabilità.

Tutto ciò che sta a valle consegue da questo. Il parsing di una risposta di d1-3B non può fallire. Inoltre non può spiegarsi da sola, e la scheda del modello lo dice direttamente: non è un modello conversazionale e non scrive testo.

A che punto sono le piste delle prove

La provenienza dei due insiemi di numeri non è equivalente, e qui ciò conta più dei numeri stessi.

• Decision Index 0.2.1 — Liquid AI d1-3B ottiene 48.57, valutato dal fornitore con lo scorer ufficiale, primo tra i modelli sotto i 10B e davanti a Decider 35B-A3B a 47.11. Ge​mma 4 12B non è affatto valutato sul Decision Index, quindi questa riga non ha un corrispondente.

• Benchmark di ragionamento — Gemma 4 12B ottiene 77,5 su AIME 2026, 78,8 su GPQA Diamond e 1.659 Codex ELO, e un Artificial Analysis Intelligence Index di 22 in modalità ragionamento e 13 con ragionamento disattivato. Liquid AI d1-3B non ha un benchmark di ragionamento, perché un modello decisionale non produce una traccia di ragionamento da valutare.

• {{1}}Contesto lungo{{/1}} — Ge​mma 4 12B accetta 256.000 token e ottiene il 43,4% su MRCR v2 eight-needle a 128k sulla scheda di Goo​gle stessa. Liquid AI d1-3B accetta 32.768 token. Se il tuo {{2}}"stato"{{/2}} è un documento di quaranta pagine più scansioni, quel divario è l'intera decisione e non c'è partita.

• Visione — Liquid AI d1-3B registra una media di 74,1 su undici benchmark pubblici di immagini, interpretati come decisioni sull'insieme di opzioni di ciascun benchmark, a fronte di 73,9 per il backbone LFM2.5-VL-3B da cui è stato costruito; il fornitore riferisce che rimuovendo le immagini le stesse domande scendono a 45,1. Le capacità visive di Gemma 4 12B sono più forti e più ampie, ma vengono riportate come qualità di generazione, non come accuratezza decisionale su opzioni denominate.

• Lingue — sedici documentate per Liquid AI d1-3B; più di 140 per Gemma 4 12B.

• Velocità — Liquid AI d1-3B risponde a una domanda in 8 ms su una RTX 4090, 16 ms su un Jetson AGX Thor, 26 ms su un Jetson AGX Orin 64 GB e 50 ms su un Jetson Orin Nano, e impacchetta 64 stati in una singola passata a 475 al secondo sulla 4090. Ge​mma 4 12B genera, quindi la sua latenza è una funzione di quanti token scrive.

• Qualità dell'evidenza — I risultati di Gemma 4 12B sono di Google, pubblicati a giugno 2026 e da allora presi in esame, quantizzati e rieseguiti da una vasta comunità. Quelli di Liquid AI d1-3B sono di Liquid, pubblicati due giorni fa, riprodotti da nessuno al di fuori del laboratorio. Leggere la seconda colonna di conseguenza.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

L'unico ambito in cui competono davvero

C'è una sovrapposizione reale, e non è su una classifica. È la chiamata LLM-as-a-judge.

Moltissime pipeline di produzione usano già un generalista di medie dimensioni come livello di valutazione: attribuire un punteggio all'urgenza di questo ticket, decidere se questo output supera una rubrica, scegliere quale strumento l'agente dovrebbe chiamare successivamente, verificare se un passaggio recuperato risponde alla domanda. Oggi la maggior parte di queste chiamate va a un modello generativo a cui viene chiesto di emettere un numero o un'etichetta sotto forma di testo, e il numero che emette è quello che ha prodotto il campionatore, non un softmax sul tuo insieme di opzioni. È il flusso di lavoro che Liquid AI d1-3B è stato post-addestrato a sostituire, e le demo pubblicate ne sono tutte versioni — un predicato SQL che risponde sì o no per 150 ticket di supporto, un ciclo di compattazione del contesto dell'agente che mantiene, taglia o scarta l'output di ogni strumento ed elimina il 52% dei token, un'app di ispezione visiva che ha selezionato pezzi buoni e difettosi da quattro linee di produzione con un'accuratezza dall'85 al 97% su un compito per cui non era mai stata addestrata.

Gemma 4 12B svolge tutti quei compiti, e ne svolge più di quelli. Può anche scrivere il riassunto, tenere a vista un documento da 256K, accettare in input una chiamata telefonica registrata e rispondere in una delle oltre 140 lingue. Se la tua pipeline necessita di una valutazione e di una narrazione, il 12B svolge due lavori con una sola chiamata e il modello decisionale 3B ne svolge uno.

Il confine è la lunghezza del contesto e la forma dell'output. Stato lungo, input vocale, molte lingue o una spiegazione che il lettore si aspetta — Ge​mma 4 12B, non c'è partita. Stato breve, un insieme fisso di opzioni, un budget di latenza per richiesta in millisecondi a una cifra, o una garanzia assoluta che la risposta venga analizzata correttamente — quella è la colonna d1-3B, e il generalista sta pagando per qualcosa che non userai.

Quanto costa chiamare ciascuno

Nessuno dei due modelli è nel nostro catalogo, quindi non c'è un prezzo di instradamento da quotare per nessuno dei due — Ge​mma 4 12B non è tra le dimensioni Ge​mma che serviamo, e Liquid AI d1-3B è a pesi aperti: puoi ospitarlo tu stesso o raggiungerlo tramite l'API del fornitore stesso e piattaforme di terze parti. Per contesto sul lato adiacente a Gemini di quella famiglia, le due dimensioni Ge​mma 4 che instradiamo sono elencate a $0,06 per milione di input e $0,33 per milione di output per Ge​mma 4 26B A4B, e $0,13 e $0,38 per Ge​mma 4 31B, entrambe con contesti da 262.144 token e input di testo, immagini e video. Il prezzo mediano dei fornitori quotato per Ge​mma 4 12B altrove si aggira intorno a $0,10 e $0,30.

L'hosted di Liquid d1 fattura solo i token di input, a $0,04 per milione, con le immagini conteggiate come input a 1,5 token per patch da 32×32 pixel. Una richiesta di decisione non ha quindi alcuna riga di token di output, che è la ragione strutturale per cui il confronto dei costi del fornitore stesso con modelli molto più grandi arriva dove arriva. I pesi aperti non hanno un prezzo per chiamata; paghi in hardware. Entrambi devono stare nella stessa pipeline di tutto il resto che chiami, che è il livello per cui esiste un router — un'unica API su oltre 200 modelli, prezzi di listino dei provider passati con markup 0%, e failover automatico così un singolo problema a monte non diventa il tuo disservizio. Questa è l'infrastruttura attorno al confronto, non il confronto.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Come decidere, onestamente

Parti dal formato della risposta anziché dal modello. Se il sistema a valle può consumare una probabilità, un'etichetta e una confidenza, e l'insieme delle risposte è piccolo e noto, Liquid AI d1-3B non è un downgrade rispetto a un 12B — è uno strumento diverso, e i numeri di latenza lo rendono un deployment categoricamente differente: 50 ms su un Jetson Orin Nano è un dispositivo che non ha alcun motivo di eseguire un 12B.

Se la risposta deve essere una frase, o lo stato supera i trentaduemila token, o qualcuno la pronuncerà, o la lingua di output è il bengalese, allora Ge​mma 4 12B è l'unico dei due che può svolgere il compito e il confronto è finito prima ancora di iniziare.

La posizione realmente utile per la maggior parte dei team è entrambe, in punti diversi. Un modello decisionale davanti alla chiamata costosa, che si occupa del triage, del routing e dei controlli di guardrail che non richiedono il linguaggio; un generalista dietro, per il lavoro che invece lo richiede. Sono la stessa pipeline, uno è un filtro e l'altro è il payload — e i team che trarranno il massimo dal rilascio d1 sono quelli che già pagano un 12B per rispondere sì o no.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.