Una scheda del titolo principale intitolata 'Liquid AI d1-3B vs Granite 4.2 3B' con il sottotitolo 'uno decide, uno scrive', che mostra una scheda a sinistra etichettata d1-3B con un'icona checklist, la didascalia '3.12B - 32,768 tokens' e chip che riportano probabilità, etichetta e punteggio, e una scheda a destra etichettata Granite 4.2 3B con un'icona fumetto, la didascalia '3B - 128K tokens' e un chip che riporta 'una risposta scritta'.
Guides & Insights

Liquid AI d1-3B vs Granite 4.2 3B: Due modelli 3B che non svolgono mai lo stesso compito

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Liquid AI d1-3B e Granite 4.2 3B sulla stessa singola GPU e entrambi ci staranno comodamente — 3,12B parametri da una parte, 3B dall'altra. Si comporteranno anche come se provenissero da discipline diverse. Granite 4.2 3B, che la model card di IBM stessa data al 25 agosto 2026, è un modello di ragionamento: tre modalità di pensiero, un blocco <think> e una risposta che leggi. Liquid AI d1-3B, caricato su Hugging Face il 5 ottobre 2026 e annunciato da Liquid due giorni dopo, è un modello decisionale: prende uno stato più un insieme esplicito di domande tipizzate e restituisce una probabilità, un'etichetta o una posizione su una scala in un solo forward pass, riportando output_tokens: 0 perché non scrive mai nulla. La domanda utile non è quale dei due sia migliore. È quale delle tue chiamate è effettivamente una decisione, perché i due repo sono costruiti per le metà opposte di quella divisione.

Che cosa c'è effettivamente in ciascun repository

Tutto ciò che segue proviene dalle due model card e dal post di annuncio di Liquid. Nulla di quanto qui riportato è stato riprodotto in modo indipendente, nessuna terza parte ha valutato nessuno dei due modelli sullo stesso harness, e i numeri nelle model card sono quelli dei fornitori stessi.

• Dimensioni — Liquid AI d1-3B 3,12B in totale, basato su LFM2.5-VL-3B di Liquid; Granite 4.2 3B, un transformer denso decoder-only da 3B basato su granite-4.1-3b-base

• Output — d1-3B restituisce probabilità, etichette e confidenze e non scrive alcun testo; Granite 4.2 3B genera token, inclusa una catena di pensiero opzionale all'interno dei<think> tag

• Contesto — d1-3B 32.768 token; Granite 4.2 3B 128K nativamente, con un'estensione di contesto lungo a 512K sulla scheda

• Ingresso — testo d1-3B, JSON, immagini o una combinazione, tramite un encoder visivo SigLIP2 NaFlex 400M; Granite 4.2 3B solo testo

• Licenza — d1-3B con licenza Liquid's LFM Open License v1.0; Granite 4.2 3B con licenza Apache 2.0

• Lingue — d1-3B ne elenca 16; Granite 4.2 3B ne elenca dodici testate, con la scheda che segnala che le altre non sono testate

• Serving — d1-3B include codice personalizzato (trust_remote_code=True, transformers>=5.14), con repo GGUF e w8a8 nella stessa famiglia e schede documentate per llama.cpp, Ollama e LM Studio; Granite 4.2 3B funziona con vLLM 0.20+ o SGLang 0.5.18+ con un parser di thinking personalizzato

Due di quelle righe fanno più lavoro delle altre. La riga dell'output è l'intero argomento di questo articolo, e la riga della licenza è quella che nessuno mette nella tabella di confronto.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

Uno scrive una catena di pensieri, l'altro si rifiuta di scrivere.

Granite 4.2 3B si ripaga pensando ad alta voce. La sua scheda documenta tre modalità: pensiero attivo per impostazione predefinita, senza pensiero, e una modalità a basso sforzo che mantiene la traccia di ragionamento ma la accorcia. Gli stack di serving separano la traccia dalla risposta finale, così la tua applicazione riceve contenuto pulito più un campo di ragionamento separato. Questo è un buon design per una domanda che deve essere risolta — un problema di matematica, un ramo della logica, un pezzo di codice che deve essere scritto prima di poter essere giudicato.

d1-3B non ha tale modalità, e la sua scheda lo dice senza mezzi termini: "Non è un modello di chat e non scrive testo." Una chiamata dichiara le domande con un tipo. noul è un sì/no che restituisce P(sì) tra 0 e 1. choice seleziona un'etichetta da un insieme di opzioni denominato e restituisce l'etichetta, una confidenza e una probabilità per opzione. score colloca lo stato su una scala ordinata da due a dieci e restituisce il livello atteso con la sua distribuzione e legenda. Il segnale viene letto dai logits in una posizione segnaposto in un'unica passata, non campionato token per token, ed è per questo che il blocco di utilizzo può riportare zero token di output senza mentire.

Questa differenza cambia la tua fattura prima di cambiare la tua accuratezza. Una chiamata di classificazione Granite che "pensa" per 400 token è una chiamata per cui paghi 400 token di output, e l'etichetta che volevi è sepolta in una prosa che poi un parser deve recuperare. Una chiamata d1-3B fattura solo l'input. Se la maggior parte del tuo traffico è un'etichetta con una regola associata, hai pagato per il ragionamento indipendentemente dal fatto che abbia cambiato l'etichetta o no.

Dove Granite 4.2 3B è chiaramente la scelta migliore

Prendi i benchmark di reasoning al valore nominale — sono di IBM stessa, eseguiti attraverso una pipeline interna NeMo Evaluator, e nessuna parte esterna li ha riprodotti — e il 3B è insolitamente forte per le sue dimensioni: AIME25 78,33, HMMT February 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78 e RULER 64K 67,52 che scende a 55,30 a 128K.

Da quell'elenco derivano quattro lavori, e d1-3B non è presente in nessuno di essi.

• Un contesto da 128K, estendibile a 512K su 32.768 token su d1-3B, se il tuo stato è un documento lungo, la scelta è fatta per te

• Chiamata agentica di strumenti con un parser documentato e integrazioni con gli harness per OpenCode, Pi e OpenHands, di cui un modello decisionale non ha alcun equivalente

• Qualsiasi compito la cui risposta sia un paragrafo: sintesi, stesura, estrazione in una struttura libera, generazione di codice

• Fine-tuning e ridistribuzione senza un tetto di ricavi, perché Apache 2.0 non prevede una clausola di soglia

Nota cosa non c'è sulla scheda di Granite: le righe SWE-Bench e Terminal-Bench sono contrassegnate come NA per il 3B. La fase di apprendimento per rinforzo agentico di IBM è stata applicata solo ai membri da 8B e 30B della famiglia, quindi il modello più piccolo non riporta i punteggi agentici che hanno i suoi fratelli maggiori. Un team che legge «Granite 4.2» e presume che il 3B erediti il profilo agentico della famiglia resterà sorpreso.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Dove d1-3B vince prima che Granite finisca di pensare

La tabella di latenza di Liquid stessa, misurata a caldo, una richiesta alla volta, è la parte più forte della sua tesi: una singola domanda in 8 ms su una RTX 4090 e 9 ms su una AMD MI325X, 16 ms su una Jetson AGX Thor e 26 ms su una Jetson AGX Orin 64GB, con 64 stati impacchettati in una sola passata a 475/s sulla 4090 e 1.106/s sulla MI325X. Per dare un'idea della scala, è all'incirca il tempo che Granite 4.2 3B impiega a emettere qualche token della sua traccia di ragionamento.

Tre tipi di domanda su un unico stato costano a d1-3B 21 ms su una 4090 invece di tre chiamate separate, perché lo stato e le sue immagini vengono letti una volta sola per tutte le domande. In uno stack di moderazione o di instradamento che prima faceva partire una richiesta HTTP per ogni regola, questa è la differenza tra una coda di chiamate e una sola.

Vede anche. d1-3B ottiene una media di 74,1 su undici benchmark pubblici di immagini rispetto a 73,9 del suo modello base, e la scheda osserva che, rimosse le immagini, le stesse domande totalizzano 45,1 — le risposte provengono dall'immagine, non dal prompt testuale. Le singole righe vanno in entrambe le direzioni (CV-Bench 82,1 contro 87,6 del modello base, POPE 88,5 contro 90,1), quindi l'affermazione sulla visione è "alla pari con il modello base", non "migliore di esso".

Il contrappeso onesto: il 48,57 di d1-3B su Decision Index 0.2.1 è stato prodotto da Liquid eseguendo essa stessa lo scorer ufficiale, anziché da una submission alla classifica, e le righe concorrenti provengono dalla classifica pubblica. La sua media di 77,1 su otto attività benchmark-as-decision e il suo 71,8 su DecisionBench sono anch'essi first-party. Tutto ciò che sta dalla parte d1 di questo confronto non è verificato.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Perché un reasoner da 3B non è un modello decisionale da 3B

La mossa allettante è considerare Granite 4.2 3B un sostituto più economico per d1-3B, o viceversa. Entrambe falliscono, e il fallimento è strutturale, non una questione di qualità.

Chiedi a Granite di decidere e ottieni una generazione che devi analizzare, un costo che scala con quanto il modello ha trovato difficile la domanda e una latenza che dipende dalla modalità di ragionamento che hai selezionato. Chiedi a d1-3B di ragionare e non ottieni assolutamente nulla: non ha alcun flusso di token in cui ragionare. I due modelli sono su lati opposti di una linea che la maggior parte delle pipeline attraversa più volte per richiesta: qualcosa deve decidere e qualcosa deve parlare. d1-3B appartiene alla parte anteriore, dove una regola di triage sceglie un percorso e restituisce una confidenza calibrata. Granite 4.2 3B appartiene dietro di esso, sul ramo in cui occorre scrivere una risposta.

C'è una seconda trappola, più silenziosa. Il valore di un modello decisionale è la calibrazione — una confidenza di 0,9 che risulta corretta nove volte su dieci. La scheda di Granite 4.2 3B non pubblica metriche di calibrazione né probabilità; pubblica punteggi di accuratezza e di ragionamento. Confrontare i due su una classifica di benchmark non ti dice nulla su a quale dei due dovresti affidarti con una soglia.

La riga di licenza che nessuno mette nella tabella

Granite 4.2 3B è distribuito con licenza Apache 2.0. d1-3B è distribuito con la LFM Open License v1.0, che sembra permissiva fino alla Sezione 5: l'uso commerciale è concesso a condizione che tu o la tua persona giuridica rimaniate al di sotto di una soglia, definita nello stesso documento, pari a un fatturato annuo di dieci milioni di dollari statunitensi o più, e qualsiasi uso commerciale al di sopra di tale linea semplicemente non è concesso in licenza. Le organizzazioni senza scopo di lucro e gli utenti della ricerca sono esentati.

Per un hobbista o una startup non è un problema. Per un'azienda che supera quel limite a metà anno — o che potrebbe essere acquisita da una di esse — i due repository non sono artefatti equivalenti, per quanto simili possano sembrare i loro conteggi di parametri, e la revisione della licenza avviene molto dopo che qualcuno ha già rilasciato il prototipo. È la cosa meno costosa da controllare per tempo su questa pagina.

Eseguire la coppia come un'unica pipeline

Nessuno dei due modelli è oggi nel nostro catalogo, quindi non si tratta di una dichiarazione di disponibilità: entrambi sono artefatti self-hosted, e in particolare Granite 4.2 3B non ha alcun provider di inferenza elencato nella sua scheda. Ma il pattern a cui un team finisce effettivamente per arrivare è una chiamata che decide e un'altra che parla, ed è lì che un livello di routing guadagna il suo posto. OrcaRouter mette più di 200 modelli dietro un'unica API key con i prezzi di listino dei provider trasferiti a markup 0%, così un taglio di prezzo di un fornitore arriva sulla tua fattura lo stesso giorno invece che al rinnovo contrattuale successivo, e il failover automatico tra provider fa sì che il componente condiviso nel mezzo di una pipeline non diventi un single point of failure mentre lo stai ancora valutando. Se vuoi confrontare in A/B d1-3B con un generalista hosted sul tuo traffico prima di impegnarti in un deployment self-hosted, il vicino instradato più prossimo alla discendenza di Granite è Gemma 4 31B a 0,13 $ per milione di token in input e 0,38 $ per milione in output — un modello molto più grande, ma con lo stesso ruolo di "generalista che scrive" nella pipeline.

Il verdetto, formulato come regola

Se quello di cui hai bisogno è un giudizio — spam o no, quale coda, quanto è urgente, quest'immagine corrisponde a quella descrizione — d1-3B è l'unico dei due che fa il lavoro in una sola passata, e lo fa in millisecondi a una cifra. Se quello di cui hai bisogno è una risposta scritta, la lettura di un lungo documento, una chiamata a uno strumento o un pezzo di codice, Granite 4.2 3B è quello che dispone quantomeno di un flusso di token, e i punteggi di ragionamento del 3B sono davvero impressionanti per le sue dimensioni — sulle valutazioni di IBM, senza che nessuno le abbia ancora verificate.

Ciò che cambierebbe il quadro non è una nuova riga di benchmark. È una terza parte che valuta entrambi i modelli sullo stesso harness di calibrazione, perché la proprietà che decide se puoi applicare una soglia a un modello è quella che nessuna delle due schede ti consente di confrontare oggi.