
Liquid AI d1-3B vs Granite 4.2 3B: Due modelli 3B che non svolgono mai lo stesso compito
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti Liquid AI d1-3B e Granite 4.2 3B sulla stessa singola GPU e entrambi ci staranno comodamente — 3,12B parametri da una parte, 3B dall'altra. Si comporteranno anche come se provenissero da discipline diverse. Granite 4.2 3B, che la model card di IBM stessa data al 25 agosto 2026, è un modello di ragionamento: tre modalità di pensiero, un blocco <think> e una risposta che leggi. Liquid AI d1-3B, caricato su Hugging Face il 5 ottobre 2026 e annunciato da Liquid due giorni dopo, è un modello decisionale: prende uno stato più un insieme esplicito di domande tipizzate e restituisce una probabilità, un'etichetta o una posizione su una scala in un solo forward pass, riportando output_tokens: 0 perché non scrive mai nulla. La domanda utile non è quale dei due sia migliore. È quale delle tue chiamate è effettivamente una decisione, perché i due repo sono costruiti per le metà opposte di quella divisione.
Che cosa c'è effettivamente in ciascun repository
Tutto ciò che segue proviene dalle due model card e dal post di annuncio di Liquid. Nulla di quanto qui riportato è stato riprodotto in modo indipendente, nessuna terza parte ha valutato nessuno dei due modelli sullo stesso harness, e i numeri nelle model card sono quelli dei fornitori stessi.
• Dimensioni — Liquid AI d1-3B 3,12B in totale, basato su LFM2.5-VL-3B di Liquid; Granite 4.2 3B, un transformer denso decoder-only da 3B basato su granite-4.1-3b-base
• Output — d1-3B restituisce probabilità, etichette e confidenze e non scrive alcun testo; Granite 4.2 3B genera token, inclusa una catena di pensiero opzionale all'interno dei<think> tag
• Contesto — d1-3B 32.768 token; Granite 4.2 3B 128K nativamente, con un'estensione di contesto lungo a 512K sulla scheda
• Ingresso — testo d1-3B, JSON, immagini o una combinazione, tramite un encoder visivo SigLIP2 NaFlex 400M; Granite 4.2 3B solo testo
• Licenza — d1-3B con licenza Liquid's LFM Open License v1.0; Granite 4.2 3B con licenza Apache 2.0
• Lingue — d1-3B ne elenca 16; Granite 4.2 3B ne elenca dodici testate, con la scheda che segnala che le altre non sono testate
• Serving — d1-3B include codice personalizzato (trust_remote_code=True, transformers>=5.14), con repo GGUF e w8a8 nella stessa famiglia e schede documentate per llama.cpp, Ollama e LM Studio; Granite 4.2 3B funziona con vLLM 0.20+ o SGLang 0.5.18+ con un parser di thinking personalizzato
Due di quelle righe fanno più lavoro delle altre. La riga dell'output è l'intero argomento di questo articolo, e la riga della licenza è quella che nessuno mette nella tabella di confronto.

Uno scrive una catena di pensieri, l'altro si rifiuta di scrivere.
Granite 4.2 3B si ripaga pensando ad alta voce. La sua scheda documenta tre modalità: pensiero attivo per impostazione predefinita, senza pensiero, e una modalità a basso sforzo che mantiene la traccia di ragionamento ma la accorcia. Gli stack di serving separano la traccia dalla risposta finale, così la tua applicazione riceve contenuto pulito più un campo di ragionamento separato. Questo è un buon design per una domanda che deve essere risolta — un problema di matematica, un ramo della logica, un pezzo di codice che deve essere scritto prima di poter essere giudicato.
d1-3B non ha tale modalità, e la sua scheda lo dice senza mezzi termini: "Non è un modello di chat e non scrive testo." Una chiamata dichiara le domande con un tipo. noul è un sì/no che restituisce P(sì) tra 0 e 1. choice seleziona un'etichetta da un insieme di opzioni denominato e restituisce l'etichetta, una confidenza e una probabilità per opzione. score colloca lo stato su una scala ordinata da due a dieci e restituisce il livello atteso con la sua distribuzione e legenda. Il segnale viene letto dai logits in una posizione segnaposto in un'unica passata, non campionato token per token, ed è per questo che il blocco di utilizzo può riportare zero token di output senza mentire.
Questa differenza cambia la tua fattura prima di cambiare la tua accuratezza. Una chiamata di classificazione Granite che "pensa" per 400 token è una chiamata per cui paghi 400 token di output, e l'etichetta che volevi è sepolta in una prosa che poi un parser deve recuperare. Una chiamata d1-3B fattura solo l'input. Se la maggior parte del tuo traffico è un'etichetta con una regola associata, hai pagato per il ragionamento indipendentemente dal fatto che abbia cambiato l'etichetta o no.
Dove Granite 4.2 3B è chiaramente la scelta migliore
Prendi i benchmark di reasoning al valore nominale — sono di IBM stessa, eseguiti attraverso una pipeline interna NeMo Evaluator, e nessuna parte esterna li ha riprodotti — e il 3B è insolitamente forte per le sue dimensioni: AIME25 78,33, HMMT February 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78 e RULER 64K 67,52 che scende a 55,30 a 128K.
Da quell'elenco derivano quattro lavori, e d1-3B non è presente in nessuno di essi.
• Un contesto da 128K, estendibile a 512K su 32.768 token su d1-3B, se il tuo stato è un documento lungo, la scelta è fatta per te
• Chiamata agentica di strumenti con un parser documentato e integrazioni con gli harness per OpenCode, Pi e OpenHands, di cui un modello decisionale non ha alcun equivalente
• Qualsiasi compito la cui risposta sia un paragrafo: sintesi, stesura, estrazione in una struttura libera, generazione di codice
• Fine-tuning e ridistribuzione senza un tetto di ricavi, perché Apache 2.0 non prevede una clausola di soglia
Nota cosa non c'è sulla scheda di Granite: le righe SWE-Bench e Terminal-Bench sono contrassegnate come NA per il 3B. La fase di apprendimento per rinforzo agentico di IBM è stata applicata solo ai membri da 8B e 30B della famiglia, quindi il modello più piccolo non riporta i punteggi agentici che hanno i suoi fratelli maggiori. Un team che legge «Granite 4.2» e presume che il 3B erediti il profilo agentico della famiglia resterà sorpreso.

Dove d1-3B vince prima che Granite finisca di pensare
La tabella di latenza di Liquid stessa, misurata a caldo, una richiesta alla volta, è la parte più forte della sua tesi: una singola domanda in 8 ms su una RTX 4090 e 9 ms su una AMD MI325X, 16 ms su una Jetson AGX Thor e 26 ms su una Jetson AGX Orin 64GB, con 64 stati impacchettati in una sola passata a 475/s sulla 4090 e 1.106/s sulla MI325X. Per dare un'idea della scala, è all'incirca il tempo che Granite 4.2 3B impiega a emettere qualche token della sua traccia di ragionamento.
Tre tipi di domanda su un unico stato costano a d1-3B 21 ms su una 4090 invece di tre chiamate separate, perché lo stato e le sue immagini vengono letti una volta sola per tutte le domande. In uno stack di moderazione o di instradamento che prima faceva partire una richiesta HTTP per ogni regola, questa è la differenza tra una coda di chiamate e una sola.
Vede anche. d1-3B ottiene una media di 74,1 su undici benchmark pubblici di immagini rispetto a 73,9 del suo modello base, e la scheda osserva che, rimosse le immagini, le stesse domande totalizzano 45,1 — le risposte provengono dall'immagine, non dal prompt testuale. Le singole righe vanno in entrambe le direzioni (CV-Bench 82,1 contro 87,6 del modello base, POPE 88,5 contro 90,1), quindi l'affermazione sulla visione è "alla pari con il modello base", non "migliore di esso".
Il contrappeso onesto: il 48,57 di d1-3B su Decision Index 0.2.1 è stato prodotto da Liquid eseguendo essa stessa lo scorer ufficiale, anziché da una submission alla classifica, e le righe concorrenti provengono dalla classifica pubblica. La sua media di 77,1 su otto attività benchmark-as-decision e il suo 71,8 su DecisionBench sono anch'essi first-party. Tutto ciò che sta dalla parte d1 di questo confronto non è verificato.

Perché un reasoner da 3B non è un modello decisionale da 3B
La mossa allettante è considerare Granite 4.2 3B un sostituto più economico per d1-3B, o viceversa. Entrambe falliscono, e il fallimento è strutturale, non una questione di qualità.
Chiedi a Granite di decidere e ottieni una generazione che devi analizzare, un costo che scala con quanto il modello ha trovato difficile la domanda e una latenza che dipende dalla modalità di ragionamento che hai selezionato. Chiedi a d1-3B di ragionare e non ottieni assolutamente nulla: non ha alcun flusso di token in cui ragionare. I due modelli sono su lati opposti di una linea che la maggior parte delle pipeline attraversa più volte per richiesta: qualcosa deve decidere e qualcosa deve parlare. d1-3B appartiene alla parte anteriore, dove una regola di triage sceglie un percorso e restituisce una confidenza calibrata. Granite 4.2 3B appartiene dietro di esso, sul ramo in cui occorre scrivere una risposta.
C'è una seconda trappola, più silenziosa. Il valore di un modello decisionale è la calibrazione — una confidenza di 0,9 che risulta corretta nove volte su dieci. La scheda di Granite 4.2 3B non pubblica metriche di calibrazione né probabilità; pubblica punteggi di accuratezza e di ragionamento. Confrontare i due su una classifica di benchmark non ti dice nulla su a quale dei due dovresti affidarti con una soglia.
La riga di licenza che nessuno mette nella tabella
Granite 4.2 3B è distribuito con licenza Apache 2.0. d1-3B è distribuito con la LFM Open License v1.0, che sembra permissiva fino alla Sezione 5: l'uso commerciale è concesso a condizione che tu o la tua persona giuridica rimaniate al di sotto di una soglia, definita nello stesso documento, pari a un fatturato annuo di dieci milioni di dollari statunitensi o più, e qualsiasi uso commerciale al di sopra di tale linea semplicemente non è concesso in licenza. Le organizzazioni senza scopo di lucro e gli utenti della ricerca sono esentati.
Per un hobbista o una startup non è un problema. Per un'azienda che supera quel limite a metà anno — o che potrebbe essere acquisita da una di esse — i due repository non sono artefatti equivalenti, per quanto simili possano sembrare i loro conteggi di parametri, e la revisione della licenza avviene molto dopo che qualcuno ha già rilasciato il prototipo. È la cosa meno costosa da controllare per tempo su questa pagina.
Eseguire la coppia come un'unica pipeline
Nessuno dei due modelli è oggi nel nostro catalogo, quindi non si tratta di una dichiarazione di disponibilità: entrambi sono artefatti self-hosted, e in particolare Granite 4.2 3B non ha alcun provider di inferenza elencato nella sua scheda. Ma il pattern a cui un team finisce effettivamente per arrivare è una chiamata che decide e un'altra che parla, ed è lì che un livello di routing guadagna il suo posto. OrcaRouter mette più di 200 modelli dietro un'unica API key con i prezzi di listino dei provider trasferiti a markup 0%, così un taglio di prezzo di un fornitore arriva sulla tua fattura lo stesso giorno invece che al rinnovo contrattuale successivo, e il failover automatico tra provider fa sì che il componente condiviso nel mezzo di una pipeline non diventi un single point of failure mentre lo stai ancora valutando. Se vuoi confrontare in A/B d1-3B con un generalista hosted sul tuo traffico prima di impegnarti in un deployment self-hosted, il vicino instradato più prossimo alla discendenza di Granite è Gemma 4 31B a 0,13 $ per milione di token in input e 0,38 $ per milione in output — un modello molto più grande, ma con lo stesso ruolo di "generalista che scrive" nella pipeline.
Il verdetto, formulato come regola
Se quello di cui hai bisogno è un giudizio — spam o no, quale coda, quanto è urgente, quest'immagine corrisponde a quella descrizione — d1-3B è l'unico dei due che fa il lavoro in una sola passata, e lo fa in millisecondi a una cifra. Se quello di cui hai bisogno è una risposta scritta, la lettura di un lungo documento, una chiamata a uno strumento o un pezzo di codice, Granite 4.2 3B è quello che dispone quantomeno di un flusso di token, e i punteggi di ragionamento del 3B sono davvero impressionanti per le sue dimensioni — sulle valutazioni di IBM, senza che nessuno le abbia ancora verificate.
Ciò che cambierebbe il quadro non è una nuova riga di benchmark. È una terza parte che valuta entrambi i modelli sullo stesso harness di calibrazione, perché la proprietà che decide se puoi applicare una soglia a un modello è quella che nessuna delle due schede ti consente di confrontare oggi.
