
Liquid AI d1-3B vs Qwen 3 8B: un carico di lavoro di classificazione da 8B dovrebbe passare a un modello decisionale?
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?
Quello che stai effettivamente pagando un 8B per fare
Metti i due contratti di output fianco a fianco e l'inefficienza risulta strutturale anziché incrementale.
Una chiamata di classificazione a Qwen 3 8B è una generazione. Scrivi un prompt che descrive le etichette, il modello facoltativamente ragiona sull'input — e su questo modello puoi attivare o disattivare quel ragionamento per richiesta, che è la manopola più utile che ha per questo tipo di lavoro — e poi restituisce una risposta. Quella risposta è testo. Se hai chiesto JSON, di solito otterrai JSON, e occasionalmente otterrai JSON dentro una frase, o un preambolo, o una spiegazione finale che non volevi. L'etichetta che ti interessa è da qualche parte nel flusso di token, e un parser la recupera. Paghi per ogni token che il modello scrive, compresi quelli che scarti.
Liquid AI d1-3B non ha alcun flusso di token. Le domande vengono dichiarate con un tipo: noul per sì/no, con risposta P(yes) tra 0 e 1; choice per un'etichetta da un insieme di opzioni denominato, con risposta come etichetta più un livello di confidenza più una probabilità per opzione; score per una posizione su una scala ordinata da due a dieci, con risposta come livello atteso con la sua distribuzione e legenda. La risposta porta un totale progressivo che riporta output_tokens: 0. Non c'è nulla da analizzare perché non è stato scritto nulla, e c'è un accessor grezzo probabilities quando vuoi la distribuzione non arrotondata anziché l'argmax.
La parte che cambia la tua bolletta è ciò che accade con più domande. Un unico stato può portarne molte: è una richiesta di rimborso, quale team dovrebbe occuparsene, quanto è urgente. Lo stato e le sue immagini vengono letti una sola volta, e Liquid riporta che tre domande su un unico stato costano 1,3 volte il tempo di una anziché 3 volte. Ciò che non riduce è l'addebito sull'input — la nota di fatturazione del fornitore è esplicita: ogni domanda viene fatturata come un prompt a sé, incluso il suo testo e tutte le sue immagini. Meno latenza, stessi token di input. È un asterisco onesto sul titolo di richiamo, ed è il tipo di cosa che scopri solo leggendo il paragrafo sui prezzi anziché il benchmark.

Cosa ti danno sedici mesi di Qwen 3 8B
Prima di considerare il modello più piccolo un aggiornamento, sii preciso su ciò che porta il modello attuale, perché è più di un semplice conteggio dei parametri.
• Contesto — Qwen 3 8B esegue 32.768 token nativamente e si estende a 131.072 convalidati tramite YaRN. Liquid AI d1-3B esegue 32.768 token fissi, senza alcun percorso di estensione documentato. Per uno stato che è un documento lungo, l'8B è l'unico dei due che può contenerlo.
• Lingue — 119 lingue e dialetti per Qwen 3 8B contro sedici documentati per Liquid AI d1-3B.
• Controllo del ragionamento — Qwen 3 8B ti consente di attivare o disattivare il pensiero per ogni richiesta. Liquid AI d1-3B non ha alcuna modalità di ragionamento da controllare, il che è o una semplificazione o un limite, a seconda di ciò per cui usavi il pensiero.
• Ampiezza — l'8B scrive, spiega, riassume, traduce e programma. Liquid AI d1-3B non fa nulla di tutto ciò. La sua scheda lo dichiara chiaramente: non è un modello di chat e non scrive testo.
• Prove — Qwen 3 8B ha sedici mesi di benchmarking pubblico, quantizzazione, fine-tuning e utilizzo in produzione. Il punteggio Decision Index di 48,57 di Liquid AI d1-3B è stato prodotto da Liquid utilizzando lo scorer ufficiale anziché essere inviato alla classifica pubblica, ed è di pochi giorni fa senza alcuna riproduzione di terze parti.
• Visione — questa riga va nella direzione opposta. Liquid AI d1-3B accetta immagini, con il fornitore che riporta 74,1 su undici benchmark pubblici di immagini interpretati come decisioni sull'insieme di opzioni di ciascun benchmark, e che riporta che rimuovere le immagini fa crollare le stesse domande a 45,1. Il Qwen 3 8B solo testo necessita di un modello di visione separato davanti a sé per fare qualcosa del genere.
• Velocità — una domanda in 8 ms su una RTX 4090, 16 ms su una Jetson AGX Thor, 50 ms su una Jetson Orin Nano, e 64 stati impacchettati per passata a 475 al secondo sulla 4090. Un classificatore basato sulla generazione non ha un numero comparabile, perché la sua latenza dipende da quanto è lunga la risposta.
Il riassunto onesto è che l'8B è lo strumento generico migliore e il modello decisionale 3B è quello specializzato migliore, e l'unica domanda che conta è quanta parte del tuo traffico rappresenta il caso specializzato.
L'aritmetica dei costi, fatta con attenzione
È qui che il confronto o si ripaga da solo oppure no, quindi vale la pena farlo con una struttura reale invece che con uno slogan.
La tesi pubblicata da Liquid due giorni prima del rilascio degli open-weights è che il suo modello decisionale hosted eguaglia o batte GPT-6.1 Sol su quattro delle sei applicazioni reali, a un costo inferiore da 19x a 200x, e risponde più rapidamente su ogni compito. Leggi la metodologia prima di ripeterla: ogni applicazione è stata eseguita una volta per modello il 5 ottobre 2026, i modelli di chat hanno risposto in JSON alle loro impostazioni di ragionamento predefinite, e il costo di d1 è stato calcolato a $0,04 per milione di token di input. Quella cifra di $0,04 è la in hosting d1 tariffa di input, ed è l'unica tariffa esistente — non c'è alcuna voce di output da aggiungere.
Ora costruisci lo stesso tipo di stima per un classificatore Qwen 3 8B e l'asimmetria è visibile senza citare il prezzo di alcun provider. L'8B ha due voci fatturabili dove il modello decisionale ne ha una, e la seconda voce è quella che cresce: una classificazione che ragiona prima paga il ragionamento, e una classificazione che riempie il suo JSON paga il riempimento. Il costo di input del modello decisionale è fissato dallo stato e dalle domande. Quello dell'8B non è fissato da nulla che tu possa prevedere dal solo stato.
Due contrappesi impediscono che questa diventi una disfatta. Primo, il modello decisionale addebita ogni domanda come un prompt a sé stante, quindi porre cinque domande su un unico documento lungo quintuplica l'input — l'8B pone tutte e cinque in una sola chiamata e paga il documento una volta sola. Secondo, e più importante, un modello decisionale può rispondere solo a domande per cui è stato post-addestrato a rispondere in quella forma. Qualunque cosa richieda una spiegazione, un riassunto o un giudizio espresso a parole ti riporta al generalista e, in pratica, ti riporta a pagare per entrambi.

In cosa {{1}}i due sono davvero bravi{{/1}}
Togli il benchmarking e la separazione è più netta di quanto i conteggi dei parametri lascino pensare.
Liquid AI d1-3B è per il sì/no, la selezione da un elenco e la valutazione, a un livello di latenza che nulla di generativo raggiunge, su hardware che include un Jetson Orin Nano a 50 ms e un laptop. Le applicazioni dimostrate da Liquid in ottobre erano tutte versioni di quella forma — un predicato SQL che risponde sì o no per 150 ticket di supporto, un ciclo di compattazione del contesto dell'agente che mantiene, riduce o scarta l'output di ogni strumento e rimuove il 52% dei token, un'app di ispezione che smista parti buone e difettose provenienti da quattro linee di produzione con un'accuratezza dall'85 al 97% su un compito per cui non era mai stata addestrata e che aveva compreso da una breve descrizione. Quell'ultima demo è l'espressione più chiara di a cosa serve la categoria: un compito in cui la risposta è una tra poche possibilità, lo stato è un'immagine e non è mai stata richiesta alcuna spiegazione.
Qwen 3 8B è per il lavoro che deve tornare come linguaggio, o coprire 119 lingue, o contenere un documento più lungo di trentaduemila token, o ragionare ad alta voce prima di impegnarsi. È anche la risposta giusta quando la classificazione non è una delle tre forme sopra — quando l'insieme delle etichette è aperto, quando i criteri sono abbastanza sfumati da richiedere il ragionamento, quando la stessa chiamata deve gestire il caso facile e quello difficile senza che tu debba instradare tra due modelli. Ed è la scelta sicura quando un revisore chiede quali benchmark indipendenti esistono, perché la risposta è: molti, che risalgono a un anno e mezzo fa.
I team che lo fanno bene non scelgono. Mettono il modello decisionale davanti al generalista, sulla porzione di traffico in cui la risposta è un numero, e lasciano che l'8B gestisca tutto ciò che richiede una frase. Il filtro è 3B e 8 ms; l'8B resta per il payload.
Schierando la coppia
Liquid AI d1-3B arriva sotto forma di pesi con il lavoro di deployment già svolto: supporto llama.cpp dal primo giorno, l'intero stack NVIDIA da DGX fino a Jetson, quantizzazione NVFP4, una variante a 8 bit per pesi e attivazioni e conversioni GGUF su Hugging Face. Qwen 3 8B ha l'ecosistema di self-hosting più profondo di qualsiasi modello in questa fascia di peso. Nessuno dei due è nel nostro catalogo, nulla di quanto qui riportato costituisce una dichiarazione di disponibilità per nessuno dei due — la via ospitata per Liquid d1-3B è l'API dello stesso fornitore e piattaforme di terze parti, dove il d1è prezzato solo sui token di input a 0,04 $ per milione, con token fatturati a 1,5 token per patch da 32×32 pixel.
Una volta che entrambi sono nella stessa pipeline, il problema del routing smette di essere teorico. Hai un modello piccolo che possiedi, un 8B che puoi ospitare o noleggiare, e le chiamate generative che di sicuro noleggi — e decidere per ogni richiesta quale di questi dovrebbe ricevere un dato input è esattamente la decisione che un layer di routing esiste per prendere. Un solo endpoint su oltre 200 modelli, prezzi di listino dei provider passati con markup dello 0% così un cambiamento di prezzo di un fornitore è attivo dalla tua parte lo stesso giorno, failover automatico così un pomeriggio storto di un upstream non diventa la tua interruzione di servizio. Quando il tuo traffico di classificazione si misura in miliardi di chiamate all'anno, quel layer è dove i risparmi di un modello decisionale da 3B vengono effettivamente incassati.
Il verdetto
Se al tuo 8B vengono poste domande chiuse — è tossico, è pertinente, in quale coda va inserito, quanto è urgente — stai pagando il conto di due righe di un generalista e la latenza di una generazione per un'etichetta, e Liquid AI d1-3B è una sostituzione diretta, con una traccia probatoria più debole e una concreta differenza di licenza da soppesare. Accetta il tetto di contesto di 32K, le sedici lingue e il fatto che nessuno al di fuori di Liquid lo abbia ancora valutato.
Se al tuo 8B viene chiesto di spiegare, riassumere, tradurre, gestire un documento lungo o ragionare prima di decidere, questo confronto non si applica a te. Tieni l'8B e considera il modello decisionale solo come un pre-filtro per il traffico che puoi identificare in anticipo come del tipo facile.
Il numero interessante da tenere d'occhio non è il punteggio di benchmark dell'uno o dell'altro modello. È quanto rapidamente arriva la prima riproduzione indipendente del d1 Decision Index, perché è il momento in cui il confronto smette di essere un'affermazione di un fornitore e comincia a essere un fatto su cui puoi pianificare.

