
Liquid AI d1-3B e d1-omni-600M: pesi aperti per modelli che non scrivono mai una parola
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Liquid AI d1-3B e Liquid AI d1-omni-600M sono stati pubblicati su Hugging Face il 7 ottobre 2026, e i due checkpoint hanno una proprietà che rende sbagliata la forma di ogni tabella comparativa che abbiate letto quest'anno. Nessuno dei due genera testo. A Liquid AI d1-3B si fornisce uno stato — un ticket di supporto, un payload JSON, una fotografia, o tutti e tre insieme — e un insieme di domande denominate, e il modello restituisce risposte prese direttamente dalla sua distribuzione sulle vostre opzioni. Sì/no come probabilità. Una scelta tra etichette con una confidenza e un vettore di probabilità completo. Una posizione su una scala ordinata. Non c'è alcun passaggio di campionamento, nessun JSON da analizzare, nessuna generazione incontrollata, e il contatore d'uso del fornitore stesso dichiara la cosa senza giri di parole: output_tokens: 0. Il modello da 3B è il pezzo forte — totalizza 48,57 sul Decision Index 0.2.1 con punteggio del fornitore, davanti a tutto ciò che sta sotto i 10B e davanti a un modello decisionale dodici volte più grande. Il fratello da 600M è quello da tenere d'occhio: legge immagini e fino a trenta secondi di parlato attraverso gli stessi pesi del tronco, ed è etichettato come rilascio di ricerca preliminare.
Che cos'è un modello decisionale, in un paragrafo
La categoria si sta costruendo da un anno sotto nomi come modelli system-one e classificatori-che-non-sono-classificatori, e la coppia d1 è finora l'espressione più chiara di tutto ciò. A un modello generativo viene posta una domanda e questo scrive una risposta; la risposta deve essere analizzata sintatticamente, l'analisi può fallire e ogni token che scrive ti costa denaro e tempo. A un modello decisionale viene posta una domanda e questo riporta ciò che già ritiene vero. Le domande di Liquid sono di tre tipi. noul è una domanda sì/no, a cui si risponde con P(sì) tra 0 e 1. choice seleziona un'etichetta da un insieme denominato e restituisce l'etichetta, una confidenza e la probabilità di ciascuna opzione. score colloca lo stato su una scala ordinata da due a dieci livelli e restituisce il livello atteso con la sua distribuzione e legenda. Uno stato può portare più domande contemporaneamente, e lo stato e le sue immagini vengono letti una volta sola per tutte quante.
Quell'ultima proprietà è l'intero business case. Tre domande su un unico ticket costano 1,3 volte il tempo di una domanda, non 3 volte, perché il modello esegue un solo forward pass sull'input e ne ricava diverse risposte. Non c'è nulla da scrivere, quindi non c'è nulla da scrivere male.
Il 3B e il 600M sono costruiti da direzioni opposte
È qui che il rilascio diventa tecnicamente interessante, ed è la parte che la copertura del lancio ha per lo più saltato. I due modelli non condividono una discendenza.
Liquid AI d1-3B discende da LFM2.5-VL-3B, il modello visione-linguaggio decoder-only del produttore. Porta 3,12 miliardi di parametri, un encoder visivo SigLIP2 NaFlex da 400 milioni ottimizzato per la forma, una finestra di contesto di 32.768 token, un vocabolario di 128.000 token e sedici lingue documentate. Per costruirlo, Liquid ha mediato i pesi di LFM2.5-2.6B e del backbone testuale di LFM2.5-VL-3B, ha sottoposto a fine-tuning checkpoint provenienti da diversi seed casuali e miscele di dati, poi ha unito di nuovo i risultati. La sintesi del produttore su ciò che ha contato è rinfrescante nella sua assenza di glamour: l'addestramento su input lunghi, il rimescolamento dell'ordine delle opzioni di risposta e la caccia alle scorciatoie nei dati di addestramento hanno fatto più per il numero finale di qualsiasi tecnica avanzata.
Liquid AI d1-omni-600M discende da LFM2.5-Encoder-350M, un encoder bidirezionale — una specie di rete del tutto diversa. Ha 587M di parametri suddivisi in un tronco condiviso da 381M, un encoder visivo da 94M preso in prestito da LFM2.5-VL-350M e un encoder audio da 112M costruito a partire da un FastConformer a 17 livelli. Ogni modalità utilizza gli stessi pesi del tronco. Il suo contesto è di 16.384 token che coprono insieme posizioni di testo, immagine e audio e, quando sono allegate immagini, stato e domanda vengono ridotti a 896 token perché è ciò su cui è stato addestrato. L'audio riceve un avvertimento che la scheda dichiara senza mezzi termini: la capacità è stata addestrata su richieste tra un parlante inglese e un altro, e le clip vengono tagliate a trenta secondi.
Quindi la famiglia non è un unico modello in due dimensioni. È un decoder e un encoder, addestrati a posteriori per svolgere lo stesso compito con due meccanismi completamente diversi, uno dei quali vede e uno dei quali sente.

I numeri, e di chi sono
Ogni dato in questa sezione è di Liquid. Le righe del Decision Index per i modelli d1 sono state valutate dal fornitore utilizzando lo scorer ufficiale — non inviate alla classifica — mentre ogni riga dei concorrenti proviene dalla classifica pubblica alla v0.2.1. Nessun laboratorio indipendente ha ancora riprodotto nulla di tutto ciò, e i modelli hanno due giorni al momento in cui scriviamo.
• Decision Index 0.2.1 — Liquid AI d1-3B ottiene 48,57, con sottopunteggi pari a Conoscenza 23,8, Lingua 56,4, Recupero 52,8, Strumenti 74,5 e Arti 36,3. Liquid AI d1-omni-600M ottiene 15,95, con Strumenti a 15,1.
• Dove si colloca 48,57 — primo tra tutto ciò che è sotto i 10B nella tabella pubblicata dal fornitore, e davanti a Decider 35B-A3B con 47,11. È secondo nel complesso, dietro Winnow-12B con 50,02, che è quattro volte più grande.
• Benchmark testuali, riportati dal fornitore — d1-3B ha una media di 82.9 su sette benchmark pubblici, davanti all'81.1 di Decider 4B; d1-omni-600M ha una media di 78.4, che batte il 77.1 di Decider 2B con circa un quarto del numero di parametri. Il 600M registra il miglior punteggio di tossicità della tabella (Civil Comments 95.8) e il suo miglior punteggio di parafrasi (PAWS-X 79.5).
• Visione, secondo il fornitore — d1-3B registra una media di 74,1 su undici benchmark pubblici di immagini interpretati come decisioni tra le opzioni di ciascun benchmark, contro 73,9 per il suo backbone LFM2.5-VL-3B. Rimuovendo le immagini, le stesse domande scendono a 45,1, ed è così che il fornitore dimostra che le risposte provengono dai pixel.
• Latenza, misurata dal fornitore — una domanda richiede 8 ms su una RTX 4090 e 9 ms su una AMD MI325X; 16 ms su un Jetson AGX Thor, 26 ms su un Jetson AGX Orin 64 GB, 50 ms sul più piccolo Jetson Orin Nano e 30 ms su un Apple M5 Pro. Sessantaquattro stati impacchettati in un'unica passata vengono eseguiti a 475 al secondo sulla 4090.
• Cosa manca — d1-omni-600M non ha alcuna tabella di inferenza. Liquid afferma che è in fase di sviluppo attivo e semplicemente non ne riporta la latenza. Inoltre, non c'è alcun benchmark per le decisioni audio in tutta la release, perché, per usare le parole del fornitore, i benchmark dedicati alle decisioni audio sono attualmente un problema aperto.
La vera affermazione che il comunicato sta facendo
Due giorni prima che i pesi venissero pubblicati, Liquid ha pubblicato la versione hosted di questo modello e l'ha messa a confronto con GPT-6.1 Sol e Claude Opus 5.5 su sei applicazioni. Il suo riassunto: d1 eguaglia o supera GPT-6.1 Sol su quattro delle sei, costa da 19x a 200x in meno e risponde più velocemente su ogni attività. Vale la pena leggere la metodologia pubblicata prima di ripetere qualcuna di queste affermazioni: ogni applicazione è stata eseguita una volta per modello il 5 ottobre 2026, i modelli chat hanno risposto in JSON con la loro impostazione di ragionamento predefinita, e il costo di d1 è stato calcolato a $0,04 per milione di token di input.
Le demo sono la metà più persuasiva. Smistare pezzi buoni e difettosi da quattro linee di produzione — circuiti stampati, candele, anacardi, chewing gum — con una precisione dall'85 al 97%, su un modello che non è mai stato addestrato per quel compito e che lo ha capito da una breve descrizione. Un predicato SQL che risponde sì o no per ciascuno di 150 ticket di assistenza. Un ciclo di compattazione del contesto che legge l'output di ogni strumento nella sessione di un agente di programmazione e lo mantiene, lo taglia o lo scarta, rimuovendo il 52% dei token pur conservando ogni output di cui il compito ha bisogno. In Tetris, aggiungere lo schermo a un gioco completamente descrivibile a parole ha aumentato il punteggio da 70 linee completate a 81 — un risultato di visione che non puoi ottenere da un classificatore solo testuale, per quanto buono possa essere.
Quelle sono dimostrazioni gestite dai fornitori con compiti scelti dai fornitori, e la sezione sulla metodologia lo dice. Restano comunque il quadro più chiaro che chiunque abbia pubblicato di ciò a cui serve un modello decisionale.

Dove viene eseguito e quanto costa chiamarlo
I pesi aperti sono pensati per l'esecuzione locale e il fornitore ha svolto in anticipo il lavoro di integrazione: supporto a llama.cpp dal primo giorno, l'intero stack NVIDIA da DGX fino a Jetson, quantizzazione NVFP4 e una variante a 8 bit di pesi/attivazioni pubblicata insieme al checkpoint base. Le conversioni GGUF sono già su Hugging Face. Se preferisci non ospitare nulla, Liquid fornisce il d1 ospitato dalla propria API: solo token di input, nessun token di output, con le immagini fatturate come input a 1,5 token per patch da 32×32 pixel, il che rende un'immagine 1024×1024 pari a 1.536 token. L'accesso solo testo è disponibile anche tramite piattaforme di terze parti.
La nota di routing onesta: né Liquid AI d1-3B né Liquid AI d1-omni-600M sono nel nostro catalogo, e questo articolo non è una dichiarazione di disponibilità per nessuno dei due. Ciò che la coppia d1 cambia per un router è la forma della pipeline che le sta attorno. Un modello decisionale che risponde in millisecondi e non costa nulla in token di output è un filtro, non un sostituto — la selezione tra buoni e difettosi e il triage dei ticket avvengono prima della chiamata generativa, e la chiamata generativa è dove un singolo endpoint su oltre 200 modelli, prezzi di listino passati con markup 0%, e failover automatico si ripagano davvero. Livello diverso, stessa pipeline.
Cosa risolverebbe la discussione?
Tre cose sono irrisolte, e tutte e tre sono di quelle che solo il tempo può chiudere.
Il primo è la riproduzione indipendente. I numeri del Decision Index sono stati prodotti dal fornitore con lo scorer ufficiale e ogni riga dei concorrenti è stata presa da una classifica pubblica, il che è un metodo difendibile e non equivale a far eseguire il tuo modello a una terza parte. Il secondo è l'audio. Un checkpoint da 600M che instrada un comando vocale in un singolo forward pass è una capacità genuinamente nuova, e non esiste alcun benchmark che misuri se lo fa bene. Il terzo è la categoria stessa: quando la risposta viene letta da una distribuzione anziché scritta, le solite modalità di fallimento di un modello piccolo — looping, drifting, rifiuto, allucinazione di un formato — semplicemente non possono verificarsi, e nessuno ha pubblicato una buona trattazione di ciò che le sostituisce. L'errore di calibrazione è il candidato ovvio, ed è esattamente ciò che il campo di confidenza su ogni risposta ti invita a misurare da solo.
Dieci demo eseguono Liquid AI d1-3B in un ciclo su input live dalla telecamera in uno spazio pubblico di Hugging Face, che è il modo più economico per formarti una tua opinione. I pesi sono gratuiti e le domande sono specifiche. È una posizione di partenza migliore di quella offerta dalla maggior parte dei rilasci di quest'anno.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
