
Liquid AI d1-3B vs LFM2.5-2.6B-Base: Il modello decisionale e il suo stesso antenato
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Questo non è un incontro tra due rivali. Liquid AI d1-3B, il modello decisionale open-weight che Liquid AI ha pubblicato il 7 ottobre 2026, è stato costruito su una base che il fornitore ha creato facendo la media dei pesi di LFM2.5-2.6B con il backbone testuale di LFM2.5-VL-3B. LFM2.5-2.6B-Base è quel primo genitore — il checkpoint pre-addestrato grezzo che Liquid ha caricato il 1° agosto 2026, 2,69 miliardi di parametri, 34 trilioni di token di addestramento, contesto di 131.072 token, nessun tuning su istruzioni e nessun template di chat. Quindi l'inquadramento onesto di questo confronto è discendente contro antenato: un modello che è stato post-addestrato per un compito molto specifico, posto accanto al substrato non modellato da cui è stato plasmato. Uno dei due stasera risponde alle domande. L'altro è il punto di partenza se la domanda a cui ti serve una risposta non è una che nessuno ha ancora posto.
Cosa sia in realtà ognuno
Le due model card si leggono come documenti provenienti da fasi diverse di una linea di produzione, e le differenze non sono di natura stilistica.
Liquid AI d1-3B ha 3,12 miliardi di parametri, un encoder visivo SigLIP2 NaFlex da 400 M, una finestra di contesto di 32.768 token, un vocabolario di 128.000 token e sedici lingue documentate. È un modello decisionale: gli si fornisce uno stato e domande con nome, e restituisce una probabilità sì/no, un'etichetta scelta con confidenza e una distribuzione completa delle opzioni, oppure un punteggio ordinato — in un solo passaggio in avanti, senza generare token di output. Fornisce una system_one chiamata per uno stato con diverse domande, una variante in batch che raggruppa molte richieste senza padding, e un accessor grezzo alle probabilità delle distribuzioni sottostanti. Non è un modello di chat e non scrive testo, e la scheda lo dice proprio con queste parole.
LFM2.5-2.6B-Base porta 2,69 miliardi di parametri in 30 strati — 22 blocchi di convoluzione corta a doppio gating e 8 blocchi di attenzione con query raggruppate — addestrato su 34 trilioni di token ed esteso a un contesto di 131.072 token durante l'addestramento intermedio, con lo stesso vocabolario di 128.000 token e le stesse sedici lingue. È un checkpoint pre-addestrato solo testo, senza instruction tuning, senza benchmark sulla sua scheda e con una raccomandazione che suona come un avvertimento: usatelo solo per attività che richiedono un fine-tuning intenso. Completa il testo. Non segue le istruzioni.
Entrambi sono download liberamente accessibili con la licenza aperta propria di Liquid. Entrambi privilegiano il testo. Nessuno dei due è presente nel nostro catalogo, e nulla di quanto qui contenuto costituisce una dichiarazione di disponibilità per alcuno dei due.

Il lignaggio è la parte interessante
Liquid non ha eseguito il fine-tuning di un modello nuovo per realizzare la release d1. Ha fatto la media di due checkpoint — LFM2.5-2.6B e la torre di testo di LFM2.5-VL-3B — per ottenere un punto di partenza migliore, poi ha eseguito il fine-tuning di diverse run con seed casuali e miscele di dati differenti e le ha fuse di nuovo insieme. Il resoconto del fornitore su ciò che ha migliorato il risultato è sorprendentemente privo di tecniche esotiche: l'addestramento su input lunghi, il rimescolamento dell'ordine in cui compaiono le opzioni di risposta e la rimozione di scorciatoie dai dati di addestramento hanno fatto più di qualsiasi metodo avanzato abbiano provato.
Quel dettaglio della rimozione delle scorciatoie merita una pausa, perché dà un nome al fallimento che questa categoria esiste per evitare. Un modello addestrato a rispondere a domande a scelta multipla imparerà volentieri che l'opzione B di solito è quella giusta, o che l'opzione più lunga vince. Mescolare l'ordine delle opzioni durante l'addestramento è ciò che lo impedisce. Un modello decisionale che ha imparato un prior di posizione invece di leggere lo stato è peggio che inutile — sbaglia con sicurezza su larga scala — ed è la cosa specifica che separa un vero modello decisionale da un classificatore con un prompt.
C'è anche una regressione che vale la pena nominare apertamente, perché il fornitore non lo fa: il checkpoint di base ha una finestra di contesto di 131.072 token, mentre Liquid AI d1-3B ne ha 32.768. Il post-training verso un modello decisionale è costato tre quarti del contesto utilizzabile. Se immaginavate che il discendente dominasse rigorosamente il suo antenato su ogni asse, non è così, e le decisioni su documenti lunghi sono l'asse su cui il checkpoint più vecchio ha più spazio — in linea di principio, anche se non ha una testa decisionale con cui usarlo.
Il tabellone, con l'asimmetria allegata
Confrontare questi due sui benchmark è un errore di categoria, ma è un errore di categoria dalla forma informativa, quindi eccolo qui con le avvertenze già espresse. Ogni valore di d1-3B è di Liquid, valutato dal fornitore con lo scorer ufficiale anziché essere inviato a una classifica pubblica, e non riprodotto da terzi. Ogni valore di LFM2.5-2.6B-Base è assente perché un modello base non ha nulla da misurare.
• Decision Index 0.2.1 — Liquid AI d1-3B 48,57, primo tra tutto ciò che è sotto i 10B nella tabella del fornitore e davanti a un modello decisionale dodici volte più grande. LFM2.5-2.6B-Base — non valutato, non valutabile senza una testa decisionale.
• Benchmark di testo — Liquid AI d1-3B ha una media di 82,9 su sette benchmark pubblici che coprono comprensione, tossicità, intento, QA medica e comprensione cross-linguale. LFM2.5-2.6B-Base non pubblica alcuna tabella di benchmark.
• Visione — Liquid AI d1-3B ha una media di 74,1 su undici benchmark di immagini interpretati come decisioni; rimuovendo le immagini, le stesse domande scendono a 45,1. LFM2.5-2.6B-Base è solo testo, senza torre di visione.
• Parametri — 3,12B contro 2,69B. Il modello decisionale è il più grande dei due, il che è l'opposto della consueta narrazione post-addestramento.
• Contesto — 32.768 token contro 131.072. L'antenato vince questa riga ed è l'unica riga che vince.
• Latenza — Liquid AI d1-3B risponde a una singola domanda in 8 ms su una RTX 4090 e in 50 ms su una Jetson Orin Nano, ed esegue 64 stati packed a 475 al secondo sulla 4090. LFM2.5-2.6B-Base non ha alcuna latenza da citare finché non lo si sottopone a fine-tuning trasformandolo in qualcosa che risponda a una domanda, e a quel punto il numero è quello del proprio fine-tuning.

Tra cosa stai scegliendo, in pratica
La regola decisionale è insolitamente netta, perché i due checkpoint competono per la stessa linea.
Scegli Liquid AI d1-3B quando la domanda esiste già ed è una delle tre forme che un modello decisionale gestisce: un sì o no, una scelta da un insieme definito, o una valutazione su una scala ordinata. Le applicazioni pubblicate sono tutte attività produttive riconoscibili — triage e instradamento, moderazione, classificazione di intenti e argomenti, controlli di estrazione, reranking, guardrail degli agenti e ispezione visiva. I numeri della demo che il fornitore ha eseguito il 5 ottobre mettono d1 contro GPT-6.1 Sol e Claude Opus 5.5 su sei di queste attività e sostengono che eguagli o superi GPT-6.1 Sol su quattro, costando da 19x a 200x in meno; la pagina della metodologia afferma chiaramente che ogni applicazione è stata eseguita una volta per modello, quindi considera la forma dell'affermazione come il risultato, non le cifre decimali. Quella davvero sorprendente è la demo di ispezione: smistamento tra buoni e difettosi su quattro linee di produzione con un'accuratezza dall'85 al 97% su un compito per cui il modello non è mai stato addestrato, compreso da una breve descrizione.
Scegli LFM2.5-2.6B-Base quando la domanda non esiste ancora. È il punto di partenza più economico per un fine-tune che intendi possedere — una testa decisionale di dominio, un classificatore su misura, un task per cui nessuno ha un checkpoint. Eredi l'architettura, il tokenizer e il contesto lungo, e paghi in potenza di calcolo, dati e valutazione. Due delle quattro applicazioni che il fornitore ha costruito attorno a d1 sono partite da progetti open source anziché da zero, il che è un quadro fedele di ciò che un checkpoint base più disciplina produce effettivamente.
La trappola pratica è trattare il checkpoint base come un sostituto pronto all'uso. Non è un assistente, non seguirà un prompt e, valutato come modello di chat, ottiene un punteggio vicino allo zero — il che non è un fatto sulla sua qualità, è un fatto su cosa significhi "base".
Self-hosting di uno dei due, e il livello superiore
Entrambi arrivano come pesi, e il fornitore ha svolto il lavoro di deployment per il lato d1: supporto llama.cpp dal primo giorno, l'intero stack NVIDIA da DGX fino a Jetson, quantizzazione NVFP4, una variante a 8 bit di pesi e attivazioni e conversioni GGUF su Hugging Face. Il checkpoint di base ha varianti GGUF, ONNX e MLX proprie attraverso la più ampia famiglia LFM2.5. Se preferisci non ospitare nulla, Liquid fornisce l'accesso ospitato a d1 dalla propria API con prezzo basato solo sui token di input, con immagini fatturate a 1,5 token per patch da 32×32 pixel; l'accesso solo testo è disponibile anche tramite piattaforme di terze parti.
Ciò che nessuno dei due percorsi cambia è il resto dello stack. Un modello che ospiti è un modello che devi tenere in vita, versionare e di cui devi gestire il failover — e le decisioni che alimenta finiscono comunque accanto alle chiamate generative che non ospiti. Quel mix è lo strato che un router fa collassare: un unico endpoint su oltre 200 modelli, prezzi di listino dei provider passati a markup 0% così una variazione di prezzo di un fornitore è attiva dalla tua parte lo stesso giorno, e failover automatico così un pomeriggio storto di un upstream non diventa la tua interruzione di servizio. Ospitare in autonomia un modello decisionale da 3B accanto a tutto questo rende la questione del routing più netta, non più morbida, perché ora possiedi metà della pipeline e noleggi l'altra metà.
Quale, per chi
Se la domanda a cui devi rispondere questa settimana è una delle tre forme che può assumere un modello decisionale, ed è una domanda che qualcun altro ha già immaginato, il discendente è completo e gratuito e gira in 50 ms su un dispositivo senza GPU — prendi Liquid AI d1-3B e il gioco è fatto.
Se stai costruendo la cosa che risponde a una domanda che nessuno ha ancora posto, e hai i dati e la potenza di calcolo per dominare quel campo, LFM2.5-2.6B-Base è il punto di partenza onesto, e vale la pena sapere che il discendente descritto in questo articolo è stato creato a partire da esso esattamente attraverso il percorso che stai per intraprendere.
E se non sei sicuro di quale delle due situazioni ti trovi, la risposta è quasi sempre la prima. Il post-training su una testa decisionale è la mossa costosa; eseguirne una di qualcun altro è gratis.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
