Una card con titolo in evidenza intitolata "Uno decide, uno descrive" con il sottotitolo "Liquid AI d1-omni-600M vs LFM2.5-VL-3B - pesi aperti, ottobre 2026", e due card: Liquid AI d1-omni-600M con 587M parametri che restituisce un'etichetta o un punteggio con 0 token di output, contro LFM2.5-VL-3B con 3,1B parametri che scrive testo e legge immagini per restituire prosa.
Guides & Insights

Liquid AI d1-omni-600M vs LFM2.5-VL-3B: uno decide, l'altro descrive

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Liquid AI d1-omni-600M e LFM2.5-VL-3B sono entrambi piccoli, entrambi multimodali, entrambi pubblicati dallo stesso laboratorio su Hugging Face con la stessa licenza lfm1.0 — e accoppiarli è un errore di categoria che si rivela utile. LFM2.5-VL-3B è arrivato il 12 agosto 2026 come modello visione-linguaggio per l'edge di Liquid AI: 3,1 miliardi di parametri, una finestra di 32.768 token e un output in prosa. Dagli una pagina scansionata e restituisce la trascrizione, con il layout, sotto forma di testo. Liquid AI d1-omni-600M è stato caricato il 7 ottobre 2026 con il resto della famiglia d1 open, e fa l'opposto con gli stessi input. È un modello decisionale da 587 milioni di parametri: colleghi domande con nome a uno stato e questo riporta ciò che già crede — P(yes), un'etichetta scelta con una confidenza, una posizione su una scala ordinata da due a dieci — in un singolo forward pass, con zero token di output e nulla a valle da analizzare. Se hai cercato «il piccolo modello Liquid multimodale», ora hai davanti a te due forme, e la forma è la decisione.

Questa pagina è ciò che le due model card, il post di rilascio del 7 ottobre e i repository stessi stabiliscono effettivamente. È anche esplicita su dove si fermano. Nulla in questo confronto è stato riprodotto al di fuori di Liquid AI, e per uno dei due modelli il fornitore non ha pubblicato alcun benchmark di accuratezza specifico per la propria capacità di punta.

I due checkpoint, fianco a fianco

Le schede tecniche divergono su quasi ogni asse, cosa che ci si aspetterebbe da due modelli che non erano mai stati pensati per competere per lo stesso posto.

• Che cos'è — LFM2.5-VL-3B è un modello generativo visione-linguaggio che scrive testo; Liquid AI d1-omni-600M è un modello decisionale che restituisce risposte strutturate e non emette token

• Parametri — 3,1B in BF16 per LFM2.5-VL-3B contro 587M per Liquid AI d1-omni-600M, a sua volta costituito da un tronco condiviso e da una testa decisionale da 381M, oltre a un encoder visivo da 94M e a un encoder audio da 112M

• Backbone — LFM2.5-VL-3B abbina un modello linguistico LFM2.5-2.6B a un encoder visivo SigLIP2 NaFlex ottimizzato per la forma da 400M; Liquid AI d1-omni-600M è addestrato da LFM2.5-Encoder-350M, un encoder bidirezionale, con una torre SigLIP2 presa da LFM2.5-VL-450M e un FastConformer a 17 livelli per l'audio

• Input — testo e immagini per LFM2.5-VL-3B; testo più immagini o testo più fino a 30 secondi di parlato per Liquid AI d1-omni-600M, che solleva un ValueError se immagini e audio arrivano nella stessa richiesta

• Contesto — 32.768 token per LFM2.5-VL-3B rispetto a 16.384 posizioni combinate di testo, immagine e audio per Liquid AI d1-omni-600M, la cui scheda aggiunge che, in presenza di immagini, il testo dello stato e della domanda viene ridotto a 896 token per corrispondere all'addestramento

• Vocabolario — 128.000 token per LFM2.5-VL-3B, 65.536 per Liquid AI d1-omni-600M

• Runtime — LFM2.5-VL-3B viene eseguito in transformers e vLLM e ha un modello draft DSpark separato per la decodifica speculativa; Liquid AI d1-omni-600M viene distribuito con codice personalizzato, richiede trust_remote_code=True, e la sua scheda raccomanda float16 su GPU avvertendo che bfloat16 ha cambiato la risposta principale su alcune righe

• Licenza — lfm1.0 per entrambi, che consente il fine-tuning e la distribuzione

Una riga di quell'elenco sta facendo più lavoro delle altre. Liquid AI d1-omni-600M è costruito su un encoder bidirezionale anziché su un decoder. Non è una riduzione di dimensioni di LFM2.5-VL-3B; è una discendenza diversa, ed è la ragione architetturale per cui i due modelli non possono essere scambiati l'uno con l'altro, indipendentemente da come si leggano le tabelle dei benchmark.

Il contratto di output decide più di quanto facciano i benchmark

Fai una domanda a LFM2.5-VL-3B su un'immagine e ricevi indietro del linguaggio. Questo ha valore economico quando la risposta deve essere letta da una persona, registrata come stringa o fornita a un passaggio che si aspetta testo in prosa. È anche una criticità che devi gestire a livello ingegneristico: l'output generato può divagare, una richiesta in formato JSON può tornare con una struttura diversa da quella richiesta, e ogni token viene fatturato e comporta un'attesa. Il modello è esplicitamente pensato per attività di visione a turno singolo, ad alto throughput e bassa latenza — OCR in batch di documenti scansionati, rilevamento in tempo reale in un veicolo, traduzione di segnaletica sul dispositivo — ed è esplicitamente tenuto lontano da domande con contesto lungo e ad alto carico di ragionamento, come "cosa c'è che non va in questo progetto tecnico".

Liquid AI d1-omni-600M risponde a una domanda strettamente più ristretta entro un perimetro strettamente più affidabile. La sua interfaccia è uno stato — testo, JSON, una o più immagini oppure fino a 30 secondi di parlato — più un insieme di domande denominate, ciascuna delle quali dichiara il proprio tipo. Una domanda noul richiede un sì/no e restituisce P(yes) tra 0 e 1. Una domanda choice sceglie un'etichetta da un insieme da te indicato e restituisce l'etichetta, una confidenza e la probabilità di ciascuna opzione. Una domanda score colloca lo stato su una scala ordinata da due a dieci livelli e restituisce il livello atteso con la relativa distribuzione. Più domande possono essere collegate a un unico stato e vengono lette in una sola passata, perciò il contatore di utilizzo della scheda del modello riporta output_tokens: 0. Non c'è alcuna fase di generazione, il che significa che non esiste un output che fallisca il parsing.

Ciò a cui rinunci è tutto ciò che una risposta generata porta con sé e che un'etichetta non ha: il ragionamento, la cautela, la frase che puoi incollare in un ticket, la possibilità di porre una domanda di follow-up nella stessa conversazione. Liquid lo dice chiaramente — il modello non è un modello di chat e non scrive testo. Se la tua pipeline ha bisogno di una spiegazione accanto al verdetto, Liquid AI d1-omni-600M è la metà sbagliata della coppia, e la risposta onesta è eseguirli entrambi: LFM2.5-VL-3B per produrre la lettura dell'immagine, Liquid AI d1-omni-600M per produrre la decisione al riguardo.

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

Non esiste un dato di visione da confronto diretto, e questo è il risultato.

Il passo successivo istintivo è allineare i benchmark di visione. Non si può. Su LFM2.5-VL-3B il fornitore pubblica un set completo — RefCOCO Macro Precision@1 a 87,9, ScreenSpot-v2 a 80,7, ChartQA a 81,3, POPE a 88,7, MMStar a 63,3, BLINK a 61,5, MuirBench a 58,3, ToolSandBox a 59,5, OCRBench v2 English a 47,5 e un RealWorldQA di 73,1 che supera di poco il 71,1 del precedente LFM2-VL-3B. Tutti questi sono dichiarati dal fornitore, nessuno è stato rieseguito in modo indipendente, e ciò nonostante sono affermazioni specifiche su capacità specifiche su cui un lettore può chiedere conto al laboratorio.

Per Liquid AI d1-omni-600M, il post di rilascio afferma che il Decision Index v0.3 include una split vision privata "su cui non riportiamo dati in questa release", e che invece Liquid ha validato che il checkpoint 600M "gestisce tutte e tre le modalità", con le prove collocate nelle demo del playground. Questo è tutto il resoconto pubblicato sulla visione. Non c'è alcun numero di benchmark per immagini per questo checkpoint, né nella sua model card né nel post di lancio. Lo stesso post conferma ciò che manca sul fronte audio in modo ancora più diretto: i benchmark dedicati alle decisioni audio sono, secondo le parole stesse del fornitore, "attualmente un problema aperto".

Quindi la lettura corretta del confronto è asimmetrica e va dichiarata come tale. LFM2.5-VL-3B ha dimostrato capacità di visione con numeri a corredo. Liquid AI d1-omni-600M ha un encoder di visione preso in prestito da un modello affine, un adapter addestrato contro un backbone congelato, una demo e una promessa. Se il tuo deployment ha bisogno che il modello sia accurato sulle immagini questo mese, il 3B è l'unico dei due ad avere qualcosa su cui reggersi.

Velocità: solo uno di questi è stato misurato

Poiché un modello decisionale non genera nulla, la latenza è il numero che conta, e anche in questo caso solo un lato è documentato. LFM2.5-VL-3B è indicato a 228 token al secondo su un Apple M5 Max e 116 token al secondo su un AMD Ryzen AI Max+ 395, entrambi entro 3,3 GB di memoria, con circa 20 token al secondo su un Galaxy S26 Ultra e all'incirca 11.000 token al secondo su una singola H100 con vLLM. Queste cifre descrivono il throughput di decodifica, che è la misura corretta per un modello che scrive.

Per Liquid AI d1-omni-600M la scheda dichiara che i valori di inferenza non vengono riportati perché il modello è una versione di ricerca preliminare e in fase di sviluppo attivo. Il fratello d1-3B della stessa famiglia ha invece tabelle di latenza: 8 ms per una domanda su una RTX 4090, 16 ms su una Jetson AGX Thor, 26 ms su una Jetson AGX Orin 64 GB, 50 ms su una Orin Nano, con tre domande su un unico stato che richiedono circa 1,3 volte il tempo di una. Quei numeri appartengono al modello decisionale 3B e non devono essere estrapolati al 600M. Per Liquid AI d1-omni-600M, la posizione onesta è che l'architettura implica un modello piccolo e veloce e nessuno al di fuori del laboratorio ha pubblicato un valore in millisecondi.

L'ingombro dei pesi può quanto meno essere stimato. Alla precisione float16 consigliata dalla scheda, 587M parametri corrispondono a circa 1,2 GB di pesi prima delle attivazioni — aritmetica basata sul conteggio pubblicato dei parametri, non su una misurazione del fornitore — contro i meno di 3,3 GB che Liquid dichiara per LFM2.5-VL-3B. Su un dispositivo in cui i megabyte sono il vincolo, quella differenza è l'argomento a favore del 600M.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Come scegliere tra loro

La scelta si risolve in modo netto una volta che il contratto di output viene considerato fisso anziché negoziabile.

Scegli LFM2.5-VL-3B quando il risultato è testo: OCR a pagina intera con annotazione del layout, grounding e rilevamento da query in linguaggio naturale, traduzione della segnaletica su un dispositivo, qualsiasi passaggio in cui un essere umano o un modello linguistico a valle utilizzi la risposta. Dispone inoltre di un contesto più ampio, pari a 32.768 token, e in pratica di una copertura linguistica più approfondita, perché le sue risposte sono linguaggio anziché etichette.

Scegli Liquid AI d1-omni-600M quando il risultato da ottenere è una decisione: instradare un ticket, fare triage di un frame, moderare una clip, controllare un guardrail, assegnare un punteggio a una risposta su una scala da due a dieci — e, cosa unica tra questi due, quando l'input è vocale. È l'unico dei due che accetti l'audio, fino a 30 secondi per richiesta, anche se la sua scheda segnala che l'audio è stato addestrato su scambi tra un parlante inglese e un assistente, il che è una descrizione ristretta del mondo da cui arriveranno le tue chiamate.

Non puntare su nessuno dei due e resta su un modello vision-language generico, se il compito richiede ragionamento sull'immagine anziché una lettura o un verdetto su di essa. Entrambe le model card sono orientate altrove rispetto a quel caso d'uso, e Liquid AI d1-omni-600M non ha alcun meccanismo per tentarlo.

Provando un{{1}} {{2}}modello{{/2}}{{/1}} sperimentale

Liquid AI d1-omni-600M è, per stessa etichetta del fornitore, una release di ricerca preliminare, e il suo comportamento in ambito visivo e audio non è stato sottoposto a benchmark. È esattamente il profilo di un modello che conviene valutare dietro un fallback anziché davanti ai clienti. OrcaRouter instrada oltre 200 modelli attraverso un'unica chiave API con failover automatico tra provider, che è il modo economico per mettere un checkpoint come questo su un percorso live: se la rotta sperimentale peggiora o un provider va giù, la richiesta finisce sul fallback senza modifiche al codice. La stessa chiave copre ogni modello a cui la pipeline passa il controllo, al prezzo di listino di ciascun provider, trasferito con 0% di markup, così un taglio di prezzo del fornitore è il tuo prezzo lo stesso giorno.

Un avvertimento, dichiarato perché è fondamentale: i modelli open d1 e la famiglia LFM2.5-VL non sono nel nostro catalogo oggi. L'auto-hosting dei pesi è la strada che il fornitore raccomanda per entrambi, con supporto llama.cpp dal primo giorno su hardware Apple, AMD, Qualcomm e NVIDIA, e eseguirli su un endpoint ospitato significa l'API del fornitore stesso o piattaforme di terze parti. Leggere questa pagina come un'affermazione di disponibilità sarebbe un errore.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Cosa guardare

La domanda interessante non è se il 600M alla fine batterà il 3B in qualcosa — non lo farà, e non è stato costruito per farlo. È se Liquid AI pubblicherà la split di visione privata che ha tenuto nascosta, e se qualcuno costruirà il benchmark decisionale audio che il laboratorio sostiene non esista ancora. Finché una di queste cose non si concretizza, un confronto tra Liquid AI d1-omni-600M e LFM2.5-VL-3B è un confronto tra un modello misurato e uno plausibile. Per il lavoro non misurato — parlato in ingresso, verdetto in uscita, abbastanza piccolo da stare sul dispositivo — il 600M è l'unico checkpoint open-weight di questa famiglia a provarci, ed essere primi senza un tabellone segnapunti è comunque essere primi.

OrcaRouter instrada oltre 200 modelli attraverso un'unica chiave API, con il prezzo di listino di ciascun provider trasferito con 0% di markup, così un taglio di prezzo del fornitore è il tuo prezzo lo stesso giorno.