
Liquid AI d1-omni-600M vs Liquid AI d1-3B: quale metà della famiglia d1 ti serve davvero?
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Liquid AI d1-omni-600M e Liquid AI d1-3B sono stati caricati su Hugging Face a distanza di otto ore l'uno dall'altro il 5 ottobre 2026 e rilasciati insieme nello stesso annuncio del 7 ottobre, il che rende la solita domanda — quale è più recente, quale è migliore — quella sbagliata. Sono i due estremi di un compromesso deliberato. Liquid AI d1-3B è il prodotto finito: 3,12 miliardi di parametri, un 48,57 sul Decision Index 0.2.1 valutato dal fornitore, tabelle di benchmark, latenza misurata fino a un Jetson Orin Nano, e un posto descritto nel post di rilascio come la più alta qualità decisionale alla sua dimensione. Liquid AI d1-omni-600M è l'esperimento: 587 milioni di parametri, un 15,95 sullo stesso indice, input audio che il 3B non ha, e una model card che dichiara apertamente che si tratta di un rilascio di ricerca preliminare senza numeri di inferenza perché è ancora in fase di sviluppo attivo. Scegliere tra i due non è una decisione di qualità. È una decisione su se hai bisogno delle modalità extra in fondo alla famiglia o della precisione extra in cima, e i numeri si allineano dietro questa divisione invece di offuscarla.
Tutto ciò che segue proviene dalle due schede dei modelli e dal post di rilascio del 7 ottobre, rispettando l'etichettatura dello stesso post di rilascio: le righe d1 del Decision Index sono state valutate da Liquid AI con lo scorer ufficiale anziché essere inviate alla classifica pubblica, e nulla di quanto qui riportato è stato riprodotto in modo indipendente.
Due backbone che non sarebbero mai confluiti
La famiglia d1 non ha ridimensionato una singola ricetta. I due checkpoint partono da estremità opposte del catalogo di modelli di Liquid e si incontrano nel mezzo.
Liquid AI d1-3B si basa su LFM2.5-VL-3B, il modello visione-linguaggio decoder-only del fornitore risalente ad agosto 2026. La sua base è stata creata mediando i pesi di LFM2.5-2.6B con il backbone testuale di LFM2.5-VL-3B, per poi mettere a punto i checkpoint con seed casuali e miscele di dati diversi prima di unirli nuovamente. Dispone di un encoder visivo SigLIP2 NaFlex shape-optimized da 400M, un contesto di 32.768 token, un vocabolario di 128.000 token e sedici lingue documentate.
Liquid AI d1-omni-600M arriva dalla direzione opposta. Il suo trunk è LFM2.5-Encoder-350M, un encoder bidirezionale, messo a punto prima su task decisionali e poi esteso per fasi — un encoder FastConformer a 17 layer più un adapter per l'audio, con l'encoder audio successivamente messo a punto rispetto a un backbone testuale congelato, poi una torre SigLIP2 ripresa da LFM2.5-VL-450M con un adapter e aggiornamenti LoRA al backbone per la visione. Il modello finale è stato unito a partire dagli aggiornamenti LoRA e mediato con il checkpoint precedente. Si arriva a 587M parametri in totale: un trunk condiviso e una testa decisionale da 381M, un encoder visivo da 94M e un encoder audio da 112M.
Il confronto tra decoder-only e bidirezionale è l'aspetto da tenere a mente. Il modello da 3B legge uno stato e produce una decisione nello stesso modo in cui un modello linguistico produce una sequenza di token, una direzione alla volta. Il modello da 600M legge l'intero stato in una volta e decide, cosa che ci si aspetterebbe da un encoder che non è mai stato progettato per generare. Entrambi sono addestrati a riportare risposte dalla distribuzione del modello con zero token di output, ma il meccanismo sottostante non è della stessa classe di modello, e il divario di accuratezza qui sotto è il costo visibile del progetto più piccolo e a forma di encoder.
Lo spread del Decision Index è ampio, e i sottopunteggi sono più interessanti del totale
Sul Decision Index 0.2.1, Liquid riporta 48,57 per Liquid AI d1-3B e 15,95 per Liquid AI d1-omni-600M, contro 50,02 per Winnow-12B. Si tratta di un divario di 32 punti tra due checkpoint rilasciati lo stesso giorno dallo stesso laboratorio, e la lettura dei cinque punteggi parziali spiega da dove deriva.
• Conoscenza — 23,8 per Liquid AI d1-3B contro 8,3 per Liquid AI d1-omni-600M
• Lingua — 56,4 contro 12,9
• Recupero — 52,8 rispetto a 35,0
• Strumenti — 74,5 contro 15,1
• Arti — 36,3 contro 6,8
Il recupero è l'unico ambito in cui il modello piccolo mantiene la sua posizione, perdendo meno di un terzo del punteggio del 3B, mentre nelle altre quattro categorie perde dal 60 all'80 percento. Questo schema è coerente con ciò che è il 600M: un encoder addestrato con una reale capacità rappresentazionale di far corrispondere uno stato a un contenuto, e molta meno della capacità stratificata che il 3B eredita da un decoder che è stato preaddestrato su una quantità di linguaggio molto maggiore. Se il tuo carico di lavoro è una decisione di tipo recupero — questo passaggio risponde a questa domanda, quale di questi documenti è rilevante — il profilo del 600M è meno negativo di quanto suggerisca il suo totale. Se il tuo carico di lavoro è una decisione di instradamento degli strumenti, il divario di 51 punti in quella colonna è il numero da fissare.
La tabella dei benchmark testuali racconta una storia più blanda rispetto all'indice, cosa che vale la pena sapere prima che uno dei due numeri venga usato per sostenere una tesi. Su sette benchmark pubblici il 3B è in vantaggio con una media di 82.9 e il 600M raggiunge 78.4. Il 600M perde effettivamente di stretta misura su SQuAD 2.0 (74.0 contro 85.3), PubMedQA (61.3 contro 66.0), BoolQ (77.7 contro 86.7) e XNLI (74.7 contro 85.0), ma vince sul rilevamento di tossicità di Civil Comments (95.8 contro 93.0) e sull'identificazione di parafrasi di PAWS-X (79.5 contro 76.9). L'inquadramento dello stesso Liquid è che il 600M batte la media di 77.1 del Decider 2B con un quarto dei parametri. Due suite di benchmark, due verdetti apparentemente diversi, entrambi dichiarati dal fornitore: questo è ciò che le prove supportano e nulla di più.

Cosa ha il 600M che il 3B non ha
Il motivo per tollerare un divario di 32 punti nell'indice è che Liquid AI d1-omni-600M fa una cosa che Liquid AI d1-3B non può fare, e non è una differenza di fedeltà.
• Audio — Liquid AI d1-omni-600M accetta fino a 30 secondi di parlato per richiesta tramite il suo encoder FastConformer; Liquid AI d1-3B non ne accetta nessuno
• Miscelazione di modalità — il 600M accetta testo con immagini o testo con audio e genera un ValueError se entrambi arrivano insieme; il 3B accetta testo e immagini
• Finestra di contesto — 16.384 token tra le posizioni di testo, immagine e audio per il 600M, con il testo ridotto a 896 token quando sono presenti immagini; 32.768 token per il 3B
• Vocabolario — 65.536 per il 600M, 128.000 per il 3B
• Precisione — la scheda 600M consiglia float16 su GPU e avverte che bfloat16 ha cambiato la risposta principale su alcune righe; il 3B viene fornito con 15 quantizzazioni, inclusa una build w8a8
• Lingue — il 600M elenca 16 lingue in un set diverso rispetto alle 16 del 3B, e il suo audio è descritto come addestrato su scambi tra un parlante inglese e un assistente, il che rappresenta una fetta ristretta di ciò che contiene un feed audio di produzione.
La nota sull'addestramento audio è facile da trascurare, e non dovrebbe esserlo. Un modello addestrato su scambi in inglese tra parlante e assistente ha visto un'unica geometria dei parlanti, un'unica struttura dei turni e un'unica distribuzione degli accenti. Implementarlo su audio di call centre o registrazioni sul campo significa aspettarsi comportamenti che la scheda non dichiara, e il post di rilascio ammette candidamente che non esiste alcun benchmark sulle decisioni audio con cui verificarlo — Liquid lo definisce «un problema attualmente aperto» e invita la comunità a crearne uno.

Latenza: un sibling ha le tabelle, l'altro ha una nota a piè di pagina
Per i modelli decisionali il numero interessante è la latenza end-to-end, perché non c'è alcuna decodifica da cronometrare. Liquid pubblica un set completo per il 3B e nessuno per il 600M.
• Una domanda — 8 ms su una RTX 4090, 9 ms su una MI325X, 16 ms su una Jetson AGX Thor, 26 ms su una Jetson AGX Orin 64 GB, 50 ms su una Orin Nano, 30 ms su un Apple M5 Pro
• Tre domande su un unico stato — 21 ms su RTX 4090 e 20 ms su AGX Thor, circa 1,3 volte il costo di una singola domanda anziché 3 volte
• Uno stato da 3,4K token — 102 ms sulla 4090, 220 ms sul Thor, 1.640 ms sull'Orin Nano
• Throughput in modalità packed — 475 decisioni al secondo su RTX 4090, 1.106 al secondo su MI325X
• Un'immagine da 384px — 17 ms sulla 4090, 18 ms sulla MI325X
Quelle cifre descrivono solo Liquid AI d1-3B. Per Liquid AI d1-omni-600M la scheda del modello dichiara che i numeri di inferenza non vengono riportati perché il modello è un rilascio di ricerca preliminare in fase di sviluppo attivo. Non è che il modello piccolo sia più lento — è quasi certo il contrario, dato che avere un quinto dei parametri non lo rende più lento a parità di precisione — è che non esiste alcun dato, e citare i millisecondi del 3B per il 600M sarebbe un'invenzione dall'aspetto plausibile. Ciò che si può dire senza inventare nulla è che, alla precisione float16 raccomandata dalla scheda, 587M parametri corrispondono nell'ordine di 1,2 GB di pesi prima delle attivazioni, il che è aritmetica su un conteggio di parametri pubblicato, non una misurazione.
Il cascade è la vera risposta per la maggior parte dei carichi di lavoro
Poiché entrambi i checkpoint sono stati rilasciati insieme e restituiscono lo stesso tipo di oggetto — una probabilità, un'etichetta con una confidenza o un punteggio ordinato — si compongono in un modo che due modelli arbitrari non fanno. Il 600M può fare da filtro e il 3B può decidere. Assegna un punteggio agli elementi in arrivo con Liquid AI d1-omni-600M e porta in escalation quelli che colloca vicino al centro della sua scala a Liquid AI d1-3B per una valutazione più precisa. Le regole di escalation sono la confidenza e la distribuzione che il 600M già restituisce, quindi la logica di instradamento non necessita di un modello aggiuntivo. Su un carico di lavoro con una forte maggioranza di elementi facili, la maggior parte del traffico non raggiunge mai il 3B e la maggior parte del denaro non viene mai speso.
Quel pattern è anche il motivo per cui vale la pena eseguire i due modelli dietro un router. Tramite OrcaRouter entrambi starebbero dietro un'unica chiave API al prezzo di listino di ciascun provider, passato con 0% di markup, così la cascata è una regola di routing anziché una seconda integrazione, e un'escalation che fallisce a livello di provider viene ritentata su un fallback invece di far fallire la richiesta. Il failover automatico qui conta più di quanto conti per un modello consolidato, perché metà di questa coppia è un checkpoint il cui comportamento è descritto dal fornitore stesso come in fase di sviluppo attivo.
Niente di tutto ciò costituisce una dichiarazione di disponibilità, e la distinzione merita di essere fatta chiaramente: i checkpoint aperti d1 non sono nel nostro catalogo. La via del fornitore consiste nello scaricare i pesi ed eseguirli localmente — il supporto per llama.cpp è arrivato dal primo giorno su hardware Apple, AMD, Qualcomm e NVIDIA — oppure raggiungerli tramite l'API proprietaria del fornitore e piattaforme di terze parti.
Scegliere, in un'unica passata
Se hai bisogno di testo e immagini, e la risposta deve essere corretta, scegli Liquid AI d1-3B. Ha i benchmark, le tabelle di latenza, il contesto più ampio, il vocabolario più ampio e le quantizzazioni, ed è il membro della coppia che Liquid posiziona come leader di qualità nella sua fascia di dimensione.
Se ti serve il parlato nel percorso decisionale, scegli Liquid AI d1-omni-600M, perché è l'unica opzione open-weight di questa famiglia che accetti l'audio, e metti in conto che lo stai adottando su sensazioni e una demo finché qualcuno non pubblica un benchmark decisionale sull'audio o lo split vision non divulgato.
Se non sai ancora quale di quelli descrive il tuo carico di lavoro, inizia con il 3B e monitora la confidenza che restituisce. I sotto-punteggi sono il segnale rivelatore: un compito che vive nelle colonne Tools o Language verrà servito male dal 600M, mentre qualcosa di tipo retrieval è l'unico caso in cui il piccolo checkpoint è più vicino di quanto il suo totale lasci intendere. La famiglia esiste per permetterti di barattare accuratezza con footprint, e lo scambio è sicuro solo se sai quale colonna occupa il tuo compito.

Tramite OrcaRouter entrambi i modelli stanno dietro un'unica chiave API, con una regola di routing anziché una seconda integrazione e un'escalation che fallisce a livello di provider viene ritentata su un fallback invece di far fallire la richiesta.
