Scheda titolo hero per LFM2.5-VL-3B, con titolo 'LFM2.5-VL-3B' e sottotitolo 'Il modello visione-linguaggio da 3B di Liquid AI per l'edge', un badge con scritto 'Nuovo — spedito l'11 agosto 2026', e tre icone lineari piatte (cornice, paragrafo, occhio).
Guides & Insights

LFM2.5-VL-3B: il nuovo modello visione-linguaggio da 3B di Liquid AI per l'edge

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La prima cosa da sapere su LFM2.5-VL-3B è che è stato rilasciato in due mezze tappe. I pesi sono apparsi su Hugging Face l'11 agosto 2026 — un checkpoint bf16 completo, una scheda del modello con una tabella di benchmark e un README in sedici lingue, e nessun annuncio allegato. La scheda mostrava zero download. Il giorno successivo, 12 agosto, Liquid AI ha pubblicato il comunicato ufficiale, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge," e il rilascio silenzioso è diventato un vero e proprio rilascio. Se stai leggendo questo nella stessa settimana, stai leggendo uno dei primi resoconti indipendenti di un modello che quasi nessuno al di fuori del laboratorio Liquid ha ancora eseguito — quindi ecco cosa è realmente conoscibile dalla repo, e cosa non lo è.

Cos'è LFM2.5-VL-3B

LFM2.5-VL-3B è un modello visione-linguaggio — input immagine e testo, output testo — costruito sul backbone testuale LFM2.5 di Liquid AI. Nello specifico: il modello linguistico è il LFM2.5-2.6B, abbinato a un encoder visivo SigLIP2 NaFlex 400M, per un totale di circa 3,1 miliardi di parametri. Mantiene l'architettura ibrida della famiglia, con blocchi di convoluzione gated a corto raggio intervallati da attenzione a query raggruppate, un vocabolario di 128.000 token e una finestra di contesto di 32.768 token. Supporta sedici lingue (inglese, arabo, cinese, francese, tedesco, hindi, indonesiano, italiano, giapponese, coreano, polacco, portoghese, russo, spagnolo, thai, vietnamita), è distribuito in bfloat16 e concesso in licenza secondo la licenza aperta lfm1.0 di Liquid.

Non è un modello creato da zero. La scheda tecnica lo descrive come una variante multimodale di LFM2.5 che si basa sul precedente LFM2-VL-3B con ulteriori fasi di mid-training e post-training. Questa discendenza è importante: le capacità visive sono stratificate sopra un modello di testo già pre-addestrato su circa 34 trilioni di token, quindi il lato linguistico non è un giocattolo — è lo stesso motore di famiglia usato dai modelli di testo, con un encoder visivo saldato sopra e riaddestrato per i compiti visivi.

Cosa può fare

Il report di Liquid evidenzia quattro miglioramenti rispetto al precedente LFM2-VL-3B: comprensione di schermo e interfaccia utente, chiamata di funzioni, grounding e input multi-immagine. In termini semplici, ciò significa:

• Grounding — punta agli oggetti con query in linguaggio naturale ("il segnale di stop", "la colonna dei prezzi") e ottieni una posizione normalizzata.

• Comprensione dello schermo — rispondere a domande su cosa è a schermo e dove, testato su ScreenSpot-v2.

• OCR con annotazione di layout — OCR a pagina intera che restituisce anche la struttura del documento, con 23 etichette di layout (testo, titolo, elenco, tabella, didascalia di tabella, grafico, equazione, codice, intestazioni e piè di pagina, e altro) come coordinate intere normalizzate.

• Uso degli strumenti — un flusso di chiamata di funzioni in quattro fasi che accetta definizioni di strumenti come JSON, emette chiamate in stile Python tra i token di chiamata degli strumenti e restituisce una risposta finale in testo semplice.

• Input multi-immagine — ragiona su più immagini in un unico turno.

Le indicazioni di Liquid su dove non si adatta sono insolitamente specifiche. La scheda lo consiglia per attività a turno singolo, ad alta produttività e bassa latenza — rilevamento di oggetti in tempo quasi reale nel settore automotive, OCR in batch di documenti scansionati, traduzione on-device di menu e segnali stradali — e mette esplicitamente in guardia da lavori con contesti lunghi e ragionamento intensivo, web design visuale e domande altamente tecniche su progetti.

I numeri — tutti riportati dal fornitore

Ogni figura in questa sezione proviene dalla model card e dal post del blog di Liquid AI. Nessuna di esse è stata riprodotta in modo indipendente, e finché una terza parte non esegue il checkpoint, dovresti trattarle come affermazioni, non come fatti. Questa etichetta sta facendo un lavoro reale qui, perché il record è davvero solido sulla carta:

• Grounding — precisione macro RefCOCO@1 dell'87,9, in aumento rispetto al 57,1 del precedente LFM2-VL-3B — un salto di circa trenta punti che Liquid attribuisce al post-training visivo.

• Comprensione dello schermo — media su ScreenSpot-v2 di 80.7, che Liquid segnala essere superiore al 78.5 che attribuisce a Qwen3.5-4B.

• Uso degli strumenti — ToolSandbox 59.5, più del doppio del 26.4 misurato da Liquid su LFM2-VL-3B; BFCLv4 32.5, in aumento rispetto a 20.5.

• Ragionamento visivo generale — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.

• OCR — OCRBenchv2 (sottoinsieme in inglese) 47,5, in aumento rispetto a 43,9.

• Ragionamento multimodale difficile — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — il punto debole, come previsto per un modello da 3B.

• Velocità, secondo i test del fornitore — {{1}}228 token/s su Apple M5 Max, 116 token/s su AMD Ryzen AI Max+ 395 e 20 token/s su Galaxy S26 Ultra{{/1}}, il tutto entro circa 3,3 GB di memoria. Su un H100 con vLLM, Liquid dichiara {{2}}circa 11.000 token di output al secondo ad alta concorrenza e un tempo al primo token di circa 34 ms su una clip di cinque fotogrammi{{/2}}, attribuendolo al fatto che il modello risponde direttamente invece di ragionare.

Scoreboard for LFM2.5-VL-3B with one column: Params 3.1B (2.6B LM + 400M vision), Context 32,768 tokens, Vision encoder SigLIP2 NaFlex 400M, Grounding RefCOCO 87.9, Screen understanding ScreenSpot-v2 80.7, Status no hosted endpoint yet. Footer: 'All benchmark figures vendor-reported; no independent scores yet.'

È un bel po' di affermazioni per un singolo modello da 3B, e vale la pena ribadire l'avvertenza nel piè di pagina della scheda del modello stesso: questi sono i numeri di Liquid. Il divario tra "ottimi punteggi in una valutazione di laboratorio" e "regge sui tuoi dati" è esattamente il punto in cui un modello così nuovo di solito inciampa.

Ciò che non è ancora noto

La lista onesta delle domande aperte:

• Nessun benchmark indipendente — al momento in cui scriviamo, LFM2.5-VL-3B non compare in nessuna classifica di terze parti. Ogni punteggio sopra riportato è dichiarato dal fornitore.

• Nessun endpoint ospitato — nessun provider di inferenza lo serve ancora. Questa è una storia di self-hosting, punto.

• Nessun dato di utilizzo — zero download nel primo giorno significa nessun feedback dalla community, nessun fine-tuning, nessun "l'ho provato su X e si è rotto su Y." I primi report dal mondo reale devono ancora arrivare.

• Una funzionalità sperimentale — l'output delle annotazioni di layout è contrassegnato da Liquid stesso come "sperimentale" e "potrebbe cambiare, potrebbe essere inaffidabile e potrebbe non essere banale da analizzare". Non costruire ancora il tuo parser basandoti su di esso.

• Copertura di terze parti limitata — la stampa della prima settimana è per lo più brevi rassegne di notizie. Nessuno ha fatto un test indipendente approfondito.

Screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B, showing Image-Text-to-Text, license lfm1.0, 16 languages, 'This model isn't deployed by any Inference Provider', and 228 tok/s on Apple M5 Max / 116 tok/s on AMD Ryzen AI Max+ 395 in under 3.3 GB of memory.

Tutto ciò non significa che il modello sia scarso. Significa che non è comprovato, nello stesso modo in cui qualsiasi modello non è comprovato nei giorni successivi al rilascio.

Come eseguirlo da soli

Per un modello così giovane, la storia dell'ecosistema è insolitamente buona. Le varianti di formato sono arrivate lo stesso giorno dei pesi: GGUF per llama.cpp, ONNX e cinque quantizzazioni MLX per Apple Silicon, insieme al checkpoint nativo bf16 per Transformers, vLLM e SGLang. Liquid elenca il supporto dal primo giorno su llama.cpp, MLX, vLLM, SGLang e ONNX, più una demo browser WebGPU. I parametri di campionamento consigliati sono temperatura 0.2, top_k 50, penalità di ripetizione 1.0, con la gestione della visione affidata alla configurazione del processore del modello. Se vuoi provarlo stasera su un laptop, le build MLX o GGUF sono la via più breve.

Cosa guardare

Due cose determinano se LFM2.5-VL-3B conta al di là del ciclo dell'hype. Primo, se i punteggi di grounding e comprensione dello schermo sopravvivono alla replicazione indipendente — {{1}}80.7 su ScreenSpot-v2 e 87.9 su RefCOCO sono le due affermazioni che vale maggiormente la pena verificare, perché sono quelle che lo renderebbero un modello edge davvero dirompente{{/1}}. Secondo, se appare un endpoint ospitato, perché {{2}}questo cambia i calcoli da "progetto self-host interessante" a "distribuibile oggi".{{/2}} Ed è proprio allora che un livello di routing giustifica la sua esistenza: {{3}}un'API su oltre 200 modelli significa che il giorno in cui Liquid o un provider attiva un endpoint, aggiungi LFM2.5-VL-3B accanto ai modelli che già chiami senza modificare la tua integrazione, al prezzo di listino del provider senza alcun ricarico, e il failover automatico ti consente di indirizzare traffico reale verso di esso mentre un modello collaudato copre le chiamate che sbaglia.{{/3}} Fino ad allora {{4}}è una promettente storia di self-hosting — e per un modello di una settimana, è già più di quanto ottenga la maggior parte dei modelli rilasciati.{{/4}}

Screenshot of Liquid AI's announcement blog post 'LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge' dated Aug 12, 2026, showing the opening paragraphs and an evaluations table comparing LFM2.5-VL-3B with Gemma, InternVL, and Qwen models.
© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube