Hjälte-titelkort för LFM2.5-VL-3B, med rubriken 'LFM2.5-VL-3B' och undertiteln 'Liquid AIs 3B-vision-språkmodell för edge', en etikett som lyder 'Ny — släppt 11 aug 2026', samt tre platta linjeikoner (bildram, stycke, öga).
Guides & Insights

LFM2.5-VL-3B: Liquid AIs nya 3B-vision-språkmodell för edge

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det första du behöver veta om LFM2.5-VL-3B är att den släpptes i två halvsteg. Vikterna dök upp på Hugging Face den 11 augusti 2026 — en full bf16-checkpoint, ett modellkort med en benchmark-tabell och en README på sexton språk, och inget tillkännagivande. Kortet visade noll nedladdningar. Dagen därpå, den 12 augusti, publicerade Liquid AI det officiella inlägget, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge," och den tysta releasen blev en riktig sådan. Om du läser detta samma vecka läser du en av de tidigaste oberoende texterna om en modell som nästan ingen utanför Liquids labb har kört ännu — så här är vad som faktiskt går att veta från repot, och vad som inte gör det.

Vad LFM2.5-VL-3B är

LFM2.5-VL-3B är en vision-språkmodell — bild och text in, text ut — byggd på Liquid AI:s LFM2.5-textryggrad. Konkret: språkmodellen är LFM2.5-2.6B, ihopkopplad med en SigLIP2 NaFlex 400M-visionkodare, för totalt cirka 3,1 miljarder parametrar. Den behåller familjens hybridarkitektur med kortdistans-gated konvolutionsblock varvade med grupperad-frågeuppmärksamhet, ett ordförråd på 128 000 tokens och ett kontextfönster på 32 768 tokens. Den stöder sexton språk (engelska, arabiska, kinesiska, franska, tyska, hindi, indonesiska, italienska, japanska, koreanska, polska, portugisiska, ryska, spanska, thai, vietnamesiska), levereras i bfloat16 och licensieras under Liquids lfm1.0-öppna licens.

Det är inte en modell från grunden. Modellkortet beskriver den som en multimodal variant av LFM2.5 som bygger på den tidigare LFM2-VL-3B med ytterligare mitt- och efterträning. Den här härstamningen är viktig: synfärdigheterna ligger ovanpå en textmodell som redan är förtränad på ungefär 34 biljoner token, så språksidan är ingen leksak — det är samma familjemotor som textmodellerna använder, med en synkodare påsvetsad och omtränad för synarbete.

Vad den kan göra

Liquids skrivning lyfter fram fyra förbättringar jämfört med den tidigare LFM2-VL-3B: skärm- och UI-förståelse, funktionsanrop, förankring och inmatning av flera bilder. Enkelt uttryckt innebär det:

• Grounding — peka på objekt med naturliga språkfrågor (”stoppskylten”, ”priskolumnen”) och få en normaliserad plats tillbaka.

• Skärmförståelse — besvara frågor om vad som finns på skärmen och var, benchmarkad på ScreenSpot-v2.

• OCR med layoutanteckning — helsides-OCR som också returnerar dokumentstruktur, med 23 layoutetiketter (text, titel, lista, tabell, tabellrubrik, diagram, ekvation, kod, sidhuvud och sidfot, med mera) som normaliserade heltalskoordinater.

• Verktygsanvändning — ett fyrstegsflöde för funktionsanrop som tar verktygsdefinitioner som JSON, genererar Pythonic-anrop mellan token för verktygsanrop och returnerar ett slutligt svar i klartext.

• Multi-bildinmatning — resonera över flera bilder i en enda omgång.

Liquids egen vägledning om var den inte passar är ovanligt specifik. Kortet rekommenderar den för enkelvända uppgifter med hög genomströmning och låg latens — objektdetektering i nära realtid inom fordonsindustrin, batch-OCR av skannade dokument, översättning av menyer och vägskyltar på enheten — och varnar uttryckligen mot långkontextuellt, resonemangstungt arbete, visuell webbdesign och mycket tekniska ritningsfrågor.

Siffrorna — alla leverantörsrapporterade

Varje figur i detta avsnitt kommer från Liquid AIs egen modellkort och blogginlägg. Inget av det har oberoende reproducerats, och tills en tredje part kör checkpointen bör du behandla dessa som påståenden, inte fakta. Den etiketten gör verkligen arbete här, för resultaten är på papperet genuint starka:

• Förankring — RefCOCO makro precision@1 på 87,9, upp från 57,1 på den tidigare LFM2-VL-3B — ett hopp på ungefär trettio punkter som Liquid tillskriver vision-postträningen.

• Skärmförståelse — genomsnitt på 80,7 i ScreenSpot-v2, vilket enligt Liquid ligger före de 78,5 som de tillskriver Qwen3.5-4B.

• Verktygsanvändning — ToolSandbox 59,5, mer än dubbelt så mycket som de 26,4 som Liquid uppmätte på LFM2-VL-3B; BFCLv4 32,5, upp från 20,5.

• Allmänt visuellt resonemang — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.

• OCR — OCRBenchv2 (engelska delmängden) 47,5, upp från 43,9.

• Svårt multimodalt resonemang — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — den svagare delen, som väntat för en 3B-modell.

• Hastighet, leverantörsutförd — 228 tokens/s på en Apple M5 Max, 116 tokens/s på en AMD Ryzen AI Max+ 395 och 20 tokens/s på en Galaxy S26 Ultra, allt inom ungefär 3,3 GB minne. På en H100 med vLLM hävdar Liquid cirka 11 000 utdatatokens/s vid hög samtidighet och en tid-till-första-token på cirka 34 ms för ett klipp på fem bildrutor, vilket Liquid tillskriver att modellen svarar direkt istället för att resonera.

Scoreboard for LFM2.5-VL-3B with one column: Params 3.1B (2.6B LM + 400M vision), Context 32,768 tokens, Vision encoder SigLIP2 NaFlex 400M, Grounding RefCOCO 87.9, Screen understanding ScreenSpot-v2 80.7, Status no hosted endpoint yet. Footer: 'All benchmark figures vendor-reported; no independent scores yet.'

Det är många påståenden för en enda 3B-modell, och det är värt att upprepa förbehållet i sidfoten på modellens eget kort: det här är Liquids siffror. Klyftan mellan att "prestera bra i en labbutvärdering" och att "hålla måttet på dina data" är precis där en så här ny modell brukar snubbla.

Vad som ännu inte är känt

Den ärliga listan över öppna frågor:

• Ingen oberoende benchmark — i skrivande stund finns LFM2.5-VL-3B inte på någon tredjepartsleaderboard. Alla poäng ovan är leverantörsrapporterade.

• Ingen hostad slutpunkt — ingen inferensleverantör tillhandahåller den ännu. Det här handlar om självhostning, punkt.

• Ingen användningsdata — noll nedladdningar första dagen innebär ingen feedback från communityn, inga finjusteringar, inget "jag körde det på X och det kraschade vid Y." De första verkliga rapporterna ligger fortfarande framför oss.

• En experimentell funktion — layout-annotationsutdata flaggas av Liquid själv som "experimentell" och "kan ändras, kan vara opålitlig och kanske inte är trivial att tolka." Bygg inte din parser runt den ännu.

• Tunn täckning från tredje part — pressen under första veckan består mestadels av korta nyhetsreferat. Ingen har gjort ett djupgående oberoende test.

Screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B, showing Image-Text-to-Text, license lfm1.0, 16 languages, 'This model isn't deployed by any Inference Provider', and 228 tok/s on Apple M5 Max / 116 tok/s on AMD Ryzen AI Max+ 395 in under 3.3 GB of memory.

Inget av detta betyder att modellen är dålig. Det betyder att den är oprövad på samma sätt som vilken modell som helst är oprövad under dagarna efter lanseringen.

Så här kör du det själv

För en så här ung modell är ekosystemhistorien ovanligt bra. Formatvarianter släpptes samma dag som vikterna: GGUF för llama.cpp, ONNX och fem MLX-kvantiseringar för Apple Silicon, tillsammans med den inbyggda bf16-checkpointen för Transformers, vLLM och SGLang. Liquid listar stöd från dag ett för llama.cpp, MLX, vLLM, SGLang och ONNX, plus en WebGPU-demo i webbläsaren. Rekommenderade samplingsparametrar är temperatur 0,2, top_k 50, repetitionsstraff 1,0, med vision hanterad av modellens processorkonfiguration. Om du vill prova den på en bärbar dator ikväll är MLX- eller GGUF-byggena den kortaste vägen.

Vad du ska titta på

Två saker avgör om LFM2.5-VL-3B spelar roll bortom hype-cykeln. För det första om siffrorna för grounding och skärmförståelse överlever oberoende reproduktion — 80,7 på ScreenSpot-v2 och 87,9 på RefCOCO är de två påståenden som är mest värda att kontrollera, eftersom det är de som skulle göra detta till en genuint disruptiv edge-modell. För det andra om en hosted endpoint dyker upp, eftersom det förändrar kalkylen från ”intressant self-host-projekt” till ”redo att leverera idag”. Och det är precis då ett routinglager förtjänar sin plats: ett API över 200+ modeller innebär att den dag Liquid eller en leverantör sätter upp en endpoint, lägger du till LFM2.5-VL-3B bredvid de modeller du redan anropar utan att ändra din integration, till leverantörens listpris utan påslag, och automatisk failover låter dig dirigera riktig trafik till den medan en beprövad modell täcker upp de anrop som den misslyckas med. Tills dess är det en lovande self-host-historia — och för en modell som bara är en vecka gammal är det redan mer än de flesta lanseringar får.

Screenshot of Liquid AI's announcement blog post 'LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge' dated Aug 12, 2026, showing the opening paragraphs and an evaluations table comparing LFM2.5-VL-3B with Gemma, InternVL, and Qwen models.
© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube