
LFM2.5-VL-3B: Liquid AI's nieuwe 3B vision-language model voor de Edge
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Het eerste wat je moet weten over LFM2.5-VL-3B is dat het in twee halve stappen werd uitgebracht. De gewichten verschenen op 11 augustus 2026 op Hugging Face — een volledige bf16-checkpoint, een modelkaart met een benchmarktabel en een README in zestien talen, en geen aankondiging erbij. De kaart toonde nul downloads. De volgende dag, 12 augustus, plaatste Liquid AI de officiële write-up, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge," en de stille release werd een echte. Als je dit dezelfde week leest, lees je een van de vroegste onafhankelijke write-ups van een model dat bijna niemand buiten Liquid's lab al heeft gedraaid — dus hier is wat er daadwerkelijk bekend is uit de repo, en wat niet.
Wat LFM2.5-VL-3B is
LFM2.5-VL-3B is een vision-taalmodel — afbeelding en tekst in, tekst uit — gebouwd op de LFM2.5-tekstbackbone van Liquid AI. Concreet: het taalmodel is de LFM2.5-2.6B, gekoppeld aan een SigLIP2 NaFlex 400M-visie-encoder, met in totaal ongeveer 3,1 miljard parameters. Het behoudt de hybride architectuur van de familie, met gated convolutieblokken voor korte afstanden afgewisseld met grouped-query attention, een woordenschat van 128.000 tokens en een contextvenster van 32.768 tokens. Het ondersteunt zestien talen (Engels, Arabisch, Chinees, Frans, Duits, Hindi, Indonesisch, Italiaans, Japans, Koreaans, Pools, Portugees, Russisch, Spaans, Thais, Vietnamees), wordt geleverd in bfloat16 en is gelicenseerd onder de lfm1.0-openlicentie van Liquid.
Het is geen model dat vanaf nul is opgebouwd. De kaart beschrijft het als een multimodale variant van LFM2.5 die voortbouwt op de eerdere LFM2-VL-3B met verdere mid- en post-training. Die afstamming is belangrijk: de visuele vaardigheden zijn gelaagd bovenop een tekstmodel dat al is voorgetraind op ongeveer 34 biljoen tokens, dus de taalkant is geen speelgoed — het is dezelfde familie-engine die de tekstmodellen gebruiken, met een visuele encoder eraan gelast en opnieuw getraind voor visueel werk.
Wat het kan doen
Liquid's write-up noemt vier verbeteringen ten opzichte van de vorige LFM2-VL-3B: scherm- en UI-begrip, functieaanroepen, grounding en invoer van meerdere afbeeldingen. In eenvoudige bewoordingen betekent dat:
• Gronding — wijs naar objecten met natuurlijke-taalquery's ("het stopbord", "de prijskolom") en ontvang een genormaliseerde locatie terug.
• Scherm begrip — beantwoord vragen over wat er op het scherm staat en waar, gebenchmarkt op ScreenSpot-v2.
• OCR met layoutannotatie — OCR voor volledige pagina's die ook de documentstructuur retourneert, met 23 layoutlabels (tekst, titel, lijst, tabel, tabelbijschrift, grafiek, vergelijking, code, paginakop- en voetteksten, en meer) als genormaliseerde gehele coördinaten.
{{1}}Toolgebruik — een vierstaps functieaanroepstroom die tooldefinities als JSON accepteert, Python-achtige aanroepen tussen tool-call-tokens genereert, en een definitief antwoord in platte tekst retourneert.{{/1}}
• Multi-image invoer — redeneer over meerdere afbeeldingen in één enkele beurt.
Liquid's eigen richtlijnen over waar het niet past zijn ongewoon specifiek. De kaart beveelt het aan voor single-turn, high-throughput, low-latency taken — bijna-realtime objectdetectie in de automobielsector, batch-OCR van gescande documenten, on-device vertaling van menu's en verkeersborden — en waarschuwt expliciet tegen redeneerintensief werk met lange contexten, visueel webdesign en zeer technische blauwdrukvragen.
De cijfers — allemaal door leveranciers gerapporteerd
Elke figuur in deze sectie komt uit Liquid AI's eigen modelkaart en blogpost. Niets daarvan is onafhankelijk gereproduceerd, en totdat een derde partij de checkpoint draait, moet je deze als beweringen behandelen, niet als feiten. Dat label doet hier echt werk, want op papier is de staat van dienst echt sterk:
• Grounding — RefCOCO macro precision@1 van 87,9, tegenover 57,1 op het vorige LFM2-VL-3B — een sprong van ongeveer dertig punten die Liquid toeschrijft aan de vision-posttraining.
• Schermbegrip — ScreenSpot-v2-gemiddelde van 80,7, waarvan Liquid meldt dat het boven de 78,5 ligt die zij aan Qwen3.5-4B toeschrijven.
• Toolgebruik — ToolSandbox 59,5, meer dan het dubbele van de 26,4 die Liquid op LFM2-VL-3B haalde; BFCLv4 32,5, gestegen ten opzichte van 20,5.
• Algemene visuele redenering — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (Engelse subset) 47.5, gestegen van 43.9.
• Complex multimodaal redeneren — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — de zwakkere kant, zoals verwacht voor een 3B-model.
Snelheid, door leverancier uitgevoerd — 228 tokens/s op een Apple M5 Max, 116 tokens/s op een AMD Ryzen AI Max+ 395, en 20 tokens/s op een Galaxy S26 Ultra, alles binnen ongeveer 3,3 GB geheugen. Op een H100 met vLLM beweert Liquid ongeveer 11K output tokens/s te halen bij hoge gelijktijdigheid en een time-to-first-token van ongeveer 34 ms op een clip van vijf frames, wat het toeschrijft aan het feit dat het model direct antwoordt in plaats van redeneert.

Dat zijn nogal wat claims voor één 3B-model, en het is de moeite waard om de kanttekening in de voettekst van de eigen modelkaart te herhalen: dit zijn de cijfers van Liquid. De kloof tussen "goed scoren in een labevaluatie" en "standhouden op jouw data" is precies waar zo'n nieuw model meestal struikelt.
Wat is nog niet bekend?
De eerlijke lijst van open vragen:
• Geen onafhankelijke benchmark — op dit moment verschijnt LFM2.5-VL-3B op geen enkele leaderboard van derden. Elke bovenstaande score is door de leverancier gerapporteerd.
• Geen gehost eindpunt — geen inferenceprovider biedt het nog aan. Dit is een self-host verhaal, punt uit.
• Geen gebruiksgegevens — nul downloads op de eerste dag betekent geen feedback van de community, geen fine-tunes, geen "ik draaide het op X en het crashte op Y." De eerste praktijkrapporten liggen nog in het verschiet.
• Een experimentele functie — de output van de layoutannotatie wordt door Liquid zelf gemarkeerd als "experimenteel" en "kan veranderen, kan onbetrouwbaar zijn en is mogelijk niet eenvoudig te parseren". Bouw je parser er nog niet omheen.
• Magere berichtgeving van derden — de pers in de eerste week bestaat vooral uit korte nieuwsoverzichten. Niemand heeft een diepgaande onafhankelijke test uitgevoerd.

Niets van dat alles betekent dat het model slecht is. Het betekent dat het onbewezen is, zoals elk model onbewezen is in de dagen na de release.
Hoe je het zelf kunt uitvoeren
Voor een zo jong model is het verhaal rond het ecosysteem buitengewoon goed. Formaatvarianten verschenen op dezelfde dag als de gewichten: GGUF voor llama.cpp, ONNX en vijf MLX-kwantiseringen voor Apple Silicon, naast de native bf16-checkpoint voor Transformers, vLLM en SGLang. Liquid vermeldt ondersteuning vanaf dag één voor llama.cpp, MLX, vLLM, SGLang en ONNX, plus een WebGPU-browserdemo. Aanbevolen samplingparameters zijn temperature 0,2, top_k 50 en repetition penalty 1,0, waarbij vision wordt afgehandeld door de processorconfiguratie van het model. Als je het vanavond op een laptop wilt proberen, zijn de MLX- of GGUF-builds de kortste weg.
Wat te kijken
Twee dingen bepalen of LFM2.5-VL-3B ertoe doet buiten de hypecyclus. Ten eerste, {{1}}of de cijfers voor grounding en schermbegrip onafhankelijke replicatie overleven{{/1}} — {{2}}80,7 op ScreenSpot-v2 en 87,9 op RefCOCO{{/2}} zijn de twee beweringen die het meest de moeite waard zijn om te controleren, want dat zijn de cijfers die dit model tot een werkelijk ontwrichtend edge-model zouden maken. Ten tweede, {{3}}of er een gehost endpoint verschijnt{{/3}}, want dat verandert de afweging van 'interessant self-host-project' naar 'vandaag nog inzetbaar'. En dat is precies het moment waarop een routeringslaag zijn waarde bewijst: {{4}}één API voor 200+ modellen{{/4}} betekent dat op de dag dat Liquid of een provider een endpoint opzet, je LFM2.5-VL-3B toevoegt naast de modellen die je al aanroept {{5}}zonder je integratie te wijzigen{{/5}}, tegen de lijstprijs van de provider zonder opslag, en {{6}}automatische failover laat je echt verkeer ernaartoe sturen terwijl een bewezen model de aanroepen opvangt die het verprutst{{/6}}. Tot die tijd is het een {{7}}veelbelovend self-host-verhaal{{/7}} — en voor een model dat een week oud is, is dat al meer dan de meeste releases krijgen.

