
Liquid AI d1-omni-600M vs LFM2.5-VL-3B: De een beslist, de ander beschrijft
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Liquid AI d1-omni-600M en LFM2.5-VL-3B zijn beide klein, beide multimodaal, beide gepubliceerd door hetzelfde lab op Hugging Face onder dezelfde lfm1.0-licentie — en ze aan elkaar koppelen is een categoriefout die nuttig blijkt te zijn. LFM2.5-VL-3B verscheen op 12 augustus 2026 als Liquid AI's edge vision-language-model: 3,1B parameters, een venster van 32.768 tokens en een output die proza is. Geef het een gescande pagina en het retourneert de transcriptie, inclusief lay-out, als tekst. Liquid AI d1-omni-600M werd op 7 oktober 2026 geüpload met de rest van de open d1-familie, en doet met dezelfde inputs het tegenovergestelde. Het is een beslissingsmodel met 587M parameters: je koppelt benoemde vragen aan een toestand en het rapporteert wat het al gelooft — P(ja), een gekozen label met een betrouwbaarheid, een positie op een geordende schaal van twee tot tien — in één enkele voorwaartse pass, met nul outputtokens en niets stroomafwaarts om te parsen. Als je zocht naar "het kleine multimodale Liquid-model", liggen er nu twee vormen voor je, en de vorm is de beslissing.
Deze pagina is wat de twee modelkaarten, het releasebericht van 7 oktober en de repositories zelf daadwerkelijk vaststellen. Ze is ook expliciet over waar ze stoppen. Niets in deze vergelijking is buiten Liquid AI gereproduceerd, en voor een van de twee modellen heeft de leverancier überhaupt geen nauwkeurigheidsbenchmark gepubliceerd die specifiek is voor zijn eigen belangrijkste capaciteit.
De twee controlepunten, naast elkaar
De specificatiebladen lopen op vrijwel elk vlak uiteen, wat je zou verwachten van twee modellen die nooit bedoeld waren om voor dezelfde plek te concurreren.
• Wat het is — LFM2.5-VL-3B is een generatief visie-taalmodel dat tekst schrijft; Liquid AI d1-omni-600M is een beslissingsmodel dat gestructureerde antwoorden retourneert en geen tokens uitzendt
• Parameters — 3,1B in BF16 voor LFM2.5-VL-3B versus 587M voor Liquid AI d1-omni-600M, zelf een gedeelde trunk en beslissingshoofd van 381M plus een visie-encoder van 94M en een audio-encoder van 112M
• Backbone — LFM2.5-VL-3B combineert een LFM2.5-2.6B-taalmodel met een qua vorm geoptimaliseerde SigLIP2 NaFlex-visionencoder van 400M; Liquid AI d1-omni-600M is getraind op basis van LFM2.5-Encoder-350M, een bidirectionele encoder, met een SigLIP2-toren overgenomen van LFM2.5-VL-450M en een 17-laags FastConformer voor audio
• Invoer — tekst en afbeeldingen voor LFM2.5-VL-3B; tekst plus afbeeldingen of tekst plus tot 30 seconden spraak voor Liquid AI d1-omni-600M, dat een ValueError veroorzaakt als afbeeldingen en audio in hetzelfde verzoek aankomen
• Context — 32.768 tokens voor LFM2.5-VL-3B versus 16.384 gecombineerde tekst-, beeld- en audioposities voor Liquid AI d1-omni-600M, waarvan de kaart nog toevoegt dat, wanneer er afbeeldingen aanwezig zijn, de status- en vraagtekst worden ingekort tot 896 tokens om overeen te komen met de training
• Vocabulaire — 128.000 tokens voor LFM2.5-VL-3B, 65.536 voor Liquid AI d1-omni-600M
• Runtime — LFM2.5-VL-3B draait in transformers en vLLM en heeft een apart DSpark-conceptmodel voor speculatieve decoding; Liquid AI d1-omni-600M wordt geleverd met aangepaste code, vereist trust_remote_code=True, en de bijbehorende kaart raadt float16 aan op de GPU, met de waarschuwing dat bfloat16 het beste antwoord op sommige rijen veranderde
• Licentie — lfm1.0 voor beide, wat fine-tuning en deployment toestaat
Eén regel in die lijst doet meer werk dan de rest. Liquid AI d1-omni-600M is gebouwd op een bidirectionele encoder in plaats van een decoder. Dat is geen verkleining van LFM2.5-VL-3B; het is een andere afstamming, en het is de architectonische reden waarom de twee modellen niet met elkaar verwisseld kunnen worden, ongeacht hoe de benchmarkresultaten worden gelezen.
Het outputcontract bepaalt meer dan de benchmarks doen.
Stel LFM2.5-VL-3B een vraag over een afbeelding en je krijgt taal terug. Dat is geld waard wanneer het antwoord door een persoon gelezen moet worden, als een string gelogd moet worden, of gevoed moet worden aan een stap die proza verwacht. Het is ook een risico waarmee je rekening moet houden in je ontwerp: gegenereerde uitvoer kan afdwalen, een verzoek in JSON-vorm kan anders terugkomen dan je had gevraagd, en voor elke token betaal je en moet je wachten. Het model is expliciet bedoeld voor single-turn, high-throughput, low-latency visiewerk — gebatchte OCR van gescande documenten, realtime detectie in een voertuig, vertaling van bewegwijzering op het apparaat — en wordt expliciet weggehouden van long-context, redeneerintensieve vragen zoals "wat is er mis met deze blauwdruk."
Liquid AI d1-omni-600M beantwoordt een strikt engere vraag in een strikt betrouwbaardere envelop. De interface is een toestand — tekst, JSON, een of meer afbeeldingen, of maximaal 30 seconden spraak — plus een set benoemde vragen, elk met een eigen type. Een noul-vraag is een ja/nee-vraag en komt terug als P(ja) tussen 0 en 1. Een choice-vraag kiest één label uit een set die u noemt en retourneert het label, een betrouwbaarheid en de waarschijnlijkheid van elke optie. Een score-vraag plaatst de toestand op een geordende schaal van twee tot tien niveaus en retourneert het verwachte niveau met zijn verdeling. Meerdere vragen kunnen aan één toestand hangen en worden in één pass gelezen, dus de gebruiksteller van de modelkaart rapporteert output_tokens: 0. Er is geen generatiestap, wat betekent dat er niet zoiets bestaat als output die niet kan worden geparseerd.
Wat je opoffert, is alles wat een gegenereerd antwoord met zich meebrengt wat een label niet heeft: de redenering, het voorbehoud, de formulering die je in een ticket kunt plakken, de mogelijkheid om binnen hetzelfde gesprek een vervolgvraag te stellen. Liquid zegt het ronduit — het model is geen chatmodel en schrijft geen tekst. Als je pipeline een uitleg naast het oordeel nodig heeft, is Liquid AI d1-omni-600M de verkeerde helft van het paar, en het eerlijke antwoord is om beide te draaien: LFM2.5-VL-3B om de lezing van de afbeelding te genereren, Liquid AI d1-omni-600M om de beslissing erover te genereren.

Er is geen head-to-head visienummer, en dat is de bevinding.
De instinctieve volgende zet is om de vision-benchmarks op een rij te zetten. Dat kan niet. Voor de LFM2.5-VL-3B publiceert de leverancier een volledige set — RefCOCO Macro Precision@1 op 87,9, ScreenSpot-v2 op 80,7, ChartQA op 81,3, POPE op 88,7, MMStar op 63,3, BLINK op 61,5, MuirBench op 58,3, ToolSandBox op 59,5, OCRBench v2 Engels op 47,5, en een RealWorldQA van 73,1 die net boven de 71,1 van de vorige LFM2-VL-3B uitkomt. Allemaal zijn ze door de leverancier gerapporteerd, geen ervan is onafhankelijk opnieuw uitgevoerd, en toch zijn het specifieke claims over specifieke capaciteiten waar een lezer het lab aan kan houden.
Het releasebericht voor Liquid AI d1-omni-600M zegt dat de Decision Index v0.3 een privévisionsplit bevat 'die we in deze release niet rapporteren', en dat Liquid in plaats daarvan heeft gevalideerd dat het 600M-checkpoint 'alle drie de modaliteiten aankan', met het bewijs in playgrounddemo's. Dat is het volledige gepubliceerde vision-record. Er is geen benchmarkcijfer voor beeld voor dit checkpoint, noch in de modelkaart, noch in het lanceringsbericht. Hetzelfde bericht bevestigt nog directer wat er aan de audiozijde ontbreekt: toegewijde decisionbenchmarks voor audio zijn, in de woorden van de leverancier zelf, 'momenteel een open probleem'.
De juiste interpretatie van de vergelijking is dus asymmetrisch en moet ook zo worden verwoord. LFM2.5-VL-3B heeft visuele capaciteiten aangetoond, onderbouwd met cijfers. Liquid AI d1-omni-600M heeft een vision-encoder geleend van een zustermodel, een adapter die is getraind tegen een bevroren backbone, een demo en een belofte. Als uw deployment deze maand een model nodig heeft dat het bij afbeeldingen bij het rechte eind heeft, is de 3B de enige van de twee die ergens op kan staan.
Snelheid: slechts één van deze is gemeten
Omdat een beslissingsmodel niets genereert, is latentie het getal dat ertoe doet, en ook hier is slechts één kant gedocumenteerd. Voor LFM2.5-VL-3B wordt 228 tokens per seconde genoemd op een Apple M5 Max en 116 tokens per seconde op een AMD Ryzen AI Max+ 395, beide binnen 3,3 GB geheugen, met ongeveer 20 tokens per seconde op een Galaxy S26 Ultra en ruwweg 11.000 tokens per seconde op een enkele H100 onder vLLM. Die cijfers beschrijven de decode-doorvoer, wat de juiste maatstaf is voor een model dat schrijft.
Voor Liquid AI d1-omni-600M vermeldt de modelkaart dat er geen inferentiecijfers worden gerapporteerd, omdat het model een vroege onderzoeksrelease is en actief wordt ontwikkeld. Het d1-3B-zusmodel in dezelfde familie heeft wél latentietabellen — 8 ms voor één vraag op een RTX 4090, 16 ms op een Jetson AGX Thor, 26 ms op een Jetson AGX Orin 64 GB, 50 ms op een Orin Nano, waarbij drie vragen over één state ongeveer 1,3× de tijd van één vraag kosten. Die cijfers horen bij het 3B-beslissingsmodel en mogen niet naar de 600M worden doorgetrokken. Voor Liquid AI d1-omni-600M is de eerlijke positie dat de architectuur een klein, snel model impliceert en dat niemand buiten het lab een millisecondecijfer heeft gepubliceerd.
De voetafdruk van de gewichten kan ten minste worden geschat. Bij de float16-precisie die de kaart aanbeveelt, is 587M parameters ruwweg 1,2 GB aan gewichten vóór activaties — een berekening op basis van het gepubliceerde aantal parameters, geen meting van de leverancier — tegenover de minder dan 3,3 GB die Liquid voor LFM2.5-VL-3B meldt. Op een apparaat waar megabytes de beperkende factor zijn, is dat verschil het argument voor de 600M.

Hoe kies je daartussen?
De keuze lost zich netjes op zodra het outputcontract als vaststaand wordt behandeld in plaats van als onderhandelbaar.
Kies voorLFM2.5-VL-3Bwanneer het eindproduct tekst is: OCR van een volledige pagina met lay-outannotatie, grounding en detectie op basis van vragen in natuurlijke taal, vertaling van bewegwijzering op een apparaat, elke stap waarin een mens of een downstream taalmodel het antwoord gebruikt. Het biedt ook de bredere context van 32.768 tokens en de diepere taaldekking in de praktijk, omdat de antwoorden taal zijn en geen labels.
Kies Liquid AI d1-omni-600Mwanneer de oplevering een beslissing is: een ticket routeren, een frame triageren, een clip modereren, een guardrail activeren, een antwoord beoordelen op een schaal van twee tot tien — en, uniek tussen deze twee, wanneer de invoer spraak is. Het is de enige van het tweetal die überhaupt audio accepteert, tot 30 seconden per verzoek, hoewel de kaart vermeldt dat de audio is getraind op uitwisselingen tussen een Engelssprekende en een assistent, wat een beperkte beschrijving is van de wereld waaruit je aanroepen zullen komen.
Kies geen van beide en blijf bij een algemeen visie-taalmodel als de taak redeneren over de afbeelding vereist in plaats van een lezing of een oordeel erover. Beide modelkaarten wijzen weg van dat gebruiksscenario, en Liquid AI d1-omni-600M heeft geen mechanisme om het te proberen.
Een experimentele checkpoint uitproberen zonder de hele pipeline eraan op te hangen
Liquid AI d1-omni-600M is, volgens het eigen label van de leverancier, een vroege onderzoeksrelease, en het vision- en audiogedrag zijn niet gebenchmarkt. Dat is precies het profiel van een model dat je achter een fallback wilt evalueren in plaats van vóór klanten. OrcaRouter routeert meer dan 200 modellen via één API-sleutel met automatische failover tussen providers, wat de goedkope manier is om een checkpoint als dit op een live pad te zetten: als de experimentele route verslechtert of een provider uitvalt, komt het verzoek op de fallback terecht zonder codewijziging. Dezelfde sleutel dekt elk model waaraan de pijplijn overdraagt, tegen de lijstprijs van elke provider, doorgegeven met 0% markup, dus een prijsverlaging van een leverancier is dezelfde dag jouw prijs.
Eén voorbehoud, dat ik vermeld omdat het cruciaal is: de open d1-modellen en de LFM2.5-VL-familie staan vandaag niet in onze catalogus. De gewichten zelf hosten is de route die de leverancier voor beide aanbeveelt, met ondersteuning voor llama.cpp vanaf dag één op hardware van Apple, AMD, Qualcomm en NVIDIA, en ze via een gehost endpoint draaien betekent de eigen API van de leverancier of platforms van derden. Deze pagina lezen als een claim over beschikbaarheid zou een vergissing zijn.

Wat te kijken
De interessante vraag is niet of de 600M de 3B uiteindelijk op wat dan ook verslaat — dat zal niet gebeuren, en daarvoor is het niet gebouwd. Het gaat erom of Liquid AI de private vision-split publiceert die het achterhield, en of iemand de audiobeslissingsbenchmark bouwt waarvan het lab zegt dat die nog niet bestaat. Tot een van die twee beschikbaar is, is een vergelijking tussen Liquid AI d1-omni-600M en LFM2.5-VL-3B een vergelijking tussen een gemeten model en een plausibel model. Voor ongemeten werk — spraak in, oordeel uit, klein genoeg om op het apparaat te passen — is de 600M het enige open-weight checkpoint in deze familie dat dit probeert, en de eerste zijn zonder scorebord blijft de eerste zijn.
OrcaRouter routeert 200+ modellen via één API-sleutel, waarbij de lijstprijs van elke provider met 0% opslag wordt doorgegeven, zodat een prijsverlaging van een leverancier dezelfde dag jouw prijs is.
