Ett hero-rubrikkort med rubriken 'En avgör, en beskriver' och underrubriken 'Liquid AI d1-omni-600M vs LFM2.5-VL-3B – öppna vikter, oktober 2026', och två kort: Liquid AI d1-omni-600 med 587M parametrar som returnerar en etikett eller en poäng med 0 utdatatoken, mot LFM2.5-VL-3B med 3,1B parametrar som skriver text och läser bilder för att returnera prosa.
Guides & Insights

Liquid AI d1-omni-600M vs LFM2.5-VL-3B: En bestämmer, en beskriver

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Liquid AI d1-omni-600M och LFM2.5-VL-3B är båda små, båda multimodala, båda publicerade av samma labb på Hugging Face under samma lfm1.0-licens — och att para ihop dem är ett kategorimisstag som visar sig vara användbart. LFM2.5-VL-3B släpptes den 12 augusti 2026 som Liquid AIs edge vision-language-modell: 3,1B parametrar, ett tokenfönster på 32 768 och utdata i prosa. Ge den en skannad sida och den returnerar transkriptionen, med layout, som text. Liquid AI d1-omni-600M laddades upp den 7 oktober 2026 tillsammans med resten av den öppna d1-familjen, och den gör motsatsen med samma indata. Det är en beslutsmodell med 587M parametrar: du kopplar namngivna frågor till ett tillstånd och den rapporterar vad den redan tror — P(ja), en vald etikett med en konfidens, en position på en ordnad skala från två till tio — i en enda framåtpassning, med noll utdatatokens och inget nedströms att parsa. Om du sökte efter "den lilla multimodala Liquid-modellen" finns det två former framför dig nu, och formen är beslutet.

Den här sidan är vad de två modellkorten, lanseringsinlägget den 25 oktober och själva repositorierna faktiskt fastställer. Den är också tydlig med var de slutar. Inget i den här jämförelsen har återgivits från Liquid AI, och för en av de två modellerna har leverantören inte publicerat något noggrannhetsriktmärke specifikt för sin egen främsta förmåga över huvud taget.

De två kontrollpunkterna, sida vid sida

Specifikationsbladen skiljer sig åt på nästan varje punkt, vilket är vad man kan förvänta sig av två modeller som aldrig var avsedda att konkurrera om samma plats.

• Vad det är – LFM2.5-VL-3B är en generativ vision-språkmodell som skriver text; Liquid AI d1-omni-600M är en beslutsmodell som returnerar strukturerade svar och inte avger några tokens

• Parametrar — 3,1B i BF16 för LFM2.5-VL-3B jämfört med 587M för Liquid AI d1-omni-600M, som i sig är en 381M delad trunk och beslutshead plus en 94M visionsencoder och en 112M ljudencoder

• Stomme — LFM2.5-VL-3B kombinerar en LFM2.5-2.6B-språkmodell med en SigLIP2 NaFlex-formoptimerad 400M visionskodare; Liquid AI d1-omni-600M tränas från LFM2.5-Encoder-350M, en dubbelriktad kodare, med ett SigLIP2-torn hämtat från LFM2.5-VL-450M och en 17-lagers FastConformer för ljud

• Indata — text och bilder för LFM2.5-VL-3B; text plus bilder eller text plus upp till 30 sekunders tal för Liquid AI d1-omni-600M, som kastar ett ValueError om bilder och ljud anländer i samma begäran

• Kontext — 32 768 tokens för LFM2.5-VL-3B jämfört med 16 384 kombinerade text-, bild- och ljudpositioner för Liquid AI d1-omni-600M, vars kort tillägger att när bilder finns trimmas tillstånds- och frågetexten till 896 tokens för att matcha träningen

• Vokabulär — 128 000 tokens för LFM2.5-VL-3B, 65 536 för Liquid AI d1-omni-600M

• Körtid — LFM2.5-VL-3B körs i transformers och vLLM och har en separat DSpark-utkastmodell för spekulativ avkodning; Liquid AI d1-omni-600M levereras med anpassad kod, kräver trust_remote_code=True, och dess modellkort rekommenderar float16 på GPU samtidigt som det varnar för att bfloat16 ändrade det främsta svaret på vissa rader

• Licens — lfm1.0 för båda, vilket tillåter finjustering och driftsättning

En rad i den listan gör mer arbete än resten. Liquid AI d1-omni-600M är byggd på en dubbelriktad encoder snarare än en decoder. Det är inte en storleksminskning av LFM2.5-VL-3B; det är en annan härstamning, och det är det arkitektoniska skälet till att de två modellerna inte kan bytas ut mot varandra, oavsett hur benchmark-tabellerna läses.

Utdatakontraktet avgör mer än vad benchmarkarna gör

Ställ en fråga till LFM2.5-VL-3B om en bild och du får språk tillbaka. Det är värt pengar när svaret måste läsas av en person, loggas som en sträng eller matas till ett steg som förväntar sig prosa. Det är också en riskfaktor som man måste konstruera runt: genererad utdata kan sväva ut, en JSON-formad förfrågan kan komma tillbaka i en annan form än du bad om, och varje token faktureras och innebär väntetid. Modellen är uttryckligen avsedd för bildarbete i en enda tur med hög genomströmning och låg latens – batchad OCR av skannade dokument, realtidsdetektering i ett fordon, översättning av skyltar på enheten – och styrs uttryckligen bort från frågor med lång kontext och tunga resonemang, som "vad är fel med den här ritningen."

Liquid AI d1-omni-600M svarar på en strikt snävare fråga i ett strikt mer tillförlitligt hölje. Dess gränssnitt är ett tillstånd — text, JSON, en eller flera bilder, eller upp till 30 sekunders tal — plus en uppsättning namngivna frågor, var och en deklarerar sin egen typ. En noul-fråga är en ja/nej-fråga och kommer tillbaka som P(ja) mellan 0 och 1. En choice-fråga väljer en etikett från en uppsättning du namnger och returnerar etiketten, en konfidens och sannolikheten för varje alternativ. En score-fråga placerar tillståndet på en ordnad skala från två till tio nivåer och returnerar den förväntade nivån med dess fördelning. Flera frågor kan hänga på ett tillstånd och läses från en enda genomgång, så modellkortets användningsräknare rapporterar output_tokens: 0. Det finns inget genereringssteg, vilket innebär att det inte finns något sådant som utdata som misslyckas att tolka.

Det du avstår från är allt som ett genererat svar bär med sig som en etikett inte gör: resonemanget, förbehållet, formuleringen du kan klistra in i en ticket, möjligheten att ställa en följdfråga i samma konversation. Liquid säger det rakt ut – modellen är inte en chattmodell och skriver ingen text. Om din pipeline behöver en förklaring bredvid utlåtandet är Liquid AI d1-omni-600M fel halva av paret, och det ärliga svaret är att köra båda: LFM2.5-VL-3B för att producera tolkningen av bilden, Liquid AI d1-omni-600M för att producera beslutet om den.

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

Det finns ingen synsiffra för direkt jämförelse, och det är fyndet.

Nästa instinktiva drag är att rada upp vision-benchmarkarna. Det går inte. För LFM2.5-VL-3B publicerar leverantören en fullständig uppsättning – RefCOCO Macro Precision@1 på 87,9, ScreenSpot-v2 på 80,7, ChartQA på 81,3, POPE på 88,7, MMStar på 63,3, BLINK på 61,5, MuirBench på 58,3, ToolSandBox på 59,5, OCRBench v2 engelska på 47,5, och ett RealWorldQA på 73,1 som ligger snäppet över den tidigare LFM2-VL-3B:s 71,1. Alla dessa är leverantörsrapporterade, ingen av dem har återtestats oberoende, och de är ändå specifika påståenden om specifika förmågor som en läsare kan ställa labbet till svars för.

För Liquid AI d1-omni-600M säger lanseringsinlägget att Decision Index v0.3 innehåller en privat vision-split "som vi inte rapporterar om i denna utgåva", och att Liquid i stället validerade att 600M-kontrollpunkten "hanterar alla tre modaliteter", med bevisen placerade i playground-demos. Det är hela det publicerade underlaget för vision. Det finns ingen bildbenchmark-siffra för denna kontrollpunkt, varken i dess modellkort eller i lanseringsinlägget. Samma inlägg bekräftar vad som saknas på ljudsidan ännu mer direkt: dedikerade benchmarkar för ljudbeslut är, med leverantörens egna ord, "för närvarande ett öppet problem."

Så den korrekta tolkningen av jämförelsen är asymmetrisk och bör uttryckas som sådan. LFM2.5-VL-3B har demonstrerat visuell förmåga med tillhörande siffror. Liquid AI d1-omni-600M har en vision-encoder lånad från en syskonmodell, en adapter tränad mot en fryst stomme, en demo och ett löfte. Om din driftsättning behöver att modellen har rätt om bilder den här månaden, är 3B den enda av de två som har något att stå på.

Hastighet: endast en av dessa har mätts

Eftersom en beslutsmodell inte genererar något är latensen den siffra som spelar roll, och återigen är bara en sida dokumenterad. LFM2.5-VL-3B anges till 228 tokens per sekund på en Apple M5 Max och 116 tokens per sekund på en AMD Ryzen AI Max+ 395, båda inom 3,3 GB minne, med omkring 20 tokens per sekund på en Galaxy S26 Ultra och ungefär 11 000 tokens per sekund på en enda H100 under vLLM. Dessa siffror beskriver avkodningsgenomströmning, vilket är rätt mätvärde för en modell som skriver.

För Liquid AI d1-omni-600M anger kortet att inferenssiffror inte rapporteras eftersom modellen är en tidig forskningsrelease och under aktiv utveckling. Syskonmodellen d1-3B i samma familj har däremot latenstabeller — 8 ms för en fråga på ett RTX 4090, 16 ms på en Jetson AGX Thor, 26 ms på en Jetson AGX Orin 64 GB, 50 ms på en Orin Nano, där tre frågor över ett tillstånd kostar ungefär 1,3 gånger tiden för en. Dessa siffror tillhör 3B-beslutsmodellen och får inte läsas över till 600M. För Liquid AI d1-omni-600M är den ärliga hållningen att arkitekturen antyder en liten, snabb modell och att ingen utanför labbet har publicerat en millisekundsiffra.

Viktminnets storlek kan åtminstone uppskattas. Vid den float16-precision som kortet rekommenderar är 587M parametrar ungefär 1,2 GB vikter före aktiveringar — aritmetik utifrån det publicerade parameterantalet, inte en leverantörsmätning — jämfört med de under 3,3 GB som Liquid rapporterar för LFM2.5-VL-3B. På en enhet där megabyte är begränsningen är den skillnaden argumentet för 600M.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Hur man väljer mellan dem

Valet löser sig enkelt när utdatakontraktet behandlas som fast snarare än förhandlingsbart.

Välj LFM2.5-VL-3B när det som ska levereras är text: helsida med layout, grundning och detektion från naturliga språkfrågor, skyltöversättning på en enhet, alla steg där en nedströms språkmodell konsumerar svaret. Den har också den bredare kontexten på 32k tokens och det djupare språket, eftersom dess svar är språk snarare än etiketter.

Vänd dig till Liquid AI d1-omni-600Mnär det som ska levereras är ett beslut: att dirigera ett ärende, triagera en bildruta, moderera ett klipp, grinda en skyddsräls, poängsätta ett svar på en skala från två till tio — och, unikt bland dessa två, när indata är tal. Det är den enda av de två som överhuvudtaget tar emot ljud, upp till 30 sekunder per begäran, även om dess kort noterar att ljudet tränades på utbyten mellan en engelsktalande person och en assistent, vilket är en snäv beskrivning av världen som dina anrop kommer att komma från.

Välj ingen av dem, och håll dig till en generell vision-språkmodell, om uppgiften kräver resonemang om bilden snarare än en tolkning eller ett utlåtande om den. Båda modellkorten pekar bort från det användningsfallet, och Liquid AI d1-omni-600M har ingen mekanism för att försöka med det.

Testar en experimentell checkpoint utan att satsa pipelinen på den

Liquid AI d1-omni-600M är, enligt leverantörens egen beteckning, en tidig forskningsversion, och dess beteende inom vision och ljud är inte benchmarkat. Det är exakt profilen för en modell som du vill utvärdera bakom en fallback i stället för framför kunder. OrcaRouter dirigerar 200+ modeller genom en enda API-nyckel med automatisk failover mellan leverantörer, vilket är det billiga sättet att lägga en checkpoint som denna på en live-väg: om den experimentella vägen försämras eller en leverantör går ner, hamnar begäran på fallbacken utan kodändring. Samma nyckel täcker alla modeller som pipelinen lämnar över till, till varje leverantörs listpris som förs vidare med 0 % påslag, så en leverantörs prissänkning blir ditt pris samma dag.

Ett förbehåll, som nämns eftersom det är avgörande: de öppna d1-modellerna och LFM2.5-VL-familjen finns inte i vår katalog i dag. Att själv hosta vikterna är den väg leverantören rekommenderar för båda, med llama.cpp-stöd från dag ett för Apple-, AMD-, Qualcomm- och NVIDIA-hårdvara, och att köra dem på en hostad endpoint innebär leverantörens egen API eller tredjepartsplattformar. Att tolka den här sidan som ett påstående om tillgänglighet vore ett misstag.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Vad du ska titta på

Den intressanta frågan är inte huruvida 600M till slut slår 3B på något — det kommer den inte att göra, och den byggdes inte för att göra det. Det är huruvida Liquid AI publicerar den privata vision-spliten som företaget höll tillbaka, och huruvida någon bygger det benchmark för ljudbeslut som labbet säger ännu inte finns. Tills något av detta landar är en jämförelse mellan Liquid AI d1-omni-600M och LFM2.5-VL-3B en jämförelse mellan en uppmätt modell och en plausibel modell. För icke uppmätt arbete — tal in, dom ut, tillräckligt litet för att rymmas på enheten — är 600M den enda open-weight-checkpointen i den här familjen som försöker sig på det, och att vara först utan resultattavla är fortfarande att vara först.

OrcaRouter dirigerar 200+ modeller via en enda API-nyckel, med varje leverantörs listpris vidarebefordrat med 0 % påslag så en leverantörs prissänkning blir ditt pris samma dag.