
Liquid AI d1-3B vs LFM2.5-2.6B-Base: Het beslissingsmodel en zijn eigen voorouder
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Dit is geen wedstrijd tussen twee rivalen. Liquid AI d1-3B, het open-weight beslissingsmodel dat Liquid AI op 7 oktober 2026 publiceerde, is gebouwd op een basis die de leverancier construeerde door de gewichten van LFM2.5-2.6B te middelen met de tekstbackbone van LFM2.5-VL-3B. LFM2.5-2.6B-Base is die eerste ouder — de ruwe vooraf getrainde checkpoint die Liquid op 1 augustus 2026 uploadde, 2,69 miljard parameters, 34 biljoen trainingstokens, 131.072-tokencontext, geen instructietuning en geen chatsjabloon. De eerlijke manier om deze vergelijking te kaderen is dus afstammeling tegenover voorouder: een model dat via post-training in een heel specifieke taak is gevormd, naast het ongevormde substraat waaruit het is gevormd. Een van hen beantwoordt vanavond vragen. De andere is waar je begint als de vraag die je beantwoord wilt hebben nog niet door iemand is gesteld.
Wat elk ervan eigenlijk is
De twee modelkaarten lezen als documenten uit verschillende fasen van een productielijn, en de verschillen zijn niet stilistisch.
Liquid AI d1-3B heeft 3,12 miljard parameters, een SigLIP2 NaFlex vision-encoder van 0M, een contextvenster van 32.768 tokens, een vocabulaire van 128.000 tokens en zestien gedocumenteerde talen. Het is een beslissingsmodel: je geeft het een toestand en benoemde vragen, en het retourneert een ja/nee-waarschijnlijkheid, een gekozen label met betrouwbaarheid en een volledige optieverdeling, of een geordende score — in één forward pass, zonder dat er uitvoertokens worden gegenereerd. Het wordt geleverd met een system_one-aanroep voor één toestand met meerdere vragen, een gebatchte variant die veel verzoeken zonder padding verpakt, en een ruwe probabilities-accessor voor de onderliggende verdelingen. Het is geen chatmodel en schrijft geen tekst, en de kaart zegt dat in die bewoordingen.
LFM2.5-2.6B-Basebevat 2,69 miljard parameters in 30 lagen — 22 dubbel-gated short-convolutionblokken en 8 grouped-query attention-blokken — getraind op 34 biljoen tokens en tijdens de mid-training uitgebreid naar een context van 131.072 tokens, met dezelfde vocabulaire van 128.000 tokens en dezelfde zestien talen. Het is een voorgetraind checkpoint voor alleen tekst, zonder instruction tuning, zonder benchmarks op de modelkaart, en met een aanbeveling die als een waarschuwing leest: gebruik het alleen voor taken die zware fine-tuning vereisen. Het vult tekst aan. Het volgt geen instructies.
Beide zijn downloads zonder toegangsdrempel onder de eigen open licentie van Liquid. Bij beide staat tekst voorop. Geen van beide staat in onze catalogus, en niets hier is een claim over de beschikbaarheid van een van beide.

De afstamming is het interessante deel
Liquid heeft geen nieuw model fine-getuned om de d1-release te maken. Het nam het gemiddelde van twee checkpoints — LFM2.5-2.6B en de teksttoren van LFM2.5-VL-3B — om een beter startpunt te krijgen, en voerde daarna fine-tuning uit op verschillende runs met verschillende willekeurige seeds en datamengsels, waarna het die weer samenvoegde. Het verslag van de leverancier over wat het resultaat verbeterde, is opvallend vrij van exotische techniek: trainen op lange inputs, het door elkaar husselen van de volgorde waarin antwoordopties verschijnen, en het verwijderen van shortcuts uit de trainingsdata deden meer dan welke geavanceerde methode dan ook die ze hebben geprobeerd.
Dat detail over het verwijderen van shortcuts is het waard even bij stil te staan, want het benoemt de faalwijze die deze categorie wil vermijden. Een model dat is getraind om meerkeuzevragen te beantwoorden, leert maar al te graag dat optie B meestal juist is, of dat de langste optie wint. Het husselen van de volgorde van opties tijdens de training is wat dat tegengaat. Een beslissingsmodel dat een positieprior heeft geleerd in plaats van de toestand te lezen, is erger dan nutteloos — het zit er op schaal vol vertrouwen naast — en het is precies het ding dat een echt beslissingsmodel onderscheidt van een classifier met een prompt.
Er is ook een regressie die je ronduit moet benoemen, omdat de leverancier dat niet doet: het basischeckpoint heeft een contextvenster van 131.072 tokens en Liquid AI d1-3B heeft 32.768. Post-training naar een beslissingsmodel kostte driekwart van de bruikbare context. Als je dacht dat de afstammeling zijn voorouder op elke as strikt domineert, is dat niet zo, en beslissingen over lange documenten zijn de as waarop het oudere checkpoint meer ruimte heeft — in principe, hoewel het geen beslissingshoofd heeft om die te gebruiken.
Het scorebord, met de asymmetrie eraan gehecht
Het vergelijken van deze twee op benchmarks is een categoriefout, maar het is een categoriefout met een informatieve vorm, dus hier is het met de kanttekeningen op hun plaats. Elk cijfer voor d1-3B is van Liquid zelf, gescoord door de leverancier met de officiële scorer in plaats van ingediend bij een openbaar leaderboard, en door geen enkele derde partij gereproduceerd. Elk cijfer voor LFM2.5-2.6B-Base ontbreekt, omdat een basismodel niets heeft om te meten.
• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, de nummer één van alles onder 10B in de tabel van de leverancier en vóór een beslissingsmodel dat twaalf keer zo groot is. LFM2.5-2.6B-Base — niet gescoord, niet scoorbaar zonder een beslissingshoofd.
• Tekstbenchmarks — Liquid AI d1-3B scoort gemiddeld 82,9 op zeven openbare benchmarks die zich uitstrekken over begrip, toxiciteit, intentie, medische QA en cross-linguaal begrip. LFM2.5-2.6B-Base publiceert helemaal geen benchmarktabel.
• Visie — Liquid AI d1-3B scoort gemiddeld 74,1 op elf beeldbenchmarks die als beslissingen worden gelezen; het verwijderen van de afbeeldingen laat dezelfde vragen dalen naar 45,1. LFM2.5-2.6B-Base is uitsluitend voor tekst, zonder visietoren.
• Parameters — 3,12B tegen 2,69B. Het beslissingsmodel is het grootste van de twee, wat het tegenovergestelde is van het gebruikelijke posttrainingsverhaal.
• Context — 32.768 tokens tegen 131.072. De voorouder wint deze rij en het is de enige rij die hij wint.
• Latentie — Liquid AI d1-3B beantwoordt één enkele vraag in 8 ms op een RTX 4090 en in 50 ms op een Jetson Orin Nano, en verwerkt 64 packed states met 475 per seconde op de 4090. LFM2.5-2.6B-Base heeft geen latentie om te noemen totdat je het fine-tunet tot iets dat een vraag beantwoordt; op dat punt is het getal dat van jouw fine-tune.

Waar je in de praktijk tussen kiest
De beslissingsregel is hier ongewoon helder, omdat de twee controlepunten niet om dezelfde begrotingspost concurreren.
Neem Liquid AI d1-3B wanneer de vraag al bestaat en een van de drie vormen is die een beslissingsmodel aankan: een ja of nee, een keuze uit een benoemde set, of een beoordeling op een geordende schaal. De gepubliceerde toepassingen zijn allemaal herkenbare productietaken — triage en routing, moderatie, intentie- en topicclassificatie, extractiecontroles, reranking, agent-guardrails en visuele inspectie. De demonummers die de leverancier op 5 oktober uitvoerde, zetten d1 tegenover GPT-6.1 Sol en Claude Opus 5.5 op zes van zulke taken en beweren dat het GPT-6.1 Sol op vier daarvan evenaart of verslaat, terwijl het 19x tot 200x minder kost; de methodologiepagina stelt ronduit dat elke toepassing één keer per model is uitgevoerd, dus beschouw de vorm van de bewering als de bevinding, niet de decimalen. De echt opvallende is de inspectiedemo: het sorteren van goede versus defecte producten over vier productielijnen met 85 tot 97% nauwkeurigheid op een taak waarvoor het model nooit is getraind, begrepen uit een korte beschrijving.
Kies LFM2.5-2.6B-Base wanneer de vraag nog niet bestaat. Het is het goedkopere startpunt voor een fine-tune die je zelf wilt bezitten — een domeinspecifiek beslissingshoofd, een classifier op maat, een taak waarvoor niemand een checkpoint heeft. Je erft de architectuur, de tokenizer en de lange context, en je betaalt in rekentijd, data en evaluatie. Twee van de vier applicaties die de leverancier rond d1 bouwde, begonnen vanuit open-sourceprojecten in plaats van vanaf nul, wat een eerlijk beeld geeft van wat een basis-checkpoint plus discipline daadwerkelijk oplevert.
De praktische valkuil is om het base-checkpoint als een drop-in te behandelen. Het is geen assistent, het zal geen prompt volgen, en als het als chatmodel wordt beoordeeld, scoort het bijna nul — wat geen feit over de kwaliteit ervan is, maar een feit over wat "base" betekent.
Een van beide zelf hosten, en de laag erboven
Beide zijn beschikbaar als gewichten, en de leverancier heeft het deploymentwerk voor de d1-kant gedaan: llama.cpp-ondersteuning vanaf dag één, de volledige NVIDIA-stack van DGX tot Jetson, NVFP4-quantisatie, een 8-bits variant voor gewichten en activaties, en GGUF-conversies op Hugging Face. Het basis-checkpoint heeft eigen GGUF-, ONNX- en MLX-varianten via de bredere LFM2.5-familie. Als je liever niets zelf host, serveert Liquid de gehoste d1 via zijn eigen API, met prijzen uitsluitend op basis van inputtokens, waarbij afbeeldingen worden gefactureerd tegen 1,5 token per patch van 32×32 pixels; toegang tot alleen tekst is ook beschikbaar via platforms van derden.
Wat geen van beide paden verandert, is de rest van de stack. Een model dat je zelf host, is een model dat je in leven moet houden, moet versioneren en moet failoveren — en de beslissingen die het aanstuurt, komen nog steeds naast de generatieve calls die je niet zelf host. Die mix is de laag die een router samenbrengt: één endpoint voor meer dan 200 modellen, lijstprijzen van providers doorgegeven met 0% opslag zodat een prijswijziging van een leverancier dezelfde dag nog live staat aan jouw kant, en automatische failover zodat een slechte middag bij één upstream niet jouw storing wordt. Een 3B-beslismodel ernaast zelf hosten maakt de routeringsvraag juist scherper in plaats van zachter, want nu bezit je de helft van de pipeline en huur je de andere helft.
Welke, voor wie
Als de vraag die je deze week beantwoord wilt hebben een van de drie vormen is die een beslissingsmodel aanneemt, en het is een vraag die iemand anders al heeft bedacht, dan is de afstammeling klaar en gratis en draait hij in 50 ms op een apparaat zonder GPU — neem Liquid AI d1-3B en je bent klaar.
Als je het ding bouwt dat een vraag beantwoordt die nog niemand heeft gesteld, en je hebt de data en de rekenkracht om dat te bezitten, dan is LFM2.5-2.6B-Base het eerlijke uitgangspunt, en het is goed om te weten dat de afstammeling in dit artikel daaruit is gemaakt via precies de route die jij op het punt staat te nemen.
En als je niet zeker weet in welke van die twee situaties je zit, is het antwoord bijna altijd de eerste. Post-training naar een decision head is de dure zet; die van iemand anders draaien is gratis.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
