
Liquid AI d1-3B en d1-omni-600M: Open gewichten voor modellen die nooit een woord schrijven
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Liquid AI d1-3B en Liquid AI d1-omni-600M zijn op 7 oktober 2026 op Hugging Face verschenen, en de twee checkpoints hebben een eigenschap die elke vergelijkingstabel die je dit jaar hebt gelezen de verkeerde vorm geeft. Geen van beide genereert tekst. Je geeft Liquid AI d1-3B een toestand — een supportticket, een JSON-payload, een foto, of alle drie tegelijk — en een set benoemde vragen, en het retourneert antwoorden die rechtstreeks uit de kansverdeling van het model over jouw opties zijn geplukt. Ja/nee als waarschijnlijkheid. Een keuze uit labels, met een betrouwbaarheid en een volledige waarschijnlijkheidsvector. Een positie op een geordende schaal. Er is geen samplingstap, geen JSON om te parsen, geen ontspoorde generatie, en de eigen gebruiksteller van de leverancier meldt het simpelweg: output_tokens: 0. Het 3B-model is de blikvanger — het behaalt 48,57 op de door de leverancier gescoorde Decision Index 0.2.1, beter dan alles onder 10B en beter dan een beslissingsmodel dat twaalf keer zo groot is. Het 600M-broertje is degene die het volgen waard is: het leest afbeeldingen en tot dertig seconden spraak via dezelfde trunk-gewichten, en het is aangeduid als een vroege onderzoeksrelease.
Wat een beslissingsmodel is, in één alinea
De categorie is een jaar lang opgebouwd onder namen als systeem-1-modellen en classificatoren-die-geen-classificatoren-zijn, en het d1-paar is tot nu toe de zuiverste formulering ervan. Aan een generatief model wordt een vraag gesteld en het schrijft een antwoord; het antwoord moet worden geparseerd, het parsen kan mislukken, en elke token die het schrijft kost je geld en tijd. Aan een beslissingsmodel wordt een vraag gesteld en het rapporteert wat het al gelooft. De vragen van Liquid komen in drie typen. noul is een ja/nee-vraag, beantwoord met P(ja) tussen 0 en 1. choice kiest één label uit een benoemde set en retourneert het label, een betrouwbaarheid en de waarschijnlijkheid van elke optie. score plaatst de toestand op een geordende schaal van twee tot tien niveaus en retourneert het verwachte niveau met zijn verdeling en legenda. Eén toestand kan meerdere vragen tegelijk dragen, en de toestand en zijn afbeeldingen worden één keer gelezen voor alle vragen.
Die laatste eigenschap is de hele businesscase. Drie vragen over één ticket kosten 1,3x de tijd van één vraag, niet 3x, omdat het model één forward pass over de input doet en er meerdere antwoorden uit leest. Er valt niets te schrijven, dus er valt niets slecht te schrijven.
De 3B en de 600M zijn vanuit tegengestelde richtingen gebouwd
Dit is waar de release technisch interessant wordt, en het is het deel dat de lanceerberichtgeving grotendeels heeft overgeslagen. De twee modellen delen geen afstamming.
Liquid AI d1-3B stamt af van LFM2.5-VL-3B, het decoder-only visie-taalmodel van de leverancier. Het heeft 3,12B parameters, een SigLIP2 NaFlex-vormgeoptimaliseerde visie-encoder van 400M, een contextvenster van 32.768 tokens, een vocabulaire van 128.000 tokens en zestien gedocumenteerde talen. Om het te bouwen nam Liquid het gemiddelde van de gewichten van LFM2.5-2.6B en de tekstbackbone van LFM2.5-VL-3B, voerde fine-tuning uit op checkpoints uit verschillende willekeurige seeds en datamengsels, en voegde de resultaten daarna opnieuw samen. De eigen samenvatting van de leverancier van wat ertoe deed, is verfrissend niet-glamoureus: trainen op lange inputs, het door elkaar schudden van de volgorde van antwoordopties en het opsporen van shortcuts in de trainingsdata deden meer voor het uiteindelijke cijfer dan welke geavanceerde techniek dan ook.
Liquid AI d1-omni-600M stamt af van LFM2.5-Encoder-350M, een bidirectionele encoder — een heel ander soort netwerk. Het telt 587M parameters, verdeeld over een gedeelde trunk en beslissingshoofd van 381M, een visie-encoder van 94M, geleend van LFM2.5-VL-450M, en een audio-encoder van 112M, gebouwd op een FastConformer met 17 lagen. Elke modaliteit loopt door dezelfde trunk-gewichten. De context is 16.384 tokens en omvat tekst-, beeld- en audioposities samen, en wanneer er afbeeldingen zijn toegevoegd, wordt de status- en vraagtekst teruggebracht tot 896 tokens omdat dat is waarop het is getraind. Audio krijgt één waarschuwing die de kaart zonder voorbehoud vermeldt: de mogelijkheid is getraind op verzoeken tussen een Engelssprekende en een assistent, en clips worden op dertig seconden afgekapt.
Dus de familie is niet één model in twee maten. Het is een decoder en een encoder, verder getraind om hetzelfde werk te doen met twee compleet verschillende mechanismen, waarvan de ene ziet en de andere hoort.

De nummers, en van wie ze zijn
Elk cijfer in deze sectie is van Liquid zelf. De Decision Index-rijen voor de d1-modellen zijn door de leverancier gescoord met de officiële scorer — niet ingediend bij het leaderboard — terwijl elke concurrerende rij afkomstig is van het openbare leaderboard op v0.2.1. Nog geen enkel onafhankelijk lab heeft er tot nu toe iets van gereproduceerd, en de modellen zijn twee dagen oud op het moment dat dit geschreven wordt.
• Decision Index 0.2.1 — Liquid AI d1-3B scoort 48,57, met deelscores: Kennis 23,8, Taal 56,4, Ophalen 52,8, Hulpmiddelen 74,5 en Kunsten 36,3. Liquid AI d1-omni-600M scoort 15,95, met Hulpmiddelen op 15,1.
• Waar 48,57 staat — als eerste van alles onder 10B in de tabel die de leverancier heeft gepubliceerd, en vóór Decider 35B-A3B op 47,11. Het staat overall tweede, achter Winnow-12B op 50,02, dat vier keer zo groot is.
• Tekstbenchmarks, volgens opgave van de leverancier — d1-3B scoort gemiddeld 82,9 op zeven publieke benchmarks, voor op de 81,1 van Decider 4B; d1-omni-600M scoort gemiddeld 78,4, waarmee hij de 77,1 van Decider 2B verslaat bij ongeveer een kwart van het aantal parameters. De 600M noteert de beste toxiciteitsscore in de tabel (Civil Comments 95,8) en de beste parafrasescore (PAWS-X 79,5).
• Beeld, volgens opgave van de leverancier — d1-3B scoort gemiddeld 74,1 op elf publieke beeldbenchmarks, gelezen als beslissingen over de opties van elke benchmark, tegenover 73,9 voor zijn LFM2.5-VL-3B-backbone. Het verwijderen van de afbeeldingen laat dezelfde vragen naar 45,1 zakken, waarmee de leverancier laat zien dat de antwoorden uit de pixels komen.
• Latentie, door de leverancier gemeten — één vraag kost 8 ms op een RTX 4090 en 9 ms op een AMD MI325X; 16 ms op een Jetson AGX Thor, 26 ms op een Jetson AGX Orin 64 GB, 50 ms op de kleinste Jetson Orin Nano, en 30 ms op een Apple M5 Pro. Vierenzestig toestanden, verpakt in één enkele pass, draaien op 475 per seconde op de 4090.
• Wat ontbreekt — d1-omni-600M heeft helemaal geen inferentietabel. Liquid zegt dat het in actieve ontwikkeling is en rapporteert er simpelweg geen latentie voor. Er is ook nergens in de release een benchmark voor audiobeslissingen te vinden, omdat, in de woorden van de leverancier, speciale benchmarks voor audiobeslissingen momenteel een open probleem vormen.
De claim die de release werkelijk maakt
Twee dagen voordat de weights werden vrijgegeven, publiceerde Liquid de gehoste versie van dit model en liet het het opnemen tegen GPT-6.1 Sol en Claude Opus 5.5 op zes toepassingen. De samenvatting luidt: d1 evenaart of verslaat GPT-6.1 Sol op vier van de zes, kost 19x tot 200x minder en antwoordt sneller bij elke taak. Het is de moeite waard de gepubliceerde methodologie te lezen voordat je iets daarvan herhaalt — elke toepassing werd op 5 oktober 2026 één keer per model uitgevoerd, de chatmodellen antwoordden in JSON met hun standaard redeneerinstelling, en de kosten van d1 werden berekend op $0,04 per miljoen inputtokens.
De demo's zijn de overtuigendere helft. Goede en defecte onderdelen sorteren van vier productielijnen — printplaten, kaarsen, cashewnoten, kauwgom — met 85 tot 97% nauwkeurigheid, met een model dat nooit voor de taak is getraind en die uit een korte beschrijving begreep. Een SQL-predicaat dat voor elk van de 150 supporttickets ja of nee antwoordt. Een contextcompactielus die elke tool-uitvoer in de sessie van een codeeragent leest en deze behoudt, inkort of laat vallen, waarbij 52% van de tokens wordt verwijderd terwijl elke uitvoer die de taak nodig heeft behouden blijft. In Tetris verhoogde het toevoegen van het scherm aan een volledig in tekst te beschrijven spel de score van 70 gewiste lijnen naar 81 — een visieresultaat dat je niet uit een classificator die alleen tekst gebruikt kunt halen, hoe goed die ook is.
Dat zijn demonstraties die door leveranciers worden uitgevoerd, met door leveranciers gekozen taken, en dat staat in de methodologiesectie. Ze vormen nog steeds het helderste beeld dat iemand heeft gepubliceerd van waar een beslissingsmodel voor dient.

Waar het draait, en wat een aanroep kost
De open gewichten zijn gebouwd voor lokale uitvoering en de leverancier heeft het integratiewerk vooraf gedaan: ondersteuning vanaf dag één voor llama.cpp, de volledige NVIDIA-stack van DGX tot Jetson, NVFP4-kwantificatie, en een 8-bits variant voor gewichten/activatie die samen met het basischeckpoint is gepubliceerd. GGUF-conversies staan al op Hugging Face. Als je liever niets zelf host, serveert Liquid de gehoste d1 via zijn eigen API — alleen invoertokens, geen uitvoertokens, waarbij afbeeldingen als invoer worden gefactureerd tegen 1,5 tokens per patch van 32×32 pixels, waardoor een afbeelding van 1024×1024 1.536 tokens kost. Toegang tot alleen tekst is ook beschikbaar via platforms van derden.
De eerlijke routeringsopmerking: noch Liquid AI d1-3B noch Liquid AI d1-omni-600M staat in onze catalogus, en dit artikel is voor geen van beide een beschikbaarheidsclaim. Wat het d1-paar verandert voor een router is de vorm van de pijplijn eromheen. Een beslissingsmodel dat in milliseconden antwoordt en niets aan outputtokens kost, is een filter, geen vervanging — het sorteren van goede en defecte exemplaren en de tickettriage gebeuren vóór de generatieve aanroep, en de generatieve aanroep is waar één enkel endpoint voor 200+ modellen, lijstprijzen doorgegeven met 0% opslag, en automatische failover echt hun geld waard zijn. Andere laag, dezelfde pijplijn.
Wat zou de discussie beslechten?
Drie dingen zijn onopgelost, en alle drie zijn het van het soort dat alleen de tijd kan sluiten.
Het eerste is onafhankelijke reproductie. De cijfers van de Decision Index zijn door de leverancier geproduceerd met de officiële scorer, en elke rij van een concurrent is overgenomen uit een openbare leaderboard. Dat is een verdedigbare methode en niet hetzelfde als een derde partij die je model draait. Het tweede is audio. Een 600M-checkpoint dat een spraakopdracht in één forward pass routeert, is een werkelijk nieuwe capaciteit, en er bestaat geen benchmark die meet of het dat goed doet. Het derde is de categorie zelf: wanneer het antwoord van een distributie wordt afgelezen in plaats van uitgeschreven, kunnen de gebruikelijke faalmodi van een klein model — blijven hangen, afdrijven, weigeren, een formaat hallucineren — eenvoudigweg niet optreden, en niemand heeft een goede uiteenzetting gepubliceerd van wat daarvoor in de plaats komt. Calibratiefout is de voor de hand liggende kandidaat, en het is precies wat het confidenceveld bij elk antwoord je uitnodigt om zelf te meten.
Tien demo's laten Liquid AI d1-3B in een lus over live camera-invoer draaien in een publieke Hugging Face-space, wat de goedkoopste manier is om je eigen mening te vormen. De gewichten zijn gratis en de vragen zijn specifiek. Dat is een beter uitgangspunt dan de meeste releases dit jaar bieden.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
