Een hero-titelkaart met de titel 'Liquid AI d1-3B vs Gemma 4 12B' en de subkop 'een beslissingsmodel tegenover een generalist', waarop een kleine 3,12B-checklistkaart met een waarschijnlijkheidschip naast een grotere 11,96B-kaart met document-, golfvorm- en filmframe-pictogrammen en een chip met een geschreven antwoord te zien is.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: Een beslissingsmodel een generalist

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De snelste manier om deze vergelijking verkeerd te krijgen, is Liquid AI d1-3B en Ge​mma 4 12B op dezelfde benchmark te zetten en op een winnaar te wachten. Ze beantwoorden niet dezelfde vraag. Liquid AI d1-3B is een beslissingsmodel van 3,12B dat op 7 oktober 2026 met open gewichten is gepubliceerd: je geeft het een toestand en een reeks benoemde vragen, en het retourneert waarschijnlijkheden, een gekozen label en een betrouwbaarheidswaarde, met nul outputtokens en geen generatiestap. Ge​mma 4 12B is Goo​gle's encoder-vrije any-to-any-generalist, een checkpoint van 11,96B dat tekst, afbeelding, audio en video aanneemt en een antwoord schrijft over een venster van 256.000 tokens in meer dan 140 talen. Een van de twee vertelt je welke van vier dingen een printplaat is. De andere vertelt je waarom. Vergelijk ze alleen op kwaliteit en je leert niets, omdat de outputs niet in dezelfde maat te vatten zijn — en de leveranciers hebben ze nooit tegen elkaar gebenchmarkt. Vergelijk ze op wat een aanroep daadwerkelijk retourneert, wat die kost, en waar elk van de twee tegen zijn grenzen aanloopt, en de koppeling wordt een echt nuttige grenstest.

Twee verschillende outputcontracten

Het onderscheid dat hier al het werk doet, is wat er over de lijn terugkomt.

Liquid AI d1-3B retourneert een gestructureerd antwoordobject. Elke vraag in een verzoek declareert een type — noul voor ja/nee met P(ja), choice voor één van een benoemde optieset met een betrouwbaarheid en een waarschijnlijkheid per optie, of score voor een positie op een geordende schaal van twee tot tien niveaus met het verwachte niveau en de bijbehorende verdeling. Het model rapporteert output_tokens: 0 omdat er niets wordt geschreven. Meerdere vragen over één toestand worden uit één enkele forward pass gelezen, en de toestand en de bijbehorende afbeeldingen worden één keer voor allemaal gecodeerd.

Ge​mma 4 12B retourneert proza. Soms retourneert het de JSON waarom je hebt gevraagd, soms retourneert het JSON waarom je niet precies hebt gevraagd, en het kan redeneren voordat het antwoordt. Het is in de eerste plaats een taalmodel: alles wat het weet te classificeren, drukt het uit als tekst. Dat is een sterk punt wanneer het antwoord aan een mens moet worden uitgelegd of aan een vervolgstap moet worden doorgegeven die taal verwacht, en een nadeel wanneer het enige dat je nodig had een waarschijnlijkheid was.

Alles wat stroomafwaarts komt, volgt daaruit. Een d1-3B-respons kan niet onparseerbaar zijn. Die kan zichzelf ook niet uitleggen, en de modelkaart zegt dat ronduit: het is geen chatmodel en het schrijft geen tekst.

Waar de bewijssporen staan

De herkomst van de twee getallensets is niet gelijkwaardig, en dat weegt hier zwaarder dan de getallen zelf.

• Decision Index 0.2.1 — Liquid AI d1-3B scoort 48,57, gescoord door de leverancier met de officiële scorer, als eerste onder modellen onder 10B en vóór Decider 35B-A3B met 47,11. Gemma 4 12B wordt helemaal niet gescoord op de Decision Index, dus deze rij heeft geen tegenhanger.

• Redeneerbenchmarks — Ge​mma 4 12B scoort 77,5 op AIME 2026, 78,8 op GPQA Diamond en 1.659 Codeforces ELO, en heeft een Artificial Analysis Intelligence Index van 22 in de redeneermodus en 13 met redeneren uitgeschakeld. Liquid AI d1-3B heeft geen redeneerbenchmark, omdat een beslissingsmodel geen redeneerspoor produceert om te scoren.

• Lange context — Ge​mma 4 12B accepteert 256.000 tokens en scoort 43,4% op MRCR v2 eight-needle bij 128k op de eigen kaart van Goo​gle. Liquid AI d1-3B accepteert 32.768 tokens. Als je "state" een document van veertig pagina's plus scans is, dan is dat verschil de hele beslissing en het is niet eens dichtbij.

• Visie — Liquid AI d1-3B scoort gemiddeld 74,1 op elf publieke beeldbenchmarks, gelezen als beslissingen over de optieset van elke benchmark, tegenover 73,9 voor de LFM2.5-VL-3B-backbone waarop het is gebouwd, en de leverancier meldt dat het verwijderen van de afbeeldingen dezelfde vragen naar 45,1 laat dalen. De visie van Ge​mma 4 12B is sterker en breder, maar wordt gerapporteerd als generatiekwaliteit, niet als beslissingsnauwkeurigheid over benoemde opties.

• Talen — zestien gedocumenteerd voor Liquid AI d1-3B; meer dan 140 voor Ge​mma 4 12B.

• Snelheid — Liquid AI d1-3B beantwoordt één vraag in 8 ms op een RTX 4090, 16 ms op een Jetson AGX Thor, 26 ms op een Jetson AGX Orin 64 GB en 50 ms op een Jetson Orin Nano, en verwerkt 64 states in één enkele pass met 475 per seconde op de 4090. Ge​mma 4 12B genereert, dus de latentie ervan is een functie van het aantal tokens dat het schrijft.

• Bewijskwaliteit — De resultaten van Ge​mma 4 12B zijn die van Goo​gle, gepubliceerd in juni 2026 en sindsdien door een grote community onder de loep genomen, gekwantiseerd en opnieuw uitgevoerd. Die van Liquid AI d1-3B zijn die van Liquid, twee dagen geleden gepubliceerd, door niemand buiten het lab gereproduceerd. Lees de tweede kolom in dat licht.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

De enige plek waar ze echt concurreren

Er is een echte overlap, en die staat niet op een ranglijst. Het is de LLM-as-a-judge-aanroep.

Tal van productiepijplijnen gebruiken al een middelgrote generalist als beoordelingslaag: de urgentie van dit ticket scoren, beslissen of deze output aan een rubric voldoet, kiezen welke tool de agent als volgende moet aanroepen, controleren of een opgehaalde passage de vraag beantwoordt. Vandaag gaan de meeste van die aanroepen naar een generatief model dat wordt gevraagd een getal of een label als tekst te genereren, en het getal dat het genereert, is wat de sampler heeft geproduceerd in plaats van een softmax over je optieset. Dat is de workflow die Liquid AI d1-3B via post-training moest vervangen, en de gepubliceerde demo's zijn allemaal varianten daarvan — een SQL-predicaat dat ja of nee antwoordt voor 150 supporttickets, een agent-contextcompactielus die elke tool-output behoudt, inkort of laat vallen en 52% van de tokens verwijdert, een app voor visuele inspectie die goede en defecte onderdelen van vier productielijnen sorteerde met een nauwkeurigheid van 85 tot 97% op een taak waarvoor hij nooit was getraind.

Gemma 4 12B doet al die taken, en doet zelfs meer dan die taken. Het kan ook de samenvatting schrijven, een document van 256K in beeld houden, een opgenomen telefoongesprek als invoer nemen en antwoorden in een van de meer dan 140 talen. Als je pipeline een beoordeling en een verslag nodig heeft, doet de 12B twee taken met één aanroep en doet het 3B-beslissingsmodel er één van die twee.

De grens is contextlengte en de vorm van de output. Lange state, gesproken invoer, vele talen, of een uitleg die de lezer verwacht — Ge​mma 4 12B, geen twijfel. Korte state, een vaste set opties, een latentiebudget per verzoek van enkele milliseconden, of een harde garantie dat het antwoord te parsen is — dat is de d1-3B-kolom, en de generalist betaalt voor capaciteit die je niet zult gebruiken.

Wat het kost om elk te bellen

Geen van beide modellen staat in onze catalogus, dus voor geen van beide is er een routeringsprijs om te noemen — Ge​mma 4 12B behoort niet tot de Ge​mma-formaten die wij aanbieden, en Liquid AI d1-3B is open weights die je zelf host of bereikt via de eigen API van de leverancier en platforms van derden. Voor context over de Gemini-aanverwante kant van die familie: de twee Ge​mma 4-formaten die wij wél routeren, zijn geprijsd op $0,06 per miljoen input en $0,33 per miljoen output voor Ge​mma 4 26B A4B, en $0,13 en $0,38 voor Ge​mma 4 31B, beide met contexten van 262.144 tokens en tekst-, afbeeldings- en video-invoer. De mediane providerprijs die elders voor Ge​mma 4 12B wordt genoemd, ligt rond $0,10 en $0,30.

Liquid's gehoste d1 factureert alleen inputtokens, tegen $0,04 per miljoen, waarbij afbeeldingen als input worden geteld tegen 1,5 tokens per patch van 32×32 pixels. Een beslissingsverzoek heeft daardoor helemaal geen regel voor outputtokens, wat de structurele reden is dat de eigen kostenvergelijking van de leverancier met veel grotere modellen uitkomt waar die uitkomt. De open gewichten hebben geen prijs per aanroep; je betaalt in hardware. Beide moeten in dezelfde pipeline zitten als alles wat je verder aanroept, en dat is de laag waarvoor een router bestaat — één API voor 200+ modellen, lijstprijzen van providers doorgegeven tegen 0% opslag, en automatische failover zodat één hapering upstream niet jouw storing wordt. Dat is het leidingwerk rond de vergelijking, niet de vergelijking.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Hoe je eerlijk kunt beslissen

Begin bij het antwoordformaat in plaats van bij het model. Als het downstreamsysteem een waarschijnlijkheid, een label en een betrouwbaarheidsscore kan verwerken, en de antwoordset klein en bekend is, dan is Liquid AI d1-3B geen downgrade ten opzichte van een 12B — het is een ander instrument, en de latentiecijfers maken het een categorisch andere deployment: 50 ms op een Jetson Orin Nano is een apparaat dat absoluut geen 12B hoort te draaien.

Als het antwoord een zin moet zijn, of de toestand langer is dan tweeëndertigduizend tokens, of iemand het gaat uitspreken, of de uitvoertaal Bengaals is, dan is Ge​mma 4 12B de enige van de twee die het werk kan doen en is de vergelijking voorbij voordat ze begint.

De echt nuttige positie voor de meeste teams is beide, op verschillende plekken. Een beslismodel vóór de dure aanroep, dat de triage, de routering en de guardrailcontroles doet die geen taal nodig hebben; een generalist daarachter voor het werk dat taal wel nodig heeft. Dat is dezelfde pijplijn: de een is een filter en de ander is de payload — en de teams die het meest uit de d1-release halen, zijn degenen die al betalen voor een 12B om ja of nee te antwoorden.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.