
Liquid AI d1-3B vs Granite 4.2 3B: Twee 3B-modellen die nooit hetzelfde werk doen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zet Liquid AI d1-3B en Granite 4.2 3B op één en dezelfde GPU en ze passen allebei comfortabel — 3,12B parameters aan de ene kant, 3B aan de andere. Ze zullen zich ook gedragen alsof ze uit verschillende disciplines komen. Granite 4.2 3B, die volgens IBM's eigen modelkaart dateert van 25 augustus 2026, is een redeneermodel: drie denkmodi, een <think> blok, en een antwoord dat je leest. Liquid AI d1-3B, geüpload naar Hugging Face op 5 oktober 2026 en twee dagen later aangekondigd door Liquid, is een beslissingsmodel: het neemt een toestand plus een expliciete set getypeerde vragen en retourneert in één forward pass een waarschijnlijkheid, een label of een positie op een schaal, en rapporteert output_tokens: 0 omdat het nooit iets schrijft. De nuttige vraag is niet welke van de twee beter is. Het is welke van jouw aanroepen eigenlijk een beslissing is, want de twee repo's zijn gebouwd voor tegenovergestelde helften van die splitsing.
Wat zit er eigenlijk in elke repository?
Alles hieronder komt uit de twee modelkaarten en de aankondigingspost van Liquid. Niets hiervan is onafhankelijk gereproduceerd, geen enkele derde partij heeft een van beide modellen op hetzelfde testharnas beoordeeld, en de cijfers in de kaarten zijn die van de leveranciers zelf.
• Grootte — Liquid AI d1-3B, 3,12B totaal, gebouwd op Liquid's LFM2.5-VL-3B; Granite 4.2 3B, een 3B decoder-only dense transformer gebouwd op granite-4.1-3b-base
• Uitvoer — d1-3B retourneert waarschijnlijkheden, labels en betrouwbaarheden en schrijft helemaal geen tekst; Granite 4.2 3B genereert tokens, inclusief een optionele gedachteketen binnen <think> tags
• Context — d1-3B 32.768 tokens; Granite 4.2 3B 128K native, met een long-context-uitbreiding naar 512K op de kaart
• Invoer — d1-3B tekst, JSON, afbeeldingen of een combinatie daarvan, via een SigLIP2 NaFlex 400M vision-encoder; Granite 4.2 3B alleen tekst
• Licentie — d1-3B onder Liquid's LFM Open License v1.0; Granite 4.2 3B onder Apache 2.0
• Talen — d1-3B vermeldt 16; Granite 4.2 3B vermeldt twaalf geteste, waarbij op de kaart staat dat andere niet zijn getest
• Serveren — d1-3B wordt geleverd met aangepaste code (trust_remote_code=True, transformers>=5.14), met GGUF- en w8a8-repo's in dezelfde familie en kaarten gedocumenteerd voor llama.cpp, Ollama en LM Studio; Granite 4.2 3B draait onder vLLM 0.20+ of SGLang 0.5.18+ met een aangepaste thinking-parser
Twee van die regels doen meer werk dan de rest. De outputrij is het hele argument van dit artikel, en de licentierij is degene die niemand in de vergelijkingstabel zet.

De een schrijft een gedachtegang, de ander weigert te schrijven.
Granite 4.2 3B verdient zijn brood door hardop te denken. De modelkaart documenteert drie modi: denken standaard ingeschakeld, niet-denken, en een modus met lage inspanning die het redeneerspoor behoudt maar verkort. De serving stacks scheiden het redeneerspoor van het uiteindelijke antwoord, zodat je applicatie schone inhoud plus een apart redeneerveld ontvangt. Dat is een goed ontwerp voor een vraag die moet worden uitgewerkt — een wiskundeprobleem, een tak van logica, een stuk code dat moet worden geschreven voordat het kan worden beoordeeld.
d1-3B heeft geen dergelijke modus, en op de kaart staat het ronduit: "Het is geen chatmodel en schrijft geen tekst." Een aanroep declareert vragen met een type. noul is een ja/nee die P(ja) tussen 0 en 1 retourneert. choice kiest één label uit een benoemde optieset en retourneert het label, een betrouwbaarheid en een waarschijnlijkheid per optie. score plaatst de toestand op een geordende schaal van twee tot tien en retourneert het verwachte niveau met de bijbehorende verdeling en legenda. Het signaal wordt in één pass uitgelezen uit de logits op een placeholderpositie, niet token voor token gesampled, en daarom kan het usage-blok nul uitvoertokens rapporteren zonder te liegen.
Dat verschil verandert je rekening voordat het je nauwkeurigheid verandert. Een Granite-classificatieaanroep die 400 tokens nadenkt, is een aanroep waarvoor je 400 outputtokens betaalt, en het label dat je wilde, zit begraven in proza dat een parser vervolgens moet zien te achterhalen. Bij een d1-3B-aanroep betaal je alleen voor input. Als het grootste deel van je verkeer een label met een bijbehorende regel is, heb je betaald voor het redeneren, of dat nu wel of niet het label veranderde.
Waar Granite 4.2 3B duidelijk de betere keuze is
Neem de reasoning-benchmarks op hun nominale waarde — ze zijn van IBM zelf, uitgevoerd via een interne NeMo Evaluator-pipeline, en geen enkele externe partij heeft ze gereproduceerd — en de 3B is ongewoon sterk voor zijn formaat: AIME25 78,33, HMMT februari 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78, en RULER 64K 67,52, wat bij 128K zakt naar 55,30.
Uit die lijst volgen vier taken, en d1-3B zit in geen van hen.
Een 128K-native context, uitbreidbaar tot 512K, tegenover 32.768 tokens op d1-3B — als je state een lang document is, wordt de keuze voor jou gemaakt
• Agentische toolaanroep met een gedocumenteerde parser en harness-integraties voor OpenCode, Pi en OpenHands, waarvoor een beslissingsmodel geen equivalent heeft
• Elke taak waarvan het antwoord een alinea is: samenvatten, opstellen, extraheren naar een vrije structuur, codegeneratie
• Fine-tuning en herdistributie zonder omzetplafond, omdat Apache 2.0 geen drempelclausule heeft
Let op wat niet op de Granite-kaart staat: SWE-Bench- en Terminal-Bench-rijen zijn voor de 3B als NA gemarkeerd. IBM's agentische reinforcement-learningfase werd alleen toegepast op de 8B- en 30B-leden van de familie, dus het kleinste model draagt niet de agentische scores die zijn grotere broers en zussen wel hebben. Een team dat "Granite 4.2" leest en aanneemt dat de 3B het agentische profiel van de familie erft, zal verrast zijn.

Waar d1-3B wint voordat Granite klaar is met denken
De eigen latentietabel van Liquid, warm gemeten, één verzoek tegelijk, is het sterkste onderdeel van zijn pleidooi: één enkele vraag in 8 ms op een RTX 4090 en 9 ms op een AMD MI325X, 16 ms op een Jetson AGX Thor en 26 ms op een Jetson AGX Orin 64GB, waarbij 64 states in één pass worden samengepakt met 475/s op de 4090 en 1.106/s op de MI325X. Ter vergelijking: dat is ongeveer de tijd die Granite 4.2 3B nodig heeft om een paar tokens van zijn redeneerspoor te genereren.
Drie vraagtypen over één state kosten d1-3B 21 ms op de 4090 in plaats van drie afzonderlijke aanroepen, omdat de state en de bijbehorende afbeeldingen één keer worden gelezen voor alle vragen. In een moderatie- of routeringsstack die voorheen één HTTP-verzoek per regel afvuurde, is dat het verschil tussen een wachtrij van aanroepen en één.
Het ziet ook. d1-3B scoort een gemiddelde van 74,1 op elf publieke beeldbenchmarks tegenover 73,9 voor zijn basismodel, en de kaart merkt op dat zonder de afbeeldingen dezelfde vragen 45,1 scoren — de antwoorden komen uit de afbeelding, niet uit de tekstprompt. Individuele rijen kunnen beide kanten op worden uitgelegd (CV-Bench 82,1 tegenover 87,6 van het basismodel, POPE 88,5 tegenover 90,1), dus de visieclaim is "gelijk aan het basismodel", niet "beter dan het".
Het eerlijke tegenwicht: de 48,57 van d1-3B op Decision Index 0.2.1 kwam tot stand doordat Liquid zelf de officiële scorer draaide, in plaats van via een inzending voor het leaderboard, en de concurrerende rijen komen van het openbare leaderboard. Het gemiddelde van 77,1 over acht benchmark-as-decision-taken en de 71,8 op DecisionBench zijn eveneens first-party. Alles aan de d1-zijde van deze vergelijking is niet geverifieerd.

Waarom een 3B-redeneerder geen 3B-beslissingsmodel is
De verleidelijke zet is om Granite 4.2 3B te behandelen als een goedkopere vervanger voor d1-3B, of omgekeerd. Beide falen, en het falen is structureel in plaats van een kwestie van kwaliteit.
Vraag je Granite om te beslissen, dan krijg je een generatie die je moet parsen, een rekening die meeschaalt met hoe moeilijk het model de vraag vond, en een latentie die afhangt van de denkmodus die je hebt gekozen. Vraag je d1-3B om te redeneren, dan krijg je helemaal niets — het heeft geen tokenstroom om in te redeneren. De twee modellen bevinden zich aan weerszijden van een grens die de meeste pipelines meerdere keren per verzoek overschrijden: iets moet beslissen, en iets moet spreken. d1-3B hoort vooraan, waar een triageregel een route kiest en een gekalibreerde confidence teruggeeft. Granite 4.2 3B hoort erachter, op de tak waar een antwoord geschreven moet worden.
Er is een tweede, stillere valkuil. De waarde van een beslissingsmodel is calibratie — een betrouwbaarheid van 0,9 die negen van de tien keer juist is. De kaart van Granite 4.2 3B publiceert geen calibratiemetrieken en geen waarschijnlijkheden; het publiceert nauwkeurigheids- en redeneerscores. Het vergelijken van de twee op een benchmarkleaderboard vertelt je niets over welke van hen je met een drempel zou moeten vertrouwen.
Je bent een professionele software-localisatie-engine. Vertaal het bericht van de gebruiker naar het Nederlands. De tekst bevat genummerde span-markeringen zoals {{1}}...{{/1}}, {{2}}...{{/2}}. Houd ELKE markering byte voor byte hetzelfde: dezelfde nummers, dezelfde openende/sluitende paren, hetzelfde, hetzelfde — nooit weglaten, hernummeren of herordenen van de markeringen zelf, vertaal alleen de tekst ertussen. Je MAG een ...{{n}}...{{/n}} verplaatsen naar waar de woordvolgorde van de doeltaal dat vereist. Alle tekst binnen een {{K}}...{{/K}}-span moet EXACT worden weergegeven zoals die is (vertaal die niet). Geef ALLEEN de vertaalde tekst met de bijbehorende markeringen — geen inleiding, geen aanhalingstekens, geen.
Granite 4.2 3B wordt uitgebracht onder Apache 2.0. d1-3B wordt uitgebracht onder de LFM Open License v1.0, die ruimhartig lijkt tot Section 5: commercieel gebruik wordt verleend op voorwaarde dat u of uw juridische entiteit onder een drempel blijft die in hetzelfde document is gedefinieerd als een jaarlijkse omzet van tien miljoen Amerikaanse dollar of meer, en elk commercieel gebruik boven die grens is simpelweg niet gelicentieerd. Non-profitorganisaties en onderzoeksgebruikers zijn uitgezonderd.
Voor een hobbyist of een start-up is dit geen probleem. Voor een bedrijf dat die grens halverwege het jaar overschrijdt — of dat door zo'n bedrijf overgenomen zou kunnen worden — zijn de twee repo's geen gelijkwaardige artefacten, hoe vergelijkbaar hun parameteraantallen er ook uitzien, en de licentiebeoordeling vindt plaats lang nadat iemand het prototype al heeft uitgeleverd. Het is het goedkoopste dat op deze pagina vroeg te controleren valt.
Het paar als één pijplijn uitvoeren
Geen van beide modellen staat vandaag in onze catalogus, dus dit is geen beschikbaarheidsclaim: beide zijn self-hosted artefacten, en Granite 4.2 3B in het bijzonder heeft helemaal geen inference-providers vermeld op zijn kaart. Maar het patroon waar een team uiteindelijk op uitkomt, is één call die beslist en een andere die spreekt, en dat patroon is waar een routeringslaag zijn plek verdient. OrcaRouter zet meer dan 200 modellen achter één API-key met lijstprijzen van providers doorgegeven tegen 0% markup, zodat een prijsverlaging van een leverancier je factuur dezelfde dag bereikt in plaats van bij de volgende contractverlenging, en automatische failover tussen providers betekent dat het gedeelde component in het midden van een pipeline geen single point of failure wordt terwijl je het nog aan het evalueren bent. Als je d1-3B wilt A/B-testen tegen een gehoste generalist op je eigen verkeer voordat je je vastlegt op een self-hosted deployment, dan is de dichtstbijzijnde gerouteerde buur van Granite's afkomst Gemma 4 31B tegen $0,13 per miljoen inputtokens en $0,38 per miljoen output — een veel groter model, maar dezelfde rol van "generalist die schrijft" in de pipeline.
Het vonnis, als regel geformuleerd
Als wat je nodig hebt een beoordeling is — spam of niet, in welke wachtrij, hoe urgent, komt deze afbeelding overeen met die beschrijving — dan is d1-3B de enige van de twee die de klus in één keer klaart, en dat in enkele milliseconden. Als wat je nodig hebt een geschreven antwoord is, het lezen van een lang document, een toolaanroep of een stuk code, dan is Granite 4.2 3B degene die überhaupt een tokenstroom heeft, en de redeneerscores van de 3B zijn oprecht indrukwekkend voor zijn formaat — op de eigen evaluaties van IBM, die nog door niemand zijn gecontroleerd.
Wat het beeld zou veranderen, is niet een nieuwe benchmarkrij. Het is een derde partij die beide modellen op hetzelfde kalibratieharnas scoort, want de eigenschap die bepaalt of je een drempel op een model kunt zetten, is juist degene die geen van beide kaarten je vandaag laat vergelijken.
