Een hero-titelkaart met als kop 'Liquid AI d1-3B vs Intern-Decision-4B' en als ondertitel 'welke gekalibreerde beslisser heb je nodig?', met links een kaart met het label d1-3B en de chips '32.768 tokens' en '8 ms op een RTX 4090', rechts een kaart met het label Intern-Decision-4B en de chips 'limiet van 8.192 tokens' en '44 ms op een RTX 4090', en daaronder een brede strook met de tekst 'beide retourneren kansen, geen tekst'.
Guides & Insights

Liquid AI d1-3B vs Intern-Decision-4B: Welke gekalibreerde beslisser heb je nu echt nodig?

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee open-weightmodellen beantwoorden nu vragen door niets te schrijven, en tot je hun I/O-schema's naast elkaar legt, lijken ze hetzelfde idee in tweevoud. Liquid AI d1-3B, op 5 oktober 2026 geüpload naar Hugging Face en twee dagen later aangekondigd door Liquid, is een 3,12B multimodaal beslissingsmodel waarvan de modelkaart botweg zegt dat het "geen chatmodel is en geen tekst schrijft." Intern-Decision-4B van InternLM, op 26 september 2026 stilletjes geüpload naar de InternLM-organisatie zonder blogpost, tweet of lanceringspagina erachter, is een 4B-beslissingsmodel dat op basis van Qwen3.5-4B is fine-tuned en dat eveneens in één forward pass een antwoorddistributie voor elke vraag retourneert. Aan de oppervlakte hetzelfde contract. De verschillen daaronder — een licentie die het je lastig zal maken, een contract dat per ongeluk tekst kan schrijven, en machines die niemand heeft vergeleken — bepalen welke van de twee in je stack thuishoort.

Hoe dicht de twee eigenlijk bij elkaar zijn

Het eerste dat je helder moet krijgen, is hoeveel van deze vergelijking een gelijkspel is. Beide modellen nemen een toestand en een schema van benoemde vragen, beide lezen het signaal uit de logits op een placeholderpositie in plaats van te samplen, beide zijn multimodaal, en beide melden dat ze niets hebben geschreven. Wat betreft de vorm van de aanroep zijn ze vrijwel identiek, en de interessante verschillen zitten in de details aan de randen.

• Grootte — Liquid AI d1-3B 3,12B in totaal, gebaseerd op Liquid's LFM2.5-VL-3B; Intern-Decision-4B 4B (ongeveer 4,54B volgens het aantal tensors dat de kaart vermeldt), fine-tuned op basis van Qwen3.5-4B

• Vraagtypen — d1-3B en Intern-Decision-4B gebruiken dezelfde drie: noul voor ja/nee, choice voor één uit een benoemde set, score voor een punt op een geordende schaal

• Antwoordvelden — d1-3B retourneert het antwoord plus confidence en waarschijnlijkheden; het InternLM-schema retourneert verdelingen plus een confidencewaarde waarvan de modelkaart waarschuwt dat deze geen gekalibreerde waarschijnlijkheid is

Invoerlimiet — d1-3B 32.768 tokens context; Intern-Decision-4B een plafond van 8.192 tokens dat langere verzoeken ronduit weigert in plaats van ze af te kappen, waarbij afbeeldingen tegen die limiet worden meegeteld

• Licentie — d1-3B onder Liquid's LFM Open License v1.0, Apache 2.0 aan de InternLM-kant

• Talen — d1-3B vermeldt 16; de kaart van Intern-Decision-4B vermeldt er geen

• Interface — d1-3B wordt geleverd als een model dat je laadt en aanroept met trust_remote_code=True; Intern-Decision-4B wordt geleverd als een Python-bibliotheek die je pip install, met één geïmplementeerde backend en het eigen modelveld van het verzoek dat expliciet niet van checkpoint kan wisselen

• Eigen score van leveranciers — d1-3B 48,57 op de publieke split van Decision Index 0.2.1; Intern-Decision-4B 90,02 gemiddeld over zijn eigen tabel met zeven sets, met een Brier-score van 0,347 en een verwachte kalibratiefout van 0,065

Die laatste twee getallen zijn niet vergelijkbaar, en ze als een scorebord behandelen zou de allergemakkelijkste fout zijn die je op deze pagina kunt maken. Ze komen uit verschillende testharnassen, verschillende vragensets en verschillende scoresystemen.

A two-column scoreboard for Liquid AI d1-3B and Intern-Decision-4B. The d1-3B column reads: Decision Index 48.57; parameters 3.12B; context 32,768 tokens; licence LFM Open License v1.0; calibration metric not published; one question 8 ms on an RTX 4090. The Intern-Decision-4B column reads: Decision Index not scored on it; parameters about 4.54B; context 8,192-token cap; licence Apache 2.0; calibration metric Brier 0.347, ECE 0.065; one question 44 ms on an RTX 4090. The footer reads 'Both columns vendor-reported from different harnesses; not comparable, not independently scored.'

Kalibratie is het hele product, en slechts één van hen staat er in druk achter

Een beslissingsmodel is alleen zijn latentie waard als het getal dat het naast het antwoord teruggeeft, iets betekent. Dat is wat kalibratie is: een opgegeven vertrouwen van 0,9 zou ongeveer negen van de tien keer juist moeten zijn, en een model dat zelfverzekerd en fout is, is erger dan een model dat zegt het niet te weten.

InternLM is degene die zich hiermee bezighoudt. De bijbehorende kaart documenteert een gefitte temperatuur van 1,99241824, afgeleid via minimalisatie van de negatieve log-likelihood over 1.728 aangewezen kalibratiecases, met 1.693 achtergehouden voor validatie, en weergegeven met acht decimalen zodat die kan worden gereproduceerd. Er wordt ook een pilot met voor- en nameting over 96 cases gepubliceerd die laat zien dat het mechanisme werkt in plaats van dat te beweren: Brier 0,628 en ECE 0,213 vóór kalibratie tegenover 0,550 en 0,089 erna. Brier en ECE zijn de twee standaardmaten voor de vraag of opgegeven waarschijnlijkheden eerlijk zijn, en de beweging is groot.

Liquid publiceert geen equivalent. De eigen kaart van d1-3B bevat accuracy-achtige benchmarks — SQuAD 2.0 85,3, Civil Comments 93,0, MASSIVE intent 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, een gemiddelde van 77,1 — naast zijn 48,57 op de Decision Index, en het opgegeven verkoopargument van het model is gekalibreerde getypeerde antwoorden. Maar er is geen ECE-rij, geen Brier-rij en geen gepubliceerde gefitte temperatuur.

Die asymmetrie betekent niet dat de afstammeling van Qwen3.5-4B beter gekalibreerd is dan een 3B die op LFM2.5-VL-3B is gebouwd; ze betekent dat er van deze twee kaarten één je de berekening geeft om de bewering te reproduceren en de andere je de bewering geeft. Als je pipeline een drempel op een betrouwbaarheidsscore zet — routeer boven 0,8, escaleer onder 0,4 — kun je de InternLM-kant vanavond valideren en kun je de Liquid-kant alleen steekproefsgewijs controleren.

De kanttekening geldt in beide richtingen. Beide sets cijfers zijn eigen data. Geen van beide modellen is door een onafhankelijke partij beoordeeld, en de kalibratieclaims van InternLM berusten op InternLM's eigen pilot met 96 gevallen tegen InternLM's eigen fit.

De licentie die je om een nummer vraagt

Intern-Decision-4B is Apache 2.0, overgenomen van Qwen3.5-4B, met de upstream-kennisgevingen behouden — commercieel gebruik, herdistributie, fine-tuning, nergens een vraag over omzet.

d1-3B valt onder Liquid's LFM Open License v1.0, en Sectie 5 is het deel dat niemand leest totdat de inkoopafdeling dat wel doet. Commercieel gebruik wordt alleen toegestaan op voorwaarde dat u of uw juridische entiteit onder een Drempel blijft, in datzelfde document gedefinieerd als een jaarlijkse omzet van tien miljoen Amerikaanse dollar of meer; gebruik daarboven is simpelweg niet gelicentieerd. Non-profitorganisaties en onderzoeksgebruikers zijn uitgezonderd.

Voor een individu of een klein team zijn beide gratis. Voor alles met een financiële afdeling zijn de twee repo's verschillende producten, en het verschil is een getal waar je wel of niet boven zit.

De staart van de benchmarktabel van d1-3B is de echte claim.

Het meest in het oog springende cijfer op de kaart van Liquid is 48,57 op Decision Index 0.2.1, beter dan de andere sub-10B-rijen in een tabel die loopt van Winnow-12B met 50,02 tot Decider 2B met 28,97. Wat dat getal het vermelden waard maakt, is de discriminatie-index die eronder staat. Op de eigen subscores van de Decision Index scoort d1-3B 74,5 op Tools en 36,3 op Arts, terwijl het slechts 23,8 op Knowledge haalt — tegenover Decider 35B-A3B, een 36B mixture-of-experts-model dat 12x zo groot is en 56,5 op Tools, 32,6 op Arts en 31,8 op Knowledge scoort.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the paragraph that releases d1-3B and d1-omni-600M as open-weight models, the Decision Index v0.2.1 score of 48.57 with the claim that it is ahead of every model under 10B and on par with Decider 35B-A3B, and the 8 ms RTX 4090 latency line.

Met andere woorden: de 3B is geen klein model dat uniform een beetje slechter is. Het is een klein model dat ongewoon sterk is in gestructureerde beslissingen in toolstijl en ongewoon zwak in vragen waarvoor wereldkennis nodig is, en het verslaat de 36B op de twee categorieën die het meest lijken op de taak waarvoor het is gebouwd. Als je beslissingen van het type "welke van deze vijf genoemde acties" en "is dit gebaseerd op de opgehaalde passage" zijn, speelt het grootteverschil een kleinere rol dan je zou verwachten. Als je beslissingen leunen op feiten die het model al moet kennen, verwacht dan dat de 23.8 opduikt.

Er is een tweede versie van dat argument aan de visiekant. d1-3B scoort gemiddeld 74,1 op elf publieke beeldbenchmarks, tegenover 73,9 voor zijn eigen basismodel, en als de afbeeldingen worden weggelaten, scoren dezelfde vragen 45,1 — dus bij beeldvragen komen de antwoorden echt uit het beeld. Het is gelijkwaardig aan zijn basismodel in plaats van beter, en de rijen per benchmark vallen beide kanten op: CV-Bench 82,1 tegen 87,6, POPE 88,5 tegen 90,1, BLINK 59,2 tegen 58,7.

Ook opmerkelijk is de pauze in de InternLM-kaart: de hoge totaalscore komt voort uit vraaggestuurde taken zoals Typed Decision 80,55 en ToolACE 96,45, terwijl Jevbench-Hard op 73,87 staat. Waar het schema moeilijk wordt, daalt de score.

Snelheid: de kloof zit niet waar je het verwacht.

d1-3B adverteert met 8 ms voor één vraag op een RTX 4090 en 9 ms op een MI325X, 21 ms voor drie vragen die één toestand delen, 16 ms op een Jetson AGX Thor, en een gepakte doorvoer van 475 beslissingen per seconde op de 4090 en 1.106 op de MI325X.

De kaart van Intern-Decision-4B meet op dezelfde RTX 4090 gemiddeld 44,16 ms end-to-end, met een mediaan van 44,03 ms en 44,60 ms bij P95.

Dat ziet eruit als een 5x-winst, en dat is het niet, omdat de twee verschillende dingen meten. Liquid's cijfers zijn warme modelaanroepen, één verzoek tegelijk, waarbij kernelselectie en compilatie vooraf zijn betaald — de kaart zegt expliciet dat een enkele vraag 16 ms kost op de 4090 zonder CUDA-graphcompilatie, en dat de eerste aanroep met een nieuwe CUDA-graph de compilatie betaalt. InternLM's 16 ms is per query end-to-end via een bibliotheek waarvan de enige geïmplementeerde backend lokale Hugging Face-inference is, dus het draagt de omliggende machinerie met zich mee. Geen van beide getallen is fout. Zet beide onder één harness, op één machine, op dezelfde vorm van taak, en het verschil krimpt tot iets dat je zou willen meten in plaats van aannemen.

Wat niet ter discussie staat, is het plafond. 8.192 tokens is een harde weigering aan de InternLM-kant, en afbeeldingstokens gaan van hetzelfde budget af, dus een lang document plus een screenshot is een verzoek dat wordt afgewezen in plaats van afgekapt. d1-3B geeft je 32.768 tokens om mee te werken. Als je states tickets en korte uitwisselingen zijn, krijg je nooit last van die kloof. Als ze paginagroot zijn, beslist die de kwestie voordat welke benchmark dan ook dat doet.

Voer ze uit als een panel, niet als een swap.

Het beantwoorden van een specifieke ja/nee-vraag en het beantwoorden van "welke van zes genoemde dingen is dit, en hoe zeker ben je" zijn verschillende opdrachten, en de twee kaarten zijn dusdanig anders gevormd — de ene met een hard invoerplafond en een gepubliceerde kalibratiefit, de andere met 32K context en een betere scorende staart — dat de nuttige inzet voor een team dat beide evalueert vaak geen vervanging is maar een panel: dezelfde toestand voorgelegd aan beide modellen, waarbij meningsverschillen worden doorgestuurd naar een mens of naar een groter model.

Geen van beide modellen staat in onze catalogus, en dit is geen beschikbaarheidsclaim; beide zijn zelfgehoste artefacten. Maar een panel is precies de vorm waarin een routeringslaag het werk doet in plaats van het papierwerk. OrcaRouter stelt meer dan 200 modellen beschikbaar achter één API-sleutel met lijstprijzen van providers doorgegeven met 0% opslag — dus wanneer een leverancier die je via ons routeert zijn prijs verlaagt, beweegt je factuur dezelfde dag mee — en automatische failover tussen providers voorkomt dat een panel met twee modellen twee single points of failure wordt. De modellen die je vandaag routeert zijn niet deze twee; het zijn de gehoste generalisten die je zou vervangen, zoals Qwen3.5-27B tegen $0.086 per miljoen inputtokens en $0.688 per miljoen outputtokens, wat het getal is dat een zelfgehoste 3B moet verslaan zodra je de GPU hebt meegerekend.

Wat deze week te doen

Als je beslissingen korte toestanden zijn, de licentie de beoordeling door je bedrijf moet doorstaan, en je het breedste scala aan build-targets wilt — llama.cpp, Ollama, LM Studio, een packed batch-pad dat 64 toestanden in één pass verwerkt — dan is d1-3B de meer geproductiseerde van de twee en is zijn tool-and-arts-discriminatie het sterkste dat een van beide kaarten laat zien. Als je beslissingen over lange toestanden lopen, of je een licentie zonder omzetclausule nodig hebt, of je een kalibratiefit wilt die je kunt reproduceren en een testharnas waarin de kosten eromheen al zijn meegerekend, dan is Intern-Decision-4B degene waarvan je het papierwerk daadwerkelijk kunt controleren.

A capture of the Hugging Face model card for internlm/Intern-Decision-4B, showing the Apache 2.0 licence, the 5B safetensors file size, the description of a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution for every question in one forward pass, the download count of 2,756 for the last month, and the tags qwen3_5, decision-making and multimodal.

Het ongemakkelijke deel is voor beide hetzelfde: geen enkele onafhankelijke partij heeft een van beide modellen gedraaid, en er bestaat geen kalibratievergelijking die niet is uitgevoerd in opdracht van de leverancier die de kaart heeft geschreven. Voor een modelklasse waarvan de hele waarde de betekenis is van een getal naast een antwoord, is dat het gat dat het waard is om te dichten voordat je ergens een drempel op zet.