
Liquid AI d1-3B vs Qwen 3 8B: Moet een 8B-classificatieworkload naar een Decision Model worden verplaatst?
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?
Wat je een 8B eigenlijk betaalt om te doen
Zet de twee outputcontracten naast elkaar en de inefficiëntie is structureel in plaats van incrementeel.
Een Qwen 3 8B-classificatieaanroep is een generatie. Je schrijft een prompt die de labels beschrijft, het model redeneert optioneel over de invoer — en bij dit model kun je dat redeneren per verzoek aan- of uitzetten, wat de meest nuttige knop is die het voor dit soort werk heeft — en dan schrijft het een antwoord terug. Dat antwoord is tekst. Als je om JSON hebt gevraagd, krijg je meestal JSON, en soms krijg je JSON midden in een zin, of een inleiding, of een afsluitende uitleg die je niet wilde. Het label dat je belangrijk vindt, staat ergens in de tokenstroom, en een parser haalt het eruit. Je betaalt voor elke token die het model schrijft, inclusief de tokens die je weggooit.
Liquid AI d1-3B heeft geen tokenstream. Vragen worden gedeclareerd met een type: noul voor ja/nee, beantwoord als P(ja) tussen 0 en 1; choice voor één label uit een benoemde optieset, beantwoord als het label plus een betrouwbaarheidsscore plus een waarschijnlijkheid per optie; score voor een positie op een geordende schaal van twee tot tien, beantwoord als het verwachte niveau met zijn verdeling en legenda. Het antwoord bevat een lopend totaal dat output_tokens: 0 weergeeft. Er is niets te parsen omdat er niets is geschreven, en er is een ruwe probabilities-accessor wanneer je de niet-afgeronde verdeling wilt in plaats van de argmax.
Het deel dat je factuur verandert, is wat er gebeurt bij meerdere vragen. Eén state kan er veel bevatten: is dit een terugbetalingsverzoek, welk team moet het oppakken, hoe urgent is het. De state en zijn afbeeldingen worden één keer gelezen, en Liquid meldt dat drie vragen over één state 1,3x de tijd van één kosten in plaats van 3x. Wat het niet samenvoegt, is de inputkosten — de factureringsnotitie van de leverancier stelt expliciet dat elke vraag als een eigen prompt wordt gefactureerd, inclusief de tekst en alle afbeeldingen ervan. Minder latentie, dezelfde inputtokens. Dat is een eerlijke asterisk bij de kop, en het is het soort ding dat je alleen ontdekt door de prijsparagraaf te lezen in plaats van de benchmark.

Wat zestien maanden Qwen 3 8B je oplevert
Voordat je het kleinere model als een upgrade behandelt, moet je precies zijn over wat het huidige model meebrengt, want het is meer dan het aantal parameters.
• Context — Qwen 3 8B draait native 32.768 tokens en breidt uit naar 131.072, gevalideerd via YaRN. Liquid AI d1-3B blijft beperkt tot 32.768 tokens, zonder gedocumenteerd uitbreidingspad. Voor een toestand die een lang document is, is de 8B de enige van de twee die dit kan bevatten.
• Talen — 119 talen en dialecten voor Qwen 3 8B tegenover zestien gedocumenteerde voor Liquid AI d1-3B.
• Redeneerbeheer — Qwen 3 8B laat je het denken per verzoek aan- of uitzetten. Liquid AI d1-3B heeft geen redeneermodus om te beheren, wat ofwel een vereenvoudiging ofwel een beperking is, afhankelijk van waarvoor je het denken gebruikte.
• Breedte — de 8B schrijft, legt uit, vat samen, vertaalt en programmeert. Liquid AI d1-3B doet geen van die dingen. In de modelkaart staat het ronduit: het is geen chatmodel en het schrijft geen tekst.
• Bewijs — Qwen 3 8B heeft zestien maanden openbare benchmarking, kwantisatie, fine-tuning en productiegebruik. De Decision Index-score van 48,57 van Liquid AI d1-3B werd door Liquid geproduceerd met behulp van de officiële scorer in plaats van ingediend bij het openbare leaderboard, en deze is enkele dagen oud zonder reproductie door derden.
• Vision — deze rij loopt de andere kant op. Liquid AI d1-3B verwerkt afbeeldingen, waarbij de leverancier 74,1 rapporteert over elf openbare beeldbenchmarks, die worden geïnterpreteerd als beslissingen over de optieset van elke benchmark, en meldt dat het verwijderen van de afbeeldingen dezelfde vragen tot 45,1 doet instorten. De Qwen 3 8B, die alleen tekst aankan, heeft daarvoor een apart visiemodel nodig dat ervoor wordt geplaatst.
• Snelheid — één vraag in 8 ms op een RTX 4090, 16 ms op een Jetson AGX Thor, 50 ms op een Jetson Orin Nano, en 64 gepakte toestanden per pass met 475 per seconde op de 4090. Een op generatie gebaseerde classifier heeft geen vergelijkbaar getal, omdat de latentie ervan afhangt van hoe lang het antwoord is.
De eerlijke samenvatting is dat de 8B het betere algemene instrument is en het 3B-beslissingsmodel het betere gespecialiseerde, en de enige vraag die ertoe doet, is hoeveel van je verkeer het gespecialiseerde geval is.
De kostenberekening, zorgvuldig uitgevoerd
Dit is waar de vergelijking zichzelf wel of niet terugbetaalt, dus het loont om dit met echte structuur te doen in plaats van met een slogan.
De bewering die Liquid twee dagen voor de open-weights-release publiceerde, is dat zijn gehoste beslissingsmodel op vier van de zes echte toepassingen GPT-6.1 Sol evenaart of verslaat, tegen 19x tot 200x lagere kosten, en bij elke taak sneller antwoordt. Lees de methodologie voordat je dit herhaalt: elke toepassing werd op 5 oktober 2026 één keer per model uitgevoerd, de chatmodellen antwoordden in JSON met hun standaard redeneerinstelling, en de kosten van d1 werden berekend op $0,04 per miljoen invoertokens. Dat bedrag van $0,04 is het gehoste d1-invoertarief, en het is het enige tarief dat bestaat — er is geen uitvoerregel om aan toe te voegen.
Bouw nu dezelfde vorm van schatting voor een Qwen 3 8B-classificator, en de asymmetrie is zichtbaar zonder de providerprijs van wie dan ook te citeren. De 8B heeft twee factureerbare regels waar het beslissingsmodel er één heeft, en de tweede regel is degene die groeit: een classificatie die eerst redeneert, betaalt voor het redeneren, en een classificatie die padding aan zijn JSON toevoegt, betaalt voor de padding. De invoerkosten van het beslissingsmodel worden bepaald door de toestand en de vragen. Die van de 8B worden door niets bepaald dat je alleen uit de toestand kunt voorspellen.
Twee tegenwichten voorkomen dat dit een afstraffing wordt. Ten eerste brengt het beslissingsmodel elke vraag als een eigen prompt in rekening, dus vijf vragen over één lang document vervijfvoudigt de input — de 8B stelt alle vijf in één call en betaalt het document maar één keer. Ten tweede, en belangrijker, kan een beslissingsmodel alleen vragen beantwoorden die het post-getraind is om in die vorm te beantwoorden. Alles wat een uitleg, een samenvatting of een in woorden uitgedrukt oordeel vereist, brengt je terug bij de generalist en, in de praktijk, terug bij het betalen voor beide.

Waar de twee echt goed in zijn
Haal de benchmarking eruit en de split is schoner dan de parameteraantallen doen vermoeden.
Liquid AI d1-3B is bedoeld voor het ja/nee, het kiezen uit een lijst en de beoordeling, met een latentieondergrens die niets generatiefs haalt, op hardware waaronder een Jetson Orin Nano op 50 ms en een laptop. De toepassingen die Liquid in oktober demonstreerde, waren allemaal varianten op dat patroon — een SQL-predicaat dat ja of nee antwoordt voor 150 supporttickets, een agent-contextcompactielus die elke tool-uitvoer behoudt, inkort of laat vallen en 52% van de tokens verwijdert, een inspectie-app die goede en defecte onderdelen van vier productielijnen sorteert met 85 tot 97% nauwkeurigheid voor een taak waarvoor hij nooit was getraind en die hij begreep uit een korte beschrijving. Die laatste demo is de duidelijkste formulering van waar de categorie voor dient: een taak waarbij het antwoord een van een paar dingen is, de toestand een afbeelding is, en er nooit om een uitleg is gevraagd.
Qwen 3 8B is voor het werk dat als taal terug moet komen, of 119 talen moet beslaan, of een document van meer dan tweeëndertigduizend tokens moet bevatten, of hardop moet redeneren voordat het een beslissing neemt. Het is ook het juiste antwoord wanneer de classificatie niet een van de drie bovenstaande vormen is — wanneer de labelset open is, wanneer de criteria zo genuanceerd zijn dat je het denkwerk wilde, wanneer dezelfde aanroep zowel het makkelijke als het moeilijke geval moet afhandelen zonder dat je tussen twee modellen hoeft te routeren. En het is de veilige keuze wanneer een reviewer vraagt welke onafhankelijke benchmarks er bestaan, want het antwoord is: heel veel, tot anderhalf jaar terug.
De teams die dit goed doen, maken geen keuze. Ze zetten het beslissingsmodel vóór de generalist, op het deel van het verkeer waar het antwoord een getal is, en laten de 8B alles afhandelen wat een zin nodig heeft. Het filter is 3B en 8 ms; de 8B blijft voor de payload.
Het paar implementeren
Liquid AI d1-3B verschijnt als gewichten waarbij het implementatiewerk al gedaan is: ondersteuning voor llama.cpp vanaf dag één, de volledige NVIDIA-stack van DGX tot Jetson, NVFP4-kwantisatie, een 8-bits variant met gewichten en activaties, en GGUF-conversies op Hugging Face. Qwen 3 8B heeft het diepste selfhosting-ecosysteem van alle modellen in deze gewichtsklasse. Geen van beide staat in onze catalogus, en niets hier is een beschikbaarheidsclaim voor een van beide — de gehoste route voor Liquid AI d1-3B is de eigen API van de leverancier en platforms van derden, waar de gehoste d1 uitsluitend op inputtokens wordt geprijsd tegen $0,04 per miljoen, waarbij afbeeldingen worden gefactureerd tegen 1,5 token per patch van 32×32 pixels.
Zodra beide in dezelfde pipeline zitten, is het routeringsprobleem niet langer theoretisch. Je hebt een klein model dat je zelf bezit, een 8B die je kunt hosten of huren, en de generatieve calls die je zeker huurt — en per verzoek beslissen welke daarvan een bepaalde input moet raken, is precies de beslissing waarvoor een routeringslaag bestaat. Eén endpoint voor 200+ modellen, lijstprijzen van providers doorgegeven tegen 0% opslag zodat een prijswijziging van een leverancier dezelfde dag nog live staat aan jouw kant, automatische failover zodat een slechte middag bij een upstream niet jouw storing wordt. Wanneer je classificatieverkeer in miljarden calls per jaar wordt gemeten, is die laag waar de besparingen van een 3B-beslissingsmodel daadwerkelijk worden geïncasseerd.
Het vonnis
Als je 8B gesloten vragen krijgt — is dit toxisch, is dit relevant, in welke wachtrij hoort dit, hoe urgent is het — betaal je de tweeregelige rekening van een generalist en de latentie van een generatie voor een label, en Liquid AI d1-3B is een directe vervanging met een zwakkere bewijsketen en een echt licentieverschil om af te wegen. Accepteer het 32K-contextplafond, de zestien talen, en het feit dat niemand buiten Liquid het nog heeft gescoord.
Als jouw 8B wordt gevraagd om uit te leggen, samen te vatten, te vertalen, een lang document vast te houden of te redeneren voordat hij beslist, geldt deze vergelijking niet voor jou. Houd de 8B, en beschouw het beslissingsmodel alleen als een voorfilter voor het verkeer dat je vooraf als het gemakkelijke soort kunt identificeren.
Het interessante getal om in de gaten te houden is niet de benchmarkscore van een van beide modellen. Het is hoe snel de eerste onafhankelijke reproductie van de d1 Decision Index beschikbaar komt, want dat is het moment waarop de vergelijking ophoudt een claim van een leverancier te zijn en een feit wordt waarop je kunt plannen.

