Ett hero-rubrikkort med rubriken 'Liquid AI d1-3B vs Qwen 3 8B' och underrubriken 'bör en 8B-klassificeringsarbetsbelastning flyttas ned?', som visar en pipeline där en inkommande förfrågan förgrenar sig till en liten d1-3B-ruta märkt 8 ms och 0 utdatatokens samt en större Qwen 3 8B-ruta märkt skriver ett svar, med etikett- och poängchips som lämnar den lilla rutan och ett proschip som lämnar den stora.
Guides & Insights

Liquid AI d1-3B vs Qwen 3 8B: Bör en 8B-klassificeringsarbetsbelastning flyttas till en beslutsmodell?

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Någonstans i de flesta produktionsstackar finns en Qwen 3 8B som får betalt för att svara ja eller nej. Den modererar en kommentar, taggar ett supportärende, avgör om en hämtad passage är relevant eller poängsätter en annan modells utdata mot en bedömningsmall – och det gör den genom att generera text som något nedströms sedan parsar. Liquid AI d1-3B, den 3,12B beslutsmodellen som Liquid AI släppte med öppna vikter den 7 oktober 2026, finns till för att göra exakt det jobbet utan att generera någonting: ett tillstånd in, en uppsättning namngivna frågor in och sannolikheter, etiketter och konfidensvärden ut i en enda framåtpassning med noll utdatatokens. Qwen 3 8B är leverantörens arbetshäst med öppna vikter från april 2025 – ungefär 8,2B täta parametrar, 119 språk, tänkande på eller av per begäran och sexton månaders community-driftsättning bakom sig. Frågan som den här kombinationen egentligen ställer är snäv och praktisk: för den del av din trafik som utgörs av klassificering, är en 8B-generalist det billigaste sättet att få en etikett 2026, eller har formen på det jobbet förändrats under den?

Vad du faktiskt betalar en 8B för att göra

Ställ de två utdatakontrakten sida vid sida, och ineffektiviteten är strukturell snarare än inkrementell.

Ett klassificeringsanrop till Qwen 3 8B är en generering. Du skriver en prompt som beskriver etiketterna, modellen resonerar eventuellt om indata – och i den här modellen kan du slå på eller av det resonemanget per begäran, vilket är den enskilt mest användbara inställningen den har för den här typen av arbete – och sedan skriver den tillbaka ett svar. Det svaret är text. Om du bad om JSON får du oftast JSON, och ibland får du JSON inuti en mening, eller en inledning, eller en avslutande förklaring som du inte ville ha. Etiketten du bryr dig om finns någonstans i tokenströmmen, och en parser hämtar den. Du debiteras för varje token som modellen skriver, inklusive de du kastar bort.

Liquid AI d1-3B har ingen tokenström. Frågor deklareras med en typ: noul för ja/nej, besvaras som P(ja) mellan 0 och 1; choice för en etikett från en namngiven alternativuppsättning, besvaras som etiketten plus en konfidens plus en sannolikhet per alternativ; score för en position på en ordnad skala från två till tio, besvaras som den förväntade nivån med dess fördelning och teckenförklaring. Svaret innehåller en löpande summa som visar output_tokens: 0. Det finns inget att parsa eftersom inget skrevs, och det finns en rå probabilitiesåtkomst när du vill ha den oavrundade fördelningen i stället för argmax.

Den del som ändrar din faktura är vad som händer med flera frågor. Ett tillstånd kan bära många: är detta en återbetalningsbegäran, vilket team bör äga den, hur brådskande är den. Tillståndet och dess bilder läses en gång, och Liquid rapporterar tre frågor över ett tillstånd som kostar 1,3x tiden för en i stället för 3x. Det den inte slår samman är indatakostnaden — leverantörens faktureringsnotis är tydlig med att varje fråga faktureras som en egen prompt, inklusive dess text och alla dess bilder. Lägre latens, samma indatatokens. Det är en ärlig asterisk på rubriken, och det är sådant man bara hittar genom att läsa prissättningsstycket i stället för benchmarken.

A two-column scoreboard for Liquid AI d1-3B and Qwen 3 8B. The d1-3B column reads: job a closed question answered; 3.12B parameters; output tokens billed 0; 32,768-token context; image input yes; one question in 8 ms on an RTX 4090. The Qwen 3 8B column reads: job text in, text out; about 8.2B dense parameters; output tokens billed every one it writes; 32,768 native context extending to 131,072 via YaRN; image input no; one answer as long as the answer is. The footer reads 'd1-3B figures vendor-reported; Qwen 3 8B figures per Alibaba, April 2025.'

Vad sexton månader av Qwen 3 8B ger dig

Innan du betraktar den mindre modellen som en uppgradering, var noga med att precisera vad den nuvarande modellen bidrar med, eftersom det är mer än bara antalet parametrar.

• Kontext — Qwen 3 8B hanterar 32 768 tokens inbyggt och utökar till 131 072 validerat via YaRN. Liquid AI d1-3B hanterar 32 768 tokens utan utökning, med ingen dokumenterad utökningsväg. För ett tillstånd som utgörs av ett långt dokument är 8B den enda av de två som kan hålla det.

• Språk — 119 språk och dialekter för Qwen 3 8B jämfört med sexton dokumenterade för Liquid AI d1-3B.

• Resonemangsstyrning — Qwen 3 8B låter dig slå på eller av tänkande per begäran. Liquid AI d1-3B har inget resonemangsläge att styra, vilket antingen är en förenkling eller en begränsning beroende på vad du använde tänkandet till.

• Bredd – 8B skriver, förklarar, sammanfattar, översätter och kodar. Liquid AI d1-3B gör inget av detta. I dess kort står det klart och tydligt: den är inte en chattmodell och den skriver inte text.

Bevis — Qwen 3 8B har sexton månader av offentlig benchmarking, kvantisering, finjustering och produktionsanvändning. Liquid AI d1-3B:s Decision Index-poäng på 48.57 togs fram av Liquid med den officiella poängsättaren i stället för att skickas in till den offentliga resultattavlan, och den är bara några dagar gammal utan någon tredjepartsreproduktion.

• Vision – den här raden går åt andra hållet. Liquid AI d1-3B tar emot bilder, och leverantören rapporterar 74,1 över elva offentliga bildbenchmarks tolkade som beslut över varje benchmarks alternativuppsättning, och rapporterar att om man tar bort bilderna kollapsar samma frågor till 45,1. Den textbaserade Qwen 3 8B behöver en separat visionsmodell framför sig för något av detta.

• Hastighet — en fråga på 8 ms på ett RTX 4090, 16 ms på en Jetson AGX Thor, 50 ms på en Jetson Orin Nano, och 64 packade tillstånd per pass vid 475 per sekund på 4090. En generationsbaserad klassificerare har ingen jämförbar siffra, eftersom dess latens beror på hur långt svaret är.

Den ärliga sammanfattningen är att 8B är det bättre generella instrumentet och 3B-beslutsmodellen det bättre specialiserade, och den enda fråga som spelar roll är hur mycket av din trafik som är det specialiserade fallet.

Kostnadsaritmetiken, utförd noggrant

Det är här jämförelsen antingen betalar sig eller inte, så det är värt att göra med verklig struktur snarare än en slogan.

Påståendet som Liquid publicerade två dagar före släppet av öppna vikter är att dess hostade beslutsmodell matchar eller slår GPT-6.1 Sol i fyra av sex verkliga applikationer, med 19x till 200x lägre kostnad, och svarar snabbare på varje uppgift. Läs metodiken innan du upprepar den: varje applikation kördes en gång per modell den 5 oktober 2026, chattmodellerna svarade i JSON med sin standardinställning för resonemang, och d1:s kostnad beräknades till 0,04 USD per miljon indatatoken. Den siffran på 0,04 USD är det hostade d1-indatapriset, och det är det enda pris som finns – det finns ingen utdatarad att lägga till.

Bygg nu samma form av uppskattning för en Qwen 3 8B-klassificerare, och asymmetrin syns utan att citera någon leverantörs pris. 8B:n har två debiterbara rader där beslutsmodellen har en, och den andra raden är den som växer: en klassificering som resonerar först betalar för resonemanget, och en klassificering som fyller ut sin JSON betalar för utfyllnaden. Beslutsmodellens inputkostnad bestäms av tillståndet och frågorna. 8B:ns är inte bestämd av något du kan förutsäga enbart utifrån tillståndet.

Två motvikter hindrar detta från att bli en slakt. För det första debiterar beslutsmodellen varje fråga som en egen prompt, så att ställa fem frågor om ett långt dokument femdubblar indata – 8B ställer alla fem i ett enda anrop och betalar för dokumentet en gång. För det andra, och viktigare, kan en beslutsmodell bara svara på frågor som den har eftertränats att svara på i den formen. Allt som kräver en förklaring, en sammanfattning eller ett omdöme uttryckt i ord för dig tillbaka till generalisten och, i praktiken, tillbaka till att betala för båda.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Vad de två är genuint bra på

Tar man bort benchmarkningen är uppdelningen renare än vad parameterantalen antyder.

Liquid AI d1-3B är till för ja/nej, välj-från-en-lista och betyget, vid en latensgolv som inget generativt når, på hårdvara som inkluderar en Jetson Orin Nano på 50 ms och en laptop. De applikationer Liquid demonstrerade i oktober var alla versioner av den formen – ett SQL-predikat som svarar ja eller nej för 150 supportärenden, en agent-loop för kontextkomprimering som behåller, trimmar eller kastar varje verktygsutdata och tar bort 52 % av tokens, en inspektionsapp som sorterar bra och defekta delar från fyra produktionslinjer med 85 till 97 % noggrannhet på en uppgift den aldrig hade tränats för och förstod utifrån en kort beskrivning. Den sista demon är det tydligaste uttalandet om vad kategorin är till för: ett jobb där svaret är ett av några få saker, tillståndet är en bild, och ingen förklaring någonsin efterfrågades.

Qwen 3 8B är till för arbete som måste återkomma som språk, eller omfatta 119 språk, eller rymma ett dokument som är längre än trettiotvåtusen tokens, eller resonera högt innan den bestämmer sig. Det är också rätt svar när klassificeringen inte är en av de tre formerna ovan – när etikettmängden är öppen, när kriterierna är så nyanserade att du ville ha tänkandet, när samma anrop måste hantera både det enkla och det svåra fallet utan att du behöver dirigera mellan två modeller. Och det är det säkra valet när en granskare frågar vilka oberoende benchmarks som finns, för svaret är: en hel del, som sträcker sig ett och ett halvt år tillbaka.

De team som lyckas med detta väljer inte. De sätter beslutsmodellen framför generalisten, på den del av trafiken där svaret är en siffra, och låter 8B hantera allt som behöver en mening. Filtret är 3B och 8 ms; 8B stannar för nyttolasten.

Distribuerar paret

Liquid AI d1-3B anländer som vikter med driftsättningsarbetet redan gjort: llama.cpp-stöd från dag ett, hela NVIDIA-stacken från DGX ned till Jetson, NVFP4-kvantisering, en 8-bitars vikt- och aktiveringsvariant och GGUF-konverteringar på Hugging Face. Qwen 3 8B har det djupaste självhostingekosystemet av alla modeller i den här viktklassen. Ingen av dem finns i vår katalog, och inget här är ett tillgänglighetsanspråk för någon av dem — den hostade vägen för Liquid AI d1-3B är leverantörens eget API och tredjepartsplattformar, där den hostade d1 prissätts enbart på indatatoken till $0,04 per miljon, med bilder fakturerade till 1,5 token per 32×32-pixelruta.

När båda finns i samma pipeline upphör routningsproblemet att vara teoretiskt. Du har en liten modell som du äger, en 8B som du kan hosta eller hyra, och de generativa anropen som du definitivt hyr – och att fatta beslut per begäran om vilken av dem en viss indata ska gå till är precis det beslut ett routningslager finns för att fatta. En slutpunkt över 200+ modeller, leverantörers listpriser som förs vidare med 0 % påslag så att en leverantörs prisändring är live hos dig samma dag, automatisk failover så att en uppströmsleverantörs dåliga eftermiddag inte blir ditt avbrott. När din klassificeringstrafik mäts i miljarder anrop per år, är det lagret där besparingarna från en 3B-beslutsmodell faktiskt hämtas hem.

Domen

Om din 8B får slutna frågor – är det här toxiskt, är det här relevant, vilken kö hör det här hemma i, hur brådskande är det – betalar du en generalists tvåradsnota och en genereringslatens för en etikett, och Liquid AI d1-3B är en direkt ersättning med en svagare beviskedja och en verklig licensskillnad att väga. Acceptera 32K-taket för kontext, de sexton språken och det faktum att ingen utanför Liquid ännu har poängsatt det.

Om din 8B får i uppgift att förklara, sammanfatta, översätta, hålla ett långt dokument eller resonera innan den fattar beslut, gäller den här jämförelsen inte för dig. Behåll 8B, och betrakta beslutsmodellen endast som ett förfilter för den trafik du i förväg kan identifiera som den enkla sorten.

Det intressanta talet att hålla ögonen på är inte någon av modellernas benchmarkpoäng. Det är hur snabbt den första oberoende reproduktionen av d1 Decision Index landar, för det är ögonblicket då jämförelsen slutar vara ett leverantörspåstående och börjar bli ett faktum man kan planera utifrån.

A capture of our own catalogue page for Qwen3 VL 8B Instruct, showing the model id qwen/qwen3-vl-8b-instruct, a release date of 2025-10-14, text, image and video input, a 131,072-token context window with 32K max output, a P50 time-to-first-token of 3.59 seconds, and pricing of $0.18 per million input tokens against $0.70 per million output tokens.