Ett hero-titelkort med rubriken "Liquid AI d1-3B vs Gemma 4 12B" och underrubriken "en beslutsmodell mot en generalist", som visar ett litet 3,12B-checklistkort med ett sannolikhetschip bredvid ett större 11,96B-kort med dokument-, vågforms- och filmruteikoner och ett chip för skrivet svar.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: En beslutsmodell mot en generalist

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det snabbaste sättet att få den här jämförelsen fel är att sätta Liquid AI d1-3B och Gemma 4 12B i samma benchmark och vänta på en vinnare. De besvarar inte samma fråga. Liquid AI d1-3B är en beslutsmodell på 3,12B som publicerades som öppna vikter den 7 oktober 2026: du ger den ett tillstånd och en uppsättning namngivna frågor, och den returnerar sannolikheter, en vald etikett och en konfidens, med noll output-tokens och inget genereringssteg. Gemma 4 12B är Googles encoderfria any-to-any-generalist, en checkpoint på 11,96B som tar text och ljud och skriver ett svar över ett fönster på 256 000 token på fler än 140 språk. En av dem säger vilken av fyra saker ett kretskort är. Den andra säger varför. Jämför dem enbart på kvalitet och du lär dig ingenting, eftersom utdata inte kan mätas med samma mått — och leverantörerna har aldrig benchmarkat dem mot varandra. Jämför dem utifrån vad ett anrop faktiskt returnerar, vad det kostar och var vägen tar slut för var och en, och kombinationen blir ett genuint användbart gränstest.

Två olika utdatakontrakt

Den distinktion som gör hela jobbet här är vad som kommer tillbaka över tråden.

Liquid AI d1-3B returnerar ett strukturerat svarssobjekt. Varje fråga i en begäran deklarerar en typ — noul för ja/nej med P(ja), choice för ett av en namngiven uppsättning alternativ med en konfidens och en sannolikhet per alternativ, eller score för en position på en ordnad skala med två till tio nivåer med den förväntade nivån och dess fördelning. Modellen rapporterar output_tokens: 0 eftersom inget skrivs. Flera frågor över ett tillstånd läses från en enda framåtpassning, och tillståndet och dess bilder kodas en gång för dem alla.

Gemma 4 12B returnerar prosa. Ibland returnerar den JSON som du bad om, ibland returnerar den JSON som du inte bad om exakt, och den kan resonera innan den svarar. Den är i första hand en språkmodell: allt den kan klassificera uttrycker den som text. Det är en styrka när svaret måste förklaras för en människa eller matas in i ett nedströms steg som förväntar sig språk, och en kostnad när det enda du behövde var en sannolikhet.

Allt nedströms följer av det. Ett svar från d1-3B kan inte misslyckas med att parsas. Det kan inte heller förklara sig självt, och modellkortet säger det direkt: det är inte en chattmodell och det skriver inte text.

Var bevisspåren står

Ursprunget för de två sifferserierna är inte likvärdigt, och det spelar större roll här än siffrorna själva gör.

• Decision Index 0.2.1 — Liquid AI d1-3B får 48,57, poängsatt av leverantören med den officiella poängsättaren, först bland modeller under 10B och före Decider 35B-A3B på 47,11. Gemma 4 12B är inte poängsatt på Decision Index över huvud taget, så den här raden har ingen motsvarighet.

• Resonemangsbenchmarks — Ge​mma 4 12B uppnår 77,5 på AIME 2026, 78,8 på GPQA Diamond och 1 659 i Codeforces-ELO, samt har ett Artificial Analysis Intelligence Index på 22 i resonemangsläge och 13 med resonemang avstängt. Liquid AI d1-3B har ingen resonemangsbenchmark, eftersom en beslutsmodell inte producerar något resonemangsspår att poängsätta.

• Lång kontext — Ge​mma 4 12B tar emot 256 000 token och presterar 43,4 % på MRCR v2 eight-needle vid 128k på Goo​gles eget kort. Liquid AI d1-3B tar emot 32 768 token. Om din "state" är ett dokument på fyrtio sidor plus skanningar är gapet hela beslutet, och det är inte ens nära.

• Vision — Liquid AI d1-3B har ett genomsnitt på 74,1 över elva offentliga bildbenchmarkar, lästa som beslut över varje benchmarks alternativuppsättning, mot 73,9 för LFM2.5-VL-3B-backbonen som den byggdes från, och leverantören rapporterar att om bilderna tas bort sjunker samma frågor till 45,1. Ge​mma 4 12B:s vision är starkare och bredare, men rapporteras som genereringskvalitet, inte som beslutsnoggrannhet över namngivna alternativ.

• Språk — sexton dokumenterade för Liquid AI d1-3B; fler än 140 för Gemma 4 12B.

• Hastighet — Liquid AI d1-3B svarar på en fråga på 8 ms på en RTX 4090, 16 ms på en Jetson AGX Thor, 26 ms på en Jetson AGX Orin 64 GB och 50 ms på en Jetson Orin Nano, och packar 64 tillstånd i en enda genomkörning med 475 per sekund på 4090. Ge​mma 4 12B genererar, så dess latens är en funktion av hur många tokens den skriver.

• Beviskvalitet — Gemma 4 12B:s resultat är Googles, publicerade i juni 2026 och har sedan dess undersökts, kvantiserats och körts om av en stor community. Liquid AI d1-3B:s resultat är Liquids, publicerade för två dagar sedan, och har inte reproducerats av någon utanför labbet. Läs den andra kolumnen i ljuset av detta.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

Den enda platsen där de verkligen konkurrerar

Det finns en verklig överlappning, och den finns inte på en topplista. Det är anropet med LLM-as-a-judge.

Många produktionspipelines använder redan en medelstor generalist som ett bedömningslager: poängsätt det här ärendets brådskande grad, avgör huruvida den här utdatan klarar en bedömningsmall, välj vilket verktyg agenten ska anropa härnäst, kontrollera om en hämtad passage besvarar frågan. I dag går de flesta av dessa anrop till en generativ modell som ombeds skriva ut en siffra eller en etikett som text, och siffran den skriver ut är vad samplern råkade producera snarare än en softmax över din uppsättning alternativ. Det är arbetsflödet som Liquid AI d1-3B eftertränades för att ersätta, och de publicerade demosarna är alla varianter av det – ett SQL-predikat som svarar ja eller nej för 150 supportärenden, en loop för kontextkomprimering i agenten som behåller, trimmar eller släpper varje verktygsutdata och tar bort 52 % av tokenmängden, en app för visuell inspektion som sorterade bra och defekta delar från fyra produktionslinjer med 85 till 97 % träffsäkerhet på en uppgift den aldrig hade tränats för.

Gemma 4 12B utför alla dessa uppgifter, och gör mer än dessa uppgifter. Den kan också skriva sammanfattningen, hålla ett 256K-dokument i vyn, ta ett inspelat telefonsamtal som indata och svara på ett av över 140 språk. Om din pipeline behöver en bedömning och en berättelse, utför 12B två uppgifter med ett anrop och 3B-beslutsmodellen utför en av dem.

Gränsen går vid kontextlängd och utdatans form. Långt tillstånd, talat indata, många språk eller en förklaring som läsaren förväntar sig — Ge​mma 4 12B, utan tvekan. Kort tillstånd, en fast uppsättning alternativ, en latensbudget per begäran i ensiffriga millisekunder, eller en hård garanti att svaret kan parsas — det är d1-3B-kolumnen, och generalisten betalar för kapacitet du inte kommer att använda.

Vad det kostar att ringa var och en

Ingen av modellerna finns i vår katalog, så det finns inget routingpris att uppge för någon av dem – Gemma 4 12B finns inte bland de Gemma-storlekar vi tillhandahåller, och Liquid AI d1-3B är öppna vikter som du hostar själv eller når via leverantörens eget API och tredjepartsplattformar. För kontext kring den Gemini-närliggande sidan av den familjen: de två Gemma 4-storlekar som vi faktiskt routar listas till $0.06 per miljon indata och $0.33 per miljon utdata för Gemma 4 26B A4B, samt $0.13 och $0.38 för Gemma 4 31B, båda med kontexter på 262 144 token och text-, bild- och videoindata. Medianpriset hos leverantörer som anges för Gemma 4 12B på andra håll ligger nära $0.10 och $0.30.

Liquids hostade d1 fakturerar endast indatatokens, till $0,04 per miljon, där bilder räknas som indata med 1,5 tokens per 32×32-pixelruta. En beslutsförfrågan har därför ingen rad för utdatatokens alls, vilket är det strukturella skälet till att leverantörens egen kostnadsjämförelse mot mycket större modeller hamnar där den gör. De öppna vikterna har inget pris per anrop; du betalar i hårdvara. Båda måste ligga i samma pipeline som allt annat du anropar, vilket är det lager en router finns till för — ett API över 200+ modeller, leverantörslistpriser som förs vidare med 0 % påslag, och automatisk failover så att en enda tillfällig störning uppströms inte blir ditt avbrott. Det är infrastrukturen runt jämförelsen, inte jämförelsen.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Hur man bestämmer sig, ärligt talat

Utgå från svarsformatet snarare än från modellen. Om det nedströms systemet kan ta emot en sannolikhet, en etikett och ett konfidensvärde, och svarsuppsättningen är liten och känd, är Liquid AI d1-3B inte en nedgradering från en 12B – det är ett annat instrument, och latenssiffrorna gör det till en kategoriskt annorlunda driftsättning: 50 ms på en Jetson Orin Nano är en enhet som inte har någon som helst anledning att köra en 12B.

Om svaret måste vara en mening, eller tillståndet är längre än trettiotvåtusen tokens, eller någon kommer att säga det, eller utdataspråket är bengaliska, då är Ge​mma 4 12B den enda av de två som kan göra jobbet, och jämförelsen är över innan den börjar.

Den verkligt användbara positionen för de flesta team är båda, på olika platser. En beslutsmodell framför det dyra anropet, som gör triage, routning och de guardrail-kontroller som inte kräver språk; en generalist bakom den för det arbete som behöver det. Det är samma pipeline, en är ett filter och en är nyttolasten — och de team som kommer att få ut mest av d1-släppet är de som redan betalar en 12B för att svara ja eller nej.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.