
Liquid AI d1-3B vs LFM2.5-2.6B-Base: Beslutsmodellen och dess egen förfader
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det här är inte en matchning mellan två rivaler. Liquid AI d1-3B, den beslutsmodell med öppna vikter som Liquid AI publicerade den 7 oktober 2026, byggdes på en bas som leverantören konstruerade genom att medelvärdesbilda vikterna från LFM2.5-2.6B med textstommen från LFM2.5-VL-3B. LFM2.5-2.6B-Base är den första föräldern – den råa förtränade checkpoint som Liquid laddade upp den 1 augusti 2026, 2,69 miljarder parametrar, 34 biljoner träningstoken, 131 072 token kontext, ingen instruktionsträning och ingen chattmall. Så den ärliga inramningen av den här jämförelsen är ättling mot förfader: en modell som har eftertränats för ett mycket specifikt jobb, bredvid det oformade substratet som den formades ur. En av dem svarar på frågor i kväll. Den andra är där du börjar om frågan du behöver få besvarad inte är en som någon har ställt ännu.
Vad var och en faktiskt är
De två modellkorten framstår som dokument från olika stadier i en produktionslinje, och skillnaderna är inte stilistiska.
Liquid AI d1-3B har 3,12 miljarder parametrar, en SigLIP2 NaFlex-visionencoder på 400M, ett kontextfönster på 32 768 token, en vokabulär på 128 000 token och sexton dokumenterade språk. Det är en beslutsmodell: du ger den ett tillstånd och namngivna frågor, och den returnerar en ja/nej-sannolikhet, en vald etikett med konfidens och en fullständig alternativfördelning, eller en ordnad poäng — i en enda framåtpassning, utan att några utdatatoken genereras. Den levereras med ett system_one-anrop för ett tillstånd med flera frågor, en batchad variant som packar många förfrågningar utan utfyllnad, och en rå probabilities-accessor för de underliggande fördelningarna. Det är inte en chattmodell och skriver inte text, och kortet säger det med de orden.
LFM2.5-2.6B-Base har 2,69 miljarder parametrar i 30 lager – 22 dubbelgrindade kortkonvolutionsblock och 8 grupperade query-attentionsblock – tränad på 34 biljoner tokens och utökad till en kontext på 131 072 tokens under mellanträningen, med samma ordförråd på 128 000 tokens och samma sexton språk. Det är en förtränad checkpoint för enbart text utan instruktionsträning, inga benchmarks på dess modellkort och en rekommendation som låter som en varning: använd den bara för uppgifter som kräver omfattande finjustering. Den utför textkomplettering. Den följer inte instruktioner.
Båda är nedladdningar utan registreringskrav under Liquids egen öppna licens. Båda är i första hand text. Ingen av dem finns i vår katalog, och inget här utgör ett påstående om tillgänglighet för någon av dem.

Härstamningen är den intressanta delen.
Liquid finjusterade inte en helt ny modell för att ta fram d1-släppet. De beräknade medelvärdet av två checkpoints – LFM2.5-2.6B och texttornet i LFM2.5-VL-3B – för att få en bättre utgångspunkt, och körde sedan flera finjusteringar med olika slumpfrön och datablandningar och slog samman dem igen. Leverantörens redogörelse för vad som förbättrade resultatet är påfallande fri från exotiska tekniker: att träna på långa indata, blanda ordningen i vilken svarsalternativen visas och ta bort genvägar från träningsdatan gjorde mer än någon avancerad metod de provade.
Att ta bort genvägar är värt att stanna upp vid, eftersom det pekar ut den fallgrop som den här kategorin är konstruerad för att undvika. En modell som tränas på att svara på flervalsfrågor lär sig gärna att alternativ B oftast är rätt, eller att det längsta alternativet vinner. Att blanda ordningen på alternativen under träningen är det som stoppar det. En beslutsmodell som har lärt sig en positionsprior i stället för att läsa av tillståndet är värre än värdelös — den är självsäkert fel i stor skala — och det är just det som skiljer en riktig beslutsmodell från en klassificerare med en prompt.
Det finns också en regression som är värd att säga rakt ut, eftersom leverantören inte gör det: bascheckpointen har ett kontextfönster på 131 072 token och Liquid AI d1-3B har 32 768. Efterträning till en beslutsmodell kostade tre fjärdedelar av den användbara kontexten. Om du föreställde dig att ättlingen strikt dominerar sin förfader på varje axel, så gör den inte det, och långdokumentsbeslut är den axel där den äldre checkpointen har mer utrymme – i princip, även om den inte har något beslutshuvud att använda det med.
Resultattavlan, med asymmetrin bifogad
Att jämföra dessa två i benchmarks är ett kategorimisstag, men det är ett kategorimisstag med en informativ form, så här är det med förbehållen på plats. Varje siffra för d1-3B är Liquids egen, poängsatt av leverantören med den officiella poängsättaren i stället för att ha skickats in till en offentlig resultattavla, och inte reproducerad av någon tredje part. Varje siffra för LFM2.5-2.6B-Base saknas eftersom en basmodell inte har något att mäta.
• Decision Index 0.2.1 — Liquid AI d1-3B 48,57, först bland allt under 10B i leverantörens tabell och före en beslutsmodell som är tolv gånger så stor. LFM2.5-2.6B-Base — inte poängsatt, inte poängsättbar utan ett beslutshuvud.
• Textbenchmarkar — Liquid AI d1-3B har ett genomsnitt på 82,9 över sju offentliga benchmarkar som omfattar förståelse, toxicitet, avsikt, medicinsk QA och tvärspråklig förståelse. LFM2.5-2.6B-Base publicerar ingen benchmarktabell alls.
• Vision — Liquid AI d1-3B ligger i genomsnitt på 74.1 över elva bildbenchmarkar som läses som beslut; att ta bort bilderna sänker samma frågor till 45.1. LFM2.5-2.6B-Base är endast text, utan visionstorn.
• Parametrar — 3,12 miljarder mot 2,69 miljarder. Beslutsmodellen är den större av de två, vilket är motsatsen till den vanliga berättelsen om efterträning.
• Kontext — 32 768 tokens mot 131 072. Förfadern vinner den här raden och det är den enda rad den vinner.
• Latens — Liquid AI d1-3B svarar på en enskild fråga på 8 ms på en RTX 4090 och 50 ms på en Jetson Orin Nano, och kör 64 packade tillstånd vid 475 per sekund på 4090:n. LFM2.5-2.6B-Base har ingen latens att ange förrän du finjusterar den till något som svarar på en fråga, och då är siffran din finjusterings.

Vad du i praktiken väljer mellan
Beslutsregeln här är ovanligt tydlig, eftersom de två kontrollpunkterna inte konkurrerar om samma budgetpost.
Ta Liquid AI d1-3B när frågan redan finns och är en av de tre former som en beslutsmodell hanterar: ett ja eller nej, ett val från en namngiven uppsättning eller en betygssättning på en ordnad skala. De publicerade applikationerna är alla igenkännliga produktionssysslor – triage och routing, moderering, avsikts- och ämnesklassificering, extraktionskontroller, omrankning, agentriktlinjer och visuell inspektion. Demosiffrorna som leverantören körde den 5 oktober ställde d1 mot GPT-6.1 Sol och Claude Opus 5.5 på sex sådana uppgifter och hävdar att den matchar eller slår GPT-6.1 Sol på fyra samtidigt som den kostar 19x till 200x mindre; metodsidan säger tydligt att varje applikation kördes en gång per modell, så behandla påståendets form som fyndet, inte decimalerna. Den verkligt slående är inspektionsdemon: sortering av bra kontra defekta över fyra produktionslinjer med 85 till 97 % noggrannhet på en uppgift som modellen aldrig tränats för, förstådd från en kort beskrivning.
Välj LFM2.5-2.6B-Base när frågan ännu inte finns. Det är den billigare utgångspunkten för en finjustering som du avser att äga — ett domänbeslutshuvud, en skräddarsydd klassificerare, en uppgift som ingen har en checkpoint för. Du ärver arkitekturen, tokenizern och den långa kontexten, och du betalar i beräkningskraft, data och utvärdering. Två av de fyra applikationer som leverantören byggde kring d1 utgick från öppen källkodsprojekt snarare än från grunden, vilket är en rättvisande bild av vad en bas-checkpoint plus disciplin faktiskt åstadkommer.
Den praktiska fällan är att behandla bascheckpointen som en drop-in. Den är inte en assistent, den kommer inte att följa en prompt, och utvärderad som chattmodell hamnar den nära noll — vilket inte är ett faktum om dess kvalitet, det är ett faktum om vad "base" betyder.
Att självhosta endera, och lagret ovanför
Båda levereras som vikter, och leverantören har gjort driftsättningsarbetet för d1-sidan: llama.cpp-stöd från dag ett, hela NVIDIA-stacken från DGX ner till Jetson, NVFP4-kvantisering, en 8-bitars variant för vikter och aktiveringar samt GGUF-konverteringar på Hugging Face. Bascheckpointen har egna GGUF-, ONNX- och MLX-varianter via den bredare LFM2.5-familjen. Om du hellre avstår från att hosta något själv tillhandahåller Liquid den hostade d1 via sitt eget API, med prissättning enbart baserad på indatatokens, där bilder debiteras med 1,5 token per 32×32-pixelruta; textbaserad åtkomst finns även via tredjepartsplattformar.
Det som ingendera vägen förändrar är resten av stacken. En modell du driftar är en modell du måste hålla vid liv, versionshantera och redundanssäkra — och de beslut den matar hamnar fortfarande intill de generativa anrop du inte driftar. Den mixen är det lager som en router kollapsar: en enda slutpunkt över 200+ modeller, leverantörernas listpriser vidarebefordrade med 0 % påslag så att en prisförändring från en leverantör slår igenom hos dig samma dag, och automatisk redundansväxling så att en dålig eftermiddag uppströms inte blir ditt avbrott. Att själv hosta en 3B-beslutsmodell bredvid gör routingfrågan skarpare i stället för mildare, för nu äger du halva pipelinen och hyr den andra halvan.
Vilken, för vem
Om frågan du behöver få besvarad den här veckan är en av de tre former en beslutsmodell kan anta, och det är en fråga som någon annan redan har föreställt sig, är ättlingen färdig och gratis och körs på 50 ms på en enhet utan GPU – ta Liquid AI d1-3B och var klar med det.
Om du bygger det som besvarar en fråga som ingen har ställt ännu, och du har data och beräkningskraften att äga det, är LFM2.5-2.6B-Base den ärliga utgångspunkten, och det är värt att veta att ättlingen i den här artikeln skapades från den på exakt den väg du är på väg att ta.
Och om du inte är säker på vilken av dessa två situationer du befinner dig i, är svaret nästan alltid den första. Att efterträna in i ett beslutshuvud är det dyra draget; att köra någon annans är gratis.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
