
Liquid AI d1-3B och d1-omni-600M: Öppna vikter för modeller som aldrig skriver ett ord
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Liquid AI d1-3B och Liquid AI d1-omni-600M lades upp på Hugging Face den 7 oktober 2026, och de två checkpoints har en egenskap som gör att varje jämförelsetabell du har läst i år är felformad. Ingen av dem genererar text. Du ger Liquid AI d1-3B ett tillstånd – en supportbiljett, en JSON-payload, ett fotografi, eller alla tre samtidigt – och en uppsättning namngivna frågor, och den returnerar svar som plockas direkt ur modellens fördelning över dina alternativ. Ja/nej som en sannolikhet. Ett val bland etiketter med en konfidens och en fullständig sannolikhetsvektor. En position på en ordnad skala. Det finns inget samplingsteg, ingen JSON att parsa, ingen skenande generering, och leverantörens egen användningsräknare rapporterar saken rakt ut: output_tokens: 0. 3B-modellen är huvudnumret – den landar på 48,57 på det leverantörsbedömda Decision Index 0.2.1, före allt under 10B och före en beslutsmodell som är tolv gånger så stor. 600M-syskonet är det som är värt att hålla ögonen på: det läser bilder och upp till trettio sekunder tal genom samma stamvikter, och det är märkt som en tidig forskningsrelease.
Vad en beslutsmodell är, i ett stycke
Kategorin har byggts upp i ett år under namn som System 1-modeller och klassificerare-som-inte-är-klassificerare, och d1-paret är den tydligaste formuleringen av den hittills. En generativ modell får en fråga och skriver ett svar; svaret måste parsas, parsningen kan misslyckas, och varje token den skriver kostar dig pengar och tid. En beslutsmodell får en fråga och rapporterar vad den redan tror. Liquids frågor finns i tre typer. noul är en ja/nej-fråga, som besvaras med P(ja) mellan 0 och 1. choice väljer en etikett från en namngiven mängd och returnerar etiketten, en konfidens och sannolikheten för varje alternativ. score placerar tillståndet på en ordnad skala med två till tio nivåer och returnerar den förväntade nivån med dess fördelning och legend. Ett tillstånd kan bära flera frågor samtidigt, och tillståndet och dess bilder läses en gång för alla dem.
Den sista egenskapen är hela affärscaset. Tre frågor om ett och samma ärende kostar 1,3x tiden för en fråga, inte 3x, eftersom modellen gör en framåtpassning över indata och läser ut flera svar ur den. Det finns inget att skriva, så det finns inget att skriva dåligt.
3B och 600M är byggda från motsatta håll.
Det är här släppet blir tekniskt intressant, och det är den del som bevakningen av lanseringen mestadels har hoppat över. De två modellerna delar inte härstamning.
Liquid AI d1-3B härstammar från LFM2.5-VL-3B, leverantörens decoder-only vision-language-modell. Den har 3,12 miljarder parametrar, en SigLIP2 NaFlex-formoptimerad 400M visionskodare, ett kontextfönster på 32 768 token, en vokabulär på 128 000 token och sexton dokumenterade språk. För att bygga den tog Liquid medelvärdet av vikterna för LFM2.5-2.6B och textstommen i LFM2.5-VL-3B, finjusterade checkpoints från flera slumpmässiga seeds och datablandningar och slog sedan samman resultaten igen. Leverantörens egen sammanfattning av vad som spelade roll är uppfriskande oglamorös: träning på långa indata, att blanda ordningen på svarsalternativen och att jaga genvägar i träningsdatan gjorde mer för slutresultatet än någon avancerad teknik.
Liquid AI d1-omni-600M härstammar från LFM2.5-Encoder-350M, en bidirektionell encoder – en helt annan typ av nätverk. Den har totalt 587M parametrar uppdelade i en delad stomme och ett beslutshuvud på 381M, en visionsencoder på 94M lånad från LFM2.5-VL-450M, och en ljudencoder på 112M byggd av en 17-lagers FastConformer. Varje modalitet passerar genom samma stomvikter. Dess kontext är 16 384 token som täcker text-, bild- och ljudpositioner tillsammans, och när bilder bifogas kortas tillstånds- och frågetexten till 896 token eftersom det är vad den tränades på. Ljudet får en varning som kortet anger utan förbehåll: funktionen tränades på förfrågningar mellan en engelsktalande och en assistent, och klipp kapas vid trettio sekunder.
Så familjen är inte en modell i två storlekar. Det är en avkodare och en kodare, eftertränade att göra samma jobb med två helt olika mekanismer, varav den ena ser och den andra hör.

Siffrorna, och vems de är
Varje siffra i det här avsnittet är Liquids egen. Decision Index-raderna för d1-modellerna poängsattes av leverantören med hjälp av den officiella poängsättaren – de lämnades inte in till resultattavlan – medan varje konkurrerande rad kommer från den offentliga resultattavlan i v0.2.1. Inget oberoende labb har ännu reproducerat något av det, och modellerna är två dagar gamla när detta skrivs.
• Decision Index 0.2.1 — Liquid AI d1-3B får 48,57 med delpoäng på Kunskap 23,8, Språk 56,4, Hämtning 52,8, Verktyg 74,5 och Konst 36,3. Liquid AI d1-omni-600M får 15,95, med Verktyg på 15,1.
• Var 48.57 ligger — först bland allt under 10B i tabellen som leverantören publicerade, och före Decider 35B-A3B på 47.11. Det är tvåa totalt, efter Winnow-12B på 50.02, som är fyra gånger så stor.
• Textbenchmarks, leverantörsrapporterade — d1-3B har i genomsnitt 82,9 över sju offentliga benchmarks, före Decider 4B:s 81,1; d1-omni-600M har i genomsnitt 78,4, vilket slår Decider 2B:s 77,1 med ungefär en fjärdedel av parameterantalet. 600M står för tabellens bästa toxicitetspoäng (Civil Comments 95,8) och dess bästa parafraspoäng (PAWS-X 79,5).
• Vision, leverantörsrapporterad — d1-3B har i genomsnitt 74,1 över elva offentliga bildbenchmarkar, tolkade som val bland varje benchmarks svarsalternativ, jämfört med 73,9 för dess LFM2.5-VL-3B-backbone. Om bilderna tas bort sjunker samma frågor till 45,1, vilket är så leverantören visar att svaren kommer från pixlarna.
• Latens, mätt av leverantören — en fråga tar 8 ms på en RTX 4090 och 9 ms på en AMD MI325X; 16 ms på en Jetson AGX Thor, 26 ms på en Jetson AGX Orin 64 GB, 50 ms på den minsta Jetson Orin Nano och 30 ms på en Apple M5 Pro. Sextiofyra tillstånd packade i ett enda svep körs i 475 per sekund på 4090.
• Vad som saknas – d1-omni-600M har ingen inferenstabell alls. Liquid säger att den är under aktiv utveckling och rapporterar helt enkelt inte latens för den. Det finns inte heller något benchmark för ljudbeslut någonstans i releasen, eftersom dedikerade benchmarkar för ljudbeslut enligt leverantörens egna ord för närvarande är ett öppet problem.
Det påstående som releasen egentligen framför
Två dagar innan vikterna lades upp publicerade Liquid den hostade versionen av den här modellen och körde den mot GPT-6.1 Sol och Claude Opus 5.5 på sex applikationer. Sammanfattningen: d1 matchar eller slår GPT-6.1 Sol i fyra av sex, kostar 19x till 200x mindre och svarar snabbare på varje uppgift. Den publicerade metodiken är värd att läsa innan man upprepar något av detta – varje applikation kördes en gång per modell den 5 oktober 2026, chattmodellerna svarade i JSON med sin standardinställning för resonemang, och d1:s kostnad beräknades till $0,04 per miljon indatatokens.
Demorna är den mer övertygande hälften. Sortering av goda och defekta delar från fyra produktionslinjer – kretskort, stearinljus, cashewnötter, tuggummi – med 85 till 97 % noggrannhet, på en modell som aldrig tränats för uppgiften och förstod den från en kort beskrivning. Ett SQL-predikat som svarar ja eller nej för vart och ett av 150 supportärenden. En loop för kontextkomprimering som läser varje verktygsutdata i en kodagents session och behåller, trimmar eller tar bort den, och därmed avlägsnar 52 % av tokenerna samtidigt som den behåller varje utdata som uppgiften behöver. I Tetris höjde tillägget av skärmen i ett spel som helt kan beskrivas i text poängen från 70 rensade rader till 81 – ett datorseenderesultat som man inte kan få från en enbart textbaserad klassificerare, oavsett hur bra den är.
De är leverantörsdrivna demonstrationer med uppgifter som leverantören har valt, och det står i metodavsnittet. De är fortfarande den tydligaste bilden någon har publicerat av vad en beslutsmodell är till för.

Var den körs, och vad det kostar att anropa
De öppna vikterna är byggda för lokal körning och leverantören gjorde integrationsarbetet i förväg: stöd från dag ett för llama.cpp, hela NVIDIA-stacken från DGX ned till Jetson, NVFP4-kvantisering och en 8-bitars vikt-/aktiveringsvariant som publicerats tillsammans med bascheckpointen. GGUF-konverteringar finns redan på Hugging Face. Om du helst inte vill hosta något själv tillhandahåller Liquid den hostade d1 via sitt eget API – endast indatatoken, inga utdatatoken, med bilder fakturerade som indata till 1,5 token per 32×32-pixelpatch, vilket gör en 1024×1024-bild till 1 536 token. Endast textbaserad åtkomst finns även via tredjepartsplattformar.
Den ärliga routingnoten: varken Liquid AI d1-3B eller Liquid AI d1-omni-600M finns i vår katalog, och den här artikeln är inte ett tillgänglighetsanspråk för någon av dem. Vad d1-paret förändrar för en router är formen på pipelinen runt den. En beslutsmodell som svarar på millisekunder och inte kostar något i utdatatokens är ett filter, inte en ersättning – sorteringen av bra och defekta samt triagen av ärenden sker före det generativa anropet, och det generativa anropet är där en enda slutpunkt över 200+ modeller, listpriser som förs vidare med 0 % påslag, och automatisk failover verkligen gör nytta. Annat lager, samma pipeline.
Vad skulle avgöra argumentet
Tre saker är ouppklarade, och alla tre är av det slag som bara tiden kan avsluta.
Det första är oberoende reproduktion. Siffrorna i Decision Index togs fram av leverantören med den officiella bedömaren, och varje konkurrentrad hämtades från en offentlig resultattavla, vilket är en försvarbar metod och inte samma sak som att en tredje part kör din modell. Det andra är ljud. En 600M-checkpoint som dirigerar ett röstkommando i en enda framåtpassning är en genuint ny förmåga, och det finns inget benchmark som mäter om den gör det bra. Det tredje är själva kategorin: när svaret läses av från en fördelning i stället för att skrivas ut, kan de vanliga felsätten hos en liten modell – att fastna i loopar, driva iväg, vägra svara, hallucinera ett format – helt enkelt inte uppstå, och ingen har publicerat en bra redogörelse för vad som ersätter dem. Kalibreringsfel är den uppenbara kandidaten, och det är precis vad konfidensfältet på varje svar bjuder in dig att mäta själv.
Tio demos kör Liquid AI d1-3B i en loop över livekameraingång i ett offentligt Hugging Face Space, vilket är det billigaste sättet att bilda sig en egen uppfattning. Vikterna är gratis och frågorna är specifika. Det är en bättre utgångspunkt än vad de flesta släpp i år erbjuder.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
