
Liquid AI d1-3B vs Intern-Decision-4B: Vilken kalibrerad beslutsfattare behöver du egentligen?
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Två modeller med öppna vikter svarar nu på frågor genom att inte skriva någonting, och förrän man ställer deras I/O-scheman sida vid sida ser de ut som samma idé två gånger. Liquid AI d1-3B, som laddades upp till Hugging Face den 5 oktober 2026 och tillkännagavs av Liquid två dagar senare, är en multimodal beslutsmodell på 3,12B vars modellkort rakt ut säger att den "inte är en chattmodell och inte skriver text". InternLMs Intern-Decision-4B, som laddades upp tyst till InternLM-organisationen den 26 september 2026 utan blogginlägg, tweet eller lanseringssida bakom sig, är en 4B-beslutsmodell finjusterad från Qwen3.5-4B som på samma sätt returnerar en svarsfördelning för varje fråga i en enda framåtpassning. Samma kontrakt på ytan. Skillnaderna under ytan – en licens som kommer att krångla till det för dig, ett kontrakt som kan skriva text av misstag och maskiner som ingen har jämfört – är det som avgör vilken av dem som hör hemma i din stack.
Hur nära de två egentligen är
Det första man måste reda ut är hur mycket av den här jämförelsen som är oavgjord. Båda modellerna tar ett tillstånd och ett schema med namngivna frågor, båda läser signalen från logits vid en platshållarposition i stället för att sampla, båda är multimodala, och båda rapporterar att de inte skrev något. När det gäller anropets form är de nästan identiska, och de intressanta skillnaderna finns i detaljerna runt kanterna.
• Storlek — Liquid AI d1-3B 3,12B totalt, byggd på Liquids LFM2.5-VL-3B; Intern-Decision-4B 4B (cirka 4,54B enligt tensorantalet som kortet anger), finjusterad från Qwen3.5-4B
• Frågetyper — d1-3B och Intern-Decision-4B använder samma tre: noul för ja/nej, choice för en av en namngiven mängd, score för en punkt på en ordnad skala
• Svarsfält — d1-3B returnerar svaret plus konfidens och sannolikheter; InternLM-schemat returnerar fördelningar plus ett konfidensvärde som modellkortet varnar för inte är en kalibrerad sannolikhet
• Gräns för indata — d1-3B 32 768 tokens kontext; Intern-Decision-4B ett tak på 8 192 token som rakt av avvisar längre förfrågningar i stället för att trunkera, där bilder räknas mot taket
• Licens — d1-3B under Liquid's LFM Open License v1.0, Apache 2.0 på InternLM-sidan
• Språk — d1-3B listar 16; Intern-Decision-4B:s kort anger inga
• Gränssnitt — d1-3B levereras som en modell som du laddar och anropar med trust_remote_code=True; Intern-Decision-4B levereras som ett Python-bibliotek som du installerar med pip install, med en implementerad backend och förfrågans eget model-fält som uttryckligen inte kan byta checkpoints
• Leverantörernas egen poäng — d1-3B 48,57 på den publika delningen av Decision Index 0.2.1; Intern-Decision-4B 90,02 i medeltal över sin egen tabell med sju set, med en Brier-poäng på 0,347 och ett förväntat kalibreringsfel på 0,065
De där två sista siffrorna är inte jämförbara, och att behandla dem som en resultattavla vore det enskilt enklaste misstaget att göra på den här sidan. De kommer från olika testramverk, olika frågeuppsättningar och olika bedömare.

Kalibrering är hela produkten, och bara en av dem står bakom den i tryck.
En beslutsmodell är bara värd sin latens om talet den returnerar bredvid svaret betyder något. Det är vad kalibrering är: en angiven konfidens på 0,9 bör ha rätt ungefär nio gånger av tio, och en modell som är säker och har fel är sämre än en som säger att den inte vet.
InternLM är den som tar sig an detta. Dess kort dokumenterar en anpassad temperatur på 1,99241824, framtagen genom minimering av negativ log-likelihood över 1 728 utsedda kalibreringsfall med 1 693 undanhållna för validering, och utskriven med åtta decimaler så att den kan reproduceras. Den publicerar också en pilotstudie före och efter över 96 fall som visar att mekanismen fungerar i stället för att bara påstå det: Brier 0,628 och ECE 0,213 före kalibrering mot 0,550 och 0,089 efter. Brier och ECE är de två standardmåtten på om angivna sannolikheter är ärliga, och förflyttningen är stor.
Liquid publicerar ingen motsvarighet. d1-3B:s eget modellkort innehåller träffsäkerhetsliknande benchmarks – SQuAD 2.0 85,3, Civil Comments 93,0, MASSIVE intent 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, ett medelvärde på 77,1 – vid sidan av sina 48,57 på Decision Index, och modellens angivna säljargument är kalibrerade typade svar. Men det finns ingen ECE-rad, ingen Brier-rad och ingen publicerad anpassad temperatur.
Den asymmetrin betyder inte att Qwen3.5-4B:s ättling är bättre kalibrerad än en 3B byggd på LFM2.5-VL-3B; den betyder att mellan dessa två kort ger det ena dig räkneunderlaget för att reproducera påståendet och det andra ger dig påståendet. Om din pipeline sätter en tröskel på en konfidens — routa över 0,8, eskalera under 0,4 — kan du validera InternLM-sidan i kväll och du kan bara stickprovskontrollera Liquid-sidan.
Förbehållet gäller åt båda hållen. Båda uppsättningarna siffror är förstapartsdata. Ingen av modellerna har poängsatts av en oberoende part, och InternLMs kalibreringspåståenden vilar på InternLMs egen pilotstudie med 96 fall mot InternLMs egen anpassning.
Licensen som ber dig om ett nummer
Intern-Decision-4B är Apache 2.0, ärvt från Qwen3.5-4B, med uppströmsmeddelandena bevarade — kommersiell användning, vidaredistribution, finjustering, ingen intäktsfråga någonstans i den.
d1-3B omfattas av Liquid's LFM Open License v1.0, och avsnitt 5 är den del som ingen läser förrän inköpsavdelningen gör det. Kommersiell användning beviljas endast under förutsättning att du eller din juridiska person ligger under ett tröskelvärde, som i samma dokument definieras som en årlig intäkt på tio miljoner US-dollar eller mer; användning över det är helt enkelt inte licensierad. Ideella organisationer och forskningsanvändare undantas.
För en enskild person eller ett litet team är båda gratis. För allt med en ekonomiavdelning är de två repona olika produkter, och skillnaden är en siffra som du antingen ligger över eller inte.
Slutet av d1-3B:s benchmarktabell är dess egentliga påstående.
Huvudsiffran på Liquids kort är 48,57 på Decision Index 0.2.1, före de andra raderna under 10B i en tabell som sträcker sig från Winnow-12B på 50,02 ner till Decider 2B på 28,97. Det som gör den siffran värd att citera är diskriminationsindexet som ligger under den. På Decision Indexets egna delpoäng får d1-3B 74,5 på Tools och 36,3 på Arts medan den bara når 23,8 på Knowledge – mot Decider 35B-A3B, en 36B mixture-of-experts-modell som är 12x så stor, som får 56,5 på Tools, 32,6 på Arts och 31,8 på Knowledge.

Med andra ord är 3B inte en liten modell som är enhetligt lite sämre. Det är en liten modell som är ovanligt stark på strukturerade beslut i verktygsstil och ovanligt svag på frågor som kräver omvärldskunskap, och den slår 36B inom de två kategorier som mest liknar det jobb den byggdes för. Om dina beslut är "vilken av dessa fem namngivna åtgärder" och "är detta grundat i den hämtade passagen", gör storleksgapet mindre arbete än du skulle förvänta dig. Om dina beslut lutar sig mot fakta som modellen redan måste ha, förvänta dig att 23.8 dyker upp.
Det finns en andra version av det argumentet på visionssidan. d1-3B har ett genomsnitt på 74,1 över elva offentliga bildbenchmarkar mot 73,9 för sin egen basmodell, och när bilderna tas bort får samma frågor 45,1 — så på bildfrågor kommer svaren verkligen från bilden. Den ligger i nivå med sin basmodell snarare än att vara bättre än den, och raderna per benchmark går åt båda hållen: CV-Bench 82,1 mot 87,6, POPE 88,5 mot 90,1, BLINK 59,2 mot 58,7.
Värt att notera är också pausen i InternLM-kortet: dess höga aggregerade värde kommer från frågedrivna uppgifter som Typed Decision 80,55 och ToolACE 96,45, medan Jevbench-Hard ligger på 73,87. Där schemat blir svårt, sjunker poängen.
Hastighet: gapet är inte där du förväntar dig det
d1-3B uppger 8 ms för en enskild fråga på ett RTX 4090 och 9 ms på en MI325X, 21 ms för tre frågor som delar ett tillstånd, 16 ms på en Jetson AGX Thor, samt packad genomströmning på 475 beslut per sekund på 4090 och 1 106 på MI325X.
Intern-Decision-4B:s kort uppmäter i genomsnitt 44,16 ms end-to-end på samma RTX 4090, med en median på 44,03 ms och 44,60 ms vid P95.
Det ser ut som en 5x-vinst, och det är det inte, eftersom de två mäter olika saker. Liquids siffror är varma modellanrop, en begäran i taget, med kernelval och kompilering betald i förväg – kortet säger uttryckligen att en enskild fråga kostar 16 ms på 4090 utan CUDA-grafkompilering, och att det första anropet med en ny form betalar för kompileringen. InternLM:s 44 ms är per fråga från början till slut genom ett Python-bibliotek vars enda implementerade backend är lokal Hugging Face-inferens, så den bär med sig den omgivande maskineriet. Inget av talen är fel. Sätt båda under en och samma testrigg, på en och samma maskin, med samma form på begäran, och gapet krymper till något man vill mäta snarare än anta.
Det som inte är i fråga är taket. 8 192 token är en hård avvisning på InternLM-sidan, och bildtoken drar från samma budget, så ett långt dokument plus en skärmbild är en begäran som avvisas i stället för att trunkeras. d1-3B ger dig 32 768 token att arbeta med. Om dina tillstånd är ärenden och korta utbyten biter det gapet aldrig. Om de är sidstora avgör den frågan innan något benchmark gör det.
Kör dem som en panel, inte ett utbyte.
Att svara på ett specifikt ja/nej och att svara på "vilken av sex namngivna saker är detta, och hur säker är du" är olika slags uppgifter, och de två korten är tillräckligt olika utformade — det ena med ett hårt tak för indata och en publicerad kalibreringsanpassning, det andra med 32K kontext och en bättre svans i poängsättningen — för att den användbara driftsättningen för ett team som utvärderar båda ofta inte är en ersättning utan en panel: samma tillstånd presenterat för båda modellerna, med oenigheter dirigerade till en människa eller till en större modell.
Ingen av modellerna finns i vår katalog, och detta är inte ett påstående om tillgänglighet; båda är självhostade artefakter. Men en panel är precis den form där ett routningslager gör jobbet i stället för pappersarbetet. OrcaRouter exponerar fler än 200 modeller bakom en enda API-nyckel med leverantörslistpriser vidarebefordrade med 0 % påslag – så när en leverantör som du routar bakom oss sänker sitt pris, ändras din faktura samma dag – och automatisk failover mellan leverantörer hindrar en panel med två modeller från att bli två enskilda felpunkter. Modellerna du routar i dag är inte dessa två; de är de hostade generalisterna du skulle ersätta, till exempel Qwen3.5-27B till $0.086 per miljon indatatokens och $0.688 per miljon utdatatokens, vilket är siffran en självhostad 3B måste slå när man har räknat in GPU:n.
Vad du ska göra den här veckan
Om dina beslut är korta tillstånd, om licensen måste klara företagets granskning och om du vill ha det bredaste utbudet av byggmål – llama.cpp, Ollama, LM Studio, en packad batchväg som kör 64 tillstånd i en enda genomkörning – är d1-3B den mer produktifierade av de båda, och dess särskiljningsförmåga mellan verktyg och konst är det starkaste som något av korten uppvisar. Om dina beslut sträcker sig över långa tillstånd, eller om du behöver en licens utan intäktsklausul, eller vill ha en kalibreringsanpassning som du kan reproducera och en testrigg där den omgivande kostnaden redan är inräknad, är Intern-Decision-4B den vars pappersarbete du faktiskt kan kontrollera.

Den obehagliga delen är densamma för båda: ingen oberoende part har kört någon av modellerna, och det finns ingen kalibreringsjämförelse som inte har beställts av den leverantör som skrev kortet. För en modellklass vars hela värde är betydelsen av en siffra bredvid ett svar är det gapet värt att täppa igen innan du sätter ett tröskelvärde på något.
