Ett titelkort för en jämförelseartikel med texten Intern-Decision-0.8B vs Qwen 3.8, med underrubriken 853 miljoner parametrar, 1,71 GB och en sluten uppsättning svar, samt tre platta kort med textraderna Ämne: Intern-Decision-0.8B släpptes 26 sep 2026 utan tillkännagivande, Motståndare: Qwen 3.8, en gles kärna på 2,4T med Qwen3.8-Max för 2,00 $ och 6,00 $, och Huvudfynd: 2B-syskonmodellen är snabbare och mer träffsäker medan endast fotavtrycket talar till 0.8B:s fördel.
Engineering & Research

Intern-Decision-0.8B vs Qwen 3.8: 853 miljoner parametrar och en sluten uppsättning svar

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Intern-Decision-0.8B är den minsta av tre beslutsmodeller som InternLM lade upp på Hugging Face på morgonen den 26 september 2026, och den är inte den snabbaste av dem. Det är det första som är värt att veta. Enligt labbets egna mätningar kör 2B-syskonmodellen marginellt snabbare – 33,28 ms mot 33,98 ms – och får sex poäng högre i samma genomsnitt över sju sviter, så den vanliga anledningen att ta till en checkpoint under en miljard, rå hastighet, gäller inte här. Det som gäller är storleken: 852 985 920 parametrar, 1,71 GB bf16-vikter, litet nog att permanent få plats i marginalen på en maskin som har något annat att göra. Ställ det mot Qwen3.8-Max – den hostade leveransen av den glesa mixture-of-experts-kärnan med 2,4 biljoner parametrar som leverantören publicerade i augusti, med ett pris på 2,00 och 6,00 dollar per miljon tokens – och de två konkurrerar inte om samma uppgift. Den ena returnerar en sannolikhetsfördelning över alternativ som du angav i förväg. Den andra skriver.

Det korta svaret: Intern-Decision-0.8B är värd att ha om du behöver ett beslut i en sluten uppsättning poängsatt på hårdvara du redan äger, och om 1,71 GB i stället för 4,43 GB är skillnaden mellan att skeppa och inte skeppa. Den är inte värd att ha om du vill ha den mest träffsäkra lilla poängsättaren som InternLM släppte den här veckan – det är 4B – eller om ditt svar inte redan är uppräknat i din prompt, i vilket fall ingen av dessa två är rätt verktyg och Qwen 3.8 är den enda av de två som överhuvudtaget kan göra jobbet.

Vad repositoryt säger, och vad inget annat gör

Börja med bevisningen, för det finns väldigt lite av den. InternLM har inte meddelat något om den här modellen. Inget lanseringsinlägg, ingen artikel, ingen beskrivning av repositoriet. Hugging Face-kortet länkar till en demo-Space och ett GitHub-repositorium, och i skrivande stund returnerar Spacet 401 och GitHub-länken returnerar 404 – de två platser som kortet hänvisar till för mer information är stängda. Tre checkpoints dök upp inom fyrtio sekunder från varandra runt 05:36 UTC den 26 september: Intern-Decision-0.8B, Intern-Decision-2B och Intern-Decision-4B, alla med samma taggar – beslutsfattande, multimodal, strukturerad prediktion – och alla finjusteringar av Qwen-checkpoints, i det här fallet Qwen3.5-0.8B.

Vad som går att veta från repositoriet är ovanligt exakt för ett oannonserat släpp, eftersom labbet levererade sin egen inferensmodul tillsammans med vikterna. 0.8B laddas via en 16 KB inference.py i modellkatalogen, kräver Python 3.12 eller nyare och torch 2.9.1 med transformers 5.14.1, och exponerar en DecisionEngine-klass som du instansierar en gång och återanvänder. En Python-dict in, en svarsdict ut. Vad som inte går att veta: huruvida detta är ett färdigt släpp eller en tidig push, huruvida en hostad endpoint är på väg, och huruvida de två checkpoints som den ligger mellan är avsedda att vara samma produkt i olika storlekar eller tre olika produkter som råkar dela ett namn. Ingen utanför InternLM har kört någon av dem.

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

Syskonproblemet: 2B är snabbare och bättre

Här är den del av InternLMs egen publicerade tabell som gör att 0.8B är svår att placera. Läser man de tre storlekarna nedåt i samma sju sviter:

• Hastighet — 0,8B: 33,98 ms medel, 33,44 ms median, 37,50 ms vid p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Allt mätt per fråga på ett enda RTX 4090 via den lokala Hugging Face-vägen.

• Genomsnitt för sju sviter — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.

• Kalibrering — 0,8B: Brier 0,530, ECE 0,066. 2B: Brier 0,437, ECE 0,100. 4B: Brier 0,347, ECE 0,065.

• Diskutrymme vid bf16 — 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.

2B är snabbare i genomsnitt, dramatiskt snävare i svansen och mer träffsäker, allt på en gång. Så "mindre betyder snabbare" är falskt i den här familjen – dubbelt upp, eftersom 4B är långsammare än båda. Den enda axel där 0.8B vinner ohotat är den som ingen kör benchmark på: 1,71 GB mot 2B:s 4,43 GB och 4B:s 9,08 GB. Om du placerar en scorer inom en fast minnesbudget – en liten box som alltid är på, en GPU som delas av flera hyresgäster, en edge-nod med en språkmodell som redan upptar större delen av kortet – är det hela argumentet, och det är ett verkligt sådant.

Resten av tabellen är en studie i var små modeller brister ojämnt. 0.8B-modellens Typed Decision-poäng är 77,35 mot 4B-modellens 80,55 – tre poängs skillnad vid en femtedel av parameterantalet. Men Jevbench-Original faller från 98,61 till 80,56 och WildJailBreak kollapsar från 89,86 till 64,48. Vad dessa två sviter än mäter – kortet säger det inte, och kortet ger inga svitdefinitioner alls – är det de som straffar den lilla checkpointen hårdast. En modell som håller stånd på en axel men rasar utför ett stup på två andra är inte en genomgående svagare modell. Det är en modell med en specifik kompetensgräns, och man vill veta var ens arbetsbelastning ligger innan man satsar flottan på den.

Ytterligare en varning om kalibreringsraden. 0.8B:s ECE på 0.066 är dess bästa siffra — bättre än Jevs 0.095 i samma svit — medan dess Brier-poäng på 0.530 är sämre än Jevs 0.358. Kalibrerat fel och medelkvadratiskt sannolikhetsfel är inte samma mätning, och en tabell som visar att den ena ser stark ut och den andra ser svag ut säger att fördelningen är välformad nära sina konfidenstoppar och fetare än den borde vara däremellan. Om ditt system tillämpar tröskelvärden på konfidens har den skillnaden större betydelse än genomsnittet.

Vad 1,71 GB faktiskt ger

Inferensvägen i denna modell är en poängsättare, inte en generator, och skillnaden i kostnad är strukturell snarare än inkrementell. Du ger den ett delat tillstånd, ett schema över namngivna frågor och valfritt upp till åtta bilder. Varje fråga är en av tre typer: val (ett av en ordnad uppsättning alternativ), poäng (en ordinalskala, returnerad som ett sannolikhetsviktat förväntat värde), eller noul (binär nej/ja). Tillståndet, schemat och ett komplett JSON-skelett för assistenten renderas med en platshållare per fält, modellen kör en enda kausal framåtpassning, och logits läses vid positionen omedelbart före varje platshållare. En softmax beräknas endast över det fältets tillåtna kandidatsymboler, checkpointens inpassade kalibrering tillämpas, symbolerna mappas tillbaka till dina alternativvärden.

Tre konsekvenser följer av det. Det finns ingen utdatatoken och därför inget utdatapris — en miljon beslut kostar ingenting i tokens. Det finns ingen avkodningsloop och ingen klammerparentes att glömma, så felformad JSON är inte ett felmod. Och eftersom varje fälts svarsrymd sätts samman per begäran behöver ett schema som du hittar på i eftermiddag ingen omskolning: lägg till en fråga och dess alternativ blir kandidatsymboler för det fältet.

Gränserna anges lika rakt på sak. En till sexton frågor, upp till 62 alternativ vardera, upp till åtta bilder och en standardgräns på 8 192 token – där indata över gränsen avvisas i stället för att trunkeras. Den sista satsen är ett designbeslut värt att uppehålla sig vid, eftersom tyst trunkering är hur en klassificerare tyst börjar svara på en annan fråga än den du ställde. InternLM misslyckas högljutt i stället, vilket är korrekt och samtidigt en operativ fälla: en lång ärendetråd plus ett schema plus bilder kommer att blåsa förbi 8 192 snabbare än du räknar med, och det finns ingen smidig väg när det väl händer.

Och de 1,71 GB köper en körtidsekonomi du kan räkna ut. Vid 33,98 ms per beslut är en miljon beslut 9,44 timmar på ett RTX 4090. 4B behöver 12,3 timmar för samma miljon, och ger upp tio och en halv procentenheter i noggrannhet i utbyte mot de 7,37 GB du inte hade. Ingen av siffrorna inkluderar kostnaden för burken, och ingen av dem inkluderar delen som folk glömmer: du driver en tjänst, och det finns ingen server i repot.

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 är inte en enda modell, och det är den billiga änden man bör lägga märke till

Qwen 3.8, om man betraktar det som ett fristående namn, är Qwen3.8-2.4T-A95B: den 2,4 biljoner parametrar stora glesa mixture-of-experts-kärnan som Alibaba publicerade som öppna vikter den 12 augusti 2026, med ungefär 95 miljarder aktiva parametrar per token och en anpassad licens i stället för Apache 2.0. Den hostade leveransen av samma kärna är Qwen3.8-Max, allmänt tillgänglig via ett prissatt API sedan den 3 augusti och uppdaterad som en daterad snapshot från den 2 september. De är en hjärna som säljs på två sätt, och den andra leveransen är den som de flesta faktiskt kommer att anropa.

Enligt oberoende mätningar mäter Artificial Analysis Septembersnapshoten av Qwen3.8-Max till ett Intelligence Index på 45,4 – femtonde plats av 145 indexerade modeller – med en AA Coding-poäng på 76,2 på nionde plats av 138, GPQA Diamond på 92,8, Humanity's Last Exam på 43,1 och en long-context-recall-poäng på 80,3. Den öppna checkpointen ligger efter det API som den destillerades från, på 39,9. I vårt eget sjudagarsfönster i playgrounden ligger Qwen3.8-Max på en p50 på 2 578 ms och en p95 på 9 539 ms vid 55,5 utdatatokens per sekund, med en felfrekvens på 1,57 %. Qwen3.8-Max går att anropa på OrcaRouter hos leverantör med 0 % påslagså en prisändring från Alibaba är aktiv hos oss samma dag i stället för vid nästa faktureringscykel.

Den densa syskonmodellen är dock den man bör väga mot en lokal checkpoint på 1,71 GB, eftersom den är det billigaste sättet att köpa generell kapacitet i den här familjen. Qwen3.8-27B är Apache 2.0, har en nativ kontext på 262 144 tokens, och Qwen3.8-27B ligger på 0,33 USD och 2,40 USD per miljon tokens i vår katalog. Dess Artificial Analysis Intelligence Index är 33,7. Den har ungefär trettiotvå gånger så många parametrar som Intern-Decision-0.8B, är fortfarande generativ och fortfarande fel instrument för ett beslut i sluten mängd vid volym – men den är det ärliga mittenalternativet och den enda medlemmen i den här jämförelsen som är genuint billig och genuint generell på samma gång.

Poängsättare mot generator, enkelt uttryckt.

• Kontext — Qwen3.8-Max har ett tokenfönster på 1 000 000. Intern-Decision-0.8B avvisar allt över 8 192. En faktor på 122, framtvingad i stället för avkortad.

• Indata – Qwen3.8-Max tar emot text, bild och video. Intern-Decision-0.8B tar emot text och upp till åtta bilder, och bildtoken räknas mot samma budget på 8 192.

• Utdata — Qwen3.8-Max skriver, resonerar, anropar verktyg och avger JSON på begäran. Intern-Decision-0.8B kan inte producera ett stycke, en motivering eller en plan. Den kan bara poängsätta de alternativ som du redan hade tänkt lista.

• Kostnad per anrop – ett realistiskt triageanrop med 800 indatatokens och 150 utdatatokens kostar cirka 0,0025 USD på Qwen3.8-Max, innan några resonemangstokens, och dess utdatasida är optimistiskt liten eftersom den är en resonemangsmodell. En miljon sådana anrop är ungefär 2 500 USD. Intern-Decision-0.8B har inget tokenpris alls: en miljon beslut är 9,44 timmar på en 4090 som du äger eller hyr.

• Latens – 2 578 ms i median på Qwen3.8-Max under de senaste sju dagarna, inklusive nätverk och kötid. Intern-Decision-0.8B:s 33,98 ms är bara en forward-pass på ett lokalt grafikkort och är inte samma mätning; den ärliga jämförelsen är en storleksordning, inte åttio gånger.

• Bevis — varje Intern-Decision-0.8B-siffra här är leverantörsrapporterad i InternLMs egna testramverk och inte reproducerad av någon, inklusive latensen. Varje Qwen 3.8-siffra är antingen Alibabas egen eller en mätning från Artificial Analysis, och de är märkta separat ovan.

• Oberoende poäng — Qwen3.8-Max har en. Intern-Decision-0.8B har ingen av något slag, och ingen inferensleverantör driftsätter den.

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

Två sätt att köra den här pipelinen

Den operativa förgreningen är vassare än benchmark-förgreningen. Intern-Decision-0.8B är en modul, inte en tjänst. Det finns ingen OpenAI-kompatibel endpoint, ingen batchserver, ingen hälsokontroll, ingen återförsökspolicy och ingen andra replik om du inte bygger en. Den laddas i en process och svarar på en dict i taget, och om du behöver failover är du failover. Det är en rimlig beskrivning av en forskningscheckpoint med 853 miljoner parametrar som publicerats utan en lanseringsnotis, och det bör vägas in i beslutet i enlighet därmed.

Den generativa halvan av samma pipeline är ett nätverksanrop, och ett nätverksanrop är vad en router är till för. Både Qwen3.8-Max och Qwen3.8-27B går att nå bakom en enda OpenAI-kompatibel nyckel, och automatisk failover innebär att en degraderad uppströmstjänst inte blir din incident — värt att nämna här eftersom Qwen3.8-Maxs live-felfrekvens över sju dagar på vår sida är 1,57 %, vilket är lågt tills det är din förfrågan. Mönstret som är vettigt är det som den här kombinationen tyst har beskrivit: kör den billiga scorern för den slutna uppsättningen lokalt eftersom den är snabb och inte kostar något per anrop, och routa resonemangssteget eftersom det är där prissänkningarna, modellbytena och avbrotten faktiskt inträffar.

Två saker kommer vi inte att påstå. Intern-Decision-0.8B är inte en av våra rutter och kommer inte att vara det förrän InternLM hostar den någonstans – vi tänker inte antyda något annat. Och vi hostar ingen InternLM-modell alls i dag, så inget i den här artikeln är en pitch för att köra ämnet genom oss.

Vad skulle ändra svaret

Tre öppna frågor, alla besvarbara inom några dagar. Publicerar InternLM det GitHub-repositorium som dess eget kort länkar till, och tillsammans med det en beskrivning av hur dessa vikter justerades? Följs checkpoints av ett lanseringsinlägg som förvandlar en tyst push till en dokumenterad release med en angiven driftsättningsberättelse? Och reproducerar någon oberoende medelvärdet 79,38 eller kalibreringsfelet 0,066 på hårdvara som inte är InternLMs?

Tills ett av dem landar är den ärliga tolkningen av Intern-Decision-0.8B snäv och specifik: det är den billigaste poängsättaren för slutna mängder i en familj på tre, på ett fotavtryck som får plats där dess egen snabbare och mer träffsäkra syskonmodell inte gör det, publicerad utan tillkännagivande och utan den enda artefakt som skulle tala om vad den var optimerad för. Om ditt beslut gäller en sluten mängd, dina svar går att räkna upp i en prompt och 1,71 GB är siffran som din driftsättning faktiskt hänger på, är det rätt val och det finns inget annat som liknar det i den storleken. Om ditt svar inte går att räkna upp i förväg, eller om ditt tillstånd överstiger 8 192 tokens, eller om du behöver en motivering som du kan visa för en människa, då var det aldrig en nära jämförelse — och modellen du vill ha var aldrig den med 853 miljoner parametrar.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen