Ett titelkort för en jämförelseartikel med texten Intern-Decision-4B vs Qwen 3.8, med underrubriken En framåtpassning på 44 millisekunder mot 2,4 biljoner parametrar, med tre platta linjeikoner som antyder en liten snabb poängsättare, en stor resonemangsmodell och en kostnadsjämförelse.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: En 44-millisekunders framåtpassning mot 2,4 biljoner parametrar

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

InternLM publicerade Intern-Decision-4B på Hugging Face på morgonen den 26 september 2026 – inget lanseringsinlägg, inget blogginlägg, en GitHub-länk på dess eget modellkort som returnerar 404 och en demo-Space som returnerar 401. Vikterna är verkliga och nedladdningsbara; tillkännagivandet finns inte där. Och modellen bakom dem är en finjustering av Qwen3.5-4B, vilket är vad som gör jämförelsen mot den värdbaserade flaggskeppsmodellen värd mer än ett specifikationsblad. Dessa två är inte rivaler. De är de två ändarna av en pipeline, och hela frågan är var gränsen mellan dem går. Den bakomliggande kärnan är den 2,4 biljoner parametrar stora modellen som leverantören publicerade i augusti och nu erbjuder som Qwen3.8-Max, debiterad till $2,00 och $6,00 per miljon tokens; Intern-Decision-4B är en ombyggnad på 4,54 miljarder parametrar av den sju månader gamla basmodellen, som inte avger några tokens alls, svarar på upp till sexton typade frågor i en enda framåtpassning och kostar ingenting per anrop eftersom det inte finns någon utdata att debitera för.

Det korta svaret: om din uppgift är ett beslut med en sluten uppsättning svar är Intern-Decision-4B ungefär femtio gånger snabbare per beslut och strukturellt billigare, och ingen frontier-modell kommer att slå den på den smala axeln. Om din uppgift är något annat – resonemang, lång kontext, verktygsanvändning, vad som helst där svaret inte redan är uppräknat i din prompt – är Qwen 3.8 inte bara bättre, det är den enda av de två som överhuvudtaget kan utföra jobbet. Allt nedan handlar om att hitta den gränsen exakt.

Vad som faktiskt är bekräftat, och vad som inte är det

Börja med bevisen, eftersom inramningen spelar roll. Det finns inget leverantörsmeddelande för Intern-Decision-4B. Inget pressmeddelande, ingen artikel, ingen repo-beskrivning att läsa. Det som finns i dag är ett Hugging Face-repositorium som publicerades i morse under internlm-organisationen – Intern Large Models, gruppen från Shanghai AI Laboratory – med Apache 2.0-licensen och Qwens uppströmslicens bevarad bredvid som LICENSE-QWEN. Två syskoncheckpoints dök upp inom fyrtio sekunder från varandra: Intern-Decision-0.8B med 853 miljoner parametrar och Intern-Decision-2B med 2,21 miljarder. Alla tre har samma taggar – beslutsfattande, multimodal, strukturerad prediktion – och alla tre ligger under en modellsamling som ännu inte kan nås offentligt.

Vad som inte är bekräftat: huruvida detta är den färdiga utgåvan eller en tidig push. Repositoriet skapades 05:36 UTC och ändrades igen före 08:00 UTC samma dag, och ytterligare offentlig aktivitet kring systercheckpoints fortsatte efter 09:00. InternLM har inte sagt hur den är tänkt att driftsättas, har inte publicerat repositoriet som det länkar till, och har inte sagt om en hostad slutpunkt är på väg. Behandla varje benchmark-siffra i den här artikeln som leverantörsrapporterad och icke reproducerad – för i skrivande stund har bokstavligen inget annat skrivits om den här modellen någonstans. Tre separata sökvägar ger inga träffar på namnet.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

Den arkitektoniska satsningen: en scorer, inte en generator

Den viktigaste meningen i Intern-Decision-4B:s egen dokumentation är en negation: inferensvägen "anropar inte generate() eller samplar fritext." Det är inte en implementationsdetalj, det är hela designen, och det är vad som skiljer detta från att anropa Qwen3.8-Max med ett JSON-schema och hoppas att måsvingen stängs.

Här är mekanismen, så som kortet beskriver den. Du ger modellen ett delat tillstånd, ett schema med namngivna frågor och valfritt upp till åtta bilder. Varje fråga är en av tre typer: choice (välj ett av en ordnad uppsättning alternativ), score (betygsätt på en ordinalskala, som returneras som ett sannolikhetsviktat förväntat värde), eller noul (ett binärt nej/ja). Systemprompten, tillståndet, schemat och ett komplett JSON-skelett för assistenten renderas med en platshållare per fält. Sedan – och det här är tricket – kör modellen en kausal framåtpassning, och logitsen läses vid positionen omedelbart före varje platshållare. En softmax beräknas endast över det fältets tillåtna kandidatsymboler, kontrollpunktens kalibrering tillämpas, och symbolerna mappas tillbaka till dina ursprungliga alternativvärden.

Konsekvenserna är konkreta. Eftersom varje fälts svarsrymd sätts samman per begäran i stället för att bakas in i ett vokabulärhuvud, kräver ett schema som du hittar på i eftermiddag ingen omskolning – lägg till en fråga, och alternativen blir kandidatsymboler för det fältet. Eftersom det inte finns någon avkodningsloop finns det ingen utdatatoken, ingen klammerparentes att glömma och ingen återförsökslogik kring felaktig JSON. Och eftersom alla frågor poängsätts utifrån samma läsning av tillståndet kostar sexton frågor en framåtpassning, inte sexton.

Gränserna är lika konkreta, och kortet anger dem utan förbehåll. En till sexton frågor, upp till 62 alternativ per fråga, upp till åtta bilder. Ett standardmaximum på 8 192 tokens – och indata som överskrider det avvisas utan trunkering. Den sista satsen är ett designbeslut värt att uppehålla sig vid: tyst trunkering är hur en klassificerare tyst börjar svara på en annan fråga än den du ställde, och InternLM har valt att misslyckas högljutt i stället. Det är rätt beslut, och det är också en operativ fälla, eftersom en lång ärendetråd plus ett schema plus bilder kommer att spränga 8 192-gränsen snabbare än du förväntar dig och det finns ingen smidig väg – du får ett felmeddelande.

Där Intern-Decision-4B vinner, och det är inte ens nära

Två axlar, och båda är strukturella snarare än inkrementella.

• Latens per beslut — 44,16 ms medelvärde, 44,03 ms median, 44,60 ms vid p95, uppmätt på ett enda RTX 4090 via den lokala Hugging Face-vägen. Jämfört med Qwen3.8-Max, vars aktuella sjudagarsfönster på vår egen playground visar ett p50 på 2 474 ms och ett p95 på 9 789 ms vid 55,4 utdatatokens per sekund. Det är ungefär 56× vid medianen, och jämförelsen är inte så mycket orättvis som den är mellan två olika operationer: den ena modellen klassificerar, den andra resonerar och skriver sedan. Gapet är verkligt, och detsamma gäller skälet till det.

• Kostnad per beslut – och detta är aritmetik, inte åsikt. Ta ett realistiskt supporttriageanrop: 800 indatatoken av tillstånd och schema, och 150 utdatatoken med strukturerad JSON. På Qwen3.8-Max blir det 800 × $2.00/M plus 150 × $6.00/M, eller ungefär $0.0025 per beslut, innan en enda resonemangstoken – och Qwen3.8-Max är en resonemangsmodell, så utdatasidan är optimistiskt liten. En miljon beslut kostar ungefär $2 500. Samma miljon beslut på Intern-Decision-4B kostar noll i tokens och cirka 12,3 timmar RTX 4090-tid. Intern-Decision-4B har inget utdatapris eftersom den inte har någon utdata.

Avvägningen är ärlig och uppenbar: 4B:n behöver en GPU som du äger eller hyr, den upptar den GPU:n, och den kan aldrig göra något annat än en enda sak. Men om den enda saken är det din produkt gör miljontals gånger om dagen, är räkneexemplet ovan hela affärscaset, och ingen mängd kapacitet hos frontier-modeller ändrar på det.

Siffran som Qwen 3.8 inte publicerar: kalibrering

Detta är den tysta differentieraren, och det är den som de flesta jämförelser kommer att missa, eftersom den inte ser ut som ett benchmark.

Intern-Decision-4B returnerar en fördelning över dina alternativvärden, inte bara en etikett — plus en konfidens, och för nya frågor den kalibrerade sannolikheten för ja. InternLM rapporterar en Brier-poäng på 0,347 och ett kalibreringsfel på 0,065 i sin egen svit, och levererar den anpassade temperaturen i checkpointen: 1,99241824, anpassad separat för denna storlek genom minimering av negativ log-likelihood på 1 728 avsedda kalibreringsfall med 1 693 hållna valideringsfall. Testsvitens etiketter användes inte för att välja den. Det finns en andra, oberoende diagnostik med 96 fall i kortet som använder exakta referensfördelningar snarare än samplade etiketter, och den visar att övergripande Brier/ECE går från 0,628 / 0,089 före kalibrering till 0,0 / 0,089 efter — kalibreringssteget minskar det förväntade felet med väl över.

Titta nu efter samma siffra på Qwen 3.8-sidan. Den finns inte där. Alibaba publicerar poäng för Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking och återkallning i långa kontexter – alla kapacitetsmått. Det publicerar inget kalibreringsmått för någon medlem i Qwen 3.8-familjen, eftersom en generativ modells konfidens inte är en kvantitet som leverantören levererar. Om ditt system behöver en sannolikhet som det kan tröskla på eller routa på snarare än ett svar som det måste lita på, är den skillnaden inte en fråga om grad. Den ena modellen ger dig ett tal med en dokumenterad felfrekvens; den andra ger dig text, och du bygger din egen konfidensuppskattning runt den.

Där Qwen 3.8 vinner, och det är inte ens nära

Ställ de två sida vid sida när det gäller vad de kan ombes att göra, så upphör gränserna att vara subtila.

• Kontext — Qwen3.8-Max har ett fönster på 1 000 000 token. Intern-Decision-4B avvisar allt över 8 192. Det är en faktor på 122, och det finns ingen väg runt det, eftersom gränsen för indata tillämpas i stället för att trunkeras.

• Inmatningsmodalitet – Qwen3.8-Max tar text, bild och video. Intern-Decision-4B tar text och bilder, upp till åtta, och bildtokens räknas mot samma budget på 8 192.

• Resonemang och verktyg — Qwen3.8-Max har verktygsanvändning, JSON-läge och resonemang bland sina deklarerade förmågor, och uppnår ett Artificial Analysis Intelligence Index på 45,4, på femtonde plats av 145 indexerade modeller, med en AA Coding-poäng på 76,2 på nionde plats av 138. Det är oberoende siffror publicerade av Artificial Analysis, inte leverantörspåståenden. Intern-Decision-4B har ingen post hos Artificial Analysis, ingen oberoende poäng av något slag och ingen förmåga att resonera, planera eller anropa något.

• Fritt formulerad utdata — Qwen3.8-Max skriver. Intern-Decision-4B kan inte producera ett stycke, en motivering eller en plan. Den kan bara poängsätta de alternativ som du redan hade kommit på att lista.

Värt att notera på open-weights-sidan också: om du vill ha själva Qwen 3.8-kärnan och inte den hostade vägen, är Qwen3.8-27B det dense-syskonet — 27,8 miljarder parametrar, Apache 2.0, en kontext på 262 144 tokens och ungefär $0,33 / $2,40 per miljon tokens där den serveras. Den får 33,7 på AA Intelligence Index. Den är fortfarande en storleksordning större än Intern-Decision-4B, fortfarande generativ och fortfarande fel verktyg för ett beslut med sluten uppsättning i stor skala — men det är det ärliga mellanalternativet, och det enda av de tre som är både genuint billigt och genuint kapabelt på en och samma gång.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Att läsa InternLMs egen benchmarktabell ärligt

Intern-Decision-4B:s modellkort innehåller en jämförelsetabell, och det som saknas i den är mer informativt än vad som finns i den. Raderna är Jev, Laya, SemIf, Kev, JevK5 och InternLM:s egna 0.8B och 2B. Var och en av dessa är ännu en post av typen System One eller beslutsmodell — Jev från TypeSafe AI, Laya från Convai Innovations och tre andra. Varje siffra är rapporterad av leverantören i InternLM:s egna testramverk. Det finns överhuvudtaget ingen frontiermodell i tabellen.

Det är inte ett förbiseende. Det är den ärliga omfattningen av anspråket. Intern-Decision-4B:s huvudgenomsnitt på 90,02 över sju testsviter — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — är ett anspråk på att leda kategorin för beslutsmodeller, vilket den gör i den här tabellen, och slår Jevs 88,74 och Layas 57,77. Det är inte ett anspråk på att konkurrera med Qwen 3.8, och InternLM gör inte det anspråket någonstans. Modellkortet är avgränsat till sin egen kategori, och att läsa en kategorivinst som en kapacitetsvinst är misstaget som det här avsnittet finns för att förhindra.

Ytterligare två varningar. Latenssiffrorna – 44 ms i snitt på ett 4090 – är leverantörsmätta, beroende av arbetsbelastning och hårdvara, och en framåtpassning på ett enda GPU är inte samma mätning som ett API-anrop hos en extern tjänst, som inkluderar nätverksrundtur och kötid. Och kalibreringspiloten omfattar 96 fall: en diagnostik, inte ett benchmark, och det står uttryckligen på kortet.

Utplaceringsfrågan, som är den verkliga förgreningen.

Glöm benchmarks för en stund och fråga dig vad var och en kräver av dig rent operativt.

Intern-Decision-4B är ungefär 9,1 GB på disk i bf16 – två språk-shardar på 4,26 GB och 4,15 GB, ett 612 MB visionstorn och en 54 MB-projektor. Den laddas via en 16 KB inference.py som medföljer i själva repot, med en DecisionEngine-klass som du instansierar en gång och återanvänder. En Python-dict in, en svars-dict ut, med krav på Python 3.12+. Den körs på 44 ms på en 4090, och 0,8B-syskonet är litet nog att resonera om på betydligt mindre. Men modulen är gränssnittet – det finns ingen server, ingen OpenAI-kompatibel slutpunkt och inget hostat API. Du bygger tjänsten runt den, och om du behöver två av dem för failover bygger du det också.

Den generativa sidan av samma pipeline är ett helt annat beslut, och det är det som en router faktiskt är till för. Qwen3.8-Max och Qwen3.8-27B är båda anropbara på OrcaRouter bakom samma OpenAI-kompatibla nyckel, till leverantörens listpris med 0 % påslag som förs vidare — så när Alibaba ändrar ett Qwen-pris är det live hos oss samma dag i stället för vid nästa faktureringscykel. Intern-Decision-4B är inte en av våra rutter och kommer inte att vara det förrän InternLM hostar den någonstans; vi tänker inte låtsas något annat. Det vi täcker är den halva av den här pipelinen som är ett nätverksanrop: en nyckel för 200+ modeller, automatisk failover om Qwen3.8-Max försämras — dess live-sjudagarsfelfrekvens är 1,78 % — och möjligheten att A/B-testa de två Qwen 3.8-nivåerna mot varandra i samma anropsväg innan du bestämmer dig för någon av dem.

Vilket är mönstret som är värt att ta med sig. Kör scorern lokalt, eftersom den är billig och snabb och gör en enda smal sak bra. Routa resonemangssteget, för det är där leverantörsbyten och prissänkningar och avbrott faktiskt sker.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Vilken du egentligen borde välja

Välj Intern-Decision-4B om ditt beslut har en sluten uppsättning svarsalternativ, dina svar går att räkna upp i en prompt, du kör samma beslut i stor skala och du bryr dig om sannolikheten lika mycket som om etiketten. Ärendefördelning, innehållsmoderering mot en fast taxonomi, strukturerad extraktion till ett schema du kontrollerar, betygskriterier, binära grindar – allt där en människa skulle ha kunnat skriva alternativlistan i förväg. De 4,54 miljarder parametrarna är ärliga om taket: kortet självt visar 4B på 73,87 på Jevbench-Hard mot 100,00 på Easy, så ju svårare beslutsformen är, desto mer ger den lilla modellen upp.

Välj Qwen 3.8 – det vill säga Qwen3.8-Max om du vill ha den hostade kärnan, Qwen3.8-27B om du vill ha vikter du kan hålla i handen – om svaret inte kan räknas upp i förväg, om indata är längre än 8 192 tokens, om du behöver en motivering du kan visa för en människa, om du behöver verktygsanrop eller om du behöver video. Välj det också om du helt enkelt inte vill driva en GPU: 12,3 timmar 4090-tid per miljon beslut är billigt bara om du redan har 4090:n och något annat att göra med den de övriga 363 dagarna.

Välj båda om din pipeline har den form som de flesta pipelines faktiskt har – en billig klassificerare för slutna mängder framför, en frontier-modell bakom den för de fall där klassificeraren är osäker. Det är den konfiguration som Intern-Decision-4B:s kalibrerade konfidens byggdes för, och det är anledningen till att ECE-siffran ovan väger tyngre än det genomsnitt som lyfts fram i rubriken.

Vad du ska titta på

Tre öppna frågor, alla kan besvaras inom några dagar. Publicerar InternLM det GitHub-repositorium som dess eget kort länkar till – för närvarande en 404 – och tillsammans med det en träningsbeskrivning? Följs vikterna av ett tillkännagivande som förvandlar en tyst push till en dokumenterad release? Och reproducerar något oberoende 90,02-genomsnittet, eller 0,347 Brier, på hårdvara som inte är InternLM:s?

Det finns en liten inkonsekvens att notera medan du väntar, för det är den typ av sak som spelar roll när du dimensionerar en driftsättning. Modellen heter 4B. Parameterantalet är 4 539 265 536 – 4,54 miljarder. Syskonmodellen 0.8B är 853 miljoner och syskonmodellen 2B är 2,21 miljarder, båda avrundas uppåt eller nedåt med en hårsmån. Endast 4B avrundas nedåt med mer än en halv miljard. Det är inte ett problem. Det är en påminnelse om att vid en oannonserad lansering är dokumentet den enda specifikation du har, och till och med dokumentet redigeras fortfarande.