Een titelkaart voor een vergelijkingsartikel met de tekst Intern-Decision-4B vs Qwen 3.8, met als ondertitel Een forward pass van 44 milliseconden tegenover 2,4 biljoen parameters, met drie platte lijniconen die een kleine snelle scorer, een groot redeneermodel en een kostenvergelijking suggereren.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: een forward pass van 44 milliseconden tegen 2,4 biljoen parameters

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

InternLM heeft Intern-Decision-4B op de ochtend van 26 september 2026 op Hugging Face gepubliceerd — geen aankondigingsbericht, geen blogartikel, een GitHub-link op de eigen modelkaart die 404 retourneert en een demo-Space die 401 retourneert. De gewichten zijn echt en downloadbaar; de aankondiging ontbreekt. En het model daaronder is een fine-tune van Qwen3.5-4B, wat de vergelijking met het gehoste vlaggenschip meer waard maakt dan een specsheet. Deze twee zijn geen rivalen. Het zijn de twee uiteinden van één pijplijn, en de hele vraag is waar de grens tussen hen ligt. De onderliggende kern is het model met 2,4 biljoen parameters dat de leverancier in augustus publiceerde en nu wordt aangeboden als Qwen3.8-Max, gefactureerd tegen $2,00 en $6,00 per miljoen tokens; Intern-Decision-4B is een herbouw met 4,54 miljard parameters van dat zeven maanden oude basismodel, dat helemaal geen tokens uitzendt, tot zestien getypeerde vragen in één enkele forward pass beantwoordt, en niets kost per aanroep omdat er geen uitvoer is om voor te factureren.

Het antwoord in één regel: als je taak een beslissing is met een gesloten set antwoorden, is Intern-Decision-4B ongeveer vijftig keer sneller per beslissing en structureel goedkoper, en geen enkel frontier-model zal het op die smalle as verslaan. Als je taak iets anders is — redeneren, lange context, toolgebruik, alles waarbij het antwoord niet al in je prompt staat opgesomd — dan is Qwen 3.8 niet alleen beter, het is de enige van de twee die het werk überhaupt kan doen. Alles hieronder gaat erom die grens precies te vinden.

Wat is daadwerkelijk bevestigd, en wat niet

Begin bij het bewijs, want de framing is belangrijk. Er is geen leveranciersaankondiging voor Intern-Decision-4B. Geen persbericht, geen paper, geen repositorybeschrijving om te lezen. Wat vandaag bestaat, is een Hugging Face-repository die vanochtend is gepubliceerd onder de internlm-organisatie — Intern Large Models, de groep van het Shanghai AI Laboratory — met de Apache 2.0-licentie en daarnaast de upstream Qwen-licentie bewaard als LICENSE-QWEN. Twee zustercheckpoints verschenen binnen veertig seconden van elkaar: Intern-Decision-0.8B met 853 miljoen parameters en Intern-Decision-2B met 2,21 miljard. Alle drie dragen dezelfde tags — besluitvorming, multimodaal, gestructureerde voorspelling — en alle drie vallen ze onder één modelcollectie die nog niet publiekelijk resolveert.

Wat niet bevestigd is: of dit de definitieve release is of een vroege push. De repository is aangemaakt om 05:36 UTC en dezelfde dag vóór 08:00 UTC opnieuw gewijzigd, en verdere publieke activiteit op de zustercheckpoints ging door na 09:00. InternLM heeft niet gezegd wat het beoogde uitrolverhaal is, heeft de repository waarnaar het linkt niet gepubliceerd, en heeft niet gezegd of er een gehoste endpoint aankomt. Beschouw elke benchmarkscore in dit artikel als door de leverancier gerapporteerd en niet gereproduceerd — want op het moment van schrijven is er werkelijk nergens anders iets over dit model geschreven. Drie afzonderlijke zoekpaden leveren niets op over de naam.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

De architecturale gok: een scorer, geen generator

De belangrijkste zin in de eigen documentatie van Intern-Decision-4B is een ontkenning: het inferentiepad "roept generate() niet aan en samplet geen vrije tekst." Dat is geen implementatiedetail, het is het hele ontwerp, en het is wat dit onderscheidt van het aanroepen van Qwen3.8-Max met een JSON-schema en hopen dat de accolade sluit.

Hier is het mechanisme, zoals de kaart het beschrijft. Je geeft het model een gedeelde toestand, een schema van benoemde vragen, en optioneel tot acht afbeeldingen. Elke vraag is een van drie typen: choice (kies er één uit een geordende set opties), score (beoordeel op een ordinale schaal, geretourneerd als een waarschijnlijkheidsgewogen verwachte waarde), of noul (een binaire nee/ja). De systeemprompt, toestand, schema en een compleet JSON-skelet voor de assistent worden weergegeven met één placeholder per veld. Dan — en dit is de truc — voert het model één causale forward pass uit, en de logits worden gelezen op de positie direct vóór elke placeholder. Er wordt een softmax genomen over alleen de toegestane kandidaatsymbolen van dat veld, de kalibratie van het checkpoint wordt toegepast, en de symbolen worden teruggezet naar je oorspronkelijke optiewaarden.

De gevolgen zijn concreet. Omdat de antwoordruimte van elk veld per verzoek wordt samengesteld in plaats van te worden ingebakken in een vocabulaire-head, hoeft een schema dat je vanmiddag bedenkt niet opnieuw te worden getraind — voeg een vraag toe, en de opties worden kandidaatsymbolen voor dat veld. Omdat er geen decoderingslus is, is er geen outputtoken, geen accolade om te vergeten, en geen retry-logica rond misvormde JSON. En omdat alle vragen worden gescoord op basis van dezelfde uitlezing van de toestand, kosten zestien vragen één forward pass, niet zestien.

De limieten zijn even concreet, en de kaart vermeldt ze zonder enige terughoudendheid. Eén tot zestien vragen, tot 62 opties per vraag, tot acht afbeeldingen. Een standaardmaximum van 8.192 tokens — en invoer die dat overschrijdt wordt zonder afkapping afgewezen. Die laatste clausule is een ontwerpbeslissing die het overdenken waard is: stille afkapping is hoe een classifier ongemerkt een andere vraag begint te beantwoorden dan degene die je stelde, en InternLM heeft ervoor gekozen om in plaats daarvan luidruchtig te falen. Het is de juiste keuze, en het is ook een operationele valkuil, want een lange ticketthread plus een schema plus afbeeldingen zullen de 8.192 sneller overschrijden dan je verwacht en er is geen elegante route — je krijgt een foutmelding.

Waar Intern-Decision-4B wint, en het is niet eens nipt.

Twee assen, en beide zijn structureel in plaats van incrementeel.

• Latentie per beslissing — 44,16 ms gemiddeld, 44,03 ms mediaan, 44,60 ms bij p95, gemeten op één enkele RTX 4090 via het lokale Hugging Face-pad. Vergeleken met Qwen3.8-Max, waarvan het live venster van zeven dagen op onze eigen playground een p50 van 2.474 ms en een p95 van 9.789 ms laat zien bij 55,4 outputtokens per seconde. Dat is ongeveer 56× op de mediaan, en de vergelijking is niet zozeer oneerlijk als wel een vergelijking tussen twee verschillende bewerkingen: het ene model classificeert, het andere redeneert en schrijft vervolgens. Het verschil is reëel, en de reden ervoor ook.

• Kosten per beslissing — en dit is rekenwerk, geen mening. Neem een realistische supporttriage-aanroep: 800 invoertokens aan state en schema, en 150 uitvoertokens aan gestructureerde JSON. Bij Qwen3.8-Max is dat 800 × $2,00/M plus 150 × $6,00/M, of ongeveer $0,0025 per beslissing, nog vóórdat er ook maar één redeneertoken is meegerekend — en Qwen3.8-Max is een redeneermodel, dus de uitvoerkant is optimistisch klein. Een miljoen beslissingen kost ongeveer $2.500. Dezelfde miljoen beslissingen op Intern-Decision-4B kosten qua tokens niets en ongeveer 12,3 uur RTX 4090-tijd. Intern-Decision-4B heeft geen uitvoerprijs omdat het geen uitvoer heeft.

De ruil is eerlijk en duidelijk: de 4B heeft een GPU nodig die je bezit of huurt, hij neemt die GPU in beslag, en hij kan maar één ding doen. Maar als dat ene ding is wat je product miljoenen keren per dag doet, dan is de bovenstaande rekensom de hele businesscase, en geen enkele hoeveelheid frontier-modelcapaciteit verandert daar iets aan.

Het getal dat Qwen 3.8 niet publiceert: kalibratie

Dit is het stille onderscheidende element, en het is precies wat de meeste vergelijkingen zullen missen, omdat het er niet als een benchmark uitziet.

Intern-Decision-4B retourneert een verdeling over je optiewaarden, niet alleen een label — plus een vertrouwensscore, en voor noul-vragen de gekalibreerde kans op ja. InternLM rapporteert een Brier-score van 0,347 en een verwachte kalibratiefout van 0,065 over zijn eigen suite, en levert de gefitte temperatuur in de checkpoint: 1,99241824, afzonderlijk voor deze grootte gefit door minimalisatie van de negatieve log-likelihood op 1.728 aangewezen kalibratiegevallen met 1.693 achtergehouden validatiegevallen. Labels van de testsuite werden niet gebruikt om die te selecteren. Er is een tweede, onafhankelijke diagnostiek van 96 gevallen in de modelkaart die exacte referentieverdelingen gebruikt in plaats van bemonsterde labels, en die laat zien dat de algehele Brier/ECE verschuift van 0,628 / 0,213 vóór kalibratie naar 0,550 / 0,089 erna — waarbij de kalibratiestap de verwachte fout met ruim meer dan de helft vermindert.

Zoek nu hetzelfde cijfer aan de Qwen 3.8-kant. Het staat er niet. Alibaba publiceert scores voor de Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking en long-context recall — allemaal capaciteitsmaten. Het publiceert geen kalibratiemetriek voor enig lid van de Qwen 3.8-familie, omdat de zekerheid van een generatief model geen grootheid is die de leverancier meelevert. Als je systeem een waarschijnlijkheid nodig heeft waarop het een drempel kan toepassen of op kan routeren in plaats van een antwoord dat het moet vertrouwen, dan is dat verschil geen kwestie van gradatie. Het ene model geeft je een getal met een gedocumenteerd foutpercentage; het andere geeft je tekst, en daar bouw je je eigen zekerheidsinschatting omheen.

Waar Qwen 3.8 wint, en het is ook niet eens nipt.

Zet de twee naast elkaar wat betreft wat van hen gevraagd kan worden, en de grenzen zijn niet langer subtiel.

• Context — Qwen3.8-Max heeft een venster van 1.000.000 tokens. Intern-Decision-4B weigert alles boven 8.192. Dat is een factor 122, en er is geen omweg, omdat de invoerlimiet wordt gehandhaafd in plaats van afgekapt.

• Invoermodaliteit — Qwen3.8-Max accepteert tekst, afbeelding en video. Intern-Decision-4B accepteert tekst en afbeeldingen, tot acht, en de afbeeldingstokens tellen mee voor hetzelfde budget van 8.192.

• Redeneren en tools — Qwen3.8-Max heeft toolgebruik, JSON-modus en redeneren onder zijn verklaarde capaciteiten, en behaalt een Artificial Analysis Intelligence Index van 45,4, de vijftiende van 145 geïndexeerde modellen, met een AA Coding-score van 76,2 op de negende plaats van 138. Dit zijn onafhankelijke cijfers gepubliceerd door Artificial Analysis, geen claims van de leverancier. Intern-Decision-4B heeft geen Artificial Analysis-vermelding, geen enkele onafhankelijke score, en geen vermogen om te redeneren, plannen of iets aan te roepen.

• Open uitvoer — Qwen3.8-Max schrijft. Intern-Decision-4B kan geen alinea, onderbouwing of plan produceren. Het kan alleen de opties scoren die je al had bedacht om op te sommen.

Ook aan de open-weights-kant het vermelden waard: als je de Qwen 3.8 core zelf wilt en niet de gehoste route, is Qwen3.8-27B het dense broertje — 27,8 miljard parameters, Apache 2.0, een context van 262.144 tokens, en ruwweg $0,33 / $2,40 per miljoen tokens waar het wordt aangeboden. Het scoort 33,7 op de AA Intelligence Index. Het is nog steeds een orde van grootte groter dan Intern-Decision-4B, nog steeds generatief, en nog steeds het verkeerde hulpmiddel voor een beslissing uit een gesloten set op volume — maar het is de eerlijke middenoptie, en de enige van de drie die tegelijk echt goedkoop en echt capabel is.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

InternLM's eigen benchmarktabel eerlijk lezen

De kaart van Intern-Decision-4B bevat een vergelijkingstabel, en wat daarin ontbreekt is informatiever dan wat erin staat. De rijen zijn Jev, Laya, SemIf, Kev, JevK5, en InternLM's eigen 0.8B en 2B. Elk daarvan is weer een andere vermelding van een System One- of beslissingsmodel — Jev van TypeSafe AI, Laya van Convai Innovations, en nog drie andere. Elk cijfer is door de leverancier gerapporteerd op InternLM's eigen harnassen. Er staat helemaal geen frontiermodel in de tabel.

Dat is geen vergissing. Het is de eerlijke reikwijdte van de claim. Het in de kop genoemde gemiddelde van Intern-Decision-4B van 90,02 over zeven suites — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — is een claim dat het de categorie beslissingsmodellen leidt, wat het op deze tabel ook doet, en waarmee het Jevs 88,74 en Laya's 57,77 verslaat. Het is geen claim dat het kan concurreren met Qwen 3.8, en InternLM doet die claim nergens. De modelkaart is afgebakend tot zijn eigen categorie, en een categoriewinst lezen als een capaciteitswinst is de fout die deze sectie moet voorkomen.

Nog twee waarschuwingen. De latentiecijfers — gemiddeld 44 ms op een 4090 — zijn door de leverancier gemeten, afhankelijk van workload en hardware, en een forward pass op één GPU is niet dezelfde meting als een gehoste API-aanroep inclusief netwerk round-trip en wachtrijvorming. En de calibratiepilot omvat 96 cases: een diagnostisch hulpmiddel, geen benchmark, en dat staat ook op de kaart.

De deploymentkwestie, die de echte splitsing is

Vergeet heel even de benchmarks en vraag je af wat elk ervan operationeel van je vraagt.

Intern-Decision-4B is ongeveer 9,1 GB op schijf bij bf16 — twee taal-shards van 4,26 GB en 4,15 GB, een vision tower van 612 MB en een projector van 54 MB.inference.py die in de repository zelf wordt meegeleverd, met een DecisionEngine-klasse die je één keer instantieert en hergebruikt. Eén Python-dict in, één responsdict uit, met Python 3.12+ als vereiste. Hij draait in 44 ms op een 4090, en het 0.8B-zusje is klein genoeg om op veel minder te overzien. Maar de module is de interface — er is geen server, geen OpenAI-compatibele endpoint en geen gehoste API. Je bouwt de service eromheen, en als je er twee nodig hebt voor failover, bouw je dat ook.

De generatieve kant van dezelfde pipeline is een heel andere beslissing, en daar is een router nu juist voor bedoeld. Qwen3.8-Max en Qwen3.8-27B zijn beide aanroepbaar op OrcaRouter achter dezelfde OpenAI-compatibele sleutel, tegen de providerlijstprijs met 0% markup die wordt doorgegeven — dus wanneer Alibaba een Qwen-prijs aanpast, staat die dezelfde dag nog live aan onze kant in plaats van bij de volgende factuurcyclus. Intern-Decision-4B is geen van onze routes en zal dat ook niet zijn totdat InternLM het ergens host; we gaan niet doen alsof dat anders is. Wat wij dekken is de helft van deze pipeline die een netwerkaanroep is: één sleutel voor meer dan 200 modellen, automatische failover als Qwen3.8-Max het laat afweten — het actuele foutpercentage over zeven dagen is 1,78% — en de mogelijkheid om de twee Qwen 3.8-tiers in hetzelfde aanvraagpad tegen elkaar A/B te testen voordat je je op een van beide vastlegt.

Dat is het patroon dat je moet onthouden. Draai de scorer lokaal, want die is goedkoop en snel en doet één smalle taak goed. Routeer de redeneerstap, want daar vinden de leverancierswisselingen, de prijsverlagingen en de storingen daadwerkelijk plaats.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Welke je eigenlijk zou moeten kiezen

Kies Intern-Decision-4B als je beslissing een gesloten set is, je antwoorden in een prompt kunnen worden opgesomd, je dezelfde beslissing op grote schaal uitvoert en je evenveel om de waarschijnlijkheid geeft als om het label. Ticketroutering, contentmoderatie aan de hand van een vaste taxonomie, gestructureerde extractie naar een schema dat je zelf beheert, beoordelingsrubrieken, binaire poorten — alles waarvoor een mens de optielijst vooraf had kunnen schrijven. De 4,54 miljard parameters zijn eerlijk over het plafond: de kaart zelf toont de 4B op 73,87 op Jevbench-Hard tegenover 100,00 op Easy, dus hoe moeilijker de vorm van de beslissing, hoe meer het kleine model opgeeft.

Kies Qwen 3.8 — oftewel Qwen3.8-Max als je de gehoste kern wilt, Qwen3.8-27B als je gewichten wilt die je kunt vasthouden — als het antwoord niet vooraf op te sommen is, als de invoer langer is dan 8.192 tokens, als je een onderbouwing nodig hebt die je aan een mens kunt laten zien, als je tool calls nodig hebt, of als je video nodig hebt. Kies het ook als je simpelweg geen GPU wilt beheren: 12,3 uur 4090-tijd per miljoen beslissingen is alleen goedkoop als je de 4090 al hebt en er de andere 363 dagen iets anders mee te doen hebt.

Kies beide als jouw pipeline de vorm heeft die de meeste pipelines in werkelijkheid hebben — een goedkope closed-set-classifier vooraan, een frontier-model erachter voor de gevallen waarover de classifier onzeker is. Dat is de configuratie waarvoor de gekalibreerde confidence van Intern-Decision-4B is gebouwd, en het is de reden dat het ECE-getal hierboven belangrijker is dan het headline-gemiddelde.

Wat te kijken

Drie open vragen, allemaal binnen enkele dagen te beantwoorden. Publiceert InternLM de GitHub-repository waarnaar zijn eigen kaart linkt — momenteel een 404 — en daarmee een trainingsbeschrijving? Volgt er een aankondiging op de gewichten, waarmee een stille push wordt omgezet in een gedocumenteerde release? En reproduceert iets onafhankelijks het gemiddelde van 90,02, of de Brier van 0,347, op hardware die niet van InternLM is?

Er is één kleine inconsistentie om op te merken terwijl je wacht, want het is precies het soort ding dat van belang is wanneer je een deployment aan het dimensioneren bent. Het model heet 4B. Het aantal parameters is 4.539.265.536 — 4,54 miljard. Het 0.8B-zusje heeft 853 miljoen parameters en het 2B-zusje 2,21 miljard; beide ronden net een haartje naar boven of beneden af. Alleen de 4B rondt met meer dan een half miljard naar beneden af. Het is geen probleem. Het is een herinnering eraan dat bij een onaangekondigde release de documentatie de enige specificatie is die je hebt, en zelfs de documentatie wordt nog bewerkt.