Een hero-titelkaart met de tekst 'Intern-Decision-0.8B' en de ondertitel 'Stilletjes uitgebracht, niet aangekondigd', met de badges 'geen paper, geen repository, geen launchpost' en '852.985.920 parameters, 1,73 GB op schijf', met het OrcaRouter-logo in de hoek gecompositeerd.
Guides & Insights

Intern-Decision-0.8B verscheen zonder aankondiging: wat InternLM stilletjes op Hugging Face heeft gezet

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De GitHub-link op de modelkaart geeft een 404. De demo-Space geeft een 401. Er is geen collectie, geen blogpost, geen technisch rapport en nergens een zoekresultaat voor de tekenreeks "Intern-Decision" dat geen stagevacature is — en toch staat Intern-Decision-0.8B nu op Hugging Face als een complete, downloadbare Apache-2.0-checkpoint, gefinetuned vanaf Qwen3.5-0.8B, geüpload in de vroege uurtjes van 26 september 2026, met twee grotere broers die in dezelfde drie minuten verschenen: Intern-Decision-2B en Intern-Decision-4B. InternLM heeft dit eerder op deze manier uitgebracht, en daarom is alles hieronder samengesteld uit de repository zelf in plaats van uit een lanceringsbericht. Het onderscheid is hier meer dan anders van belang: een repo vertelt je wat bestaat, en alleen de leverancier kan je vertellen waarvoor het dient.

Wat de repo wel zegt, in detail, is ongewoon genoeg om de moeite van het lezen waard te zijn. Dit zijn geen chatmodellen en geen kleine taalmodellen in de gebruikelijke zin. Intern-Decision-0.8B neemt een stukje state, een schema van benoemde vragen die je vooraf schrijft, en optioneel tot acht afbeeldingen, en retourneert een antwoorddistributie voor elke vraag in één forward pass. Het roept nooit generate() aan. Het samplet nooit. Er is geen tekstuitvoer om te parsen, geen JSON om te repareren, geen retry-lus rond een accolade die nooit werd gesloten. De beperktheid is de hele architectuur, en het plaatst dit model in dezelfde kleine categorie als TypeSafe's Jev 1.13 en Convai's Laya — een categorie waartegen InternLM duidelijk met opzet heeft gebenchmarkt, omdat Jevbench TypeSafe's eigen benchmark is en het de eerste kolom van de tabel is.

Dit is wat kenbaar is vanuit de checkpoint, wat alleen door de checkpoint wordt geclaimd, en wat niemand buiten InternLM momenteel überhaupt kan zeggen.

Wat zit er eigenlijk in de repository?

De modelkaart is kort en openhartig over de afstamming. Intern-Decision-0.8B wordt beschreven als "een multimodaal gestructureerd beslissingsmodel dat is fine-tuned op Qwen3.5-0.8B" — de Qwen-basis die op 28 februari 2026 werd uitgebracht — en de repository bevat een tweede licentiebestand, LICENSE-QWEN, naast de Apache-2.0-voorwaarden, wat een afgeleid model hoort te doen en op zichzelf een klein eerlijkheidssignaal is. De index van Hugging Face meldt 852.985.920 parameters verdeeld over drie shards: een taalshard van 1,50 GB, een visionshard van 176 MB en een projector van 25 MB. De totale opslag van de repository is ongeveer 1,73 GB inclusief tokenizerbestanden, waardoor het geheel comfortabel op één consumenten-GPU of een goed uitgeruste laptop past.

De configuratie onthult een architectuur die Qwen door de hele 3.5-generatie heen heeft geleverd, in plaats van een op maat gemaakt beslissingsnetwerk. Het is een Qwen3_5ForConditionalGeneration met 24 lagen in een zich herhalend patroon van drie linear-attention-lagen op één full-attention-laag, een hidden size van 1.024, 8 attention heads tegenover 2 key-value heads, een head-dimensie van 256 en een maximale positie-embedding van 262.144 tokens. Eén enkele multi-token-prediction-laag blijft behouden. Het vision-pad is er echt een: de tekst van de modelkaart beschrijft beeldverwerking, de processor accepteert afbeeldingen, en het checkpoint levert een vision tower en projector mee om dat te ondersteunen — dus het multimodal-label op de repo wordt onderbouwd door gewichten, niet alleen door tags.

Het familiebeeld is het vermelden waard, want het bepaalt hoe je al het andere leest. InternLM uploadde drie formaten in 40 seconden: 0.8B, dan 2B, dan 4B. De parameteraantallen zijn 852.985.920, 2.213.241.664 en 4.539.265.536. De modelkaart van het 4B-model bevat een extra sectie — een kalibratiepilot met 96 gevallen met bekende verdeling en scores voor en na — die de 0.8B-kaart niet heeft. Die asymmetrie is geen bewijs van een defect in het kleine model; het is bewijs dat de documentatie van het kleine model met een korter budget is geschreven, en dat is precies hoe een stille release eruitziet.

Hoe het inferentiepad daadwerkelijk werkt

De meegeleverde inference.py is het meest informatieve bestand in de repo, omdat het een contract documenteert in plaats van een prompt. De volgorde verloopt als volgt:

• Je verstrekt een verzoek met toestand (hetgeen beoordeeld wordt), vragen (een schema) en optioneel afbeeldingen.

• De opties van elke vraag worden toegewezen aan symbolen van één token — A tot en met Z, dan kleine letters, dan cijfers, tot 62 opties per vraag.

• De systeemprompt, de status, het schema en een compleet JSON-skelet van de assistent worden weergegeven met één <decision>-placeholder per veld.

• Er wordt één causale forward pass uitgevoerd. Logits worden uitgelezen op de positie direct vóór elke placeholder.

• Er wordt alleen een softmax genomen over de toegestane kandidaatsymbolen van dat veld, de kalibratie van het checkpoint wordt toegepast, en de symbolen worden teruggezet naar je oorspronkelijke optiewaarden.

De engine biedt drie vraagtypen. choice neemt een geordend object dat optiewaarden aan beschrijvingen koppelt. score neemt een lijst — die de tekenreekswaarden "0", "1", "2" enzovoort oplevert — of een geordend object met eindige numerieke tekenreekssleutels, waardoor het model een kansgewogen verwachte waarde kan retourneren en niet alleen een categorie. noul is een binaire beslissing met nee vóór ja. Het antwoord retourneert per veld de gekalibreerde kansverdeling, een betrouwbaarheid gelijk aan de maximale kandidaatkans, de argmax-beslissing met lexicale tiebreaking, en voor score-vragen de verwachte numerieke waarde en een legenda. De limieten zijn expliciet: één tot zestien vragen per verzoek, maximaal 62 opties per vraag, een standaard invoerplafond van 8.192 tokens dat wordt geweigerd in plaats van afgekapt, en maximaal acht afbeeldingen waarvan de tokens meetellen voor dat plafond.

Twee details in die lijst verdienen aandacht, want ze bepalen of je de output kunt vertrouwen. Het eerste is dat er geen gouden antwoorden in de prompt worden ingevoegd — het model scoort kandidaten waarvoor het het antwoord niet te zien heeft gekregen. Het tweede is dat usage.output_tokens geen telling van teksttokens is; het telt gescoorde velden. Iedereen die dit in een bestaande tokenbudgetberekening inbouwt, zal daardoor verrast worden, en de kaart zegt dat ook in plaats van het te laten ontdekken.

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

De benchmarktabel, en in hoeverre je die moet geloven

Lezer, wees gewaarschuwd bij deze sectie: elk getal hieronder is door de leverancier gerapporteerd en niet gereproduceerd. InternLM heeft de benchmarks geselecteerd, de vergelijkingsmodellen gekozen, de evaluaties uitgevoerd en de tabel gepubliceerd. Er is geen onafhankelijke run van Intern-Decision-0.8B op enig openbaar leaderboard, en een zoekopdracht in Artificial Analysis levert helemaal niets op voor het model. Dat maakt de tabel niet onwaar. Het maakt de tabel ongecontroleerd, en het betekent dat de kolommen het nuttigst zijn om de vorm van het resultaat te lezen, niet het niveau.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench, drie splits — Intern-Decision-0.8B behaalt 97,92 op Easy, 80,56 op Original en 52,25 op Hard. Jev van TypeSafe staat op 100,00, 98,61 en 72,07 op dezelfde splits.

• Getypeerde beslissing — de 0,8B scoort 77,35 tegenover de 73,35 van Jev. Dit is de enige kolom waarin het kleinste model in het veld het model verslaat waarnaar de benchmark is vernoemd.

• ToolACE — 94,52 voor de 0,8B tegenover 91,29 voor Jev. ToolACE is een benchmark voor functieaanroepen, en een decision head die Jev overtroeft bij toolselectie is de meest substantiële claim in de tabel.

• AG News — 88,61 tegenover de 89,57 van Jev. Feitelijk op gelijke hoogte met de voorhoede van deze categorie bij onderwerpclassificatie in vier categorieën.

• WildJailBreak — 64,48 tegenover de 96,29 van Jev. Dit is de ineenstorting. Het is misschien wel de kolom die er het meest toe doet voor een model dat je op niet-vertrouwde invoer zou richten, en degene waarin de 0,8B het verst van de referentie af staat.

• Gemiddelde — 79,38 voor de 0,8B, 84,68 voor de eigen 2B-variant, 90,02 voor de 4B. De familie stijgt steil, precies zoals je zou verwachten, en dat is op zichzelf een bescheiden argument dat de tabel niet is terugontworpen om het vlaggenschip te vleien.

• Kalibratie — Brier 0,530 en verwachte kalibratiefout 0,066 voor de 0.8B. Jev rapporteert 0,358 en 0,095. Lees die twee samen en er ontstaat een duidelijker beeld dan elk cijfer afzonderlijk geeft: de 0.8B is beter gekalibreerd dan Jev in de ECE-zin — de opgegeven zekerheden ervan sluiten nauwer aan bij de nauwkeurigheid ervan — terwijl de algehele nauwkeurigheid duidelijk lager is. Dat is een plausibel profiel voor een klein model met een bewust gefitte temperatuur, en het is geen flatteuze combinatie om per ongeluk te publiceren.

De vergelijkingsset heeft één opvallende eigenschap: hij wordt gedomineerd door beslissingsmodellen. Jev, Laya, SemIf, Kev en JevK5 komen allemaal voor; de eigen benchmark van de tabel is van TypeSafe. InternLM koos ervoor om zich te laten meten op het terrein van een concurrent, met de harness van een concurrent, en publiceerde vervolgens de kolommen waarin zijn kleinste model verliest. Het is het soort beslissing dat een team neemt wanneer het geen marketingcampagne rond de release plant — wat in lijn is met al het andere rond hoe dit is uitgebracht.

De kalibratietemperatuur is het meest interessante getal

Intern-Decision-0.8B past een standaardtemperatuur van 2,747760550703 toe, door NLL-minimalisatie over 1.728 aangewezen kalibratiecases met 1.693 afzonderlijke validatiecases. De kaart vermeldt expliciet dat de labels van de testsuite niet zijn gebruikt om die te selecteren. De toegepaste transformatie is p = softmax(candidate_logits.float()) gevolgd door calibrated_p = softmax(log(p) / T).

Dat is kalibratie van kandidaatkansen, geen samplingtemperatuur, en het onderscheid is geen muggenzifterij. Omdat de transformatie na de softmax wordt toegepast en de volgorde behoudt, kan ze de argmax-beslissing helemaal niet veranderen. Het verschuift het vertrouwen, de noul-ja-kans en de verwachte waarde van een scorevraag — en laat de hoofdbeslissing identiek. Als je workflow het label leest, is de temperatuur een no-op. Als je workflow de waarschijnlijkheid leest — er een drempel op toepast, erop rangschikt of deze in een stroomafwaartse berekening van de verwachte waarde invoert — dan is de temperatuur het verschil tussen een getal dat iets betekent en een getal dat niets betekent. Het meegeven van temperature=1 geeft de ongekalibreerde verdeling terug, wat een nuttige ontsnappingsroute is voor iedereen die er zijn eigen kalibratie bovenop wil toepassen.

De temperatuur wordt per checkpoint afgestemd in plaats van gedeeld. Het 4B-model gebruikt een andere waarde, 1.99241824, en de modelkaart draagt je op de inferentiemodule te gebruiken die met de gedownloade grootte wordt meegeleverd, zodat de standaardkalibratie ervan overeenkomt. Iedereen die een inferentie-wrapper van het ene zustermodel naar het andere kopieert, past ongemerkt de verkeerde temperatuur toe.

Vierendertig milliseconden, en een resultaat dat niet mogelijk zou moeten zijn

InternLM heeft de end-to-end latentie per query gemeten op een enkele RTX 4090 via het lokale Hugging Face-pad — een echte meting, maar ook de traagst mogelijke servingconfiguratie, aangezien een productie-implementatie een gecompileerde of batchende runtime zou gebruiken. Jev staat vermeld met een gemiddelde van 109,70 ms en een mediaan van 106,30 ms, met een p95 van 146,70 ms. Intern-Decision-0.8B komt uit op 33,98 / 33,44 / 37,50 ms.

Het getal waarop het de moeite loont om stil te staan, is de 2B-variant: 33,28 ms gemiddeld, 33,15 ms mediaan. De 2B is sneller dan de 0,8B, met een marge die klein genoeg is om ruis te zijn, maar niet in de richting die de parameteraantallen voorspellen. Dat is geen fout in de tabel en het gaat niet echt over de modellen. Een beslissingsmodel doet precies één forward pass over een prompt waarvan de lengte wordt bepaald door de toestand, het schema en de optiebeschrijvingen — niet door wat het model schrijft, want het schrijft niets. Voor prompts in dat regime domineert het verwerken van de prompt en is het aantal parameters een secundaire kostenpost. De praktische consequentie is dat de gebruikelijke reden om naar de kleinste checkpoint te grijpen — je betaalt per token — hier niet van toepassing is. De echte reden om de 0,8B boven de 2B te verkiezen is geheugengebruik en het feit dat de volledige dataset in 1,73 GB past, niet de doorvoer.

Wat nog niet kan worden vastgesteld

Dit is het deel dat een lanceringsbericht zou hebben beantwoord en dat een repository niet kan.

Er is geen opgegeven releasedatum, geen aankondiging, en niets op de openbare kanalen van InternLM dat de familie beschrijft. De GitHub-URL die op de modelkaart is afgedrukt, werkt niet. De demo-Space waarnaar op de kaart wordt verwezen, is niet openbaar leesbaar. Er is geen collection die de drie checkpoints verzamelt, wat betekent dat de enige manier om de 2B of de 4B te vinden, is om naar de modellenlijst van de organisatie te kijken. Er is geen paper, dus de trainingsdata, het tuningrecept, het aantal trainingsstappen en wat "decision tuning" in de gewichten heeft gewijzigd, zijn allemaal niet vermeld. Er is geen onafhankelijke evaluatie, geen replicatie van latentie door derden, en nog geen bewijs dat iemand buiten InternLM de checkpoint heeft gedraaid.

Er zijn ook twee vragen die de kaart oproept zonder ze te beantwoorden. De eerste is wat het WildJailBreak-gat in de praktijk betekent: een tekort aan weigeringsrobuustheid van die omvang is een eigenschap van de fine-tune, en of dit het basismodel, de doelstelling van decision-tuning of het kleine parameteraantal weerspiegelt, vertelt de repository je niet. De tweede is wat er gebeurt bij het invoerplafond. Verzoeken van meer dan 8.192 tokens worden afgewezen in plaats van afgekapt, wat het juiste gedrag is voor een scoringsmodel, maar het betekent dat het praktische contextvenster niet de 262.144 is die de config adverteert — het is wat past in 8.192 tokens aan status, schema, opties en beeldpatches. Bij lange documenten met rijke schema's komt dat plafond eerder dan het architectuurdiagram suggereert.

Waar dit staat, en hoe je het kunt proberen zonder erop te wedden

De eerlijke voorstelling van zaken is dat Intern-Decision-0.8B een vrijgegeven checkpoint is met niet-gecontroleerde claims en geen ondersteunende documentatie. Die combinatie is geen reden om het te negeren — een Apache-2.0-release van gewichten die je in een middag kunt downloaden en meten is een betere situatie dan een API met wachtlijst — maar het betekent wel dat de last van validatie bij jou ligt. De engine laadt vanuit een lokale map, draait op een GPU uit de 4090-klasse of kleiner, en de kaart biedt een uitgewerkt verzoek dat je kunt plakken. Een dag evalueren tegen je eigen gelabelde cases zal je meer vertellen over de WildJailBreak-kolom dan de leverancierstabel kan.

Als de beslissingslaag het deel is dat u evalueert, is een gehoste versie het nuttige vergelijkingspunt. TypeSafe's Jev 1.13 is het model waartegen InternLM heeft gebenchmarkt, en het is vandaag aanroepbaar via één OpenAI-compatibel endpoint voor $0,042 per miljoen inputtokens, met output die tegen nul wordt gefactureerd — dezelfde prijs die de leverancier publiceert, omdat OrcaRouter de listprijs van de provider zonder opslag doorgeeft in plaats van er een marge bovenop te rekenen. Het op dezelfde sleutel zetten van een zelfgehoste beslissingshead van 0,8B en een gehoste beslissings-API, op dezelfde middag, is een aanzienlijk goedkoper experiment dan twee afzonderlijke contracten op te zetten om dezelfde vraag te beantwoorden.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Wat dit beeld zou veranderen is geen benchmark. Het is de GitHub-repository die verschijnt, of InternLM die het tuningrecept publiceert, of een eerste onafhankelijke run van het checkpoint die op een leaderboard belandt. Tot een van die dingen gebeurt, is de nauwkeurige beschrijving van Intern-Decision-0.8B beperkt en onflatteus en volledig in zijn voordeel: de gewichten zijn echt, het inferentiecontract is beter gedocumenteerd dan de meeste gelanceerde modellen voor elkaar krijgen, en de marketing is nog niet begonnen.