Ett genererat titelkort för Intern-Decision-4B, med underrubriken 'en strukturerad beslutsmodell som svarar utan att skriva en token', med tre chips där det står 'inget tillkännagivande', 'tre kontrollpunkter på 40 sekunder' och 'inga oberoende utvärderingar', med en sidfot som lyder 'Siffror enligt modellkortet för InternLM; inget här är oberoende reproducerat.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Intern-Decision-4B: InternLM har släppt en beslutsmodell som svarar utan att skriva en token

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tre modellarkiv dök upp på InternLMs Hugging Face-sida inom fyrtio sekunder den 26 september 2026: Intern-Decision-0.8B kl. 05:35:57 UTC, Intern-Decision-2B kl. 05:36:19, och internlm/Intern-Decision-4B kl. 05:36:37. 4B är den intressanta. Det är en finjustering av Qwen3.5-4B som tar emot ett delat tillstånd, ett schema med namngivna frågor och valfria bilder, och returnerar en kalibrerad svarsfördelning för varje fråga i en enda framåtpassning. Den genererar aldrig text. Dess egna versionsanteckningar säger det rakt ut: "Detta API utför strukturerad kandidatpoängsättning. Det anropar inte generate() eller samplar fritext." Fyrtio sekunder av uppladdningar och inte en enda rad tillkännagivande någonstans — inget blogginlägg, ingen tweet, ingen ändringslogg, ingen lanseringssida. Det som finns är ett modellkort, en inference.py, och fyra safetensors-delar.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

Vad som släpptes, och vad som inte gjorde det

Familjen är det första man måste få rätt på, eftersom 4B:ans kort tyst bär den. Dess benchmarktabell publicerar rader för Intern-Decision-0.8B och Intern-Decision-2B tillsammans med sina egna, och alla tre checkpoints landade på hubben inom samma minut. 2B-repositoriet länkas aldrig från 4B:ans kort — du måste hitta det via organisationens uppladdningsflöde.

Det som inte levererades är nästan allt som en release normalt kommer med:

• Inget tillkännagivande — noll webbtäckning, inget uttalande från leverantören på något språk vi kunde hitta.

• Ingen demo — kortet länkar till en Space på huggingface.co/spaces/internlm/intern-decision; den slutpunkten svarar HTTP 401, vilket betyder att den inte är offentlig, inte att den är trasig.

• Ingen samling — den annonserade modellsamlingen på huggingface.co/collections/internlm/intern-decision returnerar också 401.

• Ingen kodrepository — kortets GitHub-länk, github.com/internlm/Intern-Decision, är en 404, och InternLM-organisationens repositorylista innehåller inget sådant projekt.

• Ingen adoption – i skrivande stund visar 4B en gillamarkering och noll nedladdningar.

Det är hela den vetbara ytan. Behandla varje nummer nedan som leverantörens eget, eftersom ingen annan har kört det här ännu.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

Inferenskontraktet är produkten

Det mesta av kortet spenderas på en femstegsprocedur, vilket visar var ingenjörsarbetet lades. Frågor och alternativ behåller sin ordning. Varje frågas alternativ mappas till symboler med en enda token – A till Z, sedan a till z, sedan 0 till 9. Det är 62 symboler, och det är precis därför kortet begränsar en fråga till 62 alternativ. Prompten renderas från den ursprungliga systemprompten, tillståndet, beslutschemat och ett komplett assistent-JSON-skelett med en <decision> platshållare per fält, och behåller checkpointens chattmall och ett tomt tankeblock. Sedan en kausal framåtpassning. Logits läses vid positionen omedelbart före varje platshållare, en softmax körs endast över det fältets tillåtna kandidatsymbol-logits, kalibrering tillämpas, och symbolerna mappas tillbaka till dina alternativvärden.

Konsekvensen är en fast form: ingen avkodningsloop, ingen sampling, ingen parser, ingen hallucinationsyta, och ett hårt tak på ett beslut per fråga per omgång. Tre frågetyper stöds — val med en ordnad kriteriekarta, poäng med en lista eller numeriskt nycklad karta, och noul, en binär nej/ja.

Specifikationsdetaljen som betyder mest

Kortet säger uttryckligen att indata "avvisas utan trunkering" ovanför DecisionEngine(max_length=8192). Läser man det tillsammans med konfigurationen träder något märkligt fram: det underliggande texttornet deklarerar max_position_embeddings på 262 144. Backbonen kan adressera en kvarts miljon token; den släppta wrappern avvisar allt över 8 192. Detta är inte en långkontextmodell med en konservativ standard — det är en beslutsbedömningsmodell vars egen testrigg begränsar den evidens du får ge den. Om din routingfråga beror på mer än ungefär åtta tusen token av tillstånd, kommer denna checkpoint som den levereras inte att besvara den, och den kommer att vägra snarare än att korta ned din indata.

Upp till åtta bilder är tillåtna, och kortet noterar att bildtokens räknas mot samma gräns på 8 192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

Inuti vikterna

Fyra shards, 4,54 miljarder BF16-parametrar och en konfiguration som förklarar storleksnamnet: det finns ett texttorn, ett visionstorn på ungefär två dussin lager med en patchstorlek på 16 pixlar, och en projektor mellan dem. Textsidan har 32 lager med dold storlek 2 560, med 16 attention-huvuden mot 4 nyckel-/värdehuvuden, en vokabulär på 248 320 token och bundna inbäddningar. Lagertyperna alternerar med ett fast intervall – tre linjära attention-lager, sedan ett fullt attention-lager, upprepat. Endast de fulla attention-lagren bär global attention, och den roterande inbäddningen är partiell med en faktor på 0,25. Att ladda den kräver Python 3.12 eller nyare, PyTorch 2.9.1 och Transformers 5.14.1, och fillistan innehåller fortfarande tokenizer-, merges- och vokabulärfiler i stället för att luta sig mot en tokenizer på hub-sidan.

Siffrorna, och vem som tog fram dem

Allt i det här avsnittet mättes av InternLM och publicerades på modellkortet. Inget av det har reproducerats av en tredje part, och det finns ingen Artificial Analysis-post, inget arenabetyg och ingen rad på någon resultattavla för den här modellen någonstans.

Över sju utvärderingsset har 4B i genomsnitt 90,02, med en Brier-poäng på 0,347 och ett förväntat kalibreringsfel på 0,065. Samma tabell listar Intern-Decision-0.8B på 79,38 och Intern-Decision-2B på 84,68, så familjen kurvar uppåt med storleken — 4,7 poäng från 0,8B till 2B, sedan ytterligare 5,3 till 4B. Tabellen innehåller också fem rader som leverantören inte tränade: Jev på 88,74, JevK5 på 85,16, SemIf på 84,23, Kev på 79,56 och Laya på 57,77. De kördes av InternLM i InternLMs ramverk mot InternLMs checkpoint. De är inte dessa projekts egna siffror, och att tolka dem som det är det enklaste misstaget man kan göra här.

Latensen mäts på ett enda RTX 4090 via den lokala Hugging Face-vägen, och kortet flaggar värdena som beroende av arbetsbelastning och hårdvara. 4B ligger på 44,16 ms i medelvärde, 44,03 ms i median och 44,60 ms vid P95 – en spridning på långt under en millisekund mellan median och svans, vilket är vad en framåtpassning med fast form ser ut som. De två mindre checkpoints ligger båda runt 33 ms, där 2B ligger marginellt före 0,8B i medelvärde och median, vilket är värt att lägga märke till i stället för att släta över: dessa två ligger tillräckligt nära varandra för att vara inom mätbruset.

Kalibrering, och de ärliga förbehållen i den

Checkpointen levereras med en standardtemperatur på 1,99241824, anpassad separat för denna modell genom minimering av negativ log-likelihood på 1 728 utsedda kalibreringsfall, med 1 693 undanhållna för validering. Kortet uppger att testsvitens etiketter inte användes för att välja den. Implementeringen är kandidatsannolikhetskalibrering, inte en samplingstemperatur: den förskjuter konfidensen, den binära sannolikheten och den förväntade poängen medan argmax-beslutet lämnas orört.

En separat 96-fallsdiagnostik rapporterar därefter effekten. I InternLM:s egna före- och efterkolumner går 4B:s övergripande Brier och ECE från 0,628 / 0,213 till 0,550 / 0,089, jämfört med 0,595 / 0,130 för Jev. Två ärliga tolkningar av den tabellen: kalibreringen fungerar uppenbarligen, och "före"-kolumnen är inte vad någon användare någonsin skulle se, eftersom standardinställningen som levereras är den anpassade temperaturen. Värt att också flagga – två av de sex diagnostikkategorierna är sämre för 4B än för Jev, och den sämsta av dem, daglig evidens och observationsbias, förbättras till 0,575 / 0,210 men ligger fortfarande efter Jevs 0,603 / 0,114. I den delmängden minskar kalibreringen gapet utan att stänga det.

Där en router passar, och där den ännu inte passar

Det praktiska hindret för att använda den här modellen är inte noggrannhet, utan paketering. Släppet levererar en Python-klass som du importerar efter att ha laddat ner fyra shards, inte en HTTP-slutpunkt som du kan anropa. Det är precis den luckan som ett routningslager finns för att täppa igen – en nyckel för över 200 modeller, leverantörens listpris vidarebefordrat med 0 % påslag, och automatisk failover när en leverantör krånglar – men vi ska vara tydliga med att OrcaRouter för närvarande inte har Intern-Decision-4B eller någon modell av dess slag. Vår katalog listar den inte, och inget här bör läsas som ett påstående om tillgänglighet. Det vi kan erbjuda är det billigare beslutet: om du vill prova en beslutsbedömare med 4,5 miljarder parametrar framför en produktionsväg kan du bygga in den i en router med fallback till en generell modell, så att en dålig kalibreringsdag kostar dig ett nytt försök i stället för ett avbrott.

Vad skulle förändra bilden

Tre saker, i viktighetsordning. Någon utanför InternLM behöver reproducera medelvärdet 90,02 och det förväntade kalibreringsfelet på 0,065 – kalibreringspåståenden som aldrig har stött på en extern testmängd är de minst överförbara siffrorna inom maskininlärning. Modellkortets eget avtryck behöver synas: Space, samlingen, GitHub-repositoriet. Och leverantören behöver säga om detta är en produkt eller en artefakt från en artikel, eftersom en licens för enbart forskning och en Apache-2.0-licens inte är samma åtagande, och 4B-modellen valde Apache-2.0 med Qwen-licensen bevarad vid sidan om. Fram till dess är den korrekta inramningen den som uppladdningen själv antyder: detta är en riktig checkpoint med ett riktigt inferenskontrakt och ett helt overifierat resultatkort, publicerad utan att någon fick veta.

Just nu är den ärliga sammanfattningen snäv och användbar. Om ditt problem är ”välj en av fem routingetiketter och berätta hur säker du är”, är en 4,5B-modell som avger 62 logits och ingen prosa en försvarbar form att utvärdera. Om ditt problem involverar ett långt dokument, fler än åtta bilder eller något behov av att förklara svaret i ord, är denna checkpoint i befintligt skick fel verktyg, och ingen mängd polering av leverantörens benchmark ändrar på det.