
Intern-Decision-2B släpptes i tysthet på Hugging Face. GitHub-länken på dess kort har precis slutat ge 404.
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 584 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Tidigare idag pekade modellkortet för internlm/Intern-Decision-2B på tre ställen för mer information, och två av dem var döda: demo-Spacen svarade HTTP 401, och github.com/internlm/Intern-Decision gav 404 till alla som klickade på den. Från och med 08:58 UTC finns repot bakom den andra länken – offentligt, tre commits djupt, med träningskod, två inferensbackends, ett utvärderingspaket med 10 751 testrader, ett kalibreringsbenchmark med 96 fall och reproduceringsguiden. Det är det enda som har förändrats med den här modellen sedan den dök upp på Hugging Face kl. 05:36 UTC den 26 september 2026, och det räcker för att flytta Intern-Decision-2B från "en checkpoint med en oåtkomlig README" till "en checkpoint som du faktiskt kan granska, reproducera mot och argumentera med."
Själva vikterna är oförändrade och entydiga. Intern-Decision-2B är en multimodal strukturerad beslutsmodell med 2 213 241 664 parametrar, finjusterad från Qwen/Qwen3.5-2B – Alibabas basmodell från den 28 februari 2026 – släppt under Apache-2.0 med den uppströms Qwen-licensen bevarad bredvid den som LICENSE-QWEN. Den är den mellersta av tre storlekar som InternLM släppte på fyrtio sekunder: Intern-Decision-0.8B kl. 05:35:57, denna kl. 05:36:19 och Intern-Decision-4B kl. 05:36:37. Det finns fortfarande inget tillkännagivande av något slag bakom någon av dem.
Det som gör mellanstorleken värd en egen text är att det är där familjen slutar bete sig förutsägbart. Enligt InternLM:s egna siffror är den snabbast av de tre och sämst kalibrerad av de tre, och båda fakta är värda att förstå innan du laddar ner fyra och ett halvt gigabyte av vad som helst.
Vad är bekräftat, och vad är bara säljarens snack
Två kategorier, och de måste hållas åtskilda.
Bekräftat, eftersom det är en filförteckning eller ett HTTP-svar: parameterantalet (2 592 F32 plus 2 213 239 072 BF16-vikter); shard-kartan (en språkshard på 3,76 GB, ett visionstorn på 612,5 MB, en projektor på 50,3 MB, cirka 4,43 GB tensorer och ungefär 4,46 GB repo); licensparet; basmodellen; arkitekturen under (en Qwen3_5ForConditionalGeneration med 24 lager, dold storlek 2 048, 8 query-huvuden mot 2 key-value-huvuden, huvuddimension 256, ett återkommande mönster av tre linjära attention-lager till ett full-attention-lager, ett bevarat multi-token-prediction-lager och ett embedding-tak på 262 144 positioner); att repot existerar; och att modellsamlingen på huggingface.co/collections/internlm/intern-decision nu kan slås upp och listar alla tre checkpoints.
Rapporterat av leverantören och inte reproducerat: varje noggrannhetssiffra, varje latenssiffra och kalibreringstemperaturen. Det finns ingen artikel, ingen arXiv-post, inget lanseringsinlägg, ingen changelog och ingen oberoende utvärdering – en sökning på strängen "Intern-Decision" ger inget som handlar om den här modellen. Demo-Spacen svarar fortfarande 401, vilket betyder att den inte är offentlig, inte att den är trasig. 2B-checkpointen har en gillamarkering och noll nedladdningar. Ingen utanför InternLM har kört den.

Inferenskontraktet, i den ordning det sker
Den mest informativa filen i repot är inte kortet. Det är src/inference/engine.py och den medföljande inference.py på Hubben, eftersom de tillsammans dokumenterar ett kontrakt snarare än en prompt.
• Du anger tillstånd – materialet som bedöms – ett frågeschema, och valfritt upp till åtta bilder. Ett till sexton frågor, upp till 62 alternativ vardera.
• Alternativen för varje fråga mappas till symboler med en enda token: A–Z, sedan a–z, sedan 0–9. Taket på 62 alternativ är inte en designpreferens, det är exakt antalet symboler med en enda token som kontraktet kan adressera.
• Systemprompten, tillståndet, schemat och ett komplett JSON-skelett för assistenten renderas med en <decision>-platshållare per fält. Checkpointens chattmall och det tomma tankeblocket bevaras som de är.
• En kausal framåtpassning körs. Logits läses vid positionen omedelbart före varje platshållare — inte efter, inte vid en genererad token.
• En softmax beräknas endast över det fältets giltiga kandidatsymboler, checkpointens kalibrering tillämpas, och symbolerna mappas tillbaka till dina ursprungliga alternativvärden.
Kortet är tydligt med vad detta är: "Detta API utför strukturerad kandidatpoängsättning. Det anropar inte generate() eller sampla fritext." En DecisionEngine(max_length=8192) vägrar för stor indata i stället för att trunkera den, så en förfrågan som inte får plats misslyckas högljutt i stället för att tyst tappa sitt sista stycke. Backendlistan är också ärlig — backend="hf" är standard och den enda implementerade i Hugging Face-arkivet, vilket är värt att veta eftersom GitHub-utgåvan även levererar en XTuner-backend och de två är inte numeriskt identiska. InternLMs egen utvärderingsguide säger det: "Kernel- och BF16-skillnader kan ändra sannolikheter och ibland etiketter."
Anomalin i mitten
Ställ de tre checkpoints sida vid sida i InternLMs egen tabell, och formen är tillräckligt udda för att vara själva poängen.
Medelvärde över sju sviter – Intern-Decision-0.8B 79,38, Intern-Decision-2B 84,68, Intern-Decision-4B 90,02. I ordning, som man kan förvänta sig när vikterna växer.
• Latens på en RTX 4090 — 33,98 ms i medelvärde för 0,8B, 33,28 ms för 2B, 44,16 ms för 4B. Den mellersta storleken är snabbast av de tre, med en marginal som är tillräckligt liten för att vara brus på en enda GPU men konsekvent över medelvärde, median (33,15 ms) och P95 (33,55 ms).
• Brier score, lägre är bättre — 0,530, 0,437, 0,347. Monotont med storleken, precis som en korrekt poängregel vanligtvis är.
• Förväntat kalibreringsfel, lägre är bättre – 0,066 för 0,8B, 0,100 för denna 2B, 0,065 för 4B. Den mellersta storleken är sämre än modellen som är hälften så stor.
Den sista raden är den intressanta, och de anpassade temperaturerna styrker snarare än förklarar den. Varje checkpoint bär sin egen NLL-anpassade temperatur: 2,747760550703 för 0,8B, 2,100509348278 för 2B, 1,992418 för 4B. Var och en anpassades på 1 728 utsedda kalibreringsfall med 1 693 hållna utanför, genom att minimera negativ log-likelihood över en sökning i invers temperatur i [0,01; 100], med testssvitens etiketter medvetet utelämnade från anpassningen. 2B:s temperatur ligger mellan dess två syskons, vilket är vad man skulle förvänta sig om anomalin vore en anpassningsartefakt. Så är det inte: det anpassade värdet är monotont med storleken medan felet efter kalibrering inte är det. Enligt InternLM:s egen mätning är checkpointen med 2,2 miljarder parametrar den minst pålitliga av de tre när den talar om hur säker den är.
Två varningar innan det blir en slutsats. ECE med tio lika breda intervall och konfidens baserad på maximal sannolikhet är en brusig statistik på den lilla svit som den här tabellen använder – Jevbench-Hard, 111 uppgifter, så hela ECE-kolumnen vilar på ett hundratal frågor och ett val av intervallindelning.internlm/Intern-Decision-2B är det enda av de tre korten som inte har det extra kalibreringsavsnitt som 4B-kortet har, så det finns mindre dokumentation här, inte mer. Läs 0,100 som en anledning att anpassa din egen temperatur snarare än som en dom över vikterna.

Vad arkivet tillför och vad det fortfarande undanhåller
GitHub-utgåvan är mer komplett än modellkortet, som i sig är informativt — ett labb som hade för avsikt att ta fram en artikelartefakt brukar inte släppa en deterministisk kalibreringsgenerator och ett hashverifierande utvärderingspaket tillsammans med träningsstartaren.
Vad som nu är offentligt: träningskoden och målfunktionen för maskerad nästa token (facitsvarsymboler förekommer endast i etiketter, aldrig i indata; varje fälts svar förutsägs av logiten omedelbart före dess markör, och alla fält delar en gemensam framåtpassning); de sju noggrannhetssviterna med SHA-256-verifierade hashar och radantal; poängsättningskoden; temperaturanpassnings- och uppspelningsskripten, där uppspelning påstås ändra noll beslut; benchmarken för distributionskalibrering av 96 fall med sin generator och offline-poängsättare; och en webbläsardemo som serveras på loopback med POST /v1/decisions (alias för /v1/jev).
Vad utesluts uttryckligen, med repositoriets egna ord: ”Träningsdata, privata kalibrerings-/valideringsposter, bilder, förberedelsepipelines och modellvikter ingår inte.” Repositoriet innehåller ingen licensfil alls, så kodens villkor anges inte trots att vikterna är Apache-2.0. Och sammansättningen av kalibreringsdelningen – vilka 1 728 fall, varifrån – är fortfarande inte redovisad, vilket är den enda luckan som begränsar i vilken utsträckning ECE-talen kan kontrolleras.
Storlekarna vi faktiskt routar, och den vi inte gör
Intern-Decision-2B finns inte på OrcaRouter. Vår modellsida för den returnerar en 404, det finns ingen hostad slutpunkt någonstans för den som vi kunde hitta, och inget här bör läsas som ett påstående om tillgänglighet. Det enda sättet att anropa den i dag är att ladda ner checkpointen och köra inference.py bredvid vikterna.
Det spelar roll för det beslut som den här artikeln egentligen handlar om, eftersom en scorer som ingen serverar är en scorer du måste driva. Om det slutna beslut du försöker fatta till formen liknar det den här familjen gör – ett tillstånd, typade frågor, kalibrerade sannolikheter – är den hostade jämförelsen TypeSafe's Jev 1.13, som är modellen som InternLM avsiktligt benchmarkade mot och som finns på OrcaRouter för 0,042 USD per miljon indatatoken med en kontext på 65K och en P50-tid till första token på 178 ms.

Att köra en checkpoint med 2,2 miljarder parametrar lokalt och att anropa en hostad klassificerare är inte samma köp, men de är samma problem, och att ha båda på en och samma nyckel med leverantörens listpris vidarebefordrat med 0 % påslag är anledningen till att hålla jämförelsen öppen i stället för att satsa arkitekturen på en av dem.
Vad skulle förändra den här bilden?
Tre saker, i ordning.
Någon utanför InternLM behöver reproducera medelvärdet 84,68 och ECE-värdet 0,100, och repot är nu det som gör det möjligt – vilket är den egentliga nyheten här. Provet är offentligt och hash-verifierat; det enda som saknas är facit, och facit är den checkpoint som vem som helst nu kan ladda ner.
Leverantören behöver säga vad detta är till för. En modell med en fungerande träningsstack, ett publicerat utvärderingspaket och inget tillkännagivande, ingen licens på sin kod och ingen hostad slutpunkt framstår som en forskningsrelease som ännu inte har beslutats till en produkt. Apache-2.0-vikterna talar för det ena; den saknade kodlicensen och 401 Space talar för det andra.
Och den mellanstora storleken behöver en anledning att finnas. Om 2B:s hastighetsfördel gentemot 0.8B är verklig men marginell, och dess kalibrering är den svagaste av de tre vid varje mått som InternLM publicerat, så är den ärliga rekommendationen till de flesta läsare att betala 2,6× i diskutrymme för 4B eller acceptera den mindre modellens svagare noggrannhet. Argumentet för 2B är att den råkar vara den snabbaste av de snabba – och det är ett tunnare argument än familjens marknadsföringsformade inramning antyder.
