
Intern-Decision-2B vs MiniCPM5-2B: Två 2B-checkpoints, tjugo dagar isär, motsatta sätt att använda parametrarna
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 584 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
internlm/Intern-Decision-2B och openbmb/MiniCPM5-2B är samma storlek, släpptes tjugo dagar isär, licensierade på samma sätt och byggda för inget som liknar samma jobb. InternLMs checkpoint är 2 213 241 664 parametrar av beslutsbedömare: den tar ett tillstånd och typade frågor, kör en framåtpassning och returnerar kalibrerade sannolikheter utan att generera en token, och avvisar alla indata över 8 192 tokens. OpenBMB:s är 2 516 756 480 parametrar av tät generalist: en 42-lagers Llama härledd från MiniCPM5-receptet, tar 131 072 tokens kontext, skriver kod, anropar verktyg och utför matematik, med ett Artificial Analysis Intelligence Index på 12,5 och 726 518 nedladdningar förra månaden. De kostar lika mycket att ladda ner och de köper helt olika saker.
Det intressanta med den här parkopplingen är inte benchmark-klyftan – det finns knappt någon överlappande benchmark att jämföra. Det är vad en budget på 2,2 miljarder respektive 2,5 miljarder parametrar kan läggas på, och vad valet säger om vilken av dem som är färdig. MiniCPM5-2B är den andra modellen i sin serie, efter MiniCPM5-1B från maj, och den kom med en fullständig releaseapparat. Intern-Decision-2B är den mellersta av tre storlekar som InternLM lade upp på Hugging Face kl. 05:36 UTC den 26 september 2026 utan tillkännagivande, och dess releaseapparat – en träningskodbas, ett hashverifierat utvärderingspaket, en kalibreringsbenchmark med 96 fall – blev offentlig först i morse kl. 08:58 UTC.
Vart de två budgetarna tog vägen
Båda modellerna är finjusteringar av någon annans arkitektur, och båda har ungefär 2,5 miljarder parametrar. Det är där likheten slutar.

MiniCPM5-2B är en tät Transformer med 42 lager, dold storlek 2 048, 16 attention-huvuden, en mellanstorlek på 6 144, ett ordförråd på 130 560 token och en kontext på 131 072 token, tränad på en blandning av öppna korpusar som OpenBMB publicerade tillsammans med den: UltraX för webbförträning, UltraData-Code med L0–L3-nivåindelad kodhantering, UltraData-Math och 500 000 agent-SFT-exempel med över 80 000 RL-exempel i UltraData-RL-2609. Dess efterträning kör SFT, därefter specialiserade RL-lärare inom matematik, kod och agentiska uppgifter, och sedan on-policy-distillation tillbaka till en enda modell. Det är en generell modell vars hela parameterbudget exponeras som förmåga du kan prompta.
Intern-Decision-2B är en Qwen3_5ForConditionalGeneration med 24 lager — ett upprepande mönster av tre linjära attention-lager mot ett fullt attention-lager — dold storlek 2 048, 8 query-huvuden mot 2 key-value-huvuden, huvuddimension 256, ett bibehållet multi-token-prediction-lager och ett embedding-tak på 262 144 positioner. Den levereras med ett 612,5 MB vision-torn och en 50,3 MB projektor. Nästan inget av den budgeten är tillgängligt för dig som prompt: modellen svarar på ett fast schema av frågor, och dess arkitektur är leveransmekanismen för en softmax, inte en textgenerator.
En detalj i InternLMs nyligen publicerade repo förtjänar att lyftas fram, eftersom den sätter den multimodala taggen på modellkortet i ett nytt ljus. Decision tuning ”finjusterar språkryggraden i Qwen3.5 medan visionstornet och projektorn fryses”. Både 2B- och 4B-decision-checkpointarna innehåller en vision-shard på exakt 612 517 440 byte — samma storlek i båda — vilket stämmer med att dessa komponenter ärvts från Qwen-basen snarare än tränats. Bildvägen är verklig och den går att använda, men det är inte vad InternLMs decision tuning lade sin kraft på. Om din arbetsbelastning enbart består av textbaserad beslutsbedömning är ungefär 660 MB av den 4,46 GB stora nedladdningen till ingen nytta för dig.
Resultattavla

• Parametrar – Intern-Decision-2B 2 213 241 664 i BF16 plus cirka 660 MB för visionstorn och projektor, ungefär 4,46 GB repository; MiniCPM5-2B 2 516 756 480 i BF16, en safetensors-fil på 5,03 GB.
• Kontext — 8 192 tokens för Intern-Decision-2B, avvisas utan trunkering därutöver; 131 072 tokens för MiniCPM5-2B.
• Utdata — en kalibrerad fördelning plus en argmax per fält, ingen text alls; genererad text, token för token.
• Träning — beslutsjustering av en Qwen3.5-2B-stomme med visionen fryst, träningsdata ej offentliggjord; en fullständig förträning, en mellanträning och ett SFT-pass för djuptänkande på 400 miljarder token, följt av RL och on-policy-distillation, med korpusarna publicerade samtidigt.
• Publicerade bevis — en leverantörstabell över sju sviter som i genomsnitt har 84,68 med Brier 0,437 och ECE 0,100, inte reproducerad av någon tredje part, en gilla-markering och noll nedladdningar; ett OpenBMB-kort som i genomsnitt har 53,9 inom sin egen jämförelseuppsättning och ett oberoende Artificial Analysis Intelligence Index på 12,5, med 726 518 nedladdningar den senaste månaden.
• Licens — Apache-2.0 med Qwens uppströmsvillkor bevarade som LICENSE-QWEN, och ingen licens anges alls i kodförrådet; Apache-2.0 genomgående, inklusive koden.
Vad var och en faktiskt är bättre på, och det är inte ens nära.
Jämförelsen är asymmetrisk i sådan grad att den utgör ett kategorimisstag, så det är mer användbart att namnge jobben.
MiniCPM5-2B vinner allt som innebär att producera ett svar snarare än att välja ett. Den skriver kod; Intern-Decision-2B har ingen kodväg. Den hanterar en kontext på 131 072 token; Intern-Decision-2B stannar vid 8 192 och misslyckas högljutt. Den anropar verktyg, med en BFCL v4-poäng på 66,6 i OpenBMB:s egen tabell, och den gör matematik, med MATH-500 på 94,6 och GPQA-Diamond på 70,2 — siffror från leverantörens kort, där GPQA-raden har en fotnot som kortet självt tillhandahåller. Den uppnår 70,8 på MMLU-Pro och 84,7 på MMLU-Redux. Den körs i llama.cpp och MLX, levereras i GGUF-, GPTQ- och DSpark-varianter och har ett demo-Space på Hub som är offentligt, till skillnad från den 401 som Intern-Decisions kort pekar på.
Intern-Decision-2B vinner exakt två saker, och de är anledningen till att den finns. För det första: ett beslut i sluten mängd med ett schema som du skriver returnerar en sannolikhet som du kan sätta ett tröskelvärde för, i en enda framåtpassning, på cirka 33 millisekunder, utan parser och utan sampling — en form som MiniCPM5-2B inte kan producera annat än genom att generera text och hoppas att talet inuti den är välartat. För det andra är den en reproducerbar artefakt: förvaret innehåller nu träningsmålet, de sju noggrannhetssviterna med SHA-256-hashar och radantal per svit, poängsättningskoden, skripten för temperaturanpassning och replay samt ett riktmärke för distributionskalibrering med 96 fall, med egen generator och offline-poängsättare. InternLMs utvärderingsguide noterar att de släppta förinställningarna är bundna till XTuner-backenden och att HF-resultat bör rapporteras som en annan exekveringsinställning — vilket är precis den sorts förbehåll som ett reproduktionskit finns till för att göra kontrollerbart.

Vem bör ladda ner vilken
Om du har en uppgift som innebär att läsa något långt, skriva något eller svara på en fråga vars alternativ du inte räknade upp i förväg, är MiniCPM5-2B modellen och det finns inget beslut att fatta. Det är en färdig generalist i 2B-klassen med ett riktigt ekosystem, öppen data bakom sig och en oberoende utvärderingslista, och det kostar inget att prova — GGUF- och MLX-byggen finns redan på Hub.
Om du har en uppgift som verkligen är ett val bland kända svar — att routa ett ärende, klassificera ett supportmejl, märka en kandidat, poängsätta en avsikt på en ordinalskala — då är en generativ modell fel instrument, och Intern-Decision-2B är den mer intressanta av de två även om nästan ingen har kört den. En sannolikhet som du kan tröskla är billigare att driva, lättare att granska och omöjlig att hallucinera, och det faktum att checkpointen kom med ett reproduktionskit snarare än ett leaderboard-inlägg gör den till den bättre dokumenterade av de två på den axel som spelar roll när du måste försvara valet.
Ingen av modellerna finns på OrcaRouter. Vår modellsida för Intern-Decision-2B returnerar 404 och det finns ingen MiniCPM5-2B-väg; inget här är ett påstående om tillgänglighet, och båda innebär att du kör din egen inferens. Det är i de hostade beslutsmodellerna som det praktiska alternativet finns: TypeSafe:s Jev 1.13, modellen som InternLM benchmarkade hela sin familj mot, finns i katalogen för 0,042 USD per miljon indata-tokens med en kontext på 65K och en P50-tid till första token på 178 ms. Och om det du faktiskt behöver är en generalist i samma storleksklass som MiniCPM5-2B utan det operativa arbetet, är vår minsta hostade Qwen-väg flera gånger större men är en nyckel bland fler än 200 modeller, till leverantörens listpris som förs vidare utan påslag och automatisk failover bakom den.
Det enda numret som avgör det
Det är inte 84,68 mot 53,9. De två medelvärdena kommer från olika testsviter, mätta av olika labb, och i ett fall av ett labb som aldrig har fått sina siffror kontrollerade. Siffran som avgör det är 8 192. Om ditt tillstånd ryms inom åtta tusen tokens och ditt svar redan är en lista, är Intern-Decision-2B ett precist instrument med ett reproduceringskit och en kalibreringsanomali som du bör känna till – dess förväntade kalibreringsfel på 0,100 är det sämsta av de tre storlekarna som InternLM publicerade, mot 0,066 för modellen som är hälften så stor, så anpassa din egen temperatur innan du litar på ett konfidensvärde. Om ditt tillstånd inte ryms är frågan avgjord innan benchmarkarna börjar, och MiniCPM5-2B är svaret.
