Ett genererat titelkort som lyder 'Intern-Decision-2B vs MiniCPM5-2B', med undertexten 'Två 2B-budgetar, tjugo dagar isär', med märkena 'en beslutsbedömare' och 'en tät generalist', med OrcaRouter-logotypen inkomponerad i hörnet.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: Två 2B-checkpoints, tjugo dagar isär, motsatta sätt att använda parametrarna

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

internlm/Intern-Decision-2B och openbmb/MiniCPM5-2B är samma storlek, släpptes tjugo dagar isär, licensierade på samma sätt och byggda för inget som liknar samma jobb. InternLMs checkpoint är 2 213 241 664 parametrar av beslutsbedömare: den tar ett tillstånd och typade frågor, kör en framåtpassning och returnerar kalibrerade sannolikheter utan att generera en token, och avvisar alla indata över 8 192 tokens. OpenBMB:s är 2 516 756 480 parametrar av tät generalist: en 42-lagers Llama härledd från MiniCPM5-receptet, tar 131 072 tokens kontext, skriver kod, anropar verktyg och utför matematik, med ett Artificial Analysis Intelligence Index på 12,5 och 726 518 nedladdningar förra månaden. De kostar lika mycket att ladda ner och de köper helt olika saker.

Det intressanta med den här parkopplingen är inte benchmark-klyftan – det finns knappt någon överlappande benchmark att jämföra. Det är vad en budget på 2,2 miljarder respektive 2,5 miljarder parametrar kan läggas på, och vad valet säger om vilken av dem som är färdig. MiniCPM5-2B är den andra modellen i sin serie, efter MiniCPM5-1B från maj, och den kom med en fullständig releaseapparat. Intern-Decision-2B är den mellersta av tre storlekar som InternLM lade upp på Hugging Face kl. 05:36 UTC den 26 september 2026 utan tillkännagivande, och dess releaseapparat – en träningskodbas, ett hashverifierat utvärderingspaket, en kalibreringsbenchmark med 96 fall – blev offentlig först i morse kl. 08:58 UTC.

Vart de två budgetarna tog vägen

Båda modellerna är finjusteringar av någon annans arkitektur, och båda har ungefär 2,5 miljarder parametrar. Det är där likheten slutar.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B är en tät Transformer med 42 lager, dold storlek 2 048, 16 attention-huvuden, en mellanstorlek på 6 144, ett ordförråd på 130 560 token och en kontext på 131 072 token, tränad på en blandning av öppna korpusar som OpenBMB publicerade tillsammans med den: UltraX för webbförträning, UltraData-Code med L0–L3-nivåindelad kodhantering, UltraData-Math och 500 000 agent-SFT-exempel med över 80 000 RL-exempel i UltraData-RL-2609. Dess efterträning kör SFT, därefter specialiserade RL-lärare inom matematik, kod och agentiska uppgifter, och sedan on-policy-distillation tillbaka till en enda modell. Det är en generell modell vars hela parameterbudget exponeras som förmåga du kan prompta.

Intern-Decision-2B är en Qwen3_5ForConditionalGeneration med 24 lager — ett upprepande mönster av tre linjära attention-lager mot ett fullt attention-lager — dold storlek 2 048, 8 query-huvuden mot 2 key-value-huvuden, huvuddimension 256, ett bibehållet multi-token-prediction-lager och ett embedding-tak på 262 144 positioner. Den levereras med ett 612,5 MB vision-torn och en 50,3 MB projektor. Nästan inget av den budgeten är tillgängligt för dig som prompt: modellen svarar på ett fast schema av frågor, och dess arkitektur är leveransmekanismen för en softmax, inte en textgenerator.

En detalj i InternLMs nyligen publicerade repo förtjänar att lyftas fram, eftersom den sätter den multimodala taggen på modellkortet i ett nytt ljus. Decision tuning ”finjusterar språkryggraden i Qwen3.5 medan visionstornet och projektorn fryses”. Både 2B- och 4B-decision-checkpointarna innehåller en vision-shard på exakt 612 517 440 byte — samma storlek i båda — vilket stämmer med att dessa komponenter ärvts från Qwen-basen snarare än tränats. Bildvägen är verklig och den går att använda, men det är inte vad InternLMs decision tuning lade sin kraft på. Om din arbetsbelastning enbart består av textbaserad beslutsbedömning är ungefär 660 MB av den 4,46 GB stora nedladdningen till ingen nytta för dig.

Resultattavla

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• Parametrar – Intern-Decision-2B 2 213 241 664 i BF16 plus cirka 660 MB för visionstorn och projektor, ungefär 4,46 GB repository; MiniCPM5-2B 2 516 756 480 i BF16, en safetensors-fil på 5,03 GB.

• Kontext — 8 192 tokens för Intern-Decision-2B, avvisas utan trunkering därutöver; 131 072 tokens för MiniCPM5-2B.

• Utdata — en kalibrerad fördelning plus en argmax per fält, ingen text alls; genererad text, token för token.

• Träning — beslutsjustering av en Qwen3.5-2B-stomme med visionen fryst, träningsdata ej offentliggjord; en fullständig förträning, en mellanträning och ett SFT-pass för djuptänkande på 400 miljarder token, följt av RL och on-policy-distillation, med korpusarna publicerade samtidigt.

• Publicerade bevis — en leverantörstabell över sju sviter som i genomsnitt har 84,68 med Brier 0,437 och ECE 0,100, inte reproducerad av någon tredje part, en gilla-markering och noll nedladdningar; ett OpenBMB-kort som i genomsnitt har 53,9 inom sin egen jämförelseuppsättning och ett oberoende Artificial Analysis Intelligence Index på 12,5, med 726 518 nedladdningar den senaste månaden.

• Licens — Apache-2.0 med Qwens uppströmsvillkor bevarade som LICENSE-QWEN, och ingen licens anges alls i kodförrådet; Apache-2.0 genomgående, inklusive koden.

Vad var och en faktiskt är bättre på, och det är inte ens nära.

Jämförelsen är asymmetrisk i sådan grad att den utgör ett kategorimisstag, så det är mer användbart att namnge jobben.

MiniCPM5-2B vinner allt som innebär att producera ett svar snarare än att välja ett. Den skriver kod; Intern-Decision-2B har ingen kodväg. Den hanterar en kontext på 131 072 token; Intern-Decision-2B stannar vid 8 192 och misslyckas högljutt. Den anropar verktyg, med en BFCL v4-poäng på 66,6 i OpenBMB:s egen tabell, och den gör matematik, med MATH-500 på 94,6 och GPQA-Diamond på 70,2 — siffror från leverantörens kort, där GPQA-raden har en fotnot som kortet självt tillhandahåller. Den uppnår 70,8 på MMLU-Pro och 84,7 på MMLU-Redux. Den körs i llama.cpp och MLX, levereras i GGUF-, GPTQ- och DSpark-varianter och har ett demo-Space på Hub som är offentligt, till skillnad från den 401 som Intern-Decisions kort pekar på.

Intern-Decision-2B vinner exakt två saker, och de är anledningen till att den finns. För det första: ett beslut i sluten mängd med ett schema som du skriver returnerar en sannolikhet som du kan sätta ett tröskelvärde för, i en enda framåtpassning, på cirka 33 millisekunder, utan parser och utan sampling — en form som MiniCPM5-2B inte kan producera annat än genom att generera text och hoppas att talet inuti den är välartat. För det andra är den en reproducerbar artefakt: förvaret innehåller nu träningsmålet, de sju noggrannhetssviterna med SHA-256-hashar och radantal per svit, poängsättningskoden, skripten för temperaturanpassning och replay samt ett riktmärke för distributionskalibrering med 96 fall, med egen generator och offline-poängsättare. InternLMs utvärderingsguide noterar att de släppta förinställningarna är bundna till XTuner-backenden och att HF-resultat bör rapporteras som en annan exekveringsinställning — vilket är precis den sorts förbehåll som ett reproduktionskit finns till för att göra kontrollerbart.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

Vem bör ladda ner vilken

Om du har en uppgift som innebär att läsa något långt, skriva något eller svara på en fråga vars alternativ du inte räknade upp i förväg, är MiniCPM5-2B modellen och det finns inget beslut att fatta. Det är en färdig generalist i 2B-klassen med ett riktigt ekosystem, öppen data bakom sig och en oberoende utvärderingslista, och det kostar inget att prova — GGUF- och MLX-byggen finns redan på Hub.

Om du har en uppgift som verkligen är ett val bland kända svar — att routa ett ärende, klassificera ett supportmejl, märka en kandidat, poängsätta en avsikt på en ordinalskala — då är en generativ modell fel instrument, och Intern-Decision-2B är den mer intressanta av de två även om nästan ingen har kört den. En sannolikhet som du kan tröskla är billigare att driva, lättare att granska och omöjlig att hallucinera, och det faktum att checkpointen kom med ett reproduktionskit snarare än ett leaderboard-inlägg gör den till den bättre dokumenterade av de två på den axel som spelar roll när du måste försvara valet.

Ingen av modellerna finns på OrcaRouter. Vår modellsida för Intern-Decision-2B returnerar 404 och det finns ingen MiniCPM5-2B-väg; inget här är ett påstående om tillgänglighet, och båda innebär att du kör din egen inferens. Det är i de hostade beslutsmodellerna som det praktiska alternativet finns: TypeSafe:s Jev 1.13, modellen som InternLM benchmarkade hela sin familj mot, finns i katalogen för 0,042 USD per miljon indata-tokens med en kontext på 65K och en P50-tid till första token på 178 ms. Och om det du faktiskt behöver är en generalist i samma storleksklass som MiniCPM5-2B utan det operativa arbetet, är vår minsta hostade Qwen-väg flera gånger större men är en nyckel bland fler än 200 modeller, till leverantörens listpris som förs vidare utan påslag och automatisk failover bakom den.

Det enda numret som avgör det

Det är inte 84,68 mot 53,9. De två medelvärdena kommer från olika testsviter, mätta av olika labb, och i ett fall av ett labb som aldrig har fått sina siffror kontrollerade. Siffran som avgör det är 8 192. Om ditt tillstånd ryms inom åtta tusen tokens och ditt svar redan är en lista, är Intern-Decision-2B ett precist instrument med ett reproduceringskit och en kalibreringsanomali som du bör känna till – dess förväntade kalibreringsfel på 0,100 är det sämsta av de tre storlekarna som InternLM publicerade, mot 0,066 för modellen som är hälften så stor, så anpassa din egen temperatur innan du litar på ett konfidensvärde. Om ditt tillstånd inte ryms är frågan avgjord innan benchmarkarna börjar, och MiniCPM5-2B är svaret.