Een gegenereerde titelkaart met de tekst 'Intern-Decision-2B vs MiniCPM5-2B', met ondertitel 'Twee 2B-budgetten, twintig dagen uit elkaar', met de badges 'een beslissingsscorer' en 'een dense generalist', met het OrcaRouter-logo in de hoek gecompositeerd.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: Twee 2B-checkpoints, twintig dagen na elkaar, tegenovergestelde manieren om de parameters te besteden

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

internlm/Intern-Decision-2B en openbmb/MiniCPM5-2B zijn even groot, zijn twintig dagen na elkaar uitgebracht, hebben dezelfde licentie en zijn voor totaal verschillende taken gebouwd. De checkpoint van InternLM bestaat uit 2.213.241.664 parameters van een beslissingsscorer: hij neemt een toestand en getypte vragen, voert één forward pass uit en retourneert gekalibreerde waarschijnlijkheden zonder één token te genereren, en weigert elke invoer van meer dan 8.192 tokens. Die van OpenBMB telt 2.516.756.480 parameters van een dense generalist: een Llama met 42 lagen, afgeleid van het MiniCPM5-recept, met een context van 131.072 tokens, die code schrijft, tools aanroept en wiskunde doet, met een Artificial Analysis Intelligence Index van 12,5 en 726.518 downloads vorige maand. Ze kosten evenveel om te downloaden, maar je krijgt er totaal verschillende dingen voor.

Het interessante deel van deze koppeling is niet het benchmarkverschil — er is nauwelijks een overlappende benchmark om te vergelijken. Het is waaraan een budget van 2,2 miljard en een van 2,5 miljard parameters elk kan worden besteed, en wat de keuze je vertelt over welke van de twee af is. MiniCPM5-2B is het tweede model in zijn serie, volgend op MiniCPM5-1B van mei, en het kwam met een volledige release-infrastructuur. Intern-Decision-2B is de middelste van drie formaten die InternLM op 26 september 2026 om 05:36 UTC naar Hugging Face pushte zonder aankondiging, en de release-infrastructuur ervan — een trainingscodebase, een hash-geverifieerde evaluatiebundel, een kalibratiebenchmark met 96 cases — werd pas vanmorgen om 08:58 UTC openbaar.

Waar de twee budgetten naartoe zijn gegaan

Beide modellen zijn fine-tunes van andermans architectuur, en beide hebben ongeveer 2,5 miljard parameters. Daar houdt de gelijkenis op.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B is een dense Transformer met 42 lagen, verborgen grootte 2.048, 16 attention-heads, een tussenliggende grootte van 6.144, een vocabulaire van 130.560 tokens en een context van 131.072 tokens, getraind op een mengeling van open corpora die OpenBMB samen ermee publiceerde: UltraX voor webpretraining, UltraData-Code met L0–L3 gelaagd codebeheer, UltraData-Math, en 500.000 agent-SFT-voorbeelden met meer dan 80.000 RL-voorbeelden in UltraData-RL-2609. De post-training doorloopt SFT, dan gespecialiseerde RL-leraren in wiskunde, code en agentische taken, en dan on-policy distillatie terug naar één model. Het is een general-purpose model waarvan het volledige parameterbudget wordt blootgesteld als capaciteit die je kunt prompten.

Intern-Decision-2B is een Qwen3_5ForConditionalGeneration met 24 lagen — een zich herhalend patroon van drie linear-attentielagen op één full-attentielaag — verborgen grootte 2.048, 8 query-heads tegenover 2 key-value-heads, head-dimensie 256, een behouden multi-tokenvoorspellingslaag en een embeddingplafond van 262.144 posities. Het wordt geleverd met een vision tower van 612,5 MB en een projector van 50,3 MB. Bijna niets van dat budget is voor jou beschikbaar als prompt: het model beantwoordt een vast schema van vragen, en zijn architectuur is het afleveringsmechanisme voor een softmax, niet een tekstgenerator.

Eén detail uit de nieuw gepubliceerde repository van InternLM is het waard om uit te lichten, omdat het de multimodale tag op de modelkaart in een ander licht zet. De decision tuning "fine-tunet de taalbackbone van Qwen3.5 en bevriest de vision tower en projector." Zowel de 2B- als de 4B-decision-checkpoints bevatten een vision-shard van precies 612.517.440 bytes — in beide gevallen dezelfde grootte — wat consistent is met het feit dat die componenten zijn overgenomen van de Qwen-basis in plaats van getraind. Het beeldpad is echt en bruikbaar, maar het is niet waar de decision tuning van InternLM op heeft ingezet. Als je workload text-only decision scoring is, heb je niets aan ongeveer 660 MB van die download van 4,46 GB.

Scorebord

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• Parameters — Intern-Decision-2B 2.213.241.664 in BF16 plus circa 660 MB aan vision tower en projector, ongeveer 4,46 GB aan repository; MiniCPM5-2B 2.516.756.480 in BF16, één safetensors-bestand van 5,03 GB.

• Context — 8.192 tokens voor Intern-Decision-2B, daarboven afgewezen zonder truncatie; 131.072 tokens voor MiniCPM5-2B.

• Uitvoer — een gekalibreerde distributie plus een argmax per veld, helemaal geen tekst; gegenereerde tekst, token voor token.

• Training — decision tuning van een Qwen3.5-2B-backbone met de vision tower bevroren, trainingsdata niet bekendgemaakt; een volledige pre-train-, mid-train- en deep-thinking-SFT-pass van 400 miljard tokens, gevolgd door RL en on-policy distillatie, waarbij de corpora samen worden gepubliceerd.

• Gepubliceerd bewijs — een leverancierstabel met zeven suites, gemiddeld 84,68 met Brier 0,437 en ECE 0,100, door geen enkele derde partij gereproduceerd, één like en nul downloads; een OpenBMB-kaart met een gemiddelde van 53,9 binnen zijn eigen vergelijkingsset en een onafhankelijke Artificial Analysis Intelligence Index van 12,5, met 726.518 downloads in de afgelopen maand.

• Licentie — Apache-2.0, waarbij de upstream Qwen-voorwaarden behouden blijven als LICENSE-QWEN, en op de code repository wordt helemaal geen licentie vermeld; Apache-2.0 in alles, inclusief de code.

Waarin elk van hen eigenlijk beter is, en het is niet eens close

De vergelijking is zo asymmetrisch dat het een categoriefout is, dus is het nuttiger om de functies te benoemen.

MiniCPM5-2B wint alles waarbij het gaat om het produceren van een antwoord in plaats van het selecteren ervan. Het schrijft code; Intern-Decision-2B heeft geen codepad. Het verwerkt een context van 131.072 tokens; Intern-Decision-2B stopt bij 8.192 en faalt luidruchtig. Het roept tools aan, met een BFCL v4-score van 66,6 in OpenBMB's eigen tabel, en het doet aan wiskunde, met MATH-500 op 94,6 en GPQA-Diamond op 70,2 — cijfers van de kaart van de leverancier, waarbij de GPQA-rij een voetnoot bevat die de kaart zelf levert. Het haalt 70,8 op MMLU-Pro en 84,7 op MMLU-Redux. Het draait in llama.cpp en MLX, wordt geleverd in GGUF-, GPTQ- en DSpark-varianten, en heeft een demo-Space op de Hub die openbaar is, anders dan de 401 waarnaar de kaart van Intern-Decision verwijst.

Intern-Decision-2B wint precies op twee punten, en die zijn de reden dat het bestaat. Ten eerste levert een closed-set-beslissing met een schema dat je zelf schrijft een waarschijnlijkheid op waarvoor je een drempel kunt instellen, in één enkele forward pass, in ongeveer 33 milliseconden, zonder parser en zonder sampling — een vorm die MiniCPM5-2B niet kan produceren, behalve door tekst te genereren en te hopen dat het getal dat erin staat zich netjes gedraagt. Ten tweede is het een reproduceerbaar artefact: de repository bevat nu de trainingsdoelstelling, de zeven accuracy-suites met SHA-256-hashes en rijenaantallen per suite, de scoringscode, de scripts voor temperatuurfit en replay, en een distributiekalibratiebenchmark met 96 gevallen, met een eigen generator en offline scorer. De evaluatiegids van InternLM merkt op dat de vrijgegeven presets gebonden zijn aan de XTuner-backend en dat HF-resultaten gerapporteerd moeten worden als een andere uitvoeringsinstelling — en dat is precies het soort voorbehoud waarvoor een reproductiekit bestaat: om het controleerbaar te maken.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

Wie moet wat downloaden

Als je een taak hebt waarbij je iets lang moet lezen, iets moet schrijven, of een vraag moet beantwoorden waarvan je de opties niet vooraf hebt opgesomd, dan is MiniCPM5-2B het model en valt er niets te beslissen. Het is een afgewerkte generalist in de 2B-klasse met een echt ecosysteem, open data erachter en een onafhankelijke evaluatielijst, en het kost niets om het te proberen — GGUF- en MLX-builds staan al op de Hub.

Als je een taak hebt die echt een keuze is tussen bekende antwoorden — een ticket routeren, een support-e-mail classificeren, een kandidaat labelen, een intentie scoren op een ordinale schaal — dan is een generatiemodel het verkeerde instrument, en Intern-Decision-2B is de interessantere van de twee, ook al heeft bijna niemand die uitgevoerd. Een waarschijnlijkheid waarop je een drempel kunt toepassen is goedkoper in gebruik, eenvoudiger te auditen en onmogelijk te hallucineren, en het feit dat de checkpoint kwam met een reproduction kit in plaats van een leaderboardpost maakt het de beter gedocumenteerde van de twee op de as die ertoe doet wanneer je de keuze moet verdedigen.

Geen van beide modellen staat op OrcaRouter. Onze modelpagina voor Intern-Decision-2B geeft een 404 en er is geen MiniCPM5-2B-route; niets hier is een claim over beschikbaarheid, en beide betekenen het draaien van je eigen inferentie. Het praktische alternatief is te vinden in de gehoste beslissingsmodellen: TypeSafe's Jev 1.13, het model waartegen InternLM zijn hele familie heeft gebenchmarkt, staat in de catalogus voor $0,042 per miljoen inputtokens met een context van 65K en een P50 time-to-first-token van 178 ms. En als je eigenlijk een generalist nodig hebt in dezelfde grootteklasse als MiniCPM5-2B zonder het operationele werk, dan is onze kleinste gehoste Qwen-route meerdere keren zo groot, maar één sleutel tussen meer dan 200 modellen, tegen lijstprijs van de provider doorgegeven zonder markup en automatische failover erachter.

Het enige getal dat de doorslag geeft

Het is niet 84,68 tegen 53,9. Die twee gemiddelden komen uit verschillende suites, gemeten door verschillende labs, en in één geval door een lab waarvan de cijfers nooit zijn gecontroleerd. Het getal dat de beslissing bepaalt, is 8.192. Als je state binnen achtduizend tokens past en je antwoord al een lijst is, dan is Intern-Decision-2B een precies instrument met een reproductiekit en een kalibratie-anomalie waarvan je op de hoogte moet zijn — de verwachte kalibratiefout van 0,100 is de slechtste van de drie groottes die InternLM heeft gepubliceerd, tegenover 0,066 voor het model dat half zo groot is, dus pas je eigen temperatuur aan voordat je een confidencewaarde vertrouwt. Als je state niet past, is de vraag voorbij voordat de benchmarks beginnen, en is MiniCPM5-2B het antwoord.