
MiniCPM5-2B vs Granite 4.2 3B: de 3B-redeneerspecialist versus de nieuwe 2.5B-agentstack
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest plaatste Granite 4.2 3B op het eigen scorebord van MiniCPM5-2B voordat iemand erom vroeg. De modelkaart van MiniCPM5-2B die OpenBMB publiceerde toen de gewichten stilletjes live gingen op Hugging Face, vermeldt IBM's kleinste redeneermodel onder de vergelijkingsbaselines. Op die reeks laat MiniCPM5-2B een gemiddelde zien van 53,9 tegenover 42,7 voor Granite 4.2 3B. Dat is het enige directe vergelijkingscijfer dat een van beide leveranciers voor deze combinatie heeft gepubliceerd, waardoor het de aangewezen plek is om te beginnen — en om voorzichtig te zijn. Beide modellen zijn klein, Apache-2.0, zelf-gehoste open-weights-releases, gericht op dezelfde functie eind 2026; ze benaderen die echter vanaf tegenovergestelde kanten: de ene getraind om te redeneren, de andere om te handelen.
De twee releases rijmen meer dan de marketing van hun leveranciers doet vermoeden. MiniCPM5-2B werd onthuld op de World Artificial Intelligence Conference op 19 juli als ModelBest en OpenBMB's on-device-vlaggenschip — een dicht model uit de 2B-klasse, aangeprezen als agentbasis voor telefoons, pc's en slimme cockpits — en de gewichten verschenen op 6 en 7 september zonder lanceerevenement, onder Apache-2.0, naast GGUF-, MLX-, GPTQ-, base-, SFT- en draft-checkpoints en de trainingsdata erachter. Granite 4.2 3B is IBM's redeneermodel op laptopformaat, waarvan de gewichten begin augustus Hugging Face bereikten en waarvan de modelkaart en technische blog op 25 augustus uitkwamen. Geen van beide is tot nu toe door een onafhankelijke benchmark getest, en daarom zijn de bronlabels hieronder belangrijker dan de cijfers.
Twee releases die rijmen
Granite 4.2 3B is een zelfstandig dicht redeneermodel, verder getraind vanuit Granite-4.1-3B-Base. Het heeft 40 lagen met grouped-query attention, een native context van 128K die IBM in een vijfde pre-trainingsfase uitbreidt naar 512K, en drie denkmodi per query — standaard volledig denken, een modus met lage inspanning, en een pad zonder denken. De modelkaart is expliciet over wat het niet is: in tegenstelling tot de 8B- en 30B-tegenhangers van Granite 4.2 heeft de 3B bewust het gespecialiseerde agentische reinforcement-learningblok overgeslagen dat is getraind in SWE-agent-, terminal- en zoekomgevingen. IBM vermeldt daarom geen SWE-bench-resultaat en kadert het model als een redeneerspecialist in plaats van een agent. Het draait via vLLM, SGLang, Transformers, GGUF en Ollama (granite4.2:3b), gebruikt ongeveer 6-8GB in bfloat16 of minder dan 2GB gekwantiseerd, en heeft geen gehoste API. De belangrijkste cijfers — AIME 2025 op 78,33, GPQA op 54,80, LiveCodeBench v6 op 69,71, MMLU-Pro op 67,84 — zijn door IBM gerapporteerd en tot op heden niet onafhankelijk gereproduceerd.

MiniCPM5-2B is in plaats daarvan een afgerond, agentgericht model. De modelkaart beschrijft een dense transformer met in totaal 2,52B parameters (1,98B exclusief embeddings), 42 lagen met een hidden size van 2048, grouped-query attention met 16 query-heads en twee KV-heads, en een standaard LlamaForCausalLM-architectuur zonder aangepaste kernels. Bij de lancering stond het agentische vermogen centraal: agent-midtraining op 200B-schaal, een grote agent-SFT-set en RL-afstemming voor agents, afgerond met On-Policy Distillation die zestien RL-expertmodellen terugbrengt tot één klein dense netwerk — plus native ondersteuning voor lange context en hybride snelle/doordachte responsmodi. De meegeleverde config stelt een contextvenster van 131.072 tokens in (het julimateriaal repte over 512K; de uitgebrachte config bevat dat niet), en de modelkaart claimt XML-achtige toolcalls met een ingebouwde SGLang-parser. In de eigen evaluatietabel rapporteert het model een intern gemiddelde van 53,9 over de door de leverancier geselecteerde vergelijkingsset, een AIME 2025/2026 van 86,5, MATH-500 van 94,6 en een door de leverancier behaalde 46,4 op SWE-bench Verified — een score die opmerkelijk zou zijn voor een dense model van 2,5B, als die onafhankelijke tests doorstaat.

Het head-to-head-overzicht dat iemand al heeft afgedrukt.
Omdat scoreborden van verschillende leveranciers meestal appels-met-peren-vergelijkingen zijn, is het nuttigste onderdeel in deze vergelijking het stuk dat ModelBest zelf heeft afgedrukt: de kaart van MiniCPM5-2B vermeldt granite-4.2-3B als een van de uitgangspunten en rapporteert dat MiniCPM5-2B gemiddeld 53,9 scoort tegen Granite's 42,7 op die suite. Lees het precies zoals het is: één leverancier die beide modellen draait op één door hem gekozen suite, zonder onafhankelijke replicatie, met alle belang om het eigen model te laten winnen. Het is geen oordeel. Wat het je wel vertelt, is dat ModelBest zelfverzekerd genoeg was om een 3B-model van een concurrent op de eigen kaart te zetten, en dat de bewuste kloof het grootst is precies waar het eigen trainingswerk in zit: de agentische en lange-context-rijen. Beschouw het als een richtinggevende bewering, en weeg IBM's eigen afzonderlijke kaartclaims af voordat je er iets op baseert.
Het scorebord, eerlijk gelabeld.
• Release — MiniCPM5-2B: aangekondigd op 19 juli 2026; gewichten live op 6-7 september, rustig. Granite 4.2 3B: gewichten begin augustus; kaart en technische blog op 25 augustus 2026.
• Rol — MiniCPM5-2B: nadruk op on-device-agent en toolgebruik, volgens ModelBest. Granite 4.2 3B: redeneerspecialist, bewust niet-agentisch volgens IBM.
• Grootte — MiniCPM5-2B: 2,52B totaal / 1,98B niet-embedding, 42 lagen. Granite 4.2 3B: ~3B dense, 40 lagen.
• Context — MiniCPM5-2B: 131.072 tokens in de meegeleverde configuratie. Granite 4.2 3B: 128K native, uit te breiden tot 512K.
• Post-training — MiniCPM5-2B: diep denkende SFT, gespecialiseerde RL, on-policy-distillatie. Granite 4.2 3B: redenerende SFT, GRPO-RL en RLHF; geen agentic-RL-blok.
• Bewijs — MiniCPM5-2B: claims op de ModelBest-kaart, geen onafhankelijke run. Granite 4.2 3B: IBM-claims op de kaart, niet gereproduceerd; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

Het scorebord hierboven heeft dezelfde bronvermelding als de tekst: elk cijfer erop is door de leverancier gerapporteerd, en de enige vergelijking binnen dezelfde suite die een van beide leveranciers heeft gepubliceerd, is die op de eigen kaart van ModelBest.
Redeneringsspecialist vs. agent-stack
Voordat je naar de scores kijkt, moet je beslissen welk soort klein model je workload nodig heeft, want deze twee beantwoorden verschillende vragen. Granite 4.2 3B is gebouwd voor redeneren en lange context op beperkte hardware: een native contextvenster van 128K dat oprekt tot 512K, drie denkmodi, een voetafdruk die op een laptop past, en een expliciete beslissing om agentische training over te slaan. Als jouw taak analyse van lange documenten is, context op repository-schaal of betrouwbaar meerstapsredeneren op een kleine machine, dan is dat een coherente keuze, en IBM's beslissing om de agentische claims bij de 3B weg te laten is een reden om de modelkaart te vertrouwen in plaats van er een hiaat in te zien. MiniCPM5-2B is gebouwd voor de tegenovergestelde nadruk: agentisch gedrag en toolgebruik op een apparaat — de trainingspijplijn leest als een lijst van dingen die Granite 4.2 3B bewust heeft weggelaten. Als jouw taak een agentloop op het apparaat is die tools aanroept, lange gesprekken voert en schakelt tussen snelle en weloverwogen antwoorden, dan is dat de stack die op jou is gericht, en die brengt de extra onzekerheid met zich mee van een week oud checkpoint met een ongeverifieerde modelkaart.
De data die OpenBMB openstelde, stelde IBM niet open.
Het minst glamoureuze verschil is het verschil dat het meest telt voor teams die willen fine-tunen. OpenBMB heeft de trainingscorpora van MiniCPM5-2B samen met de gewichten uitgebracht — de UltraData-familie, waaronder Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math en de agent-SFT- en RL-sets — allemaal onder Apache-2.0. Dat verandert de 2B van een black box in een reproduceerbaar recept: je kunt zien waarop de agentische post-training is gebouwd en die op je eigen domein voortzetten. IBM heeft de gewichten van Granite 4.2 3B als open source uitgebracht en een gedetailleerd technisch verslag gegeven van hoe het model is gebouwd, maar niet de trainingsdata. Voor een organisatie die het model wil bezitten in plaats van huren, is die asymmetrie reëel. En MiniCPM5-2B wordt geleverd met een implementatieverhaal dat Granite op deze omvang niet evenaart: aanpassing op dag één over negen chipp families via ModelBest's FlagOS-community, van Huawei Ascend tot NVIDIA tot een reeks binnenlandse accelerators, plus ARM — een signaal dat ModelBest verwacht dat de 2B ergens anders draait dan op een NVIDIA-GPU.
De realiteit van routing
Geen van beide modellen staat momenteel in een gehoste catalogus, dus deze vergelijking speelt zich af in de self-hosted wereld — maar dat is precies waar een routinglaag zijn waarde nog steeds bewijst als vangnet in plaats van als leveringsmechanisme. Wanneer een team een week oude agentische 2B wil testen tegenover een redenerende 3B op een workload die het al bedient, is de omkeerbare zet om een testpad te wijzen naar een self-hosted MiniCPM5-2B-build via één API met automatische failover, terwijl de productie op het bewezen model blijft draaien — de nieuwe stack kan stagneren zonder iets plat te leggen, en de catalogusprijzen van de providers rond de gehoste modellen waarmee je vergelijkt, worden zonder markup (0%) doorberekend, dus de A/B-test blijft goedkoop. De laag host geen van beide modellen; hij maakt het experiment veilig om uit te voeren en gemakkelijk om terug te draaien.
Welk klein model moet je eigenlijk draaien?
Draai Granite 4.2 3B als je werklast bestaat uit redeneren met lange contexten op een machine in laptopklasse en je drie denkmodi wilt, een plafond van 512K en een eerlijke kaart die je precies vertelt waarvoor de 3B niet is getraind. Draai MiniCPM5-2B als je werklast een interactieve on-device-agent is die tools aanroept, waarbij een model van 2,5B binnen je geheugenbudget past — maar neem de tijd om de opgegeven cijfers te reproduceren voordat je erop vertrouwt, want het gemiddelde van 53,9 en de SWE-bench-claim van 46,4 komen van de leverancier en van nog niemand anders. Twee dingen beslechten deze vergelijking sneller dan welke mening ook: een onafhankelijke test van MiniCPM5-2B die de agentclaims bevestigt of ontkracht, en de redeneercijfers van IBM die een reproductie door de community doorstaan. Totdat een van beide er is, is Granite 4.2 3B vandaag het veiligere, beter gedocumenteerde kleine model, en MiniCPM5-2B de interessantere gok.
