Een hero-titelkaart voor de vergelijking MiniCPM5-2B-DSpark vs Granite 4.2 3B heeft als ondertitel 'Twee stille Apache-2.0-releases voor kleine, snelle serving' en toont twee open kartonnen dozen naast elkaar — de linker zendt een bliksemschicht uit met het label 'DSpark draft', de rechter toont een tandwiel met het label 'redeneermodi' — met een Apache-2.0-lint over de onderkant en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

MiniCPM5-2B-DSpark vs Granite 4.2 3B: Twee stille Apache-2.0-releases voor kleine, snelle, zelf-gehoste serving

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Augustus en begin september 2026 kwamen er twee geruisloze Apache-2.0-releases uit die voor dezelfde klus bedoeld waren — kleine modellen die je zelf host — maar ze pakten het van tegenovergestelde kanten aan. Granite 4.2 3B is IBM's redeneermodel op laptopformaat, waarvan de gewichten begin augustus op Hugging Face verschenen en waarvan de modelkaart en de technische blog op 25 augustus 2026 naar buiten kwamen. MiniCPM5-2B-DSpark is in diezelfde zin helemaal geen model: het is een DSpark-draftcheckpoint van 323,8M parameters dat OpenBMB op 6 september 2026 zonder enige aankondiging plaatste, en dat is gebouwd om MiniCPM5-2B — het dense on-device model met 2,52B parameters dat ModelBest op 19 juli 2026 op de WAIC aankondigde — via speculatieve decodering sneller tokens te laten genereren. De ene release is een zelfstandig klein redeneermodel; de andere is een versnellingsaccessoire voor een klein model. Beide vallen onder Apache-2.0, beide zijn uitsluitend self-host, en geen van beide is tot nu toe door een onafhankelijke benchmark getoetst.

Strip de marketinglaag eraf en de praktische vraag waar een team voor staat is eenvoudig: voor een kleine, zelfgehoste serving-workload eind 2026, wil je IBM's 3B-redeneringsspecialist of ModelBest's 2B-agentgeoriënteerde stack met een gratis draft eraan vastgeschroefd? Het bewijs is dunner dan het specificatieblad van beide leveranciers doet vermoeden, dus dit artikel bespreekt de release-feiten, de enige set cijfers uit dezelfde suite die daadwerkelijk bestaat, en het workloadverschil dat de keuze zou moeten bepalen.

De twee releases, wat kenbaar is

Granite 4.2 3B is IBM's kleinste redeneermodel, verder getraind op basis van Granite-4.1-3B-Base. Het is een dense, tekst-only model — 40 lagen, grouped-query attention, een native context van 128K die in een vijfde pre-trainingsfase wordt uitgebreid naar 512K, en drie redeneermodi: standaard volledig denken, een modus met lage inspanning, en een pad zonder denken. IBM's modelkaart is er duidelijk over dat de 3B bewust het agentische reinforcement-learning-blok heeft overgeslagen dat de grotere Granite 4.2-tegenhangers wel kregen; er worden dan ook geen SWE-Bench-resultaten vermeld en het is een redeneermodel in plaats van een agentmodel. Het draait via vLLM, SGLang, Transformers, GGUF en Ollama (granite4.2:3b), en heeft geen gehoste API. De belangrijkste cijfers op de kaart — 78,33 op AIME 2025, 54,80 GPQA, 69,71 LiveCodeBench v6 — zijn door de leverancier gerapporteerd en tot op heden niet onafhankelijk gereproduceerd.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

De modelkaart van ibm-granite/granite-4.2-3b hierboven is het publieke gezicht van die release: een op redeneren afgestemde 3B met een long-context-verhaal en zonder agentische claims.

MiniCPM5-2B-DSpark daarentegen bestaat uitsluitend ten dienste van zijn doelmodel. Het draftmodel omvat vijf full-attention-lagen met 323.776.001 parameters en een blokgrootte van zeven kandidaattokens per forward pass, en is zes epochs getraind op 7,05 miljard tokens van door MiniCPM5-2B gegenereerde antwoorden. De repo vermeldt acceptatielengtes — 5,52 geaccepteerde tokens per verificatiestap over het geheel bij greedy decoding, 6,11 voor code — maar geen tokens-per-seconde-cijfer. Het doelmodel dat het versnelt, MiniCPM5-2B, is het interessantere product: een dicht model van 2,52B parameters, 42 lagen en 128K-context, waarvan het lanceermateriaal de nadruk legt op agentische capaciteiten — agent-midtraining op 200B-schaal, een grote agent-SFT-set en agent-RL-alignment, volgens de aankondiging van ModelBest in juli — plus native lange context en hybride snelle/doordachte modi. Op ModelBests eigen vergelijkingssuite scoort het doelmodel gemiddeld 53,9 tegen open modellen uit dezelfde klasse. Al die cijfers zijn afkomstig van de leverancier.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

De bovenstaande kaart van openbmb/MiniCPM5-2B-DSpark is het gehele releaseoppervlak: modelkaart, config, één Safetensors-bestand en geen aankondiging.

De enige vergelijking binnen dezelfde suite die bestaat

Scoreborden van verschillende leveranciers zijn meestal appels met peren vergelijken, maar er is één plek waar Granite 4.2 3B en MiniCPM5-2B samen zijn gemeten: de eigen evaluatietabel van ModelBest voor MiniCPM5-2B, die granite-4.2-3B vermeldt als een van de baselines. Op die suite haalt MiniCPM5-2B een gemiddelde van 53,9 tegenover Granite 4.2 3B's 42,7. Lees dat getal precies zoals het is: één leverancier die beide modellen op één suite draait, niet gereproduceerd, en geselecteerd om het eigen model goed te laten lijken. Het is geen oordeel. Wat het je wel vertelt, is dat ModelBest zelfverzekerd genoeg was om een 3B-model van een concurrent op de kaart te zetten, en de kloof die ze claimen is het grootst precies waar hun eigen training in investeerde: long-context- en agentische rijen. Behndel het als een richtinggevende bewering, verifieer het op je eigen data, en weeg IBM's eigen afzonderlijke kaartbeweringen af voordat je er iets over beslist.

Het scorebord, eerlijk gelabeld.

• Wat wordt uitgebracht — MiniCPM5-2B-DSpark: een draftmodel van 324M voor MiniCPM5-2B (dense doelmodel van 2.52B), niet zelfstandig. Granite 4.2 3B: een zelfstandig dense redeneermodel van ~3B.

• Rol — MiniCPM5-2B-stack: nadruk op on-device-agent en toolgebruik, volgens ModelBest. Granite 4.2 3B: redeneringsspecialist, bewust niet-agentisch.

• Context — MiniCPM5-2B doelwit: 128K native. Granite 4.2 3B: 128K native, uitbreidbaar tot 512K.

• Versnelling — MiniCPM5-2B-DSpark: externe DSpark-draft, zeven tokens per pas, greedy acceptatie ~5,5 per stap (zoals gerapporteerd in de repo). Granite 4.2 3B: geen meegeleverd met deze release.

• Licentie — beide Apache-2.0.

• Bewijs — De MiniCPM-cijfers zijn claims op de ModelBest-modelkaart (zijn suite: 53,9 vs Granite 42,7); de Granite-cijfers zijn claims op de IBM-modelkaart (AIME 2025 78,33, GPQA 54,80). Van geen van beide bestaat een onafhankelijke run.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

Het bovenstaande scorebord heeft dezelfde bronvermelding als de tekst: elk cijfer erop is door de leverancier gerapporteerd, en het enige getal uit dezelfde suite dat een van beide leveranciers heeft gepubliceerd, is dat van ModelBest zelf.

Het verschil dat elke benchmark overtreft

Voordat de scores er zijn, moet je bepalen welk soort klein model jouw workload nodig heeft, want de twee releases beantwoorden verschillende vragen. Granite 4.2 3B is gebouwd voor redeneren en lange context op beperkte hardware: een native venster van 128K dat uitrekt tot 512K, drie denkmodi per query, een footprint die op een laptop draait, en een expliciete beslissing om agentische training over te slaan. Als jouw werk bestaat uit analyse van lange documenten, context op repository-schaal of betrouwbaar redeneren op een kleine machine, dan is dat een coherente match. MiniCPM5-2B is gebouwd voor de tegenovergestelde nadruk: agentisch gedrag en toolgebruik op het apparaat — het feit dat de draft überhaupt bestaat, geeft aan dat ModelBest verwacht dat dit doelwit interactief wordt bediend en de tokens per seconde terug wil hebben. Als jouw werk een on-device agentloop is die tools aanroept en lange gesprekken voert, dan is dat de stack die voor jou bedoeld is.

Het draftmodel verandert de kosten-batenverhouding van die tweede keuze op een manier waar de release van Granite niet op ingaat. MiniCPM5-2B is een dense model, en speculatieve decodering levert in precies dat dense, geheugengebonden regime het meeste op — een klein vast model dat tokens voorstelt aan een iets groter vast model. Een extern draftmodel dat ruwweg 650 MB aan BF16-gewichten toevoegt aan een doelmodel van ~5 GB, met een gedocumenteerd servingpad via SGLang en een greedy-acceptatiegraad van ongeveer 5,5 tokens per verificatiestap, is een geloofwaardige hefboom voor de doorvoer van een model dat je serveert met een concurrency van één enkele aanvraag. Maar de kanttekening is onvermijdelijk: OpenBMB heeft geen end-to-end-versnelling gepubliceerd, dus de hefboom is niet gekalibreerd. IBM levert als onderdeel van deze release geen equivalent extern draftmodel voor Granite 4.2 3B — je draait het als dense model, en zijn snelheidsverhaal is simpelweg dat de 3B klein is.

Wie moet wat runnen

Draai Granite 4.2 3B als je workload bestaat uit redeneren over lange contexten op een laptopklasse-machine — documenten, repositories, diepgaande single-threaded analyse — en je drie denkmodi en een 512K-plafond wilt op een Apache-2.0-model waarover je volledige controle hebt. Aanvaard dat er geen agentische training achter zit en geen gehoste API.

• Draai de MiniCPM5-2B-stack met zijn DSpark-draft als je workload een interactieve on-device-agent is die tools aanroept, het doelmodel binnen je geheugenbudget past en je de doorvoer wilt die een draft kan terugwinnen. Trek tijd uit om de daadwerkelijke snelheidswinst van de draft te meten op je eigen SGLang-build, want daarvoor is geen getal gepubliceerd.

• Draai beide achter een routinglaag als je echt onzeker bent. Geen van beide modellen staat vandaag in een gehoste catalogus, OrcaRouter inbegrepen — beide zijn zelf-host-oplossingen — maar een router die met automatische failover voor je eigen endpoints staat, laat de nieuwe conceptstack op een testpad staan terwijl de productie op de bewezen stack blijft, en de doorberekening zonder opslag (0% markup) voor de gehoste modellen eromheen houdt de A/B-vergelijking goedkoop. Het punt is omkeerbaarheid: verwissel een modelnaam, meet en schakel terug als de één dag oude checkpoint vastloopt.

Wat nu te kijken

Twee dingen beslechten deze strijd sneller dan welke mening dan ook. Ten eerste: een onafhankelijke run van MiniCPM5-2B die het gemiddelde van 53,9 en de agentische claims bevestigt of onderuithaalt. Een 2B die zo goed scoort op SWE-Bench-achtige taken zou een werkelijk nieuw datapunt zijn voor de on-device-klasse. Ten tweede: de cijfers van IBM's eigen reasoning-model moeten de reproductie door de community doorstaan; de 78,33 die de 3B op AIME 2025 haalt, is het soort claim dat beweegt zodra iemand anders hem draait. Totdat een van beide vaststaat, is het eerlijke standpunt: Granite 4.2 3B is vandaag het veiligere, beter gedocumenteerde kleine model, en de MiniCPM5-2B-stack is de interessantere gok — een snellere on-device-agent als zijn claims standhouden, met een draft waarvan zelfs de eigen leverancier de opbrengst nog niet heeft gemeten.