Een hero-titelkaart voor de vergelijking 'MiniCPM5-2B-DSpark vs Gemma 4 12B' met de ondertitel 'Twee manieren om concepten te maken, twee gewichtsklassen van lokale AI'. Links voedt een kleine chip, gelabeld '324M-concept', een blok dat gelabeld is '2.5B-doelmodel op het apparaat'; rechts staat een breder paneel, gelabeld '11.95B multimodale generalist'. Daarboven is een flow-lijn van token-chips te zien met het label 'eerst concept, dan verifiëren'. Rechtsonder staat het OrcaRouter-logo.
Guides & Insights

MiniCPM5-2B-DSpark vs Gemma 4 12B: Twee manieren om te schetsen, twee gewichtsklassen van lokale AI

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De snelste manier om te zien waarom MiniCPM5-2B-DSpark en Gemma 4 12B op dezelfde pagina thuishoren, is het formaat van beide even te negeren en te bekijken hoe elk van de twee een zin schrijft. Beide modellen zijn de geheugenbus te slim af met een drafter: een klein model stelt meerdere volgende tokens tegelijk voor en het echte model verifieert het blok in één enkele doorgang, zodat de chip de kosten voor het laden van gewichten één keer per blok betaalt in plaats van één keer per token. MiniCPM5-2B-DSpark is de drafter die OpenBMB op 6 september 2026 stilletjes op Hugging Face plaatste — een bijbehorend checkpoint van 323,8M parameters dat MiniCPM5-2B versnelt, het dense 2,52B on-device model dat ModelBest op 19 juli 2026 op WAIC aankondigde. Gemma 4 12B is de 11,95B encoderloze multimodale generalist van Google, gelanceerd op 3 juni 2026 met eigen ingebouwde drafters en een 256K-context. De ene levert de drafter als een apart Apache-2.0-checkpoint dat je zelf laadt; de andere verbergt een vergelijkbare truc in één enkel groot model dat je gewoon draait.

De eerlijkheidsnotitie die de vorm van dit artikel bepaalt: MiniCPM5-2B-DSpark is geen model dat je kunt prompten. Het heeft geen tokenizer, geen chatsjabloon en geen zelfstandige uitvoer — een kaart die alleen een model.safetensors, een config en een README vermeldt. Het is een accessoire voor de servicelaag van een doelwit in de 2B-klasse, en de echte vergelijking die een lezer maakt is tussen twee lokale-AI-gewichtsklassen: een telefoonformaat 2B-stack die zijn tokens genereert, versus een 16-gigabyte 12B-generalist die zijn tokens genereert. Al het andere hieronder is dat besluit concreet gemaakt.

Wat MiniCPM5-2B-DSpark eigenlijk is

De modelkaart is het volledige publieke oppervlak van de release, dus dit is wat daaruit kenbaar is. MiniCPM5-2B-DSpark is een DSpark-draftcheckpoint: vijf volledige attention-lagen, 323,776,001 parameters, grouped-query attention met 16 query-heads en 2 KV-heads, en een blokgrootte van zeven — het stelt tot zeven kandidaat-tokens per forward pass voor die het MiniCPM5-2B-doelmodel moet verifiëren. De configuratie declareert de Qwen3DSparkModel-architectuur met een DSparkDraftModel-auto-map en wordt geleverd met de confidence-head en de Markov-head van de DSpark-methode (arXiv 2607.05147, het D​eepSeek-paper van juli 2026) nog ingeschakeld — de load-aware verificateur die beslist wanneer een suffix niet de moeite waard is om te controleren. Het is getraind gedurende zes epochs op 7,05 miljard tokens van MiniCPM5-2B-gegenereerde antwoorden bij algemene, wiskunde- en code-prompts.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

De openbmb/MiniCPM5-2B-DSpark-kaart hierboven is de volledige omvang van wat er werd uitgebracht: modelkaart, config, één Safetensors-bestand, en geen aankondiging, geen blogpost, geen persbericht — een stille release van gewichten die op het moment van schrijven één dag oud was.

Wat de kaart niet bevat, is net zo belangrijk als wat hij wel bevat. Hij rapporteert de acceptatielengte — volgens de eigen evaluatie van de repo een gemiddelde van 5,52 geaccepteerde tokens per verificatiestap bij greedy decoding, met wiskunde op 6,05 en code op 6,11 op een maximum van zeven tokens — maar publiceert geen versnelling in wandkloktijd, geen tokens-per-seconde-cijfer en geen onafhankelijke benchmark. SGLang's DSPARK-engine is de gedocumenteerde serving-route, waarbij de draft naast het MiniCPM5-2B-doelmodel is geladen. Met andere woorden: de kwaliteit van de draft is gekwantificeerd, maar de opbrengst ervan nog niet, en wie hem toepast, moet meten voordat hij gelooft.

Wat Gemma 4 12B naar de andere kant brengt

Gemma 4 12B is het middelste kind van Google's Gemma 4-familie en bevindt zich op een heel ander punt op de lokale-AI-curve. Het is één dense 11,95B-model dat tekst, beeld, audio en video als invoer accepteert zonder afzonderlijke encoders, toolaanroepen meteen uit de doos ondersteunt en een native 256K-context koppelt aan multi-token-prediction-drafters die intern dezelfde geheugenbus-truc toepassen — maar dan vanuit de checkpoint zelf, zodat er niets extra's is dat je hoeft te downloaden of aan te sluiten. Het is Apache 2.0, draait in de praktijk op een 16GB-laptop en arriveerde met de volledige Google-uitrusting: launch-evals, modelkaarten voor de base- en instructievarianten en ecosysteemondersteuning in Model Garden, LM Studio en Ollama. Het heeft maanden aan community-implementatie achter zich, iets wat de één dag oude MiniCPM-draft niet heeft.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

Bovenstaande modelkaart van Google voor Gemma 4 12B is het contrast in één kader: een volwassen multimodale generalist waarvan de opstellers onderdeel zijn van de release, niet van een afzonderlijke repository.

De specs, eerlijk gelabeld

Lees deze met de herkomst in het achterhoofd: MiniCPM5-2B-cijfers zijn claims van de ModelBest-kaart, niet gereproduceerd; Gemma 4 12B-cijfers zijn van Google zelf en zijn al lang in gebruik bij de community.

• Wat je draait — MiniCPM5-2B-DSpark: een 324M-draft die alleen naast MiniCPM5-2B functioneert (2.52B dense, 42 lagen). Gemma 4 12B: een zelfstandig dense model van 11.95B.

• Context — MiniCPM5-2B doel: 128K native. Gemma 4 12B: 256K native.

• Modaliteit — MiniCPM5-2B-stack: alleen tekst. Gemma 4 12B: tekst-, beeld-, audio- en video-invoer, zonder encoder.

• Drafting — MiniCPM5-2B-DSpark: externe DSpark-draft, zeven tokens per pass, SGLang DSPARK-engine. Gemma 4 12B: interne multi-token-predictie-drafters, niets te installeren.

• Voetafdruk — MiniCPM5-2B komt neer op ongeveer 5 GB in BF16 plus een draftbestand van ~650 MB; Gemma 4 12B komt neer op ongeveer 18 GB in BF16 en is in de praktijk bruikbaar op 16GB-klasse hardware met kwantisering.

• Bewijs — MiniCPM5-2B-DSpark: alleen cijfers over acceptatielengte uit de repository, één dag oud. Gemma 4 12B: lanceringsevaluaties plus maanden van uitrol door de community.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Het scorebord hierboven is hetzelfde portret in zes rijen: de twee kolommen zijn het over bijna alles oneens, behalve over de strategie die beide gebruiken om snel te schrijven.

Welke gewichtsklasse past bij het silicium dat je daadwerkelijk hebt?

Omdat MiniCPM5-2B-DSpark geen model is, is de betekenisvolle splitsing de gewichtsklasse van het doelmodel versus die van Gemma 4 12B — en die splitsing is vooral een hardwarevraag. Een telefoon, een smart-cockpitboard of een kleine edge-box met een paar gigabyte DRAM kan een 11,95B-model niet op bruikbare snelheid draaien; de geheugenbus is precies de bottleneck die het zou verstikken. Dat is de wereld waarvoor de MiniCPM5-2B-stack is gebouwd — een dicht 2B-model waarvan de gewichten in het apparaatgeheugen passen, met een draftmodel dat eraan is toegevoegd om een deel van het aantal tokens per seconde terug te winnen dat kleine dichte modellen laten liggen. Speculatieve decodering is juist in dit dichte, geheugengebonden regime het meest effectief, en daarom is het draftmodel het interessante deel van de release in plaats van een gimmick.

Gemma 4 12B is het antwoord één gewichtsklasse hoger. Als je systeem 16GB of meer heeft — een laptop, een workstation, een stevige edge-server — kun je de multimodale generalist draaien, en je krijgt drie dingen die de 2B-stack niet kan bieden: beeld-, audio- en video-invoer zonder encoders of een tweede pipeline; een 256K-venster voor werk op repository- of documentschaal; en een volwassenheid die een conceptcheckpoint van één dag oud simpelweg niet heeft. Je levert de mogelijkheid in om op de kleinste apparaten te draaien, en dat kost ruwweg drie keer zoveel geheugen.

De routeringsrealiteit voor beide

Geen van beide modellen in deze vergelijking staat vandaag in een gehoste catalogus, ook niet in die van OrcaRouter. MiniCPM5-2B-DSpark is per definitie een self-hosted serving-accessoire — je draait zelf de SGLang-stack en het draftmodel bestaat alleen in je lokale deployment. Gemma 4 12B is een open-weight-model, dus je serveert het zelf of gebruikt het waar je het al kunt krijgen. Dat is precies de situatie waarin een routinglaag zijn bestaansrecht bewijst als vangnet in plaats van als leveringsmechanisme: wanneer je een gloednieuw draft-build test tegen een workload die je al serveert en daarbij het testpad via één API met automatische failover laat lopen, dan kan een onbewezen stack vastlopen zonder de productie neer te halen; de providerlijstprijzen worden er zonder opslag doorberekend, zodat een prijswijziging bij elk gehost model waarmee je vergelijkt dezelfde dag zichtbaar is. Voor de vergelijking zelf is de eerlijke aanpak voor beide modellen echter dezelfde: je host zelf, dus de benchmark die ertoe doet is die je op je eigen hardware draait.

Het vonnis

MiniCPM5-2B-DSpark en Gemma 4 12B zijn geen concurrenten in welke directe vergelijking dan ook — het zijn twee gewichtsklassen van lokale AI die toevallig een truc gemeen hebben. Kies de MiniCPM5-2B-stack met zijn DSpark-draft wanneer je apparaat geen 12B-model kan dragen en je een tekstgeschikt, Apache-2.0, agentgericht model wilt dat past in het geheugen van het apparaat; de draft is een veelbelovende gratis versnelling, maar meet het op je eigen SGLang-build voordat je het vertrouwt, want de opbrengst ervan is nog steeds niet gekwantificeerd. Kies Gemma 4 12B wanneer je hardware voldoende ruimte heeft en je één multimodaal model wilt met een 256K-venster en een ecosysteem erachter. De vraag is niet welk model slimmer is — het is welke jouw silicium daadwerkelijk kan voeden.