Hero-titelkaart voor 'MiniCPM5-2B vs Gemma 4 12B', met de ondertitel 'De sub-4B-ranglijstleider ontmoet Google's 12B multimodale generalist', drie chips met de teksten '2.5B vs 11.95B', '128K vs 256K context' en 'AA Index 17 — #1 sub-4B', en een lint bovenaan met de tekst 'OPEN-WEIGHTS-KRACHTMETING · SEPT 2026'.
Guides & Insights

MiniCPM5-2B versus Gemma 4 12B: de leider van de Sub-4B-ranglijst versus Google's 12B-generalist

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het lanceringsmateriaal voor MiniCPM5-2B bevat één zin die klinkt alsof ze elk argument beslecht voordat het begint: tijdens de World Artificial Intelligence Conference op 19 juli noemden ModelBest en OpenBMB het model het best presterende model met minder dan 4B parameters op het leaderboard van Artificial Analysis, en de open weights zijn inmiddels geruisloos live gegaan op Hugging Face. Gemma 4 12B is Google's antwoord uit een totaal andere gewichtsklasse — een 11.95B dense, encoder-vrije multimodale generalist, uitgebracht op 3 juni, die tekst, beeld, audio en video als invoer neemt en al maandenlang door de community wordt ingezet. Het vergelijken van die twee is geen spec-sheet-oefening; het is een beslissing over het apparaat waar je voor bouwt, want een model dat zijn grootteklasse aanvoert en een model dat simpelweg groter is, beantwoorden verschillende hardwarevragen.

De timing is de reden dat deze vergelijking überhaupt bestaat. MiniCPM5-2B werd in juli op de WAIC getoond als product — evenzeer een chipverhaal als een modelverhaal, met negen siliconpartners vanaf dag nul uit de FlagOS-gemeenschap — en de gewichten werden "in de nabije toekomst" beloofd. Zeven weken later verscheen de openbmb/MiniCPM5-2B-repository op Hugging Face (de OpenBMB-changelog dateert de release op 7 september), onder Apache-2.0, vrij toegankelijk, met de BF16-checkpoint, GGUF, MLX, GPTQ, base- en SFT-checkpoints en de trainingsdatasets allemaal in dezelfde collectie. Geen persbericht, geen lanceerevenement. Op dit moment is de modelkaart de aankondiging, en er is nog geen onafhankelijke benchmarkrun gepubliceerd — al het kwantitatieve over de 2B hieronder is ofwel een eigen reproductie van ModelBest, ofwel afkomstig uit de Artificial Analysis-snapshot die erin wordt aangehaald. Gemma 4 12B werd daarentegen via de normale kanalen van Google gelanceerd en is al miljoenen keren gedownload. Die bewijskloof maakt deel uit van de vergelijking, geen voetnoot daarbij.

Wat is er net aan elke kant veranderd?

MiniCPM5-2B is het tweede model in de MiniCPM5-serie, na de MiniCPM5-1B die OpenBMB op 19 mei als open source uitbracht. De kaart beschrijft een dense transformer met 2.516.756.480 totale parameters (1.981.982.720 niet-embedding — het getal dat de '2B-klasse'-label oplevert), 42 lagen met een verborgen grootte van 2048, grouped-query attention met 16 query-heads en slechts 2 KV-heads, en een vocabulaire van 130.560. Het is een gewone LlamaForCausalLM-architectuur — de kaart is expliciet dat er geen aangepaste kernels en geen model-code fork nodig zijn — en het volledige checkpoint wordt geleverd als één BF16 safetensors-shard. De interessante ontwerpkeuze zit in de post-training: SFT op 400B tokens aan deep-thinking-data, gevolgd door On-Policy Distillation die zestien RL-expertmodellen, vijf daarvan agentisch, terugvouwt naar één klein dense netwerk. De kaart schrijft RL + OPD een gemiddelde winst toe van 10,96 punten op redeneer- en algemene taken en 6,96 punten op agentische taken — interne delta's, maar ze verklaren de vorm van dit model: een 2B die is gebouwd als een on-device agent die native tool-calls in XML-stijl genereert.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Gemma 4 12B neemt een andere positie in binnen Google's line-up. Het is het middelste kind van de G​emma 4-familie — boven de edge-gerichte E2B- en E4B-modellen, onder de 26B-MoE en de 31B-frontier — en het is het enige lid dat op een encoderloos ontwerp is gebaseerd: ruwe beeldpatches en audiogolfvormen worden rechtstreeks in de tokenruimte geprojecteerd, zodat één dense model tekst-, beeld-, audio- en video-invoer kan verwerken zonder dat er een aparte encoder-toren aan te pas komt. Het biedt een contextvenster van 256K, tool calling uit de doos, een optionele reasoning-pass en multi-token-predictie-drafters die de decodering vanuit het checkpoint versnellen. Het valt onder Apache-2.0, is praktisch inzetbaar op hardware uit de 16GB-klasse (ongeveer 8GB bij 4-bit), en op de Hugging Face-pagina zijn maandelijks miljoenen downloads te zien.

Screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing Google DeepMind as author, the Apache-2.0 license tag, Transformers and Safetensors tags, 'Model size 12B params', and the opening text describing the Gemma 4 12B Unified model's native text, audio, image and video input with no separate encoders (captured September 7, 2026).

De rangschikkingsclaim, en de grootteklasse die hij buiten beschouwing laat.

De headline van ModelBest voor MiniCPM5-2B is een Artificial Analysis Intelligence Index van 17, waarmee het bij de lancering de eerste plaats innam onder modellen met minder dan 4B parameters. Daar horen twee kanttekeningen bij. De score weerspiegelt het v4.1-snapshot van AA en is niet direct vergelijkbaar met indexwaarden uit eerdere snapshots; bovendien is het een lanceringscijfer dat de leverancier noemde vóórdat er een onafhankelijke herrun was uitgevoerd. De eerlijke interpretatie is beperkter en nog steeds indrukwekkend: bij zijn release voerde dit 2.5B-model zijn hele grootteklasse aan volgens de methodologie die AA destijds hanteerde. Gemma 4 12B komt in die klasse niet voor, en op de eigen pagina's van Artificial Analysis staat het vandaag hoger op de index — rond 22 voor de reasoning-variant en 13 voor het niet-reasoning instructmodel, beide "ruim boven gemiddeld" voor hun vergelijkingsgroep. Indexen van verschillende snapshots sluiten niet netjes op elkaar aan; behandel dat dus als richting, niet als precisie: de 12B-generalist komt in tests naar voren als het capabelere model, en de 2B als het capabelste model van zijn omvang. Dat zijn verschillende beweringen, en ze kunnen allebei waar zijn.

Het scorebord, eerlijk gelabeld.

Lees deze rijen met de herkomst in gedachten — de cijfers van MiniCPM5-2B zijn claims van de ModelBest-kaart, een week oud en niet gereproduceerd; die van Gemma 4 12B zijn door Google gerapporteerd en al lang blootgesteld aan gebruik door de community:

• Grootte — MiniCPM5-2B: 2,52B totaal / 1,98B niet-embedding, dense. Gemma 4 12B: 11,95B, dense.

• Modaliteit — MiniCPM5-2B: alleen tekst. Gemma 4 12B: tekst-, beeld-, audio- en video-invoer, zonder encoder.

• Context — MiniCPM5-2B: 131.072 tokens in de standaardconfiguratie. Gemma 4 12B: 256K native (sommige servingconfiguraties leggen de contextlengte vast op 128K).

• Talen — MiniCPM5-2B: kaart en gegevens gericht op Engels en Chinees. Gemma 4 12B: 140+ talen.

• Release — MiniCPM5-2B: aangekondigd op 19 juli 2026; gewichten live op 6–7 september, geruisloos. Gemma 4 12B: gelanceerd op 3 juni 2026, met volledige lanceer-evals.

• Bewijs — MiniCPM5-2B: leverancierskaart plus AA v4.1 (Index 17, #1 sub-4B); nog geen onafhankelijke run. Gemma 4 12B: evaluaties bij de lancering plus maandenlange community-uitrol en ~3,3 miljoen downloads per maand.

A comparison scoreboard titled 'MiniCPM5-2B vs Gemma 4 12B — the scoreboard', with left column rows 'Params: 2.52B total · 1.98B non-emb', 'Modality: Text only', 'Context: 128K (config 131,072)', 'Languages: English / Chinese', 'AA Index: 17 — #1 sub-4B at launch', 'Evidence: Vendor card · no independent run', and right column rows 'Params: 11.95B dense', 'Modality: Text + image + audio + video', 'Context: 256K native', 'Languages: 140+', 'AA Index: 22 reasoning · 13 instruct', 'Evidence: Google evals + months of use', with a footer labeling both sides' sourcing.

Het scorebord hierboven is hetzelfde portret in zes rijen: de twee modellen verschillen op bijna elke dimensie van mening, en de kolommen die de keuze bepalen — modaliteit, talen, apparaatklasse — zijn juist de aspecten die geen enkele benchmarkgemiddelde vastlegt.

Waar de 12B wint: de dingen die een tekst-only 2B niet kan nadoen.

Begin met modaliteit. Gemma 4 12B accepteert native audio, afbeeldingen en video; MiniCPM5-2B is uitsluitend tekstgebaseerd. Elk product dat transcribeert, naar een scherm kijkt of een video bekijkt, heeft naast de 2B een tweede pijplijn nodig, en op dat moment verdampt het voordeel van een “klein model” gedeeltelijk. Talen vormen de tweede muur: 140+ versus een release met een focus op Engels/Chinees. Voor een product dat een long tail van talen bedient, is de 2B al helemaal geen kandidaat. En dan is er het bewijs. Gemma 4 12B is miljoenen keren gedownload, gekwantiseerd, gefinetuned en al drie maanden in productie gebruikt; de faalpatronen zijn gedocumenteerd en het ecosysteem omvat llama.cpp, Ollama, LM Studio, MLX, vLLM en SGLang. MiniCPM5-2B is een repo van één week oud, waarvan de topcijfers — waaronder een door de leverancier behaalde 46,4 op SWE-bench Verified, wat opmerkelijk zou zijn voor een dense model van 2,5B als het onafhankelijke tests doorstaat — nog door niemand buiten het lab zijn geverifieerd. Alleen al qua volwassenheid is de keuze niet spannend.

Waar de 2B de enige optie is

Niets daarvan doet ertoe bij de apparaatklasse waar een 12B-model simpelweg niet past. Een telefoon, een smart-cockpitboard of een kleine edge-box met een paar gigabyte DRAM kan de gewichten van een 11.95B-model niet met een bruikbare snelheid over de geheugenbus verplaatsen — dat is precies de bottleneck die het zou verstikken. MiniCPM5-2B is voor die wereld gebouwd: gewichten die in het apparaatgeheugen passen, een contextvenster van 128K voor lange agentsessies, native tool calling, ontworpen om interactief te draaien, en day-zero-adaptatie voor negen chipfamilies plus ARM. Als je doel een NPU van telefoonklasse of een embedded board is, concurreert Gemma 4 12B niet met MiniCPM5-2B; het is daar in het geheel niet inzetbaar. En als je doel 12B maar net aankan — een 16GB-laptop — dan levert de 2B je headroom op: snellere latentie per token, lager energieverbruik en de mogelijkheid om een tweede model in dezelfde footprint te draaien.

Hoe kom je erachter welke claims overleven

Omdat beide modellen open-weight en zelf-hostbaar zijn, is de eerlijke volgende stap om op je eigen hardware te meten in plaats van nog eens door de specificaties te gaan. Als je een MiniCPM5-2B tegen een Gemma 4 12B afweegt voor een workload die je al serveert, is dit ook waar een routinglaag zich terugverdient: door het testpad via één API met automatische failover naar een nieuw zelf-gehost checkpoint te leiden, kan een onbewezen stack vastlopen of in een lus blijven hangen zonder de productieomgeving mee naar beneden te trekken, terwijl de catalogusprijzen van de providers waarmee je vergelijkt zonder opslag worden doorgegeven. Het model zelf is een repo van een dag oud, dus het uitgangspunt is om het als een experiment te behandelen — maar het experiment is goedkoop om te draaien, en de twee uur die het kost om SWE-bench of een deel van je eigen eval-set op de 2B te reproduceren, is precies het bewijs dat deze vergelijking mist.

Het vonnis

Kies Gemma 4 12B wanneer je hardware de headroom heeft en je workload meer omvat dan alleen tekst — een multimodaal product, een meertalig publiek, of iets waarbij drie maanden door de community bewezen gedrag belangrijker is dan een toppositie op de ranglijst. Kies MiniCPM5-2B wanneer je apparaat een 12B-model helemaal niet aankan, of wanneer een tekstbekwame, agentgerichte 2.5B op een chip van telefoonklasse je in staat stelt een product uit te brengen dat een groter model onmogelijk maakt. De ranglijstleider in de sub-4B-categorie is een ware prestatie en de open-weights-release maakt het vandaag al testbaar; het is alleen, op grond van het beschikbare bewijs, geen vervanging voor een 12B-generalist waar dan ook een 12B daadwerkelijk kan draaien.