Een hero-titelkaart voor het artikel 'MiniCPM5-2B Weights Are Live', met ondertitel 'The model that claimed the sub-4B crown quietly went open-source', drie chips met de tekst 'Apache-2.0', '2.5B params · 128K context' en 'AA Index 17 — #1 sub-4B at launch', en een bovenlint 'OPEN WEIGHTS · SEPT 2026'.
Guides & Insights

MiniCPM5-2B-gewichten zijn live: het kleine model dat de Sub-4B-kroon opeiste wordt open-source

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het model zelf is zeven weken oud. MiniCPM5-2B werd op 19 juli onthuld tijdens de World Artificial Intelligence Conference 2026, waar ModelBest en OpenBMB het het best gerangschikte model met minder dan 4B parameters op de ranglijst van Artificial Analysis noemden en beloofden dat de gewichten "in de nabije toekomst" zouden volgen. Wat er dit weekend gebeurde, is dat de nabije toekomst zonder enige lanceertamtam aanbrak: de MiniCPM5-2B-repository ging op 6 september live op Hugging Face, en in de changelog van OpenBMB staat de release op 7 september vermeld, onder een Apache-2.0-licentie, met het volledige pakket — BF16-gewichten, GGUF-, MLX- en GPTQ-kwantiseringen, base- en SFT-checkpoints, een DSpark-draftmodel voor speculatieve decodering, en de trainingsdatasets die daaraan ten grondslag liggen.

Er ging geen persbericht aan vooraf en er was geen lanceerevenement. Het verscheen gewoon: op de ene dag een Hugging Face-repo, op de andere een regel in de changelog. Dat maakt dit een ‘wat we tot nu toe weten’-artikel — met één vroege update. De repo vertelt ons veel: het model is vandaag daadwerkelijk te downloaden en draaibaar, en de specificaties zijn openbaar. En er is al een externe score binnengekomen: Artificial Analysis plaatst MiniCPM5-2B op zijn Intelligence Index v4.2 op 15, het hoogste open-weights-resultaat onder 4B totale parameters op die index, dus de rangschikking onder 4B berust niet langer uitsluitend op het woord van de leverancier. Wat nog niet is bevestigd, zijn de hoofdcijfers op de modelkaart, die OpenBMB in zijn eigen testopstelling heeft gereproduceerd en die buiten het lab nog niemand opnieuw heeft uitgevoerd. Hier is wat uit de repo te weten valt, wat nu onafhankelijk is gemeten en wat nog verificatie behoeft voordat je erop voortbouwt.

Wat is er net gebeurd?

MiniCPM5-2B is het tweede model in de MiniCPM5-serie, na MiniCPM5-1B, dat OpenBMB op 19 mei als open source uitbracht. Toen de 2B als product op de WAIC werd gepresenteerd, was het verhaal net zozeer een chipverhaal als een modelverhaal — ModelBest positioneerde het als een on-device agent-basis voor telefoons, pc's en slimme cockpits, en noemde negen chips met day-zero-ondersteuning via zijn FlagOS-community, van Huawei Ascend tot NVIDIA en een reeks binnenlandse accelerators. Het open-sourcen werd aangekondigd als op handen zijnde. Er gingen zeven weken voorbij.

Op 6 september verscheen de repository openbmb/MiniCPM5-2B. Op het moment van schrijven is de modelkaart de release-aankondiging, en die is ongewoon compleet voor een stille release:

• Gewichten — de uiteindelijke RL + OPD post-trained checkpoint in BF16, gelicenseerd onder Apache-2.0, en niet gated — iedereen kan het downloaden.

Bijbehorende checkpoints — MiniCPM5-2B-SFT, -Midtrain en -Base voor mensen die het model vóór RL/OPD willen hebben, plus -GGUF, -MLX, -GPTQ en een -DSpark draftmodel, allemaal te vinden in de MiniCPM5-collectie op Hugging Face.

• Data — de trainingscorpora zijn ook open, uitgebracht als onderdeel van de UltraData-familie: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 en UltraData-RL-2609.

• Spiegels — de README verwijst naar zowel Hugging Face als ModelScope.

Eén regel in de modelkaart is belangrijker dan het lijkt: "geen aangepaste kernels, geen fork van de modelcode." MiniCPM5-2B gebruikt de standaard LlamaForCausalLM-architectuur, dus elke engine die al modellen van de Llama-familie ondersteunt, kan het laden zonder te wachten op een op maat gemaakte implementatie.

Waarom een 2.5B-model een tweede blik waard is

De WAIC-pitch was er een over ranglijsten. ModelBest zei dat MiniCPM5-2B een Artificial Analysis Intelligence Index van 17 behaalde, waarmee het bij lancering als eerste eindigde onder modellen met minder dan 4B parameters op de AA-ranglijst. Twee kanttekeningen horen bij dat getal. Ten eerste zijn indexscores alleen vergelijkbaar binnen een methodologieversie: MiniCPM5-1B's eerdere 17,9 kwam uit een eerdere AA-snapshot, dus dat is geen bewijs dat het kleinere model "hoger scoort", en volgens dezelfde regel is een nieuwere score op een nieuwere methodologie geen terugval. Ten tweede voeden AA's cijfers de modelkaart, maar het gemiddelde in de kop van de kaart is van OpenBMB zelf, gereproduceerd in OpenBMB's eigen testraamwerk. Dat onderscheid is belangrijk omdat AA sindsdien is overgestapt op een nieuwere methodologie en een verse score heeft gepubliceerd — de eerste externe controle van de pitch sinds de open-gewichtenrelease.

Een extern getal kwam in dezelfde week binnen als de gewichten. Op 4 september lanceerde Artificial Analysis Intelligence Index v4.2, een methodologische herziening die de weging van niet-openbare, apart gehouden tests verhoogt naar 40% en twee nieuwe componenten toevoegt: AA-Briefcase, een agentische evaluatie, en GDP.pdf van Surge, een documentredeneringstaak met lange context. De indexvermelding van AA voor MiniCPM5-2B heeft nu een v4.2-score van 15: het beste resultaat onder open-gewichtenmodellen met minder dan 4B totale parameters, en de eerste van de 47 open modellen in die grootteklasse op de lijst van AA. Daarmee blijft het model op de plek waar de pitch van juli het plaatste, dit keer op een methodologie die moeilijker te bespelen is en met gewichten die iedereen kan downloaden en opnieuw controleren. De 15 is niet vergelijkbaar met de 17 uit de lanceerfase, die afkomstig was van v4.1 — de methodologie is strenger, niet het model zwakker — en de samengestelde index verifieert de afzonderlijke rijen van de modelkaart niet opnieuw, waarvan OpenBMB de meeste in een eigen testopstelling reproduceerde. Wat de samengestelde index wel doet, is uitkomen op de twee assen waarvan OpenBMB zegt dat het model erop is geoptimaliseerd: v4.2 leunt sterker op agentische taken, en de uitvoerigheidsmeting van AA toont dat MiniCPM5-2B 57M outputtokens genereert in de indextaken, het meest beknopte model in zijn klasse tegenover een mediaan van 72M. OpenBMB bedankte AA voor de run en verwoordde het in precies die termen — agentische prestaties en tokenefficiëntie bij 2,6B, zo zei het, zijn waar het model voor is geoptimaliseerd.

De inhoudelijke claim was agentische capaciteit in een klein pakket: native tool calling, deep search en codegeneratie, vanaf de grond af ingetraind in plaats van achteraf toegevoegd. De modelkaart beschrijft een pipeline in drie fasen — basistraining, mid-training, en daarna post-training met SFT op 400B tokens aan deep-thinking-data, gespecialiseerde RL-docenten en On-Policy Distillation (OPD), die zestien RL-expertmodellen, waaronder vijf agentische, weer samenvoegt tot één klein dicht netwerk. OpenBMB schrijft een gemiddelde winst van 10,96 punten op redeneer- en algemene taken en 6,96 punten op agentische taken toe aan de RL + OPD-fase — interne delta's, maar die verklaren de ongebruikelijke vorm van dit model: een netwerk met 2,5B parameters, opgebouwd als een redeneermodel en gericht op toolgebruik.

A single-column scoreboard for MiniCPM5-2B titled 'MiniCPM5-2B — the scoreboard', with rows 'Params: 2.52B total · 1.98B non-embedding', 'Architecture: dense Llama-style, 42 layers, GQA 16:2', 'Context: 131,072 tokens (config)', 'License: Apache-2.0, weights + data', 'AA Index: 17 — #1 sub-4B at launch (AA v4.1)' and 'SWE-bench Verified: 46.4 · vendor-reported', and a footer reading 'Params, architecture and context from the HF config; AA Index per Artificial Analysis; other benchmark figures are vendor-reported.'.

Wat de repo daadwerkelijk bevat

Het specificatieblad is ondubbelzinnig, omdat het het configuratiebestand is. MiniCPM5-2B heeft 2.516.756.480 parameters, waarvan 1.981.982.720 niet-embeddingparameters — leveranciers rekenen met het niet-embeddingaantal wanneer ze "2B-klasse" zeggen. Het is een dense transformer met 42 lagen en een hidden size van 2048, grouped-query attention met 16 query-heads en slechts 2 KV-heads, een vocabulaire van 130.560 en BF16-tensors. Het geheel wordt geleverd als één enkele safetensors-shard, klein genoeg om via een laptopverbinding te downloaden en te draaien op één middelklasse-gpu of een npu van telefoonklasse.

• Parameters — 2.516.756.480 totaal; 1.981.982.720 niet-embedding.

• Architectuur — dense LlamaForCausalLM, 42 lagen, hidden size 2048, GQA 16 querykoppen / 2 KV-koppen, vocabulaire 130.560.

• Context — 131.072 tokens geconfigureerd (max_position_embeddings), geen RoPE-schaling in de config.

• Licentie — Apache-2.0, voor zowel het model als de vrijgegeven trainingsdata.

• Formaat — BF16; de GGUF-, MLX- en GPTQ-companions worden afzonderlijk gepubliceerd.

A screenshot of the Hugging Face page for openbmb/MiniCPM5-2B, showing the repository header with Transformers and Safetensors tags and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B' (captured September 7, 2026).

Eén getal uit de juli-presentatie komt niet voor in de checkpoint. Het WAIC-materiaal prees een contextvenster van 512K tokens aan; de vrijgegeven configuratie stelt max_position_embeddings in op 131.072 (128K) zonder rope_scaling-vermelding. Het is mogelijk dat het getal 512K bedoeld is om via uitbreiding tijdens de inferentie te worden bereikt, zoals verschillende kleine modellen hun context oprekken — maar zoals geleverd documenteert de repository 131.072, en dat is het getal om tegen te ontwerpen totdat OpenBMB een uitbreidingsrecept publiceert.

De getallen, gesorteerd op wie ze gemeten heeft

De modelkaart is zorgvuldig wat betreft herkomst, en het loont om de voetnoten te lezen. Scores die hij met een dolk markeert "komen uit de officiële Artificial Analysis-release" — rijen zoals GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 en GDPval-AA v2 19.6. Al het andere wordt beschreven als "intern gereproduceerd", wat betekent dat OpenBMB die evaluaties in zijn eigen testomgeving liet draaien. Tot die categorie behoren de opvallende cijfers: een intern gemiddelde van 53.9 over de vergelijkingsset van de kaart, 86.5 voor AIME 2025/2026, 94.6 voor MATH-500, 69.1 voor LiveCodeBench v6, 46.4 voor SWE-bench Verified, 66.6 voor BFCL v4, 97.1 voor τ²-Bench Telecom, 88.7 voor GAIA (Text-103) en 70.8 voor MMLU-Pro.

Drie dingen zorgen ervoor dat die cijfers eerlijk te lezen zijn. Het gemiddelde van 53,9 is een relatieve score, geen absolute: de kaart normaliseert elke radar-as zodat het beste model in de vergelijking 100 scoort. De vergelijkingsset is door de leverancier zelf samengesteld: andere open modellen van 2B-4B, waaronder Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B en LFM2.5-8B-A1B. Binnen die set toont de kaart dat MiniCPM5-2B het op één na beste model, Qwen3.5-4B met 51,1, voorbijstreeft – een werkelijk opvallend resultaat voor een model dat half zo groot is, en precies het soort resultaat dat onafhankelijk gereproduceerd moet worden voordat iemand erop voortbouwt. En een paar individuele rijen zijn lastig te rijmen met de marketing: een SWE-bench Verified-score van 46,4 van een dense 2,5B-model zou opmerkelijk zijn als die gereproduceerd wordt, terwijl een HLE van 8,9 eraan herinnert dat "sub-4B-leider" en "frontier" verschillende competities zijn. Niets hiervan wordt door de repo weersproken, en de v4.2-composiet van AA heeft sindsdien de algehele positie van het model aan de top van de sub-4B-klasse voor open-weights-modellen bevestigd – maar deze specifieke rijen zijn afkomstig van OpenBMB zelf en zijn buiten het lab nog door niemand geverifieerd.

Vandaag MiniCPM5-2B draaien

Omdat de architectuur gewoon Llama is, laden gangbare engines het direct. De README van OpenBMB bevat quickstarts voor vLLM (0.21 of nieuwer), SGLang (0.5.16 of nieuwer) en Transformers (5.6 of nieuwer), met de aanbevolen samplingparameters temperatuur 1.0 en top-p 0.95, en met enable_thinking ingeschakeld wanneer je de reasoning-pass wilt gebruiken. De GGUF- en MLX-companions zijn beschikbaar voor llama.cpp, Ollama, LM Studio en Apple Silicon; de modelkaart vermeldt ook de ArcLight-runtime en de gebruikelijke fine-tuning-stacks (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).

Twee implementatiedetails zijn goed om te weten voordat je begint. Voor het aanroepen van tools en functies is SGLang de aanbevolen backend: het model genereert XML-achtige toolaanroepen, en de ingebouwde minicpm5-parser van SGLang zet die native om naar OpenAI-compatibele tool_calls, waardoor standaard tool-calling-clients zonder een aangepaste tussenlaag werken. En het DSpark-draftmodel is bedoeld om de redeneerslag goedkoper te maken: eenmaal draaiend in SGLang met het DSPARK-algoritme voor speculatieve decodering, versnelt het de decodering terwijl de outputs van het doelmodel ongewijzigd blijven — het soort ding dat bepaalt of een agentlus met 128K-context op een laptop bruikbaar of slechts mogelijk is.

A screenshot of the Hugging Face 'MiniCPM5' collection page (openbmb/minicpm5), headed 'SOTA on-device LLMs, small yet powerful', listing openbmb/MiniCPM5-2B and openbmb/MiniCPM5-1B alongside the series' companion repositories (captured September 7, 2026).

Als je liever een reeks kleine open modellen evalueert dan er één handmatig af te stemmen, bewijst de routinglaag hier zijn waarde: wanneer een provider MiniCPM5-2B aanbiedt, is een router de goedkope manier om het zonder tweede integratie voor dezelfde taak in een A/B-test te vergelijken met Qwen3.5-2B en de andere open checkpoints met minder dan 4B parameters. Bij OrcaRouter betekent dat één API voor 200+ modellen, lijstprijzen van providers die zonder opslag worden doorberekend, en automatische failover als een gloednieuw checkpoint stokt of in een lus belandt op een productiepad. De repo is amper twee dagen oud en nog geen enkele gehoste API waar we naar kunnen verwijzen biedt MiniCPM5-2B al aan — dus de eerlijke standaard vandaag is om het te behandelen als een self-host-experiment, niet als een afhankelijkheid.

Wie zou deze gewichten moeten trekken?

Haal ze vandaag nog binnen als je werk zich richt op on-device agents, edge tool-calling, of experimenten met kleine modellen voor coderen en redeneren, en je de meest agressief getrainde optie van de 2B-klasse op tafel wilt. De Apache-2.0-licentie en de open trainingsdata wegnemen de twee redenen waarom de meeste teams terughoudend zijn bij een klein model van een Chinees lab: geen restrictie op commercieel gebruik en geen black-boxcorpus. Haal ze met voorzichtigheid binnen als je een productiemodel kiest louter op basis van de benchmarktabel: de kopregels van de modelkaart zijn OpenBMB's eigen reproducties, en de v4.2-composiet van AA — de enige externe meting tot nu toe — onderschrijft ze niet. Een 2.5B-model dat naar verluidt Qwen3.5-4B voorbijgaat, is een bewering die de twee uur waard is die het kost om SWE-bench zelf te reproduceren.

Wat je hierna in de gaten moet houden. De repo is nog maar twee dagen oud, dus de signalen op korte termijn zijn nog louter procedureel: of llama.cpp en de Ollama-bibliotheek de GGUF adopteren, of de ModelScope-mirror en de FlagOS-chipbuilds netjes live gaan, en of een gehoste API MiniCPM5-2B in het aanbod opneemt — dat is het moment waarop het niet langer uitsluitend zelf te hosten is. Het inhoudelijke signaal dat dit stuk als ontbrekend markeerde — een onafhankelijke testrun door Artificial Analysis of een universiteitslab — is inmiddels gearriveerd in de vorm van de v4.2-indexscore, en die houdt MiniCPM5-2B op de eerste plaats onder open-weights-modellen van minder dan 4B. Wat nog steeds openstaat is verificatie op rijniveau: niemand buiten OpenBMB heeft de cijfers in de modelkaart gereproduceerd, met name SWE-bench Verified op 46,4 en het interne gemiddelde van 53,9. Totdat die specifieke rijen opnieuw zijn gedraaid, moet je MiniCPM5-2B behandelen zoals je elk stilletjes uitgebracht model met een indrukwekkende modelkaart zou behandelen: als een zeer veelbelovende hypothese die je vanavond lokaal kunt draaien, en een model waarvan je de meest opvallende cijfers moet verifiëren voordat je het echt werk toevertrouwt.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube