Een hero-titelkaart met de tekst 'Kolibri vs MiniCPM5 2B' in een groot, vet lettertype, met daaronder één enkele kleinere regel met de tekst 'een model van serverkwaliteit tegenover een agent op het apparaat', en twee kleine platte lijniconen naast elkaar — links een kolibrie en rechts een kleine omtrek van een mobiele chip — gescheiden door een dunne verticale scheidingslijn, op een witte achtergrond met zachte blauw- en cyaangradiëntaccenten en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Kolibri vs MiniCPM5-2B: 78 miljard parameters tegenover 2,5, en waarom de kleine niet de goedkope optie is

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Kolibri naast MiniCPM5-2B en de instinctieve lezing is dat dit een groottevergelijking is, en dat het model met 2,5 miljard parameters de economische keuze is. Die lezing is op een leerzame manier onjuist. Kolibri is Aleph Alpha's mixture-of-experts-model met 78,1 miljard parameters, uitgebracht op 3 oktober 2026, dat per token 3,46 miljard parameters activeert, met een FP8-voetafdruk van ongeveer 78 GB en een minimale serveerconfiguratie van twee A100 80 GB-kaarten. MiniCPM5-2B is het dense model met 2,52 miljard parameters van ModelBest en OpenBMB, onthuld op de World Artificial Intelligence Conference op 19 juli 2026, met gewichten die op 6 september op Hugging Face verschenen. MiniCPM5-2B is eenendertig keer kleiner in aantal parameters. Het is ook het model dat een evaluatiebudget vereist voordat je erop vertrouwt, omdat de meest geciteerde cijfers door de leverancier zijn geproduceerd en niet gereproduceerd — wat precies het tegenovergestelde is van wat "klein model" gewoonlijk impliceert over risico.

Beide zijn stilletjes uitgebracht; slechts één ervan is onlangs uitgebracht.

Ze hebben vergelijkbare ontstaansgeschiedenissen en heel verschillende leeftijden, en de leeftijden doen ertoe. De repository van Aleph Alpha voor Kolibri werd aangemaakt op 2 oktober 2026 met een opgegeven releasedatum van 3 oktober, en de eigen newsroom-aankondiging van de leverancier werd die ochtend verstuurd, op de Dag van de Duitse Eenheid. De algemene AI-pers miste het die dag grotendeels, en daar komt de framing van de "stille release" vandaan, maar een modelkaart, een technisch rapport en een bericht van de leverancier zijn geen geruisloze introductie. MiniCPM5-2B was echt stiller: de WAIC-aankondiging in juli was een onthulling tijdens een conferentie van een pitch en specificaties, en de daadwerkelijke modelgewichten verschenen pas op 6 september, gepubliceerd zonder lanceerevenement, samen met GGUF-, MLX-, GPTQ-, base-, SFT- en draft-checkpoints en de onderliggende trainingscorpora.

Die vijfweekse kloof tussen aankondiging en gewichten is het onthouden waard, want dat is waarom er twee verschillende sets getallen voor dit model circuleren. Het materiaal uit juli pronkte met een contextvenster van 512K tokens. De meegeleverde configuratie stelt 131.072 in. Het vrijgegeven artefact is wat telt.

Waar elk model eigenlijk voor is

Kolibri is gebouwd voor het werken met Duitse en Engelse documenten, en Aleph Alpha is ongewoon specifiek over waarom daar echte engineering voor nodig was. Kleine proxy-modelexperimenten stelden een doel van ongeveer 20 procent Duits in de trainingsmix, wat voor een run van 20 biljoen tokens betekende dat er 4 biljoen Duitse tokens gevonden moesten worden. Gededupliceerde en gefilterde open Duitse datasets leverden 390 miljard op — een orde van grootte te weinig — dus het lab stelde een Common Crawl-filter specifiek voor het Duits opnieuw af, wat 1,3 biljoen unieke organische tokens opleverde, en herformuleerde bestaande Duitse documenten tot encyclopedielemma's, dialogen en passages voor nog eens ongeveer een biljoen, wat de grootste afzonderlijke Duitse bron werd. Vertaling, die voor de voorganger Kolibri Origin werd gebruikt, werd voor Kolibri geschrapt. Het filterdetail is het belangrijkste om te onthouden: een standaardpipeline voor taaldata gooit documenten met te veel lange woorden weg, en Duitse ambtelijke teksten overschrijden geregeld de Engelse grens voor de gemiddelde woordlengte, waardoor de standaardinstellingen stilletjes het register verwijderen waarin het openbaar bestuur schrijft.

MiniCPM5-2B is gebouwd voor het tegenovergestelde uiterste: een agent op het apparaat. De kaart beschrijft een dense transformer met in totaal 2,52 miljard parameters, 1,98 miljard niet-embedding, 42 lagen bij hidden size 2048, grouped-query attention met 16 query-heads en 2 KV-heads, en een standaard LlamaForCausalLM-architectuur zonder aangepaste kernels. De trainingspijplijn is agentisch van opzet: agent-midtraining op 200-miljardschaal, een grote agent-SFT-set, agent-RL-afstemming en een laatste On-Policy Distillation-fase die zestien RL-modellen terugvouwt tot één klein dense netwerk. Het wordt geleverd met XML-achtige tool calls en een ingebouwde SGLang-parser, en de vrijgegeven configuratie stelt een venster van 131.072 tokens in.

• Parameters — Kolibri: 78.103.074.560 totaal, 3.457.573.120 actief, 22,6:1 sparsity. MiniCPM5-2B: 2.516.756.480 totaal, 1,98B niet-embedding, dense.

• Uitgebracht — Kolibri: 3 oktober 2026. MiniCPM5-2B: aangekondigd op 19 juli 2026, gewichten op 6 september 2026.

• Context — Kolibri: 16.384 getraind, 65.536 mid-getraind, 262.144 native, 1.048.576 gevalideerd. MiniCPM5-2B: 131.072 in de meegeleverde configuratie; de 512K-claim uit juli zit daar niet in.

• Voetafdruk — Kolibri: ongeveer 78 GB in FP8; minimaal twee A100 80 GB, twee H100 SXM5, één H200, één B200 of één B300. MiniCPM5-2B: een enkele BF16-shard, laptopklasse.

• Talen — Kolibri: Duits en Engels, bewust en niets anders. MiniCPM5-2B: Engels en Chinees, met alle gepubliceerde evaluatiesuites in het Engels.

• Toolaanroepen — Kolibri: Hermes-stijl met een meegeleverde vLLM-parser. MiniCPM5-2B: XML-stijl met een SGLang-parser.

Licentie — beide Apache 2.0, beide zonder een aanvullende clausule over aanvaardbaar gebruik.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

De scoreborden, en de sourcing erachter

Er bestaat nergens een rechtstreeks vergelijkend cijfer voor deze combinatie, in het materiaal van geen van beide leveranciers, en we gaan er niet een samenstellen uit twee verschillende testomgevingen en dat een vergelijking noemen. Wat elke partij publiceert, is het waard zorgvuldig uit elkaar te houden, omdat de twee reeksen cijfers heel verschillende hoeveelheden bewijs bevatten.

De cijfers van Kolibri komen uit de eigen vergelijkingstabel van Aleph Alpha met veertien modellen, uitgevoerd op één harness met Kolibri ingesteld op redeneerinspanning hoog: 75,5 op het Engelse gemiddelde, 70,8 op het Duitse gemiddelde. Die tabel is niet vleiend voor het onderwerp — Qwen3.8 27B scoort 80,2 en 79,9 op dezelfde twee gemiddelden en staat bovenaan bij GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified en beide benchmarks voor lange context, terwijl het ongeveer een achtste van de parameters van Kolibri activeert. De framing die de leverancier aan dat verschil geeft, is een Pareto-frontier van kwaliteit tegenover gedecodeerde tokens per seconde per GPU, die geen van de vergeleken modellen overtroeft. Het is een argument over serveereconomie, geen argument over capaciteiten, en geen enkele derde partij heeft het gemeten: er is geen Artificial Analysis-vermelding voor Kolibri en geen replicatie van de harness.

De cijfers van MiniCPM5-2B komen van zijn eigen kaart: een intern gemiddelde van 53,9 over een door de leverancier geselecteerde vergelijkingsset, AIME 2025/2026 op 86,5, MATH-500 op 94,6, en een door de leverancier uitgevoerde 46,4 op SWE-bench Verified dat opmerkelijk zou zijn voor een dense model met 2,5 miljard parameters als het onafhankelijke tests doorstaat. Op die kaart staat IBM's Granite 4.2 3B op 42,7 tegenover MiniCPM5-2B's 53,9 — één leverancier die beide modellen op één suite draait die hij zelf heeft gekozen. Verschillende suites, verschillende testharnassen, verschillende leveranciers. Niets ervan is een eindoordeel over deze combinatie.

Wat echt nuttig is aan de kant van MiniCPM5-2B, is de openbaarmaking. OpenBMB bracht de UltraData-trainingscorpora samen met de gewichten uit — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, de agent-SFT- en RL-sets — allemaal Apache 2.0, waardoor een black box verandert in een recept dat je kunt inspecteren en op je eigen domein kunt voortzetten. Het model wordt ook geleverd met day-zero-adaptatie voor negen chipfamilies via ModelBest's FlagOS-gemeenschap, van Huawei Ascend tot NVIDIA en ARM, wat een deploymentstatement is in plaats van een benchmarkstatement. Daar staat tegenover dat IBM de gewichten van Granite 4.2 3B en een gedetailleerd technisch verslag van de opbouw publiceerde, maar niet de trainingsdata, en dat Aleph Alpha de datapijplijn en energieboekhouding van Kolibri publiceerde — 20 biljoen pre-training-tokens, 9,5×10² MWh inclusief overhead van datacenters en exclusief supervised fine-tuning en reinforcement learning — maar niet het corpus zelf.

Waar het grootteverschil echt zichtbaar wordt

De nuttigste manier om deze twee naast elkaar te zetten is langs de twee assen die een daadwerkelijke deployment bepalen: wat er in de ruimte aanwezig moet zijn, en wat er gebeurt wanneer het model ongelijk heeft.

Qua hardware wint MiniCPM5-2B met afstand. Een dense model met 2,52 miljard parameters in één BF16-shard draait op een laptop, een edgebox of één enkele consumenten-GPU, en FlagOS-ondersteuning voor negen chipfamilies betekent dat het draait op hardware die helemaal geen NVIDIA-accelerator is. De ondergrens voor Kolibri is twee A100 80GB-kaarten of één B200, ruwweg 78 GB aan FP8-gewichten, geserveerd via de aleph-alpha-inference vLLM-plugin of de gepubliceerde container. Voor een smart-cockpit- of telefoongerelateerde workload is de 2B de enige van de twee die in aanmerking komt, en Kolibri was nooit ontworpen om daar te concurreren.

Wat verifieerbaarheid betreft, wint Kolibri om een subtielere reden. De meest geciteerde bewering — de serveereconomie — is ongetest, maar de kwaliteitscijfers zijn ten minste gepubliceerd tegen dertien met naam genoemde concurrenten op één harness, met de instellingen openbaar gemaakt, en de eigen tabel van de leverancier kent de overwinning op de meeste rijen toe aan een tegenstander. De hoofdz cijfers van MiniCPM5-2B zijn die van de leverancier op de suite van de leverancier, zonder dat een vergelijkingsharness wordt onthuld, en het model draagt de extra onzekerheid van een checkpoint dat weken oud is in plaats van dagen. Geen van beide modellen is onafhankelijk gebenchmarkt. Het verschil is dat de ene leverancier een vergelijking heeft opgeschreven waarin zijn eigen model verliest, en de andere een heeft opgeschreven waarin zijn eigen model met een ruime marge wint.

Met opzet is er helemaal geen sprake van een wedstrijd. Kolibri bestaat voor Duitstalige documentverwerking on-premises, met een tweetalige tokenizer die volgens Aleph Alpha op Duitse webtekst uitkomt op gemiddeld 4,90 bytes per token, tegenover 4,35 voor GPT-5 en 3,28 voor Kimi K3 — allemaal door de leverancier gemeten, en een kosteneffect per token eerder dan een kwaliteitsclaim. MiniCPM5-2B bestaat voor tool-calling-agents in het Engels en Chinees op beperkte hardware. Een team met Duitse contracten en een compliancevereiste kiest niet tussen beide.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

De routingrealiteit, en het experiment dat de moeite waard is om uit te voeren

Geen van beide modellen staat vandaag in een gehoste catalogus, en we hebben beide gecontroleerd in plaats van aan te nemen. Kolibri heeft geen leveranciers-API-SKU — de release bestaat uit gewichten, een technisch rapport en een containerimage — en staat niet op OrcaRouter: we hebben de catalogus bevraagd met elke spelling van het leveranciersprefix en de modelnaam, en het resultaat is 'niet gevonden'. MiniCPM5-2B heeft ook geen gehost endpoint van ModelBest, en wordt niet via ons gerouteerd. Beide zijn opties voor self-hosting en we zeggen dat liever dan te suggereren dat we een van beide aanbieden.

Waar dit interessant wordt, is bij het experiment. Een agentisch model met 2,5 miljard parameters en een documentmodel met 78 miljard parameters lossen verschillende problemen op, en de enige manier om te weten welk jouw workload nodig heeft, is ze beide ertegenaan te laten draaien — precies de situatie waarvoor een routeringslaag is gebouwd, zelfs wanneer die geen van beide modellen aanbiedt. Richt een testpad op een zelfgehoste MiniCPM5-2B-build via één OpenAI-compatibel endpoint met automatische failover, laat productie op een bewezen gerouteerd model staan, en de nieuwe stack kan vastlopen of onzin produceren zonder dat er iets omvalt. De lijstprijzen van providers voor de modellen waarmee je vergelijkt, worden zonder opslag doorgegeven, dus de A/B blijft goedkoop en omkeerbaar. En als het experiment juist uitwijst dat je Duitse workload geen van beide zelfgehoste modellen nodig heeft, bereikt dezelfde sleutel een kleine mixture-of-experts-laag die al gerouteerd is — de Gemma 4 26B-A4B-variant voor $0,06 per miljoen inputtokens en $0,33 per miljoen output, met een venster van 262.144 tokens en tekst-, beeld- en video-invoer — wat de goedkoopste manier is om daarachter te komen voordat je twee GPU's koopt.

Welke, en wat zou het antwoord veranderen?

Draai MiniCPM5-2B als het apparaat de beperkende factor is. Met 2,52 miljard parameters is het de enige van de twee die op een laptop, in een cockpit of op een edge-box past, en als je workload een interactieve tool-calling-agent in het Engels of Chinees is, is dat het model dat daarvoor bedoeld is. Plan tijd in om eerst de cijfers ervan te reproduceren — het gemiddelde van 53,9 en de SWE-bench-claim van 46,4 zijn uitsluitend afkomstig van ModelBest, en doordat de trainingscorpora open zijn, is die reproductie echt mogelijk in plaats van theoretisch.

Draai Kolibri als het corpus Duits is, de hardware aanwezig is en de gewichten het gebouw niet mogen verlaten. Een native contextvenster van 262.144 tokens, een FP8 KV-cache, vier niveaus van redeneerinspanning en Hermes tool calling zijn de juiste vorm voor gereguleerd documentwerk, en de Apache 2.0-voorwaarden plus de gepubliceerde datapijplijn zijn het onderdeel dat een inkoopbeoordeling overleeft.

Twee dingen zouden dit sneller beslechten dan welk argument dan ook. Een onafhankelijke SWE-bench Verified-run op MiniCPM5-2B zou de meest verrassende claim die een van beide kaarten doet, bevestigen of ontkrachten. En een onafhankelijke throughputmeting van Kolibri in de aanbevolen configuratie met twee H100's — of een vermelding in Artificial Analysis, die vandaag niet bestaat — zou "78 miljard parameters" van een specificatie in een kostenpost veranderen, en dat is het getal waar iedereen die deze vergelijking tegen hardware afweegt, eigenlijk naar zoekt. Tot die tijd is het grootteverschil reëel, is het doelverschil groter, en is de goedkoop ogende optie degene die de niet-geverifieerde claim draagt.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt