Een hero-titelkaart voor de vergelijking {{1}}'MiniCPM5-2B-DSpark vs Qwen3-8B'{{/1}} met de ondertitel {{2}}'De nieuwe 2.5B on-device-stack versus het werkpaard met open gewichten'{{/2}}, waarop links een telefoonomtrek staat met daarin een kleine chip met het label {{3}}'2.5B + draft'{{/3}}, en rechts een serverrack met het label {{4}}'8B-werkpaard'{{/4}}, met een geheugenbandbreedtemeter ertussen en het OrcaRouter-logo in de rechterbenedenhoek.
Guides & Insights

MiniCPM5-2B-DSpark vs Qwen3-8B: De nieuwe 2,5B on-device-stack versus het werkpaard met open weights

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Elke modelvergelijking verbergt een hardwarevraag, en MiniCPM5-2B-DSpark versus Qwen3-8B is die vraag verkleed als benchmark. Qwen3-8B is het open-weights werkpaard van Alibaba uit april 2025 — ongeveer 8,2B dense parameters, 119 talen, 32K native context uitbreidbaar tot 131K, hybride denkmodi, en zestien maanden aan community-bewijs erachter. MiniCPM5-2B-DSpark is geen zelfstandig model om ernaast te zetten: het is de 323,8M-parameter DSpark-draftcheckpoint die OpenBMB op 6 september 2026 stilzwijgend op Hugging Face plaatste om MiniCPM5-2B te versnellen, het dense 2,52B on-device model dat ModelBest op 19 juli 2026 op WAIC aankondigde. Zet het paar bij elkaar en de echte vraag komt naar boven: moet de workload die momenteel op een 8B draait, draaien op hardware die slechts een 2B aankan — en is een 2,5B met een gratis draft goed genoeg om de overstap te maken?

Het korte antwoord is voor de meeste workloads nog niet, maar de redenen zijn beperkter dan het grootteverschil doet vermoeden, en er is één categorie implementaties waarin de 8B helemaal geen antwoord heeft. Alle kwantitatieve gegevens in dit stuk zijn door leveranciers gerapporteerd — de cijfers van MiniCPM zijn die van ModelBest zelf, niet onafhankelijk gereproduceerd; die van Qwen3-8B zijn die van Alibaba en worden al lang door de community gebruikt — dus de labels wegen zwaarder dan de cijfers.

Twee modellen op verschillende plaatsen op de geheugencurve

MiniCPM5-2B is een dicht causaal Transformer-model met een derde van de omvang van een 8B-model — 42 lagen, grouped-query attention, Apache-2.0 — gebouwd voor de klasse apparaten die een groot model niet kan bereiken: telefoons, slimme cockpits en kleine edge-boxen, waar de geheugenbus zou stikken in acht miljard gewichten. Het lanceringsmateriaal legt de nadruk op agentisch werk en lange context in plaats van op brede algemene kennis: 128K native context, en de claim van ModelBest dat het model op de eigen evaluatiesuite van het bedrijf gemiddeld 53,9 haalt — open-source SOTA in de 2B-klasse, volgens de leverancier, inclusief een door de leverancier uitgevoerde 46,4 op SWE-bench Verified, een score die opmerkelijk zou zijn voor een 2B als die een onafhankelijke test doorstaat. De DSpark-draft is qua doorvoer het antwoord op de voor de hand liggende tegenwerping dat een klein dicht model snel te laden is maar langzaam genereert, omdat elk token zijn gewichten over de geheugenbus sleept. De draft biedt tot zeven tokens tegelijk aan ter verificatie door het doelmodel, en de repository rapporteert een greedy acceptatie van 5,52 tokens per verificatiestap over het geheel — 6,11 op code. Dat getal is de kwaliteit van de draft; de versnelling ervan is nog niet gemeten en er is geen tokens-per-seconde-cijfer gepubliceerd.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

De openbmb/MiniCPM5-2B-DSpark-kaart hierboven is het volledige publieke oppervlak van de stille release van 6 september: een serving-accessoire dat de acceptatielengte rapporteert, zonder aankondiging en zonder versnelling van de wandkloktijd.

Qwen3-8B behoort tot dezelfde architectuurfamilie, is drie keer zo groot en zestien maanden ouder. Het is een dense causale Transformer met grouped-query attention, getraind op een meertalig corpus van 36 biljoen tokens, gelicentieerd onder Apache-2.0, en een van de meest zelf-gehoste en ingezette 8B-modellen in de open-weights-wereld. Zijn signatuur is de hybride redeneermodus van Qwen3 — denken aan of uit per verzoek — en zijn profiel is bewust breed: MMLU in de hoge 70, sterke GSM8K- en codeerresultaten, 119 talen. Het heeft een echte GPU of een krachtige edge-box nodig: bij praktische kwantisering zit het in de lage gigabytes, comfortabel op één middenklasse grafische kaart, niet op een telefoon.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

Alibaba's modelcard voor Qwen3-8B hierboven is het gezicht van de gevestigde partij: zestien maanden aan gedocumenteerd, door de community getest gedrag in 119 talen.

Waar de 8B nog steeds wint

Ga je een gewichtsklasse omlaag, dan lever je drie concrete dingen in. Ten eerste: talen. Qwen3-8B bestrijkt 119 talen; de modelkaart en datasets van MiniCPM5-2B zijn toegespitst op Engels en Chinees, en er wordt geen meertalige breedte geclaimd. Voor een product dat een lange staart van talen bedient, is dat een harde muur, geen zachte. Ten tweede: het bewijs. Qwen3-8B is zestien maanden lang beproefd, gekwantiseerd, gefinetuned en op schaal ingezet; de faalmodi zijn bekend, de kwantisaties bestaan, het ecosysteem is overal aanwezig. MiniCPM5-2B is in juli 2026 uitgebracht, met een door de leverancier beheerd scorebord en zonder onafhankelijke reproductie, en de draft is nog maar één dag oud. Ten derde: de serving-stack. Alles wat al met Qwen3-8B praat — vLLM, SGLang, llama.cpp, duizend finetunes — richt zich op een volwassen doelwit, terwijl de MiniCPM-draft een engine-build voor speculative decoding vereist (SGLang's DSPARK-algoritme) die door de repo wordt gedocumenteerd, maar die het bredere ecosysteem nog niet heeft opgenomen.

Waar de 2B stack de enige optie is.

Op de apparaatklasse waar een 8B-model simpelweg niet past, doet niets van dat alles ertoe. Op een telefoon of een edge-board met een paar gigabyte DRAM concurreert Qwen3-8B niet met MiniCPM5-2B — het is al helemaal niet op bruikbare snelheid inzetbaar. Dat is de hele reden waarom de 2B-stack bestaat, en waarom de draft het dragende deel van deze release is in plaats van een garnering. Speculatieve decodering is het meest effectief in precies het dichte, geheugengebonden regime waarin een klein model op kleine hardware leeft: een compacte drafter stelt een blok tokens voor, het doelmodel verifieert dat in één doorgang, en de kosten voor het laden van gewichten worden één keer per blok betaald in plaats van één keer per token. De van DeepSeek afkomstige DSpark-methode (arXiv 2607.05147) is ontworpen voor high-concurrency serving-systemen, maar de mechanismen ervan — en de acceptatiecijfers in deze repo — zijn de relevante hefboom voor een 2B-model dat op beperkte hardware interactief moet aanvoelen. Houd alleen het eerlijke voorbehoud in het oog: OpenBMB heeft de acceptatie van de draft gemeten, niet de versnelling, dus de daadwerkelijke winst in tokens per seconde op jouw doelapparaat moet je nog altijd zelf meten.

Het scorebord, eerlijk gelabeld.

Release — MiniCPM5-2B: 19 juli 2026 (aangekondigd); MiniCPM5-2B-DSpark: 6 september 2026, stil. Qwen3-8B: april 2025, aangekondigd.

• Grootte — MiniCPM5-2B: 2.52B dense, plus een 324M draft. Qwen3-8B: ~8.2B dense.

• Context — MiniCPM5-2B: 128K native. Qwen3-8B: 32K native, 131K via YaRN.

• Talen — MiniCPM5-2B: Engels/Chinees-gericht. Qwen3-8B: 119.

• Redeneren — MiniCPM5-2B: hybride snelle/doordachte modi volgens de lanceringsmaterialen. Qwen3-8B: denken aan of uit per verzoek.

• Bewijs — MiniCPM-cijfers zijn claims op de ModelBest-kaart (gemiddeld 53,9 op de eigen suite; geen onafhankelijke run). Qwen3-8B-cijfers zijn door Alibaba gerapporteerd en zestien maanden aan de community blootgesteld.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

Het bovenstaande scorebord toont de mismatch eerlijk: de kolommen verschillen op vrijwel alles behalve de open Apache-2.0-licentie, en de apparaatklasse waarvoor je ontwikkelt, bepaalt welke kolom je überhaupt mag kiezen.

De realiteit van routing

Geen van beide modellen staat vandaag in een gehoste catalogus op OrcaRouter, dus deze vergelijking speelt zich volledig af in de zelf-gehoste wereld — maar dat is precies waar een routinglaag nog steeds zijn waarde bewijst. Qwen3-8B wordt aangeboden door de leverancier en verschillende externe platforms; MiniCPM5-2B en het bijbehorende draft-model zijn iets wat je zelf draait. Wanneer een team wil testen of een 2.5B-stack een deel van een 8B-workload kan dragen, is de omkeerbare zet om een testpad te richten op een zelf-gehoste MiniCPM5-2B-plus-draft SGLang-build via één API met automatische failover — productie blijft op de huidige oplossing, de nieuwe stack kan stagneren zonder iets plat te leggen, en de lijstprijzen van aanbieders voor de hele vergelijking worden doorberekend met 0% opslag, dus de A/B-test is goedkoop en omkeerbaar in plaats van een gok. De laag host geen van beide modellen; het maakt het experiment veilig uitvoerbaar.

Wie moet zich verplaatsen, en wie moet wachten

Blijf bij Qwen3-8B voor al het meertalige werk, alles wat zestien maanden aan bekend gedrag nodig heeft, of elke workload die al op hardware draait die een 8B comfortabel aankan — het grootteverschil is geen reden om te migreren, en de bewijskloof pleit daartegen. Test de MiniCPM5-2B-stack met zijn DSpark-draft alleen grondig als je doelapparaat de 8B helemaal niet aankan, of als een 2.5B die het bijhoudt op agentische en long-context-taken het mogelijk maakt om geheugen en stroom te besparen op hardware die je al levert. En voordat je je op de draft vastlegt, voer je de meting uit die OpenBMB niet publiceerde: acceptatielengte is geen latentie, en de tokens-per-secondewinst op jouw apparaat is het getal dat werkelijk bepaalt of de stille, kleine checkpoint op Hugging Face de download waard was.