
MiniCPM5-2B-DSpark: OpenBMB brengt stilletjes MiniCPM5-2B-gewichten uit met een draftmodel dat is ontworpen voor snelheid.
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Zes weken geleden was MiniCPM5-2B een belofte. Onthuld op de WAIC-conferentie in Shanghai op 2026-07-19 als het sub-4B-model bovenaan de Artificial Analysis Index, ging het gepaard met een routekaartnotitie dat open gewichten er "binnenkort" zouden komen. Dat 'binnenkort' viel deze week, zonder enig tromgeroffel. Op 2026-09-06 plaatste OpenBMB de vlaggenschiprepository MiniCPM5-2B op Hugging Face onder een Apache-2.0-licentie, en eenentwintig minuten later plaatste het MiniCPM5-2B-DSpark — een draft-checkpoint van 323,8 miljoen parameters dat als enige doel heeft MiniCPM5-2B sneller te laten decoderen onder DSpark, het speculatieve decodeeralgoritme. Op 2026-09-07 volgde een GPTQ-build. Op het moment van schrijven is er geen aankondiging, geen lanceerbericht en geen changelog-entry te vinden; de release kwam bovendrijven doordat repositories in een tijdsbestek van elf dagen geruisloos openbaar werden.
Dit is een stuk over wat we tot nu toe weten, en de framing doet ertoe. MiniCPM5-2B-DSpark is geen zelfstandige chatbot of een nieuw vlaggenschip — het is een versneller: een klein, snel model dat tokens voorstelt vóór MiniCPM5-2B, dat ze vervolgens parallel verifieert. Het is nutteloos zonder zijn doelwit, en dat doelwit is de reden waarom dit ertoe doet. De open-gewichten release van MiniCPM5-2B die OpenBMB in juli beloofde, staat nu daadwerkelijk op Hugging Face, en het draftmodel dat daarmee wordt meegeleverd, is het mechanisme dat de leverancier aanbeveelt om het op bruikbare snelheid te draaien. Alles wat hieronder niet expliciet wordt toegeschreven, is direct gelezen uit de twee modelkaarten en hun repositories.
Wat is er uitgebracht, en wanneer
De 2B-familie werd uitgebracht als een doorlopende, onaangekondigde drop, nieuwste items eerst:
• 2026-08-27 — MiniCPM5-2B-Base en MiniCPM5-2B-SFT verschijnen, de ruwe voorgetrainde en supervised-fine-tuned checkpoints.
• 2026-09-01 — MiniCPM5-2B-Midtrain, de agentische mid-trainingfase.
• 2026-09-05 — MiniCPM5-2B-MLX en MiniCPM5-2B-GGUF, de Apple-Silicon- en llama.cpp-formaten.
• 2026-09-06 — eerst het vlaggenschip MiniCPM5-2B-repo, en eenentwintig minuten later MiniCPM5-2B-DSpark.
• 2026-09-07 — MiniCPM5-2B-GPTQ, het gekwantiseerde servingformaat.
Allemaal dragen ze de Apache-2.0-licentie, het ModelBest dat in mei werd gebruikt voor de MiniCPM5-1B-familie, en de eerdere checkpoints in de reeks vertonen nog steeds vrijwel geen community-signaal — een handvol downloads en likes per stuk. {{1}}Dat is de markering van een weight drop{{/1}} die nog bezig is{{2}} in plaats van{{/2}} een gecoördineerde lancering: {{3}}de artefacten verschijnen in afhankelijkheidsvolgorde{{/3}} ({{4}}eerst base en SFT{{/4}}, {{5}}als laatste de gekwantiseerde en draft-formaten{{/5}}) {{6}}zonder dat er één dag als releasedatum fungeert{{/6}}.
Wat MiniCPM5-2B-DSpark eigenlijk is
Speculatieve decodering deelt de generatie op in een goedkope voorsteller en een dure verificateur. Een klein conceptmodel raadt de volgende paar tokens; het grote model verifieert alle gissingen in één enkele voorwaartse doorgang en accepteert de gissingen waarmee het instemt. Wanneer het voorstel goed is gekalibreerd, krijg je de output van het grote model tegen een fractie van de kosten, en wanneer het ernaast zit, verspil je slechts één verificatiestap. DSpark is een specifiek recept voor dat idee, uit een artikel dat op 2026-07-06 is geplaatst (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). Twee ontwerpkeuzes onderscheiden het: het koppelt een parallelle backbone van een conceptmodel aan een lichtgewicht sequentiële module, zodat tokens binnen een voorgesteld blok van elkaar afhangen in plaats van dat hun nauwkeurigheid afneemt richting het einde van het blok, en het bepaalt per verzoek de omvang van elke verificatierun op basis van vertrouwensschattingen en de doorvoersnelheid van de engine, in plaats van altijd een blok van vaste lengte te verifiëren.
De DSpark-draft die OpenBMB heeft uitgebracht is een vijflaagse Transformer met 323,8M parameters in BF16 (ongeveer 648 MB). Het maakt deel uit van de Qwen3-architectuurfamilie, maar bevat DSpark-specifieke toevoegingen: een projector die verborgen toestanden van MiniCPM5-2B uitleest uit vijf van de lagen van het doelmodel (1, 10, 20, 30 en 39), een confidence head en een kleine Markov head die de verdeling van het volgende token modelleert. De config ervan stelt een blok van zeven tokens per forward pass voor. Met ongeveer een achtste van de 2,5B parameters van MiniCPM5-2B is het een van de kleinste draftmodellen die voor een mainstream open checkpoint zijn uitgebracht — en dat is precies de bedoeling bij een edge-georiënteerd model, waar de draft goedkoop genoeg moet zijn zodat het draaien van twee modellen op één apparaat nog steeds beter is dan het draaien van één model.

De bovenstaande repository is het volledige openbare oppervlak van het conceptmodel: een README, een configuratie, een enkel safetensors-bestand en een modelkaart waarvan de trainingsbeschrijving 1.959.525 sequenties (7,05B tokens) toont, gegenereerd door MiniCPM5-2B op basis van algemene, wiskundige en code-prompts, getraind gedurende zes epochs met een gecombineerde cross-entropie-, L1- en betrouwbaarheidsdoelstelling. Het checkpoint wordt niet op zichzelf als generatief model gebruikt.
De cijfers die OpenBMB publiceerde, eerlijk gelabeld
De kaart van het draftmodel vermeldt één cijfer dat ertoe doet: acceptance length, het gemiddelde aantal voorgestelde tokens dat het doelmodel accepteert uit elk blok van zeven tokens. De evaluatie werd uitgevoerd op MiniCPM5-2B-outputs in drie domeinen, met tot maximaal 4.096 gegenereerde tokens:
• Wiskunde — gemiddeld 6.05 tokens geaccepteerd bij greedy (T=0); 4.61 bij sampling met T=1.0.
• Code — 6,11 (greedy); 4,44 (sampled).
• Algemeen — 4.16 greedy; 3.10 sampled.
• Totaal — 5,52 (greedy); 4,05 (gesampled), op een maximum van zeven.
Die cijfers zijn door de leverancier in de modelkaart gerapporteerd en niet onafhankelijk gereproduceerd. Ze beschrijven ook de hit rate van de draft, niet een versnelling in wall-clocktijd: snelheid is een serving-meting die afhangt van wat de verificatiepass van het target kost ten opzichte van de voorstelpass van de draft, van de batchbezetting en van het inkorten van de verificatielengte door de confidence-scheduler van DSpark. OpenBMB publiceerde voor het paar geen tokens-per-seconde-getal. Om een idee te geven van waar het plafond van de methode ligt: het DSpark-paper rapporteert dat de generatie per gebruiker bij gelijke doorvoer 60–85% sneller is dan de MTP-1-baseline in het live-servingsysteem van DeepSeek — een nuttig referentiepunt voor wat het algoritme elders heeft gepresteerd, geen bewering over MiniCPM5-2B op jouw hardware.

Het scorebord hierboven is het eigen specificatieblad van de release. Lees het acceptatiecijfer als een concept-hitrate; de vermenigvuldiger voor de werkelijke doorvoer is wat een onafhankelijke SGLang-run nog moet meten.
Het model dat door de draft wordt versneld.
MiniCPM5-2B is een dense Transformer met 2,5 miljard parameters — 2.516.756.480 in totaal — met 42 lagen, 16 query-heads en 2 KV-heads, een vocabulaire van 130.560 tokens en een contextvenster van 131.072 tokens, en heeft in BF16 een omvang van circa 5 GB. Architectonisch is het opzettelijk doodgewoon: een standaard LlamaForCausalLM zonder zelfgeschreven kernels en zonder fork van de modelcode, en dat is precies waarom het zo makkelijk te porten is naar talloze runtimes en chipplatforms. Op de eigen interne benchmarksuite van OpenBMB geeft de kaart het model een gemiddelde van 53,9 voor redeneren, instructie-opvolging, kennis, lange context, toolgebruik, programmeren en zoekagenttaken — vóór Qwen3.5-4B (51,1) en granite-4.2-3B (42,7) in dezelfde tabel. Daarbij zijn verschillende cellen (GPQA-Diamond 70,2, HLE 8,9 en diverse lange-context- en agentische rijen) gemarkeerd als afkomstig van Artificial Analysis in plaats van intern gereproduceerd te zijn. De belangrijkste scores per taak zijn onder meer MATH-500 (94,6), AIME 2025 en 2026 (86,5), IFEval (86,7), MMLU-Pro (70,8) en SWE-bench Verified (46,4). Dit zijn de cijfers van de leverancier op de suite van dezelfde leverancier, en de kaart vermeldt expliciet dat sommige rijen van derden afkomstig zijn; ga dus dienovereenkomstig met die mix om.

Bij de onthulling in juli verwees het lanceringmateriaal van ModelBest naar een Artificial Analysis Index van 17 — als eerste onder modellen onder de 4B parameters — en de berichtgeving van juli verwees naar een venster van 512K tokens. De checkpoints die daadwerkelijk zijn uitgeleverd, configureren 131.072 tokens aan context. Waar een marketingcijfer van de lancering en een uitgeleverde configuratie van elkaar verschillen, is de configuratie het getal dat bepaalt wat je kunt draaien, en het verschil is de moeite waard om te kennen voordat je een workload met lange context rond het marketingcijfer plant.
MiniCPM5-2B draaien met zijn draft
Het beoogde pad is SGLang, dat het DSpark-algoritme al sinds v0.5.16 upstream ondersteunt — de minimale versie die de modelkaart vereist. Het volledige serving-commando uit de kaart:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Onder greedy decoding (T=0) is DSpark-verificatie verliesvrij: de uitvoer is identiek aan het alleen serveren van MiniCPM5-2B, waardoor de draft puur een latentiespel is. Met sampling ingeschakeld gebruikt SGLang's DSpark standaard alleen sampling van het doelmodel, met optionele rejection sampling. OpenBMB documenteert ook het gewoon laden via Transformers (transformers ≥ 5.6) en het op zichzelf serveren van het doelmodel met vLLM ≥ 0.21, plus een minicpm5-parser voor tool-calls voor agentische workloads; het speculatieve DSPARK-pad is specifiek van SGLang.
De hardware-rekenkunde is het echte verhaal voor een edge-klasse paar: ongeveer 5GB voor MiniCPM5-2B in BF16 plus ruwweg 0,65GB voor de draft. De combinatie van draft en doelmodel past comfortabel overal waar het 2B-model alleen al levensvatbaar was, wat de hele reden is om een zo kleine draft uit te brengen in plaats van een tweede, groter model.
Wat is niet bevestigd
• We konden geen aankondiging vinden — geen OpenBMB- of ModelBest-blog, geen social media-bericht in het Engels of Chinees. De typering 'stilletjes uitgebracht' is letterlijk, en de enige publieke verschijningsvorm is de Hugging Face-collectie.
• Geen onafhankelijke evaluatie. De acceptatielengtes uit het concept en het suitegemiddelde van MiniCPM5-2B (53,9) zijn door de leverancier gerapporteerd en niet gereproduceerd; de AA-gemarkeerde cellen zijn van derden, maar zijn momentopnamewaarden, geen runs van deze exacte gewichten.
• Er is nergens een gehoste API te vinden, dus adoptie betekent vandaag dat je de checkpoints zelf draait. Een ModelScope-spiegel, beloofd in de berichtgeving van juli over de onthulling, was op het moment van schrijven niet zichtbaar.
Voor het DSPARK-paar is geen versnellingsgetal op basis van de kloktijd gepubliceerd. Een acceptatielengte van 5,52 is een sterke hitrate, maar "hoeveel keer sneller" op een bepaalde GPU is precies het getal dat OpenBMB niet publiceerde.
• De bovengenoemde dubbelzinnigheid over het contextvenster: het marketingmateriaal sprak over 512K, de meegeleverde configuratie vermeldt 131.072, en niets in de repositories overbrugt de kloof tussen beide.
Waar een stille open-weight-release past in een stack
{{1}}De eerlijke lezing van MiniCPM5-2B vandaag is dat het een gok is: sterke leverancierscijfers, nul onafhankelijke runs, geen serving-geschiedenis, en een draftmodel waarvan de versnelling in de praktijk niet is gemeten.{{/1}} {{2}}Dat is precies de situatie waarvoor een routinglaag bestaat.{{/2}} {{3}}Een team dat wil testen of de output van een klein open model een gehost model dat het al aanroept kan vervangen, kan die vergelijking vanuit één API draaien — OrcaRouter fungeert als front-end voor 200+ gehoste modellen tegen de lijstprijs van de provider, zonder opslag, dus het opzetten van een evaluatieweek kost niets, en automatische failover betekent dat een checkpoint van een paar dagen oud nooit een productiepad gegijzeld hoeft te houden terwijl het zichzelf bewijst.{{/3}} {{4}}Niets daarvan vereist dat MiniCPM5-2B ergens wordt gehost; het is het vangnet rond de modellen waar je al afhankelijk van bent, terwijl je beslist of een zelf gehoste 2B de GPU waard is.{{/4}}
Let op, in volgorde van belangrijkheid: een onafhankelijke SGLang DSPARK-run die echte tokens per seconde rapporteert voor het paar, want acceptatielengte is een proxy en geen benchmark; een formele aankondiging of een ModelScope-mirror die bevestigt dat de release definitief is; en een hostingprovider die MiniCPM5-2B oppikt — als dat gebeurt, is de prijs die u aan onze kant betaalt de eigen lijstprijs van de provider, op dezelfde dag, want dat is wat doorberekening betekent. Ondertussen is het draftmodel het interessantere artefact van de twee. Een proposer met vijf lagen, waarvan de target vijf en een halve van de zeven tokens accepteert, is het verschil tussen een klein edge-model dat klein aanvoelt en een dat aanvoelt als een groter model dat op hetzelfde apparaat draait.
