
MiniCPM5-2B-DSpark: OpenBMB släpper tyst vikterna för MiniCPM5-2B med en utkastmodell byggd för hastighet
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
För sex veckor sedan var MiniCPM5-2B ett löfte. Den avtäcktes på WAIC-konferensen i Shanghai den 2026-07-19 som den sub-4B-modell som toppar Artificial Analysis Index, och åtföljdes av en färdplan som angav att öppna vikter skulle komma ”snart”. Snart kom den här veckan, utan någon pompa och ståt. Den 2026-09-06 laddade OpenBMB upp flaggskeppsrepositoryt MiniCPM5-2B till Hugging Face under en Apache-2.0-licens, och tjugoen minuter senare laddade man upp MiniCPM5-2B-DSpark – en utkastcheckpoint med 323,8 miljoner parametrar vars enda uppgift är att få MiniCPM5-2B att avkoda snabbare under den spekulativa avkodningsalgoritmen DSpark. En GPTQ-bygge följde den 2026-09-07. I skrivande stund finns det inget tillkännagivande, inget lanseringsinlägg och ingen ändringslogg som vi kunnat hitta; releasen dök upp genom att repositories tyst blev offentliga under ett elva dagar långt fönster.
Det här är en text om vad vi vet hittills, och inramningen spelar roll. MiniCPM5-2B-DSpark är inte en fristående chattbot eller en ny flaggskeppsmodell – det är en accelerator: en liten, snabb modell som föreslår tokens i förväg åt MiniCPM5-2B, som sedan verifierar dem parallellt. Den är oanvändbar utan sitt mål, och målet är det som gör den värd att uppmärksamma. OpenBMB:s utlovade släpp av MiniCPM5-2B med öppna vikter i juli finns nu faktiskt på Hugging Face, och den förslagsmodell som släpptes tillsammans med den är den mekanism som leverantören rekommenderar för att köra den i användbar hastighet. Allt som inte uttryckligen tillskrivs någon källa nedan är direkt hämtat från de två modellkorten och deras arkiv.
Vad som släpptes, och när
2B-familjen lanserades som ett rullande, oannonserat släpp, med de nyaste först:
• 2026-08-27 — MiniCPM5-2B-Base och MiniCPM5-2B-SFT dyker upp, de råa förtränade och övervakat finjusterade checkpoints.
• 2026-09-01 — MiniCPM5-2B-Midtrain, det agentiska mellanträningsstadiet.
• 2026-09-05 — MiniCPM5-2B-MLX och MiniCPM5-2B-GGUF, Apple-Silicon- och llama.cpp-formaten.
• 2026-09-06 — flaggskeppsrepot MiniCPM5-2B, och tjugoett minuter senare MiniCPM5-2B-DSpark.
• 2026-09-07 — MiniCPM5-2B-GPTQ, det kvantiserade serveringsformatet.
Alla bär Apache-2.0-licensen ModelBest använde för MiniCPM5-1B-familjen redan i maj, och de tidigare checkpointarna i sekvensen visar fortfarande i princip ingen community-signal – en handfull nedladdningar och gillanden vardera. Det är tecknet på ett pågående viktfrisläpp snarare än en samordnad lansering: artefakterna dyker upp i beroendeordning (bas och SFT först, kvantiserade och draft-format sist) utan att någon enskild dag fungerar som releasedatum.
Vad MiniCPM5-2B-DSpark faktiskt är
Spekulativ avkodning delar upp genereringen i en billig förslagsgivare och en dyr verifierare. En liten utkastmodell gissar flera av de nästkommande token; den stora modellen kontrollerar alla gissningar i ett enda framåtpass och accepterar dem som den instämmer i. När utkastet är väl kalibrerat får du den stora modellens utdata för en bråkdel av kostnaden, och när det är fel slösar du bara ett verifieringssteg. DSpark är ett specifikt recept för den idén, från en artikel postad 2026-07-06 (arXiv 2607.05147, ”Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation”). Två designval utmärker receptet: det kopplar samman en parallell utkastmodell som grundstomme med en lättviktig sekventiell modul så att token i ett föreslaget block beror på varandra snarare än att minska i noggrannhet mot blockets slut, och det storleksanpassar varje verifieringskörning per begäran utifrån konfidensskattningar och motorns genomströmning i stället för att alltid verifiera ett block med fast längd.
DSpark-draftmodellen som OpenBMB släppte är en femlagers Transformer med 323,8 miljoner parametrar i BF16 (cirka 648 MB). Den bygger på Qwen3-arkitekturfamiljen men har DSpark-specifika tillägg: en projektor som läser MiniCPM5-2B:s dolda tillstånd från fem av mållagren (1, 10, 20, 30 och 39), ett konfidenshuvud och ett litet Markov-huvud som modellerar nästa-token-fördelningen. Dess konfiguration föreslår ett block på sju token per framåtpass. Med ungefär en åttondel av MiniCPM5-2B:s 2,5 miljarder parametrar är den en av de minsta draftmodeller som släppts för en etablerad öppen checkpoint – vilket är hela poängen med en edge-orienterad modell, där draften måste vara tillräckligt resurssnål för att köra två modeller på en enhet fortfarande ska vara bättre än att köra en.

Repositoryt ovan utgör utkastmodellens hela publika yta: en README, en config, en enda safetensors-fil och ett modellkort vars träningsbeskrivning visar 1 959 525 sekvenser (7,05B token) som genererats av MiniCPM5-2B från promptar om allmänna ämnen, matematik och kod. Modellen tränades i sex epoker med ett kombinerat mål för korsentropi, L1 och konfidens. Checkpointen används inte på egen hand som en generativ modell.
Siffrorna som OpenBMB publicerade, ärligt märkta
Utkastmodellens kort rapporterar en siffra som spelar roll — acceptanslängd, det genomsnittliga antalet föreslagna tokens som målmodellen accepterar ur varje block om sju tokens. Utvärderingen kördes på MiniCPM5-2B-utdata inom tre domäner, vid upp till 4 096 genererade tokens:
• Matematik — 6.05 accepterade tokens i genomsnitt vid greedy (T=0); 4.61 vid sampling med T=1.0.
• Kod — 6,11 girig; 4,44 samplad.
• Allmänt — 4.16 girig; 3.10 samplat.
• Sammanlagd — 5.52 greedy; 4.05 samplad, av maximalt sju.
De siffrorna är leverantörsrapporterade från modellkortet och har inte oberoende reproducerats. De beskriver också förslagsmodellens träfffrekvens, inte en faktisk tidsvinst: hastighet är ett serveringsmått som beror på vad målmodellens verifieringspass kostar i förhållande till förslagsmodellens förslagspass, på batchbeläggningen och på DSpark:s konfidensschemaläggare som minskar verifieringslängden. OpenBMB publicerade inga tokens-per-sekund-siffror för paret. För en uppfattning om var metodens tak ligger rapporterar DSpark-artikeln 60–85 % snabbare generering per användare vid matchat genomflöde jämfört med MTP-1-baslinjen i DeepSeek:s live-serveringssystem — en användbar referenspunkt för vad algoritmen har gjort på andra håll, inte ett påstående om MiniCPM5-2B på din hårdvara.

Resultattavlan {{1}}ovan{{/1}} är {{2}}releasens eget specifikationsblad{{/2}}. Betrakta godkännandevärdet som {{3}}en preliminär träffgrad{{/3}}; {{4}}multiplikatorn för verklig genomströmning är vad en oberoende SGLang-körning fortfarande måste mäta{{/4}}.
Modellen som utkastet accelererar
MiniCPM5-2B är en tät transformer med 2,5 miljarder parametrar — totalt 2 516 756 480 — med 42 lager, 16 query-heads och 2 KV-heads, ett ordförråd på 130 560 tokens och ett kontextfönster på 131 072 tokens, i BF16 på cirka 5 GB. Arkitekturellt sett är den medvetet tråkig: en standard LlamaForCausalLM utan anpassade kernels och utan fork av modellkoden, vilket är precis anledningen till att den går att porta mellan så många körtider och chiparkitekturer. På OpenBMB:s egen interna benchmark-svit ger modellkortet den 53,9 i snitt över resonemang, instruktionsföljning, kunskap, lång kontext, verktygsanvändning, kodning och sökagentuppgifter — före Qwen3.5-4B på 51,1 och granite-4.2-3B på 42,7 i samma tabell, där flera celler (GPQA-Diamond 70,2, HLE 8,9 samt diverse rader för lång kontext och agentiska uppgifter) är flaggade som hämtade från Artificial Analysis i stället för internt återskapade. De viktigaste per-uppgift-cellerna inkluderar MATH-500 på 94,6, AIME 2025 och 2026 på 86,5, IFEval på 86,7, MMLU-Pro på 70,8 och SWE-bench Verified på 46,4. Det här är leverantörens siffror på leverantörens egen svit, och modellkortet anger uttryckligen att vissa rader kommer från tredje part; behandla blandningen därefter.

Vid avtäckningen i juli hänvisade ModelBests lanseringsmaterial till ett Artificial Analysis-index på 17 – först bland modeller under 4B parametrar – och bevakningen i juli nämnde ett fönster på 512K-token. De checkpoints som faktiskt levererades konfigurerar 131 072 tokens kontext. När en marknadsföringssiffra från lanseringsdagen och en levererad konfiguration inte stämmer överens är konfigurationen den siffra som avgör vad du kan köra, och gapet är värt att känna till innan du planerar en arbetsbelastning med lång kontext kring marknadsföringssiffran.
Kör MiniCPM5-2B med dess draft
Den avsedda vägen är SGLang, som har stöd för DSpark-algoritmen upstream sedan v0.5.16 — versionsgolvet som modellkortet kräver. Hela serveringskommandot från kortet:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
Vid girig avkodning (T=0) är DSpark-verifieringen förlustfri: utdata är identisk med att betjäna MiniCPM5-2B helt på egen hand, vilket gör att utkastmodellen är en ren fråga om latens. Med sampling aktiverad är standardbeteendet i SGLang:s DSpark att endast sampla från målmodellen, med valfri rejection sampling. OpenBMB dokumenterar även vanlig Transformers-inläsning (transformers ≥ 5.6) och fristående betjäning av målmodellen med vLLM ≥ 0.21, samt en minicpm5-parser för verktygsanrop för agentiska arbetsbelastningar; den spekulativa DSPARK-sökvägen är specifikt SGLang:s.
Hårdvaruaritmetiken är den verkliga historien för ett edge-klasspar: cirka 5 GB för MiniCPM5-2B i BF16 plus ungefär 0,65 GB för draftmodellen. Kombinationen av draft och målmodell ryms bekvämt överallt där enbart 2B-modellen redan var gångbar, vilket är hela anledningen till att leverera en så här liten draft snarare än en andra, större modell.
Vad som inte är bekräftat
• Vi har inte kunnat hitta något tillkännagivande — inget blogginlägg från OpenBMB eller ModelBest, inget socialt inlägg på engelska eller kinesiska. Att det "släpptes i tysthet" är bokstavligen sant, och det enda offentliga är Hugging Face-samlingen.
• Ingen oberoende utvärdering. Utkastets accepteringslängder och MiniCPM5-2B:s genomsnitt på 53,9 för sviten är leverantörsrapporterade och ej reproducerade; de AA-märkta cellerna är från tredje part men ögonblicksvärden, inte körningar av dessa exakta vikter.
• Vi kan inte hitta någon värdbaserad API någonstans, så införande idag innebär att du kör checkpoints själv. En ModelScope-spegel, som utlovades i juli-täckningen av avtäckningen, syntes inte när detta skrevs.
• Ingen siffra för snabbning i verklig tid (väggklocka) för DSPARK-paret. Acceptanslängden 5,52 ger en stark träfffrekvens, men "hur många gånger snabbare" på en given GPU är exakt den siffra som OpenBMB inte publicerade.
• Tvetydigheten kring kontextfönstret ovan: marknadsföringsmaterialet angav 512K, den levererade konfigurationen anger 131,072, och ingenting i repona överbryggar de två.
Var en lågmäld open-weight-releas passar in i en stack
Den ärliga läsningen av MiniCPM5-2B i dag är att den är ett vad: starka leverantörssiffror, noll oberoende körningar, ingen serveringshistorik och en draftmodell vars verkliga hastighetsökning i praktiken inte har uppmätts. Det är precis den situation som ett routningslager finns till för. Ett team som vill testa om en liten öppen modells utdata kan ersätta en värdbaserad modell som de redan anropar kan genomföra den jämförelsen via ett enda API — OrcaRouter förmedlar över 200 värdbaserade modeller till leverantörens listpris utan påslag, så en utvärderingsvecka kostar ingenting att sätta upp, och automatisk failover innebär att en checkpoint som är några dagar gammal aldrig behöver hålla en produktionsväg som gisslan medan den bevisar sitt värde. Inget av detta kräver att MiniCPM5-2B är värdbaserad någonstans; det är säkerhetsnätet kring de modeller du redan är beroende av medan du beslutar om en självvärd 2B är värd GPU:n.
Titta, i prioritetsordning: en oberoende SGLang DSPARK-körning som rapporterar verkliga tokens per sekund för paret, eftersom acceptanslängd är en proxy snarare än ett riktmärke; ett formellt tillkännagivande eller en ModelScope-spegel som bekräftar att releasen är slutgiltig; och en webbhotellleverantör som tar upp MiniCPM5-2B — om någon gör det, är priset du betalar hos oss leverantörens eget listpris, samma dag, eftersom det är vad pass-through innebär. Under tiden är draftmodellen den mer intressanta artefakten av de två. En föreslående modell med fem lager som målet accepterar fem och en halv token av sju är skillnaden mellan en liten kantmodell som känns liten och en som känns som en större modell som körs på samma enhet.
