En hero-titelruta för jämförelsen 'MiniCPM5-2B-DSpark vs Qwen3-8B' med underrubriken 'Den nya 2,5B-stacken på enheten vs arbetshästen med öppna vikter', som visar en telefonkontur till vänster med ett litet chip märkt '2,5B + utkast' och en serverrack till höger märkt '8B arbetshäst', med en minnesbandbreddsmätare mellan dem och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

MiniCPM5-2B-DSpark mot Qwen3-8B: Den nya 2,5B-stacken för lokal körning mot arbetshästen med öppna vikter

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Varje modelljämförelse döljer en hårdvarufråga, och MiniCPM5-2B-DSpark mot Qwen3-8B är den frågan klädd i en benchmarkkostym. Qwen3-8B är Alibabas arbetshäst med öppna vikter från april 2025 – cirka 8,2 miljarder täta parametrar, 119 språk, 32K inbyggd kontext som kan utökas till 131K, hybrida tankelägen och sexton månaders community-bevis bakom sig. MiniCPM5-2B-DSpark är ingen fristående modell att ställa bredvid den: det är DSpark-utkastcheckpunkten med 323,8 miljoner parametrar som OpenBMB tyst lade upp på Hugging Face den 6 september 2026 för att accelerera MiniCPM5-2B, den täta 2,52-miljardersmodellen för enheter som ModelBest tillkännagav på WAIC den 19 juli 2026. Sätter man ihop paret dyker den verkliga frågan upp: borde arbetsbelastningen som nu körs på en 8B köras på hårdvara som bara klarar en 2B – och är en 2,5B med ett gratis utkast tillräckligt bra för att motivera bytet?

Det korta svaret är ännu inte för de flesta arbetsbelastningar, men orsakerna är snävare än vad storleksgapet antyder, och det finns en klass av driftsättning där 8B inte har något svar alls. Allt kvantitativt i denna text är leverantörsrapporterat — MiniCPM:s siffror är ModelBest:s egna, oefterprövade; Qwen3-8B:s är Alibaba:s, länge exponerade för gemenskapsanvändning — så etiketterna spelar större roll än siffrorna.

Två modeller på olika platser på minneskurvan

MiniCPM5-2B är en tät kausal Transformer på en tredjedel av en 8B:s storlek — 42 lager, grouped-query attention, Apache-2.0 — byggd för den klass av enheter en stor modell inte når: telefoner, smarta cockpits och små edge-lådor där minnesbussen skulle kvävas av åtta miljarder vikter. Lanseringsmaterialet betonar agentiskt arbete och lång kontext snarare än rå bredd: 128K inbyggd kontext, och ModelBests påstående att modellen på dess egen utvärderingssvit i genomsnitt får 53,9 — 2B-klassens open-source-SOTA, enligt leverantören, inklusive en leverantörskörd 46,4 på SWE-bench Verified, vilket vore anmärkningsvärt för en 2B om det överlever oberoende testning. DSpark-utkastet är genomströmningssvaret på den självklara invändningen att en liten tät modell är snabb att ladda men långsam att generera, eftersom varje token drar sina vikter över minnesbussen. Utkastet föreslår upp till sju tokenar åt gången för målet att verifiera, och repot rapporterar en girig acceptans på 5,52 tokenar per verifieringssteg i genomsnitt — 6,11 på kod. Den siffran är utkastets kvalitet; dess snabbhetsökning är ännu inte mätt, och ingen siffra för tokenar per sekund har publicerats.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Openbmb/MiniCPM5-2B-DSpark-kortet ovan är hela den offentliga ytan av den tysta releasen den 6 september: ett serveringstillbehör som rapporterar acceptanslängd, utan tillkännagivande och utan faktisk tidsvinst.

Qwen3-8B tillhör samma arkitekturfamilj, men är tre gånger så stor och sexton månader äldre. Den är en tät kausal Transformer med grouped-query attention, tränad på ett flerspråkigt korpus på 36 biljoner token, Apache-2.0-licensierad och en av de mest självhostade och serverade 8B-modellerna bland modeller med öppna vikter. Dess signum är Qwen3:s hybrida resonemangsläge – tänkande på eller av per förfrågan – och profilen är medvetet bred: MMLU i de höga 70-talen, starka resultat i GSM8K och kodning, 119 språk. Den kräver ett riktigt GPU-kort eller en rejäl edge-enhet: vid praktisk kvantisering ligger den i de låga gigabyten – bekvämt på ett enda mellanklasskort, men inte på en telefon.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

Alibabas modellkort för Qwen3-8B ovan är den etablerade aktörens ansikte: sexton månader av dokumenterat, community-testat beteende på 119 språk.

Där 8B fortfarande vinner.

Går du ner en viktklass får du ge upp tre konkreta saker. Språk först: Qwen3-8B täcker 119 språk; MiniCPM5-2B:s modellkort och dataset är centrerade på engelska och kinesiska, och ingen flerspråkig bredd görs anspråk på. För en produkt som betjänar en lång svans av språk är det en hård vägg, inte en mjuk. För det andra: bevis. Qwen3-8B:s siffror har granskats, kvantiserats, finjusterats och drivits i stor skala i sexton månader; dess felmoder är kända, dess kvantiseringar finns, dess ekosystem finns överallt. MiniCPM5-2B är en release från juli 2026 med en leverantörsstyrd resultattavla och ingen oberoende reproduktion, och utkastet är en dag gammalt. För det tredje: serving-stacken. Allt som redan talar med Qwen3-8B – vLLM, SGLang, llama.cpp, tusen finjusteringar – talar med ett moget mål, medan MiniCPM-utkastet kräver en motor för spekulativ avkodning (SGLang:s DSPARK-algoritm) som repot dokumenterar men det bredare ekosystemet ännu inte har absorberat.

Där 2B-stacken är det enda alternativet.

Inget av detta har någon betydelse i den enhetsklass där en 8B helt enkelt inte får plats. På en telefon eller ett edge-kort med några gigabyte DRAM konkurrerar Qwen3-8B inte med MiniCPM5-2B — den går inte att driftsätta i användbar hastighet över huvud taget. Det är hela anledningen till att 2B-stacken finns, och det är därför draften är den bärande delen av den här releasen snarare än en garnering. Spekulativ avkodning är som mest effektiv just i det täta, minnesbundna läge som en liten modell på liten kisel lever i: en kompakt draftmodell föreslår ett block, målmodellen verifierar det i ett enda pass, och kostnaden för att ladda vikterna betalas en gång per block i stället för en gång per token. DSpark-metoden med ursprung i DeepSeek (arXiv 2607.05147) utformades för servingsystem med hög samtidighet, men dess mekanik — och acceptanssiffrorna i det här repot — är den relevanta hävstången för en 2B som måste kännas interaktiv på begränsad hårdvara. Ha bara den ärliga reservationen i åtanke: OpenBMB mätte draftens acceptansgrad, inte dess hastighetsvinst, så den faktiska vinsten i tokens per sekund på din målenhet är fortfarande din uppgift att mäta.

Resultattavlan, ärligt märkt.

Släpp — MiniCPM5-2B: 19 juli 2026 (tillkännagiven); MiniCPM5-2B-DSpark: 6 september 2026, tyst. Qwen3-8B: april 2025, tillkännagiven.

• Storlek — MiniCPM5-2B: 2,52B parametrar (dense), plus en 324M-draftmodell. Qwen3-8B: ~8,2B parametrar (dense).

• Kontext — MiniCPM5-2B: 128K nativt. Qwen3-8B: 32K nativt, 131K via YaRN.

• Språk — MiniCPM5-2B: engelska/kinesiska-centrerad. Qwen3-8B: 119.

• Resonemang — MiniCPM5-2B: hybridlägen snabb/eftertänksam enligt lanseringsmaterialet. Qwen3-8B: tänkande på eller av per begäran.

• Bevis — MiniCPM-siffrorna är påståenden från ModelBests modellkort (i genomsnitt 53,9 på ModelBests egen testsvit; ingen oberoende körning). Qwen3-8B-siffrorna är rapporterade av Alibaba, och communityn har i sexton månader kunnat granska dem.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

Resultattavlan ovan är en ärlig återgivning av skillnaden: kolumnerna skiljer sig åt i nästan allt utom den öppna Apache-2.0-licensen, och den enhetsklass du levererar till avgör vilken kolumn du över huvud taget tillåts välja.

Routingens verklighet

Ingen av modellerna finns idag i en hostad katalog på OrcaRouter, så den här jämförelsen sker helt och hållet i den självhostade världen — men det är just där ett routningslager fortfarande gör skäl för sig. Qwen3-8B tillhandahålls av sin leverantör och flera tredjepartsplattformar; MiniCPM5-2B och dess draft är något du kör själv. När ett team vill testa om en 2.5B-stack kan bära en del av en 8B-arbetsbelastning, är det reversibla draget att peka en testväg mot en självhostad MiniCPM5-2B-plus-draft SGLang-build via ett API med automatisk failover — produktionen ligger kvar på den nuvarande modellen, den nya stacken kan stanna utan att ta ner något, och leverantörernas listpriser för hela jämförelsen skickas vidare utan påslag, så A/B-testet är billigt och reversibelt snarare än en chansning. Lagret hostar inte någon av modellerna; det gör experimentet säkert att köra.

Vem ska flytta, och vem ska vänta

Stanna kvar på Qwen3-8B för allt flerspråkigt, allt som behöver sexton månaders kända beteenden, eller alla arbetsbelastningar som redan körs på hårdvara som bekvämt bär en 8B — storleksskillnaden är inte ett skäl att migrera, och bevisluckan talar emot det. Testa på allvar MiniCPM5-2B-stacken med sin DSpark-draft endast om din målenhet inte alls kan bära 8B, eller om en 2,5B som håller jämna steg i agentiska och långkontextuella arbetsuppgifter skulle låta dig minska minne och strömförbrukning på hårdvara du redan levererar. Och innan du förbinder dig till draften, kör mätningen som OpenBMB inte publicerade: acceptanslängd är inte latens, och vinsten i tokener per sekund på din enhet är siffran som faktiskt avgör om den stillsamma lilla checkpointen på Hugging Face var värd nedladdningen.