
MiniCPM5-2B jämfört med Qwen 3 8B: Bör en 8B-arbetsbelastning flyttas ner till en 2.5B?
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Varje modelljämförelse döljer en hårdvarufråga, och MiniCPM5-2B mot Qwen 3 8B är den frågan klädd i en benchmarkkostym. Qwen 3 8B är Alibabas arbetshäst med öppna vikter från april 2025 – med ungefär 8,2B täta parametrar, 119 språk, hybridtänkande på eller av per förfrågan och sexton månader av communitybevis bakom sig. MiniCPM5-2B är modellen som ModelBest och OpenBMB presenterade på World Artificial Intelligence Conference den 19 juli som den högst rankade sub-4B-modellen på Artificial Analysis leaderboard, och vars öppna vikter tyst släpptes på Hugging Face den 6 och 7 september. Frågan som faktiskt för dem samman på samma sida är den som de flesta team som kör en öppen 8B någon gång ställer sig: skulle den arbetsbelastning jag servar på en 8B kunna flyttas ner till en 2,5B – och om den kunde det, vad skulle jag ge upp?
Det korta svaret är: ännu inte för de flesta arbetsbelastningar, men skälen är snävare än vad den fyrdubbla skillnaden i modellstorlek antyder, och det finns en typ av driftsättning där 8B-modellen inte har något svar alls. Alla kvantitativa uppgifter nedan är leverantörsrapporterade och märkta som sådana: MiniCPM5-2B:s siffror är ModelBests egna modellkortspåståenden – en vecka gamla och inte reproducerade av någon utanför labbet – medan Qwen 3 8B:s är Alibabas och för länge sedan har granskats, kvantiserats och körts om av en stor community. Den bevisasymmetrin är den verkliga huvudnyheten i den här jämförelsen.
Sexton månader med Qwen 3 8B
Qwen 3 8B tillhör samma arkitekturfamilj, är tre gånger så stor och sexton månader äldre än sin motståndare. Den är en tät kausal transformer med grouped-query attention, förtränad på en flerspråkig korpus på cirka 36 biljoner tokens, Apache-2.0-licensierad och en av de mest självhostade och driftsatta 8B-modellerna i open-weights-världen. Dess signum är Qwen3:s hybrida resonemangsläge – tankeläge på eller av per förfrågan – som gör att en enda driftsättning kan ge snabba svar på enkla frågor och växla till en genomtänkt tankekedja för matematik eller kod. Den har inbyggt stöd för Model Context Protocol och funktionsanrop, ett nativt kontextfönster på 32K som Alibaba validerar upp till 131K via YaRN-skalning, samt täckning för 119 språk och dialekter. Efter sexton månader är dess felscenarier väldokumenterade, dess kvantiseringar finns överallt och serveringsstacken kring den – vLLM, SGLang, llama.cpp, tusen finjusteringar – är mogen. Vid praktisk kvantisering ligger modellen i det låga gigabyteområdet, bekvämt på ett enda mellanklass-GPU, men inte på en telefon.

Vad MiniCPM5-2B hävdar in i den världen
MiniCPM5-2B kommer från motsatt håll: medvetet liten, agentisk genom träning. Den är en tät transformer med totalt 2,52 miljarder parametrar (1,98 miljarder icke-embedding-parametrar), 42 lager med hidden size 2048, grouped-query attention, en standardarkitektur för LlamaForCausalLM utan anpassade kernels, och ett kontextfönster på 131 072 token i den levererade konfigurationen (julilanseringsmaterialet annonserade 512K; den släppta konfigurationen innehåller inte det). Medan Qwen 3 8B får sin bredd från en flerspråkig förträningskörning på 36 biljoner token, får MiniCPM5-2B sin form från post-träning: SFT på 400 miljarder token av data med djup eftertanke, följt av On-Policy Distillation, som viker ihop sexton RL-expertmodeller – varav fem är agentiska – tillbaka till ett enda litet tätt nätverk. Lanseringsbudskapet var en agentbas på enheten: nativt verktygsanrop via XML-liknande anrop, dag-noll-anpassning över nio chipfamiljer plus ARM samt hybrida snabba/eftertänksamma lägen – och modellkortet hävdar ett internt genomsnitt på 53,9 på sin leverantörsvalda jämförelseuppsättning i klassen 2B–4B, ett AIME 2025/2026-resultat på 86,5 och ett av leverantören utfört 46,4 på SWE-bench Verified, vilket vore anmärkningsvärt för en 2,5B-modell om det överlever oberoende testning.

Avvikelsen, dimension för dimension
• Släpp — MiniCPM5-2B: tillkännagavs den 19 juli 2026; vikterna släpps 6–7 september. Qwen 3 8B: tillkännagavs i april 2025.
• Storlek — MiniCPM5-2B: 2,52B totalt / 1,98B icke-embedding, tät. Qwen 3 8B: ~8,2B, tät.
• Kontext — MiniCPM5-2B: 131 072 tokens i den levererade konfigurationen. Qwen 3 8B: 32K inbyggt, 131K validerat via YaRN.
• Språk — MiniCPM5-2B: centrerad kring engelska och kinesiska. Qwen 3 8B: 119 språk och dialekter.
• Resonemang — MiniCPM5-2B: hybrida snabba/eftertänksamma lägen, enligt lanseringsmaterialet. Qwen 3 8B: Qwen3-tänkande på eller av per begäran.
• Bevis — MiniCPM5-2B: leverantörskort, ingen oberoende körning. Qwen 3 8B: Alibaba-rapporterad, sexton månader av community-reproduktion och driftsättning.

Resultattavlan ovan är en ärlig återgivning av skillnaden: kolumnerna skiljer sig åt i nästan allt utom den öppna Apache-2.0-licensen, och den enhetsklass du levererar till avgör vilken kolumn du över huvud taget tillåts välja.
Där 8B fortfarande vinner.
Går du ner en viktklass får du avstå tre konkreta saker. Språk först: Qwen 3 8B täcker 119 språk; MiniCPM5-2B:s modellkort och data är centrerade kring engelska och kinesiska, och ingen flerspråkig bredd görs anspråk på. För en produkt som betjänar en lång svans av språk är det en hård mur, inte en mjuk sådan. För det andra, bevis: sexton månader av communitytestning innebär att Qwen 3 8B:s beteende är känt och dess ekosystem finns överallt, medan MiniCPM5-2B är ett en vecka gammalt repo med ett overifierat kort – och dess rubriksiffror, om de inte överlever oberoende körningar, är precis den typ som tyst revideras. För det tredje, serveringsstacken: allt som redan pratar med Qwen 3 8B pratar med ett moget mål, medan en helt ny 2B-klass checkpoint innebär att man från grunden måste omvalidera kvantiseringar, serveringskonfigurationer och verktygsanropsbeteende. Inget av detta är skäl till att 2B inte kan vinna på ett specifikt riktmärke; det är skäl till att 8B är standardvalet med lägre risk där den passar.
Där en 2B är det enda svaret
Inget av det spelar någon roll i den enhetsklass där en 8B helt enkelt inte får plats. På en telefon, ett smart-cockpit-kort eller en liten edge-box med några gigabyte DRAM konkurrerar Qwen 3 8B inte med MiniCPM5-2B – den går inte att driftsätta i användbar hastighet överhuvudtaget. Det är hela anledningen till att 2B finns, och det är därför den ärliga beskrivningen av den här jämförelsen inte är "är 2B lika bra som 8B" utan "vilken av mina driftsättningar som bara kan betjänas av en av dessa två." Om du levererar on-device-agenter där minnesbussen skulle kvävas av åtta miljarder vikter, är MiniCPM5-2B ett av de mest aggressivt tränade alternativen i 2B-klassen som finns, och den enda frågan som är värd att ställa är om dess agentiska anspråk överlever din egen reproduktion. Om din arbetsbelastning redan körs på hårdvara som bär en 8B bekvämt, är storleksgapet i sig inte ett skäl att migrera – och evidensgapet talar emot det.
Om du funderar på att byta
Det säkra sättet att testa bytet är att behandla det som ett experiment, inte en migrering. Kör MiniCPM5-2B på din egen hårdvara, dirigera en del av den verkliga trafiken till den genom ett API med automatisk failover, och mät mot 8B med samma förfrågningar. Ett routningslager motiverar sin plats här, eftersom en veckogammal checkpoint kan fastna eller gå i loop utan att ta ner produktionen, och de listpriser leverantören sätter för de hostade modeller du jämför mot skickas vidare utan påslag. Vad du egentligen testar är tre saker: om 2B:ns noggrannhet håller på dina data, om dess latens på din enhetsklass överträffar 8B:ns på den hårdvara du annars skulle köpa, och om den engelsk-kinesiska språkprofilen täcker de användare du faktiskt har. Återskapa SWE-bench eller en del av ditt eget utvärderingsset först — de två timmar det tar är den billigaste försäkring denna jämförelse erbjuder.
Domen
Stanna kvar på Qwen 3 8B för allt som är flerspråkigt, allt som kräver sexton månaders känt beteende, eller alla arbetsbelastningar som redan körs på hårdvara som bär en 8B bekvämt. Testa MiniCPM5-2B på allvar endast om din målenhet inte alls kan bära 8B, eller om en 2.5B som håller jämna steg med agentiska och långkontextuppgifter skulle låta dig minska minne och strömförbrukning på hårdvara du redan skickar. Ledaren i rankingen under 4B är en genuin prestation och dess utgivning med öppna vikter gör den testbar redan idag; den är helt enkelt ännu inte, utifrån tillgängliga bevis, en anledning att pensionera en 8B-arbetshäst som redan förtjänat sin plats.
