Ett hero-titelkort för artikeln 'MiniCPM5-2B Weights Are Live', med undertexten 'The model that claimed the sub-4B crown quietly went open-source', tre chips med texten 'Apache-2.0', '2.5B params · 128K context' och 'AA Index 17 — #1 sub-4B at launch', samt ett toppband 'OPEN WEIGHTS · SEPT 2026'.
Guides & Insights

MiniCPM5-2B-vikterna är live: den lilla modellen som tog hem Sub-4B-kronan blir öppen källkod

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Själva modellen är sju veckor gammal. MiniCPM5-2B presenterades den 19 juli på World Artificial Intelligence Conference 2026, där ModelBest och OpenBMB kallade den för den högst rankade modellen under 4B parametrar på Artificial Analysis topplista och lovade att vikterna skulle komma "inom en snar framtid". Det som hände i helgen är att den nära framtiden infann sig utan något lanseringsståhej: MiniCPM5-2B:s repository publicerades på Hugging Face den 6 september, och OpenBMB:s ändringslogg anger lanseringen till den 7 september, under en Apache-2.0-licens, med hela paketet — BF16-vikter, GGUF-, MLX- och GPTQ-kvantiseringar, bas- och SFT-checkpoints, en DSpark-utkastsmodell för spekulativ avkodning och träningsdataseten bakom dem.

Inget pressmeddelande åtföljde det och inget lanseringsevent hölls. Det bara dök upp: en Hugging Face-repo ena dagen, en changelog-rad nästa. Det gör det här till en text om vad vi vet hittills — med en tidig uppdatering. Repon berättar en hel del: modellen är faktiskt nedladdningsbar och körbar redan idag, och specifikationen är offentlig. Och ett externt resultat har redan kommit in: Artificial Analysis listar MiniCPM5-2B på sitt Intelligence Index v4.2 med 15 poäng — det bästa resultatet med öppna vikter under 4B totala parametrar på det indexet — så rankingen bland modeller under 4B vilar inte längre enbart på leverantörens ord. Det som ännu inte är bekräftat är modellkortets huvudsiffror, som OpenBMB reproducerade i sin egen testmiljö och som ingen utanför labbet har kört om. Här är vad repon visar, vad som nu har mätts oberoende och vad som fortfarande behöver verifieras innan du bygger vidare på det.

Vad hände nyss?

MiniCPM5-2B är den andra modellen i MiniCPM5-serien, efter MiniCPM5-1B, som OpenBMB släppte som öppen källkod den 19 maj. När 2B lanserades som produkt på WAIC handlade historien lika mycket om chips som om modellen – ModelBest beskrev den som en agentbas på enheten för telefoner, datorer och smarta cockpits, och namngav nio chips med stöd från dag ett genom sin FlagOS-gemenskap, från Huawei Ascend till NVIDIA till en rad inhemska acceleratorer. Publiceringen som öppen källkod beskrevs som nära förestående. Sju veckor passerade.

Den 6 september dök openbmb/MiniCPM5-2B-repot upp. I skrivande stund är modellkortet utgivningsmeddelandet, och det är ovanligt komplett för en tyst release:

• Vikter — den slutliga RL + OPD-posttränade checkpointen i BF16, licensierad under Apache-2.0 och inte åtkomstbegränsad — vem som helst kan ladda ner den.

• Medföljande checkpoints — MiniCPM5-2B-SFT, -Midtrain och -Base för dem som vill ha modellen före RL/OPD, plus -GGUF, -MLX, -GPTQ och en -DSpark-utkastmodell, alla listade i MiniCPM5-samlingen på Hugging Face.

• Data — träningskorpusarna är också öppna, utgivna som en del av UltraData-familjen: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 och UltraData-RL-2609.

• Speglar — README:n pekar på både Hugging Face och ModelScope.

En rad i kortet betyder mer än den verkar: "inga anpassade kärnor, ingen fork av modellkoden." MiniCPM5-2B använder standardarkitekturen LlamaForCausalLM, så vilken motor som helst som redan betjänar Llama-familjens modeller kan ladda den utan att vänta på en skräddarsydd implementation.

Varför en 2.5B-modell är värd en andra titt

WAIC-pitchen var en ranking-pitch. ModelBest sade att MiniCPM5-2B fick ett Artificial Analysis Intelligence Index på 17, vilket placerade den först bland modeller under 4B parametrar på AA-ledarlistan vid lanseringen. Två förbehåll hör hemma intill den siffran. För det första är indexpoäng endast jämförbara inom en metodikversion: MiniCPM5-1B:s tidigare 17,9 kom från en tidigare AA-ögonblicksbild, så det är inget bevis för att den mindre modellen ”får högre poäng”, och enligt samma regel är en nyare poäng på en nyare metodik inte en regression. För det andra matar AA:s siffror modelkortet, men kortets rubrikgenomsnitt är OpenBMB:s eget, framtaget i OpenBMB:s egen testmiljö. Den distinktionen är viktig eftersom AA sedan dess har gått över till en nyare metodik och publicerat ett färskt resultat – den första externa kontrollen av pitchen sedan open-weights-släppet.

Ett externt mätresultat anlände samma vecka som vikterna. Den 4 september släppte Artificial Analysis Intelligence Index v4.2, en metodrevision som höjer vikten för privata, undanhållna tester till 40 % och lägger till två nya komponenter — AA-Briefcase, en agentisk utvärdering, och Surge's GDP.pdf, en uppgift som kräver resonemang över långa dokument. AAs indexpost för MiniCPM5-2B har nu ett v4.2-resultat på 15: bäst bland modeller med öppna vikter under 4B totala parametrar, och först av de 47 öppna modellerna i den storleksklassen på AAs lista. Det håller fast modellen där julipitchen placerade den, denna gång med en metod som är svårare att manipulera och med vikter som vem som helst kan ladda ner och kontrollera. 15 är inte jämförbart med lanseringssiffran 17, som kom från v4.1 — metoden är striktare, inte modellen svagare — och sammansättningen verifierar inte modellkortets enskilda rader, varav de flesta OpenBMB reproducerade i sin egen testmiljö. Det den gör är att träffa de två axlar som OpenBMB säger att modellen optimerats för: v4.2 betonar agentiska uppgifter mer, och AAs mätning av mångordighet visar att MiniCPM5-2B genererar 57M utdatatoken över indexuppgifterna — den mest koncisa modellen i sin klass mot en median på 72M. OpenBMB tackade AA för körningen och beskrev det i exakt dessa termer — agentisk prestanda och tokeneffektivitet vid 2.6B, sade man, är vad modellen optimerades för.

Kärnpåståendet gällde agentisk förmåga i ett litet format: inbyggt verktygsanrop, djup sökning och kodgenerering, inlärt från grunden snarare än påklistrat i efterhand. Modellkortet beskriver en pipeline i tre steg: grundträning, mellanträning och därefter efterträning med SFT på 400 miljarder tokens data för djupt tänkande, specialiserade RL-lärare och On-Policy Distillation (OPD), som slår samman sexton RL-expermodeller, varav fem är agentiska, till ett enda litet tätt nätverk. OpenBMB tillskriver RL + OPD-steget en genomsnittlig förbättring på 10,96 poäng på resonemangs- och generella uppgifter och 6,96 poäng på agentiska uppgifter – interna deltan, men de förklarar den ovanliga formen hos den här modellen: ett nätverk med 2,5 miljarder parametrar, byggt som en resonemangsmodell och riktat mot verktygsanvändning.

A single-column scoreboard for MiniCPM5-2B titled 'MiniCPM5-2B — the scoreboard', with rows 'Params: 2.52B total · 1.98B non-embedding', 'Architecture: dense Llama-style, 42 layers, GQA 16:2', 'Context: 131,072 tokens (config)', 'License: Apache-2.0, weights + data', 'AA Index: 17 — #1 sub-4B at launch (AA v4.1)' and 'SWE-bench Verified: 46.4 · vendor-reported', and a footer reading 'Params, architecture and context from the HF config; AA Index per Artificial Analysis; other benchmark figures are vendor-reported.'.

Vad repot faktiskt innehåller

Specifikationen är entydig, eftersom den är konfigurationsfilen. MiniCPM5-2B har 2 516 756 480 parametrar, varav 1 981 982 720 är icke-inbäddningsparametrar – det är den siffra som leverantörer syftar på när de säger ”2B-klass”. Det är en dense-transformer med 42 lager, en dold storlek på 2048, grupperad query-attention med 16 query-huvuden och endast 2 KV-huvuden, ett vokabulär på 130 560 samt BF16-tensorer. Hela modellen levereras som en enda safetensors-shard, tillräckligt liten för att laddas ner med en laptopuppkoppling och köras på ett enda grafikkort i mellanklassen eller en NPU i telefonklassen.

• Parametrar — 2 516 756 480 totalt; 1 981 982 720 icke-inbäddade.

• Arkitektur — tät LlamaForCausalLM, 42 lager, dold dimension 2048, GQA 16 query-huvuden / 2 KV-huvuden, vokabulär 130 560.

• Kontext — 131 072 token konfigurerade (max_position_embeddings), ingen RoPE-skalning i konfigurationen.

• Licens — Apache-2.0, för både modellen och den publicerade träningsdatan.

• Format — BF16; GGUF-, MLX- och GPTQ-varianter publiceras separat.

A screenshot of the Hugging Face page for openbmb/MiniCPM5-2B, showing the repository header with Transformers and Safetensors tags and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B' (captured September 7, 2026).

En siffra från julipresentationen dyker inte upp i kontrollpunkten. WAIC-materialet utlovade ett kontextfönster på 512K-token; den släppta konfigurationen sätter max_position_embeddings till 131 072 (128K) utan någon rope_scaling-post. Det är möjligt att 512K-siffran är tänkt att nås genom en förlängning vid inferenstillfället, på samma sätt som flera små modeller tänjer sitt kontextfönster — men som levererad dokumenterar repot 131 072, och det är den siffran man ska designa mot tills OpenBMB publicerar ett recept för förlängning.

Siffrorna, sorterade efter vem som mätte dem.

Modellkortet är noggrant med avseende på ursprung, och det lönar sig att läsa fotnoterna. De siffror som den markerar med en dolk ”kommer från den officiella Artificial Analysis-utgåvan” – rader som GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 och GDPval-AA v2 19.6. Allt annat beskrivs som ”reproducerat internt”, vilket innebär att OpenBMB körde dessa utvärderingar i sin egen testmiljö. I den kategorin ingår de uppseendeväckande siffrorna: ett internt genomsnitt på 53.9 över kortets jämförelseuppsättning, AIME 2025/2026 på 86.5, MATH-500 på 94.6, LiveCodeBench v6 på 69.1, SWE-bench Verified på 46.4, BFCL v4 på 66.6, τ²-Bench Telecom på 97.1, GAIA (Text-103) på 88.7 och MMLU-Pro på 70.8.

Tre saker gör att dessa siffror är ärliga att läsa. Genomsnittet på 53.9 är ett relativt resultat, inte ett absolut sådant – kortet normaliserar varje radaraxel så att den bästa modellen i jämförelsen får 100. Jämförelseuppsättningen är leverantörsvald: andra öppna modeller i 2B-4B-klassen, inklusive Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B och LFM2.5-8B-A1B. Inom den uppsättningen visar kortet att MiniCPM5-2B överträffar näst bästa, Qwen3.5-4B på 51.1 – ett verkligt slående resultat för en modell som är hälften så stor, och precis den typ av resultat som kräver en oberoende reproduktion innan någon bygger vidare på det. Och ett par av de enskilda raderna är svåra att förena med marknadsföringen: ett SWE-bench Verified på 46.4 från en 2.5B tät modell skulle vara anmärkningsvärt om det reproduceras, medan ett HLE på 8.9 påminner om att ”sub-4B-ledare” och ”frontier” är olika ligor. Inget av detta motsägs av repot, och AA:s v4.2-sammansättning har sedan bekräftat modellens övergripande placering i toppen av klassen för öppna vikter under 4B – men dessa specifika rader är OpenBMB:s egna, fortfarande overifierade av någon utanför labbet.

Kör MiniCPM5-2B idag

Eftersom arkitekturen är ren Llama, kan vanliga motorer ladda den direkt. OpenBMB:s README ger snabbstarter för vLLM (0.21 eller nyare), SGLang (0.5.16 eller nyare) och Transformers (5.6 eller nyare), med rekommenderad sampling vid temperatur 1.0 och top-p 0.95 samt enable_thinking aktiverad när du vill ha resonemangspasset. De tillhörande GGUF- och MLX-versionerna täcker llama.cpp, Ollama, LM Studio och Apple Silicon; modellkortet listar också ArcLight-runtime och de vanliga finjusteringsstackarna (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).

Två driftsättningsdetaljer är värda att känna till innan du börjar. För verktygs- och funktionsanrop är SGLang det rekommenderade backend-systemet: modellen genererar verktygsanrop i XML-stil, och SGLangs inbyggda minicpm5-parser konverterar dem direkt till OpenAI-kompatibla tool_calls, vilket innebär att vanliga klienter för verktygsanrop fungerar utan en anpassad shim. Och DSpark-draftmodellen finns för att göra resonemangspasset billigare: när den aktiveras i SGLang med DSPARK:s spekulativa avkodningsalgoritm påskyndar den avkodningen samtidigt som målmodellens utdata förblir oförändrade – typen av sak som avgör om en agentloop med 128K-kontext på en laptop är användbar eller bara möjlig.

A screenshot of the Hugging Face 'MiniCPM5' collection page (openbmb/minicpm5), headed 'SOTA on-device LLMs, small yet powerful', listing openbmb/MiniCPM5-2B and openbmb/MiniCPM5-1B alongside the series' companion repositories (captured September 7, 2026).

Om du hellre vill utvärdera en batch av små öppna modeller än att manuellt finjustera en enda, så gör routningslagret skäl för sig här: när en leverantör listar MiniCPM5-2B är en router det billiga sättet att A/B-testa den mot Qwen3.5-2B och de andra öppna checkpoints under 4B på samma uppgift utan en andra integration. På OrcaRouter innebär det ett enda API över 200+ modeller, leverantörens listpriser som vidareförmedlas utan påslag, samt automatisk failover om en helt ny checkpoint hänger sig eller loopar på en produktionsrutt. Repot är knappt två dagar gammalt och inget hostat API som vi kan peka på har listat MiniCPM5-2B ännu — så den ärliga standarden i dag är att behandla det som ett självhostat experiment, inte som ett beroende.

Vem ska dra dessa vikter?

Hämta dem idag om ditt arbete handlar om on-device-agenter, edge-verktygsanrop eller experiment med kodning och resonemang för små modeller, och du vill ha det mest aggressivt tränade alternativet i 2B-klassen på bordet. Apache-2.0-licensen och den öppna träningsdatan eliminerar de två skäl som får de flesta team att tveka inför en liten modell från ett kinesiskt labb — ingen begränsning för kommersiellt bruk och ingen svartlådekorpus. Hämta dem med försiktighet om du väljer en produktionsmodell enbart utifrån benchmarktabellen: modellkortets rubrikrader är OpenBMB:s egna reproduktioner, och AA:s v4.2-sammansättning — den enda oberoende mätningen hittills — går inte i god för dem. En 2,5B-modell som enligt uppgift slår Qwen3.5-4B är ett påstående som förtjänar de två timmar det tar att reproducera SWE-bench själv.

Vad du bör titta på härnäst. Repot är knappt två dagar gammalt, så de kortsiktiga signalerna är fortfarande mekaniska: om llama.cpp och Ollama-biblioteket plockar upp GGUF, om ModelScope-spegeln och FlagOS-chipbyggena går live smidigt, och om ett värdbaserat API listar MiniCPM5-2B – det är ögonblicket då det slutar vara enbart för självhostning. Den väsentliga signal som den här texten pekade på som saknad – en oberoende körning av Artificial Analysis eller ett universitetslaboratorium – har nu kommit i form av v4.2-indexresultatet, och det håller MiniCPM5-2B kvar som första bland open-weights-modeller under 4B. Det som fortfarande återstår är verifiering på radnivå: ingen utanför OpenBMB har reproducerat modellkortets interna siffror, framför allt SWE-bench Verified på 46,4 och det interna genomsnittet på 53,9. Tills de specifika raderna körs om, behandla MiniCPM5-2B som du skulle behandla vilken tyst släppt modell som helst med ett imponerande modellkort: som en mycket lovande hypotes du kan köra lokalt ikväll, och en modell vars mest slående siffror du bör verifiera innan du litar på den med riktigt arbete.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube