
MiniCPM5-2B vs Granite 4.2 3B: 3B-resonemangsspecialisten vs den nya 2.5B-agentstacken
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest placerade Granite 4.2 3B på MiniCPM5-2B:s egen resultattavla utan att någon bett om det. Modellkortet för MiniCPM5-2B som OpenBMB publicerade när vikterna tyst gjordes tillgängliga på Hugging Face listar IBM:s minsta resonemangsmodell bland sina jämförelsebaslinjer, och på den uppsättningen visar det MiniCPM5-2B med ett snitt på 53,9 mot Granite 4.2 3B:s 42,7. Det är den enda siffran från en direkt jämförelse som någon av leverantörerna publicerat för den här kombinationen, vilket gör den till det naturliga stället att börja – och det naturliga stället att vara försiktig. Båda modellerna är små, Apache-2.0-licensierade, självhostade open-weights-utgåvor som siktar på samma uppgift i slutet av 2026; de går bara till väga från motsatta håll – den ena tränad att resonera och den andra tränad att agera.
De två utgivningarna rimmar bättre med varandra än vad deras leverantörers marknadsföring antyder. MiniCPM5-2B presenterades vid World Artificial Intelligence Conference den 19 juli som ModelBest och OpenBMB:s flaggskepp för AI på enheten – en tät 2B-modell som marknadsförs som agentbas för telefoner, datorer och smarta cockpitar – och dess vikter dök upp den 6 och 7 september utan något lanseringsevenemang, under Apache-2.0, tillsammans med GGUF-, MLX-, GPTQ-, bas-, SFT- och draft-checkpoints och den träningsdata som ligger bakom dem. Granite 4.2 3B är IBM:s resonerande modell i laptopstorlek, vars vikter nådde Hugging Face i början av augusti och vars modellkort och tekniska blogginlägg publicerades den 25 augusti. Ingen av dem har ännu utvärderats i ett oberoende benchmark, vilket är anledningen till att källmärkningarna nedan väger tyngre än siffrorna.
Två releaser som rimmar
Granite 4.2 3B är en fristående tät resonemangsmodell, posttränad från Granite-4.1-3B-Base. Den har 40 lager med grouped-query attention, ett nativt kontextfönster på 128K som IBM utökar till 512K i en femte förträningsfas, och tre tankelägen per fråga – fullständigt tänkande som standard, ett läge med låg ansträngning och en väg utan tänkande. Dess modellkort är tydligt med vad den inte är: till skillnad från 8B- och 30B-syskonen i Granite 4.2-familjen hoppade 3B medvetet över det specialiserade agentiska förstärkningsinlärningsblocket som tränades i SWE-agent-, terminal- och sökmiljöer, så IBM listar inget SWE-bench-resultat och framställer modellen som en resonemangsspecialist snarare än en agent. Den kan serveras via vLLM, SGLang, Transformers, GGUF och Ollama (granite4.2:3b), körs på ungefär 6–8 GB i bfloat16 eller under 2 GB i kvantiserad form, och har inget värdbaserat API. Dess toppsiffror – AIME 2025 på 78,33, GPQA på 54,80, LiveCodeBench v6 på 69,71, MMLU-Pro på 67,84 – är rapporterade av IBM och i dagsläget inte oberoende reproducerade.

MiniCPM5-2B är istället en färdig agentorienterad modell. Modellkortet beskriver en tät transformer med totalt 2,52 miljarder parametrar (1,98 miljarder utan embeddingar), 42 lager med dold storlek 2048, grupperad query-uppmärksamhet med 16 queryhuvuden och två KV-huvuden, samt en standardarkitektur av typen LlamaForCausalLM utan anpassade kärnor. Lanseringsargumenten betonade agentisk förmåga — agent-mellanträning i 200-miljarderskala, en stor agent-SFT-uppsättning och RL-anpassning för agenter, avslutad med On-Policy Distillation som viker samman sexton RL-experttmodeller tillbaka till ett litet tätt nätverk — samt inbyggd lång kontext och hybrida snabba/eftertänksamma svarslägen. Den medföljande konfigurationen anger ett kontextfönster på 131 072 token (materialet från juli marknadsförde 512K; den släppta konfigurationen innehåller inte det), och modellkortet anger XML-liknande verktygsanrop med en inbyggd SGLang-parser. I sin egen utvärderingstabell rapporterar det ett internt genomsnitt på 53,9 över kortets leverantörsvalda jämförelseuppsättning, ett AIME 2025/2026-resultat på 86,5, MATH-500 på 94,6 och ett leverantörsuppmätt 46,4 på SWE-bench Verified — vilket vore anmärkningsvärt för en tät modell på 2,5B om det överlever oberoende testning.

Inbördesmötet som någon redan har skrivit ut.
Eftersom resultattavlor från olika leverantörer mestadels innebär att jämföra äpplen med päron, är den enskilt mest användbara artefakten i den här jämförelsen den som ModelBest själv har publicerat: MiniCPM5-2B:s kort listar granite-4.2-3B bland sina baslinjer och rapporterar att MiniCPM5-2B i genomsnitt når 53,9 mot Granites 42,7 i den sviten. Ta det för exakt vad det är — en leverantör som kör båda modellerna på en svit den själv valt, utan oberoende reproduktion, med alla incitament att gynna den egna modellen. Det är inget avgörande. Vad det däremot säger dig är att ModelBest var tillräckligt självsäkra för att ta med en konkurrents 3B-modell på sitt kort, och att gapet de gör anspråk på är störst precis där den egna träningen har investerat: i de agentiska och långkontext-raderna. Betrakta det som ett riktningsangivande påstående och väg in IBMs egna separata kortpåståenden innan du bestämmer något utifrån det.
Resultattavlan, ärligt märkt.
• Release — MiniCPM5-2B: tillkännagavs den 19 juli 2026; vikter släpps 6–7 september, tyst. Granite 4.2 3B: vikter i början av augusti; modellkort och teknisk blogg den 25 augusti 2026.
• Roll — MiniCPM5-2B: betoning på agent- och verktygsanvändning på enheten, enligt ModelBest. Granite 4.2 3B: resonemangsspecialist, avsiktligt icke-agentisk enligt IBM.
• Storlek — MiniCPM5-2B: 2,52B totalt / 1,98B exkl. embedding, 42 lager. Granite 4.2 3B: ~3B dense, 40 lager.
• Kontext — MiniCPM5-2B: 131 072 tokens i den levererade konfigurationen. Granite 4.2 3B: 128K nativt, utökas till 512K.
• Efterträning — MiniCPM5-2B: djupreflekterande SFT, specialiserad RL, On-Policy-distillation. Granite 4.2 3B: resonerande SFT, GRPO-RL och RLHF; inget agentiskt-RL-block.
{{1}}Bevis — MiniCPM5-2B: ModelBest-kortets påståenden, ingen oberoende körning. Granite 4.2 3B: IBM-kortets påståenden, ej återproducerade; AIME 2025 78,33, GPQA 54,80, LiveCodeBench v6 69,71.

Resultattavlan ovan har samma källa som brödtexten: varje siffra på den är leverantörsrapporterad, och den enda jämförelsen inom samma testsvit som någon av leverantörerna har publicerat är den på ModelBests eget kort.
Resonemangsspecialist vs. agentstack
Innan du tittar på poängen: bestäm vilken typ av liten modell din arbetsbelastning behöver, eftersom dessa två svarar på olika frågor. Granite 4.2 3B är byggd för resonemang och lång kontext på begränsad hårdvara: ett nativt fönster på 128K som sträcker sig till 512K, tre tankelägen, ett fotavtryck som ryms på en laptop och ett uttryckligt beslut att hoppa över agentisk träning. Om ditt jobb är analys av långa dokument, kontext i repositorieskala eller tillförlitligt flerstegsresonemang på en liten enhet, då är det en logisk kombination, och IBMs beslut att inte göra anspråk på agentiska förmågor för 3B är en anledning att lita på dess modellkort snarare än en brist i det. MiniCPM5-2B är byggd för det motsatta fokuset: agentiskt beteende och verktygsanvändning på en enhet – träningspipelinen framstår som en lista över saker som Granite 4.2 3B medvetet utelämnade. Om ditt jobb är en agentloop på enheten som anropar verktyg, för långa konversationer och växlar mellan snabba och genomtänkta svar, då är det den stacken som vänder sig till dig, och den bär med sig den extra osäkerhet som en veckogammal checkpoint med ett overifierat modellkort innebär.
De data som OpenBMB öppnade, gjorde IBM inte.
Den minst glamorösa skillnaden är den som betyder mest för team som vill finjustera. OpenBMB släppte MiniCPM5-2B:s träningskorpusar tillsammans med vikterna — UltraData-familjen, inklusive Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math samt agent-SFT- och RL-uppsättningarna — allt under Apache-2.0. Det förvandlar 2B från en svart låda till ett reproducerbart recept: du kan se vad den agentiska efterträningen byggdes på och fortsätta den inom din egen domän. IBM publicerade Granite 4.2 3B:s vikter som öppen källkod och gav en detaljerad teknisk redogörelse för hur modellen byggdes, men inte träningsdatan. För en organisation som vill äga modellen snarare än hyra den är den asymmetrin påtaglig. Och MiniCPM5-2B levereras med en driftsättningslösning som Granite inte matchar i denna storlek: dag-noll-anpassning över nio chipfamiljer genom ModelBests FlagOS-community, från Huawei Ascend till NVIDIA till en rad inhemska acceleratorer, plus ARM — en signal om att ModelBest förväntar sig att 2B ska köras någon annanstans än på en NVIDIA-GPU.
Routingens verklighet
Ingen av modellerna ligger i en hostad katalog i dag, så den här jämförelsen hör hemma i den självhostade världen – men det är just där ett routningslager fortfarande gör skäl för sig som ett skyddsnät snarare än en leveransmekanism. När ett team vill prova en en vecka gammal agentisk 2B mot en resonerande 3B på en arbetsbelastning som det redan hanterar, är det återkalleliga steget att peka en testväg mot ett självhostat MiniCPM5-2B-bygge genom ett API med automatisk failover medan produktionen ligger kvar på den beprövade modellen – den nya stacken kan stanna upp utan att fälla något, och leverantörernas listpriser för de hostade modeller du jämför mot passeras vidare med 0 % påslag, så A/B-testet förblir billigt. Lagret är inte värd för någon av modellerna; det gör experimentet säkert att köra och enkelt att rulla tillbaka.
Vilken liten modell ska du egentligen köra
Kör Granite 4.2 3B om din arbetsbelastning är resonemang med lång kontext på en dator i laptopklass och du vill ha tre tankelägen, ett tak på 512K och ett ärligt specifikationsblad som talar om exakt vad 3B-modellen inte tränats till att göra. Kör MiniCPM5-2B om din arbetsbelastning är en interaktiv, verktygsanropande agent på enheten, där en 2.5B-modell ryms i din minnesbudget — men budgetera tid för att reproducera dess annonserade toppresultat innan du litar på dem, eftersom snittet på 53,9 och SWE-bench-anspråket på 46,4 är leverantörens siffror och ingen annans ännu. Två saker kommer att avgöra den här uppgörelsen snabbare än någon åsikt: en oberoende körning av MiniCPM5-2B som bekräftar eller motbevisar agentanspråken, och att IBMs resonemangssiffror överlever reproduktion av communityn. Tills något av detta har landat är Granite 4.2 3B den säkrare, bättre dokumenterade lilla modellen idag, och MiniCPM5-2B det mer intressanta spelet.
