Hero-Titelkarte für 'MiniCPM5-2B vs Granite 4.2 3B', mit dem Untertitel 'Ein agent-trainiertes 2.5B tritt gegen IBMs 3B-Reasoning-Spezialist an', drei Chips mit der Aufschrift 'Agent-Stack vs Reasoner', 'Apache-2.0 auf beiden Seiten' und 'Gewichte live am 6.–7. September', sowie einem oberen Band 'OPEN-WEIGHTS SHOWDOWN · SEPT 2026'.
Guides & Insights

MiniCPM5-2B gegen Granite 4.2 3B: Der 3B-Reasoning-Spezialist gegen den neuen 2.5B-Agent-Stack.

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

ModelBest hat Granite 4.2 3B auf die eigene Bestenliste von MiniCPM5-2B gesetzt, bevor irgendjemand darum gebeten hat. Die Modellkarte von MiniCPM5-2B, die OpenBMB veröffentlichte, als die Gewichte still und leise auf Hugging Face live gingen, listet das kleinste Reasoning-Modell von IBM unter seinen Vergleichs-Baselines auf – und in dieser Suite zeigt sich, dass MiniCPM5-2B im Durchschnitt 53,9 erreicht, während Granite 4.2 3B auf 42,7 kommt. Das ist die einzige direkte Vergleichszahl, die einer der beiden Anbieter für diese Paarung veröffentlicht hat, was sie zum natürlichen Ausgangspunkt macht – und zum natürlichen Ort für Vorsicht. Beide Modelle sind klein, Apache-2.0-lizenziert, selbst gehostete Open-Weights-Veröffentlichungen, die auf denselben Job Ende 2026 abzielen; sie gehen die Sache nur von entgegengesetzten Enden an, das eine darauf trainiert zu reasoning, das andere darauf trainiert zu handeln.

Die beiden Veröffentlichungen reimen sich stärker, als es das Marketing ihrer Anbieter vermuten lässt. MiniCPM5-2B wurde am 19. Juli auf der World Artificial Intelligence Conference als ModellBest und OpenBMBs On-Device-Flaggschiff vorgestellt – ein dichtes Modell der 2B-Klasse, das als Agentenbasis für Telefone, PCs und intelligente Cockpits angepriesen wird – und seine Gewichte erschienen am 6. und 7. September ohne jegliches Launch-Event, unter Apache-2.0, zusammen mit GGUF-, MLX-, GPTQ-, Base-, SFT- und Draft-Checkpoints sowie den dahinterstehenden Trainingsdaten. Granite 4.2 3B ist IBMs laptopgroßes Reasoning-Modell, dessen Gewichte Anfang August auf Hugging Face landeten und dessen Modellkarte sowie technischer Blog am 25. August veröffentlicht wurden. Keines von beiden wurde bislang von einem unabhängigen Benchmark angefasst, weshalb die untenstehenden Quellenangaben wichtiger sind als die Zahlen.

Zwei Veröffentlichungen, die sich reimen

Granite 4.2 3B ist ein eigenständiges, dichtes Reasoning-Modell, das auf Basis von Granite-4.1-3B-Base nachtrainiert wurde. Es verfügt über 40 Schichten mit Grouped-Query Attention, einen nativen Kontext von 128K, den IBM in einer fünften Vortrainingsphase auf 512K erweitert, und drei Denkmodi pro Abfrage – standardmäßig vollständiges Denken, einen Modus mit geringem Aufwand und einen Pfad ohne Denken. Seine Modellkarte macht unmissverständlich klar, was es nicht ist: Anders als die 8B- und 30B-Geschwister von Granite 4.2 hat die 3B-Variante den spezialisierten, agentischen Reinforcement-Learning-Block, der in SWE-agent-, Terminal- und Suchumgebungen trainiert wurde, bewusst ausgelassen; IBM führt daher kein SWE-bench-Ergebnis auf und positioniert das Modell als Reasoning-Spezialisten statt als Agenten. Es lässt sich über vLLM, SGLang, Transformers, GGUF und Ollama (granite4.2:3b) betreiben, benötigt in bfloat16 etwa 6–8 GB beziehungsweise in quantisierter Form weniger als 2 GB Speicher und besitzt keine gehostete API. Seine wichtigsten Kennzahlen – AIME 2025: 78,33, GPQA: 54,80, LiveCodeBench v6: 69,71, MMLU-Pro: 67,84 – sind IBM-Angaben und wurden bis heute nicht unabhängig reproduziert.

Screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the model summary table — developer Granite Team, IBM, 'Decoder-only Dense Transformer (Reasoning)', base model Granite-4.1-3B-Base, 3B parameters, context 'Natively Supports 128K (Long-context extension to 512K)', bfloat16 precision, tested languages, built-in think chain-of-thought — and the Apache-2.0 license tag (captured September 7, 2026).

MiniCPM5-2B ist stattdessen ein fertiges, agentenorientiertes Modell. Die Modelkarte beschreibt einen dichten Transformer mit 2,52B Gesamtparametern (1,98B ohne Embeddings), 42 Schichten bei einer versteckten Größe von 2048, Grouped-Query-Attention mit 16 Query-Heads und zwei KV-Heads sowie einer Standard-LlamaForCausalLM-Architektur ohne benutzerdefinierte Kernel. Die Einführung hob die agentischen Fähigkeiten hervor — ein agentisches Mid-Training im 200B-Maßstab, ein großes agentisches SFT-Set und agentisches RL-Alignment, abgeschlossen mit On-Policy-Distillation, die die sechzehn RL-Expertenmodelle wieder zu einem einzigen kleinen dichten Netzwerk zusammenfaltet — sowie nativ langen Kontext und hybride schnelle/bedachte Antwortmodi. Die ausgelieferte Konfiguration legt ein Kontextfenster von 131.072 Token fest (die Juli-Materialien warben mit 512K; die veröffentlichte Konfiguration enthält das nicht), und die Modelkarte behauptet XML-artige Tool-Aufrufe mit einem eingebauten SGLang-Parser. In ihrer eigenen Bewertungstabelle berichtet sie einen internen Durchschnitt von 53,9 über das vom Anbieter ausgewählte Vergleichsset, einen AIME-2025/2026-Wert von 86,5, MATH-500 von 94,6 und ein anbieterseitig erzieltes 46,4 bei SWE-bench Verified – was für ein dichtes 2,5B-Modell bemerkenswert wäre, falls es unabhängigen Tests standhält.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Das Kopf-an-Kopf-Rennen, das jemand bereits gedruckt hat.

Da herstellerübergreifende Bestenlisten meistens Äpfel mit Birnen vergleichen, ist das mit Abstand nützlichste Artefakt in diesem Vergleich dasjenige, das ModelBest selbst veröffentlicht hat: Die Karte von MiniCPM5-2B führt granite-4.2-3B unter ihren Baselines auf und weist für MiniCPM5-2B einen Durchschnitt von 53,9 aus, während Granite bei derselben Suite auf 42,7 kommt. Lies es genau als das, was es ist – ein Anbieter, der beide Modelle auf einer selbst ausgewählten Suite laufen lässt, ohne unabhängige Reproduktion, und der allen Anreiz hat, das eigene Modell gewinnen zu sehen. Es ist kein Urteil. Was es dir allerdings sagt, ist, dass ModelBest selbstbewusst genug war, ein 3B-Modell eines Konkurrenten auf seine Karte zu setzen – und die von ihm behauptete Lücke ist genau in den Bereichen am größten, in die das eigene Training geflossen ist: bei den Zeilen für agentische Aufgaben und lange Kontexte. Behandle es als eine Richtungsangabe, und wäge die Angaben auf IBMs eigener separater Karte dagegen ab, bevor du dich auf dieser Grundlage zu irgendetwas entscheidest.

Die Anzeigetafel, ehrlich beschriftet

• Veröffentlichung — MiniCPM5-2B: Ankündigung am 19. Juli 2026; Gewichte werden am 6.–7. September still veröffentlicht. Granite 4.2 3B: Gewichte Anfang August; Modellkarte und technischer Blog am 25. August 2026.

• Rolle — MiniCPM5-2B: Fokus auf On-Device-Agenten und Tool-Nutzung, laut ModelBest. Granite 4.2 3B: Reasoning-Spezialist, laut IBM bewusst nicht-agentisch.

• Größe — MiniCPM5-2B: 2,52B gesamt / 1,98B ohne Embedding, 42 Schichten. Granite 4.2 3B: ~3B dicht, 40 Schichten.

— Kontext — MiniCPM5-2B: 131.072 Tokens in der ausgelieferten Konfiguration. Granite 4.2 3B: 128K nativ, erweiterbar auf 512K.

• Post-Training — MiniCPM5-2B: Deep-Thinking-SFT, spezialisiertes RL, On-Policy-Distillation. Granite 4.2 3B: Reasoning-SFT, GRPO-RL und RLHF; kein agentic-RL-Block.

• Belege — MiniCPM5-2B: Angaben der ModelBest-Karte, kein unabhängiger Lauf. Granite 4.2 3B: Angaben der IBM-Karte, nicht reproduziert; AIME 2025 78,33, GPQA 54,80, LiveCodeBench v6 69,71.

A comparison scoreboard titled 'MiniCPM5-2B vs Granite 4.2 3B — the scoreboard', with left column rows 'What it is: Agent-tuned 2.5B for on-device', 'Params: 2.52B total · 42 layers', 'Context: 128K in shipped config', 'Post-training: Deep-thinking SFT + RL + OPD', 'Card headline: Internal avg 53.9 on own suite', 'Release: Announced Jul 19 · weights Sep 6-7', and right column rows 'What it is: IBM's smallest reasoning 3B', 'Params: ~3B dense · 40 layers', 'Context: 128K native → 512K ext', 'Post-training: Reasoning SFT + GRPO + RLHF', 'Card headline: AIME '25 78.33 · GPQA 54.80', 'Release: Weights Aug · card Aug 25', with a footer reading 'Both vendor-reported and unreproduced; the 53.9-vs-42.7 head-to-head is on ModelBest's own card.'

Die Anzeigetafel oben basiert auf denselben Quellen wie der Fließtext: Jede Zahl darauf stammt vom Anbieter, und der einzige Vergleich innerhalb derselben Suite, den einer der Anbieter veröffentlicht hat, ist der auf ModelBests eigener Karte.

Reasoning-Spezialist vs. Agent-Stack

Bevor wir zu den Ergebnissen kommen, entscheiden Sie, welche Art von kleinem Modell Ihr Workload benötigt, denn diese beiden beantworten unterschiedliche Fragen. Granite 4.2 3B ist für Reasoning und langen Kontext auf beschränkter Hardware konzipiert: ein natives Fenster von 128K, das auf 512K erweitert werden kann, drei Denkmodi, eine Größe, die auf einen Laptop passt, und die ausdrückliche Entscheidung, auf agentisches Training zu verzichten. Wenn Ihre Aufgabe die Analyse langer Dokumente, Kontext in Repository-Größe oder zuverlässiges mehrstufiges Reasoning auf einem kleinen Rechner umfasst, ist das eine stimmige Wahl – und IBMs Entscheidung, der 3B keine Agentik-Fähigkeiten zuzuschreiben, ist ein Grund, ihrer Karte zu vertrauen, nicht eine Lücke. MiniCPM5-2B ist auf den gegenteiligen Schwerpunkt ausgelegt: agentisches Verhalten und Tool-Nutzung auf einem Gerät – die Trainingspipeline liest sich wie eine Liste von Dingen, die Granite 4.2 3B bewusst ausgelassen hat. Wenn Ihre Aufgabe eine On-Device-Agentenschleife ist, die Tools aufruft, lange Konversationen führt und zwischen schnellen und überlegten Antworten wechselt, dann ist dieser Stack genau auf Sie zugeschnitten – er bringt jedoch die zusätzliche Unsicherheit eines eine Woche alten Checkpoints mit unverifizierter Karte mit sich.

Die Daten, die OpenBMB geöffnet hat, hat IBM nicht geöffnet.

Der am wenigsten glamouröse Unterschied ist genau der, der für Teams, die ein Feintuning durchführen möchten, am wichtigsten ist. {{1}}OpenBMB hat die Trainingskorpora von MiniCPM5-2B zusammen mit den Gewichten veröffentlicht – die UltraData-Familie, einschließlich Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math und der SFT- und RL-Datensätze für Agenten – alles unter Apache-2.0.{{/1}} {{2}}Das verwandelt die 2B von einer Blackbox in ein reproduzierbares Rezept: Man kann sehen, worauf das agentische Post-Training aufbaut, und es in der eigenen Domäne fortsetzen.{{/2}} IBM hat die Gewichte von Granite 4.2 3B als Open Source veröffentlicht und einen detaillierten technischen Bericht darüber vorgelegt, wie das Modell entstanden ist – die Trainingsdaten jedoch nicht. {{3}}Für eine Organisation, die das Modell besitzen statt mieten möchte, ist diese Asymmetrie real.{{/3}} Außerdem bringt MiniCPM5-2B eine Deployment-Story mit, die Granite in dieser Größe nicht bieten kann: {{4}}Day-zero-Unterstützung für neun Chip-Familien durch die FlagOS-Community von ModelBest – von Huawei Ascend über NVIDIA bis zu einer Reihe heimischer Beschleuniger, plus ARM – ein Signal, dass ModelBest erwartet, dass die 2B auch woanders als auf einer NVIDIA-GPU läuft.{{/4}}

Die Routing-Realität

Keines der beiden Modelle befindet sich derzeit in einem gehosteten Katalog, dieser Vergleich spielt sich also in der Self-Hosted-Welt ab — aber genau dort hat eine Routing-Schicht nach wie vor ihre Daseinsberechtigung als Sicherheitsnetz und nicht als Zustellmechanismus. Möchte ein Team eine erst eine Woche alte agentische 2B gegen eine Reasoning-3B auf einer Workload testen, die es bereits bedient, so besteht der reversible Schritt darin, einen Testpfad über eine einzige API mit automatischem Failover auf einen selbst gehosteten MiniCPM5-2B-Build zu richten, während die Produktion auf dem bewährten Modell bleibt — der neue Stack kann ins Stocken geraten, ohne dass etwas ausfällt, und die Listenpreise der Anbieter für die gehosteten Vergleichsmodelle werden mit 0 % Aufschlag durchgereicht, sodass der A/B-Test günstig bleibt. Die Schicht hostet keines der beiden Modelle; sie macht das Experiment sicher durchführbar und leicht umkehrbar.

Welches kleine Modell sollten Sie tatsächlich ausführen?

Führen Sie Granite 4.2 3B aus, wenn es bei Ihrer Arbeitslast um Long-Context-Reasoning auf einem Gerät der Laptop-Klasse geht und Sie drei Denkmodi, eine 512K-Obergrenze und eine ehrliche Model-Card möchten, die genau sagt, wofür die 3B nicht trainiert wurde. Führen Sie MiniCPM5-2B aus, wenn Ihre Arbeitslast ein interaktiver On-Device-Agent mit Tool-Calling ist und ein 2,5B-Modell in Ihr Speicherbudget passt – planen Sie aber genügend Zeit ein, um seine beworbenen Kennzahlen zu reproduzieren, bevor Sie ihm vertrauen, denn der Durchschnitt von 53,9 und die 46,4 bei SWE-bench sind bislang nur Behauptungen des Herstellers und von niemandem sonst. Zwei Dinge werden diesen Vergleich schneller entscheiden als jede Meinung: ein unabhängiger Testlauf von MiniCPM5-2B, der die Behauptungen zu seinen Agentenfähigkeiten bestätigt oder widerlegt, sowie IBMs Reasoning-Zahlen, die einer Reproduktion durch die Community standhalten. Bis eines dieser Ergebnisse vorliegt, ist Granite 4.2 3B heute das sicherere, besser dokumentierte kleine Modell, und MiniCPM5-2B ist die interessantere Wette.