
MiniCPM5-2B-DSpark vs Granite 4.2 3B: Zwei unauffällige Apache-2.0-Releases für kleine, schnelle, selbst gehostete Bereitstellung
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Der August und der frühe September 2026 brachten zwei unaufgeregte, unter Apache-2.0 lizenzierte Veröffentlichungen hervor, die auf dieselbe Aufgabe abzielten — kleine Modelle, die man selbst hostet — und sie gingen dabei von entgegengesetzten Enden vor. Granite 4.2 3B ist IBMs laptopgroßes Reasoning-Modell, dessen Gewichte Anfang August auf Hugging Face landeten und dessen Modellkarte und technischer Blog am 25. August 2026 veröffentlicht wurden. MiniCPM5-2B-DSpark ist im selben Sinne überhaupt kein Modell: Es handelt sich um einen DSpark-Draft-Checkpoint mit 323,8M Parametern, den OpenBMB am 6. September 2026 ohne Ankündigung veröffentlichte, um MiniCPM5-2B — das 2,52B große dichte On-Device-Modell, das ModelBest am 19. Juli 2026 auf der WAIC ankündigte — durch spekulative Dekodierung Tokens schneller erzeugen zu lassen. Die eine Veröffentlichung ist ein eigenständiges kleines Reasoning-Modell; die andere ist ein Beschleunigungszubehör für ein kleines Modell. Beide stehen unter Apache-2.0, beide sind ausschließlich für das Selbsthosting vorgesehen, und keine von beiden wurde bisher von einem unabhängigen Benchmark getestet.
Entfernt man die Marketing-Ebene, ist die praktische Frage, vor der ein Team steht, klar: Für eine kleine, selbst gehostete Serving-Workload Ende 2026 – möchte man IBMs 3B-Reasoning-Spezialisten oder ModelBests 2B-agentenorientierten Stack mit einem gratis aufgesetzten Draft? Die Beleglage ist dünner, als es die Spezifikationsblätter beider Anbieter nahelegen. Dieser Artikel beleuchtet daher die Fakten zum Release, die einzigen tatsächlich vorhandenen Vergleichswerte aus derselben Suite sowie den Workload-Unterschied, der die Entscheidung leiten sollte.
Die beiden Veröffentlichungen, was wissbar ist
Granite 4.2 3B ist IBMs kleinstes Reasoning-Modell, das aus Granite-4.1-3B-Base nachtrainiert wurde. Es ist dicht und rein textbasiert – 40 Schichten, Grouped-Query-Attention, ein nativer Kontext von 128K, der sich in einer fünften Vortrainingsphase auf 512K erweitert, und drei Reasoning-Modi: vollständiges Denken standardmäßig, ein Low-Effort-Modus und ein Nicht-Denken-Pfad. IBMs Modellkarte stellt klar, dass die 3B-Variante den Block für agentisches Reinforcement Learning, den die größeren Granite-4.2-Geschwister erhalten haben, bewusst ausgelassen hat; daher listet sie keine SWE-Bench-Ergebnisse und ist ein Reasoning-Modell und kein Agentenmodell. Die 3B-Variante wird über vLLM, SGLang, Transformers, GGUF und Ollama (granite4.2:3b) bereitgestellt und hat keine gehostete API. Die wichtigsten Werte auf der Modellkarte – 78,33 bei AIME 2025, 54,80 GPQA, 69,71 LiveCodeBench v6 – werden vom Anbieter gemeldet und sind bis heute nicht unabhängig reproduziert.

Die oben gezeigte Modellkarte für ibm-granite/granite-4.2-3b ist das öffentliche Aushängeschild dieser Veröffentlichung: ein für Reasoning feinabgestimmtes 3B-Modell mit einer Long-Context-Story und ohne agentische Claims.
MiniCPM5-2B-DSpark hingegen existiert nur im Dienste seines Zielmodells. Der Entwurf hat fünf Full-Attention-Schichten, 323.776.001 Parameter und eine Blockgröße von sieben Kandidaten-Tokens pro Vorwärtsdurchlauf. Trainiert wurde er über sechs Epochen auf 7,05 Milliarden Tokens von MiniCPM5-2B-generierten Antworten. Sein Repository gibt eine Akzeptanzlänge an – 5,52 akzeptierte Tokens pro Verifizierungsschritt im Durchschnitt bei Greedy-Dekodierung, 6,11 bei Code –, aber keine Tokens-pro-Sekunde-Zahl. Das Zielmodell, das es beschleunigt, MiniCPM5-2B, ist das interessantere Produkt: ein dichtes Modell mit 2,52B Parametern, 42 Schichten und 128K-Kontext, dessen Launch-Materialien agentische Fähigkeiten betonen – Agent-Mid-Training im 200B-Maßstab, ein großes Agent-SFT-Set und Agent-RL-Alignment, laut ModelBests Ankündigung vom Juli – sowie natives Long-Context und hybride schnelle/bedachte Modi. In ModelBests eigener Vergleichssuite erreicht das Zielmodell einen Durchschnittswert von 53,9 gegenüber offenen Modellen derselben Klasse. Jede dieser Zahlen stammt vom Anbieter.

Die openbmb/MiniCPM5-2B-DSpark-Karte oben ist die gesamte Release-Oberfläche: Modellkarte, Konfiguration, eine Safetensors-Datei und keine Ankündigung.
Der einzige Vergleich innerhalb derselben Suite, der existiert.
Vendorübergreifende Scoreboards sind meistens Äpfel-mit-Birnen-Vergleiche, aber es gibt eine Stelle, an der Granite 4.2 3B und MiniCPM5-2B gemeinsam gemessen wurden: in ModelBests eigener Evaluierungstabelle für MiniCPM5-2B, die granite-4.2-3B unter ihren Baselines führt. In dieser Suite erreicht MiniCPM5-2B im Schnitt 53,9 gegenüber 42,7 für Granite 4.2 3B. Lies diese Zahl genau als das, was sie ist – ein Anbieter, der beide Modelle auf einer einzigen Suite laufen lässt, ohne unabhängige Reproduktion, und ausgewählt, um das eigene Modell gut aussehen zu lassen. Sie ist kein Urteil. Was sie dir sagt, ist: ModelBest war selbstbewusst genug, das 3B-Modell eines Konkurrenten auf die Karte zu setzen, und die behauptete Lücke ist genau dort am größten, wo das eigene Training investiert hat: bei Long-Context- und Agentic-Zeilen. Behandle das als Richtungsangabe, verifiziere es an deinen eigenen Daten und wäge die separaten Angaben auf IBMs eigener Karte ab, bevor du darauf eine Entscheidung stützt.
Die Anzeigetafel, ehrlich beschriftet
• Was ausgeliefert wird — MiniCPM5-2B-DSpark: ein 324M-Draft für MiniCPM5-2B (2,52B dichtes Zielmodell), nicht eigenständig. Granite 4.2 3B: ein eigenständiges ~3B dichtes Reasoning-Modell.
• Rolle — MiniCPM5-2B-Stack: Schwerpunkt auf On-Device-Agenten und Tool-Nutzung, laut ModelBest. Granite 4.2 3B: Reasoning-Spezialist, bewusst nicht-agentisch.
• Kontext — MiniCPM5-2B Ziel: 128K nativ. Granite 4.2 3B: 128K nativ, erweiterbar auf 512K.
• Beschleunigung — MiniCPM5-2B-DSpark: externer DSpark-Draft, sieben Token pro Durchgang, gierige Akzeptanz ~5,5 pro Schritt (laut Repository). Granite 4.2 3B: keine mit dieser Version ausgeliefert.
• Lizenz — beide Apache-2.0.
• Belege — Die MiniCPM-Zahlen sind Angaben von ModelBest-Karten (dessen Suite: 53,9 vs. Granite 42,7); die Granite-Zahlen sind Angaben von IBM-Karten (AIME 2025 78,33, GPQA 54,80). Für keines der beiden existiert ein unabhängiger Lauf.

Die Anzeigetafel oben stützt sich auf dieselben Quellen wie der Fließtext: Jede Zahl darauf stammt von Anbietern, und die einzige Zahl aus derselben Suite, die einer der Anbieter veröffentlicht hat, ist die von ModelBest selbst.
Der Unterschied, der jeden Benchmark übertrifft
Bevor Sie sich die Ergebnisse ansehen, entscheiden Sie, welche Art von kleinem Modell Ihre Arbeitslast benötigt, denn die beiden Veröffentlichungen beantworten unterschiedliche Fragen. Granite 4.2 3B wurde für Reasoning und lange Kontexte auf ressourcenbeschränkter Hardware entwickelt: ein natives 128K-Fenster, das auf 512K erweiterbar ist, drei Denkmodi pro Abfrage, ein Footprint, der auf einem Laptop läuft, und die ausdrückliche Entscheidung, auf agentisches Training zu verzichten. Wenn es um die Analyse langer Dokumente, Kontext auf Repository-Ebene oder zuverlässiges Reasoning auf einem kleinen Rechner geht, dann ist das eine stimmige Lösung. MiniCPM5-2B wurde für den gegenteiligen Schwerpunkt entwickelt: agentisches Verhalten und Werkzeugnutzung auf dem Gerät – die bloße Existenz des Entwurfs signalisiert, dass ModelBest erwartet, dass dieses Ziel interaktiv bedient wird und die Tokens pro Sekunde zurückhaben möchte. Wenn es Ihre Aufgabe ist, eine Agentenschleife auf dem Gerät zu betreiben, die Werkzeuge aufruft und lange Gespräche führt, dann ist das der Stack, der genau auf Sie zugeschnitten ist.
Der Entwurf verändert die Wirtschaftlichkeit dieser zweiten Option in einer Weise, die das Granite-Release nicht adressiert. MiniCPM5-2B ist ein dichtes Modell, und spekulative Dekodierung zahlt sich genau in dem dichten, speichergebundenen Regime am meisten aus – ein kleines festes Modell, das einem etwas größeren festen Modell Tokens vorschlägt. Ein externer Drafter, der einem ~5-GB-Zielmodell rund 650 MB an BF16-Gewichten hinzufügt, mit einem dokumentierten SGLang-Serving-Pfad und einer Greedy-Akzeptanzrate von etwa fünfeinhalb Tokens pro Verifikationsschritt, ist ein glaubwürdiger Hebel für den Durchsatz eines Modells, das Sie mit Single-Request-Concurrency betreiben. Doch der Vorbehalt ist unvermeidbar: OpenBMB hat keine End-to-End-Beschleunigung veröffentlicht, der Hebel ist also unkalibriert. IBM liefert im Rahmen dieses Releases keinen gleichwertigen externen Drafter für Granite 4.2 3B – Sie betreiben es als dichtes Modell, und seine Geschwindigkeitsstory ist schlicht, dass das 3B-Modell klein ist.
Wer sollte was ausführen
• Führen Sie Granite 4.2 3B aus, wenn Ihre Workload Long-Context-Reasoning auf einem Rechner der Laptop-Klasse erfordert — Dokumente, Repositories, tiefgehende Single-Thread-Analyse — und Sie drei Denkmodi sowie eine 512K-Obergrenze bei einem Apache-2.0-Modell wünschen, das Sie vollständig kontrollieren. Akzeptieren Sie, dass dahinter kein agentisches Training steckt und keine gehostete API verfügbar ist.
• Führen Sie den MiniCPM5-2B-Stack mit seinem DSpark-Draft aus, wenn Ihre Arbeitslast ein interaktiver, Tool-aufrufender On-Device-Agent ist, bei dem das Ziel in Ihr Speicherbudget passt und Sie den Durchsatz nutzen möchten, den ein Draft zurückbringen kann. Planen Sie Zeit ein, um die tatsächliche Beschleunigung des Drafts an Ihrem eigenen SGLang-Build zu messen, da für diese keine Zahl veröffentlicht wurde.
• Betreiben Sie beide hinter einer Routing-Ebene, wenn Sie wirklich unsicher sind. Keines der Modelle ist derzeit in einem gehosteten Katalog verfügbar – OrcaRouter eingeschlossen. Beide sind Selbsthosting-Lösungen. Aber ein Router mit automatischem Failover, der Ihren eigenen Endpunkten vorgeschaltet ist, hält den neuen Stack-Entwurf auf einem Testpfad, während die Produktion auf dem bewährten Pfad bleibt. Und weil er die gehosteten Modelle um sie herum ohne Aufschlag durchreicht, bleibt der A/B-Vergleich günstig. Entscheidend ist die Reversibilität: Tauschen Sie einen Modellnamen aus, messen Sie und schalten Sie zurück, falls der erst einen Tag alte Checkpoint ins Stocken gerät.
Was als Nächstes ansehen
Zwei Dinge werden dieses Duell schneller entscheiden als jede Meinung. Erstens: Ein unabhängiger Lauf von MiniCPM5-2B, der den 53,9-Durchschnitt und die Agentic-Behauptungen bestätigt oder widerlegt – ein 2B-Modell, das bei SWE-Bench-ähnlichen Aufgaben so gut abschneidet, wäre ein wirklich neuer Datenpunkt für die On-Device-Klasse. Zweitens: IBMs eigene Reasoning-Modell-Zahlen, die der Reproduktion durch die Community standhalten; die 78,33 des 3B-Modells bei AIME 2025 ist die Art von Behauptung, die sich verschiebt, wenn jemand anderes sie ausführt. Bis eines davon eintrifft, ist die ehrliche Position: Granite 4.2 3B ist heute das sicherere, besser dokumentierte kleine Modell, und der MiniCPM5-2B-Stack ist die interessantere Wette – ein schnellerer On-Device-Agent, wenn seine Behauptungen halten, mit einem Entwurf, dessen Nutzen noch nicht einmal der eigene Anbieter gemessen hat.
