Eine Hero-Titelkarte für den Vergleich ‚MiniCPM5-2B-DSpark vs. Gemma 4 12B' mit dem Untertitel ‚Zwei Arten des Draftens, zwei Gewichtsklassen lokaler KI'. Sie zeigt links einen kleinen Chip mit der Aufschrift ‚324M-Draft', der einen Block mit der Aufschrift ‚2,5B-On-Device-Ziel' speist, und rechts ein breiteres Panel mit der Aufschrift ‚11,95B-multimodaler Generalist'. Darüber verläuft eine Flusslinie aus Token-Chips mit der Aufschrift ‚Erst draften, dann verifizieren'. Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

MiniCPM5-2B-DSpark vs Gemma 4 12B: Zwei Arten zu entwerfen, zwei Gewichtsklassen lokaler KI

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der schnellste Weg, um zu erkennen, warum MiniCPM5-2B-DSpark und Gemma 4 12B auf dieselbe Seite gehören, besteht darin, ihre Größen für einen Moment zu ignorieren und zu beobachten, wie jedes von ihnen einen Satz schreibt. Beide tricksen den Speicherbus mit einem Drafter aus: Ein kleines Modell schlägt mehrere nächste Tokens auf einmal vor, und das eigentliche Modell verifiziert den Block in einem einzigen Durchgang. So zahlt der Chip die Ladekosten für die Gewichte einmal pro Block statt einmal pro Token. MiniCPM5-2B-DSpark ist das Draft-Modell, das OpenBMB am 6. September 2026 still und leise auf Hugging Face veröffentlichte – ein Begleit-Checkpoint mit 323,8 Millionen Parametern, der MiniCPM5-2B beschleunigt, das dichte On-Device-Modell mit 2,52 Milliarden Parametern, das ModelBest am 19. Juli 2026 auf der WAIC ankündigte. Gemma 4 12B ist Googles encoderfreier multimodaler Generalist mit 11,95 Milliarden Parametern, der am 3. Juni 2026 mit eigenen integrierten Draftern und einer Kontextlänge von 256K veröffentlicht wurde. Das eine verkauft den Drafter als separaten Apache-2.0-Checkpoint, den man selbst lädt; das andere versteckt einen ähnlichen Trick in einem einzigen großen Modell, das man einfach ausführt.

Der Ehrlichkeitshinweis, der die Form dieses Artikels bestimmt: MiniCPM5-2B-DSpark ist kein Modell, das man per Prompt ansteuern kann. Es hat keinen Tokenizer, kein Chat-Template und keine eigenständige Ausgabe – eine Karte, die nur eine model.safetensors, eine Config und eine README auflistet. Es ist ein Zubehörteil der Serving-Schicht für ein Ziel der 2B-Klasse, und der eigentliche Vergleich, den ein Leser anstellt, ist zwischen zwei lokalen KI-Gewichtsklassen: einem handygroßen 2B-Stack, der seine Tokens entwirft, gegenüber einem 16-Gigabyte-12B-Generalisten, der seine Tokens entwirft. Alles andere unten ist diese Entscheidung konkret umgesetzt.

Was MiniCPM5-2B-DSpark wirklich ist

Die Model Card ist die gesamte öffentliche Oberfläche des Releases, also ist dies das, was daraus zu erfahren ist. MiniCPM5-2B-DSpark ist ein DSpark-Draft-Checkpoint: fünf Full-Attention-Schichten, 323.776.001 Parameter, Grouped-Query-Attention mit 16 Query-Heads und 2 KV-Heads sowie eine Blockgröße von sieben – er schlägt bis zu sieben Kandidaten-Token pro Vorwärtsdurchlauf vor, die das MiniCPM5-2B-Ziel verifizieren soll. Die Konfiguration deklariert die Qwen3DSparkModel-Architektur mit einem DSparkDraftModel-Auto-Mapping und wird mit dem Confidence-Head und dem Markov-Head aus der DSpark-Methode (arXiv 2607.05147, das D​eepSeek-Paper vom Juli 2026) ausgeliefert, die noch aktiviert sind – der lastbewusste Verifizierer, der entscheidet, wann sich die Prüfung eines Suffixes nicht lohnt. Es wurde sechs Epochen lang auf 7,05 Milliarden Token von MiniCPM5-2B-generierten Antworten trainiert, und zwar über allgemeine, mathematische und Code-Prompts.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

Die oben gezeigte openbmb/MiniCPM5-2B-DSpark-Karte ist das gesamte Ausmaß dessen, was veröffentlicht wurde: Modellkarte, Konfiguration, eine Safetensors-Datei und keine Ankündigung, kein Blogbeitrag, keine Pressemitteilung — ein stiller Weights-Drop, der zum Zeitpunkt des Schreibens einen Tag alt ist.

Was die Karte nicht enthält, ist ebenso wichtig wie das, was sie enthält. Sie weist eine Akzeptanzlänge aus — in der eigenen Auswertung des Repos im Durchschnitt 5,52 akzeptierte Tokens pro Verifizierungsschritt bei Greedy-Dekodierung, bei Mathematik 6,05 und bei Code 6,11 (Obergrenze: sieben Tokens) —, publiziert aber keine tatsächliche Beschleunigung, keine Angabe zu Tokens pro Sekunde und keinen unabhängigen Benchmark. Die DSPARK-Engine von SGLang ist der dokumentierte Serving-Pfad, wobei das Draft-Modell neben dem Zielmodell MiniCPM5-2B geladen wird. Mit anderen Worten: Die Qualität des Drafts ist quantifiziert, sein Nutzen jedoch noch nicht – und wer ihn übernimmt, sollte messen, bevor er glaubt.

Was Gemma 4 12B auf die andere Seite bringt

Gemma 4 12B ist das mittlere Kind von Googles G​emma-4-Familie und liegt auf der Kurve der lokalen KI an einem völlig anderen Punkt. Es ist ein einzelnes dichtes 11.95B-Modell, das Text, Bild, Audio und Video ohne separate Encoder als Eingabe aufnimmt, Tool-Aufrufe von Haus aus unterstützt und einen nativen 256K-Kontext mit Multi-Token-Prediction-Draftern kombiniert, die intern denselben Memory-Bus-Trick anwenden – aber direkt aus dem Checkpoint heraus, sodass Sie nichts zusätzlich herunterladen oder anbinden müssen. Es ist unter Apache 2.0 lizenziert, läuft in der Praxis auf einem 16-GB-Laptop und wurde mit der vollen Google-Ausstattung ausgeliefert: Launch-Evals, Modellkarten für die Basis- und Instruktionsvarianten, Ökosystem-Support über Model Garden, LM Studio und Ollama. Es kann auf Monate des Community-Einsatzes zurückblicken, was der einen Tag alte MiniCPM-Entwurf nicht kann.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

Die obige Modellkarte von Google für Gemma 4 12B zeigt den Kontrast auf einen Blick: ein ausgereifter multimodaler Generalist, dessen Draft-Modelle Bestandteil der Veröffentlichung sind – nicht etwa ein separates Repository.

Die Spezifikationen, ehrlich gekennzeichnet

Lesen Sie diese mit Blick auf die Quellenlage: Die MiniCPM5-2B-Werte sind Behauptungen auf der ModelBest-Karte, die nicht unabhängig reproduziert wurden; die Gemma-4-12B-Werte stammen von Google selbst und werden seit Langem von der Community genutzt.

Was Sie ausführen — {{1}}MiniCPM5-2B-DSpark: ein 324M-Entwurf, der nur neben MiniCPM5-2B (2,52B dicht, 42 Schichten) dient.{{/1}} {{2}}Gemma 4 12B: ein eigenständiges dichtes 11,95B-Modell.{{/2}}

• Kontext — MiniCPM5-2B-Ziel: 128K nativ. Gemma 4 12B: 256K nativ.

• Modalität — MiniCPM5-2B-Stack: reine Texteingabe. Gemma 4 12B: Text-, Bild-, Audio- und Videoeingabe, ohne Encoder.

• Drafting — MiniCPM5-2B-DSpark: externer DSpark-Draft, sieben Token pro Durchlauf, SGLang-DSPARK-Engine. Gemma 4 12B: interne Drafting-Modelle mit Multi-Token-Vorhersage, nichts zu installieren.

Footprint — MiniCPM5-2B benötigt etwa 5 GB in BF16 plus eine ~650 MB große Draft-Datei; Gemma 4 12B etwa 18 GB in BF16, praktikabel auf quantisierter Hardware der 16-GB-Klasse.

Evidenz — MiniCPM5-2B-DSpark: lediglich einen Tag alte Zahlen zur Repository-Aufnahme. Gemma 4 12B: Launch-Evaluierungen sowie monatelange Community-Bereitstellung.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Die obige Anzeigetafel ist dasselbe Porträt in sechs Reihen: Die beiden Spalten sind sich in fast allem uneinig, außer bei der Strategie, die beide zum schnellen Schreiben verwenden.

Welche Gewichtsklasse passt zu dem Silizium, das Sie tatsächlich haben?

Da MiniCPM5-2B-DSpark kein Modell ist, ist die aussagekräftige Gabelung die Gewichtsklasse des Zielmodells im Vergleich zu der von Gemma 4 12B – und diese Gabelung ist vor allem eine Hardware-Frage. Ein Telefon, ein Smart-Cockpit-Board oder eine kleine Edge-Box mit ein paar Gigabyte DRAM kann ein 11,95B-Modell nicht mit brauchbarer Geschwindigkeit ausführen; der Speicherbus ist genau der Engpass, der es abwürgen würde. Das ist die Welt, für die der MiniCPM5-2B-Stack gebaut wurde – ein dichtes 2B-Modell, dessen Gewichte in den Gerätespeicher passen, mit einem aufgesetzten Draft, um einen Teil der Tokens pro Sekunde zurückzugewinnen, die kleine dichte Modelle hergeben. Spekulative Dekodierung ist genau in diesem dichten, speichergebundenen Regime am effektivsten, weshalb der Draft der interessante Teil der Veröffentlichung ist und nicht ein Gimmick.

Gemma 4 12B ist die Antwort eine Gewichtsklasse höher. Wenn dein Rechner 16 GB oder mehr hat — ein Laptop, eine Workstation, ein leistungsstarker Edge-Server — kannst du den multimodalen Generalisten mitführen und gewinnst drei Dinge, die der 2B-Stack nicht bieten kann: Bild-, Audio- und Videoeingabe ohne Encoder oder eine zweite Pipeline; ein 256K-Fenster für Repository- oder Dokumentgrößen; und eine Reife, die ein erst einen Tag alter Entwurfs-Checkpoint einfach nicht besitzt. Du gibst die Fähigkeit auf, auf den kleinsten Geräten zu laufen, und zahlst etwa das Dreifache des Speicherbedarfs.

Die Routing-Realität für beide

Keine der beiden Seiten dieses Vergleichs ist heute in einem gehosteten Katalog enthalten, auch OrcaRouter nicht. MiniCPM5-2B-DSpark ist per Definition ein selbst gehostetes Serving-Zusatzmodul – Sie betreiben den SGLang-Stack selbst, und der Draft existiert nur in Ihrer lokalen Bereitstellung. Gemma 4 12B ist ein Modell mit offenen Gewichten, Sie können es also selbst hosten oder dort einsetzen, wo Sie es bereits erhalten. Genau das ist die Situation, in der eine Routing-Schicht ihren Wert als Sicherheitsnetz statt als Bereitstellungsmechanismus beweist: Wenn Sie einen brandneuen Draft-Build gegen eine Workload testen, die Sie bereits bedienen, bedeutet das, den Testpfad über eine API mit automatischem Failover zu führen, sodass ein unerprobter Stack ins Stocken geraten kann, ohne die Produktion lahmzulegen; und die Listenpreise der Anbieter werden ohne Aufschlag durchgereicht, sodass eine Preisänderung bei jedem gehosteten Modell, das Sie vergleichen, noch am selben Tag auftaucht. Für den Vergleich selbst ist der ehrliche Plan für beide Modelle jedoch derselbe: Sie hosten selbst, also ist der Benchmark, der zählt, der, den Sie auf Ihrer eigenen Hardware ausführen.

Das Urteil

MiniCPM5-2B-DSpark und Gemma 4 12B sind keine Konkurrenten im direkten Vergleich – sie sind zwei Gewichtsklassen lokaler KI, die zufällig denselben Trick gemeinsam haben. Wählen Sie den MiniCPM5-2B-Stack mit seinem DSpark-Draft, wenn Ihr Gerät kein 12B-Modell bewältigen kann und Sie ein textfähiges, agentenorientiertes Modell unter Apache-2.0-Lizenz möchten, das in den Gerätespeicher passt. Der Draft ist eine vielversprechende, kostenlose Beschleunigung – doch bevor Sie ihm vertrauen, messen Sie seine Leistung mit Ihrem eigenen SGLang-Build, denn sein Nutzen ist noch nicht quantifiziert. Entscheiden Sie sich für Gemma 4 12B, wenn Ihre Hardware genügend Leistungsreserven hat und Sie ein multimodales Modell mit einem 256K-Kontextfenster und einem Ökosystem dahinter möchten. Die Frage ist nicht, welches Modell intelligenter ist, sondern welches Ihre Hardware tatsächlich füttern kann.