
MiniCPM5-2B vs. Gemma 4 12B: Der Spitzenreiter der Sub-4B-Rangliste vs. Googles 12B-Generalist
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
Die Launch-Materialien für MiniCPM5-2B enthalten einen Satz, der klingt, als beende er jede Diskussion, bevor sie beginnt: Auf der World Artificial Intelligence Conference am 19. Juli bezeichneten ModelBest und OpenBMB das Modell als das bestplatzierte Modell unter 4B Parametern auf Artificial Analysis‘ Leaderboard, und seine offenen Gewichte sind nun unauffällig auf Hugging Face live gegangen. Gemma 4 12B ist Googles Antwort aus einer völlig anderen Gewichtsklasse – ein dichter, encoderfreier multimodaler Generalist mit 11,95B Parametern, veröffentlicht am 3. Juni, der Text, Bild, Audio und Video als Eingabe akzeptiert und auf Monate der Nutzung durch die Community zurückblicken kann. Sie zu vergleichen ist keine Datenblatt-Übung; es ist eine Entscheidung darüber, für welches Gerät du entwickelst, denn ein Modell, das seine Größenklasse anführt, und ein Modell, das einfach größer ist, beantworten unterschiedliche Hardware-Fragen.
Das Timing ist der Grund, warum es diesen Vergleich überhaupt gibt. MiniCPM5-2B wurde im Juli auf der WAIC als Produkt gezeigt – eine Chip-Geschichte ebenso wie eine Modell-Geschichte, mit neun Chip-Partnern zum Start aus seiner FlagOS-Community – und die Gewichte wurden „in naher Zukunft“ versprochen. Sieben Wochen später erschien das Repository openbmb/MiniCPM5-2B auf Hugging Face (das OpenBMB-Changelog datiert die Veröffentlichung auf den 7. September), unter Apache-2.0, ohne Zugangsbeschränkung, mit dem BF16-Checkpoint, GGUF, MLX, GPTQ, Base- und SFT-Checkpoints sowie den Trainingsdatensätzen allesamt in derselben Sammlung. Keine Pressemitteilung, kein Launch-Event. Zum Zeitpunkt dieses Textes ist die Modellkarte die Ankündigung, und es wurde noch kein unabhängiger Benchmark-Lauf veröffentlicht – alles Quantitative über die 2B unten stammt entweder aus ModelBests eigener Reproduktion oder aus der Artificial-Analysis-Momentaufnahme, die in der Modellkarte zitiert wird. Gemma 4 12B hingegen kam über die übliche Google-Maschinerie auf den Markt und wurde millionenfach heruntergeladen. Diese Evidenzlücke ist Teil des Vergleichs, keine Fußnote dazu.
Was hat sich gerade auf beiden Seiten geändert?
MiniCPM5-2B ist das zweite Modell der MiniCPM5-Serie, nach dem MiniCPM5-1B, das OpenBMB am 19. Mai als Open Source veröffentlicht hat. Das Datenblatt beschreibt einen dichten Transformer mit insgesamt 2.516.756.480 Parametern (1.981.982.720 ohne Embeddings – die Zahl, die die Bezeichnung „2B-Klasse“ rechtfertigt), 42 Schichten bei einer versteckten Dimension (Hidden Size) von 2048, Grouped-Query-Attention mit 16 Query-Heads und nur 2 KV-Heads sowie einem Vokabular von 130.560. Es handelt sich um eine einfache LlamaForCausalLM-Architektur – das Datenblatt stellt klar, dass weder benutzerdefinierte Kernel noch ein Fork des Modellcodes erforderlich sind – und der gesamte Checkpoint wird als ein einziges BF16-Safetensors-Shard ausgeliefert. Die interessante Designentscheidung betrifft das Post-Training: Zunächst SFT auf 400B Tokens von Deep-Thinking-Daten, dann On-Policy-Distillation, die sechzehn RL-Expertenmodelle – fünf davon agentisch – wieder in ein einziges kleines dichtes Netzwerk zurückfaltet. Das Datenblatt schreibt RL + OPD einen durchschnittlichen Zugewinn von 10,96 Punkten bei Denk- und allgemeinen Aufgaben und 6,96 Punkten bei agentischen Aufgaben zu – interne Deltas, aber sie erklären die Form dieses Modells: ein 2B-Modell, das als On-Device-Agent konzipiert ist und nativ XML-artige Tool-Aufrufe ausgibt.

Gemma 4 12B nimmt in Googles Produktpalette eine besondere Position ein. Es ist das mittlere Kind der Gemma-4-Familie – über den Edge-fokussierten E2B- und E4B-Modellen, unter dem 26B-MoE und dem 31B-Frontier – und es ist das einzige Mitglied, das auf einem Encoder-freien Design basiert: Rohe Bild-Patches und Audio-Wellenformen werden direkt in den Token-Raum projiziert, sodass ein einziges dichtes Modell Text-, Bild-, Audio- und Videoeingaben verarbeitet, ohne einen separaten Encoder-Turm bereitstellen zu müssen. Es bietet ein 256K-Kontextfenster, Tool-Calling direkt ab Werk, einen optionalen Reasoning-Durchlauf und Multi-Token-Prediction-Drafters, die die Dekodierung aus dem Inneren des Checkpoints beschleunigen. Es ist unter Apache-2.0 lizenziert, auf Hardware der 16-GB-Klasse praktikabel (etwa 8 GB bei 4-Bit), und seine Hugging-Face-Seite verzeichnet Millionen von Downloads pro Monat.

Die Ranking-Behauptung und die Größenklasse, die sie auslässt.
ModelBests Schlagzeile für MiniCPM5-2B ist ein Artificial-Analysis-Intelligence-Index von 17 – der erste unter Modellen mit weniger als 4B Parametern zum Startzeitpunkt. Zwei Einschränkungen gehören daneben genannt. Der Wert spiegelt den v4.1-Snapshot von AA wider und ist nicht direkt mit Indexwerten aus früheren Snapshots vergleichbar; zudem ist es eine Zahl vom Startzeitpunkt, die der Anbieter vor jeder unabhängigen Wiederholung angeführt hat. Die ehrliche Lesart ist enger und immer noch beeindruckend: Bei seiner Veröffentlichung führte dieses 2,5B-Modell nach der damaligen AA-Methodik seine gesamte Größenklasse an. Gemma 4 12B erscheint nicht in dieser Klasse und wird auf Artificial Analysis' eigenen Seiten heute höher eingestuft – etwa 22 für die Reasoning-Variante und 13 für das Nicht-Reasoning-Instruct-Modell, beide „deutlich über dem Durchschnitt“ für ihre Vergleichsgruppe. Indizes aus verschiedenen Snapshots lassen sich nicht sauber abgleichen; behandeln Sie das also als Richtung, nicht als Präzision: Der 12B-Generalist erweist sich im Test als das leistungsfähigere Modell, und das 2B-Modell erweist sich im Test als das leistungsfähigste Modell seiner Größe. Das sind unterschiedliche Aussagen, und beide können wahr sein.
Die Anzeigetafel, ehrlich beschriftet
Lesen Sie diese Zeilen mit Blick auf die Quellenlage — die Zahlen von MiniCPM5-2B sind Behauptungen aus dem ModelBest-Datenblatt, eine Woche alt und nicht reproduziert; die von Gemma 4 12B wurden von Google gemeldet und werden seit langem von der Community genutzt:
• Größe — MiniCPM5-2B: 2,52B gesamt / 1,98B ohne Embeddings, dicht. Gemma 4 12B: 11,95B, dicht.
• Modalität — MiniCPM5-2B: nur Text. Gemma 4 12B: Text-, Bild-, Audio- und Videoeingabe, ohne Encoder.
• Kontext — MiniCPM5-2B: 131.072 Token in der mitgelieferten Konfiguration. Gemma 4 12B: 256K nativ (einige Serving-Rezepte legen 128K fest).
• Sprachen — MiniCPM5-2B: auf Englisch und Chinesisch ausgerichtete Karte und Daten. Gemma 4 12B: 140+ Sprachen.
• Veröffentlichung — MiniCPM5-2B: angekündigt am 19. Juli 2026; Gewichte am 6.–7. September live gegangen, im Stillen. Gemma 4 12B: erschienen am 3. Juni 2026, mit vollständigen Start-Evaluierungen.
• Belege — MiniCPM5-2B: Anbieterkarte plus AA v4.1 (Index 17, Nr. 1 in der Sub-4B-Klasse); noch kein unabhängiger Testlauf. Gemma 4 12B: Launch-Evals plus monatelanger Community-Einsatz und ~3,3 Mio. Downloads pro Monat.

Die obige Übersicht ist dieselbe Darstellung in sechs Zeilen: Die beiden Modelle weichen bei fast jeder Dimension voneinander ab, und die Spalten, die über die Wahl entscheiden – Modalität, Sprachen, Geräteklasse – sind genau die, die kein Benchmark-Durchschnitt erfasst.
Wo die 12B gewinnt: die Dinge, die ein reines Text-2B nicht vortäuschen kann
Beginnen wir mit der Modalität. Gemma 4 12B verarbeitet nativ Audio, Bilder und Video; MiniCPM5-2B ist rein textbasiert. Jedes Produkt, das transkribiert, auf einen Bildschirm schaut oder ein Video ansieht, benötigt neben der 2B eine zweite Pipeline, und an diesem Punkt verflüchtigt sich der Vorteil des „kleinen Modells“ teilweise. Sprachen sind die zweite Hürde: 140+ gegenüber einem auf Englisch/Chinesisch ausgerichteten Release. Für ein Produkt, das eine lange Reihe von Sprachen bedient, ist die 2B überhaupt kein Kandidat. Und dann ist da die Evidenz. Gemma 4 12B wurde millionenfach heruntergeladen, quantisiert, feinabgestimmt und wird seit drei Monaten in der Produktion eingesetzt; seine Fehlermodi sind dokumentiert, und sein Ökosystem umfasst llama.cpp, Ollama, LM Studio, MLX, vLLM und SGLang. MiniCPM5-2B ist ein eine Woche altes Repository, dessen Schlagzahlen — darunter eine vom Anbieter erzielte 46,4 bei SWE-bench Verified, die für ein dichtes 2,5B-Modell bemerkenswert wäre, falls sie unabhängige Tests übersteht — von niemandem außerhalb des Labors verifiziert wurden. Allein was die Reife angeht, ist die Entscheidung eindeutig.
Wo die 2B die einzige Option ist
Für die Geräteklasse, in die eine 12B schlicht nicht passt, spielt all das keine Rolle. Ein Smartphone, ein Smart-Cockpit-Board oder eine kleine Edge-Box mit ein paar Gigabyte DRAM kann die Gewichte eines 11,95B-Modells nicht mit brauchbarer Geschwindigkeit über den Speicherbus bewegen – genau das ist der Engpass, an dem es scheitern würde. MiniCPM5-2B wurde für genau diese Welt gebaut: Gewichte, die in den Gerätespeicher passen, ein 128K-Kontextfenster für lange Agentensitzungen, natives Tool-Calling, das für den interaktiven Betrieb ausgelegt ist, und eine Anpassung an neun Chip-Familien plus ARM ab dem ersten Tag. Wenn Ihre Zielplattform eine Smartphone-NPU oder ein Embedded-Board ist, steht Gemma 4 12B nicht in Konkurrenz zu MiniCPM5-2B – dort ist es überhaupt nicht einsetzbar. Und wenn Ihre Zielplattform eine 12B gerade eben noch verkraften kann – etwa ein Laptop mit 16 GB RAM –, verschafft Ihnen die 2B Spielraum: geringere Latenz pro Token, geringerer Stromverbrauch und die Möglichkeit, im selben Speicherbudget ein zweites Modell zu betreiben.
So finden Sie heraus, welche Ansprüche bestehen bleiben
Da beide Seiten Open-Weight-Modelle sind und sich selbst hosten lassen, ist der ehrliche nächste Schritt die Messung auf der eigenen Hardware und nicht das erneute Lesen der Modellkarten. Wenn Sie ein MiniCPM5-2B gegen ein Gemma 4 12B auf einer Workload abwägen, die Sie bereits betreiben, ist das auch der Punkt, an dem sich eine Routing-Schicht auszahlt: Den Testpfad über eine einzige API mit automatischem Failover auf einen neuen selbst gehosteten Checkpoint zu richten, bedeutet, dass ein unerprobter Stack ins Stocken geraten oder sich in einer Schleife verlieren kann, ohne die Produktion lahmzulegen, während die Listenpreise der Anbieter für das jeweilige Vergleichsmodell mit 0 % Aufschlag durchgereicht werden. Das Modell selbst ist ein erst einen Tag altes Repo, also ist es standardmäßig als Experiment zu behandeln – aber das Experiment ist günstig durchzuführen, und die zwei Stunden, die es braucht, um SWE-bench oder einen Ausschnitt Ihres eigenen Evaluierungssatzes auf der 2B zu reproduzieren, sind genau die Evidenz, die in diesem Vergleich fehlt.
Das Urteil
Wählen Sie Gemma 4 12B, wenn Ihre Hardware genügend Leistungsreserven hat und Ihre Arbeitslast über reinen Text hinausgeht – ein multimodales Produkt, ein mehrsprachiges Publikum oder etwas, bei dem drei Monate Community-bewährtes Verhalten mehr zählen als eine Ranking-Krone. Wählen Sie MiniCPM5-2B, wenn Ihr Gerät eine 12B überhaupt nicht tragen kann oder wenn eine textfähige, agentenorientierte 2.5B auf einem Smartphone-Chip es Ihnen ermöglicht, ein Produkt auszuliefern, das ein größeres Modell unmöglich macht. Der Spitzenreiter der Sub-4B-Rangliste ist eine echte Leistung, und seine Veröffentlichung mit offenen Gewichten macht ihn heute testbar; er ist jedoch nach der verfügbaren Evidenz kein Ersatz für einen 12B-Generalisten dort, wo eine 12B tatsächlich laufen kann.
