
MiniCPM5-2B vs Qwen 3 8B: Sollte eine 8B-Workload auf eine 2.5B heruntergestuft werden?
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Jeder Modellvergleich verbirgt eine Hardware-Frage, und MiniCPM5-2B versus Qwen 3 8B ist diese Frage im Benchmark-Gewand. Qwen 3 8B ist Alibabas Arbeitstier mit offenen Gewichten vom April 2025 – rund 8,2B dichte Parameter, 119 Sprachen, hybrides Denken pro Anfrage ein- oder ausschaltbar und sechzehn Monate an Community-Belegen, die dahinterstehen. MiniCPM5-2B ist das Modell, das ModelBest und OpenBMB am 19. Juli auf der World Artificial Intelligence Conference als bestplatziertes Sub-4B-Modell auf dem Leaderboard von Artificial Analysis vorstellten. Seine offenen Gewichte gingen am 6. und 7. September still auf Hugging Face online. Die Frage, die sie tatsächlich auf eine Seite bringt, ist die, die sich die meisten Teams, die ein offenes 8B-Modell betreiben, irgendwann selbst stellen: Könnte die Workload, die ich auf einem 8B-Modell laufen lasse, auf ein 2,5B-Modell umziehen – und wenn ja, was würde ich aufgeben?
Kurz gesagt: Noch nicht für die meisten Workloads – aber die Gründe sind enger gefasst, als es der vierfache Größenunterschied vermuten lässt, und es gibt eine Klasse von Einsatzszenarien, für die das 8B überhaupt keine Antwort hat. Alle quantitativen Angaben unten sind Herstellerangaben und als solche gekennzeichnet: Die Zahlen des MiniCPM5-2B sind ModelBests eigene Modellkarten-Angaben, eine Woche alt und von niemandem außerhalb des Labors reproduziert; die des Qwen 3 8B stammen von Alibaba und wurden von einer großen Community längst unter die Lupe genommen, quantisiert und erneut ausgeführt. Diese Asymmetrie der Belege ist die eigentliche Schlagzeile dieses Vergleichs.
Sechzehn Monate mit Qwen 3 8B
Qwen 3 8B stammt aus derselben Architekturfamilie, ist dreimal so groß und sechzehn Monate älter als sein Konkurrent. Es ist ein dichter kausaler Transformer mit Grouped-Query-Attention, vortrainiert auf einem mehrsprachigen Korpus von etwa 36 Billionen Tokens, Apache-2.0-lizenziert und eines der am weitesten verbreiteten selbst gehosteten und bereitgestellten 8B-Modelle in der Welt der offenen Gewichte. Sein Markenzeichen ist der hybride Denkmodus von Qwen3 – das Denken pro Anfrage ein- oder ausgeschaltet werden kann, sodass eine einzelne Bereitstellung schnelle Fragen schnell beantworten lässt und für Mathematik oder Code zu einer bewussten Gedankenkette wechseln kann. Es bringt natives Model Context Protocol und Funktionsaufrufe mit, einen nativen 32K-Kontext, den Alibaba per YaRN-Skalierung bis 131K validiert, sowie Abdeckung von 119 Sprachen und Dialekten. Nach sechzehn Monaten sind seine Fehlermodi dokumentiert, seine Quantisierungen allgegenwärtig, und der Serving-Stack darum herum – vLLM, SGLang, llama.cpp, tausende Fine-Tunings – ist ausgereift. Bei praktischer Quantisierung läuft es im niedrigen Gigabyte-Bereich, bequem auf einer Mittelklasse-GPU, nicht auf einem Telefon.

Was MiniCPM5-2B in jener Welt behauptet
MiniCPM5-2B kommt aus der entgegengesetzten Richtung: von der Konzeption her klein, durch das Training agentisch. Es ist ein dichter Transformer mit insgesamt 2,52 Mrd. Parametern (1,98 Mrd. Non-Embedding-Parametern), 42 Schichten bei einer Hidden Size von 2048, Grouped-Query Attention, einer Standard-LlamaForCausalLM-Architektur ohne benutzerdefinierte Kernel und einem Kontextfenster von 131.072 Token in der ausgelieferten Konfiguration (die Launch-Materialien vom Juli warben mit 512K; die veröffentlichte Konfiguration enthält das nicht). Während Qwen 3 8B seine Breite einem mehrsprachigen Pretraining-Lauf mit 36 Billionen Token verdankt, erhält MiniCPM5-2B seine Form durch Post-Training: SFT auf 400 Mrd. Token an Deep-Thinking-Daten, gefolgt von einer On-Policy-Distillation, die sechzehn RL-Expertenmodelle – fünf davon agentisch – wieder zu einem kleinen dichten Netzwerk zusammenführt. Der Launch-Pitch war eine On-Device-Agentenbasis – natives Tool-Calling über XML-artige Aufrufe, Day-Zero-Unterstützung für neun Chip-Familien plus ARM, hybride schnelle/bedachte Modi – und das Datenblatt beansprucht einen internen Durchschnitt von 53,9 bei seinem anbieterausgewählten 2B-4B-Vergleichssatz, einen AIME-2025/2026-Score von 86,5 und einen vom Anbieter erzielten Wert von 46,4 bei SWE-bench Verified, was für ein 2,5B-Modell bemerkenswert wäre, falls es unabhängige Tests übersteht.

Die Diskrepanz, Dimension für Dimension
• Veröffentlichung — MiniCPM5-2B: angekündigt am 19. Juli 2026; Gewichte ab 6.–7. September verfügbar. Qwen 3 8B: angekündigt im April 2025.
• Größe — MiniCPM5-2B: 2,52 Mrd. gesamt / 1,98 Mrd. ohne Embedding, dicht. Qwen 3 8B: ~8,2 Mrd. dicht.
• Kontext — MiniCPM5-2B: 131.072 Token in der ausgelieferten Konfiguration. Qwen 3 8B: 32K nativ, 131K per YaRN validiert.
• Sprachen — MiniCPM5-2B: auf Englisch und Chinesisch ausgerichtet. Qwen 3 8B: 119 Sprachen und Dialekte.
• Reasoning — MiniCPM5-2B: hybride schnelle/überlegte Modi, laut Launch-Materialien. Qwen 3 8B: Qwen3-Denken je nach Anfrage ein- oder ausschaltbar.
• Belege — MiniCPM5-2B: Anbieterkarte, kein unabhängiger Testlauf. Qwen 3 8B: von Alibaba gemeldet, sechzehn Monate Community-Reproduktion und -Bereitstellung.

Das obige Scoreboard zeigt die Diskrepanz ehrlich auf: Die Spalten unterscheiden sich in fast allem, außer bei der offenen Apache-2.0-Lizenz, und die Geräteklasse, an die Sie ausliefern, entscheidet, welche Spalte Ihnen überhaupt zur Auswahl steht.
Wo die 8B immer noch gewinnt
Wer in eine niedrigere Gewichtsklasse wechselt, gibt drei konkrete Dinge auf. Zuerst die Sprachen: Qwen 3 8B deckt 119 Sprachen ab; die Model Card und die Daten von MiniCPM5-2B sind auf Englisch und Chinesisch ausgerichtet, und es wird keine mehrsprachige Breite beansprucht. Für ein Produkt, das einen Long Tail an Sprachen bedienen muss, ist das eine harte Grenze, keine weiche. Zweitens die Belege: Sechzehn Monate Tests durch die Community bedeuten, dass das Verhalten von Qwen 3 8B bekannt ist und sein Ökosystem überall präsent ist, während MiniCPM5-2B ein eine Woche altes Repository mit einer unverifizierten Model Card ist – und seine angekündigten Kennzahlen sind, falls sie unabhängige Testläufe nicht überstehen, genau die Art von Kennzahlen, die stillschweigend revidiert werden. Drittens der Serving-Stack: Alles, was bereits mit Qwen 3 8B spricht, spricht mit einem ausgereiften Zielsystem, während ein brandneuer Checkpoint der 2B-Klasse bedeutet, Quantisierungen, Serving-Konfigurationen und Tool-Calling-Verhalten von Grund auf neu zu validieren. Nichts davon ist ein Grund, warum das 2B-Modell bei einem bestimmten Benchmark nicht gewinnen kann; es sind Gründe, warum das 8B-Modell überall dort, wo es passt, die risikoärmere Standardwahl ist.
Wo ein 2B die einzige Antwort ist
All das spielt keine Rolle bei der Geräteklasse, in die ein 8B schlicht nicht hineinpasst. Auf einem Telefon, einem Smart-Cockpit-Board oder einer kleinen Edge-Box mit ein paar Gigabyte DRAM tritt Qwen 3 8B nicht gegen MiniCPM5-2B an – es ist zu keiner brauchbaren Geschwindigkeit einsetzbar. Das ist der einzige Grund, warum es die 2B gibt, und genau deshalb ist die ehrliche Einordnung dieses Vergleichs nicht „ist die 2B so gut wie die 8B", sondern „welche meiner Bereitstellungen kann nur durch eines dieser beiden Modelle bedient werden". Wenn Sie On-Device-Agenten ausliefern, bei denen der Speicherbus an acht Milliarden Gewichten ersticken würde, ist MiniCPM5-2B eine der aggressivst trainierten Optionen der 2B-Klasse auf dem Markt, und die einzig lohnende Frage ist, ob ihre agentischen Behauptungen Ihrer eigenen Reproduktion standhalten. Wenn Ihre Arbeitslast bereits auf Hardware läuft, die eine 8B problemlos trägt, ist die reine Größendifferenz kein Grund für einen Umstieg – und die Evidenzlücke spricht dagegen.
Wenn Sie darüber nachdenken, zu wechseln
Der sichere Weg, den Wechsel zu testen, besteht darin, ihn als Experiment zu behandeln, nicht als Migration. Stellen Sie MiniCPM5-2B auf Ihrer eigenen Hardware bereit, leiten Sie einen Teil des echten Datenverkehrs über eine API mit automatischem Failover darauf und vergleichen Sie sie bei denselben Anfragen mit der 8B – eine Routing-Ebene zahlt sich hier aus, denn ein eine Woche alter Checkpoint kann ins Stocken geraten oder sich in einer Schleife verlieren, ohne die Produktion lahmzulegen, und die Listenpreise des Anbieters für die gehosteten Modelle, mit denen Sie vergleichen, werden mit 0 % Aufschlag durchgereicht. Was Sie wirklich testen, sind drei Dinge: ob die Genauigkeit der 2B auf Ihren Daten hält, ob ihre Latenz auf Ihrer Geräteklasse besser ist als die der 8B auf der Hardware, die Sie andernfalls kaufen würden, und ob das englisch-chinesische Sprachprofil die Nutzer abdeckt, die Sie tatsächlich haben. Reproduzieren Sie zuerst SWE-bench oder einen Ausschnitt Ihres eigenen Evaluierungssatzes – die zwei Stunden, die das dauert, sind die günstigste Versicherung, die dieser Vergleich bietet.
Das Urteil
Bleiben Sie für alles Mehrsprachige, für alles, was sechzehn Monate bekanntes Verhalten benötigt, oder für jede Arbeitslast, die bereits auf Hardware läuft, die ein 8B problemlos trägt, bei Qwen 3 8B. Testen Sie MiniCPM5-2B nur ernsthaft, wenn Ihr Zielgerät das 8B überhaupt nicht tragen kann, oder wenn ein 2.5B, das bei agentischen und Long-Context-Aufgaben mithält, es Ihnen erlauben würde, Speicher und Strom auf bereits ausgelieferter Hardware zu reduzieren. Der Spitzenreiter im Sub-4B-Ranking ist eine echte Leistung, und seine Veröffentlichung mit offenen Gewichten macht ihn heute testbar; er ist jedoch nach der vorliegenden Evidenz schlicht noch kein Grund, ein 8B-Arbeitspferd in den Ruhestand zu schicken, das sich seinen Platz bereits verdient hat.
