
MiniCPM5-2B-DSpark vs. Qwen3-8B: Der neue 2.5B-On-Device-Stack vs. das Open-Weights-Arbeitstier
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Jeder Modellvergleich verbirgt eine Hardware-Frage, und MiniCPM5-2B-DSpark gegen Qwen3-8B ist diese Frage im Gewand eines Benchmarks. Qwen3-8B ist Alibabas Open-Weights-Arbeitspferd vom April 2025 – grob 8,2 Mrd. dichte Parameter, 119 Sprachen, 32K nativer Kontext, erweiterbar auf 131K, hybride Denkmodi und sechzehn Monate Community-Erfahrung dahinter. MiniCPM5-2B-DSpark ist kein eigenständiges Modell, das man danebenstellen könnte: Es ist der 323,8-Millionen-Parameter-DSpark-Entwurfs-Checkpoint, den OpenBMB am 6. September 2026 still auf Hugging Face veröffentlicht hat, um MiniCPM5-2B zu beschleunigen, das dichte 2,52B-Offline-Gerätemodell, das ModelBest am 19. Juli 2026 auf der WAIC ankündigte. Stellt man die beiden nebeneinander, taucht die eigentliche Frage auf: Sollte die Arbeitslast, die derzeit auf einer 8B läuft, auf Hardware laufen, die nur eine 2B tragen kann – und ist eine 2,5B mit einem kostenlosen Entwurf gut genug, um den Wechsel zu rechtfertigen?
Die kurze Antwort lautet für die meisten Workloads noch nicht, aber die Gründe sind enger gefasst, als es die Größenlücke vermuten lässt, und es gibt eine Einsatzklasse, für die die 8B-Variante überhaupt keine Antwort hat. Alles Quantitative in diesem Beitrag stammt aus Anbieterangaben – MiniCPMs Zahlen sind ModelBests eigene, nicht reproduzierte; Qwen3-8Bs Zahlen stammen von Alibaba und sind seit Langem der Community-Nutzung ausgesetzt – daher sind die Kennzeichnungen wichtiger als die Ziffern.
Zwei Modelle an verschiedenen Stellen auf der Speicherkurve
MiniCPM5-2B ist ein dichter kausaler Transformer mit einem Drittel der Größe eines 8B-Modells – 42 Schichten, Grouped-Query-Attention, Apache-2.0 – entwickelt für die Geräteklasse, die ein großes Modell nicht erreichen kann: Smartphones, intelligente Cockpits und kleine Edge-Boxen, bei denen der Speicherbus an acht Milliarden Gewichten ersticken würde. Das Launch-Material legt den Schwerpunkt auf agentische Arbeit und langen Kontext statt auf schiere Breite: 128K nativer Kontext, und ModelBests Behauptung, dass das Modell in der eigenen Evaluierungssuite durchschnittlich 53,9 erreicht – laut Anbieter Open-Source-SOTA der 2B-Klasse, einschließlich eines vom Anbieter durchgeführten 46,4 bei SWE-bench Verified, das für eine 2B bemerkenswert wäre, falls es unabhängige Tests übersteht. Der DSpark-Entwurf ist die Durchsatz-Antwort auf den naheliegenden Einwand, dass ein kleines dichtes Modell schnell zu laden, aber langsam beim Generieren ist, weil jedes Token seine Gewichte über den Speicherbus zieht. Der Entwurf sieht vor, dass das Zielmodell bis zu sieben Token gleichzeitig verifiziert, und das Repository berichtet eine Greedy-Akzeptanz von 5,52 Token pro Verifikationsschritt insgesamt – 6,11 bei Code. Diese Zahl ist die Qualität des Entwurfs; seine Beschleunigung ist noch nicht gemessen, und es wurde keine Angabe zu Tokens pro Sekunde veröffentlicht.

Die obige Karte für openbmb/MiniCPM5-2B-DSpark ist die gesamte öffentliche Präsenz des stillen Releases vom 6. September: eine Serving-Zusatzkomponente, die die Akzeptanzlänge meldet – ohne Ankündigung und ohne tatsächliche Laufzeitbeschleunigung.
Qwen3-8B stammt aus derselben Architekturfamilie, ist dreimal so groß und sechzehn Monate älter. Es handelt sich um einen dichten kausalen Transformer mit Grouped-Query-Attention, der auf einem mehrsprachigen Korpus mit 36 Billionen Tokens trainiert wurde, unter Apache-2.0 lizenziert ist und zu den am weitesten verbreiteten selbst gehosteten und bereitgestellten 8B-Modellen in der Open-Weights-Welt gehört. Sein Markenzeichen ist der hybride Qwen3-Reasoning-Modus – Denken pro Anfrage ein- oder ausschaltbar – und sein Profil ist bewusst breit gefächert: MMLU im oberen 70er-Bereich, starke Ergebnisse bei GSM8K und beim Programmieren, 119 Sprachen. Es braucht eine echte GPU oder eine leistungsfähige Edge-Box: Bei praktischer Quantisierung liegt es im unteren Gigabyte-Bereich und läuft problemlos auf einer Mittelklasse-Grafikkarte, nicht auf einem Smartphone.

Alibabas obige Modellkarte für Qwen3-8B ist das Gesicht des Amtsinhabers: sechzehn Monate dokumentierten, von der Community getesteten Verhaltens in 119 Sprachen.
Wo die 8B immer noch gewinnt
Steigt man in eine niedrigere Gewichtsklasse ab, gibt man drei konkrete Dinge auf. Erstens: Sprachen. Qwen3-8B deckt 119 Sprachen ab; die Model Card und die Datensätze von MiniCPM5-2B sind auf Englisch und Chinesisch ausgerichtet, und auf eine breite Mehrsprachigkeit wird kein Anspruch erhoben. Für ein Produkt, das Long-Tail-Sprachen bedient, ist das eine harte Wand, keine weiche. Zweitens: die Beweislage. Qwen3-8B wurde sechzehn Monate lang geprüft, quantisiert, feinjustiert und in großem Maßstab eingesetzt; seine Fehlermodi sind bekannt, seine Quantisierungen vorhanden, sein Ökosystem ist überall. MiniCPM5-2B ist ein Release vom Juli 2026 mit einer vom Anbieter betriebenen Bestenliste und ohne unabhängige Reproduktion – und der Entwurf ist erst einen Tag alt. Drittens: der Serving-Stack. Alles, was bereits mit Qwen3-8B spricht – vLLM, SGLang, llama.cpp, tausend Fine-Tunes – spricht mit einem ausgereiften Zielsystem, während der MiniCPM-Entwurf den Bau einer Speculative-Decoding-Engine auf Basis des DSPARK-Algorithmus von SGLang erfordert, den das Repo zwar dokumentiert, den das breitere Ökosystem aber noch nicht übernommen hat.
Wo der 2B-Stack die einzige Option ist
Für die Geräteklasse, in die ein 8B-Modell schlicht nicht hineinpasst, spielt all das keine Rolle. Auf einem Smartphone oder einem Edge-Board mit ein paar Gigabyte DRAM konkurriert Qwen3-8B nicht mit MiniCPM5-2B – es ist dort überhaupt nicht mit brauchbarer Geschwindigkeit einsetzbar. Genau deshalb gibt es den 2B-Stack, und deshalb ist das Draft-Modell der lasttragende Teil dieses Releases und nicht bloßes Beiwerk. Spekulative Dekodierung ist ausgerechnet in dem dichten, speichergebundenen Regime am effektivsten, in dem ein kleines Modell auf kleiner Hardware lebt: Ein kompaktes Draft-Modell schlägt einen Block vor, das Zielmodell verifiziert ihn in einem Durchgang, und die Kosten für das Laden der Gewichte fallen einmal pro Block an statt einmal pro Token. Die von DeepSeek stammende DSpark-Methode (arXiv 2607.05147) wurde für Serving-Systeme mit hoher Nebenläufigkeit entwickelt, aber ihre Mechanik – und die Akzeptanzzahlen in diesem Repo – sind der entscheidende Hebel für ein 2B-Modell, das sich auf beschränkter Hardware interaktiv anfühlen muss. Behalte nur den ehrlichen Vorbehalt im Blick: OpenBMB hat die Akzeptanz des Draft-Modells gemessen, nicht seine Beschleunigung – den tatsächlichen Zugewinn an Tokens pro Sekunde auf deinem Zielgerät musst du also selbst messen.
Die Anzeigetafel, ehrlich beschriftet
• Release — MiniCPM5-2B: 19. Juli 2026 (angekündigt); MiniCPM5-2B-DSpark: 6. September 2026, still. Qwen3-8B: April 2025, angekündigt.
• Größe — MiniCPM5-2B: 2,52 Mrd. Parameter (dense), plus ein 324-M-Draft-Modell. Qwen3-8B: ~8,2 Mrd. Parameter (dense).
• Kontext — MiniCPM5-2B: 128K nativ. Qwen3-8B: 32K nativ, 131K über YaRN.
• Sprachen — MiniCPM5-2B: auf Englisch/Chinesisch ausgerichtet. Qwen3-8B: 119.
• Denken — MiniCPM5-2B: hybride schnelle/überlegte Modi laut den Startmaterialien. Qwen3-8B: Denken je nach Anfrage ein- oder ausschaltbar.
• Belege — Die MiniCPM-Werte sind Angaben aus der ModelBest-Modellkarte (durchschnittlich 53,9 in der eigenen Suite; kein unabhängiger Durchlauf). Die Qwen3-8B-Werte stammen von Alibaba und sind seit sechzehn Monaten der Community zugänglich.

Das obige Scoreboard zeigt die Diskrepanz ehrlich auf: Die Spalten unterscheiden sich in fast allem, außer bei der offenen Apache-2.0-Lizenz, und die Geräteklasse, an die Sie ausliefern, entscheidet, welche Spalte Ihnen überhaupt zur Auswahl steht.
Die Routing-Realität
Keines der beiden Modelle befindet sich derzeit in einem gehosteten Katalog auf OrcaRouter, daher findet dieser Vergleich vollständig in der Selbsthosting-Welt statt — aber genau dort verdient eine Routing-Ebene nach wie vor ihre Daseinsberechtigung. Qwen3-8B wird von seinem Anbieter und mehreren Drittanbieter-Plattformen bereitgestellt; MiniCPM5-2B und sein Draft-Modell betreibt man selbst. Wenn ein Team testen möchte, ob ein 2,5B-Stack einen Teil einer 8B-Workload tragen kann, besteht der reversible Schritt darin, einen Testpfad über eine einzige API mit automatischem Failover auf einen selbst gehosteten SGLang-Build aus MiniCPM5-2B plus Draft zu richten — die Produktion bleibt beim bisherigen Modell, der neue Stack kann ins Stocken geraten, ohne etwas lahmzulegen, und die Listenpreise der Anbieter werden im gesamten Vergleich mit 0 % Aufschlag durchgereicht, sodass der A/B-Test günstig und reversibel ist und keine Wette darstellt. Die Ebene hostet keines der beiden Modelle; sie macht das Experiment sicher durchführbar.
Wer sollte umziehen, und wer sollte warten
Bleiben Sie bei Qwen3-8B für alles Mehrsprachige, für alles, was sechzehn Monate bekanntes Verhalten benötigt, oder für jede Workload, die bereits auf Hardware läuft, die eine 8B bequem trägt – die Größendifferenz ist kein Grund für eine Migration, und die Evidenzlücke spricht dagegen. Testen Sie den MiniCPM5-2B-Stack mit seinem DSpark-Draft nur ernsthaft, wenn Ihr Zielgerät die 8B überhaupt nicht tragen kann oder wenn eine 2.5B, die bei agentischen und Long-Context-Aufgaben mithält, Ihnen erlauben würde, Speicher und Strom auf Hardware zu sparen, die Sie bereits ausliefern. Und bevor Sie sich auf den Draft festlegen, führen Sie die Messung durch, die OpenBMB nicht veröffentlicht hat: Akzeptanzlänge ist nicht Latenz, und der Tokens-pro-Sekunde-Gewinn auf Ihrem Gerät ist die Zahl, die tatsächlich entscheidet, ob der stille kleine Checkpoint auf Hugging Face den Download wert war.
