
MiniCPM5-2B-DSpark contre Qwen3-8B : la nouvelle stack embarquée de 2,5B contre le cheval de trait à poids ouverts
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Toute comparaison de modèles cache une question matérielle, et MiniCPM5-2B-DSpark contre Qwen3-8B, c'est cette question déguisée en benchmark. Qwen3-8B est le cheval de trait open-weights d'Alibaba d'avril 2025 — environ 8,2 milliards de paramètres denses, 119 langues, un contexte natif de 32K extensible à 131K, des modes de raisonnement hybrides, et seize mois de preuves de la communauté derrière lui. MiniCPM5-2B-DSpark n'est pas un modèle autonome à placer à côté de lui : c'est le checkpoint draft DSpark de 323,8 millions de paramètres qu'OpenBMB a discrètement publié sur Hugging Face le 6 septembre 2026 pour accélérer MiniCPM5-2B, le modèle embarqué dense de 2,52 milliards que ModelBest a annoncé au WAIC le 19 juillet 2026. Réunissez les deux et la vraie question apparaît : la charge de travail qui tourne actuellement sur un 8B devrait-elle être exécutée sur un matériel qui ne peut porter qu'un 2B — et un 2,5B avec un draft gratuit suffit-il pour franchir le pas ?
La réponse courte est : pas encore pour la plupart des charges de travail, mais les raisons sont plus circonscrites que ne le suggère l’écart de taille, et il existe une catégorie de déploiements pour laquelle le modèle 8B n’a aucune réponse du tout. Toutes les données quantitatives de cet article proviennent des fournisseurs — les chiffres de MiniCPM sont ceux de ModelBest lui-même, non reproduits ; ceux de Qwen3-8B sont ceux d’Alibaba, exposés depuis longtemps à l’usage communautaire — les étiquettes comptent donc plus que les chiffres.
Deux modèles à différents endroits de la courbe de mémoire.
MiniCPM5-2B est un Transformer causal dense, au tiers de la taille d’un 8B — 42 couches, attention par requêtes groupées, Apache-2.0 — conçu pour la classe d’appareils qu’un grand modèle ne peut pas atteindre : téléphones, cockpits intelligents et petits boîtiers edge où le bus mémoire s’engorgerait avec huit milliards de poids. Ses documents de lancement mettent l’accent sur le travail agentique et le contexte long plutôt que sur l’étendue brute : 128K de contexte natif, et ModelBest affirme que sur sa propre suite d’évaluation le modèle obtient une moyenne de 53,9 — un SOTA open-source de la classe 2B, selon le fournisseur, avec notamment un 46,4 sur SWE-bench Verified, obtenu par le fournisseur, qui serait remarquable pour un 2B s’il survit à des tests indépendants. La prépublication DSpark est la réponse en matière de débit à l’objection évidente qu’un petit modèle dense est rapide à charger mais lent à générer, car chaque jeton doit faire traverser ses poids par le bus mémoire. La prépublication propose jusqu’à sept jetons à la fois pour que la cible les vérifie, et le dépôt rapporte une acceptation gloutonne de 5,52 jetons par étape de vérification en agrégat — 6,11 sur du code. Ce chiffre est la qualité de la prépublication ; son accélération n’est pas encore mesurée, et aucun chiffre de jetons par seconde n’a été publié.

La fiche openbmb/MiniCPM5-2B-DSpark ci-dessus constitue toute la surface publique de la discrète version du 6 septembre : un accessoire de service indiquant la longueur d'acceptation, sans annonce ni accélération mesurée à l'horloge murale.
Qwen3-8B est de la même famille architecturale, trois fois plus volumineux et seize mois plus ancien. C'est un Transformer causal dense à attention par requêtes groupées, entraîné sur un corpus multilingue de 36 000 milliards de tokens, sous licence Apache-2.0, et l'un des modèles 8B les plus largement auto-hébergés et servis dans le monde des poids ouverts. Sa marque de fabrique est le mode de raisonnement hybride de Qwen3 — réflexion activée ou désactivée à chaque requête — et son positionnement est volontairement généraliste : un MMLU de l'ordre de 78, de solides résultats en GSM8K et en génération de code, 119 langues. Il lui faut un vrai GPU ou une machine edge costaude : en quantification pratique, il tient dans quelques gigaoctets, tourne confortablement sur une carte graphique de milieu de gamme, mais pas sur un téléphone.

La fiche modèle d'Alibaba pour Qwen3-8B ci-dessus est le visage du titulaire : seize mois de comportement documenté et testé par la communauté dans 119 langues.
Là où le 8B gagne encore
Descendre d'une catégorie de poids, c'est renoncer à trois choses concrètes. D'abord, les langues : Qwen3-8B en couvre 119 ; la fiche et les jeux de données de MiniCPM5-2B sont centrés sur l'anglais et le chinois, et aucune largeur multilingue n'est revendiquée. Pour un produit qui dessert une longue traîne de langues, c'est un mur dur, pas un mur souple. Deuxièmement, les preuves : les chiffres de Qwen3-8B ont été mis à l'épreuve, quantifiés, affinés et servis à grande échelle pendant seize mois ; ses modes de défaillance sont connus, ses quantifications existent, son écosystème est partout. MiniCPM5-2B est une sortie de juillet 2026 avec un tableau de scores tenu par le fournisseur et aucune reproduction indépendante, et le draft date d'un jour. Troisièmement, la pile d'inférence : tout ce qui parle déjà à Qwen3-8B — vLLM, SGLang, llama.cpp, mille fine-tunes — parle à une cible mature, tandis que le draft MiniCPM exige de construire un moteur de décodage spéculatif (l'algorithme DSPARK de SGLang) que le dépôt documente mais que l'écosystème au sens large n'a pas encore intégré.
Là où la stack 2B est la seule option.
Rien de tout cela n'a d'importance pour la classe d'appareils où un 8B ne tient tout simplement pas. Sur un téléphone ou une carte edge dotée de quelques gigaoctets de DRAM, Qwen3-8B n'est pas en concurrence avec MiniCPM5-2B — il ne peut tout simplement pas être déployé à une vitesse exploitable. Voilà toute la raison d'être de la stack 2B, et c'est pourquoi le draft est l'élément porteur de cette sortie plutôt qu'un simple ornement. Le décodage spéculatif est le plus efficace précisément dans le régime dense et limité par la mémoire où vit un petit modèle sur une petite puce : un drafter compact propose un bloc, le modèle cible le vérifie en un seul passage, et le coût de chargement des poids n'est payé qu'une fois par bloc au lieu d'une fois par jeton. La méthode DSpark, issue de DeepSeek (arXiv 2607.05147), a été conçue pour les systèmes de serving à forte concurrence, mais ses mécanismes — et les taux d'acceptation publiés sur ce dépôt — constituent le levier pertinent pour un 2B qui doit donner l'impression d'être interactif sur du matériel contraint. Gardez simplement à l'esprit cet avertissement honnête : OpenBMB a mesuré le taux d'acceptation du draft, pas son accélération. C'est donc encore à vous de mesurer le gain réel en tokens par seconde sur votre appareil cible.
Le tableau d'affichage, honnêtement étiqueté
• Sortie — MiniCPM5-2B : 19 juillet 2026 (annoncée) ; MiniCPM5-2B-DSpark : 6 septembre 2026, en toute discrétion. Qwen3-8B : avril 2025, annoncée.
• Taille — MiniCPM5-2B : 2,52B dense, plus un draft de 324M. Qwen3-8B : ~8,2B dense.
• Contexte — MiniCPM5-2B : 128K natif. Qwen3-8B : 32K natif, 131K via YaRN.
• Langues — MiniCPM5-2B : centré sur l'anglais/chinois. Qwen3-8B : 119.
• Raisonnement — MiniCPM5-2B : modes hybrides rapide/réfléchi selon les supports de lancement. Qwen3-8B : réflexion activée ou désactivée selon la demande.
• Preuve — Les chiffres de MiniCPM sont des affirmations de la fiche de ModelBest (moyenne de 53,9 sur sa propre suite ; aucun test indépendant). Les chiffres de Qwen3-8B sont rapportés par Alibaba, exposés à la communauté depuis seize mois.

Le tableau ci-dessus représente honnêtement l’inadéquation : les colonnes diffèrent sur presque tout, à l’exception de la licence ouverte Apache-2.0, et la classe d’appareils que vous ciblez détermine quelle colonne vous êtes autorisé à choisir.
La réalité du routage
Aucun des deux modèles ne figure aujourd'hui dans le catalogue hébergé d'OrcaRouter : cette comparaison se joue donc entièrement dans le monde de l'auto-hébergement — mais c'est exactement là qu'une couche de routage trouve encore sa raison d'être. Qwen3-8B est servi par son fournisseur et par plusieurs plateformes tierces ; MiniCPM5-2B et son modèle draft, en revanche, sont des modèles que vous exécutez vous-même. Quand une équipe veut tester si une stack 2.5B peut prendre en charge une partie d'une charge de travail 8B, la démarche réversible consiste à pointer un chemin de test vers un build SGLang auto-hébergé MiniCPM5-2B-plus-draft via une API unique avec basculement automatique — la production reste sur la solution en place, la nouvelle stack peut caler sans rien faire tomber, et les prix catalogue des fournisseurs impliqués dans toute la comparaison sont répercutés sans marge (0 %), si bien que le test A/B est peu coûteux et réversible plutôt qu'un pari. La couche n'héberge aucun des deux modèles ; elle permet de mener l'expérience en toute sécurité.
Qui doit bouger, et qui doit attendre
Restez sur Qwen3-8B pour tout besoin multilingue, pour tout ce qui exige seize mois de comportement connu, ou pour toute charge de travail déjà servie sur du matériel qui fait tourner un 8B confortablement : l'écart de taille n'est pas une raison de migrer, et le manque de preuves plaide contre. Ne testez sérieusement la pile MiniCPM5-2B avec son draft DSpark que si votre appareil cible ne peut pas du tout faire tourner le 8B, ou si un 2.5B qui suit la cadence sur le travail agentique et à long contexte vous permettrait de réduire la mémoire et la consommation d'énergie sur le matériel que vous expédiez déjà. Et avant de vous engager sur ce draft, effectuez la mesure qu'OpenBMB n'a pas publiée : la longueur d'acceptation n'est pas la latence, et le gain de tokens par seconde sur votre appareil est le chiffre qui décide réellement si le petit checkpoint discret sur Hugging Face valait le téléchargement.
