
MiniCPM5-2B-DSpark vs Gemma 4 12B : Deux façons de rédiger, deux classes de poids d'IA locale
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Le moyen le plus rapide de comprendre pourquoi MiniCPM5-2B-DSpark et Gemma 4 12B méritent d'être comparés est d'ignorer un instant leur taille et d'observer comment chacun écrit une phrase. Tous deux contournent le bus mémoire grâce à un drafter : un petit modèle propose plusieurs prochains tokens à la fois et le vrai modèle vérifie le bloc en une seule passe, si bien que le silicium ne paie le coût de chargement des poids qu'une fois par bloc au lieu d'une fois par token. MiniCPM5-2B-DSpark est le draft qu'OpenBMB a discrètement publié sur Hugging Face le 6 septembre 2026 — un checkpoint compagnon de 323,8 millions de paramètres qui accélère MiniCPM5-2B, le modèle dense de 2,52 milliards de paramètres sur appareil que ModelBest a annoncé au WAIC le 19 juillet 2026. Gemma 4 12B est le généraliste multimodal sans encodeur de 11,95 milliards de paramètres de Google, lancé le 3 juin 2026 avec ses propres drafter intégrés et un contexte de 256K. L'un vend le drafter comme un checkpoint Apache-2.0 séparé que vous chargez vous-même ; l'autre cache une astuce similaire dans un seul grand modèle que vous vous contentez d'exécuter.
La note d'honnêteté qui détermine la forme de cet article : MiniCPM5-2B-DSpark n'est pas un modèle que l'on peut interroger par un prompt. Il ne possède ni tokenizer, ni chat template, ni sortie autonome — une fiche qui ne répertorie qu'un model.safetensors, une config et un README. C'est un accessoire de la couche de service pour une cible de classe 2B, et la véritable comparaison que fait le lecteur se joue entre deux classes de poids d'IA locale : une pile 2B de la taille d'un téléphone qui ébauche ses tokens, contre un généraliste 12B de 16 Go qui ébauche ses tokens. Tout le reste ci-dessous n'est que cette décision rendue concrète.
Ce qu'est réellement MiniCPM5-2B-DSpark
La model card constitue toute la surface publique de la publication ; c'est donc tout ce que l'on peut en savoir. MiniCPM5-2B-DSpark est un checkpoint draft DSpark : cinq couches à attention complète, 323 776 001 paramètres, attention à requêtes groupées avec 16 têtes de requête et 2 têtes KV, et une taille de bloc de sept — il propose jusqu'à sept jetons candidats par passage avant, que la cible MiniCPM5-2B doit vérifier. La config déclare l'architecture Qwen3DSparkModel avec un auto-map DSparkDraftModel, et elle est livrée avec la tête de confiance et la tête de Markov de la méthode DSpark (arXiv 2607.05147, l'article DeepSeek de juillet 2026) toujours activées — le vérificateur sensible à la charge qui décide quand un suffixe ne vaut pas la peine d'être vérifié. Il a été entraîné pendant six époques sur 7,05 milliards de jetons de réponses générées par MiniCPM5-2B à partir de prompts généraux, mathématiques et de code.

La fiche du modèle openbmb/MiniCPM5-2B-DSpark ci-dessus est tout ce qui a été publié : fiche du modèle, configuration, un fichier Safetensors, et aucune annonce, aucun article de blog, aucun communiqué de presse — une sortie discrète des poids, vieille d'un jour au moment de la rédaction.
Ce que la carte ne contient pas est aussi important que ce qu'elle contient. Elle indique la longueur d'acceptation — sur l'évaluation propre du dépôt, une moyenne de 5,52 jetons acceptés par étape de vérification en décodage glouton, avec 6,05 en mathématiques et 6,11 en code sur un plafond de sept jetons — mais elle ne publie ni accélération en temps réel, ni chiffre de jetons par seconde, ni benchmark indépendant. Le moteur DSPARK de SGLang est le chemin de service documenté, le draft étant chargé à côté de la cible MiniCPM5-2B. En d'autres termes : la qualité du draft est quantifiée, son gain concret ne l'est pas encore, et quiconque l'adopte devrait mesurer avant de croire.
Ce que Gemma 4 12B apporte de l'autre côté
Gemma 4 12B est l'enfant du milieu de la famille Gemma 4 de Google et se situe sur un tout autre point de la courbe de l'IA locale. C'est un seul modèle dense de 11,95 milliards de paramètres qui accepte en entrée du texte, des images, de l'audio et de la vidéo sans encodeurs séparés, exécute les appels d'outils d'emblée, et associe un contexte natif de 256K à des drafters de prédiction multi-tokens qui exploitent en interne la même astuce de bus mémoire — mais depuis l'intérieur du checkpoint, si bien qu'il n'y a rien de plus à télécharger ni à connecter. Il est sous licence Apache 2.0, tourne en pratique sur un ordinateur portable de 16 Go et est arrivé avec tout l'appareil Google : évaluations de lancement, fiches de modèle pour les variantes base et instruction, support écosystémique sur Model Garden, LM Studio et Ollama. Il a derrière lui des mois de déploiement communautaire, ce que le draft MiniCPM vieux d'un jour n'a pas.

La fiche modèle de Google pour Gemma 4 12B ci-dessus illustre le contraste en une seule image : un généraliste multimodal mature dont les rédacteurs font partie de la version, et non d'un dépôt séparé.
Les spécifications, honnêtement étiquetées
Lisez ceci en gardant à l'esprit la provenance des données : les chiffres de MiniCPM5-2B proviennent des annonces de ModelBest, non reproduits ; les chiffres de Gemma 4 12B proviennent de Google, longtemps exposés à l'utilisation communautaire.
• Ce que vous exécutez — MiniCPM5-2B-DSpark : un modèle draft de 324M qui ne fonctionne qu'aux côtés de MiniCPM5-2B (2,52B dense, 42 couches). Gemma 4 12B : un modèle dense autonome de 11,95B.
• Contexte — MiniCPM5-2B cible : 128K natif. Gemma 4 12B : 256K natif.
● Modalité — Pile MiniCPM5-2B : texte uniquement. Gemma 4 12B : entrée texte, image, audio et vidéo, sans encodeur.
• Phase de draft — MiniCPM5-2B-DSpark : draft DSpark externe, sept jetons par passe, moteur SGLang DSPARK. Gemma 4 12B : modules de draft internes à prédiction multi-jetons, rien à installer.
• Empreinte mémoire — MiniCPM5-2B vise environ 5 Go en BF16, plus un fichier draft d'environ 650 Mo ; Gemma 4 12B occupe environ 18 Go en BF16 et devient exploitable en pratique sur du matériel de 16 Go une fois quantisé.
Preuves — MiniCPM5-2B-DSpark : chiffres de longueur d'acceptation du dépôt uniquement, vieux d'un jour. Gemma 4 12B : évaluations de lancement plus des mois de déploiement communautaire.

Le tableau ci-dessus est le même portrait en six rangées : les deux colonnes divergent sur presque tout, sauf sur la stratégie qu'elles utilisent toutes deux pour écrire vite.
Quelle catégorie de poids correspond au silicium que vous avez effectivement ?
Comme MiniCPM5-2B-DSpark n'est pas un modèle, la distinction pertinente oppose la classe de poids du modèle cible à celle de Gemma 4 12B — et cette distinction est avant tout une question de matériel. Un téléphone, une carte de cockpit intelligent ou un petit boîtier edge avec quelques gigaoctets de DRAM ne peut pas faire tourner un modèle de 11,95B à une vitesse utile ; le bus mémoire est précisément le goulot d'étranglement qui l'étoufferait. C'est pour ce monde-là que la pile MiniCPM5-2B a été conçue — un modèle dense de 2B dont les poids tiennent dans la mémoire de l'appareil, avec un modèle draft greffé pour regagner une partie des tokens par seconde que les petits modèles denses laissent perdre. Le décodage spéculatif est le plus efficace précisément dans ce régime dense, limité par la mémoire, c'est pourquoi le draft est la partie intéressante de la version plutôt qu'un gadget.
Gemma 4 12B est la réponse une catégorie de poids au-dessus. Si votre machine dispose de 16 Go ou plus — un ordinateur portable, une station de travail, un serveur de périphérie costaud — vous pouvez embarquer le généraliste multimodal, et vous gagnez trois choses que la pile 2B ne peut pas offrir : l'entrée d'images, d'audio et de vidéo sans encodeurs ni second pipeline ; une fenêtre de 256K pour un travail à l'échelle d'un dépôt ou d'un document ; et une maturité qu'un checkpoint de brouillon vieux d'un jour ne possède tout simplement pas. Vous abandonnez la possibilité de fonctionner sur les plus petits appareils et payez environ trois fois l'empreinte mémoire.
La réalité du routage pour les deux
Aucun des deux camps de cette confrontation ne figure aujourd'hui dans un catalogue hébergé, OrcaRouter inclus. MiniCPM5-2B-DSpark est par définition un accessoire pour le serving auto-hébergé — vous faites tourner vous-même la pile SGLang, et le draft n'existe que dans votre déploiement local. Gemma 4 12B est un modèle à poids ouverts ; vous pouvez donc l'héberger vous-même ou l'utiliser là où il est déjà disponible. C'est précisément la situation où une couche de routage fait ses preuves en tant que filet de sécurité plutôt qu'en tant que mécanisme de livraison : lorsque vous testez une toute nouvelle version du draft face à une charge de travail que vous servez déjà, faire passer le chemin de test par une seule API avec basculement automatique signifie qu'une pile non éprouvée peut caler sans faire tomber la production, et les prix catalogue du fournisseur sont répercutés sans aucune marge, si bien qu'un changement de prix sur n'importe quel modèle hébergé auquel vous comparez le draft apparaît le jour même. Pour la comparaison elle-même, cependant, la démarche honnête est la même pour les deux modèles : vous êtes en auto-hébergement, donc le benchmark qui compte est celui que vous exécutez sur votre propre matériel.
Le verdict
MiniCPM5-2B-DSpark et Gemma 4 12B ne sont pas des concurrents au sens d'un face-à-face — ce sont deux catégories de poids de l'IA locale qui partagent une même astuce. Choisissez la pile MiniCPM5-2B avec son draft DSpark lorsque votre appareil ne peut pas embarquer un modèle 12B et que vous voulez un modèle orienté agent, capable de texte, sous licence Apache-2.0, qui tient dans la mémoire de l'appareil ; le draft est une accélération gratuite prometteuse, mais mesurez-le sur votre propre build SGLang avant de lui faire confiance, car son apport est encore non quantifié. Choisissez Gemma 4 12B lorsque votre matériel a la marge nécessaire et que vous voulez un modèle multimodal doté d'une fenêtre de 256K et d'un écosystème derrière lui. La question n'est pas de savoir quel modèle est plus intelligent — c'est de savoir lequel votre silicium peut réellement alimenter.
