Une carte de titre vedette pour la comparaison MiniCPM5-2B-DSpark vs Granite 4.2 3B, avec le sous-titre « Deux versions Apache-2.0 discrètes pour un service rapide et léger », montrant deux cartons ouverts côte à côte — celui de gauche émettant un éclair étiqueté « brouillon DSpark » et celui de droite affichant un engrenage étiqueté « modes de raisonnement » — avec un ruban Apache-2.0 en bas et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

MiniCPM5-2B-DSpark vs Granite 4.2 3B : deux lancements discrets sous licence Apache-2.0 pour un service auto-hébergé, petit et rapide

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Août et début septembre 2026 ont vu deux versions discrètes sous licence Apache-2.0, destinées au même usage — de petits modèles que l'on sert soi-même — et elles sont parties des deux extrémités opposées. Granite 4.2 3B est le modèle de raisonnement de la taille d'un ordinateur portable d'IBM, dont les poids ont été publiés sur Hugging Face début août et dont la fiche modèle et le blog technique sont sortis le 25 août 2026. MiniCPM5-2B-DSpark n'est pas du tout un modèle au même sens : il s'agit d'un checkpoint de draft DSpark de 323,8 millions de paramètres qu'OpenBMB a publié le 6 septembre 2026 sans aucune annonce, conçu pour permettre à MiniCPM5-2B — le modèle dense sur appareil de 2,52 milliards de paramètres annoncé par ModelBest au WAIC le 19 juillet 2026 — de générer des jetons plus rapidement grâce au décodage spéculatif. L'une de ces versions est un modèle de raisonnement autonome de petite taille ; l'autre est un accélérateur pour un petit modèle. Les deux sont sous Apache-2.0, toutes deux ne se déploient qu'en auto-hébergement, et aucune n'a encore été soumise à un benchmark indépendant.

Si l'on retire la couche marketing, la question pratique qui se pose à une équipe est simple : pour une petite charge de travail auto-hébergée de service de modèles fin 2026, voulez-vous le spécialiste du raisonnement à 3B d'IBM ou la pile orientée agents à 2B de ModelBest avec un brouillon gratuit ajouté par-dessus ? Les preuves sont plus minces que ce que les fiches techniques des deux fournisseurs laissent entendre, aussi cet article parcourt les faits de sortie, le seul jeu de chiffres issu d'une même suite qui existe réellement, et la différence de charge de travail qui devrait guider le choix.

Les deux versions, ce qui est connaissable

Granite 4.2 3B est le plus petit modèle de raisonnement d'IBM, post-entraîné à partir de Granite-4.1-3B-Base. Dense et exclusivement textuel, il compte 40 couches, une attention à requêtes groupées, un contexte natif de 128K qui s'étend à 512K lors d'une cinquième phase de pré-entraînement, et propose trois modes de raisonnement : réflexion complète par défaut, mode à faible effort et voie sans réflexion. La fiche d'IBM est explicite : le 3B a délibérément sauté le bloc d'apprentissage par renforcement agentique reçu par les modèles Granite 4.2 plus grands. Aucun résultat SWE-Bench n'y figure donc, et le modèle se positionne comme un modèle de raisonnement plutôt que comme un modèle d'agent. Il est servi via vLLM, SGLang, Transformers, GGUF et Ollama (granite4.2:3b) et ne dispose d'aucune API hébergée. Ses principaux chiffres de la fiche — 78.33 sur AIME 2025, 54.80 GPQA, 69.71 LiveCodeBench v6 — sont déclarés par le fournisseur et non reproduits à ce jour.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

La fiche ibm-granite/granite-4.2-3b ci-dessus est la vitrine publique de cette version : un modèle 3B affiné pour le raisonnement, avec un contexte long et aucune prétention agentique.

MiniCPM5-2B-DSpark, en revanche, n'existe qu'au service de sa cible. Le draft est constitué de cinq couches d'attention complètes, avec 323 776 001 paramètres et une taille de bloc de sept jetons candidats par passage forward, entraîné pendant six époques sur 7,05 milliards de jetons de réponses générées par MiniCPM5-2B. Son dépôt rapporte une longueur d'acceptation — 5,52 jetons acceptés par étape de vérification en agrégé pour un décodage glouton, 6,11 sur le code — mais aucune mesure de jetons par seconde. La cible qu'il accélère, MiniCPM5-2B, est le produit le plus intéressant : un modèle dense de 2,52B, 42 couches, avec un contexte de 128K, dont les supports de lancement mettent l'accent sur les capacités agentiques — un mid-training agent à l'échelle de 200B, un large ensemble agent-SFT, et un alignement RL agent, selon l'annonce de juillet de ModelBest — ainsi que des modes natifs long-contexte et hybrides rapide/délibéré. Sur la propre suite de comparaison de ModelBest, la cible obtient une moyenne de 53,9 face aux modèles ouverts de même classe. Chacun de ces chiffres provient du fournisseur.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

La fiche openbmb/MiniCPM5-2B-DSpark ci-dessus constitue l'intégralité de la diffusion : fiche du modèle, configuration, un fichier Safetensors, et aucune annonce.

La seule comparaison de même suite qui existe.

Les tableaux de scores entre fournisseurs sont souvent des comparaisons trompeuses, mais il existe un endroit où Granite 4.2 3B et MiniCPM5-2B ont été mesurés ensemble : le tableau d’évaluation de ModelBest pour MiniCPM5-2B, qui liste granite-4.2-3B parmi ses références. Sur cette suite, MiniCPM5-2B obtient en moyenne 53,9 contre 42,7 pour Granite 4.2 3B. Lisez ce chiffre exactement pour ce qu’il est — un fournisseur exécutant les deux modèles sur une seule suite, non reproduit, et choisi pour mettre son propre modèle en valeur. Ce n’est pas un verdict. Ce que cela vous indique, c’est que ModelBest était suffisamment confiant pour placer le 3B d’un concurrent sur sa fiche, et que l’écart qu’il revendique est le plus important précisément là où ses propres entraînements ont investi : les lignes long contexte et agentiques. Prenez-le comme une affirmation directionnelle, vérifiez-la sur vos propres données, et pesez les affirmations distinctes de la fiche d’IBM avant de décider quoi que ce soit.

Le tableau d'affichage, honnêtement étiqueté

• Ce qui est fourni — MiniCPM5-2B-DSpark : un draft de 324M pour MiniCPM5-2B (cible dense de 2,52B), non autonome. Granite 4.2 3B : un modèle de raisonnement dense autonome de ~3B.

• Rôle — pile MiniCPM5-2B : accent mis sur l’agent sur l’appareil et l’utilisation d’outils, selon ModelBest. Granite 4.2 3B : spécialiste du raisonnement, délibérément non agentique.

• Contexte — MiniCPM5-2B cible : 128K natif. Granite 4.2 3B : 128K natif, extensible à 512K.

• Accélération — MiniCPM5-2B-DSpark : draft externe DSpark, sept jetons par passe, acceptation gloutonne ~5,5 par étape (rapporté par le dépôt). Granite 4.2 3B : aucun fourni avec cette version.

• Licence — les deux sous Apache-2.0.

• Preuve — Les chiffres de MiniCPM sont des allégations de la fiche de ModelBest (sa suite : 53,9 contre 42,7 pour Granite) ; les chiffres de Granite sont des allégations de la fiche d’IBM (AIME 2025 : 78,33 ; GPQA : 54,80). Aucune exécution indépendante n’existe pour l’un ou l’autre.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

Le tableau de bord ci-dessus s'appuie sur les mêmes sources que le texte : tous les chiffres qui y figurent proviennent des fournisseurs, et le seul résultat de cette même suite publié par l'un ou l'autre fournisseur est celui de ModelBest.

La différence qui surclasse tous les critères

Avant les scores, déterminez quel type de petit modèle votre charge de travail exige, car les deux versions répondent à des questions différentes. Granite 4.2 3B est conçu pour le raisonnement et les longs contextes sur du matériel contraint : une fenêtre native de 128K extensible à 512K, trois modes de réflexion par requête, une empreinte qui tient sur un ordinateur portable, et une décision explicite de ne pas inclure d'entraînement agentique. Si votre tâche consiste à analyser de longs documents, à manipuler des contextes à l'échelle d'un dépôt de code ou à mener un raisonnement fiable sur une petite machine, c'est un choix cohérent. MiniCPM5-2B est conçu pour l'orientation inverse : comportement agentique et utilisation d'outils sur l'appareil — le simple fait qu'un draft existe montre que ModelBest s'attend à ce que cette cible soit servie en mode interactif et veut récupérer les tokens par seconde. Si votre travail est une boucle d'agent sur appareil qui appelle des outils et entretient de longues conversations, c'est la stack qu'il vous faut.

Le projet de texte modifie l'économie de cette deuxième option d'une manière que la sortie de Granite ne traite pas. MiniCPM5-2B est dense, et le décodage spéculatif s'avère le plus rentable précisément dans le régime dense, limité par la mémoire — un petit modèle fixe qui propose des tokens à un modèle fixe légèrement plus grand. Un rédacteur externe qui ajoute environ 650 Mo de poids BF16 à une cible d'environ 5 Go, avec un chemin de service SGLang documenté et un taux d'acceptation glouton d'environ cinq tokens et demi par étape de vérification, constitue un levier de débit crédible pour un modèle que vous servez avec une concurrence d'une seule requête. Mais la réserve est inévitable : OpenBMB n'a publié aucune accélération de bout en bout, le levier reste donc non calibré. IBM ne fournit aucun rédacteur externe équivalent pour Granite 4.2 3B dans le cadre de cette sortie — vous l'exécutez en mode dense, et son histoire en matière de vitesse tient simplement au fait que le modèle 3B est petit.

Qui devrait gérer quoi

• Exécutez Granite 4.2 3B si votre charge de travail est du raisonnement à long contexte sur une machine de classe portable — documents, dépôts, analyse approfondie mono-thread — et si vous voulez trois modes de pensée et un plafond de 512K sur un modèle Apache-2.0 que vous contrôlez entièrement. Acceptez qu’il n’y ait pas d’entraînement agentique derrière et pas d’API hébergée.

• Exécutez la pile MiniCPM5-2B avec son draft DSpark si votre charge de travail est un agent interactif sur appareil qui appelle des outils, si la cible tient dans votre budget mémoire et si vous souhaitez récupérer le débit qu'un draft peut restituer. Prévoyez du temps pour mesurer l'accélération réelle du draft sur votre propre build SGLang, car aucun chiffre n'a été publié à son sujet.

• Exécutez les deux derrière une couche de routage si vous êtes vraiment incertain. Aucun des deux modèles n’est aujourd’hui dans un catalogue hébergé, y compris OrcaRouter — les deux sont des propositions auto-hébergées — mais un routeur placé devant vos propres points de terminaison avec basculement automatique permet à la nouvelle pile de brouillon de rester sur un chemin de test pendant que la production demeure sur l’ancienne éprouvée, et son transfert sans marge (0 %) sur les modèles hébergés qui les entourent maintient la comparaison A/B à faible coût. Tout repose sur la réversibilité : changer de nom de modèle, mesurer, puis revenir en arrière si le checkpoint vieux d’un jour cale.

Que regarder ensuite

Deux éléments régleront cette confrontation plus vite que n'importe quelle opinion. Premièrement, une exécution indépendante de MiniCPM5-2B qui confirme ou infirme la moyenne de 53,9 et les affirmations agentiques — un modèle 2B obtenant un tel score sur des tâches de type SWE-Bench représenterait un véritable nouveau point de données pour la classe des modèles sur appareil. Deuxièmement, les chiffres du modèle de raisonnement d'IBM qui survivent à la reproduction par la communauté ; le 78,33 AIME 2025 du 3B est le genre d'affirmation qui bouge quand quelqu'un d'autre l'exécute. Jusqu'à ce que l'un de ces éléments se concrétise, la position honnête est la suivante : Granite 4.2 3B est aujourd'hui le petit modèle le plus sûr et le mieux documenté, et la pile MiniCPM5-2B est le pari le plus intéressant — un agent plus rapide sur appareil si ses affirmations tiennent, avec une version préliminaire dont même son propre fournisseur n'a pas encore mesuré les retombées.