Carte-titre hero pour « MiniCPM5-2B vs Granite 4.2 3B », avec le sous-titre « Un 2,5B entraîné pour les agents se mesure au spécialiste du raisonnement 3B d'IBM », trois puces « Stack agent vs raisonneur », « Apache-2.0 des deux côtés » et « Poids disponibles du 6 au 7 sept. », et un ruban supérieur « FACE-À-FACE OPEN-WEIGHTS · SEPT. 2026 ».
Guides & Insights

MiniCPM5-2B contre Granite 4.2 3B : le spécialiste du raisonnement 3B face à la nouvelle stack d'agents 2.5B

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

ModelBest a placé Granite 4.2 3B sur le tableau de scores de MiniCPM5-2B avant qu’on ne lui demande de le faire. La fiche du modèle MiniCPM5-2B publiée par OpenBMB lorsque les poids ont discrètement été mis en ligne sur Hugging Face liste le plus petit modèle de raisonnement d’IBM parmi ses références comparatives, et sur cette suite de tests MiniCPM5-2B affiche une moyenne de 53,9 contre 42,7 pour Granite 4.2 3B. C’est le seul chiffre en tête-à-tête publié par l’un ou l’autre éditeur pour cette paire, ce qui en fait le point de départ naturel — et l’endroit où la prudence s’impose tout aussi naturellement. Les deux modèles sont de petites versions à poids ouverts, auto-hébergeables et sous licence Apache-2.0, destinées à la même tâche de fin 2026 ; ils s’y prennent par des bouts opposés, l’un entraîné à raisonner, l’autre à agir.

Les deux versions riment davantage entre elles que ne le laissent entendre les discours marketing de leurs éditeurs. MiniCPM5-2B a été dévoilé le 19 juillet à la Conférence mondiale sur l'intelligence artificielle comme le fleuron embarqué de ModelBest et OpenBMB — un modèle dense de la classe des 2B présenté comme une base d'agent pour téléphones, PC et cockpits intelligents — et ses poids sont apparus les 6 et 7 septembre sans aucun événement de lancement, sous licence Apache-2.0, accompagnés des checkpoints GGUF, MLX, GPTQ, base, SFT et draft, ainsi que des données d'entraînement correspondantes. Granite 4.2 3B est le modèle de raisonnement taille laptop d'IBM, dont les poids sont arrivés sur Hugging Face début août et dont la fiche modèle ainsi que le blog technique sont sortis le 25 août. Aucun des deux n'a encore été soumis à un benchmark indépendant, c'est pourquoi les étiquettes de provenance ci-dessous importent plus que les chiffres.

Deux versions qui riment

Granite 4.2 3B est un modèle de raisonnement dense autonome, post-entraîné à partir de Granite-4.1-3B-Base. Il comporte 40 couches avec attention par requêtes groupées, un contexte natif de 128K qu'IBM étend à 512K lors d'une cinquième phase de pré-entraînement, et trois modes de réflexion par requête — réflexion complète par défaut, mode à faible effort et mode sans réflexion. Sa fiche modèle est explicite sur ce qu'il n'est pas : contrairement aux variantes 8B et 30B de Granite 4.2, la 3B a délibérément écarté le bloc spécialisé d'apprentissage par renforcement agentique entraîné dans les environnements SWE-agent, terminal et recherche, si bien qu'IBM ne fait état d'aucun résultat SWE-bench et présente le modèle comme un spécialiste du raisonnement plutôt que comme un agent. Il est servi via vLLM, SGLang, Transformers, GGUF et Ollama (granite4.2:3b), fonctionne dans environ 6 à 8 Go en bfloat16 ou moins de 2 Go en version quantifiée, et ne dispose d'aucune API hébergée. Ses chiffres phares — AIME 2025 à 78.33, GPQA à 54.80, LiveCodeBench v6 à 69.71, MMLU-Pro à 67.84 — sont rapportés par IBM et non reproduits à ce jour.

Screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the model summary table — developer Granite Team, IBM, 'Decoder-only Dense Transformer (Reasoning)', base model Granite-4.1-3B-Base, 3B parameters, context 'Natively Supports 128K (Long-context extension to 512K)', bfloat16 precision, tested languages, built-in think chain-of-thought — and the Apache-2.0 license tag (captured September 7, 2026).

MiniCPM5-2B est au contraire un modèle abouti orienté agent. La fiche décrit un transformer dense de 2,52B de paramètres au total (1,98B hors plongements), 42 couches de taille cachée 2048, une attention à requêtes groupées avec 16 têtes de requête et deux têtes KV, et une architecture standard LlamaForCausalLM sans noyaux personnalisés. L’argumentaire de lancement mettait l’accent sur la capacité agentique — un pré-entraînement intermédiaire orienté agent à l’échelle 200B, un vaste ensemble de SFT agentique, et un alignement RL agentique, le tout finalisé par l’On-Policy Distillation qui condense seize modèles experts RL en un seul petit réseau dense — plus un contexte long natif et des modes de réponse hybrides rapide/réfléchi. Sa configuration livrée définit une fenêtre de contexte de 131 072 jetons (les documents de juillet vantaient 512K ; la configuration publiée ne le contient pas), et la fiche revendique des appels d’outils de type XML avec un analyseur SGLang intégré. Dans son propre tableau d’évaluation, elle rapporte une moyenne interne de 53,9 sur l’ensemble de comparaison sélectionné par le fournisseur de la fiche, un score AIME 2025/2026 de 86,5, un MATH-500 de 94,6, et un 46,4 obtenu par le fournisseur sur SWE-bench Verified — ce qui serait remarquable pour un modèle dense de 2,5B si ce score résiste à des tests indépendants.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Le face-à-face que quelqu'un a déjà imprimé.

Comme les classements comparatifs entre fournisseurs relèvent le plus souvent de la comparaison entre pommes et oranges, l'élément le plus utile dans cette confrontation est celui que ModelBest a lui-même publié : la fiche de MiniCPM5-2B liste granite-4.2-3B parmi ses références et indique que MiniCPM5-2B obtient une moyenne de 53,9 contre 42,7 pour Granite sur cette suite de tests. Prenez ce résultat pour ce qu'il est précisément — un fournisseur qui fait tourner deux modèles sur une suite qu'il a lui-même choisie, sans reproduction indépendante, avec tout intérêt à ce que son propre modèle gagne. Ce n'est pas un verdict. Ce que cela vous apprend, c'est que ModelBest a eu suffisamment confiance pour placer un modèle 3B concurrent sur sa fiche, et que l'écart qu'il revendique est le plus important précisément là où son propre entraînement a investi : les volets agentique et long contexte. Considérez-le comme une affirmation directionnelle, et pesez les affirmations de la fiche séparée d'IBM avant de vous prononcer sur la question.

Le tableau d'affichage, honnêtement étiqueté

• Sortie — MiniCPM5-2B : annoncé le 19 juillet 2026 ; poids mis en ligne les 6-7 septembre, en toute discrétion. Granite 4.2 3B : poids début août ; fiche et blog technique le 25 août 2026.

• Rôle — MiniCPM5-2B : agent sur l'appareil et accent sur l'utilisation d'outils, selon ModelBest. Granite 4.2 3B : spécialiste du raisonnement, délibérément non agentique, selon IBM.

• Taille — MiniCPM5-2B : 2,52 B au total / 1,98 B hors plongements, 42 couches. Granite 4.2 3B : ~3 B denses, 40 couches.

• Contexte — MiniCPM5-2B : 131 072 tokens dans la configuration livrée. Granite 4.2 3B : 128K natif, extensible à 512K.

• Post-entraînement — MiniCPM5-2B : SFT de réflexion approfondie, RL spécialisé, distillation on-policy. Granite 4.2 3B : SFT de raisonnement, RL GRPO et RLHF ; aucun bloc de RL agentique.

• Preuves — MiniCPM5-2B : déclarations de la fiche ModelBest, aucune exécution indépendante. Granite 4.2 3B : déclarations de la fiche IBM, non reproduites ; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

A comparison scoreboard titled 'MiniCPM5-2B vs Granite 4.2 3B — the scoreboard', with left column rows 'What it is: Agent-tuned 2.5B for on-device', 'Params: 2.52B total · 42 layers', 'Context: 128K in shipped config', 'Post-training: Deep-thinking SFT + RL + OPD', 'Card headline: Internal avg 53.9 on own suite', 'Release: Announced Jul 19 · weights Sep 6-7', and right column rows 'What it is: IBM's smallest reasoning 3B', 'Params: ~3B dense · 40 layers', 'Context: 128K native → 512K ext', 'Post-training: Reasoning SFT + GRPO + RLHF', 'Card headline: AIME '25 78.33 · GPQA 54.80', 'Release: Weights Aug · card Aug 25', with a footer reading 'Both vendor-reported and unreproduced; the 53.9-vs-42.7 head-to-head is on ModelBest's own card.'

Le tableau ci-dessus repose sur les mêmes sources que le texte : chaque chiffre qui y figure est déclaré par le fournisseur, et la seule comparaison au sein de la même suite que l'un ou l'autre fournisseur ait publiée est celle figurant sur la propre carte de ModelBest.

Spécialiste du raisonnement vs stack d'agents

Avant les scores, déterminez quel type de petit modèle votre charge de travail exige, car ces deux modèles répondent à des questions différentes. Granite 4.2 3B est conçu pour le raisonnement et le long contexte sur du matériel contraint : une fenêtre native de 128K qui s'étend jusqu'à 512K, trois modes de raisonnement, une empreinte qui tient dans un ordinateur portable, et une décision explicite de faire l'impasse sur l'entraînement agentique. Si votre tâche est l'analyse de longs documents, le contexte à l'échelle d'un dépôt ou un raisonnement multi-étapes fiable sur une petite machine, c'est un choix cohérent — et la décision d'IBM de ne pas assortir la 3B de revendications agentiques est une raison de faire confiance à sa fiche plutôt que d'y voir une lacune. MiniCPM5-2B est conçu pour l'objectif opposé : comportement agentique et utilisation d'outils sur appareil — son pipeline d'entraînement ressemble à une liste de tout ce que Granite 4.2 3B a délibérément laissé de côté. Si votre tâche est une boucle agentique sur appareil qui appelle des outils, tient de longues conversations et alterne entre réponses rapides et réfléchies, c'est cette pile logicielle qui vous est destinée, et elle comporte l'incertitude supplémentaire d'un checkpoint vieux d'une semaine avec une fiche non vérifiée.

Les données qu'OpenBMB a ouvertes, IBM ne l'a pas fait.

La différence la moins glamour est celle qui compte le plus pour les équipes qui souhaitent faire du fine-tuning. OpenBMB a publié les corpus d’entraînement de MiniCPM5-2B en même temps que les poids — la famille UltraData, comprenant Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math ainsi que les ensembles SFT et RL de l’agent — le tout sous Apache-2.0. Cela transforme la 2B d’une boîte noire en une recette reproductible : vous pouvez voir sur quoi repose le post-entraînement agentique et le poursuivre sur votre propre domaine. IBM a ouvert les poids de Granite 4.2 3B et a fourni un compte technique détaillé de sa construction, mais pas les données d’entraînement. Pour une organisation qui veut posséder le modèle plutôt que le louer, cette asymétrie est réelle. Et MiniCPM5-2B est livré avec un scénario de déploiement que Granite ne peut pas égaler à cette taille : une adaptation dès le premier jour sur neuf familles de puces via la communauté FlagOS de ModelBest, de Huawei Ascend à NVIDIA, en passant par un éventail d’accélérateurs domestiques, plus ARM — un signal que ModelBest s’attend à ce que la 2B fonctionne ailleurs que sur un GPU NVIDIA.

La réalité du routage

Aucun des deux modèles ne figure aujourd’hui dans un catalogue hébergé, de sorte que cette comparaison se situe dans le monde de l’auto-hébergement — mais c’est précisément là qu’une couche de routage conserve son utilité comme filet de sécurité plutôt que comme mécanisme de livraison. Lorsqu’une équipe veut tester un modèle agentique 2B vieux d’une semaine contre un modèle de raisonnement 3B sur une charge de travail qu’elle sert déjà, la mesure réversible consiste à diriger un chemin de test vers une version auto-hébergée de MiniCPM5-2B via une API avec bascule automatique, tandis que la production reste sur le modèle éprouvé — la nouvelle pile peut caler sans rien faire tomber, et les prix catalogue des fournisseurs pour les modèles hébergés que vous comparez sont répercutés avec une marge de 0 %, de sorte que le test A/B reste peu coûteux. La couche n’héberge aucun des deux modèles ; elle rend l’expérience sûre à exécuter et facile à annuler.

Quel petit modèle devriez-vous réellement exécuter ?

Exécutez Granite 4.2 3B si votre charge de travail est un raisonnement sur de longs contextes sur une machine de type portable et que vous voulez trois modes de pensée, un plafond de 512K et une fiche honnête qui vous dit exactement ce pour quoi le 3B n’a pas été entraîné. Exécutez MiniCPM5-2B si votre charge de travail est un agent interactif sur appareil avec appel d’outils, où un 2,5B tient dans votre budget mémoire — mais consacrez le temps de reproduire ses chiffres annoncés avant de lui faire confiance, car la moyenne de 53,9 et l’affirmation de 46,4 sur SWE-bench proviennent du fournisseur et de personne d’autre pour l’instant. Deux éléments régleront ce duel plus vite que toute opinion : une exécution indépendante de MiniCPM5-2B qui confirme ou infirme les affirmations agentiques, et les chiffres de raisonnement d’IBM survivant à la reproduction communautaire. Tant que l’un de ces éléments n’arrive pas, Granite 4.2 3B est le petit modèle actuel le plus sûr et le mieux documenté, et MiniCPM5-2B est le pari le plus intéressant.