Titre principal de l'article « Les poids de MiniCPM5-2B sont en ligne », avec le sous-titre « Le modèle qui revendiquait la couronne des moins de 4B est passé en open source en toute discrétion », trois étiquettes : « Apache-2.0 », « 2,5B de paramètres · contexte de 128K » et « AA Index 17 — n°1 en moins de 4B au lancement », et un bandeau supérieur « POIDS OUVERTS · SEPT 2026 ».
Guides & Insights

Les poids de MiniCPM5-2B sont en ligne : le petit modèle qui a décroché la couronne des moins de 4B passe en open source

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le modèle lui-même a sept semaines. MiniCPM5-2B a été dévoilé lors de la Conférence mondiale sur l’intelligence artificielle 2026, le 19 juillet, où ModelBest et OpenBMB l’ont présenté comme le modèle le mieux classé sous 4B de paramètres selon le classement d’Artificial Analysis, et ont promis que les poids suivraient « dans un avenir proche ». Ce qui s’est passé ce week-end, c’est que cet avenir proche est arrivé sans aucun des effets d’annonce du lancement : le dépôt MiniCPM5-2B est devenu public sur Hugging Face le 6 septembre, et le journal des modifications d’OpenBMB date la version du 7 septembre, sous licence Apache-2.0, avec l’ensemble complet — poids BF16, quantifications GGUF, MLX et GPTQ, points de contrôle de base et SFT, un modèle d’ébauche DSpark pour le décodage spéculatif, ainsi que les ensembles de données d’entraînement correspondants.

Aucun communiqué de presse ne l'a accompagné, et aucun événement de lancement n'a eu lieu. Il est simplement apparu : un dépôt Hugging Face un jour, une ligne de changelog le lendemain. Ce qui en fait un article « ce que l'on sait à ce jour » — avec une première mise à jour. Le dépôt nous en apprend beaucoup : le modèle est réellement téléchargeable et exécutable dès aujourd'hui, et la fiche technique est publique. Un score externe est d'ailleurs déjà tombé : Artificial Analysis classe MiniCPM5-2B sur son Intelligence Index v4.2 à 15, le meilleur résultat open-weights sous 4B de paramètres totaux sur cet indice ; le classement sub-4B ne repose donc plus uniquement sur la parole du fournisseur. Ce qui n'est toujours pas confirmé, ce sont les chiffres mis en avant sur la fiche du modèle, qu'OpenBMB a reproduits dans son propre banc d'essai et que personne en dehors du laboratoire n'a re-exécutés. Voici ce qui est connaissable à partir du dépôt, ce qui est désormais mesuré indépendamment, et ce qui doit encore être vérifié avant de vous appuyer dessus.

Qu'est-ce qui vient de se passer ?

Le MiniCPM5-2B est le deuxième modèle de la série MiniCPM5, après le MiniCPM5-1B, qu'OpenBMB a publié en open source le 19 mai. Lorsque le 2B a été lancé comme produit au WAIC, c'était une histoire de puces autant qu'une histoire de modèle — ModelBest l'a présenté comme une base d'agents embarqués pour téléphones, PC et cockpits intelligents, et a cité neuf puces avec une prise en charge dès le premier jour via sa communauté FlagOS, de Huawei Ascend à NVIDIA en passant par un ensemble d'accélérateurs nationaux. La publication en open source était annoncée comme imminente. Sept semaines se sont écoulées.

Le 6 septembre, le dépôt openbmb/MiniCPM5-2B est apparu. Au moment où j'écris ces lignes, la fiche du modèle sert d'annonce de sortie, et elle est inhabituellement complète pour une publication discrète :

• Poids — le checkpoint final post-entraîné RL + OPD en BF16, sous licence Apache-2.0 et sans restriction d’accès — n’importe qui peut les télécharger.

• Points de contrôle associés — MiniCPM5-2B-SFT, -Midtrain et -Base pour celles et ceux qui souhaitent le modèle avant RL/OPD, ainsi que -GGUF, -MLX, -GPTQ et un modèle draft -DSpark, tous répertoriés dans la collection MiniCPM5 sur Hugging Face.

• Données — les corpus d’entraînement sont également ouverts, publiés dans le cadre de la famille UltraData : Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 et UltraData-RL-2609.

• Miroirs — le README pointe à la fois vers Hugging Face et ModelScope.

Une ligne de la fiche compte plus qu'il n'y paraît : « pas de kernels personnalisés, pas de fork du code du modèle ». MiniCPM5-2B utilise l'architecture standard LlamaForCausalLM, donc tout moteur qui prend déjà en charge les modèles de la famille Llama peut le charger sans attendre une implémentation sur mesure.

Pourquoi un modèle de 2,5B mérite un second regard

L'argumentaire présenté au WAIC était un argumentaire de classement. ModelBest a indiqué que le MiniCPM5-2B avait obtenu un score de 17 à l'Artificial Analysis Intelligence Index, ce qui le plaçait en tête des modèles de moins de 4 milliards de paramètres dans le classement AA à son lancement. Deux réserves doivent accompagner ce chiffre. Premièrement, les scores de l'indice ne sont comparables qu'au sein d'une même version de méthodologie : le 17,9 obtenu précédemment par le MiniCPM5-1B provenait d'un instantané AA antérieur, ce qui ne prouve pas que le modèle plus petit « obtient un score plus élevé » ; par la même règle, un score plus récent obtenu avec une méthodologie plus récente ne constitue pas une régression. Deuxièmement, les chiffres d'AA alimentent la fiche du modèle, mais la moyenne mise en avant par la fiche est celle d'OpenBMB, produite dans le harnais d'évaluation propre à OpenBMB. Cette distinction est importante : AA est en effet depuis passé à une méthodologie plus récente et a publié un nouveau score — la première vérification externe de l'argumentaire depuis la publication des poids ouverts.

Un numéro externe est arrivé la même semaine que les poids. Le 4 septembre, Artificial Analysis a publié Intelligence Index v4.2, une révision méthodologique qui porte à 40 % le poids accordé aux tests privés non divulgués et ajoute deux nouvelles composantes — AA-Briefcase, une évaluation agentique, et Surge's GDP.pdf, une tâche de raisonnement documentaire à contexte long. L'entrée de l'index AA pour MiniCPM5-2B porte désormais un score v4.2 de 15 : le meilleur résultat parmi les modèles open-weights de moins de 4B paramètres au total, et le premier des 47 modèles ouverts de cette classe de taille sur la liste d'AA. Cela maintient le modèle là où le pitch de juillet l'avait placé, cette fois sur une méthodologie plus difficile à contourner et avec des poids que n'importe qui peut télécharger et revérifier. Le 15 n'est pas comparable au 17 de l'époque du lancement, qui provenait de la v4.1 — la méthodologie est plus stricte, pas le modèle plus faible — et le composite ne revérifie pas les lignes individuelles de la fiche, dont la plupart ont été reproduites par OpenBMB dans son propre harnais. Ce qu'il fait, c'est atterrir sur les deux axes qu'OpenBMB dit avoir optimisés : la v4.2 s'appuie davantage sur les tâches agentiques, et le suivi de verbosité d'AA montre que MiniCPM5-2B génère 57M de jetons de sortie sur les tâches de l'index, le modèle le plus concis de sa classe face à une médiane de 72M. OpenBMB a remercié AA pour l'exécution et l'a encadrée exactement en ces termes — performance agentique et efficacité de jetons à 2,6B, a-t-il déclaré, sont ce pour quoi le modèle a été optimisé.

L'affirmation de fond portait sur une capacité agentique dans un petit format : appel d'outils natif, recherche approfondie et génération de code, le tout intégré dès la base plutôt que greffé après coup. La fiche décrit un pipeline en trois étapes — entraînement de base, entraînement intermédiaire, puis post-entraînement : SFT sur 400 milliards de tokens de données de réflexion approfondie, modèles enseignants RL spécialisés et distillation on-policy (OPD), qui fusionne seize modèles experts RL, dont cinq agentiques, dans un seul petit réseau dense. OpenBMB attribue à l'étape RL + OPD un gain moyen de 10,96 points sur les tâches de raisonnement et les tâches générales, et de 6,96 points sur les tâches agentiques — des gains internes, certes, mais qui expliquent la forme inhabituelle de ce modèle : un réseau de 2,5 milliards de paramètres conçu comme un modèle de raisonnement et orienté vers l'utilisation d'outils.

A single-column scoreboard for MiniCPM5-2B titled 'MiniCPM5-2B — the scoreboard', with rows 'Params: 2.52B total · 1.98B non-embedding', 'Architecture: dense Llama-style, 42 layers, GQA 16:2', 'Context: 131,072 tokens (config)', 'License: Apache-2.0, weights + data', 'AA Index: 17 — #1 sub-4B at launch (AA v4.1)' and 'SWE-bench Verified: 46.4 · vendor-reported', and a footer reading 'Params, architecture and context from the HF config; AA Index per Artificial Analysis; other benchmark figures are vendor-reported.'.

Ce que le dépôt contient réellement

La fiche technique est sans ambiguïté, car c'est le fichier de configuration. MiniCPM5-2B possède 2 516 756 480 paramètres, dont 1 981 982 720 hors embeddings — les fournisseurs comptent le nombre hors embeddings lorsqu'ils parlent de « classe 2B ». C'est un transformer dense avec 42 couches à une taille cachée de 2048, une attention groupée par requêtes avec 16 têtes de requête et seulement 2 têtes clé-valeur, un vocabulaire de 130 560 et des tenseurs BF16. Le tout est livré sous la forme d'un seul fragment safetensors, assez petit pour être téléchargé sur une connexion portable et exécuté sur un seul GPU de milieu de gamme ou une NPU de classe téléphone.

• Paramètres — 2 516 756 480 au total ; 1 981 982 720 hors embedding.

• Architecture — LlamaForCausalLM dense, 42 couches, dimension cachée 2048, GQA 16 têtes de requête / 2 têtes KV, vocabulaire 130 560.

• Contexte — 131 072 jetons configurés (max_position_embeddings), pas de mise à l’échelle RoPE dans la configuration.

• Licence — Apache-2.0, pour le modèle et les données d’entraînement publiées.

• Format — BF16 ; les versions GGUF, MLX et GPTQ sont publiées séparément.

A screenshot of the Hugging Face page for openbmb/MiniCPM5-2B, showing the repository header with Transformers and Safetensors tags and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B' (captured September 7, 2026).

Un chiffre du diaporama de juillet n’apparaît pas dans le checkpoint. Les documents du WAIC vantaient une fenêtre de contexte de 512K tokens ; la configuration publiée fixe `max_position_embeddings` à 131 072 (128K), sans entrée `rope_scaling`. Il est possible que le chiffre de 512K soit destiné à être atteint via une extension au moment de l’inférence, comme plusieurs petits modèles étendent leur contexte — mais telle qu’elle est livrée, la documentation du dépôt indique 131 072, et c’est sur ce nombre qu’il faut concevoir en attendant qu’OpenBMB publie une recette d’extension.

Les nombres, triés selon qui les a mesurés

La fiche du modèle fait preuve de prudence quant à la provenance des scores, et il vaut la peine de lire les notes de bas de page. Les scores qu’elle marque d’un obèle « proviennent de la publication officielle d’Artificial Analysis » — des lignes telles que GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 et GDPval-AA v2 19.6. Tout le reste est décrit comme « reproduit en interne », ce qui signifie qu’OpenBMB a exécuté ces évaluations dans son propre environnement. Cette catégorie comprend les chiffres les plus frappants : une moyenne interne de 53.9 sur l’ensemble de comparaison de la fiche, AIME 2025/2026 à 86.5, MATH-500 à 94.6, LiveCodeBench v6 à 69.1, SWE-bench Verified à 46.4, BFCL v4 à 66.6, τ²-Bench Telecom à 97.1, GAIA (Text-103) à 88.7 et MMLU-Pro à 70.8.

Trois éléments rendent ces chiffres honnêtes à lire. La moyenne de 53,9 est un score relatif, et non absolu : la fiche normalise chaque axe du radar de sorte que le meilleur modèle de la comparaison atteigne 100. L’ensemble de comparaison est choisi par le fournisseur : d’autres modèles ouverts de 2B à 4B, notamment Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B et LFM2.5-8B-A1B. Dans cet ensemble, la fiche montre MiniCPM5-2B devançant nettement le second, Qwen3.5-4B, avec 51,1 — un résultat réellement frappant pour un modèle deux fois plus petit, et précisément le genre de résultat qui exige une reproduction indépendante avant que quiconque ne s’appuie dessus. Et quelques-unes des lignes individuelles sont difficiles à concilier avec le marketing : un score SWE-bench Verified de 46,4 pour un modèle dense de 2,5B serait remarquable s’il se reproduit, tandis qu’un HLE de 8,9 rappelle que « leader sub-4B » et « frontière » appartiennent à des ligues différentes. Rien de tout cela n’est contredit par le dépôt, et le composite v4.2 d’AA a depuis confirmé le placement général du modèle au sommet de la classe des poids ouverts sous-4B — mais ces lignes précises sont propres à OpenBMB, toujours non vérifiées par quiconque en dehors du laboratoire.

Exécution de MiniCPM5-2B aujourd'hui

Comme l'architecture est du Llama standard, les moteurs grand public le chargent directement. Le README d'OpenBMB fournit des guides de démarrage rapide pour vLLM (version 0.21 ou plus récente), SGLang (version 0.5.16 ou plus récente) et Transformers (version 5.6 ou plus récente), avec un échantillonnage recommandé à température 1.0 et top-p 0.95, et enable_thinking activé quand vous souhaitez la passe de raisonnement. Les déclinaisons GGUF et MLX couvrent llama.cpp, Ollama, LM Studio et Apple Silicon ; la fiche liste également le runtime ArcLight et les piles de fine-tuning habituelles (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).

Deux détails de déploiement méritent d'être connus avant de commencer. Pour l'appel d'outils et de fonctions, SGLang est le backend recommandé : le modèle émet des appels d'outils au format XML, et le parseur minicpm5 intégré à SGLang les convertit nativement en tool_calls compatibles OpenAI, ce qui signifie que les clients standard d'appel d'outils fonctionnent sans shim personnalisé. Quant au modèle draft DSpark, il existe pour rendre le passage de raisonnement moins coûteux : lancé dans SGLang avec l'algorithme de décodage spéculatif DSPARK, il accélère le décodage tout en laissant les sorties du modèle cible inchangées — le genre de chose qui détermine si une boucle d'agent avec contexte de 128K sur un ordinateur portable est utilisable ou simplement possible.

A screenshot of the Hugging Face 'MiniCPM5' collection page (openbmb/minicpm5), headed 'SOTA on-device LLMs, small yet powerful', listing openbmb/MiniCPM5-2B and openbmb/MiniCPM5-1B alongside the series' companion repositories (captured September 7, 2026).

Si vous préférez évaluer un lot de petits modèles ouverts plutôt que d'en ajuster un seul à la main, la couche de routage justifie sa place ici : lorsqu'un fournisseur référence MiniCPM5-2B, un routeur est le moyen économique de le comparer en A/B à Qwen3.5-2B et aux autres checkpoints ouverts de moins de 4B sur la même tâche, sans seconde intégration. Sur OrcaRouter, cela signifie une API unique pour plus de 200 modèles, des prix catalogue fournisseurs répercutés à 0 % de marge, et un basculement automatique si un tout nouveau checkpoint cale ou boucle sur un chemin de production. Le dépôt a à peine deux jours, et aucune API hébergée à laquelle nous puissions nous référer ne répertorie encore MiniCPM5-2B — l'option par défaut la plus honnête aujourd'hui est donc de le traiter comme une expérience auto-hébergée, et non comme une dépendance.

Qui devrait tirer ces poids ?

Téléchargez-les aujourd'hui si vos travaux portent sur les agents sur l'appareil, l'appel d'outils en périphérie ou les expérimentations de codage et de raisonnement sur petits modèles, et si vous voulez l'option de classe 2B la plus agressivement entraînée qui soit. La licence Apache-2.0 et les données d'entraînement ouvertes éliminent les deux raisons pour lesquelles la plupart des équipes hésitent à adopter un petit modèle de labo chinois — aucune restriction d'usage commercial, aucun corpus en boîte noire. Téléchargez-les avec méfiance si vous choisissez un modèle pour la production en vous fiant uniquement au tableau de benchmarks : les lignes en tête de la fiche sont des reproductions maison d'OpenBMB, et le composite v4.2 d'AA — la seule mesure externe à ce jour — ne les cautionne pas. Selon les rapports, un modèle de 2.5B dépasserait Qwen3.5-4B : c'est une affirmation qui mérite les deux heures qu'il faut pour reproduire SWE-bench soi-même.

Ce qu'il faut surveiller ensuite. Le dépôt n'a que deux jours, donc les signaux à court terme restent mécaniques : savoir si llama.cpp et la bibliothèque Ollama intègrent le GGUF, si le miroir ModelScope et les builds pour puces FlagOS se déroulent proprement, et si une API hébergée répertorie MiniCPM5-2B — c'est à ce moment qu'il cesse d'être réservé au self-hosting. Le signal substantiel que cet article signalait comme manquant — une exécution indépendante par Artificial Analysis ou un laboratoire universitaire — est maintenant arrivé sous la forme du score de l'index v4.2, et il maintient MiniCPM5-2B en première position parmi les modèles open-weights de moins de 4B. Ce qui reste en suspens, c'est la vérification au niveau des lignes : personne en dehors d'OpenBMB n'a reproduit les chiffres internes de la fiche, notamment SWE-bench Verified à 46,4 et la moyenne interne de 53,9. Tant que ces lignes précises ne sont pas re-exécutées, traitez MiniCPM5-2B comme vous traiteriez tout modèle publié discrètement avec une fiche impressionnante : comme une hypothèse très prometteuse que vous pouvez exécuter localement ce soir, et un modèle dont les chiffres les plus frappants doivent être vérifiés avant de lui confier un vrai travail.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube