
Intern-Decision-2B vs MinCPM5-2B : deux checkpoints 2B, à vingt jours d'écart, des façons opposées de dépenser les paramètres
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 584 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
internlm/Intern-Decision-2B et openbmb/MiniCPM5-2B ont la même taille, sont sortis à vingt jours d'intervalle, sous la même licence, et sont conçus pour des tâches qui n'ont rien en commun. Le checkpoint d'InternLM est un évaluateur de décision de 2 213 241 664 paramètres : il prend un état et des questions typées, effectue une seule passe avant et renvoie des probabilités calibrées sans générer le moindre token, en refusant toute entrée dépassant 8 192 tokens. Celui d'OpenBMB est un généraliste dense de 2 516 756 480 paramètres : un Llama à 42 couches dérivé de la recette MiniCPM5, acceptant 131 072 tokens de contexte, écrivant du code, appelant des outils et faisant des mathématiques, avec un indice d'intelligence Artificial Analysis de 12,5 et 726 518 téléchargements le mois dernier. Ils coûtent la même chose à télécharger, mais ils achètent des choses totalement différentes.
Ce qui est intéressant dans ce duo, ce n'est pas l'écart de benchmark — il n'y a quasiment pas de benchmark commun à comparer. C'est ce à quoi un budget de 2,2 milliards de paramètres et un budget de 2,5 milliards de paramètres peuvent chacun être consacrés, et ce que ce choix vous dit sur lequel des deux est terminé. MiniCPM5-2B est le deuxième modèle de sa série, après MiniCPM5-1B de mai, et il est arrivé avec un dispositif de publication complet. Intern-Decision-2B est la taille intermédiaire des trois tailles qu'InternLM a poussées sur Hugging Face à 05:36 UTC le 26 septembre 2026, sans annonce, et son dispositif de publication — une base de code d'entraînement, un bundle d'évaluation vérifié par hachage, un benchmark de calibration de 96 cas — n'est devenu public que ce matin à 08:58 UTC.
Où sont passés les deux budgets
Les deux modèles sont des versions affinées de l’architecture de quelqu’un d’autre, et tous deux comptent environ 2,5 milliards de paramètres. C’est là que s’arrête la ressemblance.

MiniCPM5-2B est un Transformer dense de 42 couches, avec une taille cachée de 2 048, 16 têtes d’attention, une taille intermédiaire de 6 144, un vocabulaire de 130 560 tokens et un contexte de 131 072 tokens, entraîné sur un mélange de corpus ouverts publiés par OpenBMB parallèlement à celui-ci : UltraX pour le pré-entraînement web, UltraData-Code avec une gestion hiérarchisée du code L0–L3, UltraData-Math, et 500 000 échantillons SFT d’agents avec plus de 80 000 échantillons RL dans UltraData-RL-2609. Son post-entraînement exécute d’abord du SFT, puis des enseignants RL spécialisés en mathématiques, en code et en tâches agentiques, puis une distillation on-policy vers un seul modèle. C’est un modèle polyvalent dont l’intégralité du budget de paramètres est exposée comme une capacité que vous pouvez solliciter par prompt.
Intern-Decision-2B est un Qwen3_5ForConditionalGeneration avec 24 couches — un motif répétitif de trois couches d’attention linéaire pour une couche d’attention complète — une taille cachée de 2 048, 8 têtes de requête contre 2 têtes clé-valeur, une dimension de tête de 256, une couche de prédiction multi-jetons conservée et un plafond d’embedding de 262 144 positions. Il est livré avec une tour de vision de 612,5 et un projecteur de 50,3 Mo. Presque rien de ce budget ne vous est disponible en tant que prompt : le modèle répond à un schéma fixe de questions, et son architecture est le mécanisme de livraison d’un softmax, pas un générateur de texte.
Un détail du dépôt récemment publié d'InternLM mérite d'être relevé, car il recadre l'étiquette multimodale sur la carte du modèle. Le decision tuning « affine le socle linguistique de Qwen3.5 tout en gelant la tour de vision et le projecteur ». Les checkpoints decision 2B et 4B portent tous deux un shard de vision de exactement 612 517 440 octets — la même taille dans les deux cas — ce qui est cohérent avec le fait que ces composants sont hérités de la base Qwen plutôt qu'entraînés. Le chemin d'image est réel et utilisable, mais ce n'est pas sur lui que le decision tuning d'InternLM a concentré ses efforts. Si votre charge de travail se limite au scoring de décisions en texte seul, environ 660 Mo de ce téléchargement de 4,46 Go ne vous servent à rien.
Tableau d'affichage

• Paramètres — Intern-Decision-2B : 2 213 241 664 en BF16, plus environ 660 Mo pour la tour de vision et le projecteur, soit près de 4,46 Go de dépôt ; MiniCPM5-2B : 2 516 756 480 en BF16, un seul fichier safetensors de 5,03 Go.
• Contexte — 8 192 tokens pour Intern-Decision-2B, rejeté sans troncature au-delà de cette limite ; 131 072 tokens pour MiniCPM5-2B.
• Sortie — une distribution calibrée plus un argmax par champ, aucun texte du tout ; texte généré, token par token.
• Entraînement — réglage décisionnel d’un backbone Qwen3.5-2B avec la tour de vision gelée, données d’entraînement non divulguées ; une passe complète de pré-entraînement, de mid-training et de SFT de réflexion profonde de 400 milliards de jetons, suivie de RL et de distillation on-policy, avec les corpus publiés en parallèle.
• Preuves publiées — un tableau de fournisseur à sept suites avec une moyenne de 84,68, un Brier de 0,437 et un ECE de 0,100, non reproduit par un tiers, un like et zéro téléchargement ; une fiche OpenBMB avec une moyenne de 53,9 dans son propre ensemble de comparaison et un indice d'intelligence Artificial Analysis indépendant de 12,5, avec 726 518 téléchargements au cours du dernier mois.
• Licence — Apache-2.0 avec les conditions Qwen amont conservées sous LICENSE-QWEN, et aucune licence indiquée du tout sur le dépôt de code ; Apache-2.0 dans l’ensemble, code inclus.
Ce en quoi chacun est réellement meilleur, et ce n’est pas serré.
La comparaison est asymétrique au point de constituer une erreur de catégorie ; il est donc plus utile de nommer les emplois.
MiniCPM5-2B l'emporte dans tout ce qui implique de produire une réponse plutôt que d'en sélectionner une. Il écrit du code ; Intern-Decision-2B n'a aucun chemin de code. Il gère un contexte de 131 072 jetons ; Intern-Decision-2B s'arrête à 8 192 et échoue bruyamment. Il appelle des outils, avec un score BFCL v4 de 66,6 sur le tableau d'OpenBMB lui-même, et il fait des mathématiques, avec MATH-500 à 94,6 et GPQA-Diamond à 70,2 — des chiffres issus de la fiche du fournisseur, la ligne GPQA portant une note de bas de page fournie par la fiche elle-même. Il affiche 70,8 sur MMLU-Pro et 84,7 sur MMLU-Redux. Il s'exécute dans llama.cpp et MLX, est livré en variantes GGUF, GPTQ et DSpark, et dispose d'un Space de démonstration sur le Hub qui est public, contrairement au 401 vers lequel la fiche d'Intern-Decision pointe.
Intern-Decision-2B gagne exactement deux choses, et elles sont la raison de son existence. Premièrement, une décision à ensemble fermé avec un schéma que vous écrivez renvoie une probabilité que vous pouvez seuiller, en une seule passe avant, en environ 33 millisecondes, sans parseur ni échantillonnage — une forme que MiniCPM5-2B ne peut produire qu'en générant du texte et en espérant que le nombre qu'il contient se comporte bien. Deuxièmement, c'est un artéfact reproductible : le dépôt contient désormais l'objectif d'entraînement, les sept suites de précision avec leurs hachages SHA-256 et le nombre de lignes par suite, le code de notation, les scripts d'ajustement de température et de rejeu, et un benchmark d'étalonnage de distribution à 96 cas avec son propre générateur et son propre évaluateur hors ligne. Le guide d'évaluation d'InternLM note que les préréglages publiés sont liés au backend XTuner et que les résultats HF doivent être rapportés comme un paramètre d'exécution différent — ce qui est exactement le type de mise en garde qu'un kit de reproduction a pour but de rendre vérifiable.

Qui devrait télécharger quoi
Si vous avez une tâche qui consiste à lire un texte long, à écrire quelque chose ou à répondre à une question dont vous n’avez pas énuméré les options à l’avance, MiniCPM5-2B est le modèle et il n’y a aucune décision à prendre. C’est un généraliste abouti de classe 2B, avec un véritable écosystème, des données ouvertes derrière lui et un classement d’évaluation indépendant, et il ne coûte rien à essayer — les builds GGUF et MLX sont déjà sur le Hub.
Si vous avez une tâche qui est véritablement un choix parmi des réponses connues — router un ticket, classer un courriel d'assistance, étiqueter un candidat, noter une intention sur une échelle ordinale — alors un modèle de génération est le mauvais outil, et Intern-Decision-2B est le plus intéressant des deux même si presque personne ne l'a exécuté. Une probabilité que l'on peut seuiller est moins coûteuse à exploiter, plus facile à auditer et impossible à halluciner, et le fait que le checkpoint soit arrivé avec un kit de reproduction plutôt qu'un post de classement en fait le mieux documenté des deux sur l'axe qui compte lorsqu'il faut défendre le choix.
Aucun des deux modèles n'est sur OrcaRouter. Notre page de modèle pour Intern-Decision-2B renvoie une erreur 404 et il n'existe aucune route MiniCPM5-2B ; rien ici ne constitue une affirmation de disponibilité, et les deux impliquent d'exécuter votre propre inférence. L'alternative pratique se trouve du côté des modèles de décision hébergés : Jev 1.13 de TypeSafe, le modèle par rapport auquel InternLM a évalué toute sa famille, figure au catalogue à 0,042 $ par million de jetons d'entrée, avec un contexte de 65K et un temps jusqu'au premier jeton (P50) de 178 ms. Et si ce dont vous avez réellement besoin est un modèle généraliste dans la même catégorie de taille que MiniCPM5-2B, sans le travail opérationnel, notre plus petite route Qwen hébergée est plusieurs fois plus grande, mais elle est une clé parmi plus de 200 modèles, au prix catalogue du fournisseur répercuté sans marge et basculement automatique derrière elle.
Le seul chiffre qui fait la différence
Ce n'est pas 84,68 contre 53,9. Ces deux moyennes proviennent de suites différentes, mesurées par des laboratoires différents, et dans un cas par un laboratoire dont les chiffres n'ont jamais été vérifiés. Le nombre qui tranche est 8 192. Si votre état tient dans huit mille tokens et que votre réponse est déjà une liste, Intern-Decision-2B est un instrument précis doté d'un kit de reproduction et d'une anomalie de calibration dont vous devez être conscient — son erreur de calibration attendue de 0,100 est la pire des trois tailles publiées par InternLM, contre 0,066 pour le modèle deux fois plus petit, donc ajustez votre propre température avant de faire confiance à une valeur de confiance. Si votre état ne tient pas, la question est réglée avant même que les benchmarks ne commencent, et MiniCPM5-2B est la réponse.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
