
MiniCPM5-2B contre Gemma 4 12B : le leader des modèles de moins de 4B face au généraliste 12B de Google
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
Les supports de lancement de MiniCPM5-2B contiennent une phrase qui semble régler tous les débats avant même qu'ils ne commencent : à la Conférence mondiale sur l'intelligence artificielle, le 19 juillet, ModelBest et OpenBMB ont présenté leur modèle comme le mieux classé parmi les modèles de moins de 4B de paramètres au classement d'Artificial Analysis, et ses poids ouverts ont désormais été mis en ligne en toute discrétion sur Hugging Face. Gemma 4 12B est la réponse de Google, venue d'une toute autre catégorie de poids — un généraliste multimodal dense de 11,95 milliards de paramètres, sans encodeur, sorti le 3 juin, qui accepte en entrée texte, image, audio et vidéo et fort de plusieurs mois de déploiement communautaire. Les comparer ne se résume pas à confronter des fiches techniques : c'est une décision sur l'appareil que vous ciblez, car un modèle qui domine sa catégorie de taille et un modèle simplement plus gros répondent à des questions de matériel différentes.
Le timing est la raison pour laquelle cette confrontation existe. MiniCPM5-2B a été présenté au WAIC en juillet comme un produit — une histoire de puce autant qu’une histoire de modèle, avec neuf partenaires silicium annoncés dès le premier jour, issus de sa communauté FlagOS — et les poids étaient promis « dans un avenir proche ». Sept semaines plus tard, le dépôt openbmb/MiniCPM5-2B est apparu sur Hugging Face (le journal des modifications d’OpenBMB date la sortie du 7 septembre), sous licence Apache-2.0, sans restriction d’accès, avec le checkpoint BF16, les formats GGUF, MLX, GPTQ, les checkpoints de base et SFT, ainsi que les jeux de données d’entraînement, le tout dans la même collection. Pas de communiqué de presse, pas d’événement de lancement. À l’heure où nous écrivons ces lignes, la fiche du modèle tient lieu d’annonce, et aucune exécution de benchmark indépendante n’a encore été publiée — tout ce qui est quantitatif concernant la 2B ci-dessous provient soit de la propre reproduction de ModelBest, soit de la capture d’Artificial Analysis qu’elle cite. Gemma 4 12B, en revanche, a été lancé via la procédure habituelle de Google et a été téléchargé des millions de fois. Ce déficit de preuves fait partie intégrante de la comparaison, et non une simple note de bas de page.
Qu'est-ce qui vient de changer de chaque côté ?
MiniCPM5-2B est le deuxième modèle de la série MiniCPM5, après le MiniCPM5-1B qu'OpenBMB a publié en open source le 19 mai. La fiche décrit un transformer dense de 2 516 756 480 paramètres au total (1 981 982 720 hors embeddings — le chiffre qui lui vaut l'appellation « classe 2B »), avec 42 couches et une dimension cachée de 2048, une attention par groupes de requêtes avec 16 têtes de requête et seulement 2 têtes KV, et un vocabulaire de 130 560. L'architecture est un simple LlamaForCausalLM — la fiche précise explicitement qu'aucun kernel personnalisé ni aucun fork du code du modèle n'est nécessaire — et l'ensemble du checkpoint est fourni dans un unique shard safetensors en BF16. Le choix de conception intéressant concerne le post-entraînement : un SFT sur 400 milliards de tokens de données de réflexion profonde, puis une distillation on-policy qui condense seize modèles experts RL, dont cinq agentiques, en un seul petit réseau dense. La fiche attribue à la combinaison RL + OPD un gain moyen de 10,96 points sur les tâches de raisonnement et générales, et de 6,96 points sur les tâches agentiques — des améliorations mesurées en interne, mais qui éclairent la conception de ce modèle : un 2B pensé pour être un agent embarqué, qui émet nativement des appels d'outils de type XML.

Gemma 4 12B occupe une position différente dans la gamme de Google. C'est l'enfant du milieu de la famille Gemma 4 — au-dessus des modèles E2B et E4B orientés edge, en dessous du MoE 26B et du 31B de pointe — et c'est le seul membre à reposer sur une conception sans encodeur : les patches d'images brutes et les formes d'onde audio sont projetés directement dans l'espace des tokens, de sorte qu'un seul modèle dense gère les entrées texte, image, audio et vidéo, sans tour d'encodeur séparée à servir. Il dispose d'une fenêtre de contexte de 256K, d'un appel d'outils prêt à l'emploi, d'une passe de raisonnement optionnelle et de drafters à prédiction multi-tokens qui accélèrent le décodage depuis le checkpoint lui-même. Il est sous licence Apache-2.0, exploitable sur du matériel de classe 16 Go (environ 8 Go en 4 bits), et sa page Hugging Face indique des millions de téléchargements par mois.

L'affirmation de classement, et la classe de taille qu'elle omet.
Le titre de ModelBest pour MiniCPM5-2B est un indice Artificial Analysis Intelligence de 17, le premier parmi les modèles de moins de 4B paramètres au lancement. Deux réserves doivent l'accompagner. Le score reflète l'instantané v4.1 d'AA et n'est pas directement comparable aux valeurs d'indice des instantanés précédents, et il s'agit d'un chiffre de lancement cité par le fournisseur avant toute ré-exécution indépendante. La lecture honnête est plus étroite et reste impressionnante : à sa sortie, selon la méthodologie d'AA de l'époque, ce modèle de 2,5B menait toute sa catégorie de taille. Gemma 4 12B n'apparaît pas dans cette catégorie, et sur les propres pages d'Artificial Analysis aujourd'hui, il obtient un indice plus élevé — environ 22 pour la variante de raisonnement et 13 pour le modèle instruct non-raisonnant, tous deux « bien au-dessus de la moyenne » pour leur groupe de pairs. Les indices de différents instantanés ne se recoupent pas nettement, alors considérez cela comme une direction, pas une précision : le généraliste de 12B se révèle être le modèle le plus capable, et le 2B se révèle être le modèle le plus capable de sa taille. Ce sont des affirmations différentes et les deux peuvent être vraies.
Le tableau d'affichage, honnêtement étiqueté
Lisez ces lignes en gardant à l’esprit la provenance des données — les chiffres de MiniCPM5-2B sont des affirmations de la fiche ModelBest, datant d’une semaine et non reproduites ; ceux de Gemma 4 12B sont rapportés par Google et exposés depuis longtemps à l’usage de la communauté :
• Taille — MiniCPM5-2B : 2,52B au total / 1,98B non-embedding, dense. Gemma 4 12B : 11,95B, dense.
• Modalité — MiniCPM5-2B : texte uniquement. Gemma 4 12B : entrée texte, image, audio et vidéo, sans encodeur.
• Contexte — MiniCPM5-2B : 131 072 jetons dans la configuration fournie. Gemma 4 12B : 256K de contexte natif (certaines configurations de service plafonnent à 128K).
• Langues — MiniCPM5-2B : fiche et données centrées sur l'anglais et le chinois. Gemma 4 12B : 140+ langues.
• Sortie — MiniCPM5-2B : annoncé le 19 juillet 2026 ; poids mis en ligne les 6-7 septembre, en toute discrétion. Gemma 4 12B : lancé le 3 juin 2026, avec des évaluations complètes de lancement.
• Preuves — MiniCPM5-2B : fiche du fournisseur plus AA v4.1 (Index 17, #1 sub-4B) ; aucun test indépendant pour l’instant. Gemma 4 12B : évaluations de lancement plus des mois de déploiement communautaire et environ 3,3 millions de téléchargements par mois.

Le tableau ci-dessus est le même portrait en six rangées : les deux modèles sont en désaccord sur presque toutes les dimensions, et les colonnes qui déterminent le choix — modalité, langues, classe d'appareil — sont celles qu'aucune moyenne de référence ne capture.
Là où le 12B gagne : les choses qu'un 2B purement textuel ne peut pas imiter.
Commençons par la modalité. Gemma 4 12B prend en charge nativement l’audio, les images et la vidéo ; MiniCPM5-2B est uniquement textuel. Tout produit qui transcrit, regarde un écran ou visionne une vidéo a besoin d’un second pipeline à côté du 2B, et à ce stade, l’avantage du « petit modèle » s’évapore en partie. Les langues constituent le deuxième mur : 140+ contre une version centrée sur l’anglais et le chinois. Pour un produit servant une longue traîne de langues, le 2B n’est pas du tout un candidat. Et il y a ensuite les preuves. Gemma 4 12B a été téléchargé des millions de fois, quantifié, affiné et servi en production pendant trois mois ; ses modes de défaillance sont documentés et son écosystème s’étend à llama.cpp, Ollama, LM Studio, MLX, vLLM et SGLang. MiniCPM5-2B est un dépôt vieux d’une semaine dont les chiffres phares — y compris un 46,4 sur SWE-bench Verified réalisé par le fournisseur, ce qui serait remarquable pour un modèle dense de 2,5B s’il survit aux tests indépendants — n’ont été touchés par personne en dehors du laboratoire. Rien que sur la maturité, le choix ne se discute pas.
Là où la 2B est la seule option.
Aucun de ces éléments n'a d'importance sur la classe d'appareils où un modèle 12B ne tient tout simplement pas. Un téléphone, une carte de cockpit intelligent ou un petit boîtier edge doté de quelques gigaoctets de DRAM ne peut pas déplacer les poids d'un modèle de 11,95B sur le bus mémoire à une vitesse utile — c'est exactement le goulot d'étranglement qui l'étoufferait. MiniCPM5-2B a été conçu pour ce monde : des poids qui tiennent dans la mémoire de l'appareil, une fenêtre de 128K pour les longues sessions d'agent, un appel d'outils natif conçu pour fonctionner en mode interactif, et une adaptation dès le premier jour sur neuf familles de puces plus ARM. Si votre cible est un NPU de classe téléphone ou une carte embarquée, Gemma 4 12B n'est pas en concurrence avec MiniCPM5-2B ; il n'y est tout simplement pas déployable. Et si votre cible peut embarquer un modèle 12B, mais tout juste — un ordinateur portable de 16 Go — le modèle 2B vous offre de la marge : une latence par jeton plus rapide, une consommation plus faible, et la possibilité d'exécuter un second modèle dans la même empreinte.
Comment savoir quelles réclamations survivent
Comme les deux côtés sont en open-weight et auto-hébergeables, la prochaine étape honnête consiste à mesurer sur votre propre matériel plutôt qu'à une nouvelle lecture des fiches techniques. Si vous pesez un MiniCPM5-2B contre un Gemma 4 12B sur une charge de travail que vous servez déjà, c'est aussi là qu'une couche de routage montre sa valeur : diriger le chemin de test vers un nouveau checkpoint auto-hébergé via une seule API avec basculement automatique signifie qu'une pile non éprouvée peut caler ou boucler sans faire tomber la production, tandis que les prix catalogue des fournisseurs autour de ce que vous comparez passent avec une marge de 0 %. Le modèle lui-même est un dépôt vieux d'un jour, donc le défaut est de le traiter comme une expérience — mais l'expérience est peu coûteuse à mener, et les deux heures qu'il faut pour reproduire SWE-bench ou une partie de votre propre ensemble d'évaluation sur le 2B sont exactement la preuve qui manque à cette confrontation.
Le verdict
Choisissez Gemma 4 12B lorsque votre matériel dispose de la marge suffisante et que votre charge de travail va au-delà du texte — un produit multimodal, un public multilingue, ou tout scénario où trois mois de comportement éprouvé par la communauté comptent plus qu’une couronne au classement. Choisissez MiniCPM5-2B lorsque votre appareil ne peut pas du tout faire tourner un modèle de 12B, ou lorsqu’un modèle 2,5B orienté agent, capable de traiter du texte et tournant sur une puce de classe téléphone, vous permettrait de commercialiser un produit qu’un modèle plus grand rend impossible. Le leader du classement sous-4B est une véritable prouesse, et la publication de ses poids en open-weights le rend testable dès aujourd’hui ; ce n’est toutefois pas, au vu des éléments disponibles, un remplaçant pour un modèle généraliste de 12B là où un 12B peut réellement tourner.
