
MiniCPM5-2B vs Qwen 3 8B : une charge de travail 8B devrait-elle descendre vers une 2.5B ?
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Chaque comparaison de modèles cache une question matérielle, et MiniCPM5-2B contre Qwen 3 8B, c'est cette question déguisée en benchmark. Qwen 3 8B est le cheval de trait open-weights d'Alibaba d'avril 2025 — environ 8,2 milliards de paramètres denses, 119 langues, mode de réflexion hybride activable ou non par requête, et seize mois de retours de la communauté derrière lui. MiniCPM5-2B est le modèle que ModelBest et OpenBMB ont dévoilé à la Conférence mondiale sur l'intelligence artificielle le 19 juillet, classé en tête des modèles de moins de 4 milliards de paramètres sur le leaderboard d'Artificial Analysis, et dont les poids ouverts sont discrètement apparus sur Hugging Face les 6 et 7 septembre. La question qui les réunit sur une même page est celle que la plupart des équipes faisant tourner un 8B ouvert se posent à un moment donné : la charge de travail que je fais tourner sur un 8B pourrait-elle descendre sur un 2,5B — et si oui, qu'est-ce que j'y perdrais ?
La réponse courte est : pas encore pour la plupart des charges de travail, mais les raisons sont plus étroites que ne le suggère l'écart de taille quadruple, et il existe une catégorie de déploiements où le 8B n'a aucune réponse du tout. Tout ce qui est quantitatif ci-dessous est rapporté par le fournisseur et étiqueté comme tel : les chiffres du MiniCPM5-2B sont les propres affirmations de la fiche technique de ModelBest, vieilles d'une semaine et non reproduites par quiconque en dehors du laboratoire ; ceux du Qwen 3 8B appartiennent à Alibaba, depuis longtemps examinés, quantifiés et réexécutés par une large communauté. Cette asymétrie des preuves est le véritable titre de cette confrontation.
Seize mois de Qwen 3 8B
Qwen 3 8B appartient à la même famille architecturale, avec une taille trois fois supérieure et seize mois de plus que son adversaire. C'est un transformer causal dense avec attention par requêtes groupées, pré-entraîné sur un corpus multilingue d'environ 36 000 milliards de jetons, sous licence Apache-2.0, et l'un des modèles 8B les plus largement auto-hébergés et servis dans le monde des poids ouverts. Sa signature est le mode de raisonnement hybride Qwen3 — réflexion activée ou désactivée à chaque requête, ce qui permet à un même déploiement de répondre rapidement aux questions simples et de passer à une chaîne de pensée délibérée pour les mathématiques ou le code. Il intègre nativement le Model Context Protocol et l'appel de fonctions, un contexte natif de 32K qu'Alibaba valide jusqu'à 131K via la mise à l'échelle YaRN, ainsi qu'une couverture de 119 langues et dialectes. Seize mois plus tard, ses modes de défaillance sont documentés, ses quantifications existent partout, et la pile de service qui l'entoure — vLLM, SGLang, llama.cpp, des milliers de fine-tunes — est mature. En quantification pratique, il tourne dans les quelques gigaoctets, confortablement sur un GPU de milieu de gamme, pas sur un téléphone.

Ce que MiniCPM5-2B prétend dans ce monde-là
MiniCPM5-2B arrive de la direction opposée : petit par conception, agentique par l'entraînement. Il s'agit d'un transformer dense de 2,52 milliards de paramètres au total (1,98 milliard hors embeddings), avec 42 couches d'une dimension cachée de 2048, une attention à requêtes groupées, une architecture LlamaForCausalLM standard sans noyaux personnalisés et une fenêtre de contexte de 131 072 jetons dans la configuration livrée (les supports de lancement de juillet vantaient 512K ; la configuration publiée ne le contient pas). Là où Qwen 3 8B doit son étendue à un pré-entraînement multilingue de 36 000 milliards de jetons, MiniCPM5-2B doit sa forme au post-entraînement : un SFT sur 400 milliards de jetons de données de réflexion profonde, puis une distillation on-policy qui condense seize modèles experts RL, dont cinq agentiques, en un seul petit réseau dense. Il a été présenté au lancement comme une base d'agent sur appareil — invocation native d'outils par des appels de type XML, adaptation dès le premier jour sur neuf familles de puces, plus ARM, modes hybrides rapide/réfléchi — et la fiche du modèle revendique une moyenne interne de 53,9 sur son ensemble de comparaison 2B-4B sélectionné par le fournisseur, un score de 86,5 à l'AIME 2025/2026 et un score de 46,4 obtenu par le fournisseur sur SWE-bench Verified, ce qui serait remarquable pour un modèle de 2,5 milliards s'il survit à des tests indépendants.

Le décalage, dimension par dimension
— Publication — MiniCPM5-2B : annoncé le 19 juillet 2026 ; poids disponibles du 6 au 7 septembre. Qwen 3 8B : annoncé en avril 2025.
• Taille — MiniCPM5-2B : 2,52B au total / 1,98B non-embedding, dense. Qwen 3 8B : ~8,2B dense.
• Contexte — MiniCPM5-2B : 131 072 tokens dans la configuration livrée. Qwen 3 8B : 32K natif, 131K validé via YaRN.
• Langues — MiniCPM5-2B : centré sur l'anglais et le chinois. Qwen 3 8B : 119 langues et dialectes.
• Raisonnement — MiniCPM5-2B : modes hybrides rapide/délibéré, selon les documents de lancement. Qwen 3 8B : réflexion Qwen3 activée ou désactivée selon la requête.
• Preuves — MiniCPM5-2B : fiche du fournisseur, aucune exécution indépendante. Qwen 3 8B : rapporté par Alibaba, seize mois de reproduction et de déploiement par la communauté.

Le tableau ci-dessus représente honnêtement l’inadéquation : les colonnes diffèrent sur presque tout, à l’exception de la licence ouverte Apache-2.0, et la classe d’appareils que vous ciblez détermine quelle colonne vous êtes autorisé à choisir.
Là où le 8B gagne encore
Descendre d'une catégorie de poids, c'est renoncer à trois choses concrètes. D'abord, les langues : Qwen 3 8B en couvre 119 ; la fiche et les données de MiniCPM5-2B sont centrées sur l'anglais et le chinois, et aucune envergure multilingue n'est revendiquée. Pour un produit qui dessert une longue traîne de langues, c'est un mur, pas une limite souple. Deuxièmement, les preuves : seize mois de tests communautaires signifient que le comportement de Qwen 3 8B est connu et que son écosystème est partout, tandis que MiniCPM5-2B est un dépôt vieux d'une semaine avec une fiche non vérifiée — et ses chiffres vedettes, s'ils ne survivent pas à des exécutions indépendantes, sont exactement le genre de chiffres qui se font discrètement réviser. Troisièmement, la pile de serving : tout ce qui dialogue déjà avec Qwen 3 8B dialogue avec une cible mature, alors qu'un tout nouveau checkpoint de classe 2B signifie devoir revalider quantifications, configurations de serving et comportement d'appel d'outils à partir de zéro. Aucune de ces raisons n'empêche la 2B de gagner sur un benchmark spécifique ; ce sont des raisons pour lesquelles la 8B est le choix par défaut à plus faible risque partout où elle trouve sa place.
Là où un 2B est la seule réponse
Rien de tout cela n'importe sur la classe d'appareils où un 8B ne tient tout simplement pas. Sur un téléphone, une carte de cockpit intelligent ou une petite box edge dotée de quelques gigaoctets de DRAM, Qwen 3 8B ne concurrence pas MiniCPM5-2B — il n'est tout simplement pas déployable à une vitesse utile. C'est exactement la raison d'être du 2B, et c'est pourquoi le cadrage honnête de cette confrontation n'est pas « le 2B est-il aussi bon que le 8B ? » mais « lequel de mes déploiements ne peut être servi que par l'un de ces deux modèles ? » Si vous déployez des agents sur appareil, là où le bus mémoire s'étranglerait sur huit milliards de poids, MiniCPM5-2B est l'une des options de classe 2B les plus intensivement entraînées disponibles, et la seule question qui vaille la peine d'être posée est de savoir si ses revendications agentiques survivent à votre propre reproduction. Si votre charge de travail tourne déjà sur un matériel qui porte un 8B confortablement, l'écart de taille ne suffit pas à justifier une migration — et le manque de preuves plaide contre.
Si vous envisagez de changer
La manière sûre de tester ce passage est de le traiter comme une expérience, et non comme une migration. Déployez MiniCPM5-2B sur votre propre matériel, dirigez une partie du trafic réel vers lui via une API avec bascule automatique, et comparez-le au 8B sur les mêmes requêtes — une couche de routage est ici rentable, car un point de contrôle vieux d'une semaine peut caler ou boucler sans faire tomber la production, et les prix affichés par les fournisseurs pour les modèles hébergés que vous comparez sont transmis tels quels, avec une majoration de 0%. Ce que vous testez vraiment, ce sont trois choses : si la précision du 2B tient sur vos données, si sa latence sur votre type d'appareil bat celle du 8B sur le matériel que vous achèteriez autrement, et si le profil linguistique anglais-chinois couvre les utilisateurs que vous avez réellement. Reproduisez d'abord SWE-bench ou un extrait de votre propre jeu d'évaluation — les deux heures que cela demande sont l'assurance la moins chère que cette confrontation offre.
Le verdict
Restez sur Qwen 3 8B pour tout ce qui est multilingue, tout ce qui exige seize mois de comportement connu, ou toute charge de travail déjà prise en charge sur du matériel qui accueille confortablement un 8B. Ne testez sérieusement MiniCPM5-2B que si votre appareil cible ne peut pas du tout accueillir le 8B, ou si un 2.5B qui suit le rythme sur les travaux agentiques et à long contexte vous permettrait de réduire la mémoire et la puissance sur le matériel que vous expédiez déjà. Le leader des classements sub-4B est une véritable réussite et sa sortie en poids ouverts le rend testable dès aujourd'hui ; ce n'est tout simplement pas encore, au vu des preuves disponibles, une raison de mettre à la retraite un cheval de trait 8B qui a déjà gagné sa place.
