Une carte de titre principale affichant « Kolibri vs MiniCPM5 2B » en grandes lettres grasses, avec une seule ligne plus petite en dessous indiquant « un modèle de classe serveur face à un agent embarqué », et deux petites icônes plates au trait côte à côte — un colibri à gauche et le contour d'une petite puce mobile à droite — séparées par un fin séparateur vertical, sur fond blanc avec de doux accents dégradés bleu et cyan et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Kolibri vs MiniCPM5-2B : 78 milliards de paramètres contre 2,5, et pourquoi le petit n'est pas l'option bon marché

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Placez Kolibri à côté de MiniCPM5-2B et la lecture instinctive est qu'il s'agit d'une comparaison de taille, et que le modèle à 2,5 milliards de paramètres est le choix économique. Cette lecture est fausse d'une manière instructive. Kolibri est le modèle à mélange d'experts d'Aleph Alpha fort de 78,1 milliards de paramètres, publié le 3 octobre 2026, activant 3,46 milliards de paramètres par token, avec une empreinte FP8 d'environ 78 Go et une configuration de service minimale de deux cartes A100 80 Go. MiniCPM5-2B est le modèle dense à 2,52 milliards de paramètres de ModelBest et OpenBMB, dévoilé à la World Artificial Intelligence Conference le 19 juillet 2026, ses poids étant arrivés sur Hugging Face le 6 septembre. MiniCPM5-2B est trente et une fois plus petit en nombre de paramètres. C'est aussi celui qui exige un budget d'évaluation avant qu'on puisse lui faire confiance, car ses chiffres les plus cités sont produits par le fournisseur et non reproduits — ce qui est précisément l'inverse de ce que « petit modèle » sous-entend habituellement en matière de risque.

Les deux ont été expédiés discrètement ; un seul d'entre eux a été expédié récemment.

Ils ont des histoires d'origine similaires et des âges très différents, et les âges comptent. Le dépôt d'Aleph Alpha pour Kolibri a été créé le 2 octobre 2026 avec une date de sortie annoncée au 3 octobre, et l'annonce de la salle de presse du fournisseur elle-même a été diffusée ce matin-là, le jour de la Réunification allemande. La presse IA généraliste l'a largement manquée le jour même, d'où le cadrage de « sortie discrète », mais une fiche de modèle, un rapport technique et un article du fournisseur ne constituent pas une sortie silencieuse. MiniCPM5-2B était réellement plus discret : l'annonce faite au WAIC en juillet était un dévoilement en conférence d'un argumentaire et de spécifications, et les poids proprement dits n'ont fait leur apparition que le 6 septembre, publiés sans événement de lancement, aux côtés des checkpoints GGUF, MLX, GPTQ, base, SFT et draft, ainsi que des corpus d'entraînement qui les sous-tendent.

Cet écart de cinq semaines entre l'annonce et les poids mérite d'être rappelé, car c'est la raison pour laquelle deux séries de chiffres différentes circulent pour ce modèle. La documentation de juillet vantait une fenêtre de contexte de 512 K tokens. La configuration livrée fixe 131 072. C'est l'artefact publié qui compte.

À quoi sert réellement chaque modèle

Kolibri est conçu pour le travail documentaire en allemand et en anglais, et Aleph Alpha explique avec une précision inhabituelle pourquoi cela a nécessité une véritable ingénierie. De petites expériences sur des modèles proxy ont fixé un objectif d’environ 20 % d’allemand dans le mélange d’entraînement, ce qui, pour une exécution de 20 billions de tokens, signifiait trouver 4 billions de tokens allemands. Des jeux de données allemands ouverts, dédupliqués et filtrés, ont produit 390 milliards de tokens — un ordre de grandeur en dessous —, si bien que le laboratoire a réajusté un filtre Common Crawl spécifiquement pour l’allemand, produisant 1,3 billion de tokens organiques uniques, et a reformulé des documents allemands existants en entrées d’encyclopédie, dialogues et passages pour environ un autre billion, ce qui est devenu la plus grande source allemande unique. La traduction, utilisée pour le prédécesseur Kolibri Origin, a été abandonnée pour Kolibri. Le détail du filtre est celui à retenir : un pipeline standard de données linguistiques écarte les documents contenant trop de mots longs, et la prose administrative allemande dépasse régulièrement la limite anglaise de longueur moyenne des mots, si bien que les paramètres par défaut suppriment silencieusement le registre dans lequel écrit l’administration publique.

MiniCPM5-2B a été conçu pour l'extrémité opposée — un agent embarqué. La fiche technique décrit un transformer dense de 2,52 milliards de paramètres au total, 1,98 milliard hors embeddings, 42 couches avec une taille cachée de 2048, une attention à requêtes groupées avec 16 têtes de requête et 2 têtes KV, et une architecture LlamaForCausalLM standard sans noyaux personnalisés. Le pipeline d'entraînement est résolument orienté agent : un entraînement intermédiaire d'agent à l'échelle de 200 milliards, un large ensemble agent-SFT, un alignement par RL d'agent, et une étape finale de distillation on-policy qui replie seize modèles experts RL dans un seul petit réseau dense. Il est livré avec des appels d'outils de style XML et un parseur SGLang intégré, et sa configuration publiée définit une fenêtre de 131 072 tokens.

• Paramètres — Kolibri : 78 103 074 560 au total, 3 457 573 120 actifs, sparsité de 22,6:1. MiniCPM5-2B : 2 516 756 480 au total, 1,98 B hors embeddings, dense.

• Sortie — Kolibri : 3 octobre 2026. MiniCPM5-2B : annoncé le 19 juillet 2026, poids publiés le 6 septembre 2026.

• Contexte — Kolibri : 16 384 entraînés, 65 536 mi-entraînés, 262 144 natifs, 1 048 576 validés. MiniCPM5-2B : 131 072 dans la configuration livrée ; l’affirmation des 512K de juillet n’y figure pas.

• Empreinte — Kolibri : environ 78 Go en FP8 ; au minimum deux A100 80 Go, deux H100 SXM5, un H200, un B200 ou un B300. MiniCPM5-2B : un seul fragment BF16, de classe ordinateur portable.

• Langues — Kolibri : allemand et anglais, par conception et rien d'autre. MiniCPM5-2B : anglais et chinois, avec toutes les suites d'évaluation publiées en anglais.

• Appel d’outils — Kolibri : style Hermes avec un parseur vLLM fourni. MiniCPM5-2B : style XML avec un parseur SGLang.

• Licence — toutes deux sous Apache 2.0, toutes deux sans avenant d'usage acceptable.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Les tableaux de bord, et le sourcing qui les sous-tend

Il n'existe nulle part de chiffre en confrontation directe pour ce duo, dans les documents de l'un ou l'autre fournisseur, et nous n'allons pas en constituer un à partir de deux harnais différents pour appeler cela une comparaison. Ce que chaque partie publie mérite d'être soigneusement distingué, car les deux ensembles de chiffres portent des quantités de preuves très différentes.

Les chiffres de Kolibri proviennent de la propre table de comparaison à quatorze modèles d’Aleph Alpha, exécutée sur un même harnais avec Kolibri à un effort de raisonnement élevé : 75,5 sur la moyenne anglaise, 70,8 sur la moyenne allemande. Cette table ne flatte pas son sujet — Qwen3.8 27B obtient 80,2 et 79,9 sur les deux mêmes moyennes et arrive en tête sur GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified et les deux benchmarks de contexte long, tout en activant environ un huitième des paramètres de Kolibri. La présentation de cet écart par le fournisseur est une frontière de Pareto entre qualité et tokens décodés par seconde et par GPU, qu’aucun des modèles comparés ne dépasse. C’est un argument d’économie du serving, pas un argument de capacité, et aucun tiers ne l’a mesuré : il n’existe pas d’entrée Artificial Analysis pour Kolibri et aucune réplication du harnais.

Les chiffres du MiniCPM5-2B proviennent de sa propre fiche : une moyenne interne de 53,9 sur un ensemble de comparaison choisi par le fournisseur, AIME 2025/2026 à 86,5, MATH-500 à 94,6, et un score de 46,4 obtenu par le fournisseur sur SWE-bench Verified, qui serait remarquable pour un modèle dense de 2,5 milliards de paramètres s'il résiste à des tests indépendants. Sur cette fiche, le Granite 4.2 3B d'IBM se situe à 42,7 contre 53,9 pour le MiniCPM5-2B — un seul fournisseur ayant fait tourner les deux modèles sur une unique suite qu'il a choisie. Des suites différentes, des harnais différents, des fournisseurs différents. Rien de tout cela ne constitue un verdict sur cette association.

Ce qui est véritablement utile du côté de MiniCPM5-2B, c’est la divulgation. OpenBMB a publié les corpus d’entraînement UltraData en même temps que les poids — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, les ensembles SFT et RL d’agents — le tout sous Apache 2.0, ce qui transforme une boîte noire en une recette que l’on peut inspecter et poursuivre sur son propre domaine. Le modèle est également livré avec une adaptation dès le premier jour sur neuf familles de puces via la communauté FlagOS de ModelBest, de Huawei Ascend à NVIDIA et ARM, ce qui constitue une déclaration en matière de déploiement plutôt qu’en matière de benchmark. Face à cela, IBM a publié les poids de Granite 4.2 3B et un compte rendu technique détaillé de la construction, mais pas ses données d’entraînement, et Aleph Alpha a publié le pipeline de données et la comptabilité énergétique de Kolibri — 20 000 milliards de tokens de pré-entraînement, 9,5×10² MWh, incluant les coûts indirects des centres de données et excluant le fine-tuning supervisé et l’apprentissage par renforcement — mais pas le corpus lui-même.

Où l'écart de taille se manifeste en réalité

La façon la plus utile de mettre ces deux éléments côte à côte est de les placer sur les deux axes qui déterminent un déploiement réel : ce qui doit se trouver dans la salle, et ce qui se passe lorsque le modèle se trompe.

Côté matériel, MiniCPM5-2B l'emporte, et de loin. Un modèle dense de 2,52 milliards de paramètres tenant dans un seul shard BF16 tourne sur un ordinateur portable, un boîtier edge ou un seul GPU grand public, et la prise en charge de FlagOS sur neuf familles de puces signifie qu'il tourne sur du matériel qui n'est pas du tout un accélérateur NVIDIA. Le plancher de Kolibri, c'est deux cartes A100 80 GB ou un B200, environ 78 Go de poids FP8, servis via le plugin vLLM aleph-alpha-inference ou le conteneur publié. Pour une charge de travail de cockpit intelligent ou proche du téléphone, le 2B est le seul des deux à être qualifié, et Kolibri n'a jamais été conçu pour rivaliser sur ce terrain.

En matière de vérifiabilité, Kolibri l'emporte pour une raison plus subtile. Son affirmation la plus citée — l'économie du service — n'a pas été testée, mais ses chiffres de qualité sont au moins publiés face à treize concurrents nommés sur un même harnais, avec les paramètres divulgués, et le propre tableau du fournisseur accorde la victoire à un concurrent sur la plupart des lignes. Les chiffres phares de MiniCPM5-2B sont ceux du fournisseur, sur la suite du fournisseur, sans harnais de comparaison divulgué, et le modèle porte l'incertitude supplémentaire d'un checkpoint vieux de plusieurs semaines plutôt que de quelques jours. Aucun des deux modèles n'a été évalué de manière indépendante. La différence, c'est qu'un fournisseur a consigné une comparaison qui fait perdre son propre modèle, tandis que l'autre a consigné une comparaison qui fait gagner son propre modèle avec une large marge.

À dessein, il n’y a pas l’ombre d’une concurrence. Kolibri existe pour le traitement de documents en langue allemande sur site, avec un tokeniseur bilingue qu’Aleph Alpha annonce à 4,90 octets en moyenne par token sur du texte web allemand, contre 4,35 pour GPT-5 et 3,28 pour Kimi K3 — le tout mesuré par les fournisseurs, et un effet sur le coût par token plutôt qu’une allégation de qualité. MiniCPM5-2B existe pour les agents d’appel d’outils en anglais et en chinois sur du matériel aux ressources limitées. Une équipe ayant des contrats allemands et une exigence de conformité ne choisit pas entre les deux.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

La réalité du routage, et l’expérience qui vaut la peine d’être menée

Aucun des deux modèles ne figure aujourd’hui dans un catalogue hébergé, et nous avons vérifié les deux plutôt que de le supposer. Kolibri n’a pas de SKU d’API fournisseur — la publication consiste en des poids, un rapport technique et une image de conteneur — et il n’est pas sur OrcaRouter : nous avons sondé le catalogue sous toutes les orthographes du préfixe fournisseur et du modèle, et il renvoie introuvable. MiniCPM5-2B n’a pas non plus de point de terminaison hébergé de la part de ModelBest, et il n’est pas routé chez nous. Les deux sont des propositions auto-hébergées et nous préférons le dire plutôt que de laisser entendre que nous servons l’un ou l’autre.

C'est là que cela devient intéressant : l'expérience. Un modèle agentique de 2,5 milliards de paramètres et un modèle documentaire de 78 milliards de paramètres résolvent des problèmes différents, et le seul moyen de savoir ce dont votre charge de travail a besoin est de les exécuter tous les deux dessus — ce pour quoi une couche de routage est précisément conçue, même lorsqu'elle n'héberge aucun des deux modèles. Dirigez un chemin de test vers une version auto-hébergée de MiniCPM5-2B via un point de terminaison compatible OpenAI avec basculement automatique, tout en laissant la production sur un modèle routé éprouvé, et la nouvelle pile peut se bloquer ou produire des absurdités sans faire tomber quoi que ce soit. Les prix catalogue des fournisseurs sur les modèles auxquels vous vous comparez sont répercutés sans marge, de sorte que le test A/B reste bon marché et réversible. Et si ce que l'expérience révèle en réalité, c'est que votre charge de travail allemande n'a besoin d'aucun des deux modèles auto-hébergés, la même clé atteint un petit niveau de mélange d'experts déjà routé — la variante Gemma 4 26B-A4B à 0,06 $ par million de jetons d'entrée et 0,33 $ par million de sortie, avec une fenêtre de 262 144 jetons et une entrée texte, image et vidéo — ce qui est le moyen le moins cher de le découvrir avant d'acheter deux GPU.

Lequel, et qu’est-ce qui changerait la réponse ?

Exécutez MiniCPM5-2B si la contrainte est l'appareil. Avec ses 2,52 milliards de paramètres, c'est le seul des deux à tenir dans un ordinateur portable, un cockpit ou un boîtier edge, et si votre charge de travail est un agent interactif d'appel d'outils en anglais ou en chinois, c'est le modèle conçu pour cela. Prévoyez d'abord le temps de reproduire ses chiffres — la moyenne de 53,9 et la revendication de 46,4 sur SWE-bench sont propres à ModelBest, et le fait que les corpus d'entraînement soient ouverts rend cette reproduction réellement possible plutôt que théorique.

Exécutez Kolibri si le corpus est allemand, que le matériel existe et que les poids ne peuvent pas quitter le bâtiment. Une fenêtre native de 262 144 tokens, un cache KV FP8, quatre niveaux d’effort de raisonnement et l’appel d’outils Hermes constituent la bonne configuration pour le travail sur des documents réglementés, et les conditions Apache 2.0 ainsi que le pipeline de données publié sont l’élément qui résiste à une revue d’approvisionnement.

Deux choses permettraient de trancher plus vite que n’importe quel argument. Une exécution indépendante de SWE-bench Verified sur MiniCPM5-2B confirmerait ou ruinerait l’affirmation la plus surprenante avancée par l’une ou l’autre des cartes. Et une mesure indépendante du débit de Kolibri dans sa configuration recommandée à deux H100 — ou une entrée Artificial Analysis, qui n’existe pas aujourd’hui — transformerait « 78 milliards de paramètres » d’une spécification en un coût, qui est le chiffre que recherche réellement quiconque met cette comparaison en balance avec le matériel. D’ici là, l’écart de taille est réel, l’écart de finalité est plus grand, et l’option d’apparence bon marché est celle qui porte l’affirmation non vérifiée.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement