
Liquid AI d1-3B vs MiniCPM5-2B : Probabilités vs Prose, à l'échelle d'un ordinateur portable
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Deux modèles à poids ouverts, tous deux assez petits pour tourner sur la machine devant vous, et ils ne sont pas d’accord sur ce qu’un modèle devrait renvoyer. Liquid AI d1-3B est le modèle de décision 3,12B de Liquid AI, rendu public en open weight le 7 octobre 2026 : il lit un état et un ensemble de questions nommées, puis renvoie une étiquette, une probabilité par option et un niveau de confiance, en une seule passe avant, sans rien générer. MiniCPM5-2B est le modèle dense 2,52B de ModelBest et OpenBMB, présenté à la World Artificial Intelligence Conference le 19 juillet et discrètement publié sur Hugging Face début septembre 2026 sous licence Apache-2.0 — un assistant de raisonnement, de codage et d’appel d’outils qui rédige des réponses, appelle des fonctions en XML et compte déjà plus d’un million de téléchargements. Le plus petit dispose d’une fenêtre de contexte quatre fois plus grande et d’une licence bien plus permissive ; le plus grand ne peut pas produire un seul token, même si vous le souhaitez. Laquelle de ces deux formes a sa place dans votre pipeline dépend entièrement de si l’élément en aval de l’appel attend un nombre ou une phrase.
L’inversion qu’il faut remarquer en premier
Presque toutes les attentes intuitives concernant ce duo sont à l’envers, alors commencez par là.
MiniCPM5-2B est le plus petit modèle et c’est lui qui dispose du contexte le plus long : 131 072 tokens contre 32 768 pour Liquid AI d1-3B. Il est aussi celui des deux dont la licence est la plus permissive — Apache-2.0, sans restriction d’accès, avec les jeux de données d’entraînement publiés aux côtés des poids au sein de la famille UltraData. Liquid AI d1-3B est distribué sous la licence lfm1.0 propre à Liquid, qui est téléchargeable et permet l’affinage, mais il s’agit d’une licence de fournisseur plutôt que d’une licence permissive standard.
Liquid AI d1-3B est le modèle le plus grand — 3,12B contre 2,52B au total, bien que la comparaison s'inverse à nouveau sur les paramètres non-embedding — et c'est celui qui ne sait pas écrire. Il a la vision ; le MiniCPM est uniquement textuel. Il est post-entraîné pour exactement une chose ; le MiniCPM est post-entraîné pour plusieurs. Et là où le MiniCPM5-2B arrive avec un graphique comparatif le plaçant en tête de sa catégorie de taille, Liquid AI d1-3B arrive avec un seul score d'indice et un ensemble de tableaux de latence.
Rien de tout cela ne rend l’un meilleur. Cela signifie que les deux sont conçus pour des tâches différentes, et l’indice révélateur est la forme de la réponse que chacun renvoie.
Qu’est-ce qui revient sur le fil
MiniCPM5-2B est un modèle de langage génératif. Il raisonne, il répond en prose et émet des appels d'outils au format XML que le parseur intégré à SGLang, à savoir minicpm5, convertit en tool_calls compatibles OpenAI sans adaptateur personnalisé. Son post-entraînement est la partie intéressante de son histoire : 400 milliards de tokens de fine-tuning supervisé de réflexion approfondie, puis un apprentissage par renforcement avec un algorithme à base de critique emprunté à JustRL II, puis une distillation on-policy qui replie seize enseignants RL spécialisés — dont cinq agentiques — dans un seul réseau dense. La fiche attribue au RL et à la distillation un gain moyen de 10,96 points sur les tâches de raisonnement et générales, et de 6,96 sur les tâches agentiques, et rapporte une moyenne de 53,9 sur son propre ensemble de comparaison, au-dessus du plus grand modèle inclus dans cet ensemble. Ce sont les chiffres de ModelBest, produits en interne, sans reproduction indépendante publiée à ce jour.
Liquid AI d1-3B renvoie une structure. Une nouvelle question revient comme P(oui) entre 0 et 1. Une à choix question revient comme le libellé, une confiance et une probabilité par option. Une score question revient comme un niveau attendu sur une échelle ordonnée de deux à dix avec sa distribution et sa légende. L'objet usage indique output_tokens: 0, et il y a un brut probabilities accesseur si vous voulez les vecteurs non traités. Son post-entraînement était le type de travail opposé : moyenner deux checkpoints ensemble, affiner plusieurs graines sur différents mélanges de données, les fusionner, puis consacrer l'effort à l'entraînement sur entrées longues, mélanger l'ordre des options de réponse et supprimer les raccourcis des données d'entraînement — car un modèle de décision qui apprend « l'option B est généralement correcte » au lieu de lire l'état est pire qu'inutile.
L’un demande à un modèle de réfléchir, puis de dire quelque chose. L’autre demande à un modèle ce qu’il croit déjà.

Côte à côte, avec la provenance indiquée
Tous les chiffres ci-dessous sont déclarés par les fournisseurs. Les chiffres de MiniCPM5-2B proviennent de la fiche de ModelBest et de son propre ensemble de comparaison ; ceux de Liquid AI d1-3B proviennent du fait que Liquid a exécuté elle-même le scorer officiel de Decision Index plutôt que de soumettre au classement public. Aucun des deux modèles n’a fait l’objet d’une évaluation indépendante par un tiers au moment de la publication des poids ouverts.
• Paramètres — Liquid AI d1-3B 3.12B au total avec un encodeur de vision SigLIP2 de 400M et un vocabulaire de 128,000 tokens ; MiniCPM5-2B 2,516,756,480 au total, 1,981,982,720 non-embedding, 42 couches, 16 têtes de requête vers 2 têtes KV, vocabulaire 130,560.
• Contexte — 32 768 jetons pour Liquid AI d1-3B ; 131 072 pour MiniCPM5-2B.
• Modalités d'entrée — texte et images pour Liquid AI d1-3B ; texte uniquement pour MiniCPM5-2B.
• Sortie — probabilités, étiquettes, confiances et scores ordonnés, avec zéro token de sortie, pour Liquid AI d1-3B ; texte généré, raisonnement et appels d'outils XML pour MiniCPM5-2B.
• Score principal — Liquid AI d1-3B 48,57 sur Decision Index 0.2.1, premier parmi les modèles de moins de 10B dans le tableau du fournisseur ; MiniCPM5-2B une moyenne de 53,9 sur son propre ensemble de comparaison, qui est un ensemble différent mesurant des choses différentes.
Vitesse — 8 ms par question sur une RTX 4090, 26 ms sur un Jetson AGX Orin 64 GB, 50 ms sur un Jetson Orin Nano, et 64 états empaquetés par passe à 475 par seconde pour Liquid AI d1-3B. La vitesse de MiniCPM5-2B dépend du nombre de tokens qu'il génère, il n'y a donc pas de chiffre unique à lui opposer.
• Licence — Apache-2.0, sans restriction, données d’entraînement publiées, pour MiniCPM5-2B ; lfm1.0 de Liquid pour Liquid AI d1-3B.
• Preuves — plus d’un million de téléchargements Hugging Face et un mois de quantification communautaire pour MiniCPM5-2B ; deux jours d’existence et aucune exécution tierce pour Liquid AI d1-3B.
Le travail pour lequel chacun est réellement doué
Il existe un flux de travail que les deux modèles peuvent accomplir, et la différence dans la manière dont ils s'y prennent constitue tout l'argument.
Supposons que vous triiez des tickets d’assistance, ou que vous décidiez si un passage récupéré répond à une question, ou que vous évaluiez une sortie de LLM par rapport à une grille d’évaluation. MiniCPM5-2B peut faire ces trois choses — c’est un petit raisonneur capable, doté de l’appel d’outils et d’un contexte long, et vous l’utiliseriez comme n’importe quel autre assistant, en demandant une étiquette puis en analysant ce qui est renvoyé. Parfois, il renvoie un JSON propre. Parfois, il renvoie un JSON entouré d’une explication. Parfois, il renvoie la bonne réponse dans la mauvaise forme, et ce raté est un bug dans votre analyseur plutôt que dans le modèle.
Liquid AI d1-3B ne peut rien faire d'autre, et c'est précisément là tout l'intérêt. Sur les trois mêmes tâches, il renvoie une probabilité et une étiquette, et rien à analyser ; trois questions sur un même état coûtent 1,3 fois le temps d'une seule, et le mode de défaillance passe de « le format a cassé » à « la confiance était mal calibrée » — ce qui est au moins mesurable, car la confiance se trouve directement dans la réponse.
Là où MiniCPM5-2B l’emporte nettement, c’est pour tout ce qui se situe en aval de la décision. Il prend en charge 131K jetons, de sorte que l’état peut être l’arborescence de fichiers d’un dépôt entier ou un long document plutôt que la première page de l’un d’eux. Il écrit nativement les appels d’outils. C’est un modèle sur lequel vous pouvez bâtir un petit agent, et il a été post-entraîné explicitement pour le travail agentique. Et sa licence Apache-2.0 signifie que la conversation habituelle avec un juriste commercial n’a pas lieu.
Là où le Liquid AI d1-3B l'emporte nettement, c'est sur le plancher de latence et la modalité. Un appareil qui rend une décision en 50 ms sans GPU n'est pas un appareil qui fait tourner MiniCPM5-2B ; les deux évoluent dans des catégories matérielles différentes malgré des nombres de paramètres similaires. Et le 3B voit — le fournisseur annonce 74,1 sur onze benchmarks publics d'images lus comme des décisions, contre 73,9 pour le modèle vision-langage dont il est issu, et indique que retirer les images fait chuter les mêmes questions à 45,1, ce qui est sa façon de montrer que les réponses viennent des pixels. L'inspection visuelle d'une ligne de production n'est pas une tâche que l'on peut confier au 2B textuel, tout simplement.

Les exécuter, et la couche qui les entoure
Les deux sont des cas d’auto-hébergement, et dans les deux cas, le travail de déploiement a été effectué. Liquid AI d1-3B est livré avec une prise en charge de llama.cpp dès le premier jour, la pile NVIDIA complète de DGX à Jetson, la quantification NVFP4, un build 8 bits poids et activations, et des conversions GGUF déjà publiées. MiniCPM5-2B est une architecture LlamaForCausalLM standard, sans noyaux personnalisés requis, un seul shard safetensors BF16, des builds GGUF et MLX dans la famille élargie, et une préférence documentée pour SGLang lorsque vous avez besoin du parseur d’appels d’outils. Aucun des deux ne figure dans notre catalogue, et cet article ne constitue pas une affirmation de disponibilité pour l’un ou l’autre.
Les alternatives hébergées sont l'API propre du fournisseur et les plateformes tierces. Liquid propose en version hébergéed1 facturé uniquement sur les tokens d'entrée, à 0,04 $ par million, les images étant facturées en entrée à 1,5 token par zone de 32 × 32 pixels, et sans aucune ligne de sortie ; MiniCPM5-2B n'a pas d'API en propre, ce qui est normal pour une publication de poids ouverts sous Apache-2.0.
Ce vers quoi les deux convergent est le même problème d’architecture. Un modèle local 2B ou 3B qui gère la classification, le routage ou les contrôles de garde-fous se place devant les appels génératifs que vous n’hébergez pas, et ce mélange — inférence en propre à côté d’inférence louée — est précisément ce qu’une couche de routage a pour rôle d’absorber. Un point de terminaison unique pour plus de 200 modèles, tarifs catalogue des fournisseurs répercutés avec 0 % de marge de sorte qu’un changement de prix fournisseur soit effectif le jour même, basculement automatique lorsqu’un service en amont se dégrade. Posséder le petit modèle rend la question du routage plus difficile, pas plus facile, car désormais la frontière entre votre matériel et celui de quelqu’un d’autre est une décision que vous devez prendre à chaque requête.
Choisir par type de réponse
Si ce dont vous avez besoin est une étiquette, une probabilité ou une note, et que l’ensemble des options est connu à l’avance, Liquid AI d1-3B est l’instrument le plus honnête — il a été conçu pour cette requête et la réponse n’arrivera pas malformée. Acceptez la licence du fournisseur, le contexte de 32K et les preuves vieilles de deux jours comme prix à payer.
Si ce dont vous avez besoin est un petit modèle capable de raisonner, d’appeler des outils, de tenir un long document et de répondre en mots, MiniCPM5-2B est la machine la plus capable, et de loin, et il s’accompagne d’Apache-2.0 et d’un million de téléchargements qui témoignent des tests effectués par d’autres.
Les équipes qui tireront le meilleur parti de l’une ou l’autre de ces versions sont celles qui utilisent les deux : un modèle décisionnel devant, où la réponse est un nombre et où les millisecondes comptent, et un petit modèle génératif derrière, pour les parties du travail qui nécessitent du langage. Ils ne sont pas concurrents. Ils sont un filtre et un haut-parleur.

