
MiniCPM-V 4.7 vs North Micro Vision Instruct : Cohere a livré un modèle documenté de 2,4 B ; OpenBMB a livré un blanc de 70 Go
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
MiniCPM-V 4.7 et North Micro Vision Instruct sont tous deux des réponses de petits laboratoires au même cahier des charges — un modèle compact de vision-langage que vous pouvez affiner et déployer vous-même — mais un seul des deux est terminé. North Micro Vision Instruct de Cohere est arrivé le 10 août 2026 sous la forme d’un modèle à résolution native de 2,4 milliards de paramètres sous Apache-2.0, avec un article de blog technique expliquant l’architecture et une fiche indiquant à quoi il sert. MiniCPM-V 4.7 est arrivé le 6 octobre 2026 sous la forme d’un point de contrôle sparse mixture-of-experts de 35,2 milliards de paramètres avec seize shards, sans README, sans champ de licence et sans benchmark d’aucune sorte. La comparaison intéressante n’est pas « lequel est le plus intelligent ». C’est que les deux publications incarnent des postures opposées face à la communauté qui doit les utiliser.
Les deux versions, et ce qui a été livré avec chacune
North Micro Vision Instruct est un modèle vision-langage ouvert de 2,4 B de paramètres issu de CohereLabs, publié sous licence Apache-2.0. Il est explicitement positionné comme une base compacte pour le prototypage, le fine-tuning spécifique à une tâche et les travaux multimodaux spécialisés. Sa caractéristique déterminante est un traitement d'image en résolution native qui préserve les ratios d'aspect et les détails visuels fins plutôt que de rééchantillonner dans une grille fixe, et la fiche technique revendique des capacités en VQA, légendage, grounding, OCR, graphiques et documents. Il prend en charge plusieurs images par conversation et onze langues — anglais, allemand, français, espagnol, italien, portugais, hindi, japonais, coréen, chinois et arabe. Les poids du modèle comptent 2 484 847 856 paramètres en BF16, et depuis sa publication, la communauté MLX a produit des conversions en 4 bits, 5 bits, 6 bits, 8 bits, mxfp8, mxfp4, nvfp4 et bf16, ce à quoi ressemble une publication saine de petit modèle après quelques mois. Il totalise environ 166 500 téléchargements et 150 likes.
MiniCPM-V 4.7 est openbmb/MiniCPM-V-4.7-35B-A3B : 35 212 875 824 paramètres en BF16, 70,4 Go répartis sur seize fragments safetensors, classe MiniCPMV4_7ForConditionalGeneration, enregistré par Transformers 5.2.0 et mis en ligne le 6 octobre 2026.

Son squelette textuel est un MoE creux dérivé de Qwen3.5 — 256 experts, 8 sélectionnés par token — avec 40 couches appliquant un schéma d'attention fixe de trois linéaires pour une complète, un contexte de 256K, et une tour de vision interne de 27 couches à un sous-échantillonnage de 16×. Il n'y a pas de fiche de modèle. Le dépôt compte trois likes et aucun téléchargement.
Côte à côte, sur les six choses qui comptent
• Paramètres — North Micro Vision Instruct : 2,48B dense, chaque paramètre actif par token. MiniCPM-V 4.7 : 35,2B au total, 8 sur 256 sparse. Pas un chiffre comparable.
• Licence — North Micro Vision Instruct : Apache-2.0, étiquetée et déclarée. MiniCPM-V 4.7 : aucune déclarée, ce qui revient par défaut à tous droits réservés.
• Surface de fine-tuning — North Micro Vision Instruct : explicitement conçu comme base pour le fine-tuning spécifique à une tâche, avec des quantifications communautaires déjà disponibles. MiniCPM-V 4.7 : un checkpoint BF16 de 70 Go, sans quantification et sans recette d'entraînement indiquée.
• Gestion de la résolution — North Micro Vision Instruct : résolution native, conservation du rapport d'aspect. MiniCPM-V 4.7 : downsample_mode : « 16x » avec max_slice_nums : 9, un chemin haute résolution basé sur un slicer.
• Couverture linguistique — North Micro Vision Instruct : onze langues indiquées sur la carte. MiniCPM-V 4.7 : non mentionné nulle part.
• Contexte — North Micro Vision Instruct : dimensionné pour sa classe de déploiement de 2,4B. MiniCPM-V 4.7 : max_position_embeddings : 262144, 256K.
• Preuves de qualité — North Micro Vision Instruct : une fiche publiée, un article de blog technique, des conversions communautaires et une large adoption. MiniCPM-V 4.7 : rien à citer.

L’asymétrie qui rend cette comparaison déséquilibrée
Il existe un type particulier d’article comparatif qu’il serait facile d’écrire ici : extraire les chiffres de MiniCPM-V 4.6 du GitHub d’OpenBMB, constater qu’ils surpassent la classe équivalente de petits modèles, et sous-entendre que le 4.7 en hérite. Ce serait malhonnête, et il vaut la peine d’énoncer précisément pourquoi. MiniCPM-V 4.7 n’est pas une version plus grande de 4.6. Il abandonne le backbone dense 1,3B Qwen3.5-0.8B pour un Qwen-MoE sparse de 35B, fait passer le schéma d’attention à un ratio 3:1 linéaire/complet, et change la compression visuelle par défaut à 16x. Chacun de ces éléments constitue une modification de la partie du modèle qui détermine la précision. La lignée familiale n’est pas un benchmark.
L'autre direction de la malhonnêteté est plus subtile : considérer l'absence d'une fiche comme la preuve d'un problème. Ce n'est pas le cas. OpenBMB a livré neuf générations de MiniCPM-V depuis 2024, dont plusieurs sont véritablement excellentes pour leur taille, et un intervalle de douze minutes entre la création du dépôt et le dernier commit correspond à ce à quoi ressemble un artefact préparé puis publié, et non à un artefact défectueux. La lecture correcte de MiniCPM-V 4.7 est « inconnu », et « inconnu » est une chose distincte de « mauvais ».
Le côté de Cohere a ses propres exigences d'honnêteté.

Les affirmations de qualité de la fiche North Micro Vision sont les propres mesures de Cohere, et l’analyse technique approfondie est rédigée par la même équipe. Le fait que la communauté ait réalisé seize quantifications MLX en quelques jours est une preuve d’adoption, pas d’exactitude — on convertit les modèles faciles à convertir, et une version propre de 2,4B sous Apache-2.0 est facile à convertir. Ni le nombre de téléchargements ni l’éventail des quantifications ne devraient être interprétés comme un score.
À quoi sert chacun en réalité
North Micro Vision Instruct est une cible de fine-tuning. C'est tout le cahier des charges, énoncé dans les propres termes de la fiche : une base compacte pour le prototypage et les applications spécialisées. Si vous avez une tâche étroite d'analyse de documents, d'extraction de graphiques ou de légendage multilingue et quelques milliers d'exemples étiquetés, un modèle 2,4B sous Apache-2.0 avec entrée à résolution native et quantifications en huit bits et plus est un point de départ raisonnable, et vous pouvez le déplacer vers un appareil en périphérie ou un seul GPU de milieu de gamme lorsqu'il fonctionne.
MiniCPM-V 4.7, s'il s'avère utilisable, n'est pas cela. À 70 Go non quantisé, c'est un modèle serveur, et ses caractéristiques distinctives — une fenêtre de 256K et une attention linéaire qui garde le cache KV constant — visent des charges de travail multimodales à long contexte : des transcriptions vidéo d'une heure, de grands ensembles de documents, une analyse multi-tours étendue avec des images dans l'historique. Ce sont de véritables charges de travail, et l'architecture est un pari raisonnable sur celles-ci. Le pari n'a simplement pas encore été évalué.
Il y a une nuance à retenir au sujet des deux stratégies de compression. La résolution native et le sous-échantillonnage 16× ne sont pas simplement meilleurs et moins bons. Un encodeur en résolution native dépense des tokens pour préserver les détails fins, ce dont l’OCR et le grounding ont besoin. Un sous-échantillonnage 16× dépense moins de tokens et risque de perdre précisément ces détails. Le bon choix dépend de si votre tâche consiste à lire un formulaire dense ou à décrire une scène, et le mode commutable 4x/16x de MiniCPM-V 4.6 existait précisément parce que la réponse change selon la tâche. Que 4.7 ait conservé ce commutateur fait partie des choses que la configuration ne dit pas.
Là où un routeur a sa place, et où il ne l'a pas
Ces deux modèles sont des poids que vous servez vous-même. Ni North Micro Vision Instruct ni MiniCPM-V 4.7 n’est un modèle hébergé sur OrcaRouter, et rien ici ne doit être interprété comme une affirmation en ce sens. La question du routage intervient une étape plus tard, lorsque le petit modèle auto-hébergé effectue le travail de routine et qu’un modèle plus grand doit traiter les cas sur lesquels il échoue. C’est à ce passage de relais que sert un routeur à clé unique — plus de 200 modèles de différents fournisseurs, chacun à son prix catalogue, sans marge ajoutée de notre côté, avec basculement automatique en cas de dégradation d’un fournisseur — et il vaut la peine d’avoir l’interface définie avant d’en avoir besoin, car le jour où votre évaluation de 4.7 réussit est le jour où vous voulez un second point de terminaison sans un second contrat.
Le verdict, et ce qui pourrait le changer
Cohere a publié un modèle. OpenBMB a publié un point de contrôle. Sur chaque axe sur lequel un lecteur peut agir — licence, clarté de la licence, comportement documenté, aptitude au fine-tuning, quantification, couverture linguistique — North Micro Vision Instruct est la réponse aujourd'hui, et ce n'est pas serré. Ce n'est pas une affirmation sur les capacités, car aucune comparaison de capacités n'est possible. MiniCPM-V 4.7 compte environ dix fois le nombre de paramètres du modèle auquel il est comparé et n'a rien publié pour justifier ou réfuter cette taille. La posture honnête consiste à le considérer comme en attente : un artefact réel issu d'un laboratoire avec un vrai palmarès, qui se trouve dans un dépôt auquel il manque un fichier qui changerait tout — le README.
