Une carte de titre principale générée pour « MiniCPM-V 4.7 vs Microsoft Mage-VL » avec le sous-titre « Deux façons de réduire le coût de l'analyse vidéo », une carte à gauche indiquant « Mage-VL : parcimonie de tokens native au codec, 75 % de tokens visuels en moins », une carte à droite indiquant « MiniCPM-V 4.7 : attention linéaire, cache KV constant sur 256K » et une pastille indiquant « Compresser l'entrée, ou compresser l'état », avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL : deux paris très différents sur ce que devrait coûter un modèle de vision par image

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

MiniCPM-V 4.7 et Microsoft Mage-VL sont tous deux des modèles vision-langage qui prétendent vous faire économiser des tokens, et ils y parviennent par des voies opposées. Mage-VL, publié par Microsoft le 25 juillet 2026, s'attaque au versant vidéo : il emprunte la structure d'un codec vidéo, conserve chaque patch de trame d'ancrage et uniquement les patches de trames prédites qui portent un mouvement réel, et revendique une réduction des tokens visuels de plus de 75 % avec une accélération en temps d'horloge pouvant atteindre 3,5× par rapport à un échantillonnage uniforme des trames. MiniCPM-V 4.7, mis en ligne par OpenBMB le 6 octobre 2026, s'attaque au versant séquence : un MoE clairsemé de 35,2 milliards de paramètres dont 30 de ses 40 couches suivent une voie d'attention linéaire, ce qui fait croître lentement le cache KV sur un contexte de 256K. Un modèle compresse ce qu'il regarde. L'autre compresse ce dont il se souvient. Et un seul d'entre eux est livré avec quelque chose que vous pouvez évaluer.

Ce que chacun est

Microsoft Mage-VL est un modèle de fondation multimodal codec-natif, en streaming proactif, à l'échelle 4B, publié sous Apache-2.0 avec un rapport technique et une section d'évaluation substantielle. Il a été conçu délibérément en opposition à ce que ses auteurs appellent un paradoxe de Moravec pour les VLM — performant en raisonnement hors ligne, lent en perception temps réel. L'encodeur visuel, Mage-ViT, est entraîné entièrement à partir de zéro sur environ 100 millions d'images et de vidéos non étiquetées plutôt qu'initialisé à partir d'un ViT pré-entraîné sur le web, et le seul composant pré-entraîné de la pile est le backbone linguistique Qwen3-4B-Instruct-2507. Le checkpoint complet est un modèle unifié unique qui effectue la compréhension d'images, le raisonnement vidéo hors ligne et le commentaire en streaming déclenché par événements, sans variantes distinctes, et une version microsoft/Mage-ViT compagnon fournit l'encodeur à lui seul. Elle a accumulé environ 10 600 téléchargements et 420 likes depuis sa publication.

MiniCPM-V 4.7 est openbmb/MiniCPM-V-4.7-35B-A3B, un checkpoint BF16 de 35 212 875 824 paramètres en seize fragments totalisant 70,4 Go, écrit par Transformers 5.2.0 et téléversé le 6 octobre 2026 sans fiche modèle.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Sa configuration textuelle est étiquetée qwen3_5_moe_text avec 256 experts et 8 actifs par token ; son layer_types tableau aligne trois couches d'attention linéaire pour chaque couche d'attention complète, sur 40 couches ; sa tour de vision est la tour interne minicpmv4_7_vision à 27 couches avec un sous-échantillonnage de 16× et jusqu'à neuf tranches d'image. Le contexte est de 256K. Le dépôt ne compte aucun téléchargement, trois likes, aucun benchmark et aucune licence.

Les six lignes qu'un lecteur peut vérifier

Les mêmes six dimensions, des deux côtés. Là où un nombre n'existe pas, l'écart reste visible.

• Paramètres — Mage-VL : 4,74 B, dense, tous actifs par token. MiniCPM-V 4.7 : 35,2 B au total, sparse, 8 experts sur 256 par token. Le chiffre de MiniCPM n'est pas comparable à celui d'un modèle dense.

• Licence — Mage-VL : Apache-2.0, indiqué dans la fiche et les tags du dépôt. MiniCPM-V 4.7 : rien de déclaré.

• D’où viennent les économies de tokens — Mage-VL : parcimonie des tokens visuels au niveau de l’encodeur, alignée sur le codec, avec plus de 75 % de réduction annoncée. MiniCPM-V 4.7 : attention linéaire au niveau du décodeur, ce qui réduit la croissance du cache KV sur les longues séquences mais ne réduit pas les tokens que vous lui fournissez.

• Contexte — Mage-VL : entraîné lors d'une phase à long contexte sur 350 K vidéos sous forme de fenêtres de codec glissantes allant jusqu'à 384 ou 768 images. MiniCPM-V 4.7 : max_position_embeddings: 262144.

• Provenance de l’encodeur de vision — Mage-VL : entraîné à partir de zéro sur ~100 M de trames non étiquetées ; la fiche indique 85,69 % sur ImageNet avec 256 tokens et une amélioration monotone avec le budget de tokens. MiniCPM-V 4.7 : tour de lignée réutilisée à partir de la conception de MiniCPM-V 4.6, avec la même forme de 1152 dimensions cachées et 27 couches, et un sous-échantillonnage 16x par défaut.

• Preuves — Mage-VL : une fiche complète avec DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 et un écart CrossPoint de +53,1 par rapport à Qwen3-VL-4B, tous rapportés par le fournisseur face à un backbone apparié. MiniCPM-V 4.7 : aucun.

• Comportement en streaming — Mage-VL : une porte cognitive qui évalue chaque fenêtre glissante et reste silencieuse jusqu'à ce qu'un événement soit terminé, entraînée sur ~3,3 M d'échantillons de streaming. MiniCPM-V 4.7 : non décrit nulle part.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Ce que tout le monde comprend mal au sujet des chiffres de Mage-VL

Les tableaux de référence de la fiche Mage-VL sont solides, et les plus solides sont aussi les plus faciles à mal interpréter. Les lignes de comparaison opposent Mage-VL-4B à Qwen3-VL-4B, Phi-4-Multimodal-Instruct et Phi-4-Reasoning-Vision, et les gains mis en avant — +22,5 sur QVHighlight, +24,5 sur VideoEval-Pro, +53,1 sur CrossPoint — sont réels au sens où ils figurent dans les tableaux du fournisseur. Ce sont aussi les mesures du fournisseur lui-même, produites par l'équipe qui a entraîné le modèle, sur le même banc d'essai. Aucun tiers indépendant ne les a reproduites. C'est normal pour un modèle vieux de quatre mois, et ce n'est pas un reproche à lui faire, mais cela signifie que le verbe correct est « rapporte », et non « obtient ».

Deux choses méritent d’être reconnues au-delà des tableaux. Premièrement, la conception à backbone apparié — garder le décodeur Qwen3-4B fixe et ne remplacer que le ViT — constitue un élément de preuve plus net qu’une position dans un classement, car elle isole le stack visuel plutôt que l’ensemble du système. Deuxièmement, le corpus d’entraînement de Mage-ViT compte environ 100 M d’images non étiquetées, contre les milliards de paires image-texte qu’utilisent les encodeurs pré-entraînés sur le web ; égaler ainsi le comportement de la classe SigLIP2-at-10B en matière de discrimination de clusters est une affirmation précise et vérifiable sur l’efficacité des données, plutôt qu’une vantardise générale.

MiniCPM-V 4.7 n’a rien de tout cela. Pas une version plus faible — rien.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Il n'existe aucune table, qu'elle soit fournie par un éditeur ou non, et le fichier de configuration qui décrit l'architecture s'exclut explicitement de toute déclaration relative à l'exactitude.

Architecture : deux réponses à la même question

Les deux modèles tentent de répondre à « comment rendre l’inférence multimodale bon marché », et le contraste est instructif parce que les deux réponses se composent plutôt qu’elles ne rivalisent.

Mage-VL réduit l'entrée. Sa 16×16grille de patches est partagée entre les trames d'ancrage et les trames prédites, et les trames prédites ne contribuent des patches que là où le codec dépense des bits — c'est-à-dire là où se trouvent le mouvement et les nouveaux détails. Il en résulte des flux de tokens de longueur variable par trame, c'est pourquoi la pile a besoin d'un projecteur capable de fournir une séquence variable à un décodeur causal, et pourquoi la même interface peut accepter des vecteurs de mouvement H.264/HEVC ou une carte de débit apprise d'un codec neuronal sans réentraînement. Ensuite, un encodage rotatif 3D préserve la cohérence des positions spatio-temporelles malgré la parcimonie. Le budget de tokens est la quantité qui est gérée.

MiniCPM-V 4.7 réduit l'état. Ses couches d'attention linéaire conservent un état récurrent de taille fixe au lieu d'un cache clé-valeur croissant, de sorte que le coût mémoire d'une longue conversation cesse d'augmenter linéairement avec le nombre de tokens. Son budget de séquence est la quantité gérée, et le contexte de 256K en est le gain. Notamment, la configuration de MiniCPM-V 4.7 annonce le sous-échantillonnage visuel 16x — elle compresse elle aussi l'entrée — mais reste muette sur la question de savoir si elle conserve le mode 4x commutable qu'exposait MiniCPM-V 4.6.

Pour le dire simplement : l'astuce de Mage-VL porte ses fruits sur la vidéo, où la plupart des images sont presque identiques à leurs voisines. L'astuce de MiniCPM-V 4.7 porte ses fruits sur les documents longs et les longues sessions multi-tours, où les tokens s'accumulent. Un pipeline qui ingère un flux en direct puis tient une longue conversation à son sujet bénéficierait des deux, et aucun des deux modèles n'accomplit encore la tâche de l'autre.

Les intégrer dans un flux de travail réel

Mage-VL est pratique à essayer dès aujourd'hui : un seul checkpoint, une architecture documentée, Apache-2.0, et une fiche qui vous indique ce que le dépôt regroupe. Il est disponible depuis juillet et l'outillage qui l'entoure a eu le temps de se stabiliser.

MiniCPM-V 4.7 n'est pas pratique à essayer aujourd'hui, pour des raisons ennuyeuses. 70 Go en BF16 sans quantification représentent de la mémoire d'accélérateur que vous n'avez probablement pas en réserve, et l'absence de licence fait que la question de savoir si vous pouvez l'utiliser du tout reste ouverte. Les chemins de code personnalisés nécessitent trust_remote_code, et la question de savoir si la combinaison MoE + attention linéaire dispose de kernels dans votre pile de service n'a pas été testée.

Ce qui est vrai pour les deux, c'est qu'un modèle de vision auto-hébergé est un composant d'un système qui doit aussi appeler des modèles de pointe. C'est ce qui justifie de placer la partie hébergée derrière un seul routeur plutôt qu'un second contrat et un second SDK : OrcaRouter donne accès à plus de 200 modèles avec une seule clé, répercute le prix catalogue de chaque fournisseur sans marge ajoutée par nos soins, et bascule automatiquement en cas de dégradation d'un fournisseur. Ni Mage-VL ni MiniCPM-V 4.7 n'est un modèle hébergé sur ce service — ce sont tous deux des poids que vous servez vous-même —, alors considérez cela comme la plomberie de l'autre côté du passage de relais, et non comme un canal de disponibilité pour l'un ou l'autre de ces modèles.

Verdict

Mage-VL est un modèle achevé, sous licence et évalué par benchmarks, doté d'une philosophie de conception précise et bien argumentée, et son argumentaire repose sur la diffusion vidéo en continu et le raisonnement spatial, où son encodeur natif de codec fait quelque chose de structurellement différent de tous les autres. MiniCPM-V 4.7 est un checkpoint plus grand, sans licence et non mesuré, dont la philosophie de conception est lisible mais dont le comportement est une page blanche. Sur tout ce sur quoi un lecteur peut agir aujourd'hui, Mage-VL l'emporte par défaut — non pas parce qu'il est meilleur, mais parce qu'il est le seul des deux qui puisse être jugé tout court. Revenez sur cette comparaison lorsque le README de MiniCPM-V 4.7 paraîtra ; si ce jour apporte des benchmarks et une licence, la question intéressante sera de savoir si un MoE à attention linéaire à contexte 256K bat un encodeur de parcimonie natif de codec sur la vidéo longue, et c'est là un combat réellement ouvert.