
PixelUMM vs Microsoft Mage-VL : l’un supprime le tokenizer visuel, l’autre le réécrit
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Tous deux PixelUMM et Microsoft Mage-VL ont été conçus par des équipes convaincues que la manière dont la vision est transformée en tokens constitue le mauvais goulot d'étranglement — et elles l'ont résolu dans des directions opposées. Mage-VL, le modèle de streaming natif aux codecs de Microsoft, conserve un tokenizer et le rend bien plus agressif : il suit la structure des codecs vidéo modernes, conserve chaque image d'ancrage et uniquement les patchs de trames prédites là où le codec dépense des bits, et rapporte une réduction des tokens visuels de plus de 75 % tout en obtenant jusqu'à 3,5× d'accélération en temps réel par rapport à un échantillonnage uniforme des images. PixelUMM, le modèle unifié sans encodeur de NVIDIA, supprime entièrement le tokenizer — chaque patch 16×16 de pixels bruts atteint le backbone via une seule projection linéaire, sans VAE ni vision transformer nulle part. L'un compresse plus fort. L'autre refuse totalement de compresser. Et un seul des deux peut générer quoi que ce soit.
Cette dernière différence est ce qui rend cette association plus intéressante qu’une simple bataille de spécifications. Mage-VL est un observateur — un modèle de perception en flux doté d’une porte proactive qui décide quand prendre la parole. PixelUMM est un lecteur qui dessine aussi : les mêmes poids répondent à des questions sur une image et génèrent une nouvelle vidéo à partir d’une invite textuelle. Ce sont deux réponses incompatibles à « ce que devrait être un modèle de vision unifié », et chaque labo a ses propres chiffres.
Là où la compression se produit
Le postulat de Mage-VL est un paradoxe de Moravec moderne : les modèles vision-langage sont performants sur le raisonnement hors ligne difficile, mais lents et gourmands en calcul pour la simple perception en temps réel. Sa solution est l'alignement de codec. Au lieu de décoder un flux en images échantillonnées uniformément et de faire passer une grille dense à travers un ViT figé pré-entraîné sur le Web, Mage-VL sépare un flux en images d'ancrage (I) et images prédites (P), conserve tous les patchs d'ancrage, et ne garde que les patchs des images prédites portant un mouvement réel ou un nouveau détail. L'encodeur, Mage-ViT, est entraîné à partir de zéro sur une grille de patchs 16×16 avec un encodage de position rotatif 3D et est explicitement agnostique au codec — la même interface accepte les vecteurs de mouvement et l'énergie résiduelle H.264/AVC ou HEVC, ou la carte de débit apprise d'un codec neuronal, sans changement d'architecture ni ré-entraînement.
La prémisse de PixelUMM est que le problème vient de l’encodeur lui-même, et non de son efficacité. Son article soutient que des modèles comme BAGEL embarquent deux interfaces visuelles — un ViT pour les caractéristiques sémantiques et un VAE pour les latents de reconstruction — ce qui double à peu près le contexte visuel par image de conditionnement et force à reconstruire les pipelines de pré-entraînement vision-langage autour d’un second flux. PixelUMM supprime les deux : les images deviennent des patchs spatiaux de 16×16, les vidéos deviennent des tubelets spatiotemporels de 4 images, et les pixels bruts atteignent un Transformer à décodeur seul via des projections linéaires à une seule couche. La compréhension est du texte autorégressif ; la génération est un appariement de flux dans l’espace pixel.
• Stratégie de compression — Mage-VL : temporelle, dérivée du codec ; conserver les ancres, raréfier les images prédites. PixelUMM : aucune ; conserver chaque patch de pixel brut.
• Ce qui est entraîné à partir de zéro — Mage-VL : toute la pile visuelle, sur environ 100 M d’images et de vidéos non étiquetées. PixelUMM : les encodeurs et décodeurs de pixels, au-dessus d’un socle linguistique Qwen3-8B.
• Backbone — Mage-VL : Qwen3-4B-Instruct-2507, le seul composant pré-entraîné, derrière un projecteur MLP à deux couches. PixelUMM : Qwen3-8B, environ 15,2 milliards de paramètres au total.
• Comportement de streaming — Mage-VL : une porte cognitive évalue chaque fenêtre glissante et reste silencieuse jusqu’à ce qu’un événement méritant une réponse soit terminé, n’invoquant le modèle complet qu’à ce moment-là. PixelUMM : pas de mode streaming ; les requêtes sont des appels de génération ou de compréhension.

Ce que chacun fait, et ce qu’il ne fait pas
Mage-VL est un seul checkpoint qui fournit simultanément la compréhension des images et des vidéos et la porte de streaming proactive — les mêmes poids répondent aux questions hors ligne et pilotent les commentaires déclenchés par des événements. Il regroupe le processeur de codec, le paquet de codec neuronal et la porte. Une deuxième version, microsoft/Mage-ViT, est l'encodeur visuel autonome issu de l'étape de pré-entraînement à partir de zéro, proposé comme front-end prêt à l'emploi pour d'autres entraînements multimodaux. Ce que Mage-VL ne fait pas, c'est générer. Il lit.
PixelUMM couvre le texte-vers-image, le texte-vers-vidéo à 96 images et 24 i/s, ainsi que le texte conditionné par image et par vidéo. Il est livré avec quatre checkpoints — S8-F22-R05 par défaut, couvrant les quatre tâches, S8-F18-R01 optimisé pour un meilleur texte-vers-vidéo en 480p et 720p, mais incapable de faire de la compréhension vidéo, et deux étapes intermédiaires. Ce qu'il ne fait pas, c'est le streaming, l'édition ou la 3D. Si vous avez besoin d'un modèle qui regarde un flux en direct et parle quand quelque chose se produit, PixelUMM n'a pas du tout la bonne forme, et aucune colonne de benchmark ne vous le dira.
L’écart d’adoption est le premier signal honnête
Les deux versions ne sont pas aussi matures l’une que l’autre, et les compteurs de téléchargements le disent plus clairement que n’importe quel article de lancement.
• Mage-VL — publié sur Hugging Face le 25 juillet 2026 sous licence Apache-2.0, accompagné d'un rapport technique et d'un identifiant arXiv. Début octobre, il affichait environ 13 800 téléchargements et 414 likes, et un petit écosystème de travaux communautaires s'était développé autour de lui.
• PixelUMM — publié sur Hugging Face le 1er octobre 2026 sous une licence de checkpoint non commerciale. Son nombre de téléchargements était de zéro et son nombre de « j'aime » était de trois au moment de la rédaction. Il n'a que quelques jours.
Aucun des deux laboratoires n’a encore fait d’annonce pour la sortie respective — Mage-VL est sorti en juillet sans annonce, et PixelUMM est sorti en octobre sans annonce. Cette symétrie est bien réelle, mais ce serait une erreur d’y voir deux artefacts équivalents. Mage-VL a bénéficié de dix semaines d’attention de la communauté ; PixelUMM, de quelques jours. Un modèle que personne en dehors du laboratoire n’a fait tourner est une proposition différente d’un modèle que quelques milliers de personnes ont téléchargé, et un seul de ces deux modèles appartient à la seconde catégorie.

Le tableau des scores, avec provenance
Tous les chiffres sont ceux du laboratoire de développement lui-même. Ceux de Mage-VL proviennent de la fiche et du rapport technique de Microsoft ; ceux de PixelUMM, de sa prépublication. Aucun des deux n’a été reproduit de manière indépendante.
• Jetons visuels — Mage-VL : réduction rapportée de plus de 75 % par rapport à l'échantillonnage dense de trames. PixelUMM : aucune réduction ; l'argument avancé est que les patchs bruts éliminent un second encodage plutôt que de réduire le premier.
• Vitesse en temps réel — Mage-VL : jusqu'à 3,5× plus rapide que l'échantillonnage uniforme des images à précision équivalente, selon Microsoft. PixelUMM : aucune affirmation comparative de vitesse dans l'article.
• Qualité de l'encodeur — Mage-VL : Mage-ViT rapporte 99,33 % sur CIFAR-10 et 85,69 % sur ImageNet avec un budget de 256 tokens, à partir d'environ 100 M de médias non étiquetés. PixelUMM : aucun benchmark d'encodeur équivalent, puisqu'il n'y a aucun encodeur à évaluer.
• Compréhension vidéo — Mage-VL : gains rapportés par rapport à Qwen3-VL-4B sur chaque benchmark vidéo et d'ancrage temporel qu'il rapporte, dont +22,5 sur QVHighlight et +17,1 sur ActivityNet. PixelUMM : MVBench 70,53, Video-MME 57,33 sans sous-titres, LongVideoBench 59,61, LVBench 40,41.
• Compréhension d'images — Mage-VL : au niveau de Qwen3-VL-4B sur les images statiques, selon Microsoft. PixelUMM : MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Génération — Mage-VL : aucun. PixelUMM : GenEval global 0,83 avec un réécrivain de prompt, DPG-Bench 85,74, VBench partie 1 qualité 84,10.
• Streaming — Mage-VL : gating proactif d'événements avec les meilleurs scores TimVal, F1, ROC-AUC et PR-AUC rapportés sur SoccerNet en streaming. PixelUMM : non pris en charge.
• Licence — Mage-VL : Apache-2.0, code et poids. PixelUMM : code Apache-2.0, NVIDIA One-Way Noncommercial License sur le checkpoint.
Les deux colonnes ne se chevauchent pas suffisamment pour établir un classement. Mage-VL rapporte qu’un encodeur efficace bat un concurrent de même échelle ; PixelUMM rapporte qu’un modèle 15B se situe dans la même bande que les systèmes spécialisés qui l’entourent, et affirme sans détour dans son propre article que, les données d’entraînement étant différentes, les résultats « ne peuvent pas établir quelle architecture est supérieure ».
La division pratique
Choisissez selon le cas d’usage, pas selon le score. Si vous construisez de la perception vidéo en temps réel — un moniteur qui surveille un flux et commente lorsque quelque chose se produit, avec le coût en tokens comme contrainte déterminante — Mage-VL est le seul des deux à le faire, il est sous Apache-2.0, et sa taille de classe 4B permet de le servir sur un seul nœud. Si vous avez besoin d’un seul modèle qui lit des images et des vidéos et qui les génère aussi, PixelUMM est le seul des deux à faire cela, mais c’est un artefact de recherche sous licence non commerciale, ses poids sont 128 fragments de checkpoint distribués derrière un index caché, et le texte-vers-vidéo exécute les garde-fous Cosmos par défaut, avec un environnement Python distinct pour la porte.
Pour une équipe qui a besoin de ces deux capacités, l’argument en faveur d’y accéder via une seule couche de routage plutôt que par deux intégrations directes est simple, même si aucune des deux n’est hébergée aujourd’hui : une seule clé, les prix catalogue des fournisseurs répercutés à 0 % de marge, et des règles de basculement qui vous permettent de placer un modèle Apache-2.0 nouvellement ouvert devant une partie du trafic pendant que le modèle éprouvé prend en charge le reste. OrcaRouter est conçu pour ce type de problème — et pour être explicite, nous ne routons actuellement ni PixelUMM ni Mage-VL, il s’agit donc d’une description du flux de travail, et non d’une liste.
Qu'est-ce qui le réglerait
Deux événements comptent. Le premier est une réexécution indépendante des chiffres de l'encodeur de Mage-ViT ou des résultats vidéo de Mage-VL par une personne qui n'a aucun intérêt en jeu — dix semaines de téléchargements n'en ont pas encore produit une. Le second est tout changement apporté à la licence des checkpoints de PixelUMM, le seul fait qui distingue actuellement un artefact de recherche d'un artefact déployable. Tant qu'aucun des deux ne se concrétise, la chose utile que l'on peut dire à propos de ce duo est que Microsoft a parié sur le fait de rendre l'interface visuelle moins coûteuse et NVIDIA a parié sur sa suppression, et aucun des deux paris n'a été évalué par quiconque en dehors du laboratoire qui l'a placé.
