Une carte de titre générée dans le style maison d’OrcaRouter, libellée « PixelUMM vs North Micro Vision Instruct », avec quatre tuiles statistiques : « 2,4 B » (nombre total de paramètres de North Micro Vision Instruct), « ~180 k » (ses téléchargements Hugging Face début octobre), « 0,921 / 90,42 » (son DocVQA sous forme de fraction de précision par rapport au pourcentage de PixelUMM) et « Apache-2.0 » (sa licence de code et de poids, face au checkpoint non commercial de PixelUMM). Une ligne de pied de page indique « Chiffres déclarés par le fournisseur ; aucun rerun indépendant de l’un ou l’autre modèle. ». Le logo OrcaRouter est intégré dans la bande à marge en bas à droite.
Guides & Insights

PixelUMM vs North Micro Vision Instruct : un modèle de recherche non commercial face à un lecteur de 2,4 B que vous pouvez déployer

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez North Micro Vision Instruct et PixelUMM côte à côte et la différence de taille est presque une distraction : 2,4 milliards de paramètres pour le lecteur à résolution native de Cohere contre 15,2 milliards pour le modèle unifié de NVIDIA. L'axe intéressant est l'encodeur. North Micro Vision Instruct est construit de manière conventionnelle — un encodeur visuel de 400 M initialisé à partir de SigLIP 2 SO400M, alimentant un modèle de langage de 2 Md, enveloppé dans un vocabulaire de 262 144 jetons et distribué sous Apache-2.0. PixelUMM repose sur l'argument que cette configuration exacte est le goulot d'étranglement, et supprime l'encodeur : des patchs de pixels bruts de 16 × 16 entrent dans un backbone Qwen3-8B via des projections linéaires à une seule couche, et les mêmes poids génèrent de la vidéo tout en répondant aux questions à son sujet. L'un est un appareil de lecture spécialisé que vous pouvez télécharger et déployer dès aujourd'hui. L'autre est une thèse de recherche avec un lien de téléchargement et une licence qui l'exclut des produits.

Les chiffres des deux modèles ci-dessous proviennent de leurs propres laboratoires. Aucun n'a été reproduit de manière indépendante, et les deux publient des suites de benchmarks différentes, si bien que le chevauchement est plus étroit qu'il n'y paraît.

Plaidoyer pour l'architecture ennuyeuse

North Micro Vision Instruct a été publié sur Hugging Face le 10 août 2026, a eu huit semaines pour accumuler des utilisateurs et, début octobre, affichait environ 180 000 téléchargements et 150 mentions J’aime — un ordre de grandeur de plus d’attention que le dépôt vieux de quelques jours de PixelUMM. Son argumentaire est précis et peu glamour : la plupart des modèles de vision réduisent une image à une grille fixe et perdent les détails fins dont les documents dépendent, donc celui-ci traite les images en résolution native, en préservant le rapport d’aspect et les petits textes.

• Paramètres — 2,4 B au total : un modèle de langage de 2 B plus un encodeur visuel de 400 M entraîné sur mesure à partir de SigLIP 2 SO400M.

• Contexte — un backbone linguistique de 128 K tokens, mais une plage de fonctionnement multimodale validée d’environ 8 K tokens. La fiche précise explicitement que les contextes multimodaux plus longs reposent sur l’extrapolation et ne sont pas benchmarkés.

• Entrées et sorties — en entrée, du texte et des images entrelacés ; en sortie, du texte. Multilingue dans plus de onze langues. Aucune génération, quelle qu'elle soit.

• Scores déclarés — DocVQA 0,921, ChartQA 0,808, OCRBench 0,792, tous rapportés par Cohere et non reproduits. MMMU 0,329, ce que la fiche ne cache pas : il s'agit d'un spécialiste de la lecture, pas d'un généraliste du raisonnement.

• Déploiement — Transformers 5.16.0 et un accélérateur, un seul GPU moderne à 2,4 B en bfloat16, Flash Attention 2 facultatif plutôt qu’obligatoire.

Rien dans cette conception n’a de nouveauté. C’est aussi ce qui fait qu’il peut être téléchargé, affiné et mis face à de vrais documents cette semaine.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

L’argumentaire contre, présenté par la partie adverse.

La prépublication de PixelUMM commence par nommer le coût de cette architecture. Un transformer de vision gelé, pré-entraîné sur le web, fournit des caractéristiques sémantiques pour la compréhension ; un VAE distinct fournit des latents orientés reconstruction pour la génération ; prendre en charge les deux double approximativement le contexte visuel par image de conditionnement et force à reconstruire les pipelines de pré-entraînement vision-langage autour d’un second flux. North Micro Vision Instruct évite ce doublement uniquement en refusant entièrement la seconde tâche — il ne génère pas, donc il a besoin d’une seule interface, pas de deux.

PixelUMM pousse l'argument jusqu'à sa conclusion. Aucun encodeur, aucun VAE, aucun tokenizer : des patchs de pixels de 16×16 pour les images, des tubelets spatio-temporels de 4 images pour la vidéo, les deux atteignant un Transformer à décodeur seul par le biais de projections linéaires à une seule couche, avec la compréhension par texte autorégressif et la génération par flow matching dans l'espace des pixels. Ses huit sections empiriques sont des études de choix de conception plutôt que des victoires dans les classements — taille des patchs, artefacts de patchs, dynamique d'entraînement dans l'espace des pixels versus l'espace VAE, mise à l'échelle du calcul — soit un article qui demande si le paradigme tient, et non un article qui prétend qu'il a déjà gagné.

• Chemin visuel — North Micro Vision Instruct : encodeur visuel pré-entraîné de 400 M à résolution native. PixelUMM : pas d'encodeur ; patchs bruts via une projection linéaire.

• Ce qu'il peut faire — North Micro Vision Instruct : lire des images et des documents, répondre en texte, localiser et légender. PixelUMM : lire des images et des vidéos, et générer des images et des vidéos de 4 secondes à partir de texte.

• Échelle — 2,4 B en dense contre environ 15,2 B au total sur un backbone Qwen3-8B, désigné « 8B MoT » dans les propres tableaux de l'article.

• Licence — Apache-2.0 sur le code et les poids par rapport à Apache-2.0 sur le code avec la NVIDIA One-Way Noncommercial License sur le point de contrôle.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Lire honnêtement les deux tableaux de scores

Les deux modèles publient des benchmarks différents, et là où ils se recoupent, les échelles diffèrent.

• DocVQA — North Micro Vision Instruct 0,921 en tant que fraction d'exactitude. PixelUMM 90,42 en pourcentage. Même nom de benchmark, découpages et configurations de prompt différents, et un seul des deux invoque la prise en charge de la résolution native comme raison.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82,96. Là encore, à peu près la même fourchette dès qu'on cesse de comparer les chaînes brutes.

• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.

• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Tous deux faibles selon les standards des grands modèles vision-langage, et les deux laboratoires les rapportent sans fioritures.

• PixelUMM-only — MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, GenEval 0.83 avec un réécrivain de prompt, VBench qualité de la partie 1 84.10.

• North Micro Vision Instruct-only — grounding, légendage et tâches multi-images ; une absence documentée d'appel d'outils et explicitement aucun comportement agentique.

Ce qui est frappant dans ce chevauchement, c’est à quel point un spécialiste de 2,4 B s’approche d’un généraliste de 15,2 B en lecture de documents et de graphiques. Ce n’est pas la preuve que l’approche sans encodeur échoue — c’est la preuve que la lecture de documents est une tâche pour laquelle un encodeur compact à résolution native est particulièrement bien adapté, et l’architecture de PixelUMM vise un autre argument. Le propre article de PixelUMM concède ce point dans une phrase qui mérite d’être citée : parce que les données d’entraînement diffèrent d’un modèle à l’autre, ses résultats « ne peuvent pas établir quelle architecture est supérieure ».

Où la décision atterrit réellement

Si vous avez des documents, des graphiques, des formulaires ou des captures d'écran et que vous avez besoin de réponses ce mois-ci, North Micro Vision Instruct est le choix pratique, et il n'y a pas photo : Apache-2.0, 2.4B, un chemin de chargement Transformers standard, pas d'environnement de garde-fous, pas d'index de checkpoints distribués, pas de seconde pile Python. Fine-tunez-le sur votre propre distribution de documents et vous obtenez un spécialiste. La réserve, c'est le périmètre — pointez-le vers une tâche de raisonnement et le chiffre MMMU vous rattrapera.

L'offre de PixelUMM, c'est l'étendue et une question de recherche. Il lit et génère, image et vidéo, à partir d'un seul ensemble de poids, et c'est de loin la lecture la plus intéressante. Mais son checkpoint est sous licence non commerciale, ses poids sont 128 fragments de checkpoint distribué derrière un index de métadonnées caché totalisant environ 30 Go, il exige une boîte à outils CUDA 13 avec FlashAttention compilé depuis les sources, et son pipeline texte-vers-vidéo fait tourner les garde-fous Cosmos qui nécessitent un dépôt à accès restreint et un environnement séparé. C'est un établi de laboratoire, pas un déploiement.

L'angle du routage intervient plus tard, si tant est qu'il intervienne un jour. Aucun des deux modèles n'est disponible via une API hébergée aujourd'hui — OrcaRouter n'achemine ni l'un ni l'autre — et aucun ne le sera tant que leurs licences ne le permettront pas. Lorsqu'un modèle comme North Micro Vision Instruct finit par apparaître derrière un point de terminaison partagé, la raison de le préférer à une intégration directe est la raison habituelle : une seule clé pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés avec 0 % de marge, un basculement automatique qui rétrograde un modèle dont les performances sont inférieures à sa fiche, et aucun second contrat à négocier lorsqu'on veut tester un remplacement en A/B. C'est une description du flux de travail, pas une affirmation sur la disponibilité.

Le seul test qui les séparerait

Exécutez les deux sur le même ensemble de documents à la même résolution et évaluez les cas de petit texte, puis modifiez une seule variable : retirez l’encodeur visuel de la comparaison en fournissant à PixelUMM ses entrées à résolution native. Si le modèle sans encodeur tient le coup sur du texte dense pour une fraction du coût en paramètres, c’est la preuve la plus forte possible en faveur de la thèse — et c’est un test que toute personne disposant d’une carte supplémentaire peut exécuter, car les deux checkpoints se téléchargent. En attendant que quelqu’un le fasse, le résumé pragmatique reste valable : un petit lecteur Apache-2.0 est celui que l’on déploie, et un grand généraliste non commercial est celui que l’on étudie.