Une carte titre de type hero pour la comparaison « InternLumina-U2 vs North Micro Vision Instruct », avec le sous-titre « Un lecteur de documents que vous pouvez exécuter dès aujourd'hui vs un 16B qui n'est pas encore là » et trois pastilles de statistiques — « North Micro : 2.4B, exécutable dès aujourd'hui », « InternLumina-U2 : 16B, pas encore de poids », « ChartQA 0.808 vs 86.52 (les deux rapportés) » — avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

InternLumina-U2 vs North Micro Vision Instruct : Un lecteur de documents que vous pouvez exécuter dès aujourd'hui contre un modèle 16B qui n'y est pas encore

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si vous avez besoin, cette semaine, d'un modèle qui lit des documents, des captures d'écran et des graphiques, cette comparaison a une réponse pratique courte : North Micro Vision Instruct est un modèle open-weight de 2,4 milliards de paramètres, créé par Cohere et publié sous licence Apache-2.0, téléchargeable depuis le 10 août 2026, et assez bon dans les tâches documentaires pour mériter qu'on le pointe dès aujourd'hui sur vos propres fichiers. InternLumina-U2 est le modèle de diffusion de 16 milliards de paramètres du Shanghai AI Laboratory — un projet bien plus ambitieux, qui prétend aussi comprendre graphiques et documents, parmi une demi-douzaine d'autres tâches — mais ses poids ne sont pas publics, son dépôt Hugging Face n'est qu'une coquille vide, et personne, où que ce soit, ne peut encore l'exécuter. La réponse plus longue porte sur ce qui se passe lorsque deux modèles sous Apache-2.0 font des déclarations qui se recoupent au sujet de la lecture, alors qu'un seul des deux est une chose que l'on peut tenir en main.

Le 2.4B qui existe réellement.

North Micro Vision Instruct est le spécialiste de la vision dans la famille North de Cohere : environ 2,4 milliards de paramètres au total, un modèle compact conçu pour lire en résolution native. Le principe de conception est que la plupart des modèles de vision réduisent les images à une grille fixe et perdent les détails fins sur lesquels reposent les documents — c'est pourquoi North Micro Vision Instruct accepte les images en résolution native jusqu'à environ une page A4 à 200 dpi, en préservant le rapport hauteur/largeur et les petits textes. Les chiffres rapportés par Cohere sont solides pour cette catégorie de taille : DocVQA à 0,921, ChartQA à 0,808, OCRBench à 0,792, tous annoncés par Cohere et non reproduits, avec un contexte multimodal validé d'environ 8K tokens et un point faible documenté sur MMMU (0,329) — un rappel qu'il s'agit d'un spécialiste de la lecture, pas d'un généraliste du raisonnement. Il n'a pas d'API hébergée propre ni de voie d'hébergement standard ; la solution pratique est l'auto-hébergement d'un modèle de 2,4 milliards de paramètres, assez petit pour fonctionner sur un seul GPU de station de travail moderne. L'adoption par la communauté est régulière — la fiche Hugging Face affichait des dizaines de milliers de téléchargements par mois à la fin du mois d'août.

Le 16B, c'est promis.

InternLumina-U2 est un type d'artefact différent. Ce que le laboratoire d'IA de Shanghai a publié le 1er septembre 2026, c'est du code d'inférence et une architecture, pas un modèle : un LLM de diffusion à mélange d'experts épars, 16B de paramètres au total avec 1B actifs, construit autour d'une représentation visuelle entièrement discrète à huit codebooks. Parmi les six familles de tâches couvertes par le script principal du dépôt — texte, compréhension d'images, texte-vers-image, édition d'images, compréhension vidéo, compréhension 3D — la compréhension d'images inclut explicitement les graphiques denses et les documents. Le tableau préliminaire de la page du projet répertorie des chiffres sur les graphiques et les documents que le laboratoire rapporte dans la même fourchette que celle revendiquée par le spécialiste : ChartQA 86.52, CharXiv-DQ 83.65, ainsi qu'un HallusionBench 62.15 et un MathVision 33.22. La page qualifie les résultats de « préliminaires et partiels », le rapport technique qui contiendrait les tableaux complets est marqué « à venir », et — le fait décisif — il n'y a aucun poids avec lequel quiconque puisse vérifier.

Le tableau d'affichage

Chaque chiffre ci-dessous est rapporté par le fournisseur. Les chiffres de North Micro Vision Instruct proviennent de l'évaluation propre de Cohere ; ceux d'InternLumina-U2 proviennent du tableau partiel préliminaire du laboratoire.

• Taille et forme — North Micro Vision Instruct : ~2,4B dense, lecteur à résolution native. InternLumina-U2 : 16B au total / 1B actif, MoE sparse, modèle de diffusion discret à multi-codebooks.

• Ce qu'il fait — North Micro Vision Instruct : lire les images, documents, graphiques et écrans d'interface ; répondre en texte, avec ancrage. InternLumina-U2 : affirme lire et générer — comprendre les images/vidéos/3D, générer et éditer des images.

• Poids — North Micro Vision Instruct : public depuis le 10 août 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2 : non public ; stub Hugging Face vide, poids marqués « bientôt disponible ».

• Scores de lecture phares — North Micro Vision Instruct : DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (rapporté par Cohere). InternLumina-U2 : ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (rapporté par le laboratoire, préliminaire).

Contexte du document — North Micro Vision Instruct : résolution native allant jusqu'à ~A4 à 200 dpi, contexte multimodal validé d'environ 8K. InternLumina-U2 : prend en charge les graphiques denses et les images naturelles via l'encodeur multi-codebook AToken ; contexte non encore spécifié.

• Faiblesses connues — North Micro Vision Instruct : MMMU 0,329, aucun appel d’outils — un lecteur, pas un raisonneur ni un agent. InternLumina-U2 : accuse un retard sur au moins un rival nommé sur GenEval (0,81 contre 0,89) dans son propre tableau partiel ; tout reste non vérifié.

• Comment l'exécuter — North Micro Vision Instruct : auto-héberger un modèle 2.4B ; le support vLLM était encore en cours d'intégration au moment de la rédaction. InternLumina-U2 : personne ne peut l'exécuter — pas de poids, et le pilote publié nécessite un répertoire de checkpoint et des fichiers tokenizer qui ne sont pas dans le dépôt.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Le même benchmark, deux épistémologies très différentes

ChartQA est le moyen le plus clair de voir la différence entre les deux affirmations. Les deux modèles rapportent un chiffre ChartQA ; North Micro Vision Instruct rapporte 0,808 comme fraction de précision, et InternLumina-U2 rapporte 86,52 en pourcentage — le même benchmark, essentiellement le même résultat dans la bande allant de la partie haute à la partie moyenne de la plage des 80, sur des échelles différentes, à quelques variations près selon les découpages d'évaluation et les configurations de prompt qui rendent les comparaisons ChartQA entre articles périlleuses, même lorsque les deux modèles existent. La différence épistémique est ce qui importe : le 0,808 de North Micro Vision Instruct est rattaché à un artefact téléchargeable, de sorte que toute équipe disposant d'un GPU et d'un ensemble de graphiques peut le reproduire ou le réfuter dès cette semaine. Le 86,52 d'InternLumina-U2 est rattaché à une feuille de route. Un nombre que l'on ne peut pas vérifier est un nombre sur lequel on ne devrait pas s'appuyer — c'est exactement la position que le laboratoire reconnaît lui-même en qualifiant son tableau de préliminaire.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

La fiche Hugging Face CohereLabs/North-Micro-Vision-Instruct, capturée le 27 août 2026 — la description vision-langage en résolution native de 2,4B, la licence Apache-2.0, et les benchmarks de lecture de documents rapportés par Cohere.

Lire, versus lire et dessiner

L'écart de philosophie architecturale vaut plus que l'écart sur les benchmarks. North Micro Vision Instruct est un spécialiste au périmètre étroit : il lit, et il accomplit cette seule tâche à un coût assez abordable pour que vous puissiez le faire tourner sur chaque page, chaque capture d'écran, chaque facture d'un pipeline sans surveiller votre facture GPU. Ce faible coût est la fonctionnalité — l'intelligence documentaire à grande échelle est autant un problème de coût que de précision. InternLumina-U2 est le pari inverse : un immense modèle sparse qui tente de faire tenir la lecture, la génération d'images, l'édition d'images, la compréhension vidéo et la compréhension 3D dans une interface commune de tokens discrets, sur le principe que la compréhension et la génération se renforcent mutuellement. Si ça marche, c'est une autre classe d'outil — mais ce « si ça marche » pèse très lourd, et un MoE de diffusion 16B-A1B avec un tokenizer sur mesure et un prétraitement 3D rendu par Blender ne sera jamais le lecteur bon marché et toujours actif qu'est un spécialiste de 2.4B. Ce ne sont pas vraiment des substituts. L'un est un outil que vous pouvez déployer dès aujourd'hui ; l'autre, une direction de recherche à laquelle vous pouvez vous préparer.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

Le dépôt GitHub InternLM/InternLumina-U2, capturé le 2 septembre 2026 — la page d’accueil du dépôt avec la description « Omni-Visual Understanding, Image Generation and Editing » et les scripts d’inférence par tâche ; parmi eux, le chemin de compréhension d’images est celui qui cible les images naturelles et les graphiques denses.

Ce que cela signifie si vous construisez un pipeline de documents

Aucun des deux modèles n'est hébergé sur OrcaRouter — North Micro Vision Instruct est un modèle à auto-héberger, sans API hébergée, et InternLumina-U2 n'a pas de poids que quiconque puisse héberger — l'angle du routage n'est donc pas « les appeler tous les deux via une seule clé aujourd'hui ». C'est le schéma que vous utiliseriez le jour où l'un ou l'autre changerait : un pipeline documentaire associe presque toujours un lecteur économique à un raisonneur plus puissant, et la valeur d'une couche de routage est d'exprimer ce couplage en un seul appel, tout en veillant à ce que la répercussion à 0 % de marge reste honnête sur les modèles hébergés que vous utilisez réellement. Lorsqu'un checkpoint Apache-2.0 comme InternLumina-U2 arrive enfin, la décision sensée n'est pas de démanteler une pile documentaire qui fonctionne — c'est de placer le nouveau venu sur un chemin de test derrière un basculement automatique, afin qu'il mérite le trafic de production en y survivant ; dès qu'il échoue sur un graphique réel, l'appel retombe sur le modèle qui a déjà fait ses preuves. Une API unique sur plus de 200 modèles est le mécanisme ; le basculement est le filet de sécurité ; le spécialiste que vous pouvez faire tourner dès aujourd'hui est ce qui paie les factures pendant que la promesse des 16B est encore tenue.

Le verdict

Pour la lecture de documents et de graphiques à l'heure actuelle, North Micro Vision Instruct est le seul des deux à exister dans un sens exploitable — petit, sous Apache-2.0, téléchargeable, avec des scores annoncés par le fournisseur que vous pouvez réellement aller vérifier. InternLumina-U2 est l'artefact le plus intéressant sur le long terme, car il cherche à faire de la lecture une compétence parmi six dans un modèle unifié, et si cela fonctionne, cela change ce que signifie « modèle de vision ». Surveillez son dépôt Hugging Face vide comme on surveillerait un compte à rebours de lancement : le jour où les fichiers safetensors apparaissent, la promesse devient un modèle, et la comparaison devient réelle. D'ici là, ne laissez pas un 86.52 annoncé par le fournisseur sur un benchmark de graphiques surpasser un 0.808 téléchargeable dans votre prise de décision.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube