
InternLumina-U2 vs Microsoft Mage-VL : deux laboratoires discrets qui parient que les jetons visuels devraient en faire plus
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Microsoft Mage-VL et InternLumina-U2 ont tous deux été publiés comme les laboratoires de recherche publient lorsqu'ils ne sont pas sûrs que le résultat soit déjà un produit : en silence. Microsoft a publié les poids et le code de Mage-VL sur Hugging Face le 25 juillet 2026, sans aucune annonce ; l'organisation InternLM du Laboratoire d'Intelligence Artificielle de Shanghai a publié le code d'inférence d'InternLumina-U2 sur GitHub le 1er septembre 2026, sans annonce non plus. À cinq semaines d'intervalle, deux des plus grands laboratoires du monde ont lâché des modèles partageant une conviction discrète — que la façon dont nous transformons la vision en tokens est le goulot d'étranglement — puis les ont laissés à la communauté pour qu'elle les remarque. L'un d'eux peut être téléchargé et exécuté aujourd'hui, de manière maladroite. L'autre ne peut pas du tout être exécuté, car ses poids n'existent pas encore. Voici la carte honnête des deux, et de la raison pour laquelle « tous deux rapportés par le fournisseur, tous deux non prouvés » n'est pas la même phrase pour les deux.
Cinq semaines, deux paris sur l'efficacité de la représentation
Le fil conducteur est réel, pas rhétorique. Mage-VL est un modèle vidéo natif des codecs : au lieu de décoder un flux en trames uniformément échantillonnées et de faire passer une grille dense de patches à travers un vision transformer pré-entraîné sur le web et figé, il suit la structure des codecs vidéo modernes, séparant un flux en trames d'ancrage et les données de mouvement compressées entre elles, et ingérant directement cette représentation compacte. Le bénéfice annoncé par Microsoft est une réduction importante des jetons visuels et un chemin de perception en streaming nettement plus rapide — l'entreprise le présente comme la correction d'une sorte de paradoxe de Moravec pour les modèles vidéo-langage, où les petites tâches de perception en temps réel coûtent autant de calcul que le raisonnement hors ligne difficile. Mage-VL est un observateur : il consomme la vidéo efficacement et répond en quasi-temps réel aux questions sur ce qu'il voit.
InternLumina-U2 est un pari sur le même goulot d’étranglement, mais dans l’autre sens. Là où Mage-VL compresse la vidéo en suivant le codec, InternLumina-U2 compresse chaque entrée visuelle en décrivant chaque position avec huit codes discrets complémentaires au lieu d’un seul, à l’aide d’un tokeniseur que le laboratoire appelle AToken. Le pari est qu’un codebook unique plafonne la quantité d’informations qu’un token visuel peut transporter ; ainsi, un vocabulaire multi-codebooks permet à un modèle de diffusion de 16B paramètres de faire de la compréhension et de la génération via la même interface — lire un graphique, répondre à une question vidéo, décrire un actif 3D, générer une image à partir d’un texte, en éditer une sur instruction — sans pile de génération distincte. Mage-VL veut percevoir des flux à moindre coût ; InternLumina-U2 veut percevoir et dessiner avec un seul ensemble de poids.
Le tableau d'affichage
Les chiffres des deux modèles proviennent des fournisseurs et n'ont pas été reproduits, donc le tableau de bord étiquette chaque ligne avec sa provenance.
• Forme — Mage-VL : un modèle vision-langage compact natif codec (environ 5 milliards de paramètres en BF16) bâti autour d’un backbone textuel Qwen, entraîné pour la compréhension d’images et de vidéos. InternLumina-U2 : un MoE de 16 milliards de paramètres avec 1 milliard actif (16B-A1B), un LLM à diffusion éparse couvrant la compréhension, la génération et l’édition.
• Représentation visuelle — Mage-VL : jetons natifs du codec suivant la structure du codec vidéo (ancre plus mouvement) ; réduction rapportée de plus de 75 % des jetons visuels sur la vidéo en streaming. InternLumina-U2 : jetons entièrement discrets de huit codebooks issus du tokenizer AToken.
• Ce qu'il fait — Mage-VL : regarde les entrées image et vidéo et répond par du texte ; conçu pour la perception en continu. InternLumina-U2 : revendique la compréhension de texte et d'images, la génération texte-vers-image, l'édition d'images, la compréhension vidéo et la compréhension 3D.
• Poids — Mage-VL : public sur Hugging Face depuis le 25 juillet 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2 : non public — le dépôt Hugging Face n'est qu'une coquille vide, les poids sont marqués « bientôt disponible ».
• Chiffres clés — Mage-VL : Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, tous rapportés par Microsoft. InternLumina-U2 : ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, tous rapportés par le laboratoire, préliminaires et partiels.
• La réalité du déploiement — Mage-VL : téléchargeable, mais il n'existe aucun chemin standard pour vLLM ou SGLang ; le code nécessite trust_remote_code, et aucun fournisseur d'inférence ne le déploie actuellement. InternLumina-U2 : ne peut être déployé par personne — les poids ne sont pas disponibles publiquement, et même le pilote d'inférence publié attend des fichiers de checkpoint qui ne sont pas dans le dépôt.

"Disponible mais maladroit" n'est pas la même chose que "non disponible".
Voilà la distinction qui importe le plus si l’on cherche réellement à construire quelque chose. Mage-VL est réel au sens le plus décisif : les poids sont sur Hugging Face, la fiche du modèle a connu un fort trafic de téléchargements depuis fin juillet, et un petit écosystème de quantifications communautaires a vu le jour autour de lui. « Réel » ne signifie pas « facile ». La fiche du modèle affiche une balise custom-code, l’encodeur visuel n’est pas le ViT gelé standard que supposent les piles de service existantes, et le dépôt de Microsoft lui-même en porte la conséquence pratique — l’exécution implique trust_remote_code et aucun déploiement clé en main chez un fournisseur. Mais une équipe déterminée avec un GPU peut le charger, le pointer vers un flux vidéo et vérifier si la thèse native au codec tient pour ses données. C’est une différence énorme par rapport à InternLumina-U2, où la même phrase se termine autrement : une équipe déterminée peut lire le code d’inférence, puis s’arrête là, car il n’y a pas de poids à charger.

La carte Hugging Face de microsoft/Mage-VL, capturée le 27 août 2026 — la description du streaming natif au codec, la licence Apache-2.0, la balise arxiv, et une section fournisseur d'inférence indiquant qu'aucun fournisseur ne déploie actuellement le modèle.
L'asymétrie des benchmarks s'inscrit dans la même lignée. Les scores des deux modèles sont des déclarations de leurs fournisseurs, sans réexécution indépendante pour l'instant. Mais les déclarations de Mage-VL reposent au moins sur un artefact téléchargeable, ce qui signifie que l'écart entre déclaration et vérification tient simplement à ce que quelqu'un l'exécute. Celles d'InternLumina-U2 reposent sur un élément de la feuille de route — « les tableaux de comparaison complets apparaîtront dans le prochain rapport technique » — et aucun artefact n'existe pour les vérifier. Le tableau partiel du laboratoire lui-même montre le modèle distancé par au moins un rival qu'il prétend surpasser (GenEval 0.81 contre 0.89 pour LLaDA2.0-Uni), ce qui rappelle utilement de lire son étiquette « préliminaire, partiel » au pied de la lettre.
Où ils pouvaient composer plutôt que de rivaliser
La lecture la plus utile de ces deux modèles consiste à les voir comme des échelons adjacents d’une même échelle, et non comme des rivaux pour le même poste. Un observateur natif du codec comme Mage-VL est intéressant précisément parce qu’il est assez peu coûteux pour fonctionner en continu — le module qui surveille chaque image d’un flux et ne fait remonter l’information que lorsque quelque chose mérite l’attention d’un modèle plus grand. Le modèle plus grand auquel il passe la main pourrait, en principe, être un modèle unifié du genre de celui qu’InternLumina-U2 prétend être : la porte toujours active qui décide de ce qu’il faut regarder, et le modèle profond qui, lui, lit réellement le graphique, suit la scène 3D ou produit l’image éditée. Aucun des deux n’est prouvé — Mage-VL non prouvé mais exécutable, InternLumina-U2 non prouvé et non publié — si bien que le cadrage honnête est une composition que l’on pourrait assembler une fois chaque côté validé indépendamment, et non un face-à-face que l’on peut lancer aujourd’hui.

Le dépôt GitHub InternLM/InternLumina-U2, capturé le 2 septembre 2026 — la page d'accueil du dépôt montrant la description de la diffusion multi-codebook, le badge de licence Apache-2.0, et les scripts d'entrée d'inférence qui constituent la version publique tandis que les poids restent hors de l'arborescence.
Ce que fait une couche de routage avec des points de contrôle non prouvés
Aucun de ces deux modèles n'est hébergé sur OrcaRouter, et nous n'allons pas laisser entendre le contraire — Mage-VL ne dispose d'aucun chemin de service standard où que ce soit, et InternLumina-U2 n'a pas de poids. Là où le DSL de routage est réellement utile dans cette situation, c'est pour exprimer la composition ci-dessus en un seul appel plutôt que par du code de liaison sur mesure : un modèle de perception économique, toujours actif, qui alimente un modèle plus profond, le tout étant chaîné de sorte que le modèle coûteux ne s'exécute que lorsque le modèle économique signale un changement. Et pour le problème des checkpoints non éprouvés — qui constitue la totalité du profil de risque de ces deux modèles —, le basculement automatique est le mécanisme qui permet à une équipe d'essayer un modèle comme Mage-VL sur un chemin réel sans engager ce chemin sur lui : la première fois que le nouveau checkpoint cale, renvoie n'importe quoi ou lève une exception, la requête bascule alors vers un modèle éprouvé, et pas besoin de réveiller un ingénieur pour actionner un interrupteur. Une API pour plus de 200 modèles, le prix catalogue du fournisseur répercuté à 0 % de marge, et le nouveau venu auditionné derrière un filet de sécurité plutôt que face à la production.
En résumé
Si vous voulez tester aujourd'hui la thèse de la vidéo native au codec, seul Mage-VL existe — et « existe » s'accompagne de réserves sur du code personnalisé et un service à monter soi-même. Si vous voulez tester la thèse du modèle unifié multi-codebook, c'est impossible, car InternLumina-U2 n'est encore qu'une spécification en attente de ses poids ; ce que vous pouvez faire, c'est lire son architecture dès maintenant pour être prêt le jour où le stub sur Hugging Face se remplit. Considérez le modèle de Microsoft comme un artefact certes maladroit mais réel, et celui du Shanghai AI Lab comme une promesse bien documentée, et rappelez-vous que dans ce face-à-face, « rapporté par le fournisseur et non reproduit » vaut pour les deux — cela signifie simplement quelque chose de différent quand il existe un fichier que vous pouvez télécharger.
