Une carte de titre générée dans le style propre à OrcaRouter, portant « PixelUMM vs InternLumina-U2 », avec quatre tuiles statistiques : « 41,67 / 57,33 » (MMMU et Video-MME de PixelUMM), « 0,81 / 51,26 » (GenEval et Video-MME d’InternLumina-U2), « Apache-2.0 » (le code et les deux points de contrôle d’InternLumina-U2) et « 1-way NC » (la licence du point de contrôle PixelUMM). Une ligne de pied de page indique « Chiffres communiqués par le fournisseur ; aucune réexécution indépendante de l’un ou l’autre modèle ». Le logo OrcaRouter est incrusté dans la bande avec marge intérieure située en bas à droite.
Guides & Insights

PixelUMM vs InternLumina-U2 : deux versions bêta sans encodeur, et la seule différence qui tranche

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles, tous deux publics, tous deux conçus de manière inhabituelle, et un seul d'entre eux permet de bâtir un produit dessus. PixelUMM est le modèle unifié sans encodeur de NVIDIA — 15,2 milliards de paramètres sur une base Qwen3-8B, lisant et écrivant des pixels bruts via des patchs 16×16 et des tubelets de 4 images, sans VAE ni encodeur visuel nulle part dans la pile. InternLumina-U2 est le modèle de diffusion à mélange d'experts de 16B de Shanghai AI Laboratory qui compresse chaque entrée visuelle en huit codes discrets complémentaires via un tokenizer appelé AToken. Les deux ont parié que l'interface visuelle est le goulot d'étranglement. Le pari qui compte le plus est celui des fichiers de licence : InternLumina-U2 distribue des poids Apache-2.0, PixelUMM distribue un checkpoint sous une licence non commerciale. Si vous choisissez entre eux pour un usage commercial, cette phrase constitue à elle seule toute la comparaison, et le reste de cette page n'est que du contexte pour celle-ci.

Les deux séries de chiffres ci-dessous proviennent des laboratoires eux-mêmes. Aucun des deux modèles ne dispose ni d'une évaluation indépendante, ni d'un Elo d'arène, ni d'une reproduction par un tiers. Aucun n'est servi par une API hébergée. Ce qui diffère, c'est ce que vous êtes autorisé à faire de l'artefact une fois que vous l'avez téléchargé, et où en est réellement chaque version.

Où en est chacun en ce moment

Les calendriers de sortie ont évolué à des rythmes différents, et tous les deux en toute discrétion.

• PixelUMM — Dépôt GitHub créé le 4 septembre 2026 ; prépublication arXiv 2609.38597 datée du 29 septembre 2026 ; dépôt de modèle Hugging Face créé le 1er octobre 2026 à 21 h 40 UTC. Aucun billet de blog, communiqué de presse ou fil de lancement NVIDIA n'est apparu à son sujet.

• InternLumina-U2 — Dépôt GitHub créé le 1er septembre 2026 ; fiche provisoire Hugging Face enregistrée le même jour ; poids de checkpoint entraînés sur Ascend ajoutés le 10 septembre 2026 ; poids de checkpoint NVIDIA/CUDA ajoutés le 24 septembre 2026. Sept shards par pile, les deux téléchargeables dès aujourd'hui.

L’InternLumina-U2 qui existait au début de septembre — code uniquement, poids « bientôt disponibles », un dépôt de modèle vide — n’est pas l’InternLumina-U2 qui existe aujourd’hui. Quiconque a lu des informations à son sujet au début du mois et en a conclu que les poids manquaient devrait vérifier à nouveau ; les checkpoints Huawei Ascend et NVIDIA/CUDA sont tous les deux en ligne, sous Apache-2.0, accompagnés du tokenizer, de la configuration, du template de chat et du code de modélisation distant.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Deux réponses à la même question

Les deux modèles partent de la même critique : embarquer un encodeur visuel pour la compréhension et un VAE pour la génération signifie représenter chaque image deux fois, ce qui double à peu près le contexte visuel et force un pipeline d'entraînement à maintenir deux interfaces.

La réponse de PixelUMM consiste à supprimer les deux. Les pixels bruts entrent directement via des projections linéaires à une seule couche — un patch 16×16 par position d'image, un tubelet de 4 images par position vidéo — et la colonne vertébrale est un Transformer décodeur uniquement dont la conception Mixture-of-Transformers associe une attention partagée à des paramètres spécifiques à la tâche. Le texte est prédit de manière autorégressive ; les pixels sont prédits par flow matching. L'article consacre huit sections à des études de conception — taille de patch, artefacts de patch, dynamique dans l'espace des pixels versus dans l'espace VAE, mise à l'échelle du calcul — ce qui vous dit que la vraie question de l'équipe était de savoir si le paradigme tient tout court.

La réponse d'InternLumina-U2 consiste à conserver une interface discrète tout en faisant porter bien davantage à chaque token. Le tokenizer AToken décrit chaque position visuelle à l'aide de huit codebooks complémentaires couvrant la texture, le texte intégré et la géométrie ; les huit embeddings sont concaténés par position puis projetés en un seul token de backbone. Le décodage fonctionne dans l'autre sens, avec un débruitage spatialement parallèle et une tête autoregressive à codebooks multiples prédisant les huit codes dans l'ordre. Le backbone est un LLM de diffusion épars de la lignée LLaDA-2.0, de 16B au total dont 1B actifs.

• Interface visuelle — PixelUMM : patchs de pixels bruts et tubelets, aucun tokeniseur du tout. InternLumina-U2 : jetons entièrement discrets à huit codebooks issus d’AToken, aucun latent continu.

• Backbone — PixelUMM : Qwen3-8B (15,2 B au total), décodeur dense unique avec des experts en compréhension et en génération. InternLumina-U2 : modèle de langage à diffusion MoE creux de 16 B au total / 1 B actifs.

• Méthode de génération — PixelUMM : flow matching dans l'espace des pixels plus texte autorégressif. InternLumina-U2 : débruitage par diffusion masquée sur codes discrets.

• Tâches revendiquées — PixelUMM : texte-vers-image, texte-vers-vidéo, image-vers-texte, vidéo-vers-texte. InternLumina-U2 : celles-ci, ainsi que l’édition d’images et la compréhension 3D.

• Format des poids — PixelUMM : 128 .distcp fragments (~30 Go) derrière un index .metadata caché. InternLumina-U2 : sept .safetensors fragments par pile matérielle, disposition standard Hugging Face.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

Le tableau des scores, avec sa provenance attachée

Lisez chaque ligne comme une affirmation émanant du laboratoire lui-même. Celles de PixelUMM proviennent de sa prépublication ; celles d’InternLumina-U2 relèvent de la propre description qu’en fait le laboratoire, qui les qualifie de « préliminaires, partielles », les tableaux comparatifs complets étant renvoyés à un rapport technique qui n’a pas encore paru.

• MMMU (raisonnement sur images) — PixelUMM 41,67 (selon les auteurs eux-mêmes). InternLumina-U2 : non rapporté.

• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.

• DocVQA — PixelUMM 90,42. InternLumina-U2 : non communiqué.

• Video-MME (sans sous-titres) — PixelUMM 57,33. InternLumina-U2 51,26.

• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.

• GenEval global — PixelUMM 0,83 avec un réécrivain de prompts LLM, 0,77 sans. InternLumina-U2 0,81.

• DPG-Bench global — PixelUMM 85,74. InternLumina-U2 87,10.

• Génération vidéo — PixelUMM VBench Partie 1 qualité 84,10 / sémantique 79,80, Partie 2 total 83,24. InternLumina-U2 : non communiqué.

• compréhension 3D — PixelUMM : aucune tâche de ce type. InternLumina-U2 rapporte 41,8 sur 3D MM-Vet.

La comparaison est inégale parce que les deux laboratoires publient des tableaux différents, et non parce que l'un est en train de gagner. PixelUMM comporte une section complète sur la génération vidéo et aucune sur l'édition ou la 3D ; InternLumina-U2 revendique six familles de tâches et présente un tableau partiel pour celles-ci. Les chiffres interlaboratoires associés à un même nom de benchmark ne correspondent pas à la même mesure — les découpages, les prompts et l'échantillonnage diffèrent —, donc considérez les lignes ChartQA et GenEval comme à peu près équivalentes et arrêtez-vous là.

L'octroi de licences est le point où cette égalité prend fin.

C’est la partie qu’aucun tableau de benchmarks ne montre. Le dépôt PixelUMM est sous Apache-2.0, et la fiche l’indique bien en évidence. Le checkpoint est un artefact distinct placé sous la licence NVIDIA One-Way Noncommercial License, limité à la recherche ou à l’évaluation non commerciales, et un fichier source conserve en outre une mention CC BY-NC 4.0 héritée de DiT. Usage en recherche : aucun souci. Fonctionnalité produit interne : une conversation avec le service juridique, et peut-être brève.

InternLumina-U2 est sous Apache-2.0 de bout en bout, le code et les deux checkpoints, sans exception non commerciale distincte. Pour une équipe qui doit livrer, ce n’est pas un petit avantage — c’est toute la décision. Les deux modèles sont de niveau recherche en termes de maturité. Un seul d’entre eux est sans restriction d’utilisation.

Lequel essayer réellement, et comment ?

Si votre travail porte sur la compréhension vidéo ou si vous voulez un modèle qui génère vidéos et images à partir d’un seul ensemble de poids, PixelUMM est l’artefact le plus complet et son article est la lecture la plus utile — mais il s’agit d’un projet de recherche sous licence non commerciale, donc il a sa place sur un banc d’évaluation, pas dans un pipeline. Si votre travail porte sur l’étendue de la génération de graphiques, de documents et d’images, ou si vous avez besoin d’édition et de 3D, InternLumina-U2 couvre un champ plus large et ne comporte aucun plafond de licence ; le prix à payer, c’est que le backbone de diffusion 16B-A1B et le tokenizer AToken impliquent une véritable ingénierie de serving, et que ses chiffres publiés sont explicitement partiels.

À ce jour, ni l'un ni l'autre n'est disponible sur une API hébergée, et cela inclut OrcaRouter — nous ne routons aucun des deux modèles. Le jour où cela changera, l'argument en faveur d'y accéder via une couche de routage plutôt que par intégration directe sera le même que celui qui vaut pour tout modèle nouvellement ouvert : une seule clé pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés à 0 % de marge, et un basculement automatique qui permet de rétrograder un modèle s'avérant moins bon que ne le laissait penser la fiche de son fournisseur en modifiant une route plutôt qu'en réécrivant un déploiement. En attendant, le conseil honnête est le plus ennuyeux : téléchargez la licence qui convient à votre cas d'usage, menez votre propre évaluation sur vos propres données, et ne planifiez rien à partir des chiffres de l'un ou l'autre laboratoire tant que quelqu'un d'extérieur au laboratoire ne les aura pas reproduits.

Qu’est-ce qui changerait la réponse ?

Trois choses, par ordre d'impact. Une licence commerciale sur le checkpoint de PixelUMM rendrait la comparaison vraiment serrée et la ferait passer de « lire l'article » à « évaluer les poids ». Un rapport technique du Shanghai AI Laboratory contenant les tableaux comparatifs complets transformerait les chiffres partiels d'InternLumina-U2 en quelque chose de vérifiable, et révélerait aussi dans quelle mesure l'étendue des six tâches se situe à parité plutôt qu'en profondeur de tokens. Et la première reproduction indépendante de l'un ou l'autre des modèles — une réexécution de GenEval ou de MVBench par une équipe sans enjeu dans le résultat — est le moment où l'un comme l'autre cesse d'être un tableau de fournisseur. D'ici là, l'une est une architecture inhabituelle que l'on ne peut qu'étudier, et l'autre est une architecture inhabituelle que l'on peut déployer.