
NVIDIA PixelUMM a été publié sans annonce — Les poids viennent de tomber.
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La façon la plus simple de découvrir que NVIDIA a conçu un nouveau modèle multimodal unifié est de remarquer que personne ne vous l'a dit. Le dépôt nvidia/PixelUMM est apparu sur Hugging Face à 21:40 UTC le 1er octobre 2026, transportant un checkpoint de 15,2 milliards de paramètres dont toute la pile apprise repose sur un Qwen3-8B comme backbone — et il n'y a eu ni article de blog, ni communiqué de presse, ni diapositive de keynote, ni fil de lancement pour l'accompagner. Les recherches sur ce nom ne donnent rien sur le blog de NVIDIA lui-même. Ce qui existe à la place, c'est un dépôt GitHub, une page de projet dont l'URL elle-même affiche encore « preview », une prépublication arXiv numérotée 2609.38597, et un checkpoint réparti sur 128 fichiers avec un index caché sans lequel le chargeur refuse de s'exécuter. PixelUMM est bien réel et téléchargeable dès aujourd'hui. Savoir si NVIDIA le considère comme publié est une question à laquelle l'entreprise n'a pas répondu.
Cet écart — entre un artefact qui existe et un fournisseur qui n’a rien dit — constitue toute l’histoire ici, et il vaut la peine d’être précis sur le côté de cet écart où se situe chaque fait. Tout ce qui suit provient du dépôt, de la fiche du modèle et de l’article que les auteurs eux-mêmes ont publié. Rien ne provient d’une annonce, car il n’y en a pas eu.
Qu'est-ce qui est apparu, et quand ?
La campagne s'étend sur environ quatre semaines, et chaque élément a été dévoilé en toute discrétion.
• 4 septembre 2026 — nv-tlabs/PixelUMM est créé sur GitHub sous une licence de dépôt Apache-2.0, décrit simplement comme « Compréhension et génération unifiées d'images et de vidéos sans encodeur ». Il reste avec un seul commit initial jusqu'à la fin du mois de septembre.
• 28–29 septembre 2026 — le commit initial du dépôt est effectué, et arXiv attribue au préprint la référence arXiv:2609.38597, daté du 29 septembre, listant des auteurs de NVIDIA et de l'Université de Waterloo : Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang et Jay Zhangjie Wu.
• 1er octobre 2026, 21:32 UTC — un commit final dans le dépôt intitulé « docs: add PixelUMM paper citation ».
• 1er octobre 2026, 21:40 UTC — le dépôt de modèles Hugging Face est créé, huit minutes plus tard, et se remplit avec les fragments de points de contrôle.
La page du projet est hébergée à un chemin qui se lit littéralement pixelumm-project-page-preview, et l'article ne comporte aucune mention de conférence — ni CVPR, ni NeurIPS, ni la formule « accepté à ». Pris ensemble, ces éléments se lisent comme une équipe de recherche qui met en ligne un artefact d'article et laisse le téléversement sur HF faire office d'annonce. C'est une observation sur les preuves, non une affirmation sur les intentions : il se peut très bien que NVIDIA ait prévu un lancement plus tard, et rien ici ne permet de l'exclure.

Ce qu'est réellement PixelUMM
La thèse de conception est énoncée dès la première ligne de la fiche de modèle : pas de VAE, pas d’encodeur visuel. Là où un modèle unifié classique comporte deux interfaces visuelles — un transformer de vision produisant des caractéristiques sémantiques pour la compréhension, et un autoencodeur variationnel produisant des latents de reconstruction pour la génération — PixelUMM n’en comporte aucune. Les images sont découpées en patchs de 16×16 pixels ; les vidéos sont découpées en tubelets spatiotemporels de 4 images ; les deux n’atteignent le backbone que par de simples projections linéaires à une seule couche. Les pixels bruts entrent ; les pixels bruts sortent.
• Architecture — un Transformer à décodeur seul avec des plongements de patchs de pixels bruts et une tête de génération itérative de pixels, décrit dans l’article comme un Mixture-of-Transformers qui associe une attention partagée à des paramètres spécifiques à la tâche.
• Backbone — Qwen3-8B, épinglé à la révision b968826d9c46dd6066d109eabc6255188de91218. Seuls ses fichiers de configuration et de tokenizer sont nécessaires ; le checkpoint porte ses propres poids linguistiques appris.
• Paramètres — 15 199 672 064 (environ 15,2 B), présenté sous la forme « 8B MoT » dans les tableaux de benchmarks de l'article lui-même, où la notation de taille compte séparément le backbone et l'expert de génération.
• Objectifs — prédiction de texte autorégressive et flow matching dans l'espace pixel entraînés conjointement, ce qui permet à un même ensemble de poids de répondre à une question sur une image et d'en dessiner une nouvelle.
• Tâches — texte-vers-image, texte-vers-vidéo à 96 images / 24 ips / 4 secondes, texte conditionné par image et texte conditionné par vidéo.
La partie empirique de l’article est inhabituelle d’une manière qui mérite d’être signalée. Huit de ses sections sont des études de choix de conception plutôt que des positions dans des classements — taille des patchs d’image, taille des patchs vidéo, artefacts de patchs, dynamique d’entraînement dans l’espace pixel versus l’espace VAE, taille du modèle, mise à l’échelle du calcul, conditionnement de contexte multimodal et interfaces de compréhension vidéo. C’est un article écrit par des personnes qui cherchent à répondre à la question de savoir si l’approche fonctionne, pas un article qui cherche à remporter un tableau.
Les chiffres sont ceux des auteurs eux-mêmes.
Chaque chiffre ci-dessous est rapporté par les auteurs de PixelUMM dans leur propre prépublication. Il n’y a ni reproduction indépendante, ni Elo d’arène, ni évaluation par un tiers, car le modèle a au plus six semaines et précède tout harnais externe. Considérez ces éléments comme des affirmations accompagnées d’un lien de téléchargement, et non comme des performances vérifiées.
• Compréhension d'images — MMMU 41,67, MMStar 53,99, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00, BLINK 53,46, MMMU-Pro 27,63, selon le protocole officiel LMMS-Eval (64 750 générations réparties sur 21 tâches).
• Compréhension vidéo — MVBench 70.53, Video-MME 57.33 sans sous-titres, LongVideoBench 59.61, LVBench 40.41.
• Génération d’images — GenEval global 0,83 avec un réécrivain de prompt LLM, 0,77 sans ; DPG-Bench global 85,74.
• Génération vidéo — VBench Partie 1 score de qualité 84,10, score sémantique 79,80 ; VBench Partie 2 total 83,24.
L’interprétation honnête est qu’il s’agit de chiffres compétitifs au sein de leur catégorie, et non de chiffres de premier plan dans la catégorie, et l’article le dit lui-même : il note que, parce que les données d’entraînement diffèrent d’un modèle à l’autre, les résultats « ne permettent pas d’établir quelle architecture est supérieure ». Face à Qwen3-VL-8B, l’écart de compréhension des images est important sur MMMU (41,67 contre 69,60) et sur MMMU-Pro, où les auteurs ne rapportent aucun chiffre concurrent. Face à Qwen-Image 20B, l’écart sur GenEval est de 0,83 à 0,87. Ce que PixelUMM n’est pas, d’après ses propres chiffres, c’est un modèle de pointe. Ce qu’il est, d’après ses propres chiffres, c’est un modèle de 15B doté d’une architecture réellement inhabituelle qui se situe dans la même bande que les systèmes spécialisés qui l’entourent.
L’atout le plus affûté, c’est la licence, pas le benchmark
Le dépôt est sous Apache-2.0 et la fiche du modèle l’indique clairement. Le checkpoint est un artefact différent, régi par des conditions différentes, et c’est le détail qui risque le plus de prendre une équipe en défaut. Les poids sont distribués sous la NVIDIA One-Way Noncommercial License, dont l’utilisation est limitée à la recherche ou à l’évaluation non commerciales — une autorisation nettement plus restrictive que le code qui l’accompagne. Un fichier source du dépôt, modeling/pixelumm/modeling_utils.py, conserve en outre une mention CC BY-NC 4.0 dérivée de DiT.
Pour un groupe de recherche, une équipe d’évaluation ou toute personne publiant un article, c’est une licence parfaitement utilisable. Pour une équipe produit qui prototype une fonctionnalité interne, c’est la première chose à soumettre au service juridique, et la réponse peut être non. Un modèle que vous ne pouvez pas déployer est un type d’actif différent d’un modèle que vous pouvez déployer, et aucune parité de benchmark n’y changera rien.

Ce qu'il faut pour l'exécuter.
Ce n’est pas un téléchargement de week-end. La documentation de l’environnement exige Linux x86-64, Python 3.12, une boîte à outils de développement CUDA 13.0, un GPU NVIDIA et FlashAttention compilé à partir des sources contre cette boîte à outils — une image CUDA avec uniquement le runtime ne suffira pas. Le checkpoint lui-même n’est pas un fichier model.safetensors : il s’agit de 128 fragments .distcp totalisant environ 30 Go, plus un index .metadata caché, et le chargeur exige que chaque fragment référencé et cet index soient présents.
Deux autres détails façonnent ce que vous pouvez réellement en faire. Premièrement, le texte-vers-vidéo exécute les garde-fous Cosmos par défaut, et ceux-ci ont besoin d'un accès au dépôt à accès restreint nvidia/Cosmos-1.0-Guardrail ainsi qu'à un second environnement Python avec une version majeure de Transformers différente — une simple connexion ne déverrouille pas les poids. Deuxièmement, l'exemple d'entraînement jouet en quatre étapes, la seule recette d'entraînement publiée, est documenté comme nécessitant sept GPU avec au moins 48 GiB chacun et environ 61 Go d'espace disque libre pour la sortie. L'affinage sur une station de travail n'est pas la voie prévue ; l'inférence sur une seule carte moderne l'est.
Le dépôt fournit quatre checkpoints. S8-F22-R05 est celui par défaut et celui utilisé pour l’évaluation de l’article, couvrant les quatre tâches. S8-F18-R01 a suivi 10 000 étapes supplémentaires de fine-tuning en 480p et 720p et donne généralement des résultats de génération de vidéo à partir de texte légèrement meilleurs, mais il ne peut pas faire de compréhension vidéo. S8-F19-R03 et S8-F21-R02 sont des étapes intermédiaires. Choisir entre eux est une véritable décision, pas un détail.
Qu'est-ce qui n'est pas confirmé ?
Une liste courte, et elle compte plus que la longue ci-dessus.
• Aucune annonce NVIDIA. Aucun communiqué de presse et aucune publication sur le blog de l'entreprise n'est apparu pour ce modèle au moment de la rédaction. Cette sortie discrète est peut-être délibérée — les artefacts de recherche sont souvent diffusés ainsi — ou un lancement n'a peut-être tout simplement pas encore eu lieu.
• Aucune évaluation indépendante.Chaque chiffre de cet article est celui des auteurs. Rien n’a été réexécuté en dehors de NVIDIA et Waterloo.
• Aucune route hébergée, où que ce soit. Vous ne pouvez pas appeler PixelUMM via une API aujourd'hui, et cela inclut OrcaRouter — nous ne le routons pas, et ne pouvons pas, car un checkpoint sous licence non commerciale n'est pas quelque chose qu'une plateforme de service commerciale peut proposer. Quiconque vous dit le contraire décrit une configuration auto-hébergée.
• Aucune position déclarée sur l'octroi futur de licences. Les conditions non commerciales sont celles telles que livrées. On ignore si elles seront assouplies et, compte tenu de l'historique de NVIDIA en matière de checkpoints de recherche, ce n'est pas un élément sur lequel planifier.

Ce qu'il faut surveiller ensuite
Trois événements feraient passer PixelUMM du statut d’artefact de recherche à quelque chose qu’un public plus large peut utiliser. Le premier est un changement de licence sur le checkpoint — ce seul fichier constitue toute la barrière entre « intéressant » et « utilisable dans un produit ». Le deuxième est un lancement officiel de NVIDIA, qui s’accompagnerait d’un cadrage que le dépôt ne peut pas fournir : à quoi sert le modèle, et s’il s’agit d’une orientation produit ou d’un article. Le troisième est la première reproduction indépendante, très probablement une réexécution de GenEval ou MVBench par quelqu’un disposant d’un cluster de GPU en réserve, le moment où les chiffres des auteurs cessent d’être les seuls chiffres.
D'ici là, la bonne posture est celle que les preuves étayent. PixelUMM existe, le code et l'article sont publics et lisibles, les poids se téléchargent, et aucune des affirmations de performance n'a été vérifiée par quiconque en dehors de l'équipe qui les a formulées. Ce n'est pas une critique du travail — c'est à quoi ressemble une publication de recherche vieille de six semaines. C'est aussi exactement la situation où une couche de routage finit par justifier son utilité, plus tard, si la licence venait à s'assouplir : une seule clé pour les modèles auxquels vous faites déjà confiance, des prix catalogue répercutés à 0 % de marge, et un basculement qui vous permet de diriger une partie du trafic vers quelque chose de non éprouvé sans parier un chemin de production dessus. Pour l'instant, cependant, le résumé honnête est plus simple. NVIDIA a construit quelque chose d'inhabituel, l'a publié de manière exhaustive et n'en a parlé à personne. Le dépôt fait office d'annonce.
