
NVIDIA PixelUMM se lanzó sin anuncio — Los pesos acaban de llegar
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La forma más fácil de descubrir que NVIDIA construyó un nuevo modelo multimodal unificado es darse cuenta de que nadie te lo dijo. El nvidia/PixelUMM repositorio apareció en Hugging Face a las 21:40 UTC del 1 de octubre de 2026, con un checkpoint de 15,2 mil millones de parámetros cuyo stack aprendido completo se asienta sobre un Qwen3-8B backbone — y no hubo ninguna entrada de blog, comunicado de prensa, diapositiva de keynote ni hilo de lanzamiento que lo acompañara. Las búsquedas del nombre no arrojan nada en el propio blog de NVIDIA. Lo que existe en su lugar es un repositorio de GitHub, una página de proyecto cuya propia URL todavía dice "preview", un preprint de arXiv numerado 2609.38597 y un checkpoint dividido en 128 archivos con un índice oculto sin el cual el cargador se niega a ejecutarse. PixelUMM es real y se puede descargar hoy. Si NVIDIA lo considera publicado es una pregunta que la empresa no ha respondido.
Esa brecha —entre un artefacto que existe y un proveedor que no ha dicho nada— es toda la historia aquí, y vale la pena ser precisos sobre en qué lado de ella se sitúa cada hecho. Todo lo que sigue proviene del repositorio, la ficha del modelo y el artículo que los propios autores publicaron. Nada proviene de un anuncio, porque no hubo ninguno.
Qué apareció, y cuándo
El recorrido dura unas cuatro semanas, y cada pieza cayó sin hacer ruido.
• 4 de septiembre de 2026 — nv-tlabs/PixelUMM se crea en GitHub bajo una licencia de repositorio Apache-2.0, descrito simplemente como "Encoder-Free Unified Image and Video Understanding and Generation". Permanece con un único commit inicial hasta finales de septiembre.
• 28–29 de septiembre de 2026 — se registra el commit inicial del repositorio y arXiv asigna el preprint arXiv:2609.38597, con fecha del 29 de septiembre, en el que figuran autores de NVIDIA y la Universidad de Waterloo: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang y Jay Zhangjie Wu.
• 1 de octubre de 2026, 21:32 UTC — un commit final al repositorio titulado «docs: añadir cita del artículo de PixelUMM».
• 1 de octubre de 2026, 21:40 UTC — el repositorio de modelos de Hugging Face se crea, ocho minutos después, y se llena con los fragmentos del checkpoint.
La página del proyecto está alojada en una ruta que se lee literalmente pixelumm-project-page-preview, y el paper no lleva ninguna línea de venue —ni CVPR, ni NeurIPS, ni «accepted to»—. En conjunto, la secuencia se lee como un equipo de investigación que publica en vivo un artefacto de paper y deja que la subida a HF sea el anuncio. Eso es una observación sobre la evidencia, no una afirmación sobre la intención: bien puede que NVIDIA tenga un lanzamiento planeado para más adelante, y nada de lo que hay aquí lo descarta.

Qué es realmente PixelUMM
La tesis de diseño se enuncia en la primera línea de la tarjeta del modelo: sin VAE, sin codificador visual. Donde un modelo unificado convencional lleva dos interfaces visuales —un transformer de visión que produce características semánticas para la comprensión, y un autoencoder variacional que produce latentes de reconstrucción para la generación—, PixelUMM no lleva ninguna. Las imágenes se cortan en parches de píxeles de 16×16; los vídeos se cortan en tubelets espaciotemporales de 4 fotogramas; ambos llegan al backbone a través de nada más que proyecciones lineales de una sola capa. Entran píxeles sin procesar; salen píxeles sin procesar.
• Arquitectura — Transformer solo decodificador con embeddings de parches de píxeles sin procesar y una cabeza de generación de píxeles iterativa, descrita en el artículo como una Mixture-of-Transformers que combina atención compartida con parámetros específicos de la tarea.
• Backbone — Qwen3-8B, fijado a la revisión b968826d9c46dd6066d109eabc6255188de91218. Solo se necesitan sus archivos de configuración y de tokenizador; el checkpoint lleva sus propios pesos de idioma aprendidos.
• Parámetros — 15.199.672.064 (aproximadamente 15,2B), representado como "8B MoT" en las propias tablas comparativas del artículo, donde la notación de tamaño cuenta el backbone y el experto de generación por separado.
• Objetivos — predicción autorregresiva de texto y emparejamiento de flujos en el espacio de píxeles, entrenados conjuntamente, que es lo que permite que un único conjunto de pesos tanto responda a una pregunta sobre una imagen como dibuje una nueva.
• Tareas — texto a imagen, texto a video a 96 fotogramas / 24 fps / 4 segundos, texto condicionado por imagen y texto condicionado por video.
La sección empírica del artículo es inusual de una manera que vale la pena señalar. Ocho de sus secciones son estudios de decisiones de diseño en lugar de posiciones en la tabla de clasificación: tamaño de parche de imagen, tamaño de parche de video, artefactos de parche, dinámica de entrenamiento en espacio de píxeles frente a espacio VAE, tamaño del modelo, escalado de cómputo, condicionamiento de contexto multimodal e interfaces de comprensión de video. Eso es un artículo escrito por personas que intentan responder si el enfoque funciona, no uno que intenta ganar una tabla.
Los números son de los propios autores.
Cada cifra a continuación es reportada por los autores de PixelUMM en su propio preprint. No hay reproducción independiente, ni Elo de arena, ni evaluación por terceros, porque el modelo tiene como máximo seis semanas de antigüedad y es anterior a cualquier sistema externo de evaluación. Trátalas como afirmaciones con un enlace de descarga, no como rendimiento verificado.
• Comprensión de imágenes — MMMU 41,67, MMStar 53,99, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00, BLINK 53,46, MMMU-Pro 27,63, según el protocolo oficial LMMS-Eval (64.750 generaciones en 21 tareas).
• Comprensión de vídeo — MVBench 70.53, Video-MME 57.33 sin subtítulos, LongVideoBench 59.61, LVBench 40.41.
• Generación de imágenes — GenEval en general 0,83 con un reescritor de prompts de LLM, 0,77 sin uno; DPG-Bench en general 85,74.
• Generación de vídeo — Puntuación de calidad de VBench Parte 1: 84,10; puntuación semántica: 79,80; total de VBench Parte 2: 83,24.
La lectura honesta es que estas son cifras competitivas dentro de su clase, no líderes de categoría, y el propio artículo lo dice: señala que, como los datos de entrenamiento difieren entre modelos, los resultados «no pueden establecer qué arquitectura es superior». Frente a Qwen3-VL-8B, la brecha en comprensión de imágenes es grande en MMMU (41,67 frente a 69,60) y en MMMU-Pro, donde los autores no reportan ninguna cifra de comparación. Frente a Qwen-Image 20B, la brecha en GenEval es de 0,83 a 0,87. Lo que PixelUMM no es, según sus propias cifras, es un modelo de vanguardia. Lo que es, según sus propias cifras, es un modelo de 15B con una arquitectura genuinamente inusual que se sitúa en la misma banda que los sistemas especializados que lo rodean.
La ventaja más afilada es la licencia, no el benchmark.
El repositorio es Apache-2.0 y la ficha del modelo lo anuncia claramente. El checkpoint es un artefacto distinto con términos distintos, y este es el detalle que más probablemente pille desprevenido a un equipo. Los pesos se distribuyen bajo la NVIDIA One-Way Noncommercial License, cuyo uso se limita a la investigación o la evaluación no comerciales —una concesión materialmente más restrictiva que la del código que tiene al lado. Un archivo fuente del repositorio, modeling/pixelumm/modeling_utils.py, conserva además un aviso de CC BY-NC 4.0 derivado de DiT.
Para un grupo de investigación, un equipo de evaluación o cualquiera que publique un artículo, esta es una licencia perfectamente utilizable. Para un equipo de producto que prototipa una función interna, es lo primero que hay que poner delante de legal, y la respuesta puede ser no. Un modelo que no puedes lanzar es un tipo de activo distinto de un modelo que sí puedes, y ninguna cantidad de paridad en los benchmarks cambia eso.

Lo que se necesita para ejecutarlo
Esto no es una descarga de fin de semana. La documentación del entorno requiere Linux x86-64, Python 3.12, un kit de desarrollo de CUDA 13.0, una GPU NVIDIA y FlashAttention compilado desde el código fuente con ese kit — una imagen de CUDA solo de tiempo de ejecución no servirá. El propio checkpoint no es un archivo model.safetensors: son 128 fragmentos .distcp que suman aproximadamente 30 GB, más un índice .metadata oculto, y el cargador requiere que estén presentes todos los fragmentos referenciados y ese índice.
Dos detalles adicionales determinan lo que realmente puedes hacer con él. Primero, texto a vídeo ejecuta las barreras de protección de Cosmos de forma predeterminada, y estas necesitan acceso al repositorio restringido nvidia/Cosmos-1.0-Guardrail, además de un segundo entorno de Python con una versión principal diferente de Transformers; un inicio de sesión por sí solo no desbloquea los pesos. Segundo, el ejemplo de entrenamiento de juguete de cuatro pasos, la única receta de entrenamiento publicada, está documentado que necesita siete GPU con al menos 48 GiB cada una y unos 61 GB de disco libre para la salida. El ajuste fino en una estación de trabajo no es el camino previsto; la inferencia en una única tarjeta moderna sí lo es.
El repositorio incluye cuatro checkpoints. S8-F22-R05 es el predeterminado y el que se usa para la evaluación del artículo, y abarca las cuatro tareas. S8-F18-R01 recibió 10.000 pasos adicionales de ajuste fino a 480p y 720p y, en general, ofrece resultados de texto a vídeo ligeramente mejores, pero no puede realizar comprensión de vídeo. S8-F19-R03 y S8-F21-R02 son etapas intermedias. Elegir entre ellos es una decisión real, no un detalle.
Lo que no está confirmado
Una lista corta que importa más que la larga de arriba.
• Ningún anuncio de NVIDIA. Ni una nota de prensa ni una publicación en el blog de la propia empresa apareció para este modelo en el momento de redactar este texto. Es posible que el lanzamiento silencioso sea deliberado —los artefactos de investigación a menudo se publican así— o que simplemente aún no se haya producido un lanzamiento.
• Sin evaluación independiente.Todas las cifras de este artículo son de los propios autores. Nada se ha vuelto a ejecutar fuera de NVIDIA y Waterloo.
• No hay ninguna ruta alojada en ningún sitio. Hoy no puedes llamar a PixelUMM a través de una API, y eso incluye OrcaRouter — no lo enrutamos, y no podemos, porque un checkpoint con licencia no comercial no es algo que una plataforma comercial de servicio pueda ofrecer. Quien te diga lo contrario está describiendo una configuración autoalojada.
• No hay una posición declarada sobre licencias futuras. Los términos no comerciales son los términos tal como se distribuyen. Se desconoce si se flexibilizarán y, dada la trayectoria de NVIDIA con los checkpoints de investigación, no es algo con lo que se pueda planificar.

Qué hay que vigilar a continuación
Tres acontecimientos convertirían a PixelUMM de un artefacto de investigación en algo que un público más amplio pueda usar. El primero es un cambio de licencia en el checkpoint; ese único archivo es toda la barrera entre «interesante» y «usable en un producto». El segundo es un lanzamiento oficial de NVIDIA, que vendría acompañado de un encuadre que el repositorio no puede aportar: para qué sirve el modelo y si es una dirección de producto o un artículo. El tercero es la primera reproducción independiente, muy probablemente una reejecución de GenEval o MVBench por parte de alguien con un clúster de GPU disponible, que es el momento en que los números de los autores dejan de ser los únicos números.
Hasta entonces, la postura correcta es la que respalda la evidencia. PixelUMM existe, el código y el artículo son públicos y legibles, los pesos se descargan, y nadie fuera del equipo que las hizo ha comprobado ninguna de las afirmaciones de rendimiento. Eso no es una crítica al trabajo: es el aspecto que tiene una entrega de investigación de seis semanas. También es exactamente la situación en la que una capa de enrutamiento se gana su lugar más adelante, si la licencia alguna vez se relaja: una sola clave para los modelos en los que ya confías, precios de lista transferidos con un margen del 0 %, y conmutación por error que te permite dirigir una porción del tráfico a algo no probado sin apostar por ello una ruta de producción. Por ahora, sin embargo, el resumen honesto es más simple. NVIDIA construyó algo inusual, lo publicó a fondo y no se lo dijo a nadie. El repositorio es el anuncio.
