
PixelUMM vs InternLumina-U2: dos betas sin codificador, y la única diferencia que lo decide
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos modelos, ambos públicos, ambos de diseño inusual, y solo con uno de ellos se puede construir un producto. PixelUMM es el modelo unificado sin codificador de NVIDIA — 15.200 millones de parámetros sobre una base Qwen3-8B, que lee y escribe píxeles sin procesar a través de parches de 16×16 y tubelets de 4 fotogramas, sin VAE y sin codificador de visión en ninguna parte de la arquitectura. InternLumina-U2 es el modelo de difusión de mezcla de expertos de 16B de Shanghai AI Laboratory que comprime cada entrada visual en ocho códigos discretos complementarios a través de un tokenizador llamado AToken. Ambos apostaron a que la interfaz visual es el cuello de botella. La apuesta que más importa es la de los archivos de licencia: InternLumina-U2 se distribuye con pesos Apache-2.0, PixelUMM se distribuye con un checkpoint bajo una licencia no comercial. Si estás eligiendo entre ellos para algo comercial, esa frase es toda la comparación y el resto de esta página es contexto para ello.
Ambos conjuntos de cifras que aparecen a continuación provienen de los propios laboratorios. Ninguno de los modelos cuenta con una evaluación independiente, un Elo de arena, ni una reproducción por terceros. Ninguno se sirve mediante ninguna API alojada. Lo que difiere es lo que se te permite hacer con el artefacto una vez que lo descargas, y lo avanzado que está realmente cada lanzamiento.
Dónde está cada uno en este momento
Los plazos de lanzamiento se han movido a velocidades distintas y ambos lo han hecho en silencio.
• PixelUMM — repositorio de GitHub creado el 4 de septiembre de 2026; preprint de arXiv 2609.38597 con fecha del 29 de septiembre de 2026; repositorio del modelo en Hugging Face creado el 1 de octubre de 2026 a las 21:40 UTC. No apareció ninguna publicación de blog, comunicado de prensa ni hilo de lanzamiento de NVIDIA al respecto.
• InternLumina-U2 — repositorio de GitHub creado el 1 de septiembre de 2026; stub de Hugging Face registrado el mismo día; pesos de checkpoint entrenados en Ascend añadidos el 10 de septiembre de 2026; pesos de checkpoint de NVIDIA/CUDA añadidos el 24 de septiembre de 2026. Siete fragmentos por stack, ambos descargables hoy.
El InternLumina-U2 que existía a principios de septiembre —solo código, pesos "próximamente", un repositorio de modelo vacío— no es el InternLumina-U2 que existe ahora. Cualquiera que haya leído sobre él a comienzos del mes y haya concluido que faltaban los pesos debería volver a comprobarlo; tanto los checkpoints para Huawei Ascend como los de NVIDIA/CUDA ya están disponibles, bajo Apache-2.0, junto con el tokenizador, la configuración, la plantilla de chat y el código de modelado remoto.

Dos respuestas a la misma pregunta
Ambos modelos parten de la misma queja: cargar con un codificador de visión para la comprensión y un VAE para la generación significa representar cada imagen dos veces, duplicando aproximadamente el contexto visual y obligando a un pipeline de entrenamiento a mantener dos interfaces.
La respuesta de PixelUMM es eliminar ambos. Los píxeles sin procesar entran directamente mediante proyecciones lineales de una sola capa —un parche de 16×16 por cada posición de imagen, un tubelet de 4 fotogramas por cada posición de vídeo—, y el backbone es un Transformer solo decodificador cuyo diseño Mixture-of-Transformers combina atención compartida con parámetros específicos de tarea. El texto se predice de forma autorregresiva; los píxeles se predicen mediante flow matching. El artículo dedica ocho secciones a estudios de diseño —tamaño de parche, artefactos de parche, dinámica en espacio de píxeles frente a espacio VAE, escalado de cómputo—, lo que indica que la verdadera pregunta del equipo era si el paradigma se sostiene en absoluto.
La respuesta de InternLumina-U2 es mantener una interfaz discreta pero hacer que cada token cargue mucho más. El tokenizador AToken describe cada posición visual con ocho libros de códigos complementarios que cubren textura, texto incrustado y geometría; los ocho embeddings se concatenan por posición y se proyectan en un único token del backbone. La decodificación funciona en sentido inverso, con eliminación de ruido espacialmente paralela y una cabeza autorregresiva de múltiples libros de códigos que predice los ocho códigos en orden. El backbone es un LLM de difusión disperso de la familia LLaDA-2.0, con 16B en total y 1B activos.
• Interfaz visual — PixelUMM: parches de píxeles crudos y tubelets, sin tokenizador alguno. InternLumina-U2: tokens totalmente discretos de ocho libros de código de AToken, sin latente continuo.
• Columna vertebral — PixelUMM: Qwen3-8B (15,2B en total), un único decodificador denso con expertos en comprensión y generación. InternLumina-U2: modelo de lenguaje de difusión MoE disperso con 16B en total / 1B activos.
• Método de generación — PixelUMM: flow matching en el espacio de píxeles más texto autorregresivo. InternLumina-U2: eliminación de ruido mediante difusión enmascarada sobre códigos discretos.
• Tareas declaradas — PixelUMM: texto a imagen, texto a vídeo, imagen a texto, vídeo a texto. InternLumina-U2: esas y además edición de imágenes y comprensión 3D.
• Formato de pesos — PixelUMM: 128 .distcp fragmentos (~30 GB) detrás de un índice .metadata oculto. InternLumina-U2: siete .safetensors fragmentos por pila de hardware, diseño estándar de Hugging Face.

El marcador, con su procedencia adjunta
Lee cada fila como una afirmación del propio laboratorio. Las de PixelUMM provienen de su preprint; las de InternLumina-U2 son la propia descripción que hace el laboratorio de ellas como «preliminares, parciales», y las tablas comparativas completas quedan aplazadas a un informe técnico que aún no ha aparecido.
• MMMU (razonamiento de imágenes) — PixelUMM 41.67 (de los propios autores). InternLumina-U2: no reportado.
• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.
• DocVQA — PixelUMM 90.42. InternLumina-U2: no reportado.
• Video-MME (sin subtítulos) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.
• GenEval general — PixelUMM 0,83 con un reescritor de prompts de LLM, 0,77 sin él. InternLumina-U2 0,81.
• DPG-Bench general — PixelUMM 85.74. InternLumina-U2 87.10.
• Generación de video — PixelUMM VBench Parte 1 calidad 84.10 / semántica 79.80, Parte 2 total 83.24. InternLumina-U2: no reportado.
• Comprensión 3D — PixelUMM: no existe tal tarea. InternLumina-U2 reporta 41.8 en 3D MM-Vet.
La comparación es desigual porque los dos laboratorios publican tablas distintas, no porque uno esté ganando. PixelUMM tiene una sección completa de generación de vídeo y ninguna de edición o 3D; InternLumina-U2 afirma tener seis familias de tareas y presenta una tabla parcial de ellas. Los números entre laboratorios con el mismo nombre de benchmark no son la misma medición —los splits, los prompts y el muestreo difieren—, así que considera las filas de ChartQA y GenEval más o menos igualadas y no vayas más allá.
El licenciamiento es donde esto deja de ser un empate
Esta es la parte que ninguna tabla de benchmarks muestra. El repositorio PixelUMM es Apache-2.0 y la tarjeta lo dice, de forma destacada. El checkpoint es un artefacto aparte bajo la NVIDIA One-Way Noncommercial License, limitado a investigación o evaluación no comercial, y un archivo fuente además conserva un aviso de CC BY-NC 4.0 heredado de DiT. Uso en investigación: sin problema. Función interna de producto: una conversación con el departamento legal, y posiblemente breve.
InternLumina-U2 es Apache-2.0 de extremo a extremo, tanto el código como ambos checkpoints, sin una excepción separada para uso no comercial. Para un equipo que necesita lanzar, eso no es una ventaja menor — es la decisión completa. Ambos modelos tienen madurez de nivel de investigación. Solo uno de ellos tiene uso sin restricciones.
¿Cuál probar realmente, y cómo?
Si tu trabajo es la comprensión de vídeo o quieres un modelo que genere vídeo e imágenes a partir de un único conjunto de pesos, PixelUMM es el artefacto más completo y su artículo es la lectura más útil, pero es un proyecto de investigación con una licencia no comercial, así que pertenece a un banco de evaluación, no a un pipeline. Si tu trabajo es la amplitud de generación de gráficos, documentos e imágenes, o necesitas edición y 3D, InternLumina-U2 abarca más terreno y no conlleva ningún techo de licencia; su coste es que el backbone de difusión 16B-A1B y el tokenizador AToken implican verdadera ingeniería de servicio, y sus cifras publicadas son explícitamente parciales.
Ninguno de los dos está en ninguna API alojada a día de hoy, y eso incluye OrcaRouter — no enrutamos ninguno de los dos modelos. Cuando eso cambie, el argumento para acceder a ellos a través de una capa de enrutamiento en lugar de mediante integración directa es el mismo que se aplica a cualquier modelo recién abierto: una sola clave para más de 200 modelos, los precios de lista de los proveedores traspasados con un 0 % de recargo, y conmutación por error automática para que un modelo que resulte ser peor de lo que sugería la tabla de su proveedor pueda degradarse cambiando una ruta en lugar de reescribir un despliegue. Hasta entonces, el consejo honesto es el aburrido: descarga la licencia que permita tu caso de uso, ejecuta tu propia evaluación con tus propios datos, y no planifiques en función de las cifras de ninguno de los dos laboratorios hasta que alguien externo a ellos las vuelva a ejecutar.
¿Qué cambiaría la respuesta?
Tres cosas, por orden de impacto. Una licencia comercial sobre el checkpoint de PixelUMM haría que la comparación fuera realmente reñida y lo llevaría de «leer el artículo» a «evaluar los pesos». Un informe técnico de Shanghai AI Laboratory que incluya las tablas comparativas completas convertiría los números parciales de InternLumina-U2 en algo comprobable, y también revelaría cuánto de la amplitud de las seis tareas está en paridad y cuánto en profundidad de tokens. Y la primera reproducción independiente de cualquiera de los dos modelos —una nueva ejecución de GenEval o MVBench por parte de un equipo sin interés en el resultado— es el momento en que cualquiera de estos deja de ser una tabla de proveedor. Hasta entonces, uno es una arquitectura inusual que solo puedes estudiar, y el otro es una arquitectura inusual que puedes desplegar.
