
PixelUMM vs Microsoft Mage-VL: uno elimina el tokenizador visual, el otro lo reescribe
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Tanto PixelUMM como Microsoft Mage-VL fueron creados por equipos convencidos de que la forma en que la visión se convierte en tokens es el cuello de botella equivocado —y lo solucionaron en direcciones opuestas. Mage-VL, el modelo de transmisión nativo de códec de Microsoft, mantiene un tokenizador y lo hace mucho más agresivo: sigue la estructura de los códecs de vídeo modernos, conserva cada fotograma de anclaje y solo aquellos parches de fotogramas predichos donde el códec gasta bits, y reporta reducir los tokens visuales en más del 75 % mientras obtiene una aceleración en tiempo de reloj de hasta 3,5× sobre el muestreo uniforme de fotogramas. PixelUMM, el modelo unificado sin codificador de NVIDIA, elimina por completo el tokenizador: cada parche de 16×16 de píxel sin procesar llega al backbone a través de una única proyección lineal, sin VAE ni transformador de visión en ninguna parte. Uno comprime más. El otro se niega a comprimir en absoluto. Y solo uno de ellos puede generar algo.
Esa última diferencia es lo que hace que este emparejamiento sea más interesante que una pelea de especificaciones. Mage-VL es un observador — un modelo de percepción en streaming con una puerta proactiva que decide cuándo hablar. PixelUMM es un lector que también dibuja: los mismos pesos responden preguntas sobre una imagen y generan nuevo video a partir de un prompt de texto. Son dos respuestas incompatibles a «qué debería ser un modelo de visión unificado», y los números de cada laboratorio son los suyos.
Donde ocurre la compresión
La premisa de Mage-VL es una paradoja de Moravec moderna: los modelos de visión-lenguaje son potentes en el razonamiento offline difícil, pero lentos y ávidos de cómputo en la percepción simple en tiempo real. Su solución es la alineación con el códec. En lugar de decodificar un flujo en fotogramas muestreados de forma uniforme y hacer pasar una rejilla densa por un ViT congelado preentrenado en web, Mage-VL separa un flujo en fotogramas ancla (I) y fotogramas predichos (P), conserva todos los parches de los fotogramas ancla y mantiene solo los parches de los fotogramas predichos que contienen movimiento real o detalle nuevo. El codificador, Mage-ViT, se entrena desde cero sobre una rejilla de parches de 16×16 con codificación posicional rotatoria 3D y es explícitamente agnóstico al códec: la misma interfaz acepta vectores de movimiento y energía residual de H.264/AVC o HEVC, o el mapa de tasas aprendido de un códec neuronal, sin ningún cambio de arquitectura ni reentrenamiento.
La premisa de PixelUMM es que el propio codificador es el problema, no su eficiencia. Su artículo sostiene que modelos como BAGEL llevan dos interfaces visuales —una ViT para características semánticas y una VAE para latentes de reconstrucción—, lo que aproximadamente duplica el contexto visual por imagen de condicionamiento y obliga a reconstruir los pipelines de preentrenamiento de visión-lenguaje en torno a un segundo flujo. PixelUMM elimina ambas: las imágenes se convierten en parches espaciales de 16×16, los videos se convierten en tublets espaciotemporales de 4 fotogramas, y los píxeles sin procesar llegan a un Transformer de solo decodificador mediante proyecciones lineales de una sola capa. La comprensión es texto autorregresivo; la generación es flow matching en el espacio de píxeles.
• Estrategia de compresión — Mage-VL: temporal, derivada del códec; conservar los anclajes, hacer dispersos los fotogramas predichos. PixelUMM: ninguna; conservar cada parche de píxel sin procesar.
• Qué se entrena desde cero — Mage-VL: todo el stack visual, con unos 100M de imágenes y videos sin etiquetar. PixelUMM: los embedders y decodificadores de píxeles, sobre un backbone de lenguaje Qwen3-8B.
• Backbone — Mage-VL: Qwen3-4B-Instruct-2507, el único componente preentrenado, detrás de un proyector MLP de dos capas. PixelUMM: Qwen3-8B, alrededor de 15,2B parámetros en total.
• Comportamiento de streaming — Mage-VL: una puerta de cognición puntúa cada ventana móvil y permanece en silencio hasta que se completa un evento que merece una respuesta, y solo entonces invoca el modelo completo. PixelUMM: sin modo de streaming; las solicitudes son llamadas de generación o de comprensión.

Qué hace cada uno, y qué no hace
Mage-VL es un único checkpoint que proporciona simultáneamente comprensión de imágenes y vídeo y la puerta proactiva de streaming — los mismos pesos responden a preguntas sin conexión y controlan los comentarios activados por eventos. Incluye el procesador de códecs, el paquete de códecs neuronales y la puerta. Una segunda versión, microsoft/Mage-ViT, es el codificador visual independiente de la etapa de preentrenamiento desde cero, que se ofrece como interfaz de entrada intercambiable para otros entrenamientos multimodales. Lo que Mage-VL no hace es generar. Lee.
PixelUMM cubre texto a imagen, texto a vídeo a 96 fotogramas y 24 fps, y texto condicionado por imagen y vídeo. Incluye cuatro checkpoints — S8-F22-R05 como el predeterminado que cubre las cuatro tareas, S8-F18-R01 ajustado para un mejor texto a vídeo a 480p y 720p, pero incapaz de realizar comprensión de vídeo, y dos etapas intermedias. Lo que no hace es streaming, edición o 3D. Si necesitas un modelo que observe una transmisión en directo y hable cuando ocurra algo, PixelUMM no encaja en absoluto, y ninguna columna de benchmark te lo dirá.
La brecha de adopción es la primera señal honesta.
Los dos lanzamientos no son igualmente maduros, y los contadores de descargas lo dicen con más claridad que cualquier publicación de lanzamiento.
• Mage-VL — publicado en Hugging Face el 25 de julio de 2026 bajo Apache-2.0, con un informe técnico complementario y un identificador de arXiv. A principios de octubre mostraba aproximadamente 13.800 descargas y 414 me gusta, y un pequeño ecosistema de trabajo comunitario había crecido a su alrededor.
• PixelUMM — publicado en Hugging Face el 1 de octubre de 2026 bajo una licencia de checkpoint no comercial. Su número de descargas era cero y su número de "me gusta" era tres cuando se escribió esto. Tiene apenas unos días.
Todavía no hay ningún anuncio de ninguno de los dos laboratorios sobre el lanzamiento correspondiente: Mage-VL se lanzó en julio sin uno y PixelUMM se lanzó en octubre sin uno. Esa simetría es real, pero sería un error leerla como que los dos son artefactos equivalentes. Mage-VL ha tenido diez semanas de atención de la comunidad; PixelUMM ha tenido días. Un modelo que nadie fuera del laboratorio ha ejecutado es una propuesta distinta de un modelo que unos miles de personas se han descargado, y solo uno de estos dos está en la segunda categoría.

El marcador, con procedencia
Todas las cifras son del propio laboratorio que los desarrolla. Las de Mage-VL proceden de la ficha y el informe técnico de Microsoft; las de PixelUMM, de su preprint. Ninguna ha sido reproducida de forma independiente.
• Tokens visuales — Mage-VL: se reporta una reducción de más del 75 % frente al muestreo denso de fotogramas. PixelUMM: sin reducción; el argumento es que los parches sin procesar eliminan una segunda codificación en lugar de reducir la primera.
• Velocidad en tiempo real — Mage-VL: hasta 3,5× más rápido que el muestreo uniforme de fotogramas con una precisión equivalente, según Microsoft. PixelUMM: no hay ninguna afirmación comparativa de velocidad en el artículo.
• Calidad del codificador — Mage-VL: Mage-ViT reporta un 99,33 % en CIFAR-10 y un 85,69 % en ImageNet con un presupuesto de 256 tokens, a partir de aproximadamente 100 millones de medios sin etiquetar. PixelUMM: no hay un benchmark de codificador equivalente, ya que no hay ningún codificador que evaluar.
• Comprensión de vídeo — Mage-VL: mejoras reportadas frente a Qwen3-VL-4B en cada benchmark de vídeo y de anclaje temporal que reporta, incluidos +22,5 en QVHighlight y +17,1 en ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 sin subtítulos, LongVideoBench 59,61, LVBench 40,41.
• Comprensión de imágenes — Mage-VL: a la par de Qwen3-VL-4B en imágenes estáticas, según lo reportado por Microsoft. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96.
• Generación — Mage-VL: ninguno. PixelUMM: GenEval general 0.83 con un reescritor de prompts, DPG-Bench 85.74, VBench Parte 1 calidad 84.10.
• Streaming — Mage-VL: gating proactivo de eventos con los mejores valores reportados de TimVal, F1, ROC-AUC y PR-AUC en streaming de SoccerNet. PixelUMM: no compatible.
• Licencia — Mage-VL: Apache-2.0, código y pesos. PixelUMM: código Apache-2.0, Licencia No Comercial Unidireccional de NVIDIA sobre el checkpoint.
Las dos columnas no se superponen lo suficiente como para establecer una clasificación. Mage-VL informa de un codificador eficiente que supera a un competidor de la misma escala; PixelUMM informa de que un modelo de 15B se sitúa en la misma banda que los sistemas especializados que lo rodean, y afirma sin rodeos en su propio artículo que las diferencias en los datos de entrenamiento hacen que los resultados «no puedan establecer qué arquitectura es superior».
La división práctica
Elige por trabajo, no por puntuación. Si estás construyendo percepción de video en tiempo real — un monitor que observa un stream y comenta cuando ocurre algo, con el costo de tokens como restricción vinculante — Mage-VL es el único de los dos que lo hace, es Apache-2.0, y su escala de clase 4B significa que un solo nodo puede servirlo. Si necesitas un modelo que lea imágenes y video y además los genere, PixelUMM es el único de los dos que hace eso, pero es un artefacto de investigación con una licencia no comercial, sus pesos son 128 fragmentos de checkpoint distribuidos detrás de un índice oculto, y texto-a-video ejecuta las barreras de seguridad de Cosmos por defecto con un entorno de Python separado para la compuerta.
Para un equipo que necesita ambas capacidades, el argumento a favor de acceder a ellas mediante una sola capa de enrutamiento en lugar de dos integraciones directas es sencillo, aunque hoy ninguna de las dos esté alojada: una única clave, los precios de lista de los proveedores transferidos con un 0 % de margen, y reglas de conmutación por error que te permiten colocar un modelo Apache-2.0 recién abierto frente a una porción del tráfico mientras el modelo ya probado sostiene el resto. OrcaRouter está diseñado para ese tipo de problema — y para ser explícitos, actualmente no enrutamos ni PixelUMM ni Mage-VL, así que esto es una descripción del flujo de trabajo, no un listado.
¿Qué lo resolvería?
Dos acontecimientos importan. El primero es una repetición independiente de las cifras del codificador de Mage-ViT o de los resultados de vídeo de Mage-VL por parte de alguien sin interés en ellos —diez semanas de descargas aún no han producido ninguna—. El segundo es cualquier cambio en la licencia del checkpoint de PixelUMM, que es el único hecho que actualmente separa un artefacto de investigación de uno desplegable. Hasta que cualquiera de los dos se materialice, lo útil que se puede decir sobre este par es que Microsoft apostó por abaratar la interfaz visual y NVIDIA apostó por eliminarla, y ninguna de las dos apuestas ha sido evaluada por nadie fuera del laboratorio que la realizó.
