Una tarjeta de título principal para la comparación 'InternLumina-U2 vs Microsoft Mage-VL' con el subtítulo 'Dos laboratorios discretos, dos apuestas por tokens de visión más inteligentes' y tres chips de estadísticas — 'InternLumina-U2: 16B-A1B diffusion MoE', 'Microsoft Mage-VL: ~5B VLM nativo de códec', 'Ambos reportados por el proveedor, sin reproducir' — con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

InternLumina-U2 vs Microsoft Mage-VL: Dos laboratorios discretos que apuestan a que los tokens visuales deberían cargar con más peso

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Microsoft Mage-VL e InternLumina-U2 llegaron ambas de la forma en que los laboratorios de investigación publican cuando no están seguros de que el resultado sea ya un producto: en silencio. Microsoft publicó los pesos y el código de Mage-VL en Hugging Face el 25 de julio de 2026 sin ningún anuncio; la organización InternLM del Laboratorio de Inteligencia Artificial de Shanghái publicó el código de inferencia de InternLumina-U2 en GitHub el 1 de septiembre de 2026 sin ningún anuncio tampoco. Con cinco semanas de diferencia, dos de los laboratorios más grandes del mundo lanzaron modelos que comparten una convicción silenciosa — que la forma en que convertimos la visión en tokens es el cuello de botella — y luego los dejaron para que la comunidad los notara. Uno de ellos puedes descargarlo y ejecutarlo hoy, aunque torpemente. El otro no puedes ejecutarlo en absoluto, porque sus pesos aún no existen. Este es el mapa honesto de los dos, y de por qué «ambos reportados por el proveedor, ambos sin probar» no es la misma frase para ambos.

Cinco semanas, dos apuestas por la eficiencia de representación

El hilo conductor es real, no retórico. Mage-VL es un modelo de video nativo de códec: en lugar de decodificar un flujo en fotogramas muestreados uniformemente y pasar una cuadrícula densa de parches por un transformador de visión preentrenado en datos web y congelado, sigue la estructura de los códecs de video modernos, separando un flujo en fotogramas ancla y los datos de movimiento comprimidos entre ellos, e incorporando directamente esa representación compacta. Microsoft reporta como beneficio una gran reducción de tokens visuales y una ruta de percepción en streaming notablemente más rápida: la empresa lo enmarca como la corrección de una especie de paradoja de Moravec para los modelos de lenguaje de video, donde las pequeñas tareas de percepción en tiempo real cuestan tanto cómputo como el difícil razonamiento offline. Mage-VL es un observador: consume video de manera eficiente y responde preguntas sobre lo que ve, en casi tiempo real.

InternLumina-U2 es una apuesta por el mismo cuello de botella desde la otra dirección. Mientras que Mage-VL comprime el vídeo siguiendo el códec, InternLumina-U2 comprime cada entrada visual describiendo cada posición con ocho códigos discretos complementarios en lugar de uno, usando un tokenizador que el laboratorio llama AToken. La apuesta es que un único codebook limita cuánta información puede transportar un token visual, así que un vocabulario con múltiples codebooks permite que un modelo de difusión de 16 mil millones de parámetros haga comprensión y generación a través de la misma interfaz — leer un gráfico, responder a una pregunta sobre un vídeo, describir un recurso 3D, generar una imagen a partir de texto, editarla con instrucciones — sin una pila de generación separada. Mage-VL quiere percibir flujos de forma económica; InternLumina-U2 quiere percibir y dibujar con un único conjunto de pesos.

El marcador

Las cifras de ambos modelos son reportadas por el proveedor y no han sido reproducidas, por lo que el marcador etiqueta cada fila con su procedencia.

• Forma — Mage-VL: un modelo compacto de lenguaje y visión nativo de códec (de aproximadamente 5 000 millones de parámetros en BF16) construido sobre un backbone de texto Qwen, entrenado para la comprensión de imágenes y video. InternLumina-U2: un MoE de 16 000 millones de parámetros con 1 000 millones activos (16B-A1B), un LLM de difusión dispersa que abarca comprensión, generación y edición.

• Representación visual — Mage-VL: tokens nativos de códec que siguen la estructura del códec de video (ancla más movimiento); se informa de una reducción de >75 % en tokens visuales en video en streaming. InternLumina-U2: tokens totalmente discretos de ocho libros de códigos del tokenizador AToken.

• Lo que hace — Mage-VL: observa la entrada de imagen y video, responde con texto; diseñado para percepción en streaming. InternLumina-U2: afirma comprensión de texto, de imágenes, texto a imagen, edición de imágenes, comprensión de video y comprensión 3D.

• Pesos — Mage-VL: público en Hugging Face desde el 25 de julio de 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: no público — el repositorio de Hugging Face es un stub vacío, pesos marcados como "próximamente".

• Cifras principales — Mage-VL: Video-MME 64,0; NExT-QA 83,1; OVO-Bench 64,0; todas reportadas por Microsoft. InternLumina-U2: ChartQA 86,52; MathVision 33,22; VideoMME 51,26; GenEval 0,81; todas reportadas por el laboratorio, preliminares y parciales.

• Realidad del servicio: Mage-VL se puede descargar, pero no hay una vía estándar para vLLM ni SGLang; el código exige trust_remote_code, y ningún proveedor de inferencia lo despliega actualmente. InternLumina-U2 no puede ser servido por nadie: los pesos no existen públicamente, e incluso el controlador de inferencia publicado espera archivos de checkpoint que no están en el repositorio.

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

"Disponible pero engorroso" no es lo mismo que "no disponible".

Esta es la distinción que más importa si de verdad intentas construir algo. Mage-VL es real en el sentido que más cuenta: los pesos están en Hugging Face, la tarjeta ha recibido un intenso tráfico de descargas desde finales de julio, y a su alrededor ha surgido un pequeño ecosistema de cuantizaciones comunitarias. "Real" no significa "fácil". La tarjeta del modelo muestra una etiqueta de código personalizado, el codificador visual no es el ViT congelado estándar que asumen los stacks de servicio existentes, y el propio repositorio de Microsoft conlleva la consecuencia práctica: ejecutarlo implica trust_remote_code y ningún despliegue llave en mano del proveedor. Pero un equipo decidido con una GPU puede cargarlo, apuntarlo a un flujo de video y comprobar si la hipótesis del códec nativo se sostiene con sus datos. Esa es una diferencia enorme con respecto a InternLumina-U2, donde la misma frase termina de otra manera: un equipo decidido puede leer el código de inferencia, y ahí se detiene, porque no hay pesos que cargar.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

La tarjeta de Hugging Face de microsoft/Mage-VL, capturada el 27 de agosto de 2026 — la descripción de transmisión nativa de códec, la licencia Apache-2.0, la etiqueta de arXiv y una sección de proveedores de inferencia que muestra que ningún proveedor despliega actualmente el modelo.

La asimetría de los benchmarks sigue la misma línea. Las cifras de ambos modelos son afirmaciones de los proveedores sin reevaluaciones independientes todavía. Pero las afirmaciones de Mage-VL se apoyan al menos en un artefacto descargable, lo que significa que la brecha entre la afirmación y la verificación es cuestión de que alguien lo ejecute. Las afirmaciones de InternLumina-U2 se apoyan en un elemento de la hoja de ruta — «las tablas comparativas completas aparecerán en el próximo informe técnico» — y no existe ningún artefacto que pueda verificarlas. La propia tabla parcial del laboratorio incluso muestra que el modelo va por detrás de al menos un rival del que dice superar (GenEval 0.81 frente a 0.89 de LLaDA2.0-Uni), lo cual es un recordatorio útil para leer su etiqueta de «preliminar, parcial» de forma literal.

Donde podían componer en lugar de competir

La forma más útil de leer estos dos es como peldaños adyacentes de una escalera, no como rivales para el mismo trabajo. Un observador nativo de códec como Mage-VL es interesante precisamente porque es lo bastante barato como para ejecutarse de forma continua — la pieza que vigila cada fotograma de una transmisión y solo escala cuando aparece algo que merece la atención de un modelo más grande. El modelo más grande al que escala podría, en principio, ser un modelo unificado del tipo que InternLumina-U2 afirma ser: la puerta siempre activa que decide qué mirar, y el modelo profundo que realmente lee el gráfico, sigue la escena 3D o produce la imagen editada. Los dos están sin probar — Mage-VL sin probar pero ejecutable, InternLumina-U2 sin probar y sin publicar — así que el planteamiento honesto es una composición que podrías construir una vez que cada lado haya sido validado de forma independiente, no un cara a cara que puedas ejecutar hoy.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

El repositorio de GitHub InternLM/InternLumina-U2, capturado el 2 de septiembre de 2026: la página principal del repositorio muestra la descripción de la difusión multi-codebook, la insignia de la licencia Apache-2.0 y los scripts de punto de entrada de inferencia que componen la versión pública, mientras que los pesos permanecen fuera del árbol.

Lo que hace una capa de enrutamiento con puntos de control no verificados

Ninguno de estos modelos está alojado en OrcaRouter, y no vamos a dar a entender lo contrario: Mage-VL no tiene ninguna ruta de servicio estándar en ningún lugar, e InternLumina-U2 no tiene pesos. Lo que hace que el DSL de enrutamiento sea genuinamente útil en esta situación es expresar la composición anterior como una sola llamada en lugar de un código de integración a medida: un modelo de percepción económico y siempre activo que alimenta a un modelo más profundo, encadenados de modo que el modelo caro solo se ejecuta cuando el económico indica que algo ha cambiado. Y en cuanto al problema del checkpoint no probado — que es todo el perfil de riesgo de ambos —, la conmutación automática por error es el mecanismo que permite a un equipo probar un modelo como Mage-VL en una ruta real sin apostar la ruta a ese modelo: la primera vez que el nuevo checkpoint se bloquea, devuelve basura o lanza una excepción, la llamada pasa a un modelo ya probado y no hay que despertar a ningún ingeniero para que accione un interruptor. Una API para más de 200 modelos, el precio de lista del proveedor trasladado sin margen (0 % de recargo), y la novedad puesta a prueba detrás de una red de seguridad en lugar de delante de producción.

El resultado final

Si quieres {{1}}poner a prueba la tesis del video nativo de códec{{/1}} hoy, solo existe Mage-VL — y ese «{{2}}existe{{/2}}» viene con salvedades: hará falta código a medida y tendrás que servir el modelo por tu cuenta. Si quieres {{3}}poner a prueba la tesis del modelo unificado de múltiples codebooks{{/3}}, no {{4}}puedes{{/4}}, porque InternLumina-U2 sigue siendo una especificación a la espera de sus pesos; lo que sí puedes hacer es {{5}}leer su arquitectura ahora{{/5}} para estar listo {{6}}en cuanto el stub en Hugging Face se llene{{/6}}. Trata el modelo de Microsoft como un {{7}}artefacto tosco pero real{{/7}} y el modelo del Shanghai AI Lab como una {{8}}promesa bien documentada{{/8}}, y recuerda que en esta comparativa el calificativo de «{{9}}reportado por el proveedor y no reproducido{{/9}}» se aplica a ambos — solo significa {{10}}algo diferente{{/10}} cuando hay un archivo que puedes descargar.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube