Una tarjeta de título principal generada para InternLumina-U2 con una insignia de píldora PREVIEW, el encabezado 'InternLumina-U2', el subtítulo 'Un modelo de difusión de 16B para imagen, video y 3D', una línea de descripción que menciona Shanghai AI Laboratory, un LLM de difusión con múltiples codebooks, código publicado el 2026-09-01 y pesos próximamente, chips para Imagen, Video y 3D, formas abstractas Entender-Generar-Editar en azul, cian y ámbar a la derecha, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Vista previa de InternLumina-U2: un único modelo de difusión de 16B para imagen, video y 3D — los pesos aún están por llegar

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

A las 04:03 UTC del 1 de septiembre de 2026, el Laboratorio de IA de Shanghái creó el repositorio de GitHub InternLumina-U2. Trece minutos después, la misma organización registró un repositorio con idéntico nombre en Hugging Face. No hubo publicación de lanzamiento, ni ficha del modelo, ni anuncio de ningún tipo — solo el código de inferencia para InternLumina-U2, un modelo de mezcla de expertos de 16 000 millones de parámetros (1000 millones activos) que el laboratorio presenta como un único modelo que abarca comprensión de imágenes, generación de texto a imagen, edición de imágenes, comprensión de video y comprensión 3D a través de una interfaz única de tokens discretos. El código es real y público; el modelo en sí no lo es — todavía. Los pesos están marcados como «próximamente», el repositorio de Hugging Face es un marcador de posición vacío y el informe técnico prometido no ha aparecido. Lo que se publicó discretamente el 1 de septiembre es, no obstante, la imagen pública más completa de este modelo que existe en cualquier lugar.

Si es la primera vez que te enteras de InternLumina-U2, esa es la intención. No se anunció nada sobre el lanzamiento, y todavía no parece existir cobertura independiente alguna — los artículos de señales tempranas son exactamente donde un modelo como este aparece primero, antes de la publicación de lanzamiento y a veces antes de los pesos. Todo lo que sigue está extraído del repositorio de GitHub, de la página del proyecto y del stub de Hugging Face que el propio laboratorio publicó el 1 de septiembre, y cualquier cosa más allá de esas fuentes está explícitamente etiquetada como inferencia.

Lo que realmente se envió el 1 de septiembre.

El repositorio de GitHub InternLM/InternLumina-U2 fue creado el 1 de septiembre de 2026 y ese día recibió tres commits: el commit inicial, una revisión que marcaba el enlace del modelo como «próximamente» y los resultados de los benchmarks como «preliminares», y una corrección de navegación. Tiene licencia Apache-2.0 e incluye un README titulado "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", una versión en inglés y otra en chino, un conjunto completo de herramientas de inferencia y una hoja de ruta. Un detalle curioso que conviene señalar: la noticia del propio repositorio lleva el sello «[2026-08]», pero el commit inicial y las dos marcas de tiempo del repositorio están fechados el 1 de septiembre de 2026; por lo tanto, los primeros días de septiembre deben considerarse la fecha real de publicación, no agosto. El repositorio que aparece a continuación es la totalidad de lo publicado: todos los archivos visibles en el árbol forman parte de lo que se lanzó, y no existe nada más en ningún otro lugar por ahora.

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2, creado el 2026-09-01 bajo licencia Apache-2.0, con código de inferencia para texto, texto a imagen, comprensión de imágenes, edición de imágenes, comprensión de video y comprensión 3D.

Hugging Face — internlm/InternLumina-U2, creado el 2026-09-01, actualmente contiene únicamente un archivo .gitattributes y un README de 28 bytes cuyo contenido completo es el encabezado de la licencia Apache-2.0. Sin pesos, sin configuración, sin archivos de tokenizador.

Página del proyecto — internlm.github.io/InternLumina-U2, con figuras de arquitectura, una tabla preliminar de benchmarks y demos provisionales; el informe técnico está marcado como "próximamente".

El código de inferencia está organizado como un script controlador con una sección por tarea: generación de texto plano, texto a imagen de hasta 1024×1024 con CFG y pasos de tiempo configurables, comprensión de imágenes sobre imágenes naturales y gráficos densos, edición de imágenes basada en instrucciones con un modo dual-CFG opcional, comprensión de video sobre 64 fotogramas muestreados y comprensión 3D sobre recursos GLB/GLTF que se renderizan en 64 vistas de color y profundidad mediante una canalización de Blender incluida antes de la tokenización. Esa amplitud de tareas es la tesis de diseño del modelo, y vale la pena detenerse en ella antes de sumergirse en la arquitectura.

Un modelo, seis tareas, un vocabulario de tokens

InternLumina-U2 pertenece a una línea de investigación de rápido avance que apuesta a que el lenguaje y la visión deberían compartir una única interfaz de tokens discretos en lugar de vivir en pilas separadas de comprensión y generación. El trabajo anterior del propio laboratorio en esta dirección — Lumina-DiMOO, el modelo unificado de difusión discreta presentado en WAIC 2025 — se cita junto con LLaDA2.0-Uni, Show-o2 y MMaDA como los sistemas pioneros sobre los que InternLumina-U2 se construye y a los que pretende superar. La apuesta específica de InternLumina-U2 es que el cuello de botella de estos modelos unificados no es la arquitectura, sino el vocabulario visual: un único codebook limita cuánta información puede transportar un token visual, mientras que los híbridos discreto-continuos que separan la comprensión y la generación en distintas representaciones obligan al modelo a mantener dos pilas de todos modos.

La respuesta de InternLumina-U2 es modelado totalmente discreto con múltiples libros de códigos. El lado visual utiliza el tokenizador AToken de Apple, que describe cada posición visual con ocho libros de códigos complementarios: un intento de preservar la textura local, el texto incrustado, la geometría y los detalles de alta frecuencia sin inflar la longitud de la secuencia. En el lado de entrada, cada uno de los ocho libros de códigos mantiene su propio embedding, y los ocho embeddings por posición se concatenan y se proyectan en un único token de la red troncal. En el lado de salida, la predicción es espacialmente paralela, pero autorregresiva en la profundidad de los libros de códigos: la red troncal de difusión elimina el ruido de muchas posiciones espaciales enmascaradas en paralelo, y una cabeza autorregresiva de múltiples libros de códigos predice entonces los ocho códigos de cada posición en orden.

Escala — 16B parámetros totales, 1B activos (16B-A1B), un MoE disperso.

Backbone de lenguaje — modelo de lenguaje de difusión LLaDA-2.0 MoE, cuyo objetivo de difusión por bloques se extiende a tareas visuales mediante entrenamiento conjunto multitarea (descripción del proveedor).

Representación visual — tokens totalmente discretos de 8 codebooks del tokenizador AToken de Apple.

Hardware — adaptado tanto a GPUs NVIDIA como a NPUs Ascend de Huawei en entrenamiento, evaluación e inferencia, con alineación numérica a nivel de operadores entre backends.

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

Lo que eso aporta en la práctica, si las afirmaciones se sostienen, es el sueño más antiguo del campo multimodal: un único conjunto de pesos que pueda leer una imagen, editarla, dibujar una nueva a partir de texto, responder preguntas sobre un video y describir un activo 3D — con la comprensión y la generación reforzándose mutuamente a través de la misma interfaz, en lugar de estar ensambladas a partir de modelos especializados. Esa es también la afirmación que más merece una mirada escéptica, porque es la más difícil de hacer realidad.

Los números, tales como son.

Todos los resultados del benchmark que tiene InternLumina-U2 son reportados por el propio proveedor, preliminares y parciales. El README y la página del proyecto lo dicen ellos mismos: «Resultados preliminares y parciales. Las tablas comparativas completas aparecerán en el próximo informe técnico». No existe ninguna evaluación independiente, porque los pesos no son públicos. Trata las cifras siguientes como afirmaciones del propio laboratorio, no como puntuaciones verificadas.

Comprensión de gráficos / documentos — ChartQA 86.52, CharXiv-DQ 83.65 (reportado por el proveedor).

Razonamiento matemático visual — MathVision 33.22, DynaMath 56.37; el laboratorio afirma que supera al InternVL3-8B de solo comprensión en ambos.

Robustez ante alucinaciones — HallusionBench 62.15.

Comprensión de video — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (página del proyecto).

comprensión 3D — 3D MM-Vet 41.8.

Texto a imagen — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (página del proyecto).

Edición de imágenes — ImgEdit 3.83.

El relato de la comparación es donde un lector honesto debería frenar. El README afirma que InternLumina-U2 supera a modelos unificados como InternVL-U, LLaDA2.0-Uni, Show-o2 y Lumina-DiMOO en benchmarks de comprensión y generación de grano fino — pero la propia tabla de la página del proyecto muestra InternLumina-U2 con 0.81 en GenEval frente al 0.89 de LLaDA2.0-Uni, por lo que el modelo va por detrás de al menos un competidor en al menos una métrica de generación destacada. Elegir algunos números favorables de una tabla parcial es exactamente lo que la advertencia de "tablas de comparación completas en el informe técnico" está diseñada para suavizar. Los números son una señal direccional del laboratorio, nada más.

Lo real frente a lo prometido

El alcance del lanzamiento es inusualmente explícito, y es importante para cualquiera que esté decidiendo si puede probar esto hoy. Incluido: el código de inferencia. No incluido: los pesos, el código de entrenamiento (prometido en un repositorio separado), la pila de entrenamiento e inferencia de Ascend y el informe técnico. El repositorio de Hugging Face que eventualmente albergará el modelo es un stub: la captura de pantalla a continuación es todo el contenido actual de la página a la que llega un lector cuando hace clic en el enlace "Model (coming soon)" en el README.

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

Ni siquiera el código liberado puede producir resultados todavía. El controlador de inferencia espera un directorio de checkpoint dividido de Hugging Face y los pesos del tokenizador AToken en una ruta específica — ninguno de los cuales está en el repositorio —, así que lo que se puede descargar hoy es una especificación de cómo se ejecutará el modelo, no un modelo en funcionamiento. Y cuando los pesos lleguen, el autoalojamiento no será una tarea rutinaria de pip install. El modelo utiliza una API de generación block-diffusion en lugar de la interfaz de generación estándar de Transformers, el tokenizador AToken requiere FlashAttention, el código necesita una GPU visible en el momento de la importación, el controlador raíz es de un solo proceso y el pipeline 3D espera Blender 4.5 para la codificación de activos. Eso es un proyecto de despliegue real, no un experimento de fin de semana — que es exactamente el tipo de fricción que una capa de enrutamiento existe para absorber para la mayoría de los equipos.

Cuando aterricen los pesos, trátalo como el modelo sin probar que es

Nadie puede ejecutar InternLumina-U2 hoy, y ningún proveedor puede ofrecerlo, porque los pesos no existen públicamente. Eso cambiará en algún momento: la licencia Apache-2.0 y el patrón del laboratorio en 2026 de apertura agresiva del código (el impulso de ArchSpace de «abrirlo todo», InternVL3.5, los modelos científicos Intern-S2) hacen que una publicación de los pesos sea probable, no hipotética. Cuando ocurra, el primer paso racional no es apostar un pipeline de producción por un modelo de difusión de día uno con requisitos de servicio inusuales y cero evaluaciones independientes. Es ejecutarlo en paralelo con el modelo en el que ya confías, en una ruta de prueba, con conmutación por error automática al modelo probado en el momento en que el nuevo se comporte mal. Para eso está hecha una capa de enrutamiento: una API para más de 200 modelos, precios de lista de los proveedores trasladados sin margen, y una conmutación por error que convierte «probar lo nuevo» en una regla de enrutamiento, no en una migración. OrcaRouter está configurado así — y para ser claros, no enrutamos InternLumina-U2 ni podemos hacerlo, porque los pesos no han sido liberados. Esta sección trata sobre el flujo de trabajo para cuando lo sean, no una afirmación de que el modelo esté disponible en algún lugar hoy.

Qué ver a continuación

Cuatro eventos harían pasar a InternLumina-U2 de la vista previa a la realidad, en orden aproximado de probabilidad. Primero, que se complete el repositorio de Hugging Face: la aparición de archivos safetensors, un config y los pesos del tokenizador AToken en ese stub es el momento en que el modelo realmente existe. Segundo, el informe técnico, que se supone debe incluir las tablas comparativas completas y convertiría los números parciales del proveedor mencionados arriba en algo verificable. Tercero, el repositorio del código de entrenamiento y la pila Ascend, que importan a cualquiera que quiera ajustar el modelo o ejecutarlo en hardware que no sea de NVIDIA. Cuarto, una primera evaluación independiente — un Elo de arena, una ejecución reproducida de ChartQA o GenEval — que ponga a prueba la promesa de "un modelo, seis tareas" sin el sesgo de selección del propio laboratorio. Que el código sea público desde el 1 de septiembre significa que la arquitectura ya es conocible; que los pesos estén ausentes significa que todo lo relativo a la calidad real sigue siendo una afirmación. Vigila el repositorio del modelo en lugar del feed de anuncios — las partes interesantes ya son públicas, y el modelo en sí probablemente no esté muy lejos.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube