
InternLumina-U2 vs Gemini Omni 1.1 Flash: El modelo que aún no puedes ejecutar vs el que pagas por segundo
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Si tu fecha límite es esta semana, esta comparación tiene una respuesta de una sola frase. Gemini Omni 1.1 Flash es el modelo de generación de video disponible públicamente de Google: lo llamas a través de una API, devuelve un clip con audio sincronizado y pagas por segundo de salida. InternLumina-U2 es el modelo de investigación Apache-2.0 publicado silenciosamente por el Laboratorio de Inteligencia Artificial de Shanghái: puedes descargar su código de inferencia, pero no sus pesos, que el laboratorio todavía marca como «próximamente». Uno es un producto que puedes comprar ahora mismo; el otro es una apuesta con forma de artículo que no puedes ejecutar en absoluto. La pregunta interesante es por qué alguien los pondría en la misma frase en primer lugar, y qué te dice cada uno sobre hacia dónde se dirige el trabajo multimodal abierto a finales de 2026.
Todo lo siguiente está etiquetado según su fuente. Los detalles de InternLumina-U2 provienen del repositorio de GitHub y de la página del proyecto que el laboratorio publicó el 1 de septiembre de 2026 — el mismo día en que apareció el stub vacío de Hugging Face — y todas sus cifras de benchmark son proporcionadas por el proveedor, preliminares y no reproducidas. Los detalles de Gemini Omni 1.1 Flash provienen de los materiales de lanzamiento de Google y de la página de precios del modelo, que se puso a disposición general el 27 de agosto de 2026.
Dos respuestas a la misma pregunta "multimodal"
Ambos modelos se cobijan bajo el amplio lema de {{1}}"un modelo, muchas modalidades"{{/1}}, y esa etiqueta compartida es el único motivo por el que se comparan. En el fondo no tienen casi nada en común. Gemini Omni 1.1 Flash es un servicio de generación cerrado, alojado y orientado al vídeo: dale texto, una imagen, un clip de referencia corto o audio, y produce hasta diez segundos de vídeo 720p con voz, música y efectos de sonido ya integrados, ampliable en bloques de diez segundos hasta una escena de cuarenta. Razona sobre el clip que ya tienes —la pasada de extensión ahora examina hasta diez segundos de contexto previo en lugar de uno solo— y admite control del primer/último fotograma para que puedas fijar el inicio y el final de una toma y dejar que el modelo rellene el espacio intermedio. Es una herramienta para hacer imágenes en movimiento que se vende por segundo.
InternLumina-U2 es una apuesta en la dirección opuesta: un único modelo de mezcla dispersa de expertos, con 16B de parámetros totales y 1B activos, que afirma comprender imágenes, vídeo y activos 3D, y generar y editar imágenes mediante una interfaz compartida de tokens discretos. Su lado visual es totalmente discreto —ocho libros de códigos complementarios de un tokenizador que el laboratorio llama AToken, de modo que cada posición visual se describe con ocho códigos en lugar de uno—, y su lado lingüístico es un backbone de difusión que el laboratorio extiende a partir de LLaDA-2.0. La propuesta es que la comprensión y la generación deberían reforzarse mutuamente en un único conjunto de pesos, en lugar de ensamblarse a partir de modelos especializados. Que eso funcione es, por ahora, una cuestión sin respuesta: el modelo no se puede ejecutar en ningún sitio, porque los pesos no existen públicamente.
El marcador, tal como está.
El marcador honesto de este par tiene que incluir la procedencia en cada fila, porque una columna es un producto comercializado con precios publicados y la otra es una afirmación de investigación inédita sin precio alguno.
• Qué es — Gemini Omni 1.1 Flash: un modelo alojado de generación y edición de video (ID del modelo gemini-omni-1.1-flash), GA el 27 de agosto de 2026. InternLumina-U2: un LLM de difusión de ciencia abierta para comprensión omni-visual, generación y edición de imágenes, código publicado el 1 de septiembre de 2026.
• Pesos — Gemini Omni 1.1 Flash: ninguno, cerrado y solo alojado. InternLumina-U2: tampoco ninguno todavía, pero con licencia Apache-2.0 y marcado explícitamente como "próximamente".
• Salida que obtienes — Gemini Omni 1.1 Flash: clips de 720p de 10 segundos con audio, ampliables a 40 segundos; mejoras de escala a 1080p y 4K; texto incluido. InternLumina-U2: nada todavía — código de inferencia y una hoja de ruta.
• Lo que admite — Gemini Omni 1.1 Flash: texto, imagen, video (hasta ~131K tokens de entrada; tres clips de 10 segundos por prompt), audio. InternLumina-U2: afirma admitir texto, imágenes naturales, gráficos densos, video mediante 64 fotogramas muestreados y recursos 3D GLB/GLTF renderizados a 64 vistas de color y profundidad.
• Cómo lo ejecutas — Gemini Omni 1.1 Flash: la API de Gemini de Google a través de la API Interactions con estado; acceso para consumidores mediante Google Flow para suscriptores de AI Plus, Pro y Ultra. InternLumina-U2: solo autoalojado, y solo después de que se publiquen los pesos; el código espera un directorio de checkpoint dividido, los pesos del tokenizador AToken, FlashAttention y Blender 4.5 para la ruta 3D.
• Lo que cuesta — Gemini Omni 1.1 Flash: $0.03/seg en borrador a 360p, $0.10/seg a 720p, $0.15/seg a 1080p, $0.30/seg a 4K, con una tarifa de tokens de $1.50 por millón de entrada y $9.00 por millón de salida de texto. InternLumina-U2: lo que cuesten tus propias GPU, una vez que exista.

Las dos columnas no miden el mismo eje. El lado Gemini tiene un precio, se sirve y es inmediatamente útil; el lado InternLumina es una especificación de un modelo que aún no es un modelo.
La parte que está realmente vigente: la GA de Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash es noticia por mérito propio esta semana, porque marca el momento en que la línea de video omni de Google dejó de ser una vista previa. El endpoint de vista previa de Gemini Omni Flash tiene programado apagarse el 30 de septiembre de 2026, y este modelo GA es el reemplazo al que se está trasladando a los desarrolladores. La lista de mejoras es concreta: extensión de escenas de cuarenta segundos construida a partir de incrementos de diez segundos; control de fotogramas clave que permite especificar un primer y un último fotograma y que el modelo genere el metraje que los conecta; clips de referencia de hasta tres segundos para mantener la coherencia de un personaje o escenario; y un nivel de borrador en 360p, con un precio de un tercio del de 720p y hasta un 60% más rápido, para iterar sobre los prompts antes del costoso render final. Si creas pipelines de video, la tabla de precios —0,10 USD por un segundo de 720p, 1,01 USD por un clip de diez segundos, unos 4 USD por una escena de cuarenta segundos en 720p compuesta por cuatro llamadas de extensión— es la cifra que cambia tu modelo de costos.
Nada de eso lo convierte en un competidor de InternLumina-U2 en ningún sentido operativo. Gemini Omni 1.1 Flash genera movimiento; InternLumina-U2, si sus afirmaciones sobreviven al contacto con los pesos, entenderá el movimiento y generará imágenes fijas. Un equipo que necesita video de producto este trimestre no está eligiendo entre los dos: el modelo Gemini es el único del par que se puede invocar, y está disponible a través de la propia API de Google y de varias plataformas de terceros.

La documentación «Models» de la API de Gemini en el sitio para desarrolladores de IA de Google, capturada el 2 de septiembre de 2026: la página que enumera la familia actual de Gemini, con la línea Gemini Omni en la navegación de la barra lateral.
La parte que no está actualizada en absoluto: InternLumina-U2
El lanzamiento de InternLumina-U2 del 1 de septiembre fue de los más discretos: tres commits a un repositorio de GitHub, una página de proyecto, un stub de Hugging Face de 28 bytes cuyo contenido completo es un encabezado de licencia Apache-2.0, y ningún anuncio. Lo que es realmente público es el arnés de inferencia y la arquitectura, y merecen una lectura atenta precisamente porque nadie ha podido probar el modelo en sí. El repositorio muestra un controlador con un punto de entrada por tarea: texto, generación de imagen a partir de texto de hasta 1024×1024, comprensión de imágenes en imágenes naturales y gráficos densos, edición de imágenes basada en instrucciones con un modo dual-CFG opcional, comprensión de video sobre 64 fotogramas muestreados y comprensión 3D sobre vistas GLB/GLTF renderizadas con Blender. La apuesta de diseño es que un vocabulario visual discreto de múltiples libros de códigos permite que un único backbone haga todo esto sin inflar la longitud de secuencia: el mismo instinto de que «los tokens visuales deberían transportar más información» que impulsa los modelos de video nativos de códec, aplicado a una interfaz unificada de comprensión y generación.

El repositorio de GitHub InternLM/InternLumina-U2, capturado el 2 de septiembre de 2026: la página de inicio del repositorio Apache-2.0 con la descripción «Multi-Codebook Diffusion Large Language Model», tres commits y los scripts de inferencia por tarea que constituyen toda la publicación pública hasta el momento.
La tabla de benchmarks en la página del proyecto está etiquetada como «resultados preliminares y parciales» por el propio laboratorio, y las cifras que aparecen van en ambos sentidos: sólidas puntuaciones en gráficos y documentos (ChartQA 86.52, CharXiv-DQ 83.65, reportadas por el proveedor) se sitúan junto a un GenEval de 0.81 que queda por detrás del 0.89 de al menos un modelo que el laboratorio afirma superar. No hay evaluación independiente, porque no hay modelo que evaluar. Todo lo relativo a la calidad real sigue siendo una afirmación hasta que aparezcan archivos safetensors en ese stub vacío de Hugging Face.
Qué hace una capa de enrutamiento cuando solo existe un lado
Esta es una de esas comparaciones donde el ángulo del enrutamiento va de tiempo, no de elección. No vamos a fingir que OrcaRouter sirve a InternLumina-U2 — nadie puede, los pesos no están publicados — y Gemini Omni 1.1 Flash tampoco está en nuestro catálogo; se accede a través de la API de Google. Lo que una capa de enrutamiento hace realmente en ese vacío es mantener tus opciones abiertas sin reconstruir el pipeline dos veces. El modelo de pase directo es el mecanismo: cuando un modelo alojado de un proveedor aterriza en un catálogo, el precio de lista del proveedor se transmite con un margen del 0%, así que la tarifa por segundo que publica el proveedor es la tarifa por segundo que pagas con una sola clave en lugar de un contrato por proveedor. Y cuando finalmente llega una publicación de pesos con licencia Apache-2.0 como InternLumina-U2, lo racional no es arrancar tu stack de vídeo que ya funciona — es poner el nuevo modelo en línea en una ruta de prueba con conmutación por error automática, de modo que la primera vez que el modelo de difusión no probado falle, la llamada vuelva al modelo en el que ya confías sin tocar el código. Prueba lo nuevo donde no pueda hacerte daño; enruta lo que paga las facturas.
El veredicto
Si necesitas video este mes, la decisión ya está tomada: Gemini Omni 1.1 Flash es real, tiene precio y está disponible de forma general, e InternLumina-U2 no puede ser invocado por nadie. Si estás observando hacia dónde va la investigación multimodal abierta, InternLumina-U2 es el artefacto más interesante: una rara apuesta totalmente discreta y de múltiples codebooks de un laboratorio importante, Apache-2.0, con la arquitectura ya pública y los pesos probablemente no muy lejos. Trata el repositorio como una vista previa de una dirección de investigación, trata el modelo de video GA como una herramienta sobre la que puedes construir hoy, y no dejes que la etiqueta compartida de «multimodal» te convenza de que compiten por el mismo trabajo.
