Una tarjeta de título principal para la comparación 'InternLumina-U2 vs Qwen2.5 Omni' con el subtítulo 'El modelo omni que Alibaba entregó frente al que aún prometió' y tres indicadores estadísticos — 'Qwen2.5 Omni: 17 meses en producción', 'InternLumina-U2: un día de código', 'Apache-2.0 en ambos lados' — con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni: El modelo Omni que Alibaba entregó frente al que Shanghai AI Lab todavía promete

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

InternLumina-U2 y Qwen2.5 Omni son ambas respuestas a la misma ambición — un único modelo que maneja todas las modalidades en lugar de un zoológico de especialistas — separadas por dos generaciones. Qwen2.5 Omni es la respuesta que realmente se lanzó: un modelo de pesos abiertos de 7 mil millones de parámetros publicado en marzo de 2025, con diecisiete meses de antigüedad al momento de escribir esto, que acepta texto, imágenes, audio y video como entrada y responde en texto o habla natural en streaming. InternLumina-U2 es la respuesta del Laboratorio de Inteligencia Artificial de Shanghái, publicado como código de inferencia el 1 de septiembre de 2026: un modelo de difusión dispersa de 16 mil millones de parámetros que afirma percibir imágenes, video y 3D, y generar y editar imágenes a través de una interfaz compartida de tokens discretos. Una generación de la idea omni ha estado en producción durante un año y medio; la otra tiene un día de vida y nadie puede ejecutarla, porque sus pesos aún no existen. La brecha entre ellas es la diferencia entre una promesa cumplida y una promesa hecha.

El omni que se lanzó: Qwen2.5 Omni

Qwen2.5 Omni es un modelo de referencia que se debe tomar en serio porque es uno de los pocos modelos abiertos que realmente cumple la propuesta de «percibirlo todo, responder en cualquier formato». Su arquitectura Thinker-Talker combina un pensador de texto con un hablador que genera voz, mediante una codificación posicional multimodal alineada en el tiempo para que el audio y el vídeo permanezcan sincronizados; la entrada abarca texto, imágenes, audio y vídeo, y la salida puede ser texto más voz en el mismo turno, con cuatro voces integradas. Las limitaciones están tan documentadas como las capacidades: el contexto es de 32 000 tokens, no hay llamada a funciones ni salida estructurada, y es un conversador omni, no un agente. Lo que no hace merece subrayarse en esta comparación: percibe imágenes, audio y vídeo, pero no los genera. El «omni» de Qwen2.5 Omni es la omnipercepción con síntesis de voz en el lado de la salida; los píxeles entran y las palabras salen.

El historial es real. El modelo se ha descargado cientos de miles de veces, tiene una API alojada a través de la plataforma del propio desarrollador y de varias plataformas de terceros, y ha pasado diecisiete meses acumulando cuantizaciones, herramientas comunitarias y un precio conocido: los listados de agregadores sitúan el texto en unos 0,09 $ por millón de tokens de entrada y 0,34 $ por millón de salida, con el audio facturado por separado. Diecisiete meses es tiempo suficiente para que tanto sus fortalezas como sus muros estén bien cartografiados. Eso es lo que compra la madurez: no perfección, sino previsibilidad.

El omni que fue prometido: InternLumina-U2

InternLumina-U2 intenta ir un paso más allá que Qwen2.5 Omni, y ese paso es exactamente donde reside la dificultad. Su tesis de diseño es que la percepción y la generación deberían compartir una única interfaz de tokens discretos: en lugar de un modelo de lenguaje que percibe video y un modelo de difusión separado que dibuja, un único backbone de difusión MoE disperso —16B en total, 1B activo— debería tanto leer una imagen, un gráfico, un video o un activo 3D como escribir una nueva imagen o una edición, utilizando un vocabulario visual totalmente discreto de ocho codebooks, de modo que cada posición visual transporte suficiente información para respaldar ambas direcciones. Esa es una afirmación materialmente más grande que la de Qwen2.5 Omni. Una cosa es enrutar cada modalidad de entrada hacia texto y habla; otra muy distinta es hacer que un mismo conjunto de pesos genere píxeles con la misma fluidez con la que razona sobre ellos.

También es, ahora mismo, una afirmación imposible de verificar. El laboratorio publicó código de inferencia, una página de proyecto con una tabla de referencia «preliminar, parcial» y un stub vacío de Hugging Face; los pesos, el código de entrenamiento, el informe técnico y la pila Ascend-NPU están todos marcados como «próximamente». No existe ninguna evaluación independiente porque no hay nada que evaluar. La arquitectura de Qwen2.5 Omni se podía verificar la semana en que se lanzó porque los pesos se lanzaron con ella; la arquitectura de InternLumina-U2 se puede leer hoy y su calidad sigue siendo una promesa del proveedor.

El marcador

Dado que uno de estos modelos tiene diecisiete meses de historia y el otro apenas un día de código, las filas portan su procedencia en lugar de pretender que las columnas son simétricas.

• Edad — Qwen2.5 Omni: lanzado en marzo de 2025, diecisiete meses en el mundo real, cientos de miles de descargas. InternLumina-U2: código de inferencia publicado el 1 de septiembre de 2026, cero descargas, cero ejecuciones independientes.

• Forma — Qwen2.5 Omni: ~7B de extremo a extremo, Thinker-Talker con codificación posicional multimodal alineada en el tiempo. InternLumina-U2: 16B en total / 1B activo, LLM de difusión MoE dispersa con un tokenizador visual discreto de ocho libros de códigos.

• Entrada: ambos aceptan texto e imágenes; Qwen2.5 Omni además acepta audio y vídeo para chat omni; InternLumina-U2 también afirma comprensión de vídeo a partir de 64 fotogramas muestreados y comprensión 3D de vistas GLB/GLTF renderizadas con Blender.

• Salida — Qwen2.5 Omni: texto y voz en streaming, cuatro voces. InternLumina-U2: afirma texto, texto a imagen hasta 1024×1024, y edición de imágenes basada en instrucciones.

• Frontera de generación — Qwen2.5 Omni: genera palabras y voz, no píxeles. InternLumina-U2: intenta la generación y edición de píxeles dentro del mismo modelo de tokens discretos que lee.

• Pesos y licencia: ambos son pesos abiertos bajo Apache-2.0 en principio; los de Qwen2.5 Omni se pueden descargar hoy, los de InternLumina-U2 aún no son públicos.

• Serving — Qwen2.5 Omni: API alojada además de auto-alojamiento (un despliegue pesado de precisión completa); contexto conocido de 32K, sin llamada a funciones. InternLumina-U2: no se puede servir — el controlador publicado espera checkpoints que no existen.

• Cifras principales — Qwen2.5 Omni: desde hace tiempo consolidado en el ranking de OmniBench (una puntuación de alrededor de 0,561 en los rankings actuales); InternLumina-U2: ChartQA 86,52, MathVision 33,22, GenEval 0,81 — todo ello reportado por el proveedor, preliminar y parcial.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

Por qué la brecha generacional es la verdadera historia

Dejando de lado las edades, la diferencia sustancial es la frontera en la que se detiene cada modelo. Qwen2.5 Omni eligió una versión manejable de omni: percibir ampliamente, responder en lenguaje o voz, y dejar la síntesis de imágenes y videos a modelos de generación dedicados en otra parte de la pila. Esa división del trabajo es como se construye esencialmente todo sistema multimodal de producción en 2026, y es por eso que Qwen2.5 Omni pudo lanzarse en 2025 y seguir siendo útil en 2026: hace bien su parte y se compone con el resto. InternLumina-U2 es una apuesta a que la división del trabajo es el problema: que un modelo forzado a representar todo —percepción y generación— en un único vocabulario discreto compartido aprenderá una comprensión más profunda de la visión que un modelo que solo tiene que describirla. Esa apuesta, si da resultado, es el resultado más importante. Si no, InternLumina-U2 termina siendo un Qwen2.5 Omni más lento y más hambriento, con un generador de imágenes acoplado torpemente en los mismos pesos. Todo el concurso —y es un concurso entre un diseño ya lanzado y una hipótesis, no entre dos modelos ejecutables— es si la arquitectura más difícil se justifica a sí misma.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

La tarjeta de Hugging Face de Qwen/Qwen2.5-Omni-7B, capturada el 27 de agosto de 2026: la descripción general de Thinker-Talker, la licencia Apache-2.0 y las etiquetas de modalidad de texto, imagen, audio y video del modelo.

Lo que realmente compra un año y medio de descargas

La madurez no es una vibra; es una lista de cosas que sabes. Con Qwen2.5 Omni sabes que el contexto de 32K es una restricción dura y puedes diseñar en torno a ella. Sabes que no hay una vía de llamada a funciones y no vas a fingir que la hay. Sabes aproximadamente cuánto cuesta un despliegue, tanto a través de una API alojada como en tus propias GPU, porque el modelo ya tiene un precio conocido y ha sido ejecutado por suficientes personas como para que las cifras se hayan asentado. Sabes que la posición en OmniBench es real porque los rankings independientes la han estado rastreando durante más de un año. Con InternLumina-U2 ninguno de esos verbos se aplica: no sabes, no puedes saber, porque no hay artefacto. Cuando un modelo tiene un día de vida y no tiene peso, cada afirmación sobre él es una declaración de intenciones. Esa asimetría no es una crítica a la ciencia; es la postura epistémica correcta para cualquiera que elija sobre qué construir.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

El repositorio de InternLM/InternLumina-U2 en GitHub, capturado el 2 de septiembre de 2026 — la página de inicio del repositorio que hace pública la arquitectura — descripción, licencia y los scripts de inferencia — mientras que los pesos en sí no están presentes en el árbol del repositorio.

La decisión de enrutamiento, planteada con honestidad.

Lo declararemos sin rodeos: OrcaRouter no aloja InternLumina-U2, porque no hay pesos que nadie pueda alojar, y actualmente tampoco ofrecemos Qwen2.5 Omni — funciona a través de la API del propio desarrollador y de plataformas de terceros. Así que la lección de enrutamiento aquí es de postura, no de poder llamar a estos dos mediante una sola clave hoy. El patrón duradero es aquel al que toda decisión entre un modelo consolidado y un recién llegado acaba llegando: mantén el modelo probado en la ruta principal, donde una API para más de 200 modelos y un traspaso con margen del 0 % significan que pagas el precio de lista del proveedor y nada más; apunta al recién llegado no probado hacia una ruta de prueba con conmutación automática por error, de modo que la primera vez que se atasque, se desvíe o devuelva sinsentidos, la llamada recaiga en el modelo con diecisiete meses de trayectoria. Así es como puedes evaluar una arquitectura nueva y ambiciosa como InternLumina-U2 el mismo día en que se publiquen sus pesos — sin arriesgar la ruta de producción de la que ya dependes.

El veredicto

Qwen2.5 Omni es el modelo omni sobre el que puedes construir hoy: entregado, descargable, documentado, con límites conocidos y un precio fijado. InternLumina-U2 es el modelo omni a observar: un auténtico paso arquitectónico más allá de la percepción hacia la creación, Apache-2.0, con su código público y sus pesos pendientes. Si la apuesta multi-codebook del laboratorio se sostiene bajo pruebas independientes, InternLumina-U2 no será tanto un rival de Qwen2.5 Omni como la próxima generación de la misma idea. Si no lo hace, el generalista de diecisiete meses que realmente se lanzó seguirá ahí, haciendo el trabajo que ha hecho todo este tiempo. Vigila el stub de Hugging Face; el veredicto espera en los archivos safetensors, no en este artículo.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube