Una tarjeta principal generada titulada 'Qwen3.8-Omni-Flash vs InternLumina U2' bajo el antetítulo 'Sentidos alquilados vs pesos propios', con el subtítulo 'Una API cerrada de medios largos frente a un modelo de difusión de 16B que puedes descargar.' y cuatro chips: 'Pesos: cerrados vs Apache 2.0', 'Genera imágenes: solo un lado', 'Contexto: 1M vs no divulgado', 'Enrutables aquí: ninguno de los dos'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2: Sentidos alquilados vs pesos propios

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La forma útil de comparar Qwen3.8-Omni-Flash y InternLumina U2 no es por fila de benchmark, porque no aparecen en las mismas. Es preguntar quién tiene permiso para ejecutarlos. El Qwen3.8-Omni-Flash del proveedor, abierto a clientes de API desde el 18 de septiembre de 2026, es un modelo cerrado en las plataformas propias del proveedor: un millón de tokens de contexto, hasta una hora de audio y video continuos por llamada, salida solo de texto y sin pesos. El InternLumina U2 de Shanghai AI Laboratory es un modelo de difusión de mezcla de expertos 16B-A1B bajo Apache 2.0 cuyos checkpoints para Ascend se pueden descargar de Hugging Face ahora mismo, mientras que los checkpoints para NVIDIA y el informe técnico siguen listados como próximos. Uno es un servicio que se alquila por token. El otro es un archivo que puedes tener, con la salvedad de en qué hardware se ejecuta actualmente. Esa diferencia decide más despliegues reales que cualquier puntuación en la tabla de cualquiera de los dos proveedores.

Qué es realmente InternLumina U2

La arquitectura es la parte interesante y es genuinamente inusual. InternLumina U2 es un MoE disperso con 16.000 millones de parámetros totales y 1.000 millones activos, y es un modelo de lenguaje de difusión en lugar de uno autorregresivo — refina una secuencia completa en paralelo en lugar de emitir tokens de izquierda a derecha. Su representación visual es completamente discreta: ocho libros de códigos de tokens visuales construidos sobre AToken de Apple, lo que permite que un solo modelo tanto lea una imagen como produzca una sin un decodificador separado añadido al final. Respuesta a preguntas de texto, generación de texto a imagen, comprensión de imágenes, edición de imágenes, comprensión de video y comprensión 3D son todas el mismo modelo haciendo el mismo tipo de trabajo sobre el mismo vocabulario.

• Tamaño y forma — InternLumina U2 tiene 16B en total, 1B activos, MoE disperso; la cantidad de parámetros de Qwen3.8-Omni-Flash no se ha divulgado.

• Generación — InternLumina U2 genera y edita imágenes y realiza comprensión 3D; Qwen3.8-Omni-Flash no genera ningún tipo de contenido multimedia y devuelve texto.

• Decodificación — InternLumina U2 es un LLM de difusión que decodifica en paralelo; Qwen3.8-Omni-Flash es autorregresivo.

Contexto y duración — Qwen3.8-Omni-Flash cuenta con una ventana de 1M de tokens y hasta una hora de audio y vídeo continuos en una sola llamada; los materiales publicados de InternLumina U2 no describen nada de eso, y el audio de formato largo no figura entre sus capacidades enumeradas.

• Pesos — InternLumina U2 es Apache 2.0 con checkpoints de Ascend publicados y checkpoints de NVIDIA pendientes; Qwen3.8-Omni-Flash no tiene pesos ni ningún plan anunciado para tenerlos.

• Cómo obtenerlo — InternLumina U2 es una descarga de Hugging Face con código de inferencia en GitHub; Qwen3.8-Omni-Flash es una llamada a la API a Alibaba Cloud Model Studio o a la plataforma Qianwen.

• Puntuaciones independientes: ninguna para ninguno de los dos. La propia ficha de InternLumina U2 etiqueta su tabla de benchmarks como "resultados preliminares y parciales"; las de Qwen son todas frente a su propio predecesor y sin reproducir.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

La cuestión de los pesos ha avanzado desde la cobertura de la vista previa.

Si leíste nuestro análisis anterior de InternLumina U2 cuando el código apareció por primera vez, la situación ha cambiado en una dirección y se ha mantenido igual en otra, y ambas mitades importan. El repositorio de Hugging Face ya no es un stub: la ascend/ carpeta ahora contiene siete fragmentos de safetensors además de la configuración, el tokenizador y el código de modelado, lo que significa que el modelo es genuinamente descargable y ejecutable por cualquiera que tenga el hardware adecuado. La nvidia/ carpeta todavía está marcada como próximamente, el informe técnico sigue pendiente y la propia sección de benchmarks del repositorio todavía dice "resultados preliminares, parciales". Así que la afirmación precisa hoy no es "los pesos están disponibles" ni "los pesos faltan" — es que los checkpoints de una pila de hardware están publicados y los de la otra no, lo cual es una restricción real para cualquiera cuyo clúster sea NVIDIA.

Otras dos cosas se han movido silenciosamente. El repositorio de GitHub ha seguido recibiendo commits mucho después del lanzamiento inicial del 1 de septiembre, por lo que el código publicado se mantiene en lugar de quedar abandonado. Y el contador de descargas del repositorio de Hugging Face sigue marcando cero, lo que dice menos sobre el modelo que sobre el público: un modelo de difusión 16B-A1B con checkpoints orientados primero a Ascend está pensado para un laboratorio, no para un equipo de producto que busca un endpoint alojado este trimestre.

Donde los dos se superponen realmente, y donde no

La comprensión de imágenes es la intersección, y es más estrecha de lo que parece. Ambos modelos pueden mirar una imagen y responder preguntas sobre ella, lo que constituye todo el trabajo de Qwen3.8-Omni-Flashy una de las seis tareas de InternLumina U2. Todo lo que va más allá diverge por completo. InternLumina U2 puede entonces editar esa imagen o generar una nueva a partir de una indicación, en el mismo modelo, usando el mismo vocabulario visual que empleó para leerla. Qwen3.8-Omni-Flash no puede producir un solo píxel, pero aceptará una hora de audio y video en una sola llamada y te dirá quién habló, cuándo y qué se decidió, algo que los materiales publicados de InternLumina U2 no afirman hacer en absoluto.

El solapamiento que importa menos de lo que la gente supone es el vídeo. A ambos se los describe como que manejan vídeo, pero hacen cosas diferentes con él: uno entiende una grabación larga como un documento, el otro maneja el vídeo como una modalidad visual junto con 3D. Un equipo que necesita que se resuma una hora de metraje no queda cubierto por el segundo, y un equipo que necesita que se genere un fotograma no queda cubierto por el primero.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Costo, control y lo que realmente estás comprando

La comparación de precios no es del mismo tipo. Qwen3.8-Omni-Flash cobra por token —0,15 USD por millón de entrada, 0,016 USD en caché, 0,47 USD de salida en la lista internacional, con una lista de precios separada para China continental que no es comparable— y su titular de lanzamiento fue una reducción superior al 98 % reportada por el proveedor en el costo de una hora de entrada de audio, calculada valorando una muestra de dos minutos y multiplicándola por treinta, con video muestreado a 720p y un fotograma por segundo. InternLumina U2 no cobra nada, porque no hay nada que cobrar: el costo es tu hardware y tu tiempo, y la propia ficha del modelo no publica una cifra de rendimiento que te permita convertir eso en un número por token.

Ese es el equilibrio en una sola línea. La API te ofrece capacidad que no puedes alojar y un coste por hora que escala con el uso; los pesos abiertos te ofrecen un coste fijo y control total sobre la ruta de datos, a cambio de una pila de inferencia que tienes que construir y un conjunto de checkpoints que actualmente implica hardware Ascend. Para cargas de trabajo reguladas en las que el contenido multimedia no puede salir del edificio, la segunda no es una preferencia: es la única opción en esta página. Para un equipo que necesita análisis de audio de larga duración este mes, la primera es la única opción en esta página.

OrcaRouter no aloja ninguno de los dos modelos hoy, y preferimos decirlo con claridad antes que insinuar una ruta de enrutamiento que no existe: Qwen3.8-Omni-Flash solo se ejecuta en las plataformas propias de Alibaba, y InternLumina U2 es una descarga, no un endpoint. Lo que sí ejecutamos es el resto de la línea Qwen3.8 — Qwen3.8-Flash y Qwen3.8-Max — a través de una sola API al precio de lista del proveedor con 0% de margen, que es la forma práctica de mantener una base funcional para el lado de los modelos cerrados de esta comparación mientras el lado de pesos abiertos todavía está poniendo en orden sus checkpoints de NVIDIA.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Cuál deberías elegir en realidad

Elige InternLumina U2 si necesitas un modelo que lea, genere y edite imágenes y estás dispuesto a encargarte de la pila de inferencia — y si tus aceleradores son Ascend, o puedes esperar a los checkpoints de NVIDIA. Es el único modelo de los dos que puede crear una imagen, y el único que puedes ejecutar sin enviar datos a un proveedor. Considera que sus cifras de benchmark no están probadas hasta que se publique el informe técnico, porque la ficha del modelo dice exactamente eso.

Elige Qwen3.8-Omni-Flash si tu problema son horas de audio y vídeo en lugar de píxeles de salida —inteligencia de reuniones, análisis de grabaciones largas, trabajo agéntico con mucho audio en chino e inglés— y si puedes aceptar una dependencia de una sola fuente y una salida solo de texto. Su relación costo-beneficio es sólida en horas de audio de entrada y mucho más débil en la factura total, sus benchmarks son reportados por el proveedor y no replicados, y las primeras ejecuciones de terceros que aparezcan lo sitúan en el percentil 28 en razonamiento, sobre una muestra lo bastante pequeña como para que debiera motivar una prueba en lugar de una decisión.

Si necesitas ambos, son complementos, no alternativas: un modelo de imagen de pesos abiertos que alojas tú y un modelo cerrado de medios largos al que llamas. Hoy en día ninguno de los dos puede enrutarse a través de nosotros. Lo que hay que vigilar por un lado es el checkpoint de NVIDIA y el informe técnico; por el otro, la primera evaluación independiente, que aún no existe y que es, con diferencia, el mayor vacío en todo lo que se ha escrito sobre Qwen3.8-Omni-Flash hasta la fecha.