
Ling-3.0-flash-VL vs InternLumina U2: Ambos lanzados, con silicio diferente
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Ambos modelos son ahora reales, ejecutables y descargables, algo que no era cierto hace dos semanas — y la diferencia entre ellos tiene casi nada que ver con los benchmarks. Ling-3.0-flash-VL, del laboratorio inclusionAI de Ant Group, subió los pesos BF16 y FP8 a Hugging Face entre el 4 y el 8 de septiembre de 2026, publicó recetas de servicio de SGLang y vLLM junto a ellos, y obtuvo una puntuación independiente de 25 en el Artificial Analysis Intelligence Index v4.3. InternLumina U2, del equipo InternLM del Laboratorio de IA de Shanghái, lanzó primero el código de inferencia y luego publicó sus pesos del modelo entrenados con Ascend en Hugging Face el 10 de septiembre — siete fragmentos de safetensors en una ascend/ subcarpeta, completando el repositorio con un total de dieciséis archivos.
La trampa radica en para qué se crearon esos dos lanzamientos de pesos. La ruta publicada de Ling-3.0-flash-VL es la de CUDA que todo el mundo ya tiene: un nodo de ocho aceleradores ejecuta la compilación en FP8, y los stacks de servicio son los que ya ejecutas. El checkpoint publicado de InternLumina U2 es el de Ascend, y el README es explícito en que descargues el checkpoint que coincida con cómo planeas ejecutar la inferencia — con el checkpoint entrenado con NVIDIA que aún figura como próximamente. Dos modelos lanzados en la misma semana, y solo uno de ellos se ejecuta en el hardware que la mayoría de los equipos tiene delante.
Eso reformula la comparación de manera útil. Esto ya no es un artículo sobre algo publicado frente a vaporware, y quien siga describiendo InternLumina U2 como pendiente de pesos se basa en un README de hace una semana. Es un artículo sobre dos diseños visuales unificados muy diferentes que llegaron a dos ecosistemas de silicio distintos, y sobre qué partes de cada lanzamiento están realmente terminadas.
Lo que contiene ahora cada versión
Ling-3.0-flash-VL es un modelo de mezcla dispersa de expertos de 124B de parámetros que activa aproximadamente 5,5B de parámetros por token, sobre un tronco híbrido de 42 capas que alterna Kimi Delta Attention con bloques MLA con compuerta en una proporción de 5:1. Un codificador de visión de resolución arbitraria y un proyector MLP de dos capas alimentan ese tronco, con VideoRoPE encargándose de la posición espacial y temporal. Recibe texto, imágenes y video y devuelve texto. Tanto BF16 (64 fragmentos) como FP8 (aproximadamente 126 GB, la torre de visión se mantiene deliberadamente a mayor precisión que los pesos de los expertos) son públicos bajo la licencia MIT, y el lanzamiento es lo suficientemente completo como para que la comunidad independiente de benchmarks lo puntuara — 25 en el Intelligence Index v4.3, clasificado #2 de 64 en su clase de tamaño frente a una mediana de clase de 8. Lo que no publica es un precio por token para el modelo de visión, y sus ejemplos de API llevan un -rc1, identificador que deja abierto si el checkpoint servido coincide con los pesos abiertos.
InternLumina U2 es un mixture-of-experts disperso de 16B parámetros con aproximadamente 1B de parámetros activos, construido sobre un backbone de modelo de lenguaje de difusión LLaDA-2.0 MoE, que cubre seis familias de tareas en un solo modelo: QA de texto, generación de texto a imagen, comprensión de imágenes, edición de imágenes, comprensión de vídeo y comprensión 3D. El código de inferencia para todo ello es público en main. El checkpoint entrenado en Ascend ya es público en Hugging Face. Aún queda pendiente, según la propia hoja de ruta del repositorio: el checkpoint entrenado en NVIDIA, el código de entrenamiento (un repositorio aparte) y el informe técnico. La hoja de ruta marca cuatro casillas y deja dos abiertas — código de inferencia, pesos de Ascend y el stack de entrenamiento e inferencia de Ascend, hechos; código de entrenamiento e informe técnico, no.
Un detalle práctico se interpone entre esos dos párrafos. Ejecutar las rutas de visión de U2 requiere los pesos del tokenizador AToken en atoken_inference/checkpoints/atoken-sod.pt, y el controlador publicado espera un directorio de checkpoint dividido con los recursos del modelo juntos. El código es real y se instala con Python 3.11, PyTorch 2.6.0 y, en la ruta CUDA, flash-attn 2.7.2. El soporte para Ascend vive en una rama ascend-npu-support aparte y necesita CANN más una compilación compatible de torch_npu en lugar de la cadena de herramientas CUDA. Nada de eso está oculto; todo está documentado. Simplemente es un camino más largo que pip install y una cadena de modelo.
Dos respuestas a la pregunta «¿qué es un token visual?»
Las arquitecturas discrepan en algo más profundo que el número de parámetros, y esa discrepancia es lo más interesante de poner a estas dos lado a lado.
Ling-3.0-flash-VL mantiene el contrato estándar. Una imagen se convierte en una secuencia de tokens mediante el codificador de visión y el proyector; esos tokens entran en un tronco transformer, y todo se ejecuta de forma autorregresiva. La novedad no está en cómo se representa la visión, sino en lo barato que resulta ejecutar el tronco: 5.5B parámetros activos por token de 124B en total, que es la razón entera por la que el modelo aparece en la frontera entre inteligencia y parámetros activos. VideoRoPE da a la posición espacial y temporal una codificación consistente, de modo que el video no necesita maquinaria separada.
InternLumina U2 cambia la representación en sí. Utiliza el tokenizador AToken de Apple, en el que cada posición visual se describe mediante ocho libros de códigos complementarios — textura local, texto incrustado, geometría y detalle de alta frecuencia como flujos separados en lugar de un único vector colapsado. Cada libro de códigos conserva su propia incrustación a la entrada, y las ocho incrustaciones por posición se concatenan y se proyectan a un único token del backbone. A la salida, la predicción es lo que el equipo denomina autorregresiva de profundidad de libro de códigos con paralelismo espacial: el backbone de difusión elimina el ruido de muchas posiciones espaciales enmascaradas a la vez, y luego una cabeza autorregresiva de múltiples libros de códigos predice los ocho códigos para cada posición en orden. La comprensión y la generación funcionan con la misma maquinaria, que es la afirmación real. El argumento del equipo es que un único libro de códigos limita cuánta información puede transportar un token visual, mientras que los híbridos discreto-continuos dividen la comprensión y la generación entre representaciones y rutas de decodificación diferentes, y que pasar a ser totalmente discreto con múltiples libros de códigos es la forma de obtener un modelo genuinamente unificado en lugar de dos pilas ensambladas a la fuerza.
Ambas son posturas coherentes, y conllevan costos opuestos. Las representaciones con múltiples libros de códigos pueden conservar un detalle visual más fino; también multiplican el presupuesto de tokens por imagen por el número de libros de códigos y hacen que la decodificación sea considerablemente más compleja, lo que presumiblemente es parte de por qué se eligió 16B-A1B como escala. La dispersión de Ling consigue una inferencia barata por token; también implica una menor capacidad activa por pasada hacia adelante, que es el compromiso que ilustra discretamente la mediana de su clase, 8, en el índice de inteligencia — Ling-3.0-flash-VL la supera cómodamente con 25, pero no compite con los modelos densos de frontera en razonamiento puro.
Las superficies de la tarea solo se solapan en parte
Clasificar ambos bajo «modelo multimodal» exagera el solapamiento. Saber dónde termina evita muchas comparaciones de compra desafortunadas.
• Entradas — Ling-3.0-flash-VL acepta texto, imágenes y vídeo, hasta 40 imágenes por solicitud, y devuelve texto; InternLumina U2 acepta texto, imágenes, vídeo y recursos 3D, y devuelve texto, imágenes generadas o imágenes editadasbr /> • Generación de imágenes — Ling-3.0-flash-VL no puede generar ni editar imágenes en absoluto; la afirmación central de InternLumina U2 es que hace ambas cosas, hasta 1024×1024, con los mismos pesos que leen imágenesbr /> • 3D — Ling-3.0-flash-VL no tiene una ruta 3D; InternLumina U2 incluye una canalización basada en Blender que renderiza recursos GLB y GLTF en 64 vistas emparejadas de color y profundidad para que el modelo razone sobre ellasbr /> • Vídeo — Ling-3.0-flash-VL maneja vídeo mediante codificación temporal VideoRoPE; InternLumina U2 muestrea 64 fotogramasbr /> • Contexto y salida — Ling-3.0-flash-VL mide una ventana de contexto de 262K tokens frente a los 256K que declara su ficha del modelo, y una salida máxima comparativamente corta; InternLumina U2 no ha publicado ninguna de las dos cifrasbr /> • Parámetros activos — Ling-3.0-flash-VL activa aproximadamente 5.5B por token; InternLumina U2 activa alrededor de 1B, que es una quinta parte de esa cifra
Lee esa lista y la conclusión es que estos dos son sustitutos para exactamente una tarea —leer una imagen y responder preguntas sobre ella— y complementos en casi todos los demás casos. Si necesitas un modelo que genere o edite una imagen, Ling-3.0-flash-VL no es un candidato y ningún benchmark cambia eso. Si necesitas un modelo que lea un gráfico, genere una variante y razone sobre un activo 3D, InternLumina U2 está orientado a eso y Ling-3.0-flash-VL no lo aborda.

Puntos de referencia: una puntuación independiente frente a una página de cifras de proveedores
La calidad de la evidencia no es ni de lejos equiparable, y vale la pena ser precisos sobre por qué en lugar de declarar un ganador.
El 25 de Ling-3.0-flash-VL en el Intelligence Index v4.3 es una ejecución de terceros sobre un protocolo publicado, con la mediana de su clase en 8 como contexto, además de un rendimiento medido de 142,9 tokens de salida por segundo frente a una mediana de 105,1 entre pares y un tiempo hasta el primer token de 2,21 segundos. Su ficha de proveedor afirma por separado 42 en el retirado v4.1.1 protocolo, que es una escala distinta y no puede ponerse junto al 25 como si el modelo hubiera bajado de rendimiento; el índice se reformuló en septiembre de 2026 y se volvió a puntuar en todos los casos. El proveedor también informa de una victoria de 1.441 frente a 1.440 en Image-to-WebDev Arena sobre GPT-5.4 bajo el seudónimo "linthium" —un margen de un punto dentro del ruido de Elo, y reportado por el proveedor.
Los números de InternLumina U2 son del propio laboratorio, etiquetados como preliminares y parciales, y las tablas comparativas completas y el informe técnico aún están pendientes. Ahora se encuentran en una tabla del README del repositorio en lugar de en una tabla de clasificación de referencia, y aún no pueden verificarse de forma independiente porque ningún tercero ha publicado una ejecución. Tal como los presenta el laboratorio:
• Comprensión — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • Vídeo — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • Generación y edición — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • Procedencia — cada cifra de InternLumina U2 es proporcionada por el proveedor y es preliminar; cada cifra de Ling-3.0-flash-VL es proporcionada por el proveedor excepto el Intelligence Index, que es según Artificial Analysis
Dos de esos merecen una señal de alerta. El 0,81 de GenEval queda por debajo del 0,89 de un competidor nombrado según la propia tabla del laboratorio —un caso poco frecuente de un proveedor que publica una derrota, y una razón para confiar un poco más en el resto de la hoja. Y un ImgEdit de 3,83 no significa nada sin la tabla que lo acompaña, que es parte de lo que incluirá el informe técnico pendiente. Trata la lista de InternLumina U2 como resultados que el laboratorio tiene intención de defender, no como resultados sobre los que puedas actuar. Ten en cuenta también que sus puntuaciones de comprensión y la puntuación del índice de Ling-3.0-flash-VL no son cantidades comparables: una es un conjunto de cifras de proveedor específicas de cada tarea, la otra es un índice compuesto de terceros.

Licencia, hardware y cuánto cuesta realmente apostar por cada uno
Ling-3.0-flash-VL tiene licencia MIT en ambos formatos de precisión, lo que es prácticamente lo más limpio que se puede encontrar en pesos abiertos: sin cláusulas adicionales, sin restricciones de campo de uso, sin ambigüedad respecto al despliegue comercial. La versión FP8, de aproximadamente 126 GB, cabe dentro de un nodo de ocho aceleradores de clase 80 GB; BF16 es aproximadamente el doble. El soporte de servicio ya existe en SGLang y en una bifurcación de vLLM mantenida por Ant. El riesgo residual es comercial más que legal: Ant no publica ninguna tarifa por token para el modelo de visión, el acceso gratuito en Ling Studio es promocional más que una tarifa, y Artificial Analysis lo lista a $0.00 por 1M tokens de entrada y salida solo porque el endpoint que puede ver es el gratuito.
InternLumina U2 es Apache-2.0 en el repositorio principal, con dos salvedades que vale la pena leer: el directorio incluido VeOmni/ conserva su licencia Apache-2.0 original, y atoken_inference/ deriva de ml-atoken de Apple y se redistribuye bajo los términos originales de Apple. La afirmación sobre la infraestructura es seria —apunta tanto a las GPU de NVIDIA como a las NPU Ascend de Huawei, con alineación numérica a nivel de operador entre los backends, y el equipo informa de entrenamiento de extremo a extremo en un clúster Ascend de mil tarjetas con una mejora de eficiencia de entrenamiento de 1,85× gracias a operadores fusionados, particionado HSDP ajustado y checkpointing de gradientes. Eso es ingeniería real. También es ortogonal a si el modelo es bueno o no: la eficiencia de entrenamiento en Ascend no dice nada sobre la calidad de salida, y el checkpoint que existe hoy es el dirigido a ese stack.
Así que la asimetría práctica no es abierto frente a cerrado. Ambos son abiertos, ambos tienen licencias permisivas y ambos se pueden descargar hoy. Es que una versión asume el hardware que probablemente tienes y la otra asume el hardware que probablemente no tienes. Si tu flota es NVIDIA, Ling-3.0-flash-VL es trabajo de una tarde e InternLumina U2 es una espera. Si tu flota es Ascend —que es cada vez más común en el mercado chino para el que se creó este modelo—, esa ecuación se invierte por completo, e InternLumina U2 es la que tiene un camino terminado, mientras que las recetas de Ling-3.0-flash-VL asumen CUDA.
Preguntas que la gente realmente hace sobre esta combinación
¿Ya se pueden descargar los pesos de InternLumina U2?
Sí, el checkpoint entrenado con Ascend consta de — siete fragmentos de safetensors publicados bajo ascend/ en Hugging Face, junto con los archivos de configuración, tokenizador y modelado. El checkpoint entrenado con NVIDIA es una subcarpeta aparte y sigue figurando como «próximamente», y el código de entrenamiento y el informe técnico siguen pendientes.
¿Ling-3.0-flash-VL es estrictamente mejor porque tiene una puntuación independiente?
No — está mejor respaldado por evidencia y es más fácil de ejecutar en hardware común, lo cual es una afirmación distinta. Ling-3.0-flash-VL no puede generar ni editar imágenes, no puede procesar activos 3D y no tiene un precio publicado. Si tu tarea es la generación de imágenes, la edición de imágenes o la comprensión 3D, InternLumina U2 lo aborda y Ling-3.0-flash-VL no lo aborda en absoluto, por muchos benchmarks que tenga el modelo Ling.
¿El 42 de la tarjeta del modelo de Ling-3.0-flash-VL contradice el 25 de Artificial Analysis?
No directamente. El 42 se midió con el protocolo Intelligence Index v4.1.1 y el 25 con el v4.3; el índice se reformuló en septiembre de 2026 y se volvió a puntuar en todos los casos, y las dos versiones se construyen a partir de conjuntos de evaluación diferentes. Lo que puede decirse es que el 42 nunca se ha reproducido de forma independiente y el 25 se ha producido de forma independiente.
Donde se puede llamar a cualquiera de estos
Ni Ling-3.0-flash-VL ni InternLumina U2 están en nuestro catálogo de modelos, y afirmar lo contrario sería una afirmación que un lector podría comprobar en diez segundos. Se puede acceder a Ling-3.0-flash-VL a través de la propia plataforma de Ant, que publica un endpoint compatible con OpenAI y otro compatible con Anthropic, mediante acceso de prueba gratuito en Ling Studio, y mediante los pesos abiertos si los sirves tú mismo. Se puede acceder a InternLumina U2 mediante el checkpoint de Hugging Face y el controlador de inferencia del repositorio, en el hardware al que apunta ese checkpoint.
La ruta What we do es el modelo de visión con el que este emparejamiento se compara más a menudo en la práctica: DeepSeek V4 Flash Vision Exp, activo en el catálogo con una ventana de contexto de 1M de tokens y una tarifa publicada, en el mismo endpoint compatible con OpenAI que el resto del catálogo. Cuando un laboratorio publica pesos abiertos, una capa de enrutamiento normalmente puede ofrecer el modelo sin esperar a que se estabilice el servicio alojado del propio laboratorio, lo cual es la diferencia práctica entre que un modelo se pueda cotizar y que se pueda invocar. Esa diferencia está activa para Ling-3.0-flash-VL y, por el momento, es académica para InternLumina U2, cuyo relato de lanzamiento es una ruta de hardware más que una cuestión de alojamiento.

El veredicto está genuinamente dividido, y se divide por hardware y tarea, no por calidad. Ling-3.0-flash-VL es el lanzamiento completo: MIT, ambos formatos de precisión, evaluado por terceros, con CUDA como prioridad y limitado a la comprensión. InternLumina U2 es el diseño más ambicioso y el lanzamiento menos terminado: el checkpoint de una pila de hardware publicado, una superficie unificada de seis tareas que incluye generación y 3D, y un informe técnico aún pendiente. Si necesitas un modelo de visión en hardware NVIDIA esta semana, la elección se hace sola. Si el diseño multi-codebook de InternLumina U2 es lo que te interesa, lo que hay que observar es el checkpoint de NVIDIA — y la postura honesta hasta entonces es que su tabla de benchmarks, incluida la fila que pierde, describe un modelo cuya segunda mitad aún no se ha lanzado.
