Una tarjeta principal generada para una comparación entre NVIDIA NemotronLabs AI for Media - Sports Tennis e InternLumina U2, que muestra un ícono de clip de punto de tenis de un lado y una pila de salida de texto más imagen del otro, etiquetada como especialista de 31B con salida solo de texto frente a 16B unificado con salida de texto e imágenes, con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: La comparación que ninguno de los dos modelos puede perder

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pregunta cuál es mejor — NVIDIA NemotronLabs AI for Media - Sports Tennis o InternLumina U2 — y la respuesta honesta es que la pregunta no se resuelve. Los dos repositorios aparecieron en Hugging Face en septiembre de 2026, ambos son modelos multimodales de mezcla de expertos creados por laboratorios bien financiados, y no tienen casi nada más en común. El modelo de NVIDIA es un especialista de 31B que lee un único punto de tenis y responde preguntas sobre él. InternLumina U2, del equipo InternLM de Shanghai AI Laboratory y publicado como internlm/InternLumina-U2, es un modelo unificado de 16B que comprende imágenes, vídeo y 3D y también genera y edita imágenes. No comparten ningún benchmark, ni usuario objetivo, ni perfil de despliegue. Compararlos se parece menos a elegir un teléfono y más a elegir entre un estetoscopio y una impresora 3D.

Lo que de todos modos hace que valga la pena escribir sobre el emparejamiento es un patrón que ambos modelos comparten: ninguno ha sido evaluado de forma independiente, y ambos están siendo descritos por su propio proveedor como algo distinto de terminado. Esa es la verdadera comparación — no cuál modelo gana, sino cuánto de cualquiera de los dos puedes verificar realmente hoy.

Dos trabajos diferentes que llevan la misma palabra

"Multimodal" abarca ambos y no te dice nada. Aquí está la división:

• Qué acepta — Sports Tennis: video (mp4 hasta 2 minutos), audio (wav/mp3), imágenes, texto. InternLumina U2: texto, imágenes, video y 3D. El modelo de tenis es el único de los dos con una material ruta de audio, conectada a través de un codificador de voz Parakeet que lee el sonido de la multitud y de los impactos junto con los fotogramas.

• Qué devuelve — Sports Tennis: solo texto. InternLumina U2: texto y imágenes generadas o editadas, mediante una representación visual totalmente discreta de 8 libros de códigos construida sobre AToken.

• Lo que el usuario pregunta — Tenis deportivo: "qué ocurrió en este punto, dónde estaba parado el jugador, si la pelota cayó dentro". InternLumina U2: "describe este gráfico y luego dibújame una versión nueva de él".

• Arquitectura — Sports Tennis: MoE híbrido Mamba2-Transformer, 31B en total con aproximadamente 3B activos por token, heredando su columna vertebral y codificadores de Nemotron 3 Nano Omni. InternLumina U2: un MoE disperso de 16B con 1B de parámetros activos, construido como un modelo de lenguaje de difusión de múltiples libros de códigos en lugar de uno autorregresivo convencional.

• Contexto — Sports Tennis publica hasta 256k tokens. La ficha de InternLumina U2 no anuncia una cifra de contexto.

• Licencia — Sports Tennis se distribuye bajo OpenMDW-1.1, con la ficha que indica uso comercial y no comercial. InternLumina U2 es Apache 2.0.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

Lo que realmente hace que sean incomparables

No hay un marcador compartido, y vale la pena precisar por qué en lugar de dejarlo como un vago encogimiento de hombros.

Sports Tennis, ajustado con fine-tuning sobre un conjunto de datos de tenis propietario de NVIDIA — 1.312.129 ejemplos de preguntas y respuestas en 43.084 clips a nivel de punto de 239 partidos, etiquetados según 38 categorías de anotación, todos recopilados en 2025. Su conjunto de prueba es una partición reservada de 12 partidos, 2.689 clips y 80.872 preguntas. Todos y cada uno de esos artefactos son propiedad de NVIDIA. Ningún grupo externo tiene los datos, así que ningún grupo externo puede reproducir una puntuación —y resulta que NVIDIA no publicó ninguna puntuación que reproducir. La ficha documenta el protocolo de evaluación en detalle y luego no reporta ningún resultado a partir de él. Nada sobre precisión, nada por categoría, nada.

InternLumina U2 se sitúa en el lado opuesto de esa misma pared. Publica números, pero son explícitamente parciales. La tarjeta del modelo lo dice en una línea: "Resultados preliminares y parciales. Las tablas comparativas completas aparecerán en el próximo informe técnico". Lo que existe es una serie de cifras reportadas por el proveedor en capacidades muy diferentes — ChartQA 86.52 y CharXiv-DQ 83.65 en documentos, MathVision 33.22 y DynaMath 56.37 en matemáticas visuales, VideoMME 51.26 y MVBench 59.74 en video, 3D MM-Vet 41.8, DPG-Bench 87.10 y GenEval 0.81 en generación, ImgEdit 3.83 en edición. Y la propia tabla de la página del proyecto muestra que el modelo queda por detrás de al menos un competidor nombrado en al menos una métrica principal: GenEval 0.81 frente al 0.89 de LLaDA2.0-Uni.

Así que un modelo tiene una evaluación documentada y ningún resultado, y el otro tiene resultados y una evaluación explícitamente incompleta. Ninguno te da un número que puedas poner junto al otro. Cualquier página que clasifique a estos dos se ha inventado su clasificación.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Donde realmente se superponen, y lo que eso demuestra

La comprensión de video es el único territorio que ambos reivindican, y aun ahí el solapamiento es más tenue de lo que parece. InternLumina U2 reporta VideoMME 51.26, MLVU 57.03 y MVBench 59.74 —puntuaciones de comprensión general de video, reportadas por el proveedor. Sports Tennis no reporta nada, pero su ficha describe una tarea mucho más estrecha y mucho más profunda: razonamiento a nivel de punto sobre un rally completo con audio, a través de 38 categorías de anotación de grano fino que incluyen mecánica de golpes, posicionamiento en la cancha, movimiento y estado del marcador.

La inferencia razonable es que InternLumina U2 sería el mejor generalista y Sports Tennis el mejor lector de tenis, pero eso es una inferencia a partir de la forma de la tarea, no de los datos. Podría fácilmente estar equivocado en uno u otro sentido. Lo que no es una inferencia es que un benchmark de video general y un benchmark propietario de tenis a nivel de punto no pueden colocarse en el mismo eje, y que un generador unificado de 16B y un especialista de codificador congelado de 31B no fueron construidos para responder la misma pregunta.

Ejecutar cualquiera de los dos es un tipo de proyecto diferente

El despliegue es donde la brecha deja de ser filosófica.

Sports Tennis establece un mínimo absoluto de una GPU con aproximadamente 80 GB de memoria en BF16, con pesos de alrededor de 62 GB, probado en A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor y RTX 5090. No hay ningún checkpoint cuantizado, por lo que el requisito de 80 GB no es negociable a la baja hoy. También es solo en inglés.

El problema más interesante de InternLumina U2 no es la memoria, sino el silicio. El repositorio aloja checkpoints divididos por hardware de entrenamiento: un ascend/ directorio completo con siete fragmentos safetensors entrenados en NPU de Huawei Ascend, y un nvidia/ directorio marcado como "próximamente". Si estás ejecutando hardware NVIDIA —lo cual, para un modelo cuyo hermano es un ajuste fino de tenis de Nemotron, es la mayoría de la gente que lee esto—, el checkpoint que quieres es el que aún no ha llegado. El código de inferencia y las instrucciones de configuración se encuentran en el repositorio de GitHub de InternLM en lugar de en el Hub, y el informe técnico sigue pendiente.

Eso invierte la expectativa habitual. El modelo propietario, sin benchmarks y con formato de appliance es el que puedes descargar y ejecutar ahora mismo desde el primer día. El modelo de investigación abierto Apache-2.0 es el que está esperando una compilación específica para hardware.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

Dónde encaja un router — y dónde no

Ninguno de estos modelos está alojado en OrcaRouter, y no hay forma honesta de escribir eludiendo eso. Sports Tennis no tiene ningún endpoint en ninguna parte; NVIDIA publicó los pesos y nada más. El propio repositorio de InternLumina U2 señala que los checkpoints de NVIDIA aún están pendientes, así que tampoco hay nada que servir de nuestro lado. Esta es una decisión de autoalojamiento en ambos casos, no una de enrutamiento.

La cuestión del enrutamiento aparece una capa más arriba. Un equipo que quiere evaluar a un especialista como Sports Tennis frente a un generalista como InternLumina U2 no lo hace de forma aislada: lo hace como un candidato más en un pipeline que también necesita transcripción de voz, gestión de documentos, resumen y la lógica de aplicación que los rodea. Esos componentes están alojados, y son las partes en las que una única clave de API que abarca más de 200 modelos con conmutación automática entre proveedores ahorra una semana de trabajo de integración. Una clave para los modelos que puedes llamar, así que los que tienes que ejecutar tú mismo son lo único que realmente mantienes.

La pregunta abierta

Puestos uno al lado del otro, NVIDIA NemotronLabs AI for Media - Sports Tennis e InternLumina U2 son una ilustración decente de dos maneras de lanzar un modelo multimodal de forma deficiente en público. Uno documentó su evaluación y ocultó los resultados; el otro publicó resultados y etiquetó su evaluación como incompleta. En ambos casos, a fecha de septiembre de 2026, se trata de afirmaciones no falsables.

Lo interesante de observar no es cuál resulta más fuerte —nunca se pondrán a prueba con lo mismo—. Es qué laboratorio cierra su brecha primero. Si NVIDIA publica cifras de tenis, habrá resuelto el problema más difícil, porque un benchmark privativo de reserva de 12 partidos no vistos es la única manera honesta de puntuar un ajuste fino de dominio, y NVIDIA ya construyó la división. Si InternLM distribuye los checkpoints de NVIDIA y el informe técnico, habrá hecho que su modelo Apache-2.0 sea genuinamente utilizable en el hardware que sus usuarios poseen. Pase lo que pase, valdrá la pena releer esta comparación, porque ahora mismo lo más defendible que respalda la tarjeta de cualquiera de los dos modelos es un encogimiento de hombros.