
Nemotron Sports Tennis vs InternLumina U2: La comparación que ninguno de los dos modelos puede perder
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Pregunta cuál es mejor — NVIDIA NemotronLabs AI for Media - Sports Tennis o InternLumina U2 — y la respuesta honesta es que la pregunta no se resuelve. Los dos repositorios aparecieron en Hugging Face en septiembre de 2026, ambos son modelos multimodales de mezcla de expertos creados por laboratorios bien financiados, y no tienen casi nada más en común. El modelo de NVIDIA es un especialista de 31B que lee un único punto de tenis y responde preguntas sobre él. InternLumina U2, del equipo InternLM de Shanghai AI Laboratory y publicado como internlm/InternLumina-U2, es un modelo unificado de 16B que comprende imágenes, vídeo y 3D y también genera y edita imágenes. No comparten ningún benchmark, ni usuario objetivo, ni perfil de despliegue. Compararlos se parece menos a elegir un teléfono y más a elegir entre un estetoscopio y una impresora 3D.
Lo que de todos modos hace que valga la pena escribir sobre el emparejamiento es un patrón que ambos modelos comparten: ninguno ha sido evaluado de forma independiente, y ambos están siendo descritos por su propio proveedor como algo distinto de terminado. Esa es la verdadera comparación — no cuál modelo gana, sino cuánto de cualquiera de los dos puedes verificar realmente hoy.
Dos trabajos diferentes que llevan la misma palabra
"Multimodal" abarca ambos y no te dice nada. Aquí está la división:
• Qué acepta — Sports Tennis: video (mp4 hasta 2 minutos), audio (wav/mp3), imágenes, texto. InternLumina U2: texto, imágenes, video y 3D. El modelo de tenis es el único de los dos con una material ruta de audio, conectada a través de un codificador de voz Parakeet que lee el sonido de la multitud y de los impactos junto con los fotogramas.
• Qué devuelve — Sports Tennis: solo texto. InternLumina U2: texto y imágenes generadas o editadas, mediante una representación visual totalmente discreta de 8 libros de códigos construida sobre AToken.
• Lo que el usuario pregunta — Tenis deportivo: "qué ocurrió en este punto, dónde estaba parado el jugador, si la pelota cayó dentro". InternLumina U2: "describe este gráfico y luego dibújame una versión nueva de él".
• Arquitectura — Sports Tennis: MoE híbrido Mamba2-Transformer, 31B en total con aproximadamente 3B activos por token, heredando su columna vertebral y codificadores de Nemotron 3 Nano Omni. InternLumina U2: un MoE disperso de 16B con 1B de parámetros activos, construido como un modelo de lenguaje de difusión de múltiples libros de códigos en lugar de uno autorregresivo convencional.
• Contexto — Sports Tennis publica hasta 256k tokens. La ficha de InternLumina U2 no anuncia una cifra de contexto.
• Licencia — Sports Tennis se distribuye bajo OpenMDW-1.1, con la ficha que indica uso comercial y no comercial. InternLumina U2 es Apache 2.0.

Lo que realmente hace que sean incomparables
No hay un marcador compartido, y vale la pena precisar por qué en lugar de dejarlo como un vago encogimiento de hombros.
Sports Tennis, ajustado con fine-tuning sobre un conjunto de datos de tenis propietario de NVIDIA — 1.312.129 ejemplos de preguntas y respuestas en 43.084 clips a nivel de punto de 239 partidos, etiquetados según 38 categorías de anotación, todos recopilados en 2025. Su conjunto de prueba es una partición reservada de 12 partidos, 2.689 clips y 80.872 preguntas. Todos y cada uno de esos artefactos son propiedad de NVIDIA. Ningún grupo externo tiene los datos, así que ningún grupo externo puede reproducir una puntuación —y resulta que NVIDIA no publicó ninguna puntuación que reproducir. La ficha documenta el protocolo de evaluación en detalle y luego no reporta ningún resultado a partir de él. Nada sobre precisión, nada por categoría, nada.
InternLumina U2 se sitúa en el lado opuesto de esa misma pared. Publica números, pero son explícitamente parciales. La tarjeta del modelo lo dice en una línea: "Resultados preliminares y parciales. Las tablas comparativas completas aparecerán en el próximo informe técnico". Lo que existe es una serie de cifras reportadas por el proveedor en capacidades muy diferentes — ChartQA 86.52 y CharXiv-DQ 83.65 en documentos, MathVision 33.22 y DynaMath 56.37 en matemáticas visuales, VideoMME 51.26 y MVBench 59.74 en video, 3D MM-Vet 41.8, DPG-Bench 87.10 y GenEval 0.81 en generación, ImgEdit 3.83 en edición. Y la propia tabla de la página del proyecto muestra que el modelo queda por detrás de al menos un competidor nombrado en al menos una métrica principal: GenEval 0.81 frente al 0.89 de LLaDA2.0-Uni.
Así que un modelo tiene una evaluación documentada y ningún resultado, y el otro tiene resultados y una evaluación explícitamente incompleta. Ninguno te da un número que puedas poner junto al otro. Cualquier página que clasifique a estos dos se ha inventado su clasificación.

Donde realmente se superponen, y lo que eso demuestra
La comprensión de video es el único territorio que ambos reivindican, y aun ahí el solapamiento es más tenue de lo que parece. InternLumina U2 reporta VideoMME 51.26, MLVU 57.03 y MVBench 59.74 —puntuaciones de comprensión general de video, reportadas por el proveedor. Sports Tennis no reporta nada, pero su ficha describe una tarea mucho más estrecha y mucho más profunda: razonamiento a nivel de punto sobre un rally completo con audio, a través de 38 categorías de anotación de grano fino que incluyen mecánica de golpes, posicionamiento en la cancha, movimiento y estado del marcador.
La inferencia razonable es que InternLumina U2 sería el mejor generalista y Sports Tennis el mejor lector de tenis, pero eso es una inferencia a partir de la forma de la tarea, no de los datos. Podría fácilmente estar equivocado en uno u otro sentido. Lo que no es una inferencia es que un benchmark de video general y un benchmark propietario de tenis a nivel de punto no pueden colocarse en el mismo eje, y que un generador unificado de 16B y un especialista de codificador congelado de 31B no fueron construidos para responder la misma pregunta.
Ejecutar cualquiera de los dos es un tipo de proyecto diferente
El despliegue es donde la brecha deja de ser filosófica.
Sports Tennis establece un mínimo absoluto de una GPU con aproximadamente 80 GB de memoria en BF16, con pesos de alrededor de 62 GB, probado en A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor y RTX 5090. No hay ningún checkpoint cuantizado, por lo que el requisito de 80 GB no es negociable a la baja hoy. También es solo en inglés.
El problema más interesante de InternLumina U2 no es la memoria, sino el silicio. El repositorio aloja checkpoints divididos por hardware de entrenamiento: un ascend/ directorio completo con siete fragmentos safetensors entrenados en NPU de Huawei Ascend, y un nvidia/ directorio marcado como "próximamente". Si estás ejecutando hardware NVIDIA —lo cual, para un modelo cuyo hermano es un ajuste fino de tenis de Nemotron, es la mayoría de la gente que lee esto—, el checkpoint que quieres es el que aún no ha llegado. El código de inferencia y las instrucciones de configuración se encuentran en el repositorio de GitHub de InternLM en lugar de en el Hub, y el informe técnico sigue pendiente.
Eso invierte la expectativa habitual. El modelo propietario, sin benchmarks y con formato de appliance es el que puedes descargar y ejecutar ahora mismo desde el primer día. El modelo de investigación abierto Apache-2.0 es el que está esperando una compilación específica para hardware.

Dónde encaja un router — y dónde no
Ninguno de estos modelos está alojado en OrcaRouter, y no hay forma honesta de escribir eludiendo eso. Sports Tennis no tiene ningún endpoint en ninguna parte; NVIDIA publicó los pesos y nada más. El propio repositorio de InternLumina U2 señala que los checkpoints de NVIDIA aún están pendientes, así que tampoco hay nada que servir de nuestro lado. Esta es una decisión de autoalojamiento en ambos casos, no una de enrutamiento.
La cuestión del enrutamiento aparece una capa más arriba. Un equipo que quiere evaluar a un especialista como Sports Tennis frente a un generalista como InternLumina U2 no lo hace de forma aislada: lo hace como un candidato más en un pipeline que también necesita transcripción de voz, gestión de documentos, resumen y la lógica de aplicación que los rodea. Esos componentes están alojados, y son las partes en las que una única clave de API que abarca más de 200 modelos con conmutación automática entre proveedores ahorra una semana de trabajo de integración. Una clave para los modelos que puedes llamar, así que los que tienes que ejecutar tú mismo son lo único que realmente mantienes.
La pregunta abierta
Puestos uno al lado del otro, NVIDIA NemotronLabs AI for Media - Sports Tennis e InternLumina U2 son una ilustración decente de dos maneras de lanzar un modelo multimodal de forma deficiente en público. Uno documentó su evaluación y ocultó los resultados; el otro publicó resultados y etiquetó su evaluación como incompleta. En ambos casos, a fecha de septiembre de 2026, se trata de afirmaciones no falsables.
Lo interesante de observar no es cuál resulta más fuerte —nunca se pondrán a prueba con lo mismo—. Es qué laboratorio cierra su brecha primero. Si NVIDIA publica cifras de tenis, habrá resuelto el problema más difícil, porque un benchmark privativo de reserva de 12 partidos no vistos es la única manera honesta de puntuar un ajuste fino de dominio, y NVIDIA ya construyó la división. Si InternLM distribuye los checkpoints de NVIDIA y el informe técnico, habrá hecho que su modelo Apache-2.0 sea genuinamente utilizable en el hardware que sus usuarios poseen. Pase lo que pase, valdrá la pena releer esta comparación, porque ahora mismo lo más defendible que respalda la tarjeta de cualquiera de los dos modelos es un encogimiento de hombros.
