
Nemotron Sports Tennis vs Microsoft Mage-VL: Dos formas de leer una transmisión deportiva
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Microsoft Mage-VL tiene una cifra que se puede señalar: en el benchmark de tiempos de respuesta de SoccerNet registra un TimVal de 55,54 y un PR-AUC de 9,30, el mejor en las métricas sensibles a la precisión a pesar de no haber sido entrenado nunca con ese conjunto de datos, y sus autores demuestran que se mantiene en silencio durante una transmisión de la Copa Mundial 2026 hasta los 29,36 segundos, cuando un jugador se abre paso y el modelo lanza comentarios en directo. NVIDIA NemotronLabs AI for Media - Sports Tennis no tiene ninguna cifra en absoluto. Es un modelo multimodal de 31B ajustado con 43.084 clips de puntos de tenis que NVIDIA publicó en septiembre de 2026 con un protocolo de evaluación completo en su ficha y ni un solo resultado de él.
Así que esto no es un cara a cara que puedas puntuar. Aun así, es una comparación realmente útil, porque los dos modelos responden a la misma pregunta —¿puede un modelo de visión-lenguaje seguir deporte en vivo?— con apuestas arquitectónicas opuestas, y una de esas apuestas está respaldada por evidencia mientras que la otra está respaldada por una descripción de datos. Esa asimetría es el artículo.
La bifurcación: un flujo, o un clip
La diferencia de diseño importa más que los recuentos de parámetros, y explica casi todo lo demás sobre estos dos modelos.
Microsoft Mage-VL se construye en torno a video continuo. Su codificador visual, Mage-ViT, se entrena desde cero y lee el video tal como lo hace un códec: divide un flujo en fotogramas ancla (I), que se conservan completos, y fotogramas predichos (P), donde solo se retienen los parches que contienen movimiento real o detalle nuevo, sobre una cuadrícula compartida de parches de 16×16. Eso reduce los tokens visuales en más del 75 % y, según Microsoft, ofrece hasta 3,5 veces más velocidad de inferencia real frente al muestreo uniforme de fotogramas. Sobre eso se asienta una división Sistema 1 / Sistema 2: una compuerta cognitiva ligera puntúa cada ventana deslizante y permanece en silencio ante contenido rutinario, e invoca el modelo completo solo cuando se completa un evento que merece una respuesta. Es un solo modelo haciendo ambas tareas, no un pipeline.
El modelo de tenis de NVIDIA apuesta por algo completamente distinto. Su ficha indica explícitamente que "funciona mejor cuando se le pasa como entrada un clip completo de un punto de tenis": desde el saque hasta el final del peloteo, hasta dos minutos de mp4, con audio. La política de inferencia predeterminada es de 2 fotogramas por segundo hasta 128 fotogramas, 256 tokens nuevos, decodificación greedy, vídeo más audio. No hay compuerta, ni modo de streaming, ni disparador de eventos. Es un modelo de pregunta-respuesta sobre un clip delimitado: le entregas un punto, preguntas qué pasó y te lo dice.
No son dos implementaciones de una misma idea. La percepción en streaming y el razonamiento a nivel de clip son productos distintos. Una emisora que quiera comentarios en directo necesita la forma de Mage-VL. Un analista que quiera consultar un archivo de 43.084 puntos necesita la forma de Sports Tennis. Ninguno de los dos modelos sirve como recambio directo para la función del otro.
Ambos se basan en un backbone híbrido, con una diferencia importante
• Parámetros — Sports Tennis: 31B en total, aproximadamente 3B activos por token, MoE híbrido Mamba2-Transformer. Mage-VL: 4B en total, un Mage-ViT de 316M emparejado con un decodificador Qwen3-4B-Instruct-2507.
• Codificadores — Sports Tennis congela tanto el codificador de visión C-RADIOv4-H como el codificador de voz Parakeet y ajusta únicamente los parámetros del modelo de lenguaje. Mage-VL entrena todo su stack visual desde cero con aproximadamente 100M de imágenes y vídeos sin etiquetar, siendo el modelo de lenguaje Qwen3 el único componente preentrenado.
• Audio — Sports Tennis considera el audio una entrada de primera clase e incluye la interpretación de señales de audio entre sus 38 categorías de anotación. El pipeline publicado de Mage-VL es visual; el trabajo de SoccerNet trata sobre el tiempo de respuesta en fotogramas.
• Modalidad de salida — ambos producen solo texto.
• Efecto multiplicador — como Mage-ViT era más barato de preentrenar que una torre de visión a escala web, Microsoft informa de entrenamiento con vídeos 8× más largos con el mismo presupuesto. La afirmación de eficiencia de NVIDIA es arquitectónica, en cambio: 3B parámetros activos por token de 31B en total.

Dónde reside la evidencia
Esta es la parte de la comparación que no está reñida, y vale la pena decirlo sin rodeos.
Microsoft Mage-VL es un modelo publicado con un informe técnico, una página de proyecto, un repositorio de GitHub y un conjunto de benchmarks que abarca comprensión de imágenes, comprensión de vídeo, anclaje temporal, razonamiento espacial y streaming. Frente a Qwen3-VL-4B —mismo backbone lingüístico de 4B, solo se cambió el codificador de visión—, Mage-VL mejora en todos los benchmarks reportados de vídeo y anclaje temporal, con las mayores ganancias en tareas con mucha localización: +22,5 en Timelens-QVHighlight, +17,1 en ActivityNet, +11,0 en VSI-Bench, +24,5 en VideoEval-Pro. Reporta DocVQA 95,14, MMStar 67,32 y CrossPoint 80,00 en el apartado de imagen, VideoMME 64,0 y LongVideoBench 61,3 en vídeo, y una puntuación global de 64,00 en OVO-Bench entre arquitecturas de streaming. Todos esos son reportados por Microsoft y ninguno ha sido reproducido de forma independiente, pero existen, son numerosos y son internamente consistentes en un conjunto de tareas inusualmente amplio.
Sports Tennis no reporta nada. Su ficha documenta una partición de prueba de 12 partidos totalmente reservados con 2.689 clips a nivel de punto y 80.872 preguntas, describe la evaluación mediante precisión automatizada en preguntas de opción múltiple y LLM-as-judge pass@9, señala que solo se utilizó la división de partidos no vistos para las pruebas reportadas —y luego no publica ningún resultado. Su corpus de entrenamiento es real y específico: 1.312.129 ejemplos de preguntas y respuestas, 1.226.081 de opción múltiple y 86.048 de respuesta abierta, a partir de 43.084 clips en 239 partidos, etiquetados según 38 categorías de anotación de metraje de transmisiones y capturas de pista de 2025. Nada de eso es verificable desde fuera, y faltan los números que lo harían verificable.
Una salvedad apunta en sentido contrario, y conviene señalarla para que esto no se lea como una victoria limpia de Microsoft. SoccerNet no es tenis. Las credenciales de streaming de Mage-VL provienen de datos de transmisión de fútbol bajo un protocolo específico, y su demostración en la Copa Mundial de 2026 es una demostración. No está probado si la compuerta nativa del códec se traslada limpiamente al tenis —donde los puntos son cortos, frecuentes y muy estructurados—. La diferencia es que la afirmación de Mage-VL es al menos refutable por un tercero, y la de Sports Tennis no es refutable por nadie sin el conjunto de datos de NVIDIA.

Lo que se necesita para ejecutarlos
La brecha aquí es de aproximadamente un factor de cinco en hardware, y decide quién puede probar de manera realista cada modelo.
• Sports Tennis — una GPU con unos 80 GB en BF16, con pesos de alrededor de 62 GB. A100 80GB o H100 80GB como mínimo, se recomiendan B200 o H200. No se publica ningún checkpoint cuantizado, así que no hay una ruta económica para reducir. Solo en inglés. Los entornos de ejecución son PyTorch/Transformers más NeMo y Megatron.
• Mage-VL — aproximadamente 10,6 GB en BF16, lo que sitúa una GPU de 16 GB como el mínimo práctico para trabajo con imágenes y 24 GB o más para video largo y streaming. Apache-2.0 para Mage-VL y MIT para Mage-ViT, aunque el repositorio de la familia indica que los modelos se publican únicamente con fines de investigación. Ten en cuenta los puntos críticos: trust_remote_code es obligatorio, todavía no hay una ruta de servicio de vLLM o SGLang, y el pipeline del códec necesita FFmpeg o ffprobe — y la ruta del códec neuronal necesita además DCVC-RT.
Si este mes quieres evaluar un modelo de video deportivo en una sola tarjeta de estación de trabajo, Mage-VL es el único de los dos que realmente puedes cargar. Ese es un veredicto práctico incluso en ausencia de un veredicto de benchmark.

Por cuál te decantarías
Para todo lo que es en vivo —comentarios, detección de eventos en una señal en ejecución, alertas de baja latencia sobre video de transmisión—, Microsoft Mage-VL es la elección defendible hoy: fue diseñado exactamente para eso, tiene el benchmark de streaming para argumentarlo y cabe en el hardware que la mayoría de los equipos ya posee. Para el trabajo con gran carga de archivo y orientado a consultas, específicamente en tenis —crear un índice de puntos que se pueda buscar, ejecutar análisis estructurado en miles de rallies, hacer preguntas en las que todo el clip del punto es la unidad de significado—, el modelo de NVIDIA es el único de los dos que se construyó para eso. Si hace bien el trabajo es, a septiembre de 2026, genuinamente desconocido.
Hay una tercera opción que merece ser mencionada, porque es donde terminan la mayoría de las canalizaciones reales. Si quieres probar el especialista no probado sin apostar por él una ruta de producción, mantenlo detrás de la misma interfaz que los modelos en los que confías. OrcaRouter no incluye ninguno de estos dos —NVIDIA publicó los pesos sin endpoint, y Mage-VL no tiene una ruta de servicio alojado—, así que ambos son decisiones de autoalojamiento. Lo que te ofrece una única clave que cubre más de 200 modelos alojados es el resto de la pila: los modelos de transcripción, resumen y aplicación en torno al componente de vídeo deportivo permanecen detrás de un solo endpoint, con conmutación por error automática si un proveedor se degrada, y los dos modelos especializados que ejecutas tú mismo son las únicas piezas móviles que posees.
El veredicto
Microsoft Mage-VL y NVIDIA NemotronLabs AI for Media - Sports Tennis no son rivales en el sentido que suele tener una página de comparación. Mage-VL es un modelo de streaming de 4B, publicado y evaluado con benchmarks, que se ejecuta en una estación de trabajo y cuenta con una demostración real de comentarios deportivos activados por eventos. Sports Tennis es un especialista de 31B a nivel de clips, no anunciado ni evaluado con benchmarks, que necesita una GPU de centro de datos y no aporta ninguna evidencia publicada de que funcione.
Si se juzga por la evidencia, Mage-VL gana por incomparecencia. Si se juzga por el alcance, no se solapan. Pero hay una razón para seguir de cerca el modelo de NVIDIA: un ajuste fino con codificador congelado sobre 43.084 puntos de tenis anotados correctamente es exactamente el tipo de conjunto de entrenamiento vertical, estrecho y de alta calidad que los modelos generalistas no tienen, y si NVIDIA alguna vez publica los resultados del conjunto reservado, la cuestión especialista frente a generalista en el video deportivo obtiene su primera respuesta real. Hasta entonces, Mage-VL es el modelo con pruebas y Sports Tennis es el modelo con una promesa.
