
Nemotron Sports Tennis vs Microsoft Mage-VL: Duas formas de ler uma transmissão esportiva
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O Microsoft Mage-VL tem um número que você pode apontar: no benchmark de tempo de resposta do SoccerNet, ele registra um TimVal de 55,54 e um PR-AUC de 9,30, os melhores valores nas métricas sensíveis à precisão, apesar de nunca ter sido treinado nesse conjunto de dados, e seus autores demonstram que ele assiste a uma transmissão da Copa do Mundo de 2026 do início ao fim, permanecendo em silêncio até os 29,36 segundos, quando um jogador faz uma arrancada e o modelo dispara comentários ao vivo. O NVIDIA NemotronLabs AI for Media - Sports Tennis não tem nenhum número. É um modelo multimodal de 31B ajustado com 43.084 clipes de pontos de tênis que a NVIDIA publicou em setembro de 2026 com um protocolo de avaliação completo em seu card e nem um único resultado dele.
Então, isto não é um confronto direto que se possa pontuar. Ainda assim, é uma comparação genuinamente útil, porque os dois modelos respondem à mesma pergunta — pode um modelo de visão e linguagem acompanhar esporte ao vivo — com apostas arquitetônicas opostas, e uma dessas apostas é respaldada por evidências, enquanto a outra é respaldada por uma descrição de dados. Essa assimetria é o artigo.
A bifurcação: um fluxo ou um clipe
A diferença de design importa mais do que as contagens de parâmetros, e explica quase todo o resto sobre esses dois modelos.
O Microsoft Mage-VL é construído em torno de vídeo contínuo. Seu codificador visual, o Mage-ViT, é treinado do zero e lê vídeo como um codec faz: divide um fluxo em quadros âncora (I), mantidos integralmente, e quadros previstos (P), nos quais apenas os patches que carregam movimento real ou novos detalhes são retidos, em uma grade compartilhada de patches 16×16. Isso reduz os tokens visuais em mais de 75% e, segundo a Microsoft, proporciona até 3,5× de speedup de inferência em tempo de relógio em comparação com a amostragem uniforme de quadros. Sobre isso, há uma divisão Sistema 1 / Sistema 2: um gate de cognição leve pontua cada janela deslizante e permanece silencioso em conteúdo rotineiro, invocando o modelo completo apenas quando um evento digno de resposta se completa. É um único modelo fazendo as duas tarefas, não um pipeline.
O modelo de tênis da NVIDIA faz uma aposta totalmente diferente. A ficha do modelo deixa explícito que ele “funciona melhor quando um clipe completo de um ponto de tênis é passado como entrada” — do saque até o fim do rali, até dois minutos de mp4, com áudio. A política de inferência padrão é 2 quadros por segundo, até 128 quadros, 256 novos tokens, decodificação gulosa, vídeo mais áudio. Não há gate, nem modo de streaming, nem gatilho de evento. É um modelo de perguntas e respostas sobre um clipe delimitado: você entrega um ponto, pergunta o que aconteceu e ele responde.
Não se trata de duas implementações de uma mesma ideia. Percepção em streaming e raciocínio em nível de clipe são produtos diferentes. Uma emissora que quer comentário ao vivo precisa do formato do Mage-VL. Um analista que quer consultar um arquivo de 43.084 pontos precisa do formato do Sports Tennis. Nenhum dos modelos é um substituto direto para o trabalho do outro.
Ambos são construídos sobre um backbone híbrido — com uma diferença importante
• Parâmetros — Sports Tennis: 31B no total, aproximadamente 3B ativos por token, MoE híbrido Mamba2-Transformer. Mage-VL: 4B no total, um Mage-ViT de 316M emparelhado com um decodificador Qwen3-4B-Instruct-2507.
• Codificadores — Sports Tennis congela tanto o codificador de visão C-RADIOv4-H quanto o codificador de fala Parakeet e faz ajuste fino apenas nos parâmetros do modelo de linguagem. Mage-VL treina toda a sua pilha visual do zero em cerca de 100 milhões de imagens e vídeos não rotulados, com o modelo de linguagem Qwen3 como o único componente pré-treinado.
• Áudio — O Sports Tennis trata o áudio como uma entrada de primeira classe e inclui a interpretação de sinais sonoros entre suas 38 categorias de anotação. O pipeline publicado do Mage-VL é visual; o trabalho do SoccerNet trata do tempo de resposta em quadros.
• Modalidade de saída — ambos produzem apenas texto.
• Efeito multiplicador — como o Mage-ViT era mais barato de pré-treinar do que uma torre de visão em escala web, a Microsoft relata treinar em vídeos 8× mais longos com o mesmo orçamento. A alegação de eficiência da NVIDIA é arquitetural: 3B de parâmetros ativos por token de um total de 31B.

Onde estão as evidências
Esta é a parte da comparação que não é nem de perto equilibrada, e vale a pena dizer isso sem rodeios.
O Microsoft Mage-VL é um modelo publicado, com um relatório técnico, uma página de projeto, um repositório no GitHub e um conjunto de benchmarks que abrange compreensão de imagens, compreensão de vídeo, ancoragem temporal, raciocínio espacial e streaming. Em comparação com o Qwen3-VL-4B — mesmo backbone de linguagem de 4B, apenas com o codificador de visão substituído —, o Mage-VL melhora em todos os benchmarks de vídeo e de ancoragem temporal reportados, com os maiores ganhos em tarefas fortemente focadas em localização: +22,5 no Timelens-QVHighlight, +17,1 no ActivityNet, +11,0 no VSI-Bench, +24,5 no VideoEval-Pro. Ele reporta DocVQA 95,14, MMStar 67,32 e CrossPoint 80,00 no lado de imagem, VideoMME 64,0 e LongVideoBench 61,3 em vídeo, e uma pontuação geral de 64,00 no OVO-Bench entre arquiteturas de streaming. Todos esses números são reportados pela Microsoft e nenhum foi reproduzido de forma independente — mas eles existem, são numerosos e são internamente consistentes em um conjunto incomumente amplo de tarefas.
O Sports Tennis não relata nada. Sua ficha documenta uma partição de teste de 12 partidas totalmente reservadas, com 2.689 clipes em nível de ponto e 80.872 perguntas, descreve a pontuação por acurácia automatizada de múltipla escolha e pass@9 com LLM como juiz, observa que apenas a divisão de partidas não vistas foi usada para os testes relatados — e então não publica nenhum resultado. Seu corpus de treinamento é real e específico: 1.312.129 exemplos de perguntas e respostas, 1.226.081 de múltipla escolha e 86.048 abertas, de 43.084 clipes em 239 partidas, rotulados segundo 38 categorias de anotação de filmagens de transmissão e de captura de quadra de 2025. Nada disso é verificável de fora, e os números que o tornariam verificável estão ausentes.
Uma ressalva pesa no sentido oposto, e vale a pena nomeá-la para que isto não seja lido como uma vitória limpa da Microsoft. O SoccerNet não é tênis. As credenciais de streaming do Mage-VL vêm de dados de transmissão de futebol sob um protocolo específico, e sua demonstração na Copa do Mundo de 2026 é uma demonstração. Não foi testado se o gate nativo de codec se transfere de forma limpa para o tênis — onde os pontos são curtos, frequentes e fortemente estruturados. A diferença é que a alegação do Mage-VL é ao menos falsificável por terceiros, e a do Sports Tennis não é falsificável por ninguém sem o conjunto de dados da NVIDIA.

O que é preciso para executá-los
A diferença aqui é de aproximadamente um fator de cinco no hardware, e isso determina quem pode, de forma realista, testar cada modelo.
• Sports Tennis — uma GPU com cerca de 80 GB em BF16, pesos em torno de 62 GB. A100 80GB ou H100 80GB no mínimo, B200 ou H200 recomendado. Nenhum checkpoint quantizado é publicado, então não há caminho barato para baixo. Apenas em inglês. Os ambientes de execução são PyTorch/Transformers mais NeMo e Megatron.
• Mage-VL — cerca de 10,6 GB em BF16, o que coloca uma GPU de 16 GB como o mínimo prático para trabalho com imagens e 24 GB ou mais para vídeos longos e streaming. Apache-2.0 para o Mage-VL e MIT para o Mage-ViT, embora o repositório da família declare que os modelos são disponibilizados apenas para fins de pesquisa. Atenção aos pontos críticos: trust_remote_code é obrigatório, ainda não há caminho de serving com vLLM ou SGLang, e o pipeline de codec precisa de FFmpeg ou ffprobe — com o caminho de codec neural precisando adicionalmente do DCVC-RT.
Se você quiser avaliar um modelo de vídeo esportivo este mês em uma única placa de estação de trabalho, o Mage-VL é o único dos dois que você consegue realmente carregar. Isso é um veredito prático mesmo na ausência de um veredito de benchmark.

Qual deles você escolheria
Para tudo o que é ao vivo — comentários, detecção de eventos em um feed em execução, alertas de baixa latência em vídeo de transmissão —, o Microsoft Mage-VL é a escolha defensável hoje: foi projetado exatamente para isso, tem o benchmark de streaming que o sustenta e cabe no hardware que a maioria das equipes já possui. Para trabalho com muitos arquivos e em formato de consulta, especificamente no tênis — criar um índice pesquisável de pontos, executar análise estruturada em milhares de rallies, fazer perguntas em que o clipe do ponto inteiro é a unidade de significado —, o modelo da NVIDIA é o único dos dois que foi criado para isso. Se ele desempenha bem a tarefa é, em setembro de 2026, genuinamente desconhecido.
Há uma terceira opção que vale a pena mencionar, porque é onde a maioria dos pipelines reais acaba. Se quiser experimentar o especialista não comprovado sem apostar um caminho de produção nele, mantenha-o atrás da mesma interface dos modelos em que confia. A OrcaRouter não oferece nenhum destes — a NVIDIA publicou pesos sem endpoint, e o Mage-VL não tem caminho de serviço hospedado —, portanto ambos são decisões de auto-hospedagem. O que uma única chave que cobre mais de 200 modelos hospedados lhe proporciona é o resto da pilha: os modelos de transcrição, resumo e aplicação em torno do componente de vídeo esportivo permanecem atrás de um único endpoint, com failover automático se um fornecedor degradar, e os dois modelos especialistas que você mesmo executa são as únicas peças móveis que você possui.
O veredito
Microsoft Mage-VL e NVIDIA NemotronLabs AI for Media - Sports Tennis não são rivais no sentido que uma página de comparativos costuma dar a essa palavra. O Mage-VL é um modelo de streaming de 4B, publicado e avaliado por benchmarks, que roda em uma estação de trabalho e tem uma demonstração real de comentário esportivo acionado por eventos. O Sports Tennis é um especialista em nível de clipe, de 31B, não anunciado e sem benchmarks, que exige uma GPU de datacenter e não traz nenhuma evidência publicada de que funcione.
Julgue pelas evidências e Mage-VL vence por W.O. Julgue pelo escopo e eles não se sobrepõem. Mas há um motivo para continuar acompanhando o modelo da NVIDIA: um fine-tune com encoder congelado sobre 43.084 pontos de tênis corretamente anotados é exatamente o tipo de conjunto de treinamento vertical, restrito e de alta qualidade que os modelos generalistas não têm, e se a NVIDIA algum dia publicar os resultados do conjunto de teste reservado, a questão especialista versus generalista em vídeo esportivo ganha sua primeira resposta real. Até lá, Mage-VL é o modelo com provas e Sports Tennis é o modelo com uma promessa.
