Um cartão hero gerado comparando NVIDIA NemotronLabs AI for Media - Sports Tennis e Microsoft Mage-VL, mostrando um clipe delimitado de um ponto de tênis de um lado e uma tira de filme contínua com um marcador de evento destacado do outro, com três chips de contraste dizendo clipe vs stream, sem pontuações publicadas vs pontuações do SoccerNet, e um piso de 80 GB vs um piso de 16 GB, e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL: Duas formas de ler uma transmissão esportiva

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Microsoft Mage-VL tem um número que você pode apontar: no benchmark de tempo de resposta do SoccerNet, ele registra um TimVal de 55,54 e um PR-AUC de 9,30, os melhores valores nas métricas sensíveis à precisão, apesar de nunca ter sido treinado nesse conjunto de dados, e seus autores demonstram que ele assiste a uma transmissão da Copa do Mundo de 2026 do início ao fim, permanecendo em silêncio até os 29,36 segundos, quando um jogador faz uma arrancada e o modelo dispara comentários ao vivo. O NVIDIA NemotronLabs AI for Media - Sports Tennis não tem nenhum número. É um modelo multimodal de 31B ajustado com 43.084 clipes de pontos de tênis que a NVIDIA publicou em setembro de 2026 com um protocolo de avaliação completo em seu card e nem um único resultado dele.

Então, isto não é um confronto direto que se possa pontuar. Ainda assim, é uma comparação genuinamente útil, porque os dois modelos respondem à mesma pergunta — pode um modelo de visão e linguagem acompanhar esporte ao vivo — com apostas arquitetônicas opostas, e uma dessas apostas é respaldada por evidências, enquanto a outra é respaldada por uma descrição de dados. Essa assimetria é o artigo.

A bifurcação: um fluxo ou um clipe

A diferença de design importa mais do que as contagens de parâmetros, e explica quase todo o resto sobre esses dois modelos.

O Microsoft Mage-VL é construído em torno de vídeo contínuo. Seu codificador visual, o Mage-ViT, é treinado do zero e lê vídeo como um codec faz: divide um fluxo em quadros âncora (I), mantidos integralmente, e quadros previstos (P), nos quais apenas os patches que carregam movimento real ou novos detalhes são retidos, em uma grade compartilhada de patches 16×16. Isso reduz os tokens visuais em mais de 75% e, segundo a Microsoft, proporciona até 3,5× de speedup de inferência em tempo de relógio em comparação com a amostragem uniforme de quadros. Sobre isso, há uma divisão Sistema 1 / Sistema 2: um gate de cognição leve pontua cada janela deslizante e permanece silencioso em conteúdo rotineiro, invocando o modelo completo apenas quando um evento digno de resposta se completa. É um único modelo fazendo as duas tarefas, não um pipeline.

O modelo de tênis da NVIDIA faz uma aposta totalmente diferente. A ficha do modelo deixa explícito que ele “funciona melhor quando um clipe completo de um ponto de tênis é passado como entrada” — do saque até o fim do rali, até dois minutos de mp4, com áudio. A política de inferência padrão é 2 quadros por segundo, até 128 quadros, 256 novos tokens, decodificação gulosa, vídeo mais áudio. Não há gate, nem modo de streaming, nem gatilho de evento. É um modelo de perguntas e respostas sobre um clipe delimitado: você entrega um ponto, pergunta o que aconteceu e ele responde.

Não se trata de duas implementações de uma mesma ideia. Percepção em streaming e raciocínio em nível de clipe são produtos diferentes. Uma emissora que quer comentário ao vivo precisa do formato do Mage-VL. Um analista que quer consultar um arquivo de 43.084 pontos precisa do formato do Sports Tennis. Nenhum dos modelos é um substituto direto para o trabalho do outro.

Ambos são construídos sobre um backbone híbrido — com uma diferença importante

• Parâmetros — Sports Tennis: 31B no total, aproximadamente 3B ativos por token, MoE híbrido Mamba2-Transformer. Mage-VL: 4B no total, um Mage-ViT de 316M emparelhado com um decodificador Qwen3-4B-Instruct-2507.

• Codificadores — Sports Tennis congela tanto o codificador de visão C-RADIOv4-H quanto o codificador de fala Parakeet e faz ajuste fino apenas nos parâmetros do modelo de linguagem. Mage-VL treina toda a sua pilha visual do zero em cerca de 100 milhões de imagens e vídeos não rotulados, com o modelo de linguagem Qwen3 como o único componente pré-treinado.

• Áudio — O Sports Tennis trata o áudio como uma entrada de primeira classe e inclui a interpretação de sinais sonoros entre suas 38 categorias de anotação. O pipeline publicado do Mage-VL é visual; o trabalho do SoccerNet trata do tempo de resposta em quadros.

• Modalidade de saída — ambos produzem apenas texto.

• Efeito multiplicador — como o Mage-ViT era mais barato de pré-treinar do que uma torre de visão em escala web, a Microsoft relata treinar em vídeos 8× mais longos com o mesmo orçamento. A alegação de eficiência da NVIDIA é arquitetural: 3B de parâmetros ativos por token de um total de 31B.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

Onde estão as evidências

Esta é a parte da comparação que não é nem de perto equilibrada, e vale a pena dizer isso sem rodeios.

O Microsoft Mage-VL é um modelo publicado, com um relatório técnico, uma página de projeto, um repositório no GitHub e um conjunto de benchmarks que abrange compreensão de imagens, compreensão de vídeo, ancoragem temporal, raciocínio espacial e streaming. Em comparação com o Qwen3-VL-4B — mesmo backbone de linguagem de 4B, apenas com o codificador de visão substituído —, o Mage-VL melhora em todos os benchmarks de vídeo e de ancoragem temporal reportados, com os maiores ganhos em tarefas fortemente focadas em localização: +22,5 no Timelens-QVHighlight, +17,1 no ActivityNet, +11,0 no VSI-Bench, +24,5 no VideoEval-Pro. Ele reporta DocVQA 95,14, MMStar 67,32 e CrossPoint 80,00 no lado de imagem, VideoMME 64,0 e LongVideoBench 61,3 em vídeo, e uma pontuação geral de 64,00 no OVO-Bench entre arquiteturas de streaming. Todos esses números são reportados pela Microsoft e nenhum foi reproduzido de forma independente — mas eles existem, são numerosos e são internamente consistentes em um conjunto incomumente amplo de tarefas.

O Sports Tennis não relata nada. Sua ficha documenta uma partição de teste de 12 partidas totalmente reservadas, com 2.689 clipes em nível de ponto e 80.872 perguntas, descreve a pontuação por acurácia automatizada de múltipla escolha e pass@9 com LLM como juiz, observa que apenas a divisão de partidas não vistas foi usada para os testes relatados — e então não publica nenhum resultado. Seu corpus de treinamento é real e específico: 1.312.129 exemplos de perguntas e respostas, 1.226.081 de múltipla escolha e 86.048 abertas, de 43.084 clipes em 239 partidas, rotulados segundo 38 categorias de anotação de filmagens de transmissão e de captura de quadra de 2025. Nada disso é verificável de fora, e os números que o tornariam verificável estão ausentes.

Uma ressalva pesa no sentido oposto, e vale a pena nomeá-la para que isto não seja lido como uma vitória limpa da Microsoft. O SoccerNet não é tênis. As credenciais de streaming do Mage-VL vêm de dados de transmissão de futebol sob um protocolo específico, e sua demonstração na Copa do Mundo de 2026 é uma demonstração. Não foi testado se o gate nativo de codec se transfere de forma limpa para o tênis — onde os pontos são curtos, frequentes e fortemente estruturados. A diferença é que a alegação do Mage-VL é ao menos falsificável por terceiros, e a do Sports Tennis não é falsificável por ninguém sem o conjunto de dados da NVIDIA.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

O que é preciso para executá-los

A diferença aqui é de aproximadamente um fator de cinco no hardware, e isso determina quem pode, de forma realista, testar cada modelo.

• Sports Tennis — uma GPU com cerca de 80 GB em BF16, pesos em torno de 62 GB. A100 80GB ou H100 80GB no mínimo, B200 ou H200 recomendado. Nenhum checkpoint quantizado é publicado, então não há caminho barato para baixo. Apenas em inglês. Os ambientes de execução são PyTorch/Transformers mais NeMo e Megatron.

• Mage-VL — cerca de 10,6 GB em BF16, o que coloca uma GPU de 16 GB como o mínimo prático para trabalho com imagens e 24 GB ou mais para vídeos longos e streaming. Apache-2.0 para o Mage-VL e MIT para o Mage-ViT, embora o repositório da família declare que os modelos são disponibilizados apenas para fins de pesquisa. Atenção aos pontos críticos: trust_remote_code é obrigatório, ainda não há caminho de serving com vLLM ou SGLang, e o pipeline de codec precisa de FFmpeg ou ffprobe — com o caminho de codec neural precisando adicionalmente do DCVC-RT.

Se você quiser avaliar um modelo de vídeo esportivo este mês em uma única placa de estação de trabalho, o Mage-VL é o único dos dois que você consegue realmente carregar. Isso é um veredito prático mesmo na ausência de um veredito de benchmark.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

Qual deles você escolheria

Para tudo o que é ao vivo — comentários, detecção de eventos em um feed em execução, alertas de baixa latência em vídeo de transmissão —, o Microsoft Mage-VL é a escolha defensável hoje: foi projetado exatamente para isso, tem o benchmark de streaming que o sustenta e cabe no hardware que a maioria das equipes já possui. Para trabalho com muitos arquivos e em formato de consulta, especificamente no tênis — criar um índice pesquisável de pontos, executar análise estruturada em milhares de rallies, fazer perguntas em que o clipe do ponto inteiro é a unidade de significado —, o modelo da NVIDIA é o único dos dois que foi criado para isso. Se ele desempenha bem a tarefa é, em setembro de 2026, genuinamente desconhecido.

Há uma terceira opção que vale a pena mencionar, porque é onde a maioria dos pipelines reais acaba. Se quiser experimentar o especialista não comprovado sem apostar um caminho de produção nele, mantenha-o atrás da mesma interface dos modelos em que confia. A OrcaRouter não oferece nenhum destes — a NVIDIA publicou pesos sem endpoint, e o Mage-VL não tem caminho de serviço hospedado —, portanto ambos são decisões de auto-hospedagem. O que uma única chave que cobre mais de 200 modelos hospedados lhe proporciona é o resto da pilha: os modelos de transcrição, resumo e aplicação em torno do componente de vídeo esportivo permanecem atrás de um único endpoint, com failover automático se um fornecedor degradar, e os dois modelos especialistas que você mesmo executa são as únicas peças móveis que você possui.

O veredito

Microsoft Mage-VL e NVIDIA NemotronLabs AI for Media - Sports Tennis não são rivais no sentido que uma página de comparativos costuma dar a essa palavra. O Mage-VL é um modelo de streaming de 4B, publicado e avaliado por benchmarks, que roda em uma estação de trabalho e tem uma demonstração real de comentário esportivo acionado por eventos. O Sports Tennis é um especialista em nível de clipe, de 31B, não anunciado e sem benchmarks, que exige uma GPU de datacenter e não traz nenhuma evidência publicada de que funcione.

Julgue pelas evidências e Mage-VL vence por W.O. Julgue pelo escopo e eles não se sobrepõem. Mas há um motivo para continuar acompanhando o modelo da NVIDIA: um fine-tune com encoder congelado sobre 43.084 pontos de tênis corretamente anotados é exatamente o tipo de conjunto de treinamento vertical, restrito e de alta qualidade que os modelos generalistas não têm, e se a NVIDIA algum dia publicar os resultados do conjunto de teste reservado, a questão especialista versus generalista em vídeo esportivo ganha sua primeira resposta real. Até lá, Mage-VL é o modelo com provas e Sports Tennis é o modelo com uma promessa.