Une carte hero générée comparant NVIDIA NemotronLabs AI for Media - Sports Tennis et Microsoft Mage-VL, montrant un clip borné d'un point de tennis d'un côté et une pellicule continue avec un marqueur d'événement surligné de l'autre, avec trois puces de contraste indiquant clip vs flux, aucun score publié vs scores SoccerNet, et un plancher de 80 Go vs un plancher de 16 Go, et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL : deux façons de lire une retransmission sportive

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Microsoft Mage-VL a un chiffre que vous pouvez citer : sur le SoccerNet response-timing benchmark, il affiche un TimVal de 55,54 et un PR-AUC de 9,30, meilleur sur les métriques sensibles à la précision bien qu'il n'ait jamais été entraîné sur ce jeu de données, et ses auteurs démontrent qu'il suit une diffusion de la Coupe du Monde 2026 en restant silencieux jusqu'à 29,36 secondes, lorsqu'un joueur fait une percée et que le modèle déclenche un commentaire en direct. NVIDIA NemotronLabs AI for Media - Sports Tennis n'a aucun chiffre du tout. C'est un modèle multimodal 31B affiné sur 43 084 clips de points de tennis que NVIDIA a publié en septembre 2026 avec un protocole d'évaluation complet sur sa fiche et pas un seul résultat issu de celui-ci.

Il ne s’agit donc pas d’un face-à-face que l’on peut noter. C’est malgré tout une comparaison réellement utile, parce que les deux modèles répondent à la même question — un modèle vision-langage peut-il suivre le sport en direct — avec des paris architecturaux opposés, et l’un de ces paris s’appuie sur des preuves tandis que l’autre s’appuie sur une description de données. Cette asymétrie, c’est l’article.

Le fork : un flux, ou un clip

La différence de conception importe plus que le nombre de paramètres, et elle explique presque tout le reste au sujet de ces deux modèles.

Microsoft Mage-VL est construit autour de la vidéo continue. Son encodeur visuel, Mage-ViT, est entraîné à partir de zéro et lit la vidéo comme le fait un codec : il divise un flux en images d'ancrage (I), conservées dans leur intégralité, et en images prédites (P), où seuls les patchs portant un mouvement réel ou de nouveaux détails sont conservés, sur une grille de patchs 16×16 partagée. Cela réduit les tokens visuels de plus de 75 % et, selon Microsoft, permet jusqu'à 3,5× d'accélération de l'inférence en temps réel par rapport à un échantillonnage uniforme des images. Par-dessus se trouve une séparation Système 1 / Système 2 : une porte de cognition légère évalue chaque fenêtre glissante et reste silencieuse sur le contenu de routine, n'invoquant le modèle complet que lorsqu'un événement méritant une réponse se termine. C'est un seul modèle qui fait les deux tâches, pas un pipeline.

Le modèle de tennis de NVIDIA fait un pari complètement différent. Sa fiche indique explicitement qu'il « fonctionne mieux lorsqu'un clip complet d'un point de tennis est transmis en entrée » — du service à la fin de l'échange, jusqu'à deux minutes de mp4, avec audio. La politique d'inférence par défaut est de 2 images par seconde jusqu'à 128 images, 256 nouveaux tokens, décodage glouton, vidéo et audio. Il n'y a pas de condition d'activation, pas de mode streaming, pas de déclencheur d'événement. C'est un modèle de questions-réponses sur un clip délimité : vous lui donnez un point, vous demandez ce qui s'est passé, il vous répond.

Ce ne sont pas deux implémentations d’une même idée. La perception en streaming et le raisonnement au niveau des clips sont des produits différents. Un diffuseur qui souhaite des commentaires en direct a besoin de la structure de Mage-VL. Un analyste qui souhaite interroger une archive de 43 084 points a besoin de la structure de Sports Tennis. Aucun des deux modèles n’est un remplacement direct pour le rôle de l’autre.

Tous deux reposent sur une base hybride — avec une différence importante

• Paramètres — Sports Tennis : 31 B au total, environ 3 B actifs par token, MoE hybride Mamba2-Transformer. Mage-VL : 4 B au total, un Mage-ViT de 316 M associé à un décodeur Qwen3-4B-Instruct-2507.

• Encodeurs — Sports Tennis gèle à la fois l’encodeur visuel C-RADIOv4-H et l’encodeur vocal Parakeet, et n’affine que les paramètres du modèle de langage. Mage-VL entraîne toute sa pile visuelle à partir de zéro sur environ 100 M d’images et de vidéos non étiquetées, le modèle de langage Qwen3 étant le seul composant pré-entraîné.

• Audio — Sports Tennis traite l'audio comme une entrée à part entière et inclut l'interprétation des indices audio parmi ses 38 catégories d'annotation. Le pipeline publié de Mage-VL est visuel ; les travaux sur SoccerNet portent sur le timing de réponse sur les images.

• Modalité de sortie — les deux ne produisent que du texte.

• Effet multiplicateur — parce que Mage-ViT était moins coûteux à pré-entraîner qu'une tour de vision à l'échelle du Web, Microsoft indique un entraînement sur des vidéos 8× plus long avec le même budget. En revanche, l'argument d'efficacité de NVIDIA est architectural : 3 milliards de paramètres actifs par token sur 31 milliards au total.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

Où se trouve la preuve

C'est la partie de la comparaison qui n'est pas serrée, et il vaut la peine de le dire sans détour.

Microsoft Mage-VL est un modèle publié avec un rapport technique, une page de projet, un dépôt GitHub et un ensemble de benchmarks couvrant la compréhension d'images, la compréhension vidéo, l'ancrage temporel, le raisonnement spatial et le streaming. Face à Qwen3-VL-4B — même backbone linguistique 4B, seul l'encodeur visuel ayant été remplacé — Mage-VL améliore les résultats sur chaque benchmark vidéo et d'ancrage temporel rapporté, avec les gains les plus importants sur les tâches à forte composante de localisation : +22,5 sur Timelens-QVHighlight, +17,1 sur ActivityNet, +11,0 sur VSI-Bench, +24,5 sur VideoEval-Pro. Il rapporte DocVQA 95,14, MMStar 67,32 et CrossPoint 80,00 du côté image, VideoMME 64,0 et LongVideoBench 61,3 en vidéo, et un score global de 64,00 sur OVO-Bench parmi les architectures de streaming. Tous ces chiffres sont rapportés par Microsoft et aucun n'a été reproduit indépendamment — mais ils existent, ils sont nombreux et ils sont cohérents entre eux sur un ensemble de tâches inhabituellement large.

Sports Tennis ne rapporte rien. Sa fiche documente une partition de test de 12 matchs entièrement mis à part avec 2 689 clips au niveau du point et 80 872 questions, décrit la notation par précision automatisée en choix multiples et LLM-as-judge pass@9, note que seule la division des matchs non vus a été utilisée pour les tests rapportés — puis ne publie aucun résultat. Son corpus d'entraînement est réel et spécifique : 1 312 129 exemples de questions-réponses, 1 226 081 en choix multiples et 86 048 en format ouvert, provenant de 43 084 clips à travers 239 matchs, étiquetés selon 38 catégories d'annotation issues de séquences de diffusion et de capture de court de 2025. Rien de tout cela n'est vérifiable de l'extérieur, et les chiffres qui le rendraient vérifiable sont absents.

Une réserve joue en sens inverse, et il vaut la peine de la nommer pour que cela ne soit pas lu comme une victoire nette pour Microsoft. SoccerNet n’est pas le tennis. Les références de Mage-VL en matière de streaming proviennent de données de diffusion de football selon un protocole spécifique, et sa démonstration de la Coupe du monde 2026 est une démonstration. Que la porte native du codec se transpose proprement au tennis — où les points sont courts, fréquents et fortement structurés — n’a pas été testé. La différence est que l’affirmation de Mage-VL est au moins falsifiable par un tiers, tandis que celle de Sports Tennis n’est falsifiable par personne sans le jeu de données de NVIDIA.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

Ce qu’il faut pour les faire fonctionner

L'écart ici est d'environ un facteur cinq en matière de matériel, et il détermine qui peut, de manière réaliste, essayer chaque modèle.

• Sports Tennis — un seul GPU d'environ 80 Go en BF16, avec des poids d'environ 62 Go. A100 80GB ou H100 80GB au minimum, B200 ou H200 recommandés. Aucun checkpoint quantifié n'est publié, il n'existe donc pas de voie économique vers le bas. Anglais uniquement. Les environnements d'exécution sont PyTorch/Transformers ainsi que NeMo et Megatron.

• Mage-VL — environ 10,6 Go en BF16, ce qui fait d'un GPU de 16 Go le minimum pratique pour le travail sur image et de 24 Go ou plus pour la vidéo longue et le streaming. Apache-2.0 pour Mage-VL et MIT pour Mage-ViT, bien que le dépôt de la famille indique que les modèles sont publiés à des fins de recherche uniquement. Attention aux points délicats : trust_remote_codeest requis, il n'existe encore aucune voie de service vLLM ou SGLang, et le pipeline de codec nécessite FFmpeg ou ffprobe — avec la voie du codec neuronal qui nécessite en plus DCVC-RT.

Si vous voulez évaluer ce mois-ci un modèle de vidéo sportive sur une seule carte de station de travail, Mage-VL est le seul des deux que vous pouvez réellement charger. C’est un verdict pratique, même en l’absence d’un verdict de benchmark.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

Vers lequel vous tourneriez-vous ?

Pour tout ce qui est en direct — commentaire, détection d’événements sur un flux en cours, alertes à faible latence sur vidéo de diffusion — Microsoft Mage-VL est le choix qui se défend aujourd’hui : il a été conçu exactement pour cela, il dispose du benchmark de streaming qui plaide pour lui, et il tient sur du matériel que la plupart des équipes possèdent déjà. Pour un travail à forte composante d’archives et de type requête, spécifiquement sur le tennis — construire un index consultable des points, mener une analyse structurée sur des milliers d’échanges, poser des questions où l’unité de sens est le clip complet du point — le modèle de NVIDIA est le seul des deux conçu pour cela. Savoir s’il s’acquitte bien de cette tâche est, en septembre 2026, une véritable inconnue.

Il existe une troisième option qui mérite d'être nommée, car c'est là que finissent la plupart des pipelines réels. Si vous voulez essayer le spécialiste non éprouvé sans miser une chaîne de production dessus, gardez-le derrière la même interface que les modèles auxquels vous faites confiance. OrcaRouter ne propose ni l'un ni l'autre — NVIDIA a publié des poids sans point de terminaison, et Mage-VL n'a pas de voie de service hébergée — il s'agit donc dans les deux cas de décisions d'auto-hébergement. Ce que une seule clé couvrant plus de 200 modèles hébergés vous apporte, c'est le reste de la pile : les modèles de transcription, de résumé et d'application autour du composant de vidéo sportive restent derrière un seul point de terminaison, avec basculement automatique en cas de dégradation d'un fournisseur, et les deux modèles spécialisés que vous exécutez vous-même sont les seules pièces mobiles dont vous êtes responsable.

Le verdict

Microsoft Mage-VL et NVIDIA NemotronLabs AI for Media - Sports Tennis ne sont pas des rivaux au sens où une page de comparaison l'entend habituellement. Mage-VL est un modèle de streaming 4B publié et évalué par des benchmarks, qui tourne sur une station de travail et dispose d'une véritable démonstration de commentaire sportif déclenché par des événements. Sports Tennis est un spécialiste au niveau des clips de 31B, non annoncé et non évalué par des benchmarks, qui a besoin d'un GPU de datacenter et ne comporte aucune preuve publiée qu'il fonctionne.

Si l'on juge sur les preuves, Mage-VL l'emporte par forfait. Si l'on juge sur le périmètre, ils ne se chevauchent pas. Mais il y a une raison de continuer à suivre le modèle de NVIDIA : un fine-tuning d'encodeur gelé sur 43 084 points de tennis correctement annotés est exactement le type d'ensemble d'entraînement vertical étroit et de haute qualité que les modèles généralistes n'ont pas, et si NVIDIA publie un jour les résultats sur l'ensemble tenu à l'écart, la question spécialiste contre généraliste dans la vidéo sportive obtient sa première véritable réponse. D'ici là, Mage-VL est le modèle qui a des preuves, et Sports Tennis est le modèle qui a une promesse.