Een gegenereerde hero-kaart die NVIDIA NemotronLabs AI for Media - Sports Tennis en Microsoft Mage-VL vergelijkt, met aan de ene kant een afgebakende tennispointclip en aan de andere kant een doorlopende filmstrip met een gemarkeerde gebeurtenismarker, met drie contrastchips met de tekst clip vs stream, geen gepubliceerde scores vs SoccerNet-scores, en een ondergrens van 80 GB vs een ondergrens van 16 GB, en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL: twee manieren om een sportuitzending te lezen

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Microsoft Mage-VL heeft een getal waar je naar kunt wijzen: op de SoccerNet-benchmark voor responstijden behaalt het een TimVal van 55,54 en een PR-AUC van 9,30, het beste op de precisiegevoelige metrieken, ondanks dat het nooit op die dataset is getraind, en de auteurs laten zien hoe het een uitzending van het WK 2026 uitzit en stil blijft tot 29,36 seconden, wanneer een speler doorbreekt en het model livecommentaar afvuurt. NVIDIA NemotronLabs AI for Media - Sports Tennis heeft helemaal geen getal. Het is een multimodaal model van 31B dat is fine-getuned op 43.084 tennispointclips, dat NVIDIA in september 2026 publiceerde met een volledig evaluatieprotocol op de modelkaart en geen enkel resultaat daarvan.

Dit is dus geen directe confrontatie die je kunt scoren. Het is toch een oprecht nuttige vergelijking, omdat de twee modellen dezelfde vraag beantwoorden — kan een vision-languagemodel live sport volgen — met tegengestelde architectonische gokken, en een van die gokken wordt onderbouwd door bewijs, terwijl de andere wordt onderbouwd door een databeschrijving. Die asymmetrie is het artikel.

De splitsing: een stream, of een clip

Het verschil in ontwerp is belangrijker dan de parameteraantallen, en het verklaart bijna al het andere aan deze twee modellen.

Microsoft Mage-VL is opgebouwd rond continue video. De visuele encoder, Mage-ViT, is vanaf nul getraind en leest video zoals een codec dat doet: hij splitst een stream in ankerframes (I-frames), die volledig behouden blijven, en voorspelde frames (P-frames), waarbij alleen de patches die echte beweging of nieuwe details bevatten, behouden blijven, op een gedeeld 16×16-patchraster. Dat vermindert het aantal visuele tokens met meer dan 75% en levert volgens Microsoft een wall-clock-snelheidswinst van maximaal 3,5× bij inferentie op ten opzichte van uniforme framebemonstering. Daarbovenop zit een Systeem 1 / Systeem 2-splitsing: een lichtgewicht cognitiepoort scoort elk rollend venster en blijft stil bij routine-inhoud, en roept alleen het volledige model aan wanneer een reactiewaardige gebeurtenis is voltooid. Het is één model dat beide taken doet, geen pijplijn.

Het tennismodel van NVIDIA kiest volledig voor de andere aanpak. De modelkaart vermeldt expliciet dat het "het beste werkt wanneer een volledige clip van een tennispunt als invoer wordt doorgegeven" — van de service tot het einde van de rally, tot twee minuten mp4, met audio. Het standaard inferentiebeleid is 2 frames per seconde tot maximaal 128 frames, 256 nieuwe tokens, greedy decoding, video plus audio. Er is geen poortmechanisme, geen streamingmodus, geen eventtrigger. Het is een vraag-antwoordmodel op een begrensde clip: je geeft het een punt, je vraagt wat er is gebeurd, en het vertelt het je.

Dat zijn geen twee implementaties van één idee. Streamingperceptie en redeneren op clipniveau zijn verschillende producten. Een omroep die livecommentaar wil, heeft de vorm van Mage-VL nodig. Een analist die een archief van 43.084 punten wil doorzoeken, heeft de vorm van Sports Tennis nodig. Geen van beide modellen kan zonder meer het werk van het andere overnemen.

Beide zijn gebouwd op een hybride backbone — met één belangrijk verschil

• Parameters — Sports Tennis: 31B totaal, ongeveer 3B actief per token, Mamba2-Transformer hybride MoE. Mage-VL: 4B totaal, een 316M Mage-ViT gekoppeld aan een Qwen3-4B-Instruct-2507 decoder.

• Encoders — Sports Tennis bevriest zowel de C-RADIOv4-H visie-encoder als de Parakeet spraakencoder en fine-tunet alleen de parameters van het taalmodel. Mage-VL traint zijn volledige visuele stack vanaf nul op ongeveer 100M ongelabelde afbeeldingen en video's, met het Qwen3-taalmodel als de enige vooraf getrainde component.

• Audio — Sports Tennis behandelt audio als een eersteklas invoer en rekent interpretatie van audiocues tot zijn 38 annotatiecategorieën. De gepubliceerde pipeline van Mage-VL is visueel; het SoccerNet-werk gaat over reactietiming op frames.

• Modaliteit uit — beide produceren alleen tekst.

• Multipliereffect — omdat Mage-ViT goedkoper was om te pretrainen dan een vision tower op web-schaal, meldt Microsoft dat er met hetzelfde budget 8× langer op video's wordt getraind. NVIDIA's efficiëntieclaim is daarentegen architecturaal: 3B actieve parameters per token van de in totaal 31B.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

Waar het bewijs ligt

Dit is het deel van de vergelijking waar geen twijfel over bestaat, en het is de moeite waard om dat ronduit te zeggen.

Microsoft Mage-VL is een gepubliceerd model met een technisch rapport, een projectpagina, een GitHub-repository en een benchmarkreeks die beeldbegrip, videobegrip, temporele grounding, ruimtelijke redenering en streaming omvat. Vergeleken met Qwen3-VL-4B — dezelfde 4B-taalbackbone, alleen de visie-encoder vervangen — verbetert Mage-VL op elke gerapporteerde benchmark voor video en temporele grounding, met de grootste winst bij lokalisatie-intensieve taken: +22,5 op Timelens-QVHighlight, +17,1 op ActivityNet, +11,0 op VSI-Bench, +24,5 op VideoEval-Pro. Het rapporteert DocVQA 95,14, MMStar 67,32 en CrossPoint 80,00 aan de beeldzijde, VideoMME 64,0 en LongVideoBench 61,3 voor video, en een totaalscore van 64,00 op OVO-Bench onder streamingarchitecturen. Al deze cijfers zijn door Microsoft gerapporteerd en geen ervan is onafhankelijk gereproduceerd — maar ze bestaan, het zijn er veel, en ze zijn intern consistent over een ongewoon brede reeks taken.

Sports Tennis rapporteert niets. De kaart documenteert een testpartitie van 12 volledig achtergehouden wedstrijden met 2.689 clips op puntniveau en 80.872 vragen, beschrijft de scoring op basis van geautomatiseerde meerkeuzenauwkeurigheid en LLM-as-judge pass@9, merkt op dat alleen de split met ongeziene wedstrijden werd gebruikt voor de gerapporteerde tests — en publiceert vervolgens geen resultaat. Het trainingscorpus is echt en specifiek: 1.312.129 Q&A-voorbeelden, 1.226.081 meerkeuzevragen en 86.048 open vragen, afkomstig van 43.084 clips uit 239 wedstrijden, gelabeld volgens 38 annotatiecategorieën uit uitgezonden en court-capture-beeldmateriaal uit 2025. Niets daarvan is van buitenaf verifieerbaar, en de cijfers die het verifieerbaar zouden maken, ontbreken.

Eén kanttekening pleit echter de andere kant op, en het is de moeite waard die te benoemen, zodat dit niet als een duidelijke overwinning voor Microsoft leest. SoccerNet is geen tennis. De streamingreferenties van Mage-VL komen uit voetbal-uitzenddata onder een specifiek protocol, en de demonstratie op het WK van 2026 is een demonstratie. Of de codec-native poort zich probleemloos naar tennis laat overzetten — waar punten kort, frequent en sterk gestructureerd zijn — is ongetest. Het verschil is dat de claim van Mage-VL ten minste door een derde partij falsifieerbaar is, en die van Sports Tennis door niemand zonder NVIDIA's dataset falsifieerbaar is.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

Wat er nodig is om ze te runnen

Het verschil is hier ongeveer een factor vijf qua hardware, en dat bepaalt wie elk model realistisch kan uitproberen.

• Sports Tennis — één GPU met ongeveer 80 GB bij BF16, gewichten rond 62 GB. A100 80GB of H100 80GB als ondergrens, B200 of H200 aanbevolen. Er is geen gekwantiseerd checkpoint gepubliceerd, dus er is geen goedkope route omlaag. Alleen Engels. Runtimes zijn PyTorch/Transformers plus NeMo en Megatron.

• Mage-VL — ongeveer 10,6 GB bij BF16, waardoor een GPU van 16 GB de praktische ondergrens vormt voor beeldwerk en 24 GB of meer voor lange video's en streaming. Apache-2.0 voor Mage-VL en MIT voor Mage-ViT, hoewel de repository van de familie aangeeft dat de modellen alleen voor onderzoeksdoeleinden worden vrijgegeven. Let op de scherpe randjes: trust_remote_code is vereist, er is nog geen vLLM- of SGLang-servingpad, en de codec-pijplijn heeft FFmpeg of ffprobe nodig — waarbij het neural-codec-pad bovendien DCVC-RT nodig heeft.

Als je deze maand een sportvideomodel wilt evalueren op één enkele workstation-kaart, is Mage-VL de enige van de twee die je daadwerkelijk kunt laden. Dat is een praktisch oordeel, zelfs zonder een benchmarkoordeel.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

Naar welke zou je grijpen?

Voor alles wat live is — commentaar, gebeurtenisdetectie op een lopende feed, waarschuwingen met lage latentie bij uitgezonden video — is Microsoft Mage-VL vandaag de verdedigbare keuze: het is precies daarvoor ontworpen, het heeft de streamingbenchmark om dat te onderbouwen, en het past op hardware die de meeste teams al bezitten. Voor archiefzwaar, querygericht werk, specifiek bij tennis — het bouwen van een doorzoekbare index van punten, het uitvoeren van gestructureerde analyses over duizenden rally's, vragen stellen waarbij de hele puntclip de betekeniseenheid is — is het model van NVIDIA het enige van de twee dat daarvoor is gebouwd. Of het die taak goed uitvoert, is per september 2026 echt onbekend.

Er is een derde optie die het vermelden waard is, want daar komen de meeste echte pipelines uiteindelijk uit. Als je de onbewezen specialist wilt uitproberen zonder er een productiepad op te wedden, houd die dan achter dezelfde interface als de modellen die je vertrouwt. OrcaRouter biedt geen van beide — NVIDIA heeft gewichten gepubliceerd zonder endpoint, en Mage-VL heeft geen gehoste serveermogelijkheid — dus beide zijn beslissingen om zelf te hosten. Wat één enkele sleutel die 200-plus gehoste modellen dekt je oplevert, is de rest van de stack: de transcriptie-, samenvattings- en applicatiemodellen rond de sportvideocomponent blijven achter één endpoint, met automatische failover als een provider verslechtert, en de twee specialistische modellen die je zelf draait zijn de enige bewegende onderdelen die je bezit.

Het vonnis

Microsoft Mage-VL en NVIDIA NemotronLabs AI for Media - Sports Tennis zijn geen rivalen in de zin die een versus-pagina gewoonlijk bedoelt. Mage-VL is een gepubliceerd, gebenchmarkt 4B-streamingmodel dat op een workstation draait en een echte demonstratie heeft van gebeurtenisgestuurd sportcommentaar. Sports Tennis is een onaangekondigde, niet-gebenchmarkte 31B-specialist op clipniveau die een datacenter-GPU nodig heeft en waarvoor geen gepubliceerd bewijs bestaat dat hij werkt.

Oordeel op basis van het bewijs en Mage-VL wint door forfait. Oordeel op basis van scope en ze overlappen niet. Maar er is een reden om NVIDIA's model in de gaten te blijven houden: een fine-tune met bevroren encoder op 43.084 correct geannoteerde tennispunten is precies het soort smalle, hoogwaardige verticale trainingsset dat generalistische modellen niet hebben, en als NVIDIA ooit de resultaten op de achtergehouden set publiceert, krijgt de specialist-versus-generalistvraag in sportvideo's haar eerste echte antwoord. Tot dan is Mage-VL het model met bewijs en Sports Tennis het model met een belofte.