
Nemotron Sports Tennis vs Microsoft Mage-VL: twee manieren om een sportuitzending te lezen
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Microsoft Mage-VL heeft een getal waar je naar kunt wijzen: op de SoccerNet-benchmark voor responstijden behaalt het een TimVal van 55,54 en een PR-AUC van 9,30, het beste op de precisiegevoelige metrieken, ondanks dat het nooit op die dataset is getraind, en de auteurs laten zien hoe het een uitzending van het WK 2026 uitzit en stil blijft tot 29,36 seconden, wanneer een speler doorbreekt en het model livecommentaar afvuurt. NVIDIA NemotronLabs AI for Media - Sports Tennis heeft helemaal geen getal. Het is een multimodaal model van 31B dat is fine-getuned op 43.084 tennispointclips, dat NVIDIA in september 2026 publiceerde met een volledig evaluatieprotocol op de modelkaart en geen enkel resultaat daarvan.
Dit is dus geen directe confrontatie die je kunt scoren. Het is toch een oprecht nuttige vergelijking, omdat de twee modellen dezelfde vraag beantwoorden — kan een vision-languagemodel live sport volgen — met tegengestelde architectonische gokken, en een van die gokken wordt onderbouwd door bewijs, terwijl de andere wordt onderbouwd door een databeschrijving. Die asymmetrie is het artikel.
De splitsing: een stream, of een clip
Het verschil in ontwerp is belangrijker dan de parameteraantallen, en het verklaart bijna al het andere aan deze twee modellen.
Microsoft Mage-VL is opgebouwd rond continue video. De visuele encoder, Mage-ViT, is vanaf nul getraind en leest video zoals een codec dat doet: hij splitst een stream in ankerframes (I-frames), die volledig behouden blijven, en voorspelde frames (P-frames), waarbij alleen de patches die echte beweging of nieuwe details bevatten, behouden blijven, op een gedeeld 16×16-patchraster. Dat vermindert het aantal visuele tokens met meer dan 75% en levert volgens Microsoft een wall-clock-snelheidswinst van maximaal 3,5× bij inferentie op ten opzichte van uniforme framebemonstering. Daarbovenop zit een Systeem 1 / Systeem 2-splitsing: een lichtgewicht cognitiepoort scoort elk rollend venster en blijft stil bij routine-inhoud, en roept alleen het volledige model aan wanneer een reactiewaardige gebeurtenis is voltooid. Het is één model dat beide taken doet, geen pijplijn.
Het tennismodel van NVIDIA kiest volledig voor de andere aanpak. De modelkaart vermeldt expliciet dat het "het beste werkt wanneer een volledige clip van een tennispunt als invoer wordt doorgegeven" — van de service tot het einde van de rally, tot twee minuten mp4, met audio. Het standaard inferentiebeleid is 2 frames per seconde tot maximaal 128 frames, 256 nieuwe tokens, greedy decoding, video plus audio. Er is geen poortmechanisme, geen streamingmodus, geen eventtrigger. Het is een vraag-antwoordmodel op een begrensde clip: je geeft het een punt, je vraagt wat er is gebeurd, en het vertelt het je.
Dat zijn geen twee implementaties van één idee. Streamingperceptie en redeneren op clipniveau zijn verschillende producten. Een omroep die livecommentaar wil, heeft de vorm van Mage-VL nodig. Een analist die een archief van 43.084 punten wil doorzoeken, heeft de vorm van Sports Tennis nodig. Geen van beide modellen kan zonder meer het werk van het andere overnemen.
Beide zijn gebouwd op een hybride backbone — met één belangrijk verschil
• Parameters — Sports Tennis: 31B totaal, ongeveer 3B actief per token, Mamba2-Transformer hybride MoE. Mage-VL: 4B totaal, een 316M Mage-ViT gekoppeld aan een Qwen3-4B-Instruct-2507 decoder.
• Encoders — Sports Tennis bevriest zowel de C-RADIOv4-H visie-encoder als de Parakeet spraakencoder en fine-tunet alleen de parameters van het taalmodel. Mage-VL traint zijn volledige visuele stack vanaf nul op ongeveer 100M ongelabelde afbeeldingen en video's, met het Qwen3-taalmodel als de enige vooraf getrainde component.
• Audio — Sports Tennis behandelt audio als een eersteklas invoer en rekent interpretatie van audiocues tot zijn 38 annotatiecategorieën. De gepubliceerde pipeline van Mage-VL is visueel; het SoccerNet-werk gaat over reactietiming op frames.
• Modaliteit uit — beide produceren alleen tekst.
• Multipliereffect — omdat Mage-ViT goedkoper was om te pretrainen dan een vision tower op web-schaal, meldt Microsoft dat er met hetzelfde budget 8× langer op video's wordt getraind. NVIDIA's efficiëntieclaim is daarentegen architecturaal: 3B actieve parameters per token van de in totaal 31B.

Waar het bewijs ligt
Dit is het deel van de vergelijking waar geen twijfel over bestaat, en het is de moeite waard om dat ronduit te zeggen.
Microsoft Mage-VL is een gepubliceerd model met een technisch rapport, een projectpagina, een GitHub-repository en een benchmarkreeks die beeldbegrip, videobegrip, temporele grounding, ruimtelijke redenering en streaming omvat. Vergeleken met Qwen3-VL-4B — dezelfde 4B-taalbackbone, alleen de visie-encoder vervangen — verbetert Mage-VL op elke gerapporteerde benchmark voor video en temporele grounding, met de grootste winst bij lokalisatie-intensieve taken: +22,5 op Timelens-QVHighlight, +17,1 op ActivityNet, +11,0 op VSI-Bench, +24,5 op VideoEval-Pro. Het rapporteert DocVQA 95,14, MMStar 67,32 en CrossPoint 80,00 aan de beeldzijde, VideoMME 64,0 en LongVideoBench 61,3 voor video, en een totaalscore van 64,00 op OVO-Bench onder streamingarchitecturen. Al deze cijfers zijn door Microsoft gerapporteerd en geen ervan is onafhankelijk gereproduceerd — maar ze bestaan, het zijn er veel, en ze zijn intern consistent over een ongewoon brede reeks taken.
Sports Tennis rapporteert niets. De kaart documenteert een testpartitie van 12 volledig achtergehouden wedstrijden met 2.689 clips op puntniveau en 80.872 vragen, beschrijft de scoring op basis van geautomatiseerde meerkeuzenauwkeurigheid en LLM-as-judge pass@9, merkt op dat alleen de split met ongeziene wedstrijden werd gebruikt voor de gerapporteerde tests — en publiceert vervolgens geen resultaat. Het trainingscorpus is echt en specifiek: 1.312.129 Q&A-voorbeelden, 1.226.081 meerkeuzevragen en 86.048 open vragen, afkomstig van 43.084 clips uit 239 wedstrijden, gelabeld volgens 38 annotatiecategorieën uit uitgezonden en court-capture-beeldmateriaal uit 2025. Niets daarvan is van buitenaf verifieerbaar, en de cijfers die het verifieerbaar zouden maken, ontbreken.
Eén kanttekening pleit echter de andere kant op, en het is de moeite waard die te benoemen, zodat dit niet als een duidelijke overwinning voor Microsoft leest. SoccerNet is geen tennis. De streamingreferenties van Mage-VL komen uit voetbal-uitzenddata onder een specifiek protocol, en de demonstratie op het WK van 2026 is een demonstratie. Of de codec-native poort zich probleemloos naar tennis laat overzetten — waar punten kort, frequent en sterk gestructureerd zijn — is ongetest. Het verschil is dat de claim van Mage-VL ten minste door een derde partij falsifieerbaar is, en die van Sports Tennis door niemand zonder NVIDIA's dataset falsifieerbaar is.

Wat er nodig is om ze te runnen
Het verschil is hier ongeveer een factor vijf qua hardware, en dat bepaalt wie elk model realistisch kan uitproberen.
• Sports Tennis — één GPU met ongeveer 80 GB bij BF16, gewichten rond 62 GB. A100 80GB of H100 80GB als ondergrens, B200 of H200 aanbevolen. Er is geen gekwantiseerd checkpoint gepubliceerd, dus er is geen goedkope route omlaag. Alleen Engels. Runtimes zijn PyTorch/Transformers plus NeMo en Megatron.
• Mage-VL — ongeveer 10,6 GB bij BF16, waardoor een GPU van 16 GB de praktische ondergrens vormt voor beeldwerk en 24 GB of meer voor lange video's en streaming. Apache-2.0 voor Mage-VL en MIT voor Mage-ViT, hoewel de repository van de familie aangeeft dat de modellen alleen voor onderzoeksdoeleinden worden vrijgegeven. Let op de scherpe randjes: trust_remote_code is vereist, er is nog geen vLLM- of SGLang-servingpad, en de codec-pijplijn heeft FFmpeg of ffprobe nodig — waarbij het neural-codec-pad bovendien DCVC-RT nodig heeft.
Als je deze maand een sportvideomodel wilt evalueren op één enkele workstation-kaart, is Mage-VL de enige van de twee die je daadwerkelijk kunt laden. Dat is een praktisch oordeel, zelfs zonder een benchmarkoordeel.

Naar welke zou je grijpen?
Voor alles wat live is — commentaar, gebeurtenisdetectie op een lopende feed, waarschuwingen met lage latentie bij uitgezonden video — is Microsoft Mage-VL vandaag de verdedigbare keuze: het is precies daarvoor ontworpen, het heeft de streamingbenchmark om dat te onderbouwen, en het past op hardware die de meeste teams al bezitten. Voor archiefzwaar, querygericht werk, specifiek bij tennis — het bouwen van een doorzoekbare index van punten, het uitvoeren van gestructureerde analyses over duizenden rally's, vragen stellen waarbij de hele puntclip de betekeniseenheid is — is het model van NVIDIA het enige van de twee dat daarvoor is gebouwd. Of het die taak goed uitvoert, is per september 2026 echt onbekend.
Er is een derde optie die het vermelden waard is, want daar komen de meeste echte pipelines uiteindelijk uit. Als je de onbewezen specialist wilt uitproberen zonder er een productiepad op te wedden, houd die dan achter dezelfde interface als de modellen die je vertrouwt. OrcaRouter biedt geen van beide — NVIDIA heeft gewichten gepubliceerd zonder endpoint, en Mage-VL heeft geen gehoste serveermogelijkheid — dus beide zijn beslissingen om zelf te hosten. Wat één enkele sleutel die 200-plus gehoste modellen dekt je oplevert, is de rest van de stack: de transcriptie-, samenvattings- en applicatiemodellen rond de sportvideocomponent blijven achter één endpoint, met automatische failover als een provider verslechtert, en de twee specialistische modellen die je zelf draait zijn de enige bewegende onderdelen die je bezit.
Het vonnis
Microsoft Mage-VL en NVIDIA NemotronLabs AI for Media - Sports Tennis zijn geen rivalen in de zin die een versus-pagina gewoonlijk bedoelt. Mage-VL is een gepubliceerd, gebenchmarkt 4B-streamingmodel dat op een workstation draait en een echte demonstratie heeft van gebeurtenisgestuurd sportcommentaar. Sports Tennis is een onaangekondigde, niet-gebenchmarkte 31B-specialist op clipniveau die een datacenter-GPU nodig heeft en waarvoor geen gepubliceerd bewijs bestaat dat hij werkt.
Oordeel op basis van het bewijs en Mage-VL wint door forfait. Oordeel op basis van scope en ze overlappen niet. Maar er is een reden om NVIDIA's model in de gaten te blijven houden: een fine-tune met bevroren encoder op 43.084 correct geannoteerde tennispunten is precies het soort smalle, hoogwaardige verticale trainingsset dat generalistische modellen niet hebben, en als NVIDIA ooit de resultaten op de achtergehouden set publiceert, krijgt de specialist-versus-generalistvraag in sportvideo's haar eerste echte antwoord. Tot dan is Mage-VL het model met bewijs en Sports Tennis het model met een belofte.
