
Nemotron Sports Tennis vs Microsoft Mage-VL: Två sätt att läsa en sportsändning
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M tokens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Microsoft Mage-VL har ett tal man kan peka på: på SoccerNet-benchmarken för svarstid redovisar den ett TimVal på 55,54 och ett PR-AUC på 9,30, bäst på de precisionskänsliga mätvärdena trots att den aldrig har tränats på den datamängden, och dess författare visar hur den sitter igenom en sändning från VM 2026 och är tyst fram till 29,36 sekunder, då en spelare bryter loss och modellen drar igång livekommentar. NVIDIA NemotronLabs AI for Media - Sports Tennis har inget tal alls. Det är en multimodal 31B-modell finjusterad på 43 084 tennispolängklipp som NVIDIA publicerade i september 2026 med ett fullständigt utvärderingsprotokoll på sitt modellkort och inte ett enda resultat från det.
Så det här är inte en head-to-head som du kan poängsätta. Det är ändå en genuint användbar jämförelse, eftersom de två modellerna svarar på samma fråga – kan en språk- och visionsmodell följa livesport – med motsatta arkitektoniska satsningar, och en av dessa satsningar stöds av bevis medan den andra stöds av en databeskrivning. Den asymmetrin är artikeln.
Forken: en stream eller ett klipp
Designskillnaden spelar större roll än parameterantalen, och den förklarar nästan allt annat hos dessa två modeller.
Microsoft Mage-VL är uppbyggt kring kontinuerlig video. Dess visuella encoder, Mage-ViT, är tränad från grunden och läser video på samma sätt som en codec gör: den delar upp en ström i ankar- (I-)bildrutor, som behålls i sin helhet, och predikterade (P-)bildrutor, där endast de patchar som bär verklig rörelse eller ny detalj behålls, på ett gemensamt 16×16-patchrutnät. Det minskar antalet visuella tokens med över 75 % och ger enligt Microsoft upp till 3,5× snabbare inferens i väggklockstid jämfört med enhetlig bildruteinsamling. Ovanpå detta ligger en uppdelning i System 1 / System 2: en lättviktskognitionsgrind poängsätter varje rullande fönster och förblir tyst vid rutinmässigt innehåll, och anropar den fullständiga modellen först när en händelse som är värd ett svar har slutförts. Det är en enda modell som utför båda uppgifterna, inte en pipeline.
NVIDIAs tennis-modell tar den andra satsningen helt och hållet. Dess modellkort säger uttryckligen att den "fungerar bäst när ett helt tennispoängklipp skickas som indata" — från serve till slutet av rallyt, upp till två minuter mp4, med ljud. Den förvalda inferenspolicyn är 2 bildrutor per sekund upp till 128 bildrutor, 256 nya tokens, greedy-avkodning, video plus ljud. Det finns ingen gate, inget streamingläge, ingen händelseutlösare. Det är en frågebesvarande modell över ett avgränsat klipp: du ger den en poäng, du frågar vad som hände, den berättar.
De är inte två implementationer av en och samma idé. Strömmande perception och resonemang på klippnivå är olika produkter. Ett programföretag som vill ha livekommentering behöver Mage-VLs form. En analytiker som vill ställa frågor mot ett arkiv med 43 084 punkter behöver Sports Tennis form. Ingen av modellerna är en drop-in för den andras uppgift.
Båda är byggda på en hybridstomme — med en viktig skillnad
• Parametrar — Sports Tennis: 31B totalt, ungefär 3B aktiva per token, Mamba2-Transformer-hybrid-MoE. Mage-VL: 4B totalt, en 316M Mage-ViT parad med en Qwen3-4B-Instruct-2507-avkodare.
• Kodare — Sports Tennis fryser både C-RADIOv4-H-visionkodaren och Parakeet-talkodaren och finjusterar endast språkmodellens parametrar. Mage-VL tränar hela sin visuella stack från grunden på ungefär 100 miljoner omärkta bilder och videor, med Qwen3-språkmodellen som den enda förtränade komponenten.
• Ljud — Sports Tennis behandlar ljud som en förstklassig indata och listar tolkning av ljudledtrådar bland sina 38 annoteringskategorier. Mage-VLs publicerade pipeline är visuell; SoccerNet-arbetet handlar om svarstid på bildrutor.
• Modalitet ut — båda producerar endast text.
• Multiplikatoreffekt – eftersom Mage-ViT var billigare att förträna än ett webbaserat visionstorn rapporterar Microsoft träning på videor 8× längre under samma budget. NVIDIAs effektivitetsanspråk är i stället arkitektoniskt: 3B aktiva parametrar per token av totalt 31B.

Där bevisen finns
Det här är den del av jämförelsen som inte är jämn, och det är värt att säga rakt ut.
Microsoft Mage-VL är en publicerad modell med en teknisk rapport, en projektsida, ett GitHub-arkiv och ett brett spektrum av benchmarks som täcker bildförståelse, videoförståelse, temporal grounding, spatialt resonemang och streaming. Jämfört med Qwen3-VL-4B — samma 4B-språkryggrad, där endast vision-encodern bytts ut — förbättrar Mage-VL samtliga rapporterade video- och temporal-grounding-benchmarks, med de största vinsterna på lokaliseringsintensiva uppgifter: +22,5 på Timelens-QVHighlight, +17,1 på ActivityNet, +11,0 på VSI-Bench, +24,5 på VideoEval-Pro. Modellen rapporterar DocVQA 95,14, MMStar 67,32 och CrossPoint 80,00 på bildsidan, VideoMME 64,0 och LongVideoBench 61,3 på video, samt en totalpoäng på 64,00 i OVO-Bench bland streamingarkitekturer. Alla dessa siffror är Microsoft-rapporterade och ingen av dem har reproducerats oberoende — men de finns, de är många, och de är internt konsistenta över en ovanligt bred uppsättning uppgifter.
Sports Tennis rapporterar ingenting. Dess kort dokumenterar en testpartition med 12 fullständigt undanhållna matcher med 2 689 klipp på punktnivå och 80 872 frågor, beskriver poängsättning genom automatiserad flervalsnoggrannhet och LLM-as-judge pass@9, noterar att endast splitten för osedda matcher användes för den rapporterade testningen — och publicerar sedan inget resultat. Dess träningskorpus är verklig och specifik: 1 312 129 fråge- och svarsexempel, 1 226 081 flervalsfrågor och 86 048 öppna frågor, från 43 084 klipp över 239 matcher, märkta enligt 38 annoteringskategorier från sändnings- och baninsamlat material från 2025. Inget av detta går att verifiera utifrån, och de siffror som skulle göra det verifierbart saknas.
Ett förbehåll talar i motsatt riktning, och det är värt att nämna så att detta inte framstår som en ren vinst för Microsoft. SoccerNet är inte tennis. Mage-VLs meriter inom streaming kommer från fotbollssändningsdata under ett specifikt protokoll, och dess demonstration vid världsmästerskapet 2026 är en demonstration. Huruvida den codec-nativa grinden överförs smidigt till tennis – där poäng är korta, frekventa och starkt strukturerade – är otestat. Skillnaden är att Mage-VLs påstående åtminstone är falsifierbart av en tredje part, medan Sports Tennis påstående inte är falsifierbart av någon utan NVIDIAs dataset.

Vad som krävs för att driva dem
Gapet här är ungefär en faktor fem i hårdvara, och det avgör vem som realistiskt kan prova varje modell.
• Sports Tennis — en GPU med cirka 80 GB vid BF16, vikter runt 62 GB. A100 80GB eller H100 80GB som minimum, B200 eller H200 rekommenderas. Ingen kvantiserad checkpoint är publicerad, så det finns ingen billig väg ned. Endast engelska. Runtimes är PyTorch/Transformers plus NeMo och Megatron.
• Mage-VL — cirka 10,6 GB i BF16, vilket gör en 16 GB GPU till den praktiska lägstanivån för bildarbete och 24 GB eller mer för lång video och streaming. Apache-2.0 för Mage-VL och MIT för Mage-ViT, även om familjens arkiv anger att modellerna endast släpps för forskningsändamål. Notera de vassa kanterna: trust_remote_code krävs, det finns ännu ingen serveringsväg för vLLM eller SGLang, och codec-pipelinen behöver FFmpeg eller ffprobe — med den neurala codec-vägen som dessutom kräver DCVC-RT.
Om du vill utvärdera en sportvideomodell den här månaden på ett enda arbetsstationskort är Mage-VL den enda av de två som du faktiskt kan ladda. Det är ett praktiskt omdöme även i avsaknad av ett benchmarkomdöme.

Vilken skulle du sträcka dig efter?
För allt som är live – kommentering, händelsedetektering i en pågående feed, låglatensaviseringar för broadcastvideo – är Microsoft Mage-VL det försvarbara valet i dag: det designades för exakt det, det har streaming-benchmarken som talar för det, och det passar på hårdvara som de flesta team redan äger. För arkivtungt, frågeorienterat arbete specifikt inom tennis – att bygga ett sökbart index över poäng, köra strukturerad analys över tusentals rallyn, ställa frågor där hela poängklippet är den meningsbärande enheten – är NVIDIA:s modell den enda av de två som byggdes för det. Huruvida den gör jobbet bra är, i september 2026, genuint okänt.
Det finns ett tredje alternativ värt att nämna, för det är där de flesta verkliga pipelines hamnar. Om du vill testa den obeprövade specialisten utan att satsa en produktionsväg på den, håll den bakom samma gränssnitt som de modeller du litar på. OrcaRouter erbjuder inte någon av dessa — NVIDIA publicerade vikter utan slutpunkt, och Mage-VL har ingen hostad serveringsväg — så båda är beslut om egen hosting. Vad en enda nyckel som täcker över 200 hostade modeller ger dig är resten av stacken: transkriberings-, sammanfattnings- och applikationsmodellerna runt sportvideokomponenten stannar bakom en enda slutpunkt, med automatisk failover om en leverantör försämras, och de två specialistmodellerna du kör själv är de enda rörliga delarna du äger.
Domen
Microsoft Mage-VL och NVIDIA NemotronLabs AI for Media - Sports Tennis är inte rivaler i den bemärkelse en versus-sida vanligtvis avser. Mage-VL är en publicerad, benchmarkad 4B-strömningsmodell som körs på en arbetsstation och har en verklig demonstration av händelsestyrd sportkommentering. Sports Tennis är en oannonserad, obenchmarkad 31B-specialist på klippnivå som kräver en datacenter-GPU och saknar publicerade bevis för att den fungerar.
Dömer man efter bevisningen vinner Mage-VL på walkover. Dömer man efter tillämpningsområde överlappar de inte. Men det finns en anledning att fortsätta hålla ögonen på NVIDIAs modell: en finjustering av en fryst encoder över 43 084 korrekt annoterade tennispoäng är precis den typ av smal, högkvalitativ vertikal träningsmängd som generalistmodeller inte har, och om NVIDIA någonsin publicerar resultaten från den undanhållna testmängden får frågan om specialist kontra generalist inom sportvideo sitt första riktiga svar. Fram till dess är Mage-VL modellen med bevis och Sports Tennis modellen med ett löfte.
