Una hero card generata che confronta NVIDIA NemotronLabs AI for Media - Sports Tennis e Microsoft Mage-VL, che mostra da un lato una clip delimitata di un punto di tennis e dall'altro una filmstrip continua con un indicatore di evento evidenziato, con tre chip di contrasto che recitano clip vs stream, nessun punteggio pubblicato vs punteggi SoccerNet, e un minimo di 80 GB vs un minimo di 16 GB, e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL: due modi per leggere una trasmissione sportiva

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Microsoft Mage-VL ha un numero che puoi indicare: sul benchmark response-timing di SoccerNet registra un TimVal di 55,54 e un PR-AUC di 9,30, il migliore sulle metriche sensibili alla precisione nonostante non sia mai stato addestrato su quel dataset, e i suoi autori dimostrano che resta in ascolto durante una trasmissione dei Mondiali 2026 rimanendo silenzioso fino a 29,36 secondi, quando un giocatore si infortuna e il modello avvia la telecronaca live. NVIDIA NemotronLabs AI for Media - Sports Tennis non ha alcun numero. È un modello multimodale da 31B messo a punto su 43.084 clip di punti di tennis che NVIDIA ha pubblicato a settembre 2026 con un protocollo di valutazione completo sulla sua scheda e nemmeno un risultato da esso.

Quindi non è un testa a testa che si possa valutare con un punteggio. È comunque un confronto davvero utile, perché i due modelli rispondono alla stessa domanda — un modello visione-linguaggio può seguire uno sport dal vivo? — con scommesse architetturali opposte, e una di queste scommesse è sostenuta da prove, mentre l'altra è sostenuta da una descrizione dei dati. Quella asimmetria è l'articolo.

Il bivio: uno stream o una clip

La differenza di progettazione conta più del numero di parametri, e spiega quasi tutto il resto di questi due modelli.

Microsoft Mage-VL è costruito attorno al video continuo. Il suo encoder visivo, Mage-ViT, è addestrato da zero e legge il video come fa un codec: suddivide un flusso in frame anchor (I), mantenuti integralmente, e frame predetti (P), in cui vengono conservate solo le patch che contengono movimento reale o nuovi dettagli, su una griglia condivisa di patch 16×16. Ciò riduce i token visivi di oltre il 75% e, secondo Microsoft, produce fino a 3,5× di accelerazione nell'inferenza in tempo reale rispetto al campionamento uniforme dei frame. Al di sopra di ciò si colloca una suddivisione Sistema 1 / Sistema 2: un gate cognitivo leggero valuta ogni finestra scorrevole e resta silenzioso sui contenuti di routine, invocando il modello completo solo quando si completa un evento meritevole di risposta. È un unico modello che svolge entrambi i compiti, non una pipeline.

Il modello di tennis di NVIDIA fa una scelta completamente opposta. La sua scheda specifica esplicitamente che "funziona meglio quando viene passato in input un clip completo di un punto di tennis" — dal servizio fino alla fine dello scambio, fino a due minuti di mp4, con audio. La policy di inferenza predefinita è 2 frame al secondo fino a 128 frame, 256 nuovi token, decodifica greedy, video più audio. Non c'è alcun gate, nessuna modalità streaming, nessun trigger di eventi. È un modello di question-answering su una clip delimitata: gli passi un punto, chiedi cosa è successo, e lui te lo dice.

Non sono due implementazioni di un'unica idea. La percezione in streaming e il ragionamento a livello di clip sono prodotti diversi. Un'emittente che vuole commento in diretta ha bisogno della forma di Mage-VL. Un analista che vuole interrogare un archivio di 43.084 punti ha bisogno della forma di Sports Tennis. Nessuno dei due modelli è un sostituto diretto per il lavoro dell'altro.

Entrambi si basano su un backbone ibrido — con una differenza importante

• Parametri — Sports Tennis: 31B in totale, circa 3B attivi per token, MoE ibrido Mamba2-Transformer. Mage-VL: 4B in totale, un Mage-ViT da 316M abbinato a un decoder Qwen3-4B-Instruct-2507.

• Encoder — Sports Tennis congela sia l'encoder visivo C-RADIOv4-H sia l'encoder vocale Parakeet e ottimizza solo i parametri del modello linguistico. Mage-VL addestra da zero l'intera pila visiva su circa 100 milioni di immagini e video non etichettati, con il modello linguistico Qwen3 come unica componente preaddestrata.

• Audio — Sports Tennis considera l'audio un input di prima classe ed elenca l'interpretazione dei segnali audio tra le sue 38 categorie di annotazione. La pipeline pubblicata di Mage-VL è visiva; il lavoro su SoccerNet riguarda la temporizzazione delle risposte sui frame.

• Modalità di output — entrambi producono solo testo.

• Effetto moltiplicatore — poiché Mage-ViT era meno costoso da pre-addestrare rispetto a una torre di visione su scala web, Microsoft riporta un addestramento su video 8× più lungo con lo stesso budget. L'affermazione di efficienza di NVIDIA è invece architetturale: 3B parametri attivi per token su 31B totali.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

Dove si trovano le prove

Questa è la parte del confronto in cui non c'è partita, e vale la pena dirlo chiaramente.

Microsoft Mage-VL è un modello pubblicato con un rapporto tecnico, una pagina di progetto, un repository GitHub e una serie di benchmark che copre comprensione delle immagini, comprensione dei video, temporal grounding, ragionamento spaziale e streaming. Rispetto a Qwen3-VL-4B — stesso backbone linguistico da 4B, con solo il vision encoder sostituito — Mage-VL migliora su ogni benchmark video e di temporal grounding riportato, con i guadagni maggiori sui compiti a forte componente di localizzazione: +22,5 su Timelens-QVHighlight, +17,1 su ActivityNet, +11,0 su VSI-Bench, +24,5 su VideoEval-Pro. Riporta DocVQA 95,14, MMStar 67,32 e CrossPoint 80,00 sul fronte immagini, VideoMME 64,0 e LongVideoBench 61,3 sul video, e un punteggio complessivo di 64,00 su OVO-Bench tra le architetture di streaming. Tutti questi risultati sono riportati da Microsoft e nessuno è stato riprodotto in modo indipendente — ma esistono, sono numerosi e sono internamente coerenti su un insieme insolitamente ampio di compiti.

Sports Tennis non riporta nulla. La sua scheda documenta una partizione di test di 12 partite completamente escluse con 2.689 clip a livello di punto e 80.872 domande, descrive la valutazione tramite accuratezza automatica a scelta multipla e LLM-as-judge pass@9, osserva che per i test riportati è stata usata solo la suddivisione delle partite non viste — e poi non pubblica alcun risultato. Il suo corpus di addestramento è reale e specifico: 1.312.129 esempi di domande e risposte, 1.226.081 a scelta multipla e 86.048 a risposta aperta, da 43.084 clip in 239 partite, etichettati secondo 38 categorie di annotazione provenienti da riprese televisive e di acquisizione in campo del 2025. Nulla di tutto ciò è verificabile dall'esterno, e mancano i numeri che lo renderebbero verificabile.

Un'avvertenza va nella direzione opposta, e vale la pena menzionarla in modo che non venga interpretata come una vittoria netta per Microsoft. SoccerNet non è tennis. Le credenziali di streaming di Mage-VL derivano da dati di trasmissione calcistica secondo un protocollo specifico, e la sua dimostrazione della Coppa del Mondo 2026 è una dimostrazione. Non è stato testato se il gate codec-native si trasferisca in modo pulito al tennis — dove i punti sono brevi, frequenti e fortemente strutturati. La differenza è che l'affermazione di Mage-VL è almeno falsificabile da una terza parte, e quella di Sports Tennis non è falsificabile da nessuno senza il dataset di NVIDIA.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

Cosa serve per eseguirli

Il divario qui è di circa un fattore cinque nell'hardware, e decide chi può realisticamente provare ciascun modello.

• Sports Tennis — una GPU con circa 80 GB in BF16, pesi intorno a 62 GB. A100 80GB o H100 80GB come minimo, B200 o H200 consigliate. Non è pubblicato alcun checkpoint quantizzato, quindi non c'è una via economica per scendere. Solo inglese. I runtime sono PyTorch/Transformers più NeMo e Megatron.

• Mage-VL — circa 10,6 GB in BF16, il che rende una GPU da 16 GB il minimo pratico per il lavoro sulle immagini e 24 GB o più per video lunghi e streaming. Apache-2.0 per Mage-VL e MIT per Mage-ViT, sebbene il repository della famiglia indichi che i modelli sono rilasciati solo a scopo di ricerca. Attenzione agli aspetti critici: trust_remote_code è obbligatorio, non esiste ancora un percorso di servizio vLLM o SGLang, e la pipeline del codec necessita di FFmpeg o ffprobe — con il percorso del codec neurale che richiede inoltre DCVC-RT.

Se questo mese vuoi valutare un modello per video sportivi su una singola scheda da workstation, Mage-VL è l'unico dei due che puoi effettivamente caricare. Questo è un verdetto pratico anche in assenza di un verdetto da benchmark.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

Quale prenderesti

Per tutto ciò che è in diretta — commento, rilevamento di eventi su un feed in esecuzione, avvisi a bassa latenza su video broadcast — Microsoft Mage-VL è la scelta difendibile oggi: è stato progettato esattamente per questo, ha il benchmark di streaming a sostegno della tesi, e sta su hardware che la maggior parte dei team possiede già. Per il lavoro orientato all'archivio e alle query, specificamente sul tennis — costruire un indice ricercabile dei punti, eseguire analisi strutturate su migliaia di scambi, porre domande in cui l'intero clip del punto è l'unità di significato — il modello di NVIDIA è l'unico dei due che sia stato costruito per questo. Se faccia bene il suo lavoro è, a settembre 2026, genuinamente sconosciuto.

C'è una terza opzione che vale la pena menzionare, perché è dove finiscono la maggior parte delle pipeline reali. Se vuoi provare lo specialista non ancora collaudato senza puntarci un percorso di produzione, tienilo dietro la stessa interfaccia dei modelli di cui ti fidi. OrcaRouter non offre nessuno dei due — NVIDIA ha pubblicato i pesi senza endpoint, e Mage-VL non ha un percorso di serving ospitato — quindi entrambi sono decisioni di self-hosting. Ciò che una singola chiave che copre oltre 200 modelli ospitati ti offre è il resto dello stack: i modelli di trascrizione, riassunto e applicazione attorno al componente per video sportivi restano dietro un unico endpoint, con failover automatico se un provider peggiora, e i due modelli specialistici che esegui tu stesso sono le uniche parti mobili che possiedi.

Il verdetto

Microsoft Mage-VL e NVIDIA NemotronLabs AI for Media - Sports Tennis non sono rivali nel senso in cui una pagina di confronto di solito intende. Mage-VL è un modello di streaming da 4B pubblicato e sottoposto a benchmark che gira su una workstation e ha una dimostrazione reale di commento sportivo con gating di eventi. Sports Tennis è uno specialista a livello di clip da 31B non annunciato e non sottoposto a benchmark che richiede una GPU da datacenter e non porta alcuna prova pubblicata che funzioni.

Giudicando in base alle prove, Mage-VL vince a tavolino. Giudicando in base alla portata, non si sovrappongono. Ma c’è una ragione per continuare a tenere d’occhio il modello di NVIDIA: un fine-tuning con encoder congelato su 43.084 punti tennis annotati correttamente è esattamente il tipo di set di addestramento verticale, ristretto e di alta qualità, che i modelli generalisti non hanno, e se NVIDIA pubblicherà mai i risultati held-out, la questione specialista contro generalista nel video sportivo otterrà la sua prima vera risposta. Fino ad allora, Mage-VL è il modello con le prove e Sports Tennis è il modello con una promessa.