
Nemotron Sports Tennis vs Microsoft Mage-VL: Dwa sposoby na odczytywanie transmisji sportowej
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Microsoft Mage-VL ma liczbę, na którą można wskazać: w benchmarku czasu reakcji SoccerNet uzyskuje TimVal 55,54 i PR-AUC 9,30, najlepszy pod względem metryk wrażliwych na precyzję, mimo że nigdy nie trenowano go na tym zbiorze danych, a jego autorzy pokazują, jak przesiedzi całą transmisję mundialu 2026, milcząc aż do 29,36 sekundy, gdy zawodnik wychodzi na czystą pozycję, a model generuje komentarz na żywo. NVIDIA NemotronLabs AI for Media - Sports Tennis nie ma natomiast żadnej liczby. To multimodalny model 31B dostrojony na 43 084 klipach punktów tenisowych, który NVIDIA opublikowała we wrześniu 2026 r. z pełnym protokołem oceny na swojej karcie i ani jednym wynikiem z niego.
To nie jest więc bezpośrednie starcie, które można ocenić punktowo. To i tak naprawdę użyteczne porównanie, ponieważ oba modele odpowiadają na to samo pytanie — czy model wizyjno-językowy potrafi śledzić sport na żywo — przyjmując przeciwstawne zakłady architektoniczne, a jeden z tych zakładów opiera się na dowodach, podczas gdy drugi opiera się na opisie danych. Ta asymetria jest tematem artykułu.
Fork: strumień albo klip
Różnica w konstrukcji ma większe znaczenie niż liczba parametrów i wyjaśnia niemal wszystko inne dotyczące tych dwóch modeli.
Microsoft Mage-VL jest zbudowany wokół ciągłego wideo. Jego enkoder wizualny, Mage-ViT, jest trenowany od zera i odczytuje wideo tak, jak robi to kodek: dzieli strumień na klatki zakotwiczenia (I), zachowywane w całości, oraz klatki predykowane (P), w których zachowywane są tylko fragmenty niosące rzeczywisty ruch lub nowe szczegóły, na wspólnej siatce fragmentów 16×16. To zmniejsza liczbę tokenów wizualnych o ponad 75% i według Microsoftu daje nawet 3,5-krotne przyspieszenie wnioskowania w czasie zegarowym w porównaniu z równomiernym próbkowaniem klatek. Na tym opiera się podział na System 1 / System 2: lekka bramka poznawcza ocenia każde okno kroczące i milczy przy rutynowych treściach, wywołując pełny model tylko wtedy, gdy zakończy się zdarzenie warte odpowiedzi. To jeden model wykonujący oba zadania, a nie potok.
Model tenisowy NVIDIA stawia na zupełnie inny zakład. Jego karta wyraźnie stwierdza, że „działa najlepiej, gdy jako dane wejściowe przekazany zostanie pełny klip punktu tenisowego” — od serwisu do końca wymiany, do dwóch minut mp4, z dźwiękiem. Domyślna polityka wnioskowania to 2 klatki na sekundę do 128 klatek, 256 nowych tokenów, dekodowanie zachłanne, wideo plus audio. Nie ma bramki, nie ma trybu strumieniowego, nie ma wyzwalacza zdarzeń. To model odpowiadania na pytania na podstawie ograniczonego klipu: przekazujesz mu punkt, pytasz, co się stało, a on odpowiada.
To nie są dwie implementacje jednego pomysłu. Percepcja strumieniowa i rozumowanie na poziomie klipów to różne produkty. Nadawca chcący komentarza na żywo potrzebuje kształtu Mage-VL. Analityk chcący przeszukiwać archiwum 43 084 punktów potrzebuje kształtu Sports Tennis. Żaden z modeli nie jest zamiennikiem typu drop-in dla zadania drugiego.
Oba są zbudowane na hybrydowym szkielecie — z jedną ważną różnicą
• Parametry — Sports Tennis: łącznie 31B, około 3B aktywnych parametrów na token, hybrydowy MoE typu Mamba2-Transformer. Mage-VL: łącznie 4B, 316M Mage-ViT w parze z dekoderem Qwen3-4B-Instruct-2507.
• Enkodery — Sports Tennis zamraża zarówno enkoder wizyjny C-RADIOv4-H, jak i enkoder mowy Parakeet, oraz dostraja wyłącznie parametry modelu językowego. Mage-VL trenuje cały swój stos wizualny od zera na około 100 mln nieoznaczonych obrazów i filmów, a jedynym wstępnie wytrenowanym komponentem jest model językowy Qwen3.
• Dźwięk — Sports Tennis traktuje dźwięk jako pełnoprawne dane wejściowe i wymienia interpretację wskazówek dźwiękowych wśród swoich 38 kategorii adnotacji. Opublikowany potok przetwarzania Mage-VL jest wizualny; praca SoccerNet dotyczy czasu reakcji na klatkach.
• Modalność wyjściowa — oba generują wyłącznie tekst.
• Efekt mnożnikowy — ponieważ Mage-ViT był tańszy w pretrenowaniu niż wieża wizyjna w skali internetu, Microsoft raportuje trenowanie na wideo 8× dłużej przy tym samym budżecie. Twierdzenie NVIDIA o efektywności jest natomiast architektoniczne: 3 mld aktywnych parametrów na token z 31 mld łącznie.

Gdzie znajdują się dowody
To jest ta część porównania, która nie jest wyrównana, i warto powiedzieć to wprost.
Microsoft Mage-VL to opublikowany model z raportem technicznym, stroną projektu, repozytorium GitHub oraz wachlarzem benchmarków obejmującym rozumienie obrazu, rozumienie wideo, grounding czasowy, rozumowanie przestrzenne i streaming. W porównaniu z Qwen3-VL-4B — ten sam 4B backbone językowy, wymieniono tylko enkoder wizyjny — Mage-VL poprawia wyniki we wszystkich raportowanych benchmarkach wideo i groundingu czasowego, a największe wzrosty osiąga w zadaniach w dużym stopniu opartych na lokalizacji: +22,5 w Timelens-QVHighlight, +17,1 w ActivityNet, +11,0 w VSI-Bench, +24,5 w VideoEval-Pro. Po stronie obrazu podaje DocVQA 95,14, MMStar 67,32 i CrossPoint 80,00, w przypadku wideo VideoMME 64,0 i LongVideoBench 61,3, a wśród architektur strumieniowych osiąga ogólny wynik 64,00 w OVO-Bench. Wszystkie te wyniki są raportowane przez Microsoft i żaden nie został niezależnie odtworzony — ale istnieją, jest ich wiele i są wewnętrznie spójne w niezwykle szerokim zestawie zadań.
Sports Tennis nie raportuje niczego. Jego karta dokumentuje partycję testową obejmującą 12 w pełni odłożonych meczów, 2 689 klipów na poziomie punktów i 80 872 pytań, opisuje ocenianie na podstawie automatycznej dokładności pytań wielokrotnego wyboru oraz pass@9 z oceną LLM jako sędziego, zauważa, że do raportowanych testów użyto wyłącznie podziału z niewidzianymi meczami — a następnie nie publikuje żadnego wyniku. Jego korpus treningowy jest rzeczywisty i konkretny: 1 312 129 przykładów pytań i odpowiedzi, 1 226 081 wielokrotnego wyboru i 86 048 otwartych, z 43 084 klipów z 239 meczów, oznaczonych według 38 kategorii adnotacji z materiałów transmisyjnych i nagrań z kortu z 2025 roku. Niczego z tego nie da się zweryfikować z zewnątrz, a brakuje liczb, które pozwoliłyby to zweryfikować.
Jest jednak jedno zastrzeżenie, które działa w przeciwną stronę, i warto je nazwać, żeby nie brzmiało to jak jednoznaczne zwycięstwo Microsoftu. SoccerNet to nie tenis. Referencje Mage-VL w zakresie streamingu pochodzą z danych transmisji piłkarskich w ramach określonego protokołu, a jego demonstracja na mundialu 2026 to demonstracja. To, czy bramka natywna dla kodeka przenosi się bezproblemowo na tenis — gdzie punkty są krótkie, częste i silnie ustrukturyzowane — pozostaje nieprzetestowane. Różnica polega na tym, że twierdzenie Mage-VL jest przynajmniej falsyfikowalne przez stronę trzecią, a twierdzenie Sports Tennis nie jest falsyfikowalne przez nikogo, kto nie dysponuje zbiorem danych NVIDIA.

Co jest potrzebne, aby je uruchomić
Ta luka to około pięciokrotna różnica w sprzęcie i decyduje o tym, kto może realistycznie wypróbować każdy model.
• Tenis sportowy — jeden GPU z około 80 GB przy BF16, wagi około 62 GB. A100 80GB lub H100 80GB to minimum, zalecane B200 lub H200. Nie opublikowano skwantyzowanego checkpointu, więc nie ma taniej ścieżki w dół. Tylko język angielski. Środowiska uruchomieniowe to PyTorch/Transformers oraz NeMo i Megatron.
• Mage-VL — około 10,6 GB przy BF16, co czyni GPU 16 GB praktycznym minimum do pracy z obrazami, a 24 GB lub więcej — do długich filmów i streamingu. Apache-2.0 dla Mage-VL i MIT dla Mage-ViT, choć repozytorium rodziny modeli podaje, że modele udostępniono wyłącznie do celów badawczych. Uwaga na haczyki: trust_remote_code jest wymagane, nie ma jeszcze ścieżki serwowania vLLM ani SGLang, a pipeline kodeka wymaga FFmpeg lub ffprobe — przy czym ścieżka kodeka neuronowego wymaga dodatkowo DCVC-RT.
Jeśli chcesz w tym miesiącu ocenić model wideo sportowego na pojedynczej karcie stacji roboczej, Mage-VL jest jedynym z tych dwóch, który faktycznie możesz załadować. To praktyczny werdykt, nawet przy braku werdyktu z benchmarku.

Po który z nich byś sięgnął?
W przypadku wszystkiego, co dzieje się na żywo — komentarza, wykrywania zdarzeń w działającym strumieniu, alertów o niskim opóźnieniu w wideo transmisji — Microsoft Mage-VL jest dziś wyborem, którego da się obronić: został zaprojektowany dokładnie do tego, ma wyniki benchmarku streamingu, które za nim przemawiają, i mieści się na sprzęcie, który większość zespołów już posiada. W przypadku pracy w dużej mierze archiwalnej, opartej na zapytaniach, konkretnie w tenisie — budowania przeszukiwalnego indeksu punktów, prowadzenia ustrukturyzowanej analizy tysięcy wymian, zadawania pytań, w których cały klip punktu jest jednostką znaczenia — model NVIDIA jest jedynym z tych dwóch, który został do tego zbudowany. Czy radzi sobie z tym dobrze, na dzień września 2026 roku pozostaje całkowicie nieznane.
Jest jeszcze trzecia opcja warta wymienienia, bo to na niej kończy większość rzeczywistych pipeline'ów. Jeśli chcesz wypróbować nieudowodnionego specjalistę, nie stawiając na niego ścieżki produkcyjnej, trzymaj go za tym samym interfejsem co modele, którym ufasz. OrcaRouter nie oferuje żadnego z nich — NVIDIA opublikowała wagi bez endpointu, a Mage-VL nie ma hostowanej ścieżki serwowania — więc oba przypadki to decyzje o self-hostingu. Co daje jeden klucz obejmujący ponad 200 hostowanych modeli, to reszta stosu: modele transkrypcji, streszczania i aplikacji wokół komponentu wideo sportowego pozostają za jednym endpointem, z automatycznym przełączaniem awaryjnym, jeśli dostawca zacznie działać gorzej, a dwa modele specjalistyczne, które uruchamiasz samodzielnie, to jedyne ruchome części, które należą do ciebie.
Werdykt
Microsoft Mage-VL i NVIDIA NemotronLabs AI for Media - Sports Tennis nie są rywalami w znaczeniu, jakie zwykle ma strona typu versus. Mage-VL to opublikowany, poddany benchmarkom, 4B model strumieniowy, który działa na stacji roboczej i ma prawdziwą demonstrację komentarza sportowego wyzwalanego zdarzeniami. Sports Tennis to nieogłoszony, niepoddany benchmarkom, 31B specjalista na poziomie klipów, który wymaga GPU dla centrów danych i nie ma żadnych opublikowanych dowodów, że działa.
Sądząc po dowodach, Mage-VL wygrywa walkowerem. Sądząc po zakresie, nie zachodzą na siebie. Ale jest powód, by nadal obserwować model NVIDIA: dostrojenie zamrożonego enkodera na 43 084 poprawnie oznaczonych punktach tenisowych to dokładnie ten rodzaj wąskiego, wysokiej jakości, branżowego zbioru treningowego, którego nie mają modele ogólnego przeznaczenia, a jeśli NVIDIA kiedykolwiek opublikuje wyniki na odłożonym zbiorze, pytanie specjalista kontra generalista w wideo sportowym doczeka się pierwszej prawdziwej odpowiedzi. Do tego czasu Mage-VL jest modelem z dowodami, a Sports Tennis jest modelem z obietnicą.
