
Nemotron Sports Tennis vs. Microsoft Mage-VL: Zwei Wege, eine Sportübertragung zu lesen
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Microsoft Mage-VL hat eine Zahl, auf die man verweisen kann: Im SoccerNet-Benchmark zur Antwortzeitmessung erzielt es einen TimVal von 55,54 und eine PR-AUC von 9,30 – Bestwerte bei den präzisionssensitiven Metriken, obwohl es nie auf diesem Datensatz trainiert wurde, und seine Autoren zeigen, wie es eine Übertragung der Weltmeisterschaft 2026 durchsitzt und bis 29,36 Sekunden still bleibt, als ein Spieler durchbricht und das Modell Live-Kommentar abfeuert. NVIDIA NemotronLabs AI for Media - Sports Tennis hat überhaupt keine Zahl. Es ist ein multimodales 31B-Modell, feinabgestimmt auf 43.084 Tennis-Punkt-Clips, das NVIDIA im September 2026 mit einem vollständigen Evaluierungsprotokoll auf seiner Modellkarte veröffentlichte – und keinem einzigen Ergebnis daraus.
Das ist also kein direktes Duell, das man mit Punkten bewerten könnte. Trotzdem ist es ein wirklich nützlicher Vergleich, denn die beiden Modelle beantworten dieselbe Frage – kann ein Vision-Language-Modell Live-Sport verfolgen – mit entgegengesetzten architektonischen Wetten, und eine dieser Wetten ist durch Belege gestützt, während die andere durch eine Datenbeschreibung gestützt wird. Diese Asymmetrie ist der Artikel.
Der Fork: ein Stream oder ein Clip
Der Unterschied im Design ist wichtiger als die Parameteranzahl, und er erklärt fast alles andere an diesen beiden Modellen.
Microsoft Mage-VL ist um kontinuierliches Video herum aufgebaut. Sein visueller Encoder, Mage-ViT, wird von Grund auf trainiert und liest Video so, wie ein Codec es tut: Er zerlegt einen Stream in Anker-(I-)Frames, die vollständig beibehalten werden, und vorhergesagte (P-)Frames, bei denen nur die Patches behalten werden, die echte Bewegung oder neue Details tragen, auf einem gemeinsamen 16×16-Patch-Raster. Dadurch werden visuelle Tokens um mehr als 75 % reduziert und laut Microsoft ergibt sich eine bis zu 3,5-fache Beschleunigung der Wall-Clock-Inferenz gegenüber gleichmäßiger Frame-Abtastung. Darüber hinaus gibt es eine System-1-/System-2-Aufteilung: Ein leichtgewichtiges Kognitions-Gate bewertet jedes rollierende Fenster und bleibt bei Routineinhalten still; es ruft das vollständige Modell nur auf, wenn ein antwortwürdiges Ereignis abgeschlossen ist. Es ist ein Modell, das beide Aufgaben erledigt, keine Pipeline.
NVIDIAs Tennis-Modell geht die andere Wette voll und ganz ein. Seine Modellkarte gibt explizit an, dass es „am besten funktioniert, wenn ein vollständiger Tennis-Punkt-Clip als Eingabe übergeben wird“ – vom Aufschlag bis zum Ende des Ballwechsels, bis zu zwei Minuten mp4, mit Audio. Die Standard-Inferenzrichtlinie ist 2 Bilder pro Sekunde bis zu 128 Bilder, 256 neue Tokens, Greedy-Decodierung, Video plus Audio. Es gibt kein Gate, keinen Streaming-Modus, keinen Event-Trigger. Es ist ein Frage-Antwort-Modell über einen begrenzten Clip: Man übergibt ihm einen Punkt, man fragt, was passiert ist, es sagt es einem.
Das sind nicht zwei Implementierungen einer Idee. Streaming-Wahrnehmung und Reasoning auf Clip-Ebene sind unterschiedliche Produkte. Ein Sender, der Live-Kommentar möchte, braucht den Zuschnitt von Mage-VL. Ein Analyst, der ein Archiv mit 43.084 Punkten abfragen möchte, braucht den Zuschnitt von Sports Tennis. Keines der Modelle ist ein Drop-in-Ersatz für die Aufgabe des anderen.
Beide basieren auf einem hybriden Backbone – mit einem wichtigen Unterschied.
• Parameter — Sports Tennis: 31B insgesamt, etwa 3B aktiv pro Token, hybrider Mamba2-Transformer-MoE. Mage-VL: 4B insgesamt, ein 316M Mage-ViT, gepaart mit einem Qwen3-4B-Instruct-2507-Decoder.
• Encoder — Sports Tennis friert sowohl den C-RADIOv4-H-Vision-Encoder als auch den Parakeet-Sprach-Encoder ein und fine-tunt nur die Parameter des Sprachmodells. Mage-VL trainiert seinen gesamten visuellen Stack von Grund auf mit rund 100 Mio. unbeschrifteten Bildern und Videos, wobei das Qwen3-Sprachmodell die einzige vortrainierte Komponente ist.
• Audio — Sports Tennis behandelt Audio als erstklassige Eingabe und führt die Interpretation von Audio-Hinweisen unter seinen 38 Annotationskategorien auf. Mage-VLs veröffentlichte Pipeline ist visuell; die SoccerNet-Arbeit befasst sich mit dem Reaktions-Timing auf Frames.
• Ausgabemodalität — beide erzeugen nur Text.
• Multiplikatoreffekt — weil Mage-ViT günstiger vorzutrainieren war als ein Vision-Tower im Web-Maßstab, berichtet Microsoft, dass unter demselben Budget 8× länger auf Videos trainiert wird. NVIDIAs Effizienzbehauptung ist stattdessen architektonisch: 3B aktive Parameter pro Token von insgesamt 31B.

Wo die Beweise liegen
Dies ist der Teil des Vergleichs, der nicht knapp ausfällt, und es lohnt sich, das deutlich zu sagen.
Microsoft Mage-VL ist ein veröffentlichtes Modell mit einem technischen Bericht, einer Projektseite, einem GitHub-Repository und einem Benchmark-Spektrum, das Bildverständnis, Videoverständnis, temporales Grounding, räumliches Denken und Streaming abdeckt. Gegenüber Qwen3-VL-4B — gleicher 4B-Sprachbackbone, nur der Vision-Encoder ausgetauscht — verbessert Mage-VL jeden berichteten Video- und Temporal-Grounding-Benchmark, mit den größten Zugewinnen bei lokalisierungsintensiven Aufgaben: +22,5 bei Timelens-QVHighlight, +17,1 bei ActivityNet, +11,0 bei VSI-Bench, +24,5 bei VideoEval-Pro. Es meldet DocVQA 95,14, MMStar 67,32 und CrossPoint 80,00 auf der Bildseite, VideoMME 64,0 und LongVideoBench 61,3 bei Video sowie eine Gesamtpunktzahl von 64,00 auf OVO-Bench unter Streaming-Architekturen. Alle diese Angaben stammen von Microsoft und keine davon wurde unabhängig reproduziert — aber sie existieren, sie sind zahlreich und sie sind über eine ungewöhnlich breite Auswahl an Aufgaben hinweg intern konsistent.
Sports Tennis berichtet nichts. Seine Modellkarte dokumentiert eine Testpartition von 12 vollständig zurückgehaltenen Matches mit 2.689 Clips auf Punktebene und 80.872 Fragen, beschreibt die Bewertung anhand automatisierter Multiple-Choice-Genauigkeit und LLM-as-judge pass@9, hält fest, dass für die berichtete Testung nur der Split mit ungesehenen Matches verwendet wurde – und veröffentlicht dann kein Ergebnis. Sein Trainingskorpus ist real und konkret: 1.312.129 Q&A-Beispiele, 1.226.081 Multiple-Choice- und 86.048 offene Beispiele, aus 43.084 Clips über 239 Matches hinweg, mit 38 Annotationskategorien annotiert, aus Übertragungs- und Court-Capture-Material aus dem Jahr 2025. Nichts davon ist von außen überprüfbar, und die Zahlen, die es überprüfbar machen würden, fehlen.
Ein Vorbehalt wirkt in die andere Richtung, und es lohnt sich, ihn zu benennen, damit dies nicht als sauberer Sieg für Microsoft gelesen wird. SoccerNet ist nicht Tennis. Mage-VLs Streaming-Referenzen stammen aus Fußball-Übertragungsdaten unter einem bestimmten Protokoll, und seine Demonstration beim World Cup 2026 ist eine Demonstration. Ob sich das codec-native Gate sauber auf Tennis übertragen lässt – wo Punkte kurz, häufig und stark strukturiert sind –, ist ungetestet. Der Unterschied ist, dass die Behauptung von Mage-VL zumindest von einem Dritten falsifizierbar ist, die von Sports Tennis hingegen von niemandem ohne den Datensatz von NVIDIA.

Was es braucht, um sie zu betreiben
Der Unterschied hier beträgt bei der Hardware grob einen Faktor von fünf, und er entscheidet, wer jedes Modell realistisch ausprobieren kann.
• Sport Tennis — eine GPU mit etwa 80 GB bei BF16, Gewichte rund 62 GB. A100 80GB oder H100 80GB als Untergrenze, B200 oder H200 empfohlen. Es ist kein quantisierter Checkpoint veröffentlicht, es gibt also keinen kostengünstigen Weg nach unten. Nur Englisch. Die Laufzeitumgebungen sind PyTorch/Transformers plus NeMo und Megatron.
• Mage-VL — bei BF16 rund 10,6 GB, was eine 16-GB-GPU als praktische Untergrenze für Bildarbeit und 24 GB oder mehr für lange Videos und Streaming bedeutet. Apache-2.0 für Mage-VL und MIT für Mage-ViT, allerdings gibt das Repository der Familie an, dass die Modelle nur zu Forschungszwecken veröffentlicht wurden. Beachten Sie die Tücken: trust_remote_code ist erforderlich, es gibt noch keinen Serving-Pfad für vLLM oder SGLang, und die Codec-Pipeline benötigt FFmpeg oder ffprobe – wobei der Neuronale-Codec-Pfad zusätzlich DCVC-RT erfordert.
Wenn man diesen Monat ein Sportvideo-Modell auf einer einzelnen Workstation-Karte evaluieren möchte, ist Mage-VL das einzige der beiden, das man tatsächlich laden kann. Das ist ein praktisches Urteil, auch wenn kein Benchmark-Urteil vorliegt.

Zu welchem würdest du greifen?
Für alles, was live ist — Kommentar, Ereigniserkennung in einem laufenden Feed, Alarmierung mit geringer Latenz bei Broadcast-Video — ist Microsoft Mage-VL heute die verteidigbare Wahl: Es wurde genau dafür entworfen, es hat den Streaming-Benchmark, der dafür spricht, und es passt auf Hardware, die die meisten Teams bereits besitzen. Für archivlastige, abfrageorientierte Arbeit speziell im Tennis — den Aufbau eines durchsuchbaren Index von Punkten, strukturierte Analysen über Tausende von Ballwechseln, Fragen, bei denen der gesamte Point-Clip die Bedeutungseinheit ist — ist NVIDIAs Modell das einzige der beiden, das dafür gebaut wurde. Ob es die Aufgabe gut erledigt, ist Stand September 2026 wirklich unbekannt.
Es gibt eine dritte Option, die es wert ist, genannt zu werden, denn dort landen die meisten echten Pipelines. Wenn Sie den noch unbewährten Spezialisten ausprobieren möchten, ohne einen Produktionspfad darauf zu verwetten, halten Sie ihn hinter derselben Schnittstelle wie die Modelle, denen Sie vertrauen. OrcaRouter führt keines von beiden — NVIDIA hat Gewichte ohne Endpunkt veröffentlicht, und Mage-VL hat keinen gehosteten Serving-Pfad —, also sind beides Entscheidungen fürs Selbsthosting. Was ein einziger Schlüssel, der über 200 gehostete Modelle abdeckt, Ihnen verschafft, ist der Rest des Stacks: Die Transkriptions-, Zusammenfassungs- und Anwendungsmodelle rund um die Sportvideo-Komponente bleiben hinter einem einzigen Endpunkt, mit automatischem Failover, falls ein Anbieter schlechter wird, und die beiden Spezialmodelle, die Sie selbst betreiben, sind die einzigen beweglichen Teile, die Ihnen gehören.
Das Urteil
Microsoft Mage-VL und NVIDIA NemotronLabs AI for Media - Sports Tennis sind keine Rivalen in dem Sinne, den eine Versus-Seite üblicherweise meint. Mage-VL ist ein veröffentlichtes, benchmarktes 4B-Streaming-Modell, das auf einer Workstation läuft und eine echte Demonstration ereignisgesteuerter Sportkommentierung bietet. Sports Tennis ist ein nicht angekündigter, nicht gebenchmarkter 31B-Spezialist auf Clip-Ebene, der eine Datacenter-GPU benötigt und für dessen Funktionieren es keinerlei veröffentlichte Belege gibt.
Urteilt man nach den Beweisen, gewinnt Mage-VL durch Aufgabe. Urteilt man nach dem Umfang, überschneiden sie sich nicht. Aber es gibt einen Grund, NVIDIAs Modell weiter zu beobachten: Ein Fine-Tuning mit eingefrorenem Encoder über 43.084 korrekt annotierte Tennis-Punkte ist genau die Art von schmalem, hochwertigem vertikalem Trainingsdatensatz, den generalistische Modelle nicht haben, und wenn NVIDIA jemals die zurückgehaltenen Ergebnisse veröffentlicht, erhält die Frage Spezialist versus Generalist im Sportvideo ihre erste echte Antwort. Bis dahin ist Mage-VL das Modell mit Belegen und Sports Tennis das Modell mit einem Versprechen.
