
Nemotron Sports Tennis vs Microsoft Mage-VL: Dua Cara Membaca Siaran Olahraga
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Microsoft Mage-VL memiliki angka yang dapat Anda tunjuk: pada benchmark response-timing SoccerNet, model ini mencatat TimVal 55,54 dan PR-AUC 9,30, terbaik pada metrik yang sensitif terhadap presisi meskipun tidak pernah dilatih pada dataset tersebut, dan para penulisnya mendemonstrasikan model ini menyaksikan siaran Piala Dunia 2026 dan tetap diam hingga 29,36 detik, ketika seorang pemain menerobos dan model tersebut mengeluarkan komentar langsung. NVIDIA NemotronLabs AI for Media - Sports Tennis sama sekali tidak memiliki angka. Model ini adalah model multimodal 31B yang di-fine-tune pada 43.084 klip poin tenis yang diterbitkan NVIDIA pada September 2026 dengan protokol evaluasi lengkap pada kartu modelnya dan tidak ada satu pun hasil darinya.
Jadi ini bukan adu langsung yang bisa diberi skor. Namun, ini tetap perbandingan yang benar-benar berguna, karena kedua model menjawab pertanyaan yang sama — dapatkah model visi-bahasa mengikuti olahraga secara langsung — dengan taruhan arsitektural yang berlawanan, dan salah satu taruhan itu didukung oleh bukti sementara yang lain didukung oleh deskripsi data. Asimetri itulah artikelnya.
Percabangan: stream, atau klip
Perbedaan desain lebih penting daripada jumlah parameter, dan itu menjelaskan hampir semua hal lain tentang kedua model ini.
Microsoft Mage-VL dibangun di sekitar video kontinu. Encoder visualnya, Mage-ViT, dilatih dari awal dan membaca video seperti yang dilakukan codec: ia memecah aliran menjadi frame jangkar (I), yang dipertahankan secara utuh, dan frame prediksi (P), dengan hanya patch yang membawa gerakan nyata atau detail baru yang dipertahankan, pada grid patch 16×16 yang sama. Hal itu memangkas token visual lebih dari 75% dan, menurut Microsoft, menghasilkan percepatan inferensi wall-clock hingga 3,5× dibandingkan pengambilan sampel frame secara seragam. Di atas itu terdapat pemisahan Sistem 1 / Sistem 2: gerbang kognisi ringan menilai setiap jendela bergulir dan tetap diam pada konten rutin, memanggil model penuh hanya ketika peristiwa yang layak direspons selesai. Ini adalah satu model yang menjalankan kedua tugas, bukan pipeline.
Model tenis NVIDIA mengambil taruhan yang sama sekali berbeda. Kartunya secara eksplisit menyatakan bahwa model ini "bekerja paling baik ketika klip poin tenis utuh diberikan sebagai masukan" — dari servis hingga akhir reli, hingga dua menit mp4, dengan audio. Kebijakan inferensi bawaannya adalah 2 frame per detik hingga 128 frame, 256 token baru, dekode greedy, video plus audio. Tidak ada gerbang, tidak ada mode streaming, tidak ada pemicu peristiwa. Ini adalah model tanya jawab atas klip terbatas: Anda memberinya satu poin, Anda bertanya apa yang terjadi, model menjawabnya.
Itu bukan dua implementasi dari satu gagasan. Persepsi streaming dan penalaran tingkat klip adalah produk yang berbeda. Seorang penyiar yang menginginkan komentar langsung membutuhkan bentuk Mage-VL. Seorang analis yang ingin menelusuri arsip berisi 43.084 poin membutuhkan bentuk Sports Tennis. Tidak ada model yang bisa langsung dipakai untuk menggantikan tugas model lainnya.
Keduanya dibangun di atas tulang punggung hibrida — dengan satu perbedaan penting
• Parameter — Sports Tennis: total 31B, sekitar 3B aktif per token, MoE hibrida Mamba2-Transformer. Mage-VL: total 4B, Mage-ViT 316M yang dipasangkan dengan decoder Qwen3-4B-Instruct-2507.
• Encoder — Sports Tennis membekukan baik encoder visi C-RADIOv4-H maupun encoder suara Parakeet dan hanya menyetel halus parameter model bahasa. Mage-VL melatih seluruh stack visualnya dari awal pada sekitar 100 juta gambar dan video tanpa label, dengan model bahasa Qwen3 sebagai satu-satunya komponen yang telah dilatih sebelumnya.
• Audio — Sports Tennis menganggap audio sebagai input kelas utama dan mencantumkan interpretasi isyarat audio di antara 38 kategori anotasinya. Pipeline Mage-VL yang dipublikasikan bersifat visual; karya SoccerNet berkaitan dengan waktu respons pada frame.
• Modalitas keluaran — keduanya hanya menghasilkan teks.
• Efek pengganda — karena Mage-ViT lebih murah untuk tahap prapelatihan dibandingkan menara visi berskala web, Microsoft melaporkan pelatihan pada video 8× lebih lama dengan anggaran yang sama. Klaim efisiensi NVIDIA justru bersifat arsitektural: 3B parameter aktif per token dari total 31B.

Di mana bukti berada
Ini adalah bagian dari perbandingan yang tidak seimbang, dan hal itu layak dinyatakan secara terus terang.
Microsoft Mage-VL adalah model yang telah dipublikasikan dengan laporan teknis, halaman proyek, repositori GitHub, dan cakupan benchmark yang mencakup pemahaman gambar, pemahaman video, temporal grounding, penalaran spasial, dan streaming. Dibandingkan Qwen3-VL-4B — tulang punggung bahasa 4B yang sama, hanya encoder visinya yang diganti — Mage-VL meningkat pada setiap benchmark video dan temporal-grounding yang dilaporkan, dengan keuntungan terbesar pada tugas-tugas yang berat lokalisasi: +22.5 pada Timelens-QVHighlight, +17.1 pada ActivityNet, +11.0 pada VSI-Bench, +24.5 pada VideoEval-Pro. Model ini melaporkan DocVQA 95.14, MMStar 67.32, dan CrossPoint 80.00 di sisi gambar, VideoMME 64.0 dan LongVideoBench 61.3 pada video, serta skor keseluruhan 64.00 pada OVO-Bench di antara arsitektur streaming. Semua itu dilaporkan oleh Microsoft dan tidak ada yang direproduksi secara independen — tetapi semua itu ada, jumlahnya banyak, dan konsisten secara internal di seluruh rangkaian tugas yang luar biasa luas.
Sports Tennis tidak melaporkan apa pun. Kartunya mendokumentasikan partisi uji berisi 12 pertandingan yang sepenuhnya disisihkan dengan 2.689 klip tingkat poin dan 80.872 pertanyaan, menjelaskan penilaian berdasarkan akurasi pilihan ganda otomatis dan LLM-as-judge pass@9, mencatat bahwa hanya split pertandingan yang belum pernah dilihat yang digunakan untuk pengujian yang dilaporkan — lalu tidak menerbitkan hasil apa pun. Korpus pelatihannya nyata dan spesifik: 1.312.129 contoh tanya jawab, 1.226.081 pilihan ganda dan 86.048 jawaban terbuka, dari 43.084 klip di 239 pertandingan, dilabeli menurut 38 kategori anotasi dari rekaman siaran dan tangkapan lapangan tahun 2025. Tidak ada satu pun dari itu yang dapat diverifikasi dari luar, dan angka-angka yang akan membuatnya dapat diverifikasi tidak ada.
Satu catatan mengarah ke sisi sebaliknya, dan perlu disebutkan agar ini tidak terbaca sebagai kemenangan bersih bagi Microsoft. SoccerNet bukan tenis. Kredensial streaming Mage-VL berasal dari data siaran sepak bola di bawah protokol tertentu, dan demonstrasi Piala Dunia 2026-nya hanyalah sebuah demonstrasi. Apakah gerbang native-codec itu dapat dialihkan dengan mulus ke tenis — di mana poin berlangsung singkat, sering, dan sangat terstruktur — masih belum diuji. Perbedaannya adalah klaim Mage-VL setidaknya dapat difalsifikasi oleh pihak ketiga, sedangkan klaim Sports Tennis tidak dapat difalsifikasi oleh siapa pun tanpa dataset NVIDIA.

Apa yang dibutuhkan untuk menjalankannya
Kesenjangan di sini kira-kira sebesar faktor lima dalam hal perangkat keras, dan itu menentukan siapa yang secara realistis dapat mencoba masing-masing model.
• Sports Tennis — satu GPU dengan sekitar 80 GB pada BF16, bobot sekitar 62 GB. A100 80GB atau H100 80GB sebagai batas minimum, B200 atau H200 direkomendasikan. Tidak ada checkpoint terkuantisasi yang dipublikasikan, jadi tidak ada jalur murah untuk menurunkan kebutuhan. Hanya bahasa Inggris. Runtime-nya adalah PyTorch/Transformers plus NeMo dan Megatron.
• Mage-VL — sekitar 10,6 GB pada BF16, yang menjadikan GPU 16 GB sebagai batas praktis untuk pekerjaan gambar dan 24 GB atau lebih untuk video panjang serta streaming. Apache-2.0 untuk Mage-VL dan MIT untuk Mage-ViT, meskipun repositori keluarga tersebut menyatakan bahwa model-model ini dirilis hanya untuk tujuan penelitian. Perhatikan sisi tajamnya: trust_remote_code diwajibkan, belum ada jalur penyajian vLLM atau SGLang, dan pipeline codec memerlukan FFmpeg atau ffprobe — dengan jalur neural-codec yang juga memerlukan DCVC-RT.
Jika Anda ingin mengevaluasi model video olahraga bulan ini pada satu kartu workstation, Mage-VL adalah satu-satunya dari keduanya yang benar-benar dapat Anda muat. Itu adalah penilaian praktis bahkan tanpa adanya penilaian benchmark.

Yang mana yang akan Anda pilih
Untuk apa pun yang live — komentar, deteksi peristiwa pada feed yang sedang berjalan, peringatan latensi rendah pada video siaran — Microsoft Mage-VL adalah pilihan yang bisa dipertahankan saat ini: model ini dirancang tepat untuk itu, ia punya tolok ukur streaming untuk mendukungnya, dan ia cocok di perangkat keras yang sudah dimiliki sebagian besar tim. Untuk pekerjaan yang berat arsip dan berbentuk kueri, khususnya pada tenis — membangun indeks poin yang dapat ditelusuri, menjalankan analisis terstruktur terhadap ribuan rally, mengajukan pertanyaan yang seluruh klip poin menjadi unit maknanya — model NVIDIA adalah satu-satunya dari kedua model itu yang dibangun untuk itu. Apakah model ini melakukannya dengan baik, per September 2026, benar-benar tidak diketahui.
Ada opsi ketiga yang layak disebutkan, karena di situlah sebagian besar pipeline nyata berakhir. Jika Anda ingin mencoba spesialis yang belum terbukti tanpa mempertaruhkan jalur produksi padanya, letakkan ia di balik antarmuka yang sama dengan model yang Anda percayai. OrcaRouter tidak menyediakan keduanya — NVIDIA menerbitkan bobot tanpa endpoint, dan Mage-VL tidak memiliki jalur penyajian terkelola — jadi keduanya adalah keputusan self-hosting. Yang Anda dapatkan dari satu kunci yang mencakup lebih dari 200 model yang dihosting adalah sisa tumpukannya: model transkripsi, peringkasan, dan aplikasi di sekitar komponen video olahraga tetap berada di balik satu endpoint, dengan failover otomatis jika penyedia mengalami penurunan, dan dua model spesialis yang Anda jalankan sendiri adalah satu-satunya komponen bergerak yang Anda miliki.
Putusan
Microsoft Mage-VL dan NVIDIA NemotronLabs AI for Media - Sports Tennis bukanlah rival dalam pengertian yang biasanya dimaksud oleh halaman versus. Mage-VL adalah model streaming 4B yang telah dipublikasikan dan diuji benchmark, berjalan di workstation, dan memiliki demonstrasi nyata komentar olahraga yang dipicu peristiwa. Sports Tennis adalah spesialis tingkat klip 31B yang belum diumumkan dan belum diuji benchmark, membutuhkan GPU pusat data, dan tidak membawa bukti publik bahwa ia berfungsi.
Nilai berdasarkan bukti, dan Mage-VL menang WO. Nilai berdasarkan cakupan, dan keduanya tidak tumpang tindih. Tetapi ada alasan untuk terus mengamati model NVIDIA: fine-tune encoder beku pada 43.084 poin tenis yang dianotasi dengan benar adalah persis jenis kumpulan data pelatihan vertikal yang sempit dan berkualitas tinggi yang tidak dimiliki model generalis, dan jika NVIDIA suatu saat menerbitkan hasil held-out, pertanyaan spesialis versus generalis dalam video olahraga mendapat jawaban nyata pertamanya. Sampai saat itu, Mage-VL adalah model yang punya bukti, dan Sports Tennis adalah model yang punya janji.
