NVIDIA NemotronLabs AI for Media - Sports Tennis와 Microsoft Mage-VL을 비교하는 생성형 히어로 카드로, 한쪽에는 경계가 정해진 테니스 포인트 클립을, 다른 쪽에는 강조된 이벤트 마커가 있는 연속 필름스트립을 보여주며, 세 개의 대비 칩에는 클립 vs 스트림, 공개된 점수 없음 vs SoccerNet 점수, 80 GB 하한 vs 16 GB 하한이 적혀 있고, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL: 스포츠 중계를 읽는 두 가지 방법

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Microsoft Mage-VL에는 가리킬 수 있는 수치가 있다: SoccerNet 응답 타이밍 벤치마크에서 TimVal 55.54와 PR-AUC 9.30을 기록했고, 해당 데이터셋으로 학습된 적이 전혀 없음에도 정밀도에 민감한 지표에서 최고 성능을 냈다. 또한 저자들은 이 모델이 2026 월드컵 중계를 지켜보며 29.36초까지 침묵하다가, 선수가 돌파하자 실시간 해설을 내보내는 모습을 시연한다. NVIDIA NemotronLabs AI for Media - Sports Tennis에는 아무런 수치도 없다. 이 모델은 NVIDIA가 2026년 9월에 공개한 31B 멀티모달 모델로, 43,084개의 테니스 포인트 클립으로 미세 조정되었으며, 모델 카드에 전체 평가 프로토콜을 실었지만 그로부터 나온 결과는 단 하나도 없다.

그러니 이것은 점수를 매길 수 있는 일대일 맞대결이 아니다. 그럼에도 이는 진정으로 유용한 비교다. 두 모델이 같은 질문, 즉 비전-언어 모델이 라이브 스포츠를 따라갈 수 있는가라는 질문에 서로 상반된 아키텍처적 베팅으로 답하기 때문이다. 그리고 그중 한쪽 베팅은 증거로 뒷받침되고, 다른 쪽은 데이터 설명으로 뒷받침된다. 그 비대칭성이 바로 이 글이다.

포크: 스트림 또는 클립

설계 차이는 매개변수 수보다 더 중요하며, 이 두 모델에 관한 나머지 거의 모든 것을 설명해 준다.

Microsoft Mage-VL은 연속 비디오를 중심으로 구축되었습니다. 시각 인코더인 Mage-ViT는 처음부터 학습되었으며 코덱이 비디오를 읽는 방식으로 비디오를 읽습니다. 즉, 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분할하고, 앵커 프레임은 전부 유지하며, 예측(P) 프레임에서는 공유된 16×16 패치 그리드 위에서 실제 움직임이나 새로운 세부 정보를 담은 패치만 유지합니다. 이는 시각 토큰을 75% 이상 줄이고, Microsoft에 따르면 균일 프레임 샘플링 대비 최대 3.5배의 실제 추론 속도 향상을 제공합니다. 그 위에 System 1 / System 2 분할이 자리합니다. 가벼운 인지 게이트가 각 롤링 윈도우를 점수화하고 일상적인 콘텐츠에는 침묵하며, 응답할 가치가 있는 이벤트가 완료될 때만 전체 모델을 호출합니다. 이는 두 작업을 모두 수행하는 하나의 모델이며, 파이프라인이 아닙니다.

NVIDIA의 테니스 모델은 완전히 다른 쪽에 베팅한다. 모델 카드에는 "전체 테니스 포인트 클립이 입력으로 전달될 때 가장 잘 작동한다"고 명시되어 있다 — 서브부터 랠리 끝까지, 오디오가 포함된 최대 2분 분량의 mp4. 기본 추론 정책은 최대 128프레임까지 초당 2프레임, 새 토큰 256개, 그리디 디코딩, 비디오 + 오디오다. 게이트도, 스트리밍 모드도, 이벤트 트리거도 없다. 이는 제한된 클립에 대한 질의응답 모델이다: 포인트 하나를 건네주고 무슨 일이 있었는지 물으면, 답을 해준다.

그것들은 하나의 아이디어를 구현한 두 가지 방식이 아니다. 스트리밍 지각과 클립 수준 추론은 서로 다른 제품이다. 라이브 해설을 원하는 방송사에는 Mage-VL의 형태가 필요하다. 43,084개 포인트의 아카이브를 조회하려는 분석가에게는 Sports Tennis의 형태가 필요하다. 어느 모델도 상대방의 작업에 그대로 대체 투입될 수 없다.

둘 다 하이브리드 백본을 기반으로 구축되었습니다 — 한 가지 중요한 차이점이 있습니다

• 파라미터 — Sports Tennis: 총 31B, 토큰당 약 3B 활성, Mamba2-Transformer 하이브리드 MoE. Mage-VL: 총 4B, 316M Mage-ViT와 Qwen3-4B-Instruct-2507 디코더의 조합.

• 인코더 — Sports Tennis는 C-RADIOv4-H 비전 인코더와 Parakeet 음성 인코더를 모두 동결하고 언어 모델 파라미터만 미세 조정합니다. Mage-VL은 약 1억 개의 레이블 없는 이미지와 비디오로 전체 비주얼 스택을 처음부터 학습하며, Qwen3 언어 모델만 사전 학습된 구성 요소입니다.

• 오디오 — Sports Tennis는 오디오를 일급 입력으로 취급하며, 38개 주석 범주 중 하나로 오디오 단서 해석을 나열한다. Mage-VL의 공개된 파이프라인은 시각 기반이고, SoccerNet 작업은 프레임에 대한 응답 타이밍에 관한 것이다.

• 모달리티 출력 — 둘 다 텍스트만 생성합니다.

• 승수 효과 — Mage-ViT가 웹 규모 비전 타워보다 사전 학습 비용이 더 저렴했기 때문에, Microsoft는 동일한 예산으로 8배 더 긴 비디오 학습을 보고했다. 반면 NVIDIA의 효율성 주장은 아키텍처에 근거한다: 총 31B 중 토큰당 3B의 활성 파라미터.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

증거가 자리한 곳

이것은 비교에서 차이가 확연한 부분이며, 분명히 말할 가치가 있다.

Microsoft Mage-VL은 기술 보고서, 프로젝트 페이지, GitHub 저장소, 그리고 이미지 이해, 비디오 이해, 시간적 그라운딩, 공간 추론, 스트리밍을 아우르는 벤치마크 범위를 갖춘 공개된 모델입니다. Qwen3-VL-4B — 동일한 4B 언어 백본, 비전 인코더만 교체 — 와 비교하여, Mage-VL은 보고된 모든 비디오 및 시간적 그라운딩 벤치마크에서 향상되었으며, 특히 지역화가 중요한 작업에서 가장 큰 향상을 보였습니다: Timelens-QVHighlight에서 +22.5, ActivityNet에서 +17.1, VSI-Bench에서 +11.0, VideoEval-Pro에서 +24.5. 이미지 측면에서 DocVQA 95.14, MMStar 67.32, CrossPoint 80.00을 보고하고, 비디오에서 VideoMME 64.0, LongVideoBench 61.3, 그리고 스트리밍 아키텍처 중 OVO-Bench에서 전체 점수 64.00을 보고합니다. 이 모든 수치는 Microsoft가 보고한 것이며 독립적으로 재현된 것은 없습니다 — 하지만 존재하고, 수가 많으며, 비정상적으로 넓은 범위의 작업에 걸쳐 내부적으로 일관성을 보입니다.

Sports Tennis는 아무 결과도 보고하지 않는다. 그 카드는 2,689개의 포인트 단위 클립과 80,872개의 질문을 갖춘, 완전히 홀드아웃된 12개 경기의 테스트 파티션을 기록하고, 자동화된 객관식 정확도와 LLM-as-judge pass@9로 채점한다고 설명하며, 보고된 테스트에는 보지 못한 경기(unseen-match) 분할만 사용되었음을 명시한다 — 그리고는 아무 결과도 공개하지 않는다. 그 훈련 코퍼스는 실제이며 구체적이다: 1,312,129개의 Q&A 예시가 있고, 그중 1,226,081개는 객관식, 86,048개는 개방형이며, 이는 239개 경기에 걸친 43,084개 클립에서 나왔고, 2025년 방송 및 코트 캡처 영상에서 38개 주석 범주에 따라 라벨링되었다. 그중 어느 것도 외부에서 검증할 수 없으며, 검증을 가능하게 할 수치들은 빠져 있다.

한 가지 유의점은 반대 방향으로 작용하며, 이것이 Microsoft의 완전한 승리처럼 읽히지 않도록 짚고 넘어갈 가치가 있다. SoccerNet은 테니스가 아니다. Mage-VL의 스트리밍 자격은 특정 프로토콜에 따른 축구 중계 데이터에서 비롯되며, 2026 World Cup 시연은 시연일 뿐이다. 코덱 네이티브 게이트가 테니스로 깔끔하게 전이되는지 — 테니스에서는 포인트가 짧고 빈번하며 고도로 구조화되어 있다 — 는 검증되지 않았다. 차이는 Mage-VL의 주장은 적어도 제3자가 반증할 수 있는 반면, Sports Tennis의 주장은 NVIDIA의 데이터셋 없이는 누구도 반증할 수 없다는 점이다.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

그것들을 운영하는 데 필요한 것

여기서의 격차는 하드웨어상 대략 5배이며, 이는 누가 각 모델을 현실적으로 시도해 볼 수 있는지를 결정합니다.

• Sports Tennis — BF16 기준 약 80GB GPU 한 장, 가중치는 약 62GB입니다. 최소 A100 80GB 또는 H100 80GB, B200 또는 H200 권장. 양자화된 체크포인트가 공개되지 않아 더 저렴하게 낮출 경로가 없습니다. 영어만 지원합니다. 런타임은 PyTorch/Transformers에 NeMo와 Megatron을 더한 것입니다.

• Mage-VL — BF16 기준 약 10.6GB로, 이미지 작업에는 16GB GPU가 실질적인 최소 사양이고, 긴 영상과 스트리밍에는 24GB 이상이 필요합니다. Mage-VL은 Apache-2.0, Mage-ViT는 MIT이지만, 패밀리 리포지토리에는 이 모델들이 연구 목적으로만 공개되었다고 명시되어 있습니다. 까다로운 점에 주의하세요: trust_remote_code가 필요하며, 아직 vLLM이나 SGLang 서빙 경로가 없고, 코덱 파이프라인에는 FFmpeg 또는 ffprobe가 필요합니다 — 신경 코덱 경로에는 추가로 DCVC-RT가 필요합니다.

이번 달에 워크스테이션 카드 한 장에서 스포츠 영상 모델을 평가하려는 경우, Mage-VL은 둘 중 실제로 로드할 수 있는 유일한 모델입니다. 이는 벤치마크 판정이 없는 상황에서도 내릴 수 있는 실용적인 결론입니다.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

어느 것을 고르시겠어요?

라이브 작업 — 해설, 실행 중인 피드에서의 이벤트 감지, 방송 영상에 대한 저지연 알림 — 에서는 Microsoft Mage-VL이 오늘날 방어 가능한 선택입니다. 바로 그런 용도로 설계되었고, 이를 뒷받침할 스트리밍 벤치마크가 있으며, 대부분의 팀이 이미 보유한 하드웨어에 맞기 때문입니다. 특히 테니스에서 아카이브가 많고 질의 형태인 작업 — 검색 가능한 포인트 인덱스 구축, 수천 개의 랠리에 걸친 구조화된 분석 실행, 포인트 클립 전체가 의미 단위인 질문하기 — 에 대해서는 NVIDIA의 모델이 둘 중 그 용도로 만들어진 유일한 모델입니다. 그것이 그 일을 잘하는지는 2026년 9월 현재 진정으로 알 수 없습니다.

세 번째 선택지가 있는데, 이름을 붙일 가치가 있습니다. 대부분의 실제 파이프라인이 결국 여기에 도착하기 때문입니다. 검증되지 않은 전문 모델을 프로덕션 경로에 걸지 않고 시험해 보고 싶다면, 신뢰하는 모델들과 같은 인터페이스 뒤에 두면 됩니다. OrcaRouter는 이 둘 중 어느 것도 제공하지 않습니다 — NVIDIA는 엔드포인트 없이 가중치를 공개했고, Mage-VL은 호스팅 서빙 경로가 없습니다 — 따라서 둘 다 자체 호스팅 결정입니다. 200개 이상의 호스팅 모델을 아우르는 단일 키가 사 주는 것은 나머지 스택입니다. 스포츠 영상 구성 요소를 둘러싼 전사, 요약, 애플리케이션 모델이 하나의 엔드포인트 뒤에 머물고, 제공자가 성능이 저하되면 자동 장애 조치가 이루어지며, 직접 운영하는 두 전문 모델만이 여러분이 소유한 움직이는 부품입니다.

평결

Microsoft Mage-VL과 NVIDIA NemotronLabs AI for Media - Sports Tennis는 VS 페이지가 보통 의미하는 그런 의미의 라이벌이 아니다. Mage-VL은 공개되고 벤치마크된 4B 스트리밍 모델로, 워크스테이션에서 실행되며 이벤트 게이팅 방식의 스포츠 해설에 대한 실제 데모를 갖추고 있다. Sports Tennis는 발표되지도, 벤치마크되지도 않은 31B 클립 수준 특화 모델로, 데이터센터 GPU가 필요하고 작동한다는 공개된 증거가 없다.

증거로 판단하면 Mage-VL이 몰수승을 거둔다. 범위로 판단하면 둘은 겹치지 않는다. 하지만 NVIDIA의 모델을 계속 지켜볼 이유가 있다: 43,084개의 정확하게 주석이 달린 테니스 포인트에 대한 동결 인코더 미세 조정은 범용 모델이 갖지 못한 좁고 고품질의 수직적 훈련 세트의 바로 그런 종류이며, NVIDIA가 언젠가 홀드아웃 결과를 공개한다면 스포츠 비디오에서 전문가 대 범용 모델이라는 질문이 처음으로 진짜 답을 얻게 된다. 그때까지 Mage-VL은 증거를 가진 모델이고 Sports Tennis는 약속을 가진 모델이다.