NVIDIA NemotronLabs AI for Media - Sports Tennis 모델을 위해 생성된 타이틀 카드로, 모델 이름, 총 31B(활성 약 3B), 256k 컨텍스트, 비디오 + 오디오 + 이미지 + 텍스트 입력을 표시하는 세 개의 칩, 평면 테니스 코트 라인 다이어그램, 그리고 오른쪽 아래 모서리의 OrcaRouter 로고를 보여줍니다.
Engineering & Research

조용히 출시된 NVIDIA NemotronLabs AI for Media - Sports Tennis: 리포지토리가 말하는 것과, 말하지 않는 것

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

NVIDIA NemotronLabs AI for Media - Sports Tennis는 테니스 포인트에 관한 질문에 답하는 31B 멀티모달 모델인데, 2026년 9월 11일 기준으로 그 존재를 알아차린 사람은 거의 없다. 이 저장소는 2026년 9월 1일 Hugging Face에 등장했고, 모델 카드에는 공개일이 09/10/2026으로 적혀 있다. NVIDIA 블로그 글도, 기술 보고서도, 언론 보도도, 리더보드 등재도, 가격 페이지도 없다. 우리가 확인했을 때 허브 다운로드 카운터는 2를 가리키고 있었다. 이것은 잘못된 런칭이 아니라, NVIDIA가 공지하지 않은 릴리스다. 아마도 누군가가 사용하기를 의도했을 모델인데도 말이다.

"가중치가 존재한다"와 "벤더가 뭔가를 말했다" 사이의 그 간극이 여기서는 이야기의 전부이므로, 이 글은 저장소가 실제로 문서화한 내용에만 충실하고 어디서 멈추는지를 분명히 밝힙니다. 아래에서 NVIDIA 자체 수치라고 표시된 모든 내용은 모델 카드에서 나온 것이며, 이 모델에 대해 인용할 독립적인 평가는 존재하지 않으므로 없습니다.

NVIDIA가 실제로 공개한 것

이 카드는 아무도 발표하지 않은 것치고는 유난히 상세하다. 이것이 확립하는 내용은 다음과 같다:

• 베이스 모델 — nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16의 파인튜닝으로, 이 모델 자체는 NVIDIA가 2026년 4월에 공개한 옴니모달 릴리스입니다. 테니스 모델은 처음부터 새로 시작하는 대신 그 아키텍처를 물려받습니다.

• 아키텍처 — Mamba2-Transformer 하이브리드 전문가 혼합(MoE)으로, 총 31B 파라미터에 토큰당 약 3B가 활성화되며 최대 256k 토큰의 컨텍스트를 지원합니다. Hub 사이드바에는 모델 크기가 33B로 표시되어 있는데 카드 본문에는 31B라고 적혀 있습니다. 카드에서는 이 불일치를 해소해 주지 않으며, 이는 문서 검토 없이 출시되었다는 여러 작은 징후 중 하나입니다.

• 인코더 — 이미지 및 비디오 프레임에는 C-RADIOv4-H, 오디오에는 Parakeet.동결된 상태로 파인튜닝이 진행되었으며, 언어 모델 파라미터만 학습되었습니다.

• 학습 데이터 — 독점적이라고 설명된 NVIDIA 사내 테니스 데이터셋: 239개 경기에 걸친 43,084개의 포인트 단위 비디오 클립에서 추출한 1,312,129개의 질문-답변 예시(객관식 1,226,081개, 개방형 86,048개)로, 38개 주석 범주에 따라 라벨링되었습니다. 수집 시기는 2025년으로 명시되어 있습니다.

• 평가 설정 — 보고된 테스트 세트는 "Test (unseen matches)" 분할입니다: 완전히 홀드아웃된 경기 12개, 클립 2,689개, Q&A 예시 80,872개로 구성되며, 자동 객관식 정확도와 개방형 측면에서 LLM-as-judge pass@9로 채점됩니다. 이 카드에는 "seen matches" 분할이 존재하며 보고된 수치에 사용된 것은 아니라고 명시되어 있는데, 이는 대부분의 카드가 신경 쓰지 않는 더 신중한 공개입니다.

• 라이선스 — OpenMDW-1.1, 카드에는 해당 모델이 상업적 및 비상업적 용도로 사용 가능하다고 명시되어 있습니다.

• 런타임과 하드웨어 — PyTorch와 Hugging Face Transformers, 그리고 NeMo와 Megatron. NVIDIA는 A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor, RTX 5090 전반에 걸쳐 테스트 하드웨어를 나열합니다.

• 어떻게 만들어졌는가 — 이 카드는 NVIDIA Sports Intelligence playbooks를 언급한다. 이는 스포츠 영상과 주석을 특화된 멀티모달 모델로 바꾸기 위해 NVIDIA가 공개하는 공개 레시피 모음이다. 그 링크는 이번 릴리스에 있는 발표에 가장 가까운 것이다.

A generated single-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis — the scoreboard' listing six rows: Release September 2026 unannounced, Total parameters 31B with about 3B active, Context 256k tokens, Inputs video audio image text, Published benchmark scores none, and GPU floor 1 x 80 GB, with a footer reading 'Figures per NVIDIA's model card; no independent evaluation exists.'

레포지토리가 말하지 않는 것

누락은 포함보다 더 중요합니다. 왜냐하면 바로 그 누락이 이 모델을 외부에서 평가하지 못하게 막는 것이기 때문입니다.

숫자가 없습니다. 단 하나도요. 카드는 평가 방법론을 세 개의 개별 섹션 — 훈련 데이터셋, 테스트 데이터셋, 평가 데이터셋 — 으로 설명한 다음, 그 어느 것에서도 결과를 공개하지 않습니다. MCQ 정확도도, 심사위원 통과율도, 그 38개 범주에 걸친 범주별 분석도, 심지어 단 하나의 대표 수치도 없습니다. NVIDIA는 모델을 어떻게 측정했는지는 정확히 설명하면서도 점수가 어땠는지는 밝히지 않습니다. 그것은 나쁜 결과와 같은 것이 아닙니다. 그것은 그저 알 수 없음이며, 이번 릴리스를 제품이라기보다 미완성으로 취급해야 하는 가장 큰 단일 이유입니다.

기술 보고서나 논문이 없습니다. 훈련 설명과 대조해 확인할 자료도 없고, 테니스 파인튜닝이 기본 Nemotron 3 Nano Omni 대비 무엇을 추가했는지에 대한 어블레이션도 없으며, 비전 및 오디오 인코더는 왜 동결된 채로 남겨두고 언어 모델만 변경했는지에 대한 설명도 없습니다.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table (31B total parameters, about 3B active, 256k context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, minimum one A100 80GB or H100 80GB), the openmdw-1.1 licence, and a sidebar reading 'Downloads last month 2', 'Model size 33B params', 'This model isn't deployed by any Inference Provider', and an AI for Media collection containing one item.

API도 없고, 호스팅된 엔드포인트도 없으며, 가격도 없습니다. 이것은 자체 호스팅 전용이며, Hub는 이를 분명히 밝힙니다: Inference Providers 아래에서 페이지에는 "이 모델은 어떤 Inference Provider에서도 배포되지 않았습니다."라고 적혀 있습니다. 카드의 배포 섹션에 따르면 BF16에서 약 80GB 메모리를 갖춘 단일 GPU가 필요하며, 가중치는 약 62GB입니다. 이는 최소 A100 80GB 또는 H100 80GB이고, B200 또는 H200이 권장됩니다. 호출할 것도, 사용량을 측정할 것도 없습니다.

이 이름은 현재 모델 하나뿐인 패밀리를 가리킨다. "AI for Media - Sports Tennis"는 실제로 실체가 있는 무언가, 즉 이 모델이 속한 Hub의 "AI for Media" 컬렉션을 가리키긴 하지만, 그 컬렉션에는 정확히 하나의 항목, 바로 이 모델만 들어 있고 NVIDIA는 형제 모델이나 로드맵에 대해 아무것도 말하지 않는다. 따라서 이 명명은 의도의 진정한 신호이며, 아직 하나의 라인에 대한 증거는 아니다.

그리고 여기서 "조용하다"가 무엇을 뜻하는지에 대한 설명은 없다. 전체 데이터셋 설명과 평가 프로토콜을 갖추고 가중치를 공개했지만 결과는 내놓지 않은 벤더가 모델을 숨기고 있는 것은 아니다. 오히려 논문이 나오기 전에 먼저 세상에 나온 연구 산출물처럼 보인다. 이 카드 자체의 예시 프롬프트에는 2025년 경기 영상에 등장하는 실제 선수들 — 질 테이히만과 빅토리아 음보코 — 의 이름이 나오는데, 이는 2025년 데이터 수집 기간과 그 이후 몇 달에 걸쳐 만들어진 모델과 부합한다.

테니스 모델이 대체 왜 필요할까

이번 릴리스에서 흥미로운 점은 모델이 아니다. 그것이 가리키는 방향이다.

31B 멀티모달 모델을 43,084개의 포인트 단위 클립으로 미세 조정한 것은 버티컬 제품이지, 범용 역량을 겨냥한 승부수가 아니다. 이 모델은 어떤 면에서도 프런티어 채팅 모델과 경쟁하지 않으며, 그럴 의도도 없다. 이 모델은 오디오와 함께 테니스 한 포인트 전체, 즉 서브부터 랠리 끝까지를 읽고, 샷 역학, 코트 포지셔닝, 선수 움직임, 경기 상태, 규칙, 오디오 단서에 관한 구조화된 질문에 답한다. 모델 카드는 전체 포인트 클립을 입력으로 전달할 때 가장 잘 작동한다고 분명히 밝히는데, 이는 실제 제약이며 동시에 의도된 소비자에 대한 선언이기도 하다. 즉 방송 또는 아카이브 영상을 대규모로 처리하는 사람, 혹은 코칭 및 분석 파이프라인이다.

NVIDIA는 그 사다리를 한동안 공개적으로 구축해 왔다. Sports Intelligence 플레이북은 같은 형태를 설명한다 — 선수 움직임, 공 궤적, 코트 지오메트리, 이벤트 타이밍을 보존하는 비디오·오디오 우선 파인튜닝과, 질문 클래스별 지표 및 LLM-as-judge 스코어링을 통한 도메인 특화 평가를 말이다. 테니스 모델은 독점 데이터셋에 그 레시피를 따랐을 때 나오는 결과물이다. 전략적 해석은 NVIDIA가 옴니모달 기반 + 버티컬 데이터셋 + 플레이북 = 배포 가능한 전문 모델임을 보여주고 있으며, 이를 스포츠별, 리그별, 방송사별로 할 수 있다는 것이다.

그게 계획이라면, 빠진 벤치마크는 이상한 누락이다 — 자랑할 수치가 하나도 없는 쇼케이스 모델이라니. 그래서 가장 유력한 설명은 시시한 것이다: 아티팩트는 공개되었지만, 그에 딸린 설명문은 공개되지 않았다.

운영하는 데 드는 비용, 그리고 그것이 결정을 좌우하는 이유

이 모델에 관한 실질적인 사실은 하드웨어 하한선이다. 대략 62GB의 BF16 가중치와 80GB GPU 한 대라는 명시된 요구사항은 H100, A100 80GB, B200 또는 H200을 뜻하지, 워크스테이션 카드는 아니다. 해당 카드 자체의 기본 추론 정책은 최대 128프레임까지 초당 2프레임, 256개의 새 토큰, 그리디 디코딩, 비디오+오디오다. BF16 가중치와 함께 공개된 양자화 체크포인트는 없는데, 이는 2026년 릴리스로서는 이례적이며 24GB 카드에서 4비트 빌드가 열어 줄 저렴한 경로를 막아 버린다.

솔직히 말하면, 이것은 테스트해 보고 싶다면 데이터센터 하드웨어에서 실행하는 연구용 아티팩트입니다. H100을 이미 여유분으로 보유한 팀이라면, 62GB를 다운로드하는 것이 NVIDIA의 테니스 모델이 쓸 만한지 알아보는 데 드는 전체 비용입니다. 그리고 아무도 점수를 공개하지 않았기 때문에, 현재로서는 그 테스트만이 알 수 있는 유일한 방법입니다.

그것은 또한 라우팅 계층이 존재 가치를 입증하는 지점이기도 하지만, 일반적인 방식은 아니다. OrcaRouter는 이 모델을 제공하지 않으며, 그렇지 않은 척하지도 않겠다 — NVIDIA가 호스팅 엔드포인트를 공개하지 않았으므로, 라우팅할 대상이 없다. 200개 이상의 모델을 위한 단일 API가 여기서 실제로 유용한 점은 주변 문제다: 테니스나 스포츠 영상 파이프라인을 구축하고 있다면, 포인트 수준 추론을 수행하는 모델은 하나의 구성 요소이고, 나머지 스택 — 전사, 요약, 검색, 애플리케이션 계층 — 은 호스팅되는 모델들이 담당한다. 전체 파이프라인을 하나의 키 뒤에 두고 제공자 간 자동 장애 조치를 적용한다는 것은, 검증되지 않은 31B 전문 모델이 두 번째 계약과 두 번째 자격 증명 집합 뒤가 아니라 이미 보유한 인터페이스 뒤에 위치할 수 있다는 뜻이다.

볼 것

네 가지 요소가 이것을 고요한 유물에서 이야기로 바꿔 놓을 텐데, 그중 어느 것이든 다시 찾아올 가치가 있다.

• 평가 수치가 공개되는 시점 — 기술 보고서 형태든, 카드 업데이트 형태든. 그때까지는 "작동하는가"라는 질문에 외부에서는 답할 수 없다.

• 형제 프로젝트. 만약 "Sports Tennis"가 AI-for-Media 스포츠 라인에서 하나의 항목이라면, 다음 저장소는 제품화 가설을 확인해 주고 NVIDIA가 어떤 버티컬에 전용 파인튜닝을 할 가치가 있다고 보는지 알려 줄 것이다.

• 어떤 발표든, 그 어떤 발표라도 — 블로그 글, GTC 세션, 고객 사례. 라이브 영상에서 선수, 공, 이벤트 데이터를 추출하는 Sports Intelligence 플레이북과 Stats Perform의 작업은 NVIDIA가 배포를 내세울 수 있는 확실한 지점을 제공한다.

• 양자화된 가중치 또는 서빙 통합. 4비트 빌드나 vLLM 레시피가 있다면 이 모델은 워크스테이션 GPU 한 장으로도 접근 가능해져, 현실적으로 이를 시도할 수 있는 사람이 누구인지가 달라질 것입니다.

A generated two-panel infographic headed 'Published' and 'Not published'. The Published panel lists weights in BF16, 1.31M Q&A over 43,084 clips, a held-out test protocol of 12 unseen matches, and the OpenMDW-1.1 licence. The Not published panel lists any benchmark score, technical report, hosted endpoint, and quantized checkpoint, with a footer reading 'Assessed from NVIDIA's model card, September 11, 2026.'

그중 하나가 실현되기 전까지, NVIDIA NemotronLabs AI for Media - Sports Tennis에 대한 정확한 설명은 좁고 화려하지 않다: 실제 모델, 실제 가중치, 실제 훈련 세트, 실제 평가 프로토콜, 게시된 결과 없음, 발표 없음, 그리고 한눈에 읽을 수 있는 다운로드 수. 그것이 존재한다는 것은 알아 둘 가치가 있다. 아직 그것을 전제로 계획을 세울 가치는 없다.