NVIDIA NemotronLabs AI for Media - Sports Tennis와 InternLumina U2의 비교를 위해 생성된 히어로 카드로, 한쪽에는 테니스 포인트 클립 아이콘이, 다른 쪽에는 텍스트와 이미지가 결합된 출력 스택이 표시되며, 텍스트 출력만 제공하는 31B 전문 모델과 텍스트 및 이미지 출력을 제공하는 16B 통합 모델로 라벨이 붙어 있고, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: 어느 모델도 질 수 없는 비교

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

어느 쪽이 더 나은지 — 미디어용 NVIDIA NemotronLabs AI - 스포츠 테니스와 InternLumina U2 중 어느 것인지 — 묻는다면, 솔직한 답은 그 질문은 결론이 나지 않는다는 것이다. 두 저장소는 모두 2026년 9월에 Hugging Face에 등장했고, 둘 다 자금력이 탄탄한 연구소가 만든 전문가 혼합(mixture-of-experts) 멀티모달 모델이며, 그 외에는 거의 공통점이 없다. NVIDIA의 모델은 단일 테니스 포인트를 읽고 그에 관한 질문에 답하는 31B 전문 모델이다. 상하이 AI 연구소의 InternLM 팀이 만들고 internlm/InternLumina-U2로 공개한 InternLumina U2는 이미지와 비디오, 3D를 이해할 뿐만 아니라 생성 및 편집까지 할 수 있는 16B 통합 모델이다. 두 모델은 공유하는 벤치마크도, 목표 사용자도, 배포 프로필도 없다. 이 둘을 비교하는 것은 휴대폰을 고르는 것이라기보다 청진기와 3D 프린터 중에서 고르는 것에 가깝다.

어쨌든 이 짝을 굳이 다룰 가치가 있게 만드는 것은 두 모델이 공통으로 지닌 하나의 패턴이다. 어느 쪽도 독립적으로 평가된 적이 없고, 둘 다 각자의 공급업체가 완성된 것과는 다른 무언가로 설명하고 있다. 그것이 진짜 비교다 — 어느 모델이 이기느냐가 아니라, 오늘 실제로 둘 중 어느 쪽을 얼마나 검증할 수 있느냐이다.

같은 단어를 쓰는 두 가지 다른 일

"멀티모달"은 이 둘 모두를 포괄하면서 아무것도 알려주지 않습니다. 구분은 다음과 같습니다:

• 입력으로 받는 것 — 스포츠 테니스: 비디오(mp4, 최대 2분), 오디오(wav/mp3), 이미지, 텍스트. InternLumina U2: 텍스트, 이미지, 비디오, 3D. 테니스 모델은 둘 중 유일하게 실질적인 오디오 경로를 갖추고 있으며, 프레임과 함께 관중과 충격음을 읽는 Parakeet 음성 인코더를 통해 연결됩니다.

• 되돌려주는 것 — Sports Tennis: 텍스트만. InternLumina U2: 텍스트 생성 또는 편집된 이미지, AToken을 기반으로 구축된 8-코드북 완전 이산 시각 표현을 통해.

• 사용자가 요청하는 것 — 스포츠 테니스: "이 포인트에서 무슨 일이 있었는지, 선수가 어디에 서 있었는지, 공이 인코트에 들어왔는지." InternLumina U2: "이 차트를 설명하고, 그런 다음 새 버전을 그려 줘."

• 아키텍처 — Sports Tennis: Mamba2-Transformer 하이브리드 MoE, 총 31B에 토큰당 약 3B 활성, Nemotron 3 Nano Omni로부터 백본과 인코더를 상속받음. InternLumina U2: 1B 활성 파라미터를 가진 16B 희소 MoE로, 기존의 자기회귀 모델이 아닌 다중 코드북 확산 언어 모델로 구축됨.

• 컨텍스트 — Sports Tennis는 최대 256k 토큰을 공개합니다. InternLumina U2의 카드는 컨텍스트 수치를 광고하지 않습니다.

• 라이선스 — Sports Tennis는 상업적 및 비상업적 사용을 명시한 카드와 함께 OpenMDW-1.1로 배포됩니다. InternLumina U2는 Apache 2.0입니다.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

실제로 그것들을 비교할 수 없게 만드는 것

공유된 점수판은 없으며, 왜 그런지 막연히 어깨를 으쓱해 넘기기보다는 정확히 짚어볼 가치가 있습니다.

Sports Tennis는 독점 NVIDIA 테니스 데이터셋으로 파인튜닝되었습니다 — 이 데이터셋은 239개 경기에서 나온 43,084개 포인트 단위 클립 전반에 걸친 1,312,129개 Q&A 예시로 구성되며, 38개 주석 범주에 따라 라벨링되었고, 모두 2025년에 수집되었습니다. 테스트 세트는 12개 경기, 2,689개 클립, 80,872개 질문으로 이루어진 홀드아웃 분할입니다. 그 산출물 하나하나가 모두 NVIDIA 자체의 것입니다. 외부 그룹은 이 데이터를 가지고 있지 않으므로, 어떤 외부 그룹도 점수를 재현할 수 없습니다 — 그리고 공교롭게도 NVIDIA는 재현할 점수를 발표하지 않았습니다. 이 카드는 평가 프로토콜을 자세히 문서화한 다음, 그로부터 나온 결과를 전혀 보고하지 않습니다. 정확도에 관한 것도, 범주별 결과도, 아무것도 없습니다.

InternLumina U2는 바로 그 벽의 반대편에 있다. 이 모델은 수치를 공개하지만, 그것들은 명시적으로 부분적이다. 모델 카드는 이를 한 줄로 밝힌다: "예비적이고 부분적인 결과. 전체 비교 표는 곧 나올 기술 보고서에 실릴 예정입니다." 존재하는 것은 매우 다양한 능력 전반에 걸쳐 벤더가 보고한 수치의 분포다 — 문서에서는 ChartQA 86.52와 CharXiv-DQ 83.65, 시각 수학에서는 MathVision 33.22와 DynaMath 56.37, 비디오에서는 VideoMME 51.26와 MVBench 59.74, 3D MM-Vet 41.8, 생성에서는 DPG-Bench 87.10와 GenEval 0.81, 편집에서는 ImgEdit 3.83. 그리고 프로젝트 페이지의 자체 표는 이 모델이 적어도 하나의 핵심 지표에서 적어도 하나의 이름이 밝혀진 경쟁자에게 뒤처진다는 것을 보여준다: GenEval 0.81 대 LLaDA2.0-Uni의 0.89.

그래서 한 모델은 문서화된 평가는 있지만 결과가 없고, 다른 모델은 결과는 있지만 평가가 명시적으로 불완전하다. 어느 쪽도 서로 나란히 놓고 비교할 수 있는 숫자를 주지 않는다. 이 둘의 순위를 매기는 모든 페이지는 그 순위를 지어낸 것이다.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

그것들이 진정으로 겹치는 지점, 그리고 그것이 보여주는 것

비디오 이해는 둘 모두가 주장하는 유일한 영역이며, 그곳에서조차 겹치는 부분은 보기보다 얇다. InternLumina U2는 VideoMME 51.26과 MLVU 57.03, MVBench 59.74를 보고한다 — 일반 비디오 이해 점수, 공급업체 보고. Sports Tennis는 아무것도 보고하지 않지만, 그 카드는 훨씬 더 좁고 훨씬 더 깊은 작업을 설명한다: 오디오가 포함된 전체 랠리에 대한 포인트 수준 추론, 샷 역학, 코트 포지셔닝, 움직임 및 점수 상태를 포함한 38개의 세밀한 주석 범주에 걸쳐.

합리적인 추론은 InternLumina U2가 더 나은 범용 모델이고 Sports Tennis가 더 나은 테니스 리더일 것이라는 점이지만, 그것은 데이터가 아니라 과제 형태에 기반한 추론이다. 그것은 어느 방향으로든 쉽게 틀릴 수 있다. 추론이 아닌 것은 일반 비디오 벤치마크와 독점적인 포인트 수준 테니스 벤치마크가 같은 축에 놓일 수 없다는 점, 그리고 16B 통합 생성기와 31B 고정 인코더 전문 모델이 같은 질문에 답하도록 만들어진 것이 아니라는 점이다.

둘 중 하나를 실행하는 것은 또 다른 종류의 프로젝트입니다

배포는 그 간극이 더 이상 철학적인 문제로 남지 않게 되는 지점이다.

Sports Tennis는 BF16에서 약 80GB 메모리를 갖춘 GPU 한 장이라는 엄격한 하한을 명시하며, 가중치는 약 62GB이고, A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor 및 RTX 5090에서 테스트되었습니다. 양자화된 체크포인트가 없으므로 80GB 요구 사항은 현재로서는 낮출 수 없습니다. 또한 영어 전용입니다.

InternLumina U2의 더 흥미로운 문제는 메모리가 아니라 실리콘입니다. 이 저장소에는 훈련 하드웨어별로 분리된 체크포인트가 있습니다: 완전한 ascend/ 디렉터리(화웨이 Ascend NPU에서 훈련된 7개의 safetensors 샤드 포함)와 nvidia/ 디렉터리("출시 예정" 표시)입니다. NVIDIA 하드웨어를 사용 중이라면 — 형제 모델이 Nemotron의 테니스 파인튜닝 버전인 이 모델의 경우, 이 글을 읽는 대부분의 사람이 여기에 해당합니다 — 원하는 체크포인트는 아직 공개되지 않은 것입니다. 추론 코드와 설정 안내는 Hub가 아니라 InternLM GitHub 저장소에 있으며, 기술 보고서는 아직 나오지 않았습니다.

그것은 일반적인 기대를 뒤집는다. 독점적이고 벤치마크되지 않은, 어플라이언스 형태의 모델이 바로 첫날 지금 당장 다운로드해서 실행할 수 있는 쪽이다. Apache-2.0 오픈 연구 모델은 특정 하드웨어용 빌드를 기다리고 있는 쪽이다.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

라우터가 적합한 곳 — 그리고 적합하지 않은 곳

이 두 모델은 모두 OrcaRouter에서 호스팅되지 않으며, 그 사실을 빙 둘러 쓰는 정직한 방법은 없습니다. Sports Tennis는 어디에도 엔드포인트가 없습니다. NVIDIA는 가중치만 공개했을 뿐 그 외에는 아무것도 내놓지 않았습니다. InternLumina U2의 자체 저장소에는 NVIDIA 체크포인트가 아직 보류 중이라고 명시되어 있으므로, 우리 쪽에서도 제공할 것이 없습니다. 이는 두 경우 모두 라우팅 결정이 아니라 자체 호스팅 결정입니다.

라우팅 문제는 한 계층 위에서 나타난다. Sports Tennis 같은 전문 모델을 InternLumina U2 같은 범용 모델과 비교 평가하려는 팀은 평가를 고립된 상태에서 하지 않는다 — 음성 전사, 문서 처리, 요약, 그리고 그 주변의 애플리케이션 로직도 필요한 파이프라인에서 하나의 후보로 두고 평가한다. 그런 구성 요소들은 호스팅되며, 바로 그 부분에서 200개 이상의 모델을 포괄하는 단일 API 키는 제공자 전반에 걸친 자동 장애 조치를 갖추고 있어 일주일치 통합 작업을 절약해 준다. 호출할 수 있는 모델에는 키 하나면 되므로, 직접 실행해야 하는 모델만이 실제로 유지 관리하는 유일한 대상이다.

열린 질문

나란히 놓고 보면, NVIDIA NemotronLabs AI for Media - Sports Tennis와 InternLumina U2는 멀티모달 모델을 공개적으로 형편없이 내놓는 두 가지 방식을 꽤 잘 보여주는 사례다. 하나는 자체 평가를 문서화해 놓고 결과는 공개하지 않았고, 다른 하나는 결과를 공개했지만 자체 평가를 불완전하다고 표시했다. 2026년 9월 기준으로 둘 다 반증 불가능한 주장이다.

지켜볼 흥미로운 점은 둘 중 어느 쪽이 더 강한 것으로 판명되는지가 아니다 — 그들은 결코 같은 것으로 시험되지 않을 것이다. 흥미로운 점은 어느 연구소가 먼저 자신의 격차를 좁히느냐이다. 만약 NVIDIA가 테니스 수치를 게시한다면, 그것은 더 어려운 문제를 해결한 것이 될 것이다. 왜냐하면 12개의 보지 못한 경기로 이루어진 독점적 홀드아웃 벤치마크가 도메인 파인튜닝을 점수화하는 유일하게 정직한 방법이며 NVIDIA는 이미 그 분할을 구축했기 때문이다. 만약 InternLM이 NVIDIA 체크포인트와 기술 보고서를 공개한다면, 그것은 자사의 Apache-2.0 모델을 사용자들이 소유한 하드웨어에서 진정으로 사용 가능하게 만든 것이 될 것이다. 어느 쪽이 일어나든, 이 비교는 다시 읽을 가치가 있을 것이다 — 왜냐하면 지금으로서는 어느 모델의 모델 카드가 뒷받침하는 가장 방어 가능한 것은 어깨를 으쓱하는 것뿐이기 때문이다.