NVIDIA NemotronLabs AI for Media - Sports Tennis와 North Micro Vision Instruct를 비교하는 생성된 분할 패널 히어로 카드로, 왼쪽 절반에는 31B 테니스 리더라는 라벨과 테니스 포인트 클립 아이콘 옆에 영어 전용 칩이 있고, 오른쪽 절반에는 2.4B 문서 전문가라는 라벨과 문서 및 막대 차트 아이콘 옆에 11개 이상 언어 칩이 있으며, 우측 하단 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct: 2.4B 문서 전문가에 맞서는 31B 테니스 리더

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

짧게 답부터 하자면, NVIDIA NemotronLabs AI for Media - Sports Tennis와 North Micro Vision Instruct는 서로 대체품이 아니며, 이 둘 사이에서 선택하는 사람은 사실 이 둘 사이에서 선택하고 있는 게 아니다. 하나는 NVIDIA가 테니스 포인트에 관한 질문에 답하도록 파인튜닝한 31B 멀티모달 모델로, 약 80GB의 GPU 메모리가 필요하고 영어만 읽는다. 다른 하나는 Cohere의 2.4B 비전-언어 모델로, 워크스테이션 카드 한 장에 들어가며 11개 언어를 처리하고 무엇보다 문서 — 페이지, 차트, 표, OCR — 를 읽도록 만들어졌다.

두 제품은 같은 넓은 범주에 속하지만, 그 외에는 거의 어디에서도 겹치지 않는다. 다음은 이 비교의 솔직한 버전이다. 두 제품이 진정으로 갈라지는 지점, 각 벤더가 공개한 것과 공개하지 않은 것, 그리고 그 선택이 실제로 유효해지는 단 하나의 상황이다.

각 모델이 하도록 만들어진 작업

North Micro Vision Instruct는 2B 언어 모델 — Command A+ 아키텍처를 따르는 Cohere의 North Micro LLM — 과 SigLIP 2 SO400M에서 맞춤 학습된 400M 파라미터 비전 인코더를 결합하여 총 2.4B를 구성합니다. 이 모델의 비전 경로는 네이티브 해상도로, 고정 그리드로 크기를 조정하는 대신 종횡비를 유지하며, DeepStack 프로젝터는 단일 표현을 앞에 추가하는 대신 여러 인코더 레이어의 패치 임베딩을 해당하는 초기 언어 레이어에 주입합니다. Cohere가 제시한 프레이밍은 문서 이해를 대표 기능으로 하는, 프로토타이핑과 작업별 파인튜닝을 위한 콤팩트한 기반입니다. 모델 카드는 한계에 대해 이례적으로 솔직합니다: North Micro Vision Instruct는 명시적으로 추론 모델이 아니며, 도구 호출 기능이 없고 시스템 프롬프트로 학습되지 않았습니다.

Sports Tennis는 모든 차원에서 정반대의 형태다. NVIDIA는 자사의 Nemotron 3 Nano Omni 30B-A3B-Reasoning 체크포인트에서 출발했다. 이는 Mamba2-Transformer 하이브리드 전문가 혼합으로, 총 31B이며 토큰당 약 3B가 활성화된다. 그리고 이를 독점적이며 수동으로 레이블링된 테니스 코퍼스로 미세 조정했다. 비전 인코더(C-RADIOv4-H)와 음성 인코더(Parakeet)는 모두 고정되었고, 언어 모델 파라미터만 변경되었다. 그 결과물은 설계상 좁은 범위의 모델이다. 전체 테니스 포인트 클립에 걸쳐 구조화된 객관식 및 개방형 질문에 답하며, 샷 역학, 코트 포지셔닝, 선수 움직임, 경기 사실, 규칙 지식, 오디오 단서를 아우른다. NVIDIA는 한 포인트 전체 — 서브부터 랠리 끝까지 — 가 입력으로 전달될 때 가장 잘 작동한다고 설명한다.

실제로 이들을 구분하는 차원들

• 파라미터 — North Micro Vision Instruct: 2.4B (언어 2B, 비전 400M). Sports Tennis: 총 31B, 토큰당 약 3B 활성.

• 입력 — North Micro Vision Instruct: 텍스트와 이미지 인터리브, 네이티브 해상도, 다중 이미지. 스포츠 테니스: 최대 2분 길이의 비디오, 최대 1시간 길이의 오디오, 이미지, 텍스트.

• 출력 — 둘 다 텍스트를 반환합니다. North Micro Vision Instruct는 추가로 정규화된 0–1000 스케일의 그라운딩 바운딩 박스를 반환합니다.

• 언어 — North Micro Vision Instruct: 영어, 독일어, 프랑스어, 스페인어, 이탈리아어, 포르투갈어, 힌디어, 일본어, 한국어, 중국어, 아랍어를 포함한 11개 이상. 스포츠 테니스: 영어만.

• 컨텍스트 — North Micro Vision Instruct: 128K 토큰 언어 백본이지만, Cohere는 검증된 멀티모달 범위를 최대 8K 토큰으로 명시하며, 더 긴 멀티모달 컨텍스트는 외삽에 의존하고 벤치마크되지 않았습니다. Sports Tennis: 최대 256k 토큰.

• 메모리 사용량 — North Micro Vision Instruct: BF16 기준 약 4.97 GB, 4비트 기준 약 2.17 GB. Sports Tennis: BF16 기준 약 62 GB, 80 GB GPU 1대 필요.

• 라이선스 — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, 모델 카드에 상업적 및 비상업적 사용이 명시되어 있습니다.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

벤치마크: 한 모델에는 벤치마크가 있고, 다른 모델에는 프로토콜이 있다

바로 이 지점에서 두 카드는 자세 면에서 이보다 더 다를 수 없을 만큼 극명하게 갈립니다.

Cohere는 North Micro Vision Instruct의 수치를 공개했습니다. DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 — 그리고 MMMU 0.329. 모두 벤더가 보고한 수치이며, 독립적으로 재현된 것은 하나도 없고, Cohere 스스로 OCR 결과가 분할별로 크게 달라진다고 지적합니다. 마지막 수치는 잠시 짚고 넘어갈 가치가 있습니다. MMMU 점수 0.329는 낮은 편이며, 이는 모델 설계에 관해 이 카드가 말하는 다른 모든 내용과 일치합니다. 이것은 범용 추론 모델이 아니라 독해 전문 모델이며, 이를 만든 회사도 그렇게 말합니다. 그런 종류의 공개는 듣기 좋은 숫자보다 더 유용합니다.

NVIDIA는 아무것도 공개하지 않는다. Sports Tennis 카드는 자체 평가를 꼼꼼히 설명한다 — 완전히 홀드아웃된 12개 경기, 훈련 데이터와 겹치지 않는 경기에서 가져온 2,689개의 포인트 단위 클립과 80,872개의 질문으로 구성된 테스트 파티션이며, 자동 객관식 정확도와 개방형 응답에 대한 LLM-as-judge pass@9로 채점되고, 보고되는 테스트에서는 학습에 노출된 경기 분할(seen-matches split)이 명시적으로 제외된다 — 그리고는 그중 어느 결과도 보고하지 않는다. 학습 쪽도 똑같이 상세하다: 1,312,129개의 Q&A 예시, 1,226,081개의 객관식, 86,048개의 개방형 예시가 239개 경기에 걸친 43,084개의 포인트 단위 클립에서 추출되었으며, 38개의 어노테이션 범주에 따라 레이블링되었다.

NVIDIA가 점수를 공개했더라도 비교할 수는 없었을 것이다. 문서 이해 모델과 테니스 포인트 모델이 둘 다 등장하는 벤치마크는 없다. 이 두 평가 이야기 사이의 겹침은 전무하다.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

배포: 실질적인 차이가 드러나는 곳

2.4B 모델은 훨씬 더 운영하기 쉬운 쪽이다. 대략 5GB의 BF16 가중치라면 최신 워크스테이션 GPU 한 장으로 처리할 수 있다는 뜻이고, 약 2.17GB인 4비트 빌드는 더욱 작아진다. Apple의 Core AI 런타임을 위한 독립 포팅이 존재하며, iPhone 17 Pro에서 int8로 약 18.2토큰/s가 보고되었고 int4 양자화는 완전히 실패했다. 걸림돌은 소프트웨어에 있다: North Micro Vision Instruct는 Transformers 5.16.0이 필요하며 — PyPI에 오르기 전까지는 소스에서 설치 가능 — 공개 vLLM 지원은 모델 카드에서 여전히 곧 제공될 예정이라고 설명되어 있었다. 파인튜닝은 Axolotl을 통해 지원된다. 퍼스트파티 호스팅 API는 없으며, 실용적인 경로는 자체 호스팅이다.

Sports Tennis는 운용하기 더 어려운 쪽이며, 이를 피할 방법이 없다. BF16 기준 80GB GPU 한 장, 공개된 양자화 체크포인트 없음, 영어 전용, Linux 전용, PyTorch/Transformers 또는 NeMo 또는 Megatron에서만. NVIDIA는 A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor 및 RTX 5090 전반에서 테스트했다 — 이 하드웨어 목록은 일반 팀이 조달할 수 있는 것보다 NVIDIA가 무엇을 검증하고 싶어 했는지를 더 많이 말해준다. 이 카드의 기본 추론 정책도 극히 기본적이다: 최대 128프레임까지 초당 2프레임, 새 토큰 256개, 그리디 디코딩.

두 모델 모두 OrcaRouter에서 서비스되지 않습니다. North Micro Vision Instruct는 퍼스트파티 엔드포인트가 없고 우리 카탈로그에도 없습니다; Sports Tennis는 NVIDIA가 가중치만 공개했고 호스팅 서비스는 제공하지 않기 때문에 어디에도 엔드포인트가 없습니다. 둘 다 자체 호스팅 결정입니다.

라우팅 레이어가 실제로 도움이 되는 지점은 그 주변의 파이프라인입니다. 이 중 무엇을 로컬에서 실행하든, 그 주변의 전사, 요약, 검색 및 애플리케이션 모델은 호스팅되며, 이를 자동 페일오버가 지원되는 하나의 API 키 뒤에 두면 각각에 대해 별도의 자격 증명 세트와 계약을 마련할 필요가 없습니다. 저희가 취급하는 모델에 대해서는 공급업체 정가를 0% 마크업으로 그대로 전달하므로, 직접 호스팅하지 않는 스택 부분은 벤더 가격으로 유지됩니다.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

선택이 진짜일 때

이 둘 중에서 선택하는 것이 진정한 결정이 되는 시나리오가 하나 있는데, 그것은 명백하지 않기 때문에 구체적으로 짚고 넘어갈 가치가 있다.

이는 이미 문서를 처리하고 있으며 포인트 수준의 영상 이해를 추가하려는 미디어 또는 스포츠 조직의 사례입니다. 아카이브 파이프라인을 갖춘 방송사, 경기 리포트와 통계 PDF를 보유한 리그, 텍스트와 영상 자료를 모두 가진 권리 보유자 — 이들에게 North Micro Vision Instruct는 OCR과 차트 추출을 위해 이미 스택에 있을 법하며, Sports Tennis는 그들이 새로 추가하게 될 기능입니다. 질문은 "어느 것"이 아니라 "두 번째 것은 인프라 측면에서 나에게 무엇을 비용으로 요구하는가"이며, 답은 데이터센터 GPU 한 대와 영어 전용이라는 제약입니다.

그 경우를 제외하면, 두 모델은 애초에 경쟁 상대가 아닙니다. 워크스테이션 카드에서 11개 언어로 문서를 읽어야 한다면 North Micro Vision Instruct가 답이며, Sports Tennis는 당신과 무관합니다. 오디오 맥락과 함께 테니스 포인트에 관한 구조화된 질문을 해야 한다면, Sports Tennis는 둘 중 이를 수행하는 유일한 모델이며, 공개된 벤치마크가 없다는 사실은 다른 모델을 선택할 이유라기보다 당신이 감수하게 될 위험입니다.

어느 것을 고를까?

업무가 문서, 차트, OCR, 그라운딩 또는 다국어 이미지 이해와 관련되어 있고, 약점 지표를 강점 지표와 함께 공개하는 공급업체를 중요하게 여긴다면 North Micro Vision Instruct를 선택하세요. 이 모델은 작고, Apache 2.0이며, 문서화가 잘 되어 있고, 추론 모델이 아니라는 점을 솔직히 밝힙니다. MMMU 0.329는 나중에야 발견하게 되는 결함이 아닙니다; Cohere가 처음부터 알려줍니다.

NVIDIA NemotronLabs AI for Media - Sports Tennis는 오디오를 포함한 포인트 단위 테니스 추론이 특별히 필요하고, 80GB GPU를 여유롭게 쓸 수 있으며, 이 모델을 처음 평가하는 사람이 되는 것을 개의치 않는 경우에만 선택하세요. 이 모델에 대해 공개된 점수는 아무도 없으므로, 다운로드 자체가 실험입니다. 그렇다고 해서 피해야 할 이유는 아닙니다 — 꼼꼼하게 라벨링된 43,084개 클립 학습 세트를 갖춘 좁은 분야의 전문가는 자신의 과제에서 범용 모델을 능가할 수 있는 바로 그런 유형의 모델입니다 — 다만 첫 배포를 확정된 투자가 아닌 시험으로 다루어야 할 이유는 됩니다.

당신이 절대 해서는 안 되는 한 가지는 카드에 둘 다 “vision-language model”이라고 적혀 있다는 이유로 이것들을 서로 바꿔 쓸 수 있는 것으로 취급하는 것입니다. 문서 판독기와 테니스 분석가는 결코 같은 제품이 아니었고, 이 둘 사이에서는 무엇을 하는지의 차이가 얼마나 잘하는지의 차이보다 훨씬 큽니다.