Wygenerowana dwupanelowa karta hero porównująca NVIDIA NemotronLabs AI for Media - Sports Tennis z North Micro Vision Instruct, z lewą połową oznaczoną jako czytnik tenisa 31B i znacznikiem „tylko angielski” obok ikony klipu punktu tenisowego, oraz prawą połową oznaczoną jako specjalista od dokumentów 2,4B i znacznikiem „11+ języków” obok ikony dokumentu i wykresu słupkowego, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Nemotron Sports Tennis kontra North Micro Vision Instruct: 31B czytnik tenisa przeciwko 2,4B specjaliście od dokumentów

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najpierw krótka odpowiedź: NVIDIA NemotronLabs AI for Media - Sports Tennis i North Micro Vision Instruct nie są substytutami i nikt, kto staje przed wyborem między nimi, tak naprawdę nie wybiera między nimi. Jeden to 31-miliardowy model multimodalny, który NVIDIA dostroiła do odpowiadania na pytania o punkty tenisowe, potrzebuje około 80 GB pamięci GPU i czyta tylko po angielsku. Drugi to 2,4-miliardowy model wizyjno-językowy od Cohere, który mieści się na jednej karcie graficznej stacji roboczej, obsługuje jedenaście języków i został stworzony przede wszystkim do czytania dokumentów — stron, wykresów, tabel, OCR.

Oba należą do tej samej szerokiej kategorii i prawie nigdzie indziej. Poniżej znajduje się uczciwa wersja porównania: gdzie oba naprawdę się rozchodzą, co każdy dostawca opublikował, a czego nie, oraz ta jedna sytuacja, w której wybór jest realny.

Do czego każdy model został stworzony

North Micro Vision Instruct łączy 2B model językowy — North Micro LLM od Cohere, oparty na architekturze Command A+ — z 400M-parametrowym enkoderem wizyjnym wytrenowanym specjalnie na bazie SigLIP 2 SO400M, co daje łącznie 2,4B. Jego ścieżka wizyjna działa w natywnej rozdzielczości, zachowując proporcje obrazu zamiast skalowania do stałej siatki, a projektor DeepStack wstrzykuje osadzenia fragmentów z wielu warstw enkodera do odpowiednich wczesnych warstw językowych, zamiast poprzedzać je pojedynczą reprezentacją. Deklarowane ujęcie Cohere to kompaktowy fundament do prototypowania i dostrajania do konkretnych zadań, z rozumieniem dokumentów jako flagową możliwością. Karta modelu jest nietypowo szczera co do górnej granicy możliwości: North Micro Vision Instruct wprost nie jest modelem rozumującym, nie obsługuje wywoływania narzędzi i nie był trenowany z promptami systemowymi.

Sports Tennis jest przeciwieństwem pod każdym względem. NVIDIA rozpoczęła od własnego checkpointu Nemotron 3 Nano Omni 30B-A3B-Reasoning — hybrydowej mieszanki ekspertów Mamba2-Transformer, 31B łącznie z około 3B aktywnymi na token — i dostroiła go na zastrzeżonym, ręcznie oznaczonym korpusie tenisowym. Enkoder wizji (C-RADIOv4-H) i enkoder mowy (Parakeet) zostały zamrożone; zmieniły się tylko parametry modelu językowego. Wynikiem jest wąski model z założenia: odpowiada na ustrukturyzowane pytania wielokrotnego wyboru i pytania otwarte dotyczące całego klipu z punktem tenisowym, obejmujące mechanikę uderzeń, pozycjonowanie na korcie, ruch zawodników, fakty meczowe, znajomość przepisów i wskazówki dźwiękowe. NVIDIA opisuje go jako działający najlepiej, gdy cały punkt — od serwu do końca wymiany — jest przekazywany jako dane wejściowe.

Wymiary, które tak naprawdę je oddzielają

• Parametry — North Micro Vision Instruct: 2,4 mld (2 mld parametrów językowych, 400 mln parametrów wizyjnych). Sports Tennis: łącznie 31 mld, ~3 mld aktywnych na token.

• Dane wejściowe — North Micro Vision Instruct: przeplatane teksty i obrazy, natywna rozdzielczość, wiele obrazów. Sports Tennis: wideo do 2 minut, audio do godziny, obrazy, tekst.

• Dane wyjściowe — oba zwracają tekst. North Micro Vision Instruct dodatkowo zwraca ramki ograniczające ugruntowania w znormalizowanej skali 0–1000.

• Języki — North Micro Vision Instruct: ponad jedenaście, w tym angielski, niemiecki, francuski, hiszpański, włoski, portugalski, hindi, japoński, koreański, chiński i arabski. Sports Tennis: tylko angielski.

• Kontekst — North Micro Vision Instruct: 128K-tokenowy backbone językowy, ale Cohere oznacza zweryfikowany zakres multimodalny jako wynoszący do 8K tokenów, przy czym dłuższe konteksty multimodalne opierają się na ekstrapolacji i nie zostały poddane benchmarkom. Sport – tenis: do 256k tokenów.

• Zajętość pamięci — North Micro Vision Instruct: około 4,97 GB przy BF16, mniej więcej 2,17 GB przy 4-bit. Sports Tennis: około 62 GB przy BF16, wymagany jeden GPU 80 GB.

• Licencja — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, przy czym karta wskazuje na użycie komercyjne i niekomercyjne.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmarki: jeden model je ma, drugi ma protokół

To tutaj te dwie karty nie mogłyby bardziej różnić się postawą.

Cohere publikuje liczby dla North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — oraz MMMU 0,329. Wszystkie podane przez dostawcę, żadne nie zostały niezależnie odtworzone, a sama Cohere sygnalizuje, że wyniki OCR różnią się drastycznie w zależności od podziału. Przy tej ostatniej liczbie warto się zatrzymać: wynik MMMU 0,329 jest niski i jest spójny z tym wszystkim, co karta mówi o konstrukcji modelu. To specjalista od czytania, a nie model ogólnego rozumowania, i firma, która go zbudowała, mówi to wprost. Tego rodzaju ujawnienie jest bardziej użyteczne niż pochlebna liczba.

NVIDIA nie publikuje niczego. Karta Sports Tennis szczegółowo opisuje sposób jej oceny — partycja testowa obejmująca 12 w pełni wyłączonych meczów, 2 689 klipów punktowych i 80 872 pytań z meczów bez nakładania się z treningiem, ocenianych za pomocą automatycznej dokładności w pytaniach wielokrotnego wyboru oraz pass@9 z LLM-as-judge w przypadku odpowiedzi otwartych, przy czym podzbiór meczów widzianych został wyraźnie wykluczony z raportowanego testowania — a następnie nie podaje żadnego wyniku z żadnej z tych części. Strona treningowa jest równie szczegółowa: 1 312 129 przykładów Q&A, 1 226 081 pytań wielokrotnego wyboru i 86 048 pytań otwartych, pochodzących z 43 084 klipów punktowych z 239 meczów, oznaczonych według 38 kategorii adnotacji.

Nawet gdyby NVIDIA opublikowała wyniki, nie byłyby one porównywalne. Nie istnieje żaden benchmark, na którym pojawiają się jednocześnie model rozumienia dokumentów i model punktów tenisowych. Nakładanie się tych dwóch historii ewaluacyjnych wynosi zero.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Wdrożenie: gdzie tkwi praktyczna różnica

Model 2,4B jest zdecydowanie łatwiejszy w obsłudze. Około 5 GB wag BF16 oznacza, że obsłuży go pojedynczy nowoczesny GPU stacji roboczej, a wersja 4-bitowa o rozmiarze około 2,17 GB jest jeszcze mniejsza. Istnieją niezależne porty dla środowiska uruchomieniowego Core AI firmy Apple, z raportowanym ok. 18,2 tokena/s przy int8 na iPhone 17 Pro, a kwantyzacja int4 całkowicie zawodzi. Problem leży w oprogramowaniu: North Micro Vision Instruct wymaga biblioteki Transformers 5.16.0 — którą można instalować ze źródeł, dopóki nie trafi do PyPI — a publiczne wsparcie vLLM wciąż określano na karcie modelu jako „wkrótce”. Dostrajanie jest obsługiwane przez Axolotl. Nie ma własnego hostowanego API; praktyczną drogą jest samodzielny hosting.

Sports Tennis to trudniejsza rzecz w obsłudze i nie ma od tego odwrotu. Jedna karta GPU 80 GB w BF16, brak opublikowanego skwantyzowanego checkpointu, tylko angielski, tylko Linux, na PyTorch/Transformers albo NeMo, albo Megatron. NVIDIA przetestowała na A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor i RTX 5090 — lista sprzętu, która mówi więcej o tym, co NVIDIA chciała zwalidować, niż o tym, co może zapewnić zwykły zespół. Domyślna polityka wnioskowania karty jest również minimalistyczna: 2 klatki na sekundę do 128 klatek, 256 nowych tokenów, dekodowanie zachłanne.

Żaden z tych modeli nie jest obsługiwany na OrcaRouter. North Micro Vision Instruct nie ma endpointu first-party i nie znajduje się w naszym katalogu; Sports Tennis nie ma endpointu nigdzie, ponieważ NVIDIA opublikowała wagi, a nie usługę hostowaną. Oba przypadki to decyzja o samodzielnym hostowaniu.

Tam, gdzie warstwa routingu faktycznie pomaga, jest to potok wokół nich — niezależnie od tego, które z nich uruchamiasz lokalnie, modele transkrypcji, streszczania, wyszukiwania i aplikacji, które ją otaczają, są hostowane, a umieszczenie ich za jednym kluczem API z automatycznym przełączaniem awaryjnym pozwala uniknąć tworzenia osobnego zestawu poświadczeń i umowy dla każdego z nich. W przypadku modeli, które faktycznie mamy w ofercie, przekazujemy ceny katalogowe dostawców z 0% marży, dzięki czemu części stosu, których nie hostujesz samodzielnie, pozostają w cenniku dostawcy.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Kiedy wybór jest prawdziwy

Jest jeden scenariusz, w którym wybór między tymi dwoma jest prawdziwą decyzją, i warto być w tej sprawie konkretnym, ponieważ nie jest to oczywiste.

To przypadek organizacji medialnej lub sportowej, która już przetwarza dokumenty i chce dodać rozumienie wideo na poziomie punktów. Nadawca z potokiem archiwalnym, liga z raportami meczowymi i statystycznymi PDF-ami, podmiot posiadający prawa zarówno do tekstów, jak i materiałów wideo — w ich przypadku North Micro Vision Instruct prawdopodobnie już znajduje się w stosie do OCR i ekstrakcji wykresów, a Sports Tennis to nowa możliwość, którą chcieliby dodać. Pytanie nie brzmi „który z nich”, lecz „ile kosztuje mnie ten drugi pod względem infrastruktury”, a odpowiedź to GPU w centrum danych i ograniczenie tylko do języka angielskiego.

Poza tym przypadkiem modele po prostu ze sobą nie konkurują. Jeśli potrzebujesz odczytywania dokumentów w jedenastu językach na karcie stacji roboczej, North Micro Vision Instruct jest odpowiedzią, a Sports Tennis jest dla ciebie nieistotny. Jeśli potrzebujesz zadawać ustrukturyzowane pytania o punkty tenisowe z kontekstem audio, Sports Tennis jest jedynym z tych dwóch, który to potrafi, a to, że brak mu opublikowanych benchmarków, jest ryzykiem, które byś zaakceptował, a nie powodem, by wybrać drugi model.

Które wybrać

Wybierz North Micro Vision Instruct, jeśli Twoja praca obejmuje dokumenty, wykresy, OCR, grounding lub wielojęzyczne rozumienie obrazów, i jeśli cenisz dostawcę, który publikuje swoje słabe wyniki obok tych mocnych. Jest mały, objęty licencją Apache 2.0, dobrze udokumentowany i uczciwie przyznaje, że nie jest modelem rozumującym. Jego MMMU wynoszące 0,329 nie jest wadą, którą odkrywasz dopiero później; Cohere mówi o tym od razu.

Wybierz NVIDIA NemotronLabs AI for Media - Sports Tennis tylko wtedy, gdy konkretnie potrzebujesz rozumowania na poziomie pojedynczych punktów tenisowych wraz z dźwiękiem, masz do dyspozycji 80 GB pamięci GPU i nie przeszkadza ci bycie pierwszą osobą, która go oceni. Nikt nie opublikował wyniku dla tego modelu, więc samo jego pobranie jest eksperymentem. To nie jest powód, by go unikać — wąski specjalista ze skrupulatnie oznaczonym zbiorem treningowym liczącym 43 084 klipy to dokładnie ten rodzaj modelu, który może pokonać generalistę w jego własnym zadaniu — ale jest to powód, by pierwsze wdrożenie potraktować jako próbę, a nie zobowiązanie.

Jedyne, czego nie powinieneś robić, to traktować je jako wymienne, ponieważ oba mają na karcie napis „model wizyjno-językowy”. Czytnik dokumentów i analityk tenisowy nigdy nie były tym samym produktem, a w tej parze różnica w tym, co robią, jest znacznie większa niż różnica w tym, jak dobrze to robią.