
Nemotron Sports Tennis kontra North Micro Vision Instruct: 31B czytnik tenisa przeciwko 2,4B specjaliście od dokumentów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Najpierw krótka odpowiedź: NVIDIA NemotronLabs AI for Media - Sports Tennis i North Micro Vision Instruct nie są substytutami i nikt, kto staje przed wyborem między nimi, tak naprawdę nie wybiera między nimi. Jeden to 31-miliardowy model multimodalny, który NVIDIA dostroiła do odpowiadania na pytania o punkty tenisowe, potrzebuje około 80 GB pamięci GPU i czyta tylko po angielsku. Drugi to 2,4-miliardowy model wizyjno-językowy od Cohere, który mieści się na jednej karcie graficznej stacji roboczej, obsługuje jedenaście języków i został stworzony przede wszystkim do czytania dokumentów — stron, wykresów, tabel, OCR.
Oba należą do tej samej szerokiej kategorii i prawie nigdzie indziej. Poniżej znajduje się uczciwa wersja porównania: gdzie oba naprawdę się rozchodzą, co każdy dostawca opublikował, a czego nie, oraz ta jedna sytuacja, w której wybór jest realny.
Do czego każdy model został stworzony
North Micro Vision Instruct łączy 2B model językowy — North Micro LLM od Cohere, oparty na architekturze Command A+ — z 400M-parametrowym enkoderem wizyjnym wytrenowanym specjalnie na bazie SigLIP 2 SO400M, co daje łącznie 2,4B. Jego ścieżka wizyjna działa w natywnej rozdzielczości, zachowując proporcje obrazu zamiast skalowania do stałej siatki, a projektor DeepStack wstrzykuje osadzenia fragmentów z wielu warstw enkodera do odpowiednich wczesnych warstw językowych, zamiast poprzedzać je pojedynczą reprezentacją. Deklarowane ujęcie Cohere to kompaktowy fundament do prototypowania i dostrajania do konkretnych zadań, z rozumieniem dokumentów jako flagową możliwością. Karta modelu jest nietypowo szczera co do górnej granicy możliwości: North Micro Vision Instruct wprost nie jest modelem rozumującym, nie obsługuje wywoływania narzędzi i nie był trenowany z promptami systemowymi.
Sports Tennis jest przeciwieństwem pod każdym względem. NVIDIA rozpoczęła od własnego checkpointu Nemotron 3 Nano Omni 30B-A3B-Reasoning — hybrydowej mieszanki ekspertów Mamba2-Transformer, 31B łącznie z około 3B aktywnymi na token — i dostroiła go na zastrzeżonym, ręcznie oznaczonym korpusie tenisowym. Enkoder wizji (C-RADIOv4-H) i enkoder mowy (Parakeet) zostały zamrożone; zmieniły się tylko parametry modelu językowego. Wynikiem jest wąski model z założenia: odpowiada na ustrukturyzowane pytania wielokrotnego wyboru i pytania otwarte dotyczące całego klipu z punktem tenisowym, obejmujące mechanikę uderzeń, pozycjonowanie na korcie, ruch zawodników, fakty meczowe, znajomość przepisów i wskazówki dźwiękowe. NVIDIA opisuje go jako działający najlepiej, gdy cały punkt — od serwu do końca wymiany — jest przekazywany jako dane wejściowe.
Wymiary, które tak naprawdę je oddzielają
• Parametry — North Micro Vision Instruct: 2,4 mld (2 mld parametrów językowych, 400 mln parametrów wizyjnych). Sports Tennis: łącznie 31 mld, ~3 mld aktywnych na token.
• Dane wejściowe — North Micro Vision Instruct: przeplatane teksty i obrazy, natywna rozdzielczość, wiele obrazów. Sports Tennis: wideo do 2 minut, audio do godziny, obrazy, tekst.
• Dane wyjściowe — oba zwracają tekst. North Micro Vision Instruct dodatkowo zwraca ramki ograniczające ugruntowania w znormalizowanej skali 0–1000.
• Języki — North Micro Vision Instruct: ponad jedenaście, w tym angielski, niemiecki, francuski, hiszpański, włoski, portugalski, hindi, japoński, koreański, chiński i arabski. Sports Tennis: tylko angielski.
• Kontekst — North Micro Vision Instruct: 128K-tokenowy backbone językowy, ale Cohere oznacza zweryfikowany zakres multimodalny jako wynoszący do 8K tokenów, przy czym dłuższe konteksty multimodalne opierają się na ekstrapolacji i nie zostały poddane benchmarkom. Sport – tenis: do 256k tokenów.
• Zajętość pamięci — North Micro Vision Instruct: około 4,97 GB przy BF16, mniej więcej 2,17 GB przy 4-bit. Sports Tennis: około 62 GB przy BF16, wymagany jeden GPU 80 GB.
• Licencja — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, przy czym karta wskazuje na użycie komercyjne i niekomercyjne.

Benchmarki: jeden model je ma, drugi ma protokół
To tutaj te dwie karty nie mogłyby bardziej różnić się postawą.
Cohere publikuje liczby dla North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — oraz MMMU 0,329. Wszystkie podane przez dostawcę, żadne nie zostały niezależnie odtworzone, a sama Cohere sygnalizuje, że wyniki OCR różnią się drastycznie w zależności od podziału. Przy tej ostatniej liczbie warto się zatrzymać: wynik MMMU 0,329 jest niski i jest spójny z tym wszystkim, co karta mówi o konstrukcji modelu. To specjalista od czytania, a nie model ogólnego rozumowania, i firma, która go zbudowała, mówi to wprost. Tego rodzaju ujawnienie jest bardziej użyteczne niż pochlebna liczba.
NVIDIA nie publikuje niczego. Karta Sports Tennis szczegółowo opisuje sposób jej oceny — partycja testowa obejmująca 12 w pełni wyłączonych meczów, 2 689 klipów punktowych i 80 872 pytań z meczów bez nakładania się z treningiem, ocenianych za pomocą automatycznej dokładności w pytaniach wielokrotnego wyboru oraz pass@9 z LLM-as-judge w przypadku odpowiedzi otwartych, przy czym podzbiór meczów widzianych został wyraźnie wykluczony z raportowanego testowania — a następnie nie podaje żadnego wyniku z żadnej z tych części. Strona treningowa jest równie szczegółowa: 1 312 129 przykładów Q&A, 1 226 081 pytań wielokrotnego wyboru i 86 048 pytań otwartych, pochodzących z 43 084 klipów punktowych z 239 meczów, oznaczonych według 38 kategorii adnotacji.
Nawet gdyby NVIDIA opublikowała wyniki, nie byłyby one porównywalne. Nie istnieje żaden benchmark, na którym pojawiają się jednocześnie model rozumienia dokumentów i model punktów tenisowych. Nakładanie się tych dwóch historii ewaluacyjnych wynosi zero.

Wdrożenie: gdzie tkwi praktyczna różnica
Model 2,4B jest zdecydowanie łatwiejszy w obsłudze. Około 5 GB wag BF16 oznacza, że obsłuży go pojedynczy nowoczesny GPU stacji roboczej, a wersja 4-bitowa o rozmiarze około 2,17 GB jest jeszcze mniejsza. Istnieją niezależne porty dla środowiska uruchomieniowego Core AI firmy Apple, z raportowanym ok. 18,2 tokena/s przy int8 na iPhone 17 Pro, a kwantyzacja int4 całkowicie zawodzi. Problem leży w oprogramowaniu: North Micro Vision Instruct wymaga biblioteki Transformers 5.16.0 — którą można instalować ze źródeł, dopóki nie trafi do PyPI — a publiczne wsparcie vLLM wciąż określano na karcie modelu jako „wkrótce”. Dostrajanie jest obsługiwane przez Axolotl. Nie ma własnego hostowanego API; praktyczną drogą jest samodzielny hosting.
Sports Tennis to trudniejsza rzecz w obsłudze i nie ma od tego odwrotu. Jedna karta GPU 80 GB w BF16, brak opublikowanego skwantyzowanego checkpointu, tylko angielski, tylko Linux, na PyTorch/Transformers albo NeMo, albo Megatron. NVIDIA przetestowała na A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor i RTX 5090 — lista sprzętu, która mówi więcej o tym, co NVIDIA chciała zwalidować, niż o tym, co może zapewnić zwykły zespół. Domyślna polityka wnioskowania karty jest również minimalistyczna: 2 klatki na sekundę do 128 klatek, 256 nowych tokenów, dekodowanie zachłanne.
Żaden z tych modeli nie jest obsługiwany na OrcaRouter. North Micro Vision Instruct nie ma endpointu first-party i nie znajduje się w naszym katalogu; Sports Tennis nie ma endpointu nigdzie, ponieważ NVIDIA opublikowała wagi, a nie usługę hostowaną. Oba przypadki to decyzja o samodzielnym hostowaniu.
Tam, gdzie warstwa routingu faktycznie pomaga, jest to potok wokół nich — niezależnie od tego, które z nich uruchamiasz lokalnie, modele transkrypcji, streszczania, wyszukiwania i aplikacji, które ją otaczają, są hostowane, a umieszczenie ich za jednym kluczem API z automatycznym przełączaniem awaryjnym pozwala uniknąć tworzenia osobnego zestawu poświadczeń i umowy dla każdego z nich. W przypadku modeli, które faktycznie mamy w ofercie, przekazujemy ceny katalogowe dostawców z 0% marży, dzięki czemu części stosu, których nie hostujesz samodzielnie, pozostają w cenniku dostawcy.

Kiedy wybór jest prawdziwy
Jest jeden scenariusz, w którym wybór między tymi dwoma jest prawdziwą decyzją, i warto być w tej sprawie konkretnym, ponieważ nie jest to oczywiste.
To przypadek organizacji medialnej lub sportowej, która już przetwarza dokumenty i chce dodać rozumienie wideo na poziomie punktów. Nadawca z potokiem archiwalnym, liga z raportami meczowymi i statystycznymi PDF-ami, podmiot posiadający prawa zarówno do tekstów, jak i materiałów wideo — w ich przypadku North Micro Vision Instruct prawdopodobnie już znajduje się w stosie do OCR i ekstrakcji wykresów, a Sports Tennis to nowa możliwość, którą chcieliby dodać. Pytanie nie brzmi „który z nich”, lecz „ile kosztuje mnie ten drugi pod względem infrastruktury”, a odpowiedź to GPU w centrum danych i ograniczenie tylko do języka angielskiego.
Poza tym przypadkiem modele po prostu ze sobą nie konkurują. Jeśli potrzebujesz odczytywania dokumentów w jedenastu językach na karcie stacji roboczej, North Micro Vision Instruct jest odpowiedzią, a Sports Tennis jest dla ciebie nieistotny. Jeśli potrzebujesz zadawać ustrukturyzowane pytania o punkty tenisowe z kontekstem audio, Sports Tennis jest jedynym z tych dwóch, który to potrafi, a to, że brak mu opublikowanych benchmarków, jest ryzykiem, które byś zaakceptował, a nie powodem, by wybrać drugi model.
Które wybrać
Wybierz North Micro Vision Instruct, jeśli Twoja praca obejmuje dokumenty, wykresy, OCR, grounding lub wielojęzyczne rozumienie obrazów, i jeśli cenisz dostawcę, który publikuje swoje słabe wyniki obok tych mocnych. Jest mały, objęty licencją Apache 2.0, dobrze udokumentowany i uczciwie przyznaje, że nie jest modelem rozumującym. Jego MMMU wynoszące 0,329 nie jest wadą, którą odkrywasz dopiero później; Cohere mówi o tym od razu.
Wybierz NVIDIA NemotronLabs AI for Media - Sports Tennis tylko wtedy, gdy konkretnie potrzebujesz rozumowania na poziomie pojedynczych punktów tenisowych wraz z dźwiękiem, masz do dyspozycji 80 GB pamięci GPU i nie przeszkadza ci bycie pierwszą osobą, która go oceni. Nikt nie opublikował wyniku dla tego modelu, więc samo jego pobranie jest eksperymentem. To nie jest powód, by go unikać — wąski specjalista ze skrupulatnie oznaczonym zbiorem treningowym liczącym 43 084 klipy to dokładnie ten rodzaj modelu, który może pokonać generalistę w jego własnym zadaniu — ale jest to powód, by pierwsze wdrożenie potraktować jako próbę, a nie zobowiązanie.
Jedyne, czego nie powinieneś robić, to traktować je jako wymienne, ponieważ oba mają na karcie napis „model wizyjno-językowy”. Czytnik dokumentów i analityk tenisowy nigdy nie były tym samym produktem, a w tej parze różnica w tym, co robią, jest znacznie większa niż różnica w tym, jak dobrze to robią.
