
Nemotron Sports Tennis vs InternLumina U2: Porównanie, w którym żaden z modeli nie może przegrać
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Zapytaj, który jest lepszy — NVIDIA NemotronLabs AI for Media - Sports Tennis czy InternLumina U2 — a uczciwa odpowiedź brzmi, że to pytanie nie daje się rozstrzygnąć. Oba repozytoria pojawiły się na Hugging Face we wrześniu 2026 r., oba są multimodalnymi modelami typu mixture-of-experts zbudowanymi przez dobrze finansowane laboratoria, a poza tym nie mają ze sobą prawie nic wspólnego. Model firmy NVIDIA to specjalistyczny model 31B, który odczytuje pojedynczy punkt tenisowy i odpowiada na pytania dotyczące tego punktu. InternLumina U2, pochodzący od zespołu InternLM z Shanghai AI Laboratory i opublikowany jako internlm/InternLumina-U2, to zunifikowany model 16B, który rozumie obrazy, wideo i 3D, a także generuje i edytuje obrazy. Nie mają wspólnego benchmarku, docelowego użytkownika ani profilu wdrożeniowego. Porównywanie ich jest mniej jak wybieranie telefonu, a bardziej jak wybieranie między stetoskopem a drukarką 3D.
To, co sprawia, że to zestawienie w ogóle zasługuje na opis, to wzorzec wspólny dla obu modeli: żaden z nich nie został niezależnie oceniony, a oba są opisywane przez własnego dostawcę jako coś innego niż ukończone. To jest prawdziwe porównanie — nie to, który model wygrywa, lecz to, jak dużą część każdego z nich można dziś faktycznie zweryfikować.
Dwie różne prace pod tym samym słowem
„Multimodal” obejmuje jedno i drugie i nic nie mówi. Oto podział:
• Co przyjmuje na wejściu — Sports Tennis: wideo (mp4 do 2 minut), audio (wav/mp3), obrazy, tekst. InternLumina U2: tekst, obrazy, wideo i 3D. Model tenisowy jest jedynym z tych dwóch, który ma materiałową ścieżkę audio, podłączoną przez enkoder mowy Parakeet, który odczytuje dźwięk tłumu i uderzeń wraz z klatkami.
• Co daje w zamian — Sports Tennis: tylko tekst. InternLumina U2: tekst i generowane lub edytowane obrazy, poprzez w pełni dyskretną reprezentację wizualną z 8 codebookami, zbudowaną na AToken.
• Co pyta użytkownik — Sports Tennis: „co się stało w tym punkcie, gdzie stał zawodnik, czy piłka wpadła w kort”. InternLumina U2: „opisz ten wykres, a następnie narysuj mi jego nową wersję”.
• Architektura — Sports Tennis: hybrydowy MoE Mamba2-Transformer, łącznie 31 mld parametrów, z około 3 mld aktywnych na token, dziedziczący swój szkielet i enkodery z Nemotron 3 Nano Omni. InternLumina U2: rzadki MoE o 16 mld parametrów, z 1 mld aktywnych parametrów, zbudowany jako wielokodeksowy dyfuzyjny model językowy, a nie konwencjonalny model autoregresyjny.
• Kontekst — Sports Tennis publikuje do 256 tys. tokenów. Karta InternLumina U2 nie podaje wartości kontekstu.
• Licencja — Sports Tennis jest udostępniany na licencji OpenMDW-1.1, a karta wskazuje na użycie komercyjne i niekomercyjne. InternLumina U2 jest na licencji Apache 2.0.

To, co tak naprawdę czyni je nieporównywalnymi
Nie ma wspólnej tablicy wyników i warto dokładnie powiedzieć, dlaczego tak jest, zamiast zbywać to niejasnym wzruszeniem ramion.
Sports Tennis dostrojony na zastrzeżonym zbiorze danych tenisowych NVIDIA — 1 312 129 przykładów pytań i odpowiedzi z 43 084 klipów na poziomie punktów z 239 meczów, oznaczonych według 38 kategorii adnotacji, wszystkie zebrane w 2025 r. Jego zbiór testowy to wydzielona część składająca się z 12 meczów, 2 689 klipów i 80 872 pytań. Każdy z tych artefaktów należy do samej NVIDIA. Żadna zewnętrzna grupa nie ma tych danych, więc żadna zewnętrzna grupa nie może odtworzyć wyniku — a jak się okazuje, NVIDIA nie opublikowała żadnego wyniku do odtworzenia. Karta dokumentuje szczegółowo protokół oceny, a następnie nie podaje z niego żadnego wyniku. Nic o dokładności, nic w podziale na kategorie, nic.
InternLumina U2 znajduje się po przeciwnej stronie tej samej ściany. Publikuje liczby, ale są one wyraźnie częściowe. Karta modelu mówi o tym w jednym wierszu: „Wstępne, częściowe wyniki. Pełne tabele porównawcze pojawią się w nadchodzącym raporcie technicznym”. To, co istnieje, to zestaw liczb raportowanych przez dostawcę w bardzo różnych obszarach możliwości — ChartQA 86,52 i CharXiv-DQ 83,65 w dokumentach, MathVision 33,22 i DynaMath 56,37 w matematyce wizualnej, VideoMME 51,26 i MVBench 59,74 w wideo, 3D MM-Vet 41,8, DPG-Bench 87,10 i GenEval 0,81 w generowaniu, ImgEdit 3,83 w edycji. A własna tabela na stronie projektu pokazuje, że model ustępuje co najmniej jednemu nazwanemu konkurentowi w co najmniej jednym kluczowym wskaźniku: GenEval 0,81 wobec 0,89 LLaDA2.0-Uni.
A więc jeden model ma udokumentowaną ewaluację i brak wyników, a drugi ma wyniki i jawnie niekompletną ewaluację. Żadne z nich nie daje liczby, którą można by zestawić z drugą. Każda strona, która ustawia te dwa modele w rankingu, wymyśliła ten ranking.

Gdzie naprawdę się pokrywają i co to pokazuje
Zrozumienie wideo to jedyne terytorium, do którego roszczą sobie prawo oba, a nawet tam pokrywanie się jest mniejsze, niż się wydaje. InternLumina U2 podaje VideoMME 51,26 oraz MLVU 57,03 i MVBench 59,74 — ogólne wyniki rozumienia wideo, raportowane przez dostawcę. Sports Tennis nie podaje niczego, ale jego karta opisuje zadanie znacznie węższe i znacznie głębsze: rozumowanie na poziomie punktów w ramach pełnego wymiany z dźwiękiem, w 38 szczegółowych kategoriach adnotacji, obejmujących mechanikę uderzeń, ustawienie na korcie, ruch i stan wyniku.
Rozsądny wniosek jest taki, że lepszym generalistą byłaby InternLumina U2, a lepszym czytelnikiem tenisa — Sports Tennis, ale to wniosek z kształtu zadania, a nie z danych. Łatwo może się okazać błędny w obu kierunkach. Czymś, co nie jest wnioskiem, jest to, że ogólnego benchmarku wideo i zastrzeżonego benchmarku tenisowego na poziomie punktów nie można umieścić na tej samej osi oraz że zunifikowany generator 16B i specjalista 31B z zamrożonym enkoderem nie zostały stworzone do odpowiadania na to samo pytanie.
Uruchamianie któregokolwiek z nich to projekt innego rodzaju.
Wdrożenie to moment, w którym luka przestaje być filozoficzna.
Sports Tennis określa twarde minimum jednego GPU z około 80 GB pamięci w BF16 i wagami około 62 GB; przetestowano je na A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor i RTX 5090. Nie ma skwantyzowanego checkpointu, więc nie można dziś zejść poniżej wymogu 80 GB. Jest też dostępny wyłącznie po angielsku.
Ciekawszy problem modelu InternLumina U2 nie dotyczy pamięci, lecz krzemu. Repozytorium udostępnia checkpointy podzielone według sprzętu treningowego: kompletny ascend/ katalog z siedmioma shardami safetensors wytrenowanymi na NPU Huawei Ascend oraz nvidia/ katalog oznaczony jako „wkrótce”. Jeśli pracujesz na sprzęcie NVIDIA — co, w przypadku modelu, którego bliźniaczy model to tenisowy fine-tuning modelu Nemotron, dotyczy większości osób czytających to — checkpoint, którego chcesz, to ten, który jeszcze się nie pojawił. Kod wnioskowania i instrukcje konfiguracji znajdują się w repozytorium InternLM na GitHubie, a nie na Hubie, a raport techniczny wciąż jest w przygotowaniu.
To odwraca zwykłe oczekiwania. Zastrzeżony, niepoddany benchmarkom model w formie urządzenia to ten, który możesz pobrać i uruchomić od razu, pierwszego dnia. Otwarty model badawczy Apache-2.0 to ten, który czeka na kompilację pod konkretny sprzęt.

Gdzie router pasuje — a gdzie nie
Żaden z tych modeli nie jest hostowany na OrcaRouter i nie ma uczciwego sposobu, żeby to obejść w tekście. Sports Tennis nie ma nigdzie żadnego endpointu; NVIDIA opublikowała wagi i nic więcej. Własne repozytorium InternLumina U2 odnotowuje, że checkpointy NVIDIA wciąż oczekują, więc po naszej stronie również nie ma czego udostępniać. W obu przypadkach jest to decyzja o samodzielnym hostowaniu, a nie decyzja dotycząca routingu.
Kwestia routingu pojawia się o warstwę wyżej. Zespół, który chce ocenić specjalistę takiego jak Sports Tennis w zestawieniu z generalistą takim jak InternLumina U2, nie robi tego w izolacji — robi to jako jednego kandydata w potoku, który potrzebuje także transkrypcji mowy, obsługi dokumentów, streszczania i logiki aplikacji wokół nich. Te komponenty są hostowane i to właśnie w ich przypadku jeden klucz API obejmujący ponad 200 modeli z automatycznym przełączaniem awaryjnym między dostawcami oszczędza tydzień pracy nad integracją. Jeden klucz do modeli, które możesz wywoływać, dzięki czemu te, które musisz uruchamiać samodzielnie, są jedyną rzeczą, którą faktycznie utrzymujesz.
Otwarte pytanie
Zestawione obok siebie NVIDIA NemotronLabs AI for Media - Sports Tennis i InternLumina U2 stanowią niezłą ilustrację dwóch sposobów publicznego wypuszczenia modelu multimodalnego w nieudany sposób. Jeden udokumentował swoją ewaluację i wstrzymał wyniki; drugi opublikował wyniki i oznaczył swoją ewaluację jako niekompletną. Oba są, na wrzesień 2026 r., twierdzeniami niefalsyfikowalnymi.
Ciekawą rzeczą do obserwowania nie jest to, który z nich okaże się silniejszy — nigdy nie zostaną przetestowane na tym samym. Chodzi o to, które laboratorium pierwsze zamknie swoją lukę. Jeśli NVIDIA opublikuje wyniki dla tenisa, rozwiąże trudniejszy problem, ponieważ zastrzeżony benchmark na odłożonym zbiorze 12 niewidzianych meczów to jedyny uczciwy sposób oceny dostrajania do danej dziedziny, a NVIDIA już zbudowała ten podział. Jeśli InternLM dostarczy checkpointy NVIDIA i raport techniczny, uczyni swój model na licencji Apache-2.0 naprawdę użytecznym na sprzęcie, który posiadają jego użytkownicy. Cokolwiek się stanie, to porównanie będzie warte ponownego przeczytania — bo obecnie najbardziej obronnym stanowiskiem, jakie daje karta któregokolwiek z tych modeli, jest wzruszenie ramion.
