
Nemotron Sports Tennis vs InternLumina U2: De vergelijking die geen van beide modellen kan verliezen
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Vraag welke beter is — NVIDIA NemotronLabs AI for Media - Sports Tennis of InternLumina U2 — en het eerlijke antwoord is dat de vraag zich niet laat beslechten. De twee repositories verschenen beide in september 2026 op Hugging Face, het zijn allebei mixture-of-experts multimodale modellen gebouwd door goed gefinancierde labs, en verder hebben ze bijna niets gemeen. Het model van NVIDIA is een 31B-specialist die één enkel tennispunt leest en daar vragen over beantwoordt. InternLumina U2, van het InternLM-team van Shanghai AI Laboratory en gepubliceerd als internlm/InternLumina-U2, is een geünificeerd 16B-model dat afbeeldingen, video en 3D begrijpt en ook afbeeldingen genereert en bewerkt. Ze delen geen benchmark, geen doelgebruiker en geen deploymentprofiel. Het vergelijken van de twee lijkt minder op het kiezen van een telefoon en meer op het kiezen tussen een stethoscoop en een 3D-printer.
Wat deze combinatie toch de moeite van het beschrijven waard maakt, is een patroon dat beide modellen gemeen hebben: geen van beide is onafhankelijk geëvalueerd, en beide worden door hun eigen leverancier beschreven als iets anders dan afgerond. Dat is de echte vergelijking — niet welk model wint, maar hoeveel van elk van de twee je vandaag daadwerkelijk kunt verifiëren.
Twee verschillende banen die hetzelfde woord dragen
"Multimodaal" omvat beide en zegt je niets. Hier is de splitsing:
• Wat het opneemt — Sports Tennis: video (mp4 tot 2 minuten), audio (wav/mp3), afbeeldingen, tekst. InternLumina U2: tekst, afbeeldingen, video en 3D. Het tennismodel is de enige van de twee met een wezenlijk audiopad, via een Parakeet-spraakencoder geleid, die publieks- en impactgeluid samen met de frames leest.
• Wat het teruggeeft — Sports Tennis: alleen tekst. InternLumina U2: tekst en gegenereerde of bewerkte afbeeldingen, via een 8-codeboek volledig-discrete visuele representatie gebouwd op AToken.
• Wat de gebruiker vraagt — Sport Tennis: "wat is er in dit punt gebeurd, waar stond de speler, landde de bal binnen." InternLumina U2: "beschrijf deze grafiek en teken vervolgens een nieuwe versie ervan voor me."
• Architectuur — Sports Tennis: Mamba2-Transformer hybride MoE, 31B totaal met ongeveer 3B actief per token, waarbij de backbone en encoders zijn overgenomen van Nemotron 3 Nano Omni. InternLumina U2: een 16B sparse MoE met 1B actieve parameters, gebouwd als een multi-codebook diffusietaalmodel in plaats van een conventioneel autoregressief taalmodel.
• Context — Sports Tennis publiceert tot 256k tokens. De kaart van InternLumina U2 vermeldt geen contextwaarde.
• Licentie — Sports Tennis wordt geleverd onder OpenMDW-1.1, waarbij op de kaart staat dat het voor commercieel en niet-commercieel gebruik is. InternLumina U2 valt onder Apache 2.0.

Het ding dat ze eigenlijk onvergelijkbaar maakt
Er is geen gedeeld scorebord, en het is de moeite waard om precies te zijn over waarom, in plaats van het te laten bij een vaag schouderophalen.
Sports Tennis, fine-tuned op een propriëtaire tennisdataset van NVIDIA — 1.312.129 Q&A-voorbeelden, verdeeld over 43.084 clips op puntniveau uit 239 wedstrijden, gelabeld volgens 38 annotatiecategorieën, allemaal verzameld in 2025. De testset is een achtergehouden deelverzameling van 12 wedstrijden, 2.689 clips en 80.872 vragen. Elk van die artefacten is van NVIDIA zelf. Geen enkele externe groep heeft de data, dus geen enkele externe groep kan een score reproduceren — en het toeval wil dat NVIDIA geen score heeft gepubliceerd om te reproduceren. De modelkaart documenteert het evaluatieprotocol in detail en meldt vervolgens geen enkel resultaat daaruit. Niets over nauwkeurigheid, niets per categorie, niets.
InternLumina U2 bevindt zich aan de andere kant van diezelfde muur. Het publiceert cijfers, maar die zijn expliciet gedeeltelijk. De modelkaart zegt dit in één regel: "Voorlopige, gedeeltelijke resultaten. Volledige vergelijkingstabellen verschijnen in het komende technische rapport." Wat bestaat is een reeks door leveranciers gerapporteerde cijfers over zeer verschillende capaciteiten — ChartQA 86.52 en CharXiv-DQ 83.65 op documenten, MathVision 33.22 en DynaMath 56.37 op visuele wiskunde, VideoMME 51.26 en MVBench 59.74 op video, 3D MM-Vet 41.8, DPG-Bench 87.10 en GenEval 0.81 op generatie, ImgEdit 3.83 op bewerking. En de eigen tabel van de projectpagina toont dat het model achterloopt op ten minste één genoemde concurrent op ten minste één hoofdkerncijfer: GenEval 0.81 tegenover LLaDA2.0-Uni's 0.89.
Dus het ene model heeft een gedocumenteerde evaluatie en geen resultaten, en het andere heeft resultaten en een expliciet onvolledige evaluatie. Geen van beide levert een getal op dat je naast dat van de ander kunt leggen. Elke pagina die deze twee rangschikt, heeft zijn rangschikking verzonnen.

Waar ze daadwerkelijk overlappen, en wat het laat zien
Videobegrip is het enige terrein dat beide claimen, en zelfs daar is de overlap dunner dan het lijkt. InternLumina U2 rapporteert VideoMME 51.26 en MLVU 57.03 en MVBench 59.74 — algemene scores voor videobegrip, door de leverancier gerapporteerd. Sports Tennis rapporteert niets, maar de kaart beschrijft een veel nauwere en veel diepere taak: redeneren op puntniveau over een volledige rally met audio, over 38 fijnmazige annotatiecategorieën, waaronder slagtechniek, positie op de baan, beweging en scorestatus.
De redelijke gevolgtrekking is dat InternLumina U2 de betere generalist zou zijn en Sports Tennis de betere tennislezer, maar dat is een gevolgtrekking op basis van de vorm van de taak, niet van data. Het zou gemakkelijk in beide richtingen fout kunnen zijn. Wat geen gevolgtrekking is, is dat een algemene videobenchmark en een propriëtaire tennisbenchmark op puntniveau niet op dezelfde as kunnen worden geplaatst, en dat een 16B verenigde generator en een 31B specialist met bevroren encoder niet zijn gebouwd om dezelfde vraag te beantwoorden.
Een van beide runnen is een ander soort project.
Deployment is waar de kloof ophoudt filosofisch te zijn.
Sports Tennis vermeldt een harde ondergrens van één GPU met ongeveer 80 GB geheugen bij BF16, met gewichten van ongeveer 62 GB, getest op A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor en RTX 5090. Er is geen gequantiseerd checkpoint, dus de 80 GB-vereiste is vandaag niet naar beneden onderhandelbaar. Het is ook uitsluitend Engelstalig.
Het interessantere probleem van InternLumina U2 is niet geheugen, maar silicium. De repository herbergt checkpoints die zijn opgesplitst naar trainingshardware: een complete ascend/map met zeven safetensors-shards die zijn getraind op Huawei Ascend-NPU's, en een nvidia/map die is gemarkeerd als "binnenkort beschikbaar". Als je NVIDIA-hardware gebruikt — wat, voor een model waarvan het zusje een tennis-finetune van Nemotron is, voor de meeste lezers van dit stuk geldt — dan is de checkpoint die je wilt degene die nog niet is verschenen. Inferentiecode en installatie-instructies staan in de InternLM GitHub-repository in plaats van op de Hub, en het technische rapport laat nog op zich wachten.
Dat keert de gebruikelijke verwachting om. Het propriëtaire, niet-gebenchmarkte, appliance-vormige model is het model dat je op dag één meteen kunt downloaden en draaien. Het Apache-2.0 open onderzoeksmodel is het model dat wacht op een hardware-specifieke build.

Waar een router past — en waar niet
Geen van deze modellen wordt gehost op OrcaRouter, en er is geen eerlijke manier om daar omheen te schrijven. Sports Tennis heeft nergens een endpoint; NVIDIA heeft alleen gewichten gepubliceerd en verder niets. De eigen repository van InternLumina U2 vermeldt dat de NVIDIA-checkpoints nog in behandeling zijn, dus er is van onze kant ook niets om te serveren. Dit is in beide gevallen een self-hostingbeslissing, geen routingbeslissing.
De routeringsvraag komt een laag hoger naar voren. Een team dat een specialist zoals Sports Tennis wil evalueren tegenover een generalist zoals InternLumina U2 doet dat niet geïsoleerd — het doet dat als één kandidaat in een pipeline die ook spraaktranscriptie, documentverwerking, het samenvatten en de applicatielogica eromheen nodig heeft. Die componenten worden gehost, en dat zijn de onderdelen waar één API-sleutel die meer dan 200 modellen dekt met automatische failover tussen providers een week integratiewerk bespaart. Eén sleutel voor de modellen die je kunt aanroepen, zodat de modellen die je zelf moet draaien het enige zijn dat je daadwerkelijk onderhoudt.
De open vraag
Naast elkaar gelegd zijn NVIDIA NemotronLabs AI for Media - Sports Tennis en InternLumina U2 een aardige illustratie van twee manieren om een multimodaal model slecht in het openbaar uit te brengen. De ene documenteerde zijn evaluatie en hield de resultaten achter; de andere publiceerde resultaten en bestempelde zijn evaluatie als onvolledig. Beide zijn, per september 2026, niet-falsifieerbare beweringen.
Het interessante om in de gaten te houden is niet welke van de twee sterker blijkt — ze zullen nooit op hetzelfde worden getest. Het gaat erom welk lab als eerste zijn kloof dichtmaakt. Als NVIDIA tenniscijfers publiceert, heeft het het moeilijkere probleem opgelost, want een propriëtaire, achtergehouden benchmark van 12 ongeziene wedstrijden is de enige eerlijke manier om een domeinfine-tune te beoordelen, en NVIDIA heeft de split al gebouwd. Als InternLM de NVIDIA-checkpoints en het technische rapport levert, heeft het zijn Apache-2.0-model echt bruikbaar gemaakt op de hardware die zijn gebruikers bezitten. Wat er ook gebeurt, deze vergelijking zal de moeite waard zijn om opnieuw te lezen — want op dit moment is het meest verdedigbare dat de modelkaart van een van beide modellen ondersteunt, een schouderophalen.
