Een gegenereerde hero-kaart voor een vergelijking tussen NVIDIA NemotronLabs AI for Media - Sports Tennis en InternLumina U2, met aan de ene kant een icoon van een tennispointclip en aan de andere kant een uitvoerstapel van tekst plus afbeelding, aangeduid als 31B-specialist met alleen tekstuitvoer tegenover 16B unified met tekst en afbeeldingen als uitvoer, met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: De vergelijking die geen van beide modellen kan verliezen

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Vraag welke beter is — NVIDIA NemotronLabs AI for Media - Sports Tennis of InternLumina U2 — en het eerlijke antwoord is dat de vraag zich niet laat beslechten. De twee repositories verschenen beide in september 2026 op Hugging Face, het zijn allebei mixture-of-experts multimodale modellen gebouwd door goed gefinancierde labs, en verder hebben ze bijna niets gemeen. Het model van NVIDIA is een 31B-specialist die één enkel tennispunt leest en daar vragen over beantwoordt. InternLumina U2, van het InternLM-team van Shanghai AI Laboratory en gepubliceerd als internlm/InternLumina-U2, is een geünificeerd 16B-model dat afbeeldingen, video en 3D begrijpt en ook afbeeldingen genereert en bewerkt. Ze delen geen benchmark, geen doelgebruiker en geen deploymentprofiel. Het vergelijken van de twee lijkt minder op het kiezen van een telefoon en meer op het kiezen tussen een stethoscoop en een 3D-printer.

Wat deze combinatie toch de moeite van het beschrijven waard maakt, is een patroon dat beide modellen gemeen hebben: geen van beide is onafhankelijk geëvalueerd, en beide worden door hun eigen leverancier beschreven als iets anders dan afgerond. Dat is de echte vergelijking — niet welk model wint, maar hoeveel van elk van de twee je vandaag daadwerkelijk kunt verifiëren.

Twee verschillende banen die hetzelfde woord dragen

"Multimodaal" omvat beide en zegt je niets. Hier is de splitsing:

• Wat het opneemt — Sports Tennis: video (mp4 tot 2 minuten), audio (wav/mp3), afbeeldingen, tekst. InternLumina U2: tekst, afbeeldingen, video en 3D. Het tennismodel is de enige van de twee met een wezenlijk audiopad, via een Parakeet-spraakencoder geleid, die publieks- en impactgeluid samen met de frames leest.

• Wat het teruggeeft — Sports Tennis: alleen tekst. InternLumina U2: tekst en gegenereerde of bewerkte afbeeldingen, via een 8-codeboek volledig-discrete visuele representatie gebouwd op AToken.

• Wat de gebruiker vraagt — Sport Tennis: "wat is er in dit punt gebeurd, waar stond de speler, landde de bal binnen." InternLumina U2: "beschrijf deze grafiek en teken vervolgens een nieuwe versie ervan voor me."

• Architectuur — Sports Tennis: Mamba2-Transformer hybride MoE, 31B totaal met ongeveer 3B actief per token, waarbij de backbone en encoders zijn overgenomen van Nemotron 3 Nano Omni. InternLumina U2: een 16B sparse MoE met 1B actieve parameters, gebouwd als een multi-codebook diffusietaalmodel in plaats van een conventioneel autoregressief taalmodel.

• Context — Sports Tennis publiceert tot 256k tokens. De kaart van InternLumina U2 vermeldt geen contextwaarde.

• Licentie — Sports Tennis wordt geleverd onder OpenMDW-1.1, waarbij op de kaart staat dat het voor commercieel en niet-commercieel gebruik is. InternLumina U2 valt onder Apache 2.0.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

Het ding dat ze eigenlijk onvergelijkbaar maakt

Er is geen gedeeld scorebord, en het is de moeite waard om precies te zijn over waarom, in plaats van het te laten bij een vaag schouderophalen.

Sports Tennis, fine-tuned op een propriëtaire tennisdataset van NVIDIA — 1.312.129 Q&A-voorbeelden, verdeeld over 43.084 clips op puntniveau uit 239 wedstrijden, gelabeld volgens 38 annotatiecategorieën, allemaal verzameld in 2025. De testset is een achtergehouden deelverzameling van 12 wedstrijden, 2.689 clips en 80.872 vragen. Elk van die artefacten is van NVIDIA zelf. Geen enkele externe groep heeft de data, dus geen enkele externe groep kan een score reproduceren — en het toeval wil dat NVIDIA geen score heeft gepubliceerd om te reproduceren. De modelkaart documenteert het evaluatieprotocol in detail en meldt vervolgens geen enkel resultaat daaruit. Niets over nauwkeurigheid, niets per categorie, niets.

InternLumina U2 bevindt zich aan de andere kant van diezelfde muur. Het publiceert cijfers, maar die zijn expliciet gedeeltelijk. De modelkaart zegt dit in één regel: "Voorlopige, gedeeltelijke resultaten. Volledige vergelijkingstabellen verschijnen in het komende technische rapport." Wat bestaat is een reeks door leveranciers gerapporteerde cijfers over zeer verschillende capaciteiten — ChartQA 86.52 en CharXiv-DQ 83.65 op documenten, MathVision 33.22 en DynaMath 56.37 op visuele wiskunde, VideoMME 51.26 en MVBench 59.74 op video, 3D MM-Vet 41.8, DPG-Bench 87.10 en GenEval 0.81 op generatie, ImgEdit 3.83 op bewerking. En de eigen tabel van de projectpagina toont dat het model achterloopt op ten minste één genoemde concurrent op ten minste één hoofdkerncijfer: GenEval 0.81 tegenover LLaDA2.0-Uni's 0.89.

Dus het ene model heeft een gedocumenteerde evaluatie en geen resultaten, en het andere heeft resultaten en een expliciet onvolledige evaluatie. Geen van beide levert een getal op dat je naast dat van de ander kunt leggen. Elke pagina die deze twee rangschikt, heeft zijn rangschikking verzonnen.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Waar ze daadwerkelijk overlappen, en wat het laat zien

Videobegrip is het enige terrein dat beide claimen, en zelfs daar is de overlap dunner dan het lijkt. InternLumina U2 rapporteert VideoMME 51.26 en MLVU 57.03 en MVBench 59.74 — algemene scores voor videobegrip, door de leverancier gerapporteerd. Sports Tennis rapporteert niets, maar de kaart beschrijft een veel nauwere en veel diepere taak: redeneren op puntniveau over een volledige rally met audio, over 38 fijnmazige annotatiecategorieën, waaronder slagtechniek, positie op de baan, beweging en scorestatus.

De redelijke gevolgtrekking is dat InternLumina U2 de betere generalist zou zijn en Sports Tennis de betere tennislezer, maar dat is een gevolgtrekking op basis van de vorm van de taak, niet van data. Het zou gemakkelijk in beide richtingen fout kunnen zijn. Wat geen gevolgtrekking is, is dat een algemene videobenchmark en een propriëtaire tennisbenchmark op puntniveau niet op dezelfde as kunnen worden geplaatst, en dat een 16B verenigde generator en een 31B specialist met bevroren encoder niet zijn gebouwd om dezelfde vraag te beantwoorden.

Een van beide runnen is een ander soort project.

Deployment is waar de kloof ophoudt filosofisch te zijn.

Sports Tennis vermeldt een harde ondergrens van één GPU met ongeveer 80 GB geheugen bij BF16, met gewichten van ongeveer 62 GB, getest op A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor en RTX 5090. Er is geen gequantiseerd checkpoint, dus de 80 GB-vereiste is vandaag niet naar beneden onderhandelbaar. Het is ook uitsluitend Engelstalig.

Het interessantere probleem van InternLumina U2 is niet geheugen, maar silicium. De repository herbergt checkpoints die zijn opgesplitst naar trainingshardware: een complete ascend/map met zeven safetensors-shards die zijn getraind op Huawei Ascend-NPU's, en een nvidia/map die is gemarkeerd als "binnenkort beschikbaar". Als je NVIDIA-hardware gebruikt — wat, voor een model waarvan het zusje een tennis-finetune van Nemotron is, voor de meeste lezers van dit stuk geldt — dan is de checkpoint die je wilt degene die nog niet is verschenen. Inferentiecode en installatie-instructies staan in de InternLM GitHub-repository in plaats van op de Hub, en het technische rapport laat nog op zich wachten.

Dat keert de gebruikelijke verwachting om. Het propriëtaire, niet-gebenchmarkte, appliance-vormige model is het model dat je op dag één meteen kunt downloaden en draaien. Het Apache-2.0 open onderzoeksmodel is het model dat wacht op een hardware-specifieke build.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

Waar een router past — en waar niet

Geen van deze modellen wordt gehost op OrcaRouter, en er is geen eerlijke manier om daar omheen te schrijven. Sports Tennis heeft nergens een endpoint; NVIDIA heeft alleen gewichten gepubliceerd en verder niets. De eigen repository van InternLumina U2 vermeldt dat de NVIDIA-checkpoints nog in behandeling zijn, dus er is van onze kant ook niets om te serveren. Dit is in beide gevallen een self-hostingbeslissing, geen routingbeslissing.

De routeringsvraag komt een laag hoger naar voren. Een team dat een specialist zoals Sports Tennis wil evalueren tegenover een generalist zoals InternLumina U2 doet dat niet geïsoleerd — het doet dat als één kandidaat in een pipeline die ook spraaktranscriptie, documentverwerking, het samenvatten en de applicatielogica eromheen nodig heeft. Die componenten worden gehost, en dat zijn de onderdelen waar één API-sleutel die meer dan 200 modellen dekt met automatische failover tussen providers een week integratiewerk bespaart. Eén sleutel voor de modellen die je kunt aanroepen, zodat de modellen die je zelf moet draaien het enige zijn dat je daadwerkelijk onderhoudt.

De open vraag

Naast elkaar gelegd zijn NVIDIA NemotronLabs AI for Media - Sports Tennis en InternLumina U2 een aardige illustratie van twee manieren om een multimodaal model slecht in het openbaar uit te brengen. De ene documenteerde zijn evaluatie en hield de resultaten achter; de andere publiceerde resultaten en bestempelde zijn evaluatie als onvolledig. Beide zijn, per september 2026, niet-falsifieerbare beweringen.

Het interessante om in de gaten te houden is niet welke van de twee sterker blijkt — ze zullen nooit op hetzelfde worden getest. Het gaat erom welk lab als eerste zijn kloof dichtmaakt. Als NVIDIA tenniscijfers publiceert, heeft het het moeilijkere probleem opgelost, want een propriëtaire, achtergehouden benchmark van 12 ongeziene wedstrijden is de enige eerlijke manier om een domeinfine-tune te beoordelen, en NVIDIA heeft de split al gebouwd. Als InternLM de NVIDIA-checkpoints en het technische rapport levert, heeft het zijn Apache-2.0-model echt bruikbaar gemaakt op de hardware die zijn gebruikers bezitten. Wat er ook gebeurt, deze vergelijking zal de moeite waard zijn om opnieuw te lezen — want op dit moment is het meest verdedigbare dat de modelkaart van een van beide modellen ondersteunt, een schouderophalen.