Ett genererat hero-kort för en jämförelse mellan NVIDIA NemotronLabs AI for Media - Sports Tennis och InternLumina U2, som visar en ikon för ett tennispoängklipp på ena sidan och en text-plus-bild-utdatastack på den andra, märkt 31B-specialist med endast textutdata mot 16B enhetlig med text och bilder ut, med OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: Jämförelsen som ingen av modellerna kan förlora

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Fråga vilken som är bättre – NVIDIA NemotronLabs AI for Media - Sports Tennis eller InternLumina U2 – och det ärliga svaret är att frågan inte låter sig avgöras. De två repositorierna dök båda upp på Hugging Face i september 2026, båda är multimodala mixture-of-experts-modeller byggda av välfinansierade labb, och de har nästan inget annat gemensamt. NVIDIAs modell är en 31B-specialist som tolkar en enskild tennispoäng och svarar på frågor om det. InternLumina U2, från Shanghai AI Laboratorys InternLM-team och som publicerats som internlm/InternLumina-U2, är en enhetlig 16B-modell som förstår bilder, video och 3D och även genererar och redigerar bilder. De delar ingen benchmark, ingen målgrupp och ingen driftsättningsprofil. Att jämföra dem är mindre som att välja en telefon och mer som att välja mellan ett stetoskop och en 3D-skrivare.

Det som ändå gör att det är värt att skriva om paret är ett mönster som båda modellerna delar: ingen av dem har utvärderats oberoende, och båda beskrivs av sin egen leverantör som något annat än färdiga. Det är den verkliga jämförelsen – inte vilken modell som vinner, utan hur mycket av endera man faktiskt kan verifiera i dag.

Två olika jobb som bär på samma ord

"Multimodal" täcker båda dessa och säger ingenting. Här är uppdelningen:

• Vad den tar in — Sports Tennis: video (mp4 upp till 2 minuter), ljud (wav/mp3), bilder, text. InternLumina U2: text, bilder, video och 3D. Tennismodellen är den enda av de två med en materiell ljudväg, kopplad genom en Parakeet-talencoder som läser av publik- och träffljud tillsammans med bildrutorna.

• Vad den ger tillbaka — Sports Tennis: endast text. InternLumina U2: text och genererade eller redigerade bilder, via en fullständigt diskret visuell representation med 8 kodböcker byggd på AToken.

• Vad användaren frågar — Sport Tennis: "vad hände i den här poängen, var stod spelaren, landade bollen inne." InternLumina U2: "beskriv det här diagrammet, och rita sedan en ny version av det till mig."

• Arkitektur — Sports Tennis: Mamba2-Transformer hybrid MoE, 31B totalt med cirka 3B aktiva per token, ärver sin stomme och encoders från Nemotron 3 Nano Omni. InternLumina U2: en 16B gles MoE med 1B aktiva parametrar, byggd som en multi-codebook diffusionsspråkmodell snarare än en konventionell autoregressiv sådan.

• Kontext — Sports Tennis publicerar upp till 256k tokens. Kortet för InternLumina U2 anger inte någon kontextsiffra.

• Licens — Sports Tennis levereras under OpenMDW-1.1 med kortet som anger kommersiell och icke-kommersiell användning. InternLumina U2 är Apache 2.0.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

Det som faktiskt gör dem ojämförbara

Det finns ingen gemensam resultattavla, och det är värt att vara precis om varför i stället för att lämna det som en vag axelryckning.

Sports Tennis finjusterad på en proprietär NVIDIA-tennisdatauppsättning — 1 312 129 Q&A-exempel över 43 084 klipp på poängnivå från 239 matcher, märkta enligt 38 annoteringskategorier, alla insamlade 2025. Dess testuppsättning är en undanhållen del bestående av 12 matcher, 2 689 klipp och 80 872 frågor. Var och en av dessa artefakter är NVIDIAs egen. Ingen utomstående grupp har data, så ingen utomstående grupp kan reproducera ett resultat — och som det visar sig publicerade NVIDIA inget resultat att reproducera. Kortet dokumenterar utvärderingsprotokollet i detalj och rapporterar sedan inget resultat från det. Ingenting om träffsäkerhet, ingenting per kategori, ingenting.

InternLumina U2 ligger på andra sidan av samma vägg. Den publicerar siffror, men de är uttryckligen partiella. Modellkortet säger det på en rad: "Preliminära, partiella resultat. Fullständiga jämförelsetabeller kommer att finnas i den kommande tekniska rapporten." Det som finns är en spridning av leverantörsrapporterade siffror över mycket olika förmågor – ChartQA 86.52 och CharXiv-DQ 83.65 på dokument, MathVision 33.22 och DynaMath 56.37 på visuell matematik, VideoMME 51.26 och MVBench 59.74 på video, 3D MM-Vet 41.8, DPG-Bench 87.10 och GenEval 0.81 på generering, ImgEdit 3.83 på redigering. Och projektsidans egen tabell visar att modellen ligger efter minst en namngiven konkurrent på minst ett huvudmått: GenEval 0.81 mot LLaDA2.0-Unis 0.89.

Så den ena modellen har en dokumenterad utvärdering och inga resultat, och den andra har resultat och en uttryckligen ofullständig utvärdering. Ingen av dem ger dig en siffra som du kan ställa bredvid den andra. Varje sida som rangordnar dessa två har hittat på sin rangordning.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Där de verkligen överlappar varandra, och vad det visar

Videoförståelse är det enda område båda gör anspråk på, och även där är överlappningen tunnare än den ser ut. InternLumina U2 rapporterar VideoMME 51,26 och MLVU 57,03 och MVBench 59,74 — allmänna videoförståelsepoäng, rapporterade av leverantören. Sports Tennis rapporterar ingenting, men dess kort beskriver en mycket smalare och mycket djupare uppgift: resonemang på poängnivå över en hel rally med ljud, över 38 finkorniga annoteringskategorier inklusive slagmekanik, banpositionering, rörelse och poängställning.

Den rimliga slutledningen är att InternLumina U2 skulle vara den bättre generalisten och Sports Tennis den bättre tennisläsaren, men det är en slutledning utifrån uppgiftens form, inte utifrån data. Den skulle lätt kunna vara fel åt endera hållet. Det som inte är en slutledning är att ett generellt videobenchmark och ett proprietärt tennisbenchmark på punktnivå inte kan placeras på samma axel, och att en enhetlig 16B-generator och en fryst 31B-encoderspecialist inte byggdes för att svara på samma fråga.

Att driva någon av dem är ett annat slags projekt.

Driftsättning är där klyftan slutar vara filosofisk.

Sports Tennis anger en hård nedre gräns på en GPU med ungefär 80 GB minne vid BF16, med vikter på omkring 62 GB, testat på A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor och RTX 5090. Det finns ingen kvantiserad checkpoint, så kravet på 80 GB går inte att förhandla nedåt i dag. Det är också endast på engelska.

InternLumina U2:s mer intressanta problem är inte minnet, det är kisel. Repositoriet innehåller checkpoints uppdelade efter träningshårdvara: en komplett ascend/katalog med sju safetensors-shards tränade på Huawei Ascend NPU:er, och en nvidia/katalog märkt "kommer snart." Om du kör NVIDIA-hårdvara — vilket, för en modell vars syskon är en tennis-finjustering av Nemotron, gäller de flesta som läser detta — är den checkpoint du vill ha den som inte har landat. Inferenskod och installationsinstruktioner finns i InternLM GitHub-repositoriet i stället för på Hubben, och den tekniska rapporten är fortfarande inte klar.

Det vänder på den vanliga förväntan. Den proprietära, icke-benchmarkade, apparatliknande modellen är den du kan ladda ner och köra redan nu på dag ett. Den öppna forskningsmodellen under Apache-2.0 är den som väntar på en hårdvaruspecifik build.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

Där en router passar — och där den inte gör det

Ingen av dessa modeller hostas på OrcaRouter, och det finns inget ärligt sätt att skriva runt det. Sports Tennis har ingen endpoint någonstans; NVIDIA publicerade vikter och inget annat. InternLumina U2:s eget repositorium noterar att NVIDIA-checkpointarna fortfarande är väntande, så det finns inget att serva från vår sida heller. Detta är ett beslut om egen hosting i båda fallen, inte ett routingbeslut.

Routningsfrågan dyker upp ett lager upp. Ett team som vill utvärdera en specialist som Sports Tennis mot en generalist som InternLumina U2 gör det inte isolerat — de gör det som en kandidat i en pipeline som också behöver taltranskribering, dokumenthantering, sammanfattning och applikationslogiken runt dem. Dessa komponenter är hostade, och de är de delar där en enda API-nyckel som täcker över 200 modeller med automatisk failover mellan leverantörer sparar en veckas integrationsarbete. En nyckel för modellerna du kan anropa, så de du måste köra själv är det enda du faktiskt underhåller.

Den öppna frågan

Ställda sida vid sida utgör NVIDIA NemotronLabs AI for Media - Sports Tennis och InternLumina U2 en hyfsad illustration av två sätt att släppa en multimodell offentligt på ett dåligt sätt. Den ena dokumenterade sin utvärdering och undanhöll resultaten; den andra publicerade resultaten och betecknade sin utvärdering som ofullständig. Båda är, i september 2026, icke-falsifierbara påståenden.

Det intressanta att följa är inte vilken av dem som visar sig starkare — de kommer aldrig att testas på samma sak. Det är vilket labb som stänger sitt gap först. Om NVIDIA publicerar tennissiffror har NVIDIA löst det svårare problemet, eftersom ett proprietärt held-out-benchmark med 12 osedda matcher är det enda ärliga sättet att poängsätta en domänfinjustering, och NVIDIA har redan byggt uppdelningen. Om InternLM levererar NVIDIA-checkpoints och den tekniska rapporten har InternLM gjort sin Apache-2.0-modell genuint användbar på den hårdvara som dess användare äger. Vilket som än händer kommer den här jämförelsen att vara värd att läsa om — för just nu är det mest försvarbara som något av modellkorten stöder en axelryckning.