
Nemotron Sports Tennis vs InternLumina U2: Jämförelsen som ingen av modellerna kan förlora
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M tokens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fråga vilken som är bättre – NVIDIA NemotronLabs AI for Media - Sports Tennis eller InternLumina U2 – och det ärliga svaret är att frågan inte låter sig avgöras. De två repositorierna dök båda upp på Hugging Face i september 2026, båda är multimodala mixture-of-experts-modeller byggda av välfinansierade labb, och de har nästan inget annat gemensamt. NVIDIAs modell är en 31B-specialist som tolkar en enskild tennispoäng och svarar på frågor om det. InternLumina U2, från Shanghai AI Laboratorys InternLM-team och som publicerats som internlm/InternLumina-U2, är en enhetlig 16B-modell som förstår bilder, video och 3D och även genererar och redigerar bilder. De delar ingen benchmark, ingen målgrupp och ingen driftsättningsprofil. Att jämföra dem är mindre som att välja en telefon och mer som att välja mellan ett stetoskop och en 3D-skrivare.
Det som ändå gör att det är värt att skriva om paret är ett mönster som båda modellerna delar: ingen av dem har utvärderats oberoende, och båda beskrivs av sin egen leverantör som något annat än färdiga. Det är den verkliga jämförelsen – inte vilken modell som vinner, utan hur mycket av endera man faktiskt kan verifiera i dag.
Två olika jobb som bär på samma ord
"Multimodal" täcker båda dessa och säger ingenting. Här är uppdelningen:
• Vad den tar in — Sports Tennis: video (mp4 upp till 2 minuter), ljud (wav/mp3), bilder, text. InternLumina U2: text, bilder, video och 3D. Tennismodellen är den enda av de två med en materiell ljudväg, kopplad genom en Parakeet-talencoder som läser av publik- och träffljud tillsammans med bildrutorna.
• Vad den ger tillbaka — Sports Tennis: endast text. InternLumina U2: text och genererade eller redigerade bilder, via en fullständigt diskret visuell representation med 8 kodböcker byggd på AToken.
• Vad användaren frågar — Sport Tennis: "vad hände i den här poängen, var stod spelaren, landade bollen inne." InternLumina U2: "beskriv det här diagrammet, och rita sedan en ny version av det till mig."
• Arkitektur — Sports Tennis: Mamba2-Transformer hybrid MoE, 31B totalt med cirka 3B aktiva per token, ärver sin stomme och encoders från Nemotron 3 Nano Omni. InternLumina U2: en 16B gles MoE med 1B aktiva parametrar, byggd som en multi-codebook diffusionsspråkmodell snarare än en konventionell autoregressiv sådan.
• Kontext — Sports Tennis publicerar upp till 256k tokens. Kortet för InternLumina U2 anger inte någon kontextsiffra.
• Licens — Sports Tennis levereras under OpenMDW-1.1 med kortet som anger kommersiell och icke-kommersiell användning. InternLumina U2 är Apache 2.0.

Det som faktiskt gör dem ojämförbara
Det finns ingen gemensam resultattavla, och det är värt att vara precis om varför i stället för att lämna det som en vag axelryckning.
Sports Tennis finjusterad på en proprietär NVIDIA-tennisdatauppsättning — 1 312 129 Q&A-exempel över 43 084 klipp på poängnivå från 239 matcher, märkta enligt 38 annoteringskategorier, alla insamlade 2025. Dess testuppsättning är en undanhållen del bestående av 12 matcher, 2 689 klipp och 80 872 frågor. Var och en av dessa artefakter är NVIDIAs egen. Ingen utomstående grupp har data, så ingen utomstående grupp kan reproducera ett resultat — och som det visar sig publicerade NVIDIA inget resultat att reproducera. Kortet dokumenterar utvärderingsprotokollet i detalj och rapporterar sedan inget resultat från det. Ingenting om träffsäkerhet, ingenting per kategori, ingenting.
InternLumina U2 ligger på andra sidan av samma vägg. Den publicerar siffror, men de är uttryckligen partiella. Modellkortet säger det på en rad: "Preliminära, partiella resultat. Fullständiga jämförelsetabeller kommer att finnas i den kommande tekniska rapporten." Det som finns är en spridning av leverantörsrapporterade siffror över mycket olika förmågor – ChartQA 86.52 och CharXiv-DQ 83.65 på dokument, MathVision 33.22 och DynaMath 56.37 på visuell matematik, VideoMME 51.26 och MVBench 59.74 på video, 3D MM-Vet 41.8, DPG-Bench 87.10 och GenEval 0.81 på generering, ImgEdit 3.83 på redigering. Och projektsidans egen tabell visar att modellen ligger efter minst en namngiven konkurrent på minst ett huvudmått: GenEval 0.81 mot LLaDA2.0-Unis 0.89.
Så den ena modellen har en dokumenterad utvärdering och inga resultat, och den andra har resultat och en uttryckligen ofullständig utvärdering. Ingen av dem ger dig en siffra som du kan ställa bredvid den andra. Varje sida som rangordnar dessa två har hittat på sin rangordning.

Där de verkligen överlappar varandra, och vad det visar
Videoförståelse är det enda område båda gör anspråk på, och även där är överlappningen tunnare än den ser ut. InternLumina U2 rapporterar VideoMME 51,26 och MLVU 57,03 och MVBench 59,74 — allmänna videoförståelsepoäng, rapporterade av leverantören. Sports Tennis rapporterar ingenting, men dess kort beskriver en mycket smalare och mycket djupare uppgift: resonemang på poängnivå över en hel rally med ljud, över 38 finkorniga annoteringskategorier inklusive slagmekanik, banpositionering, rörelse och poängställning.
Den rimliga slutledningen är att InternLumina U2 skulle vara den bättre generalisten och Sports Tennis den bättre tennisläsaren, men det är en slutledning utifrån uppgiftens form, inte utifrån data. Den skulle lätt kunna vara fel åt endera hållet. Det som inte är en slutledning är att ett generellt videobenchmark och ett proprietärt tennisbenchmark på punktnivå inte kan placeras på samma axel, och att en enhetlig 16B-generator och en fryst 31B-encoderspecialist inte byggdes för att svara på samma fråga.
Att driva någon av dem är ett annat slags projekt.
Driftsättning är där klyftan slutar vara filosofisk.
Sports Tennis anger en hård nedre gräns på en GPU med ungefär 80 GB minne vid BF16, med vikter på omkring 62 GB, testat på A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor och RTX 5090. Det finns ingen kvantiserad checkpoint, så kravet på 80 GB går inte att förhandla nedåt i dag. Det är också endast på engelska.
InternLumina U2:s mer intressanta problem är inte minnet, det är kisel. Repositoriet innehåller checkpoints uppdelade efter träningshårdvara: en komplett ascend/katalog med sju safetensors-shards tränade på Huawei Ascend NPU:er, och en nvidia/katalog märkt "kommer snart." Om du kör NVIDIA-hårdvara — vilket, för en modell vars syskon är en tennis-finjustering av Nemotron, gäller de flesta som läser detta — är den checkpoint du vill ha den som inte har landat. Inferenskod och installationsinstruktioner finns i InternLM GitHub-repositoriet i stället för på Hubben, och den tekniska rapporten är fortfarande inte klar.
Det vänder på den vanliga förväntan. Den proprietära, icke-benchmarkade, apparatliknande modellen är den du kan ladda ner och köra redan nu på dag ett. Den öppna forskningsmodellen under Apache-2.0 är den som väntar på en hårdvaruspecifik build.

Där en router passar — och där den inte gör det
Ingen av dessa modeller hostas på OrcaRouter, och det finns inget ärligt sätt att skriva runt det. Sports Tennis har ingen endpoint någonstans; NVIDIA publicerade vikter och inget annat. InternLumina U2:s eget repositorium noterar att NVIDIA-checkpointarna fortfarande är väntande, så det finns inget att serva från vår sida heller. Detta är ett beslut om egen hosting i båda fallen, inte ett routingbeslut.
Routningsfrågan dyker upp ett lager upp. Ett team som vill utvärdera en specialist som Sports Tennis mot en generalist som InternLumina U2 gör det inte isolerat — de gör det som en kandidat i en pipeline som också behöver taltranskribering, dokumenthantering, sammanfattning och applikationslogiken runt dem. Dessa komponenter är hostade, och de är de delar där en enda API-nyckel som täcker över 200 modeller med automatisk failover mellan leverantörer sparar en veckas integrationsarbete. En nyckel för modellerna du kan anropa, så de du måste köra själv är det enda du faktiskt underhåller.
Den öppna frågan
Ställda sida vid sida utgör NVIDIA NemotronLabs AI for Media - Sports Tennis och InternLumina U2 en hyfsad illustration av två sätt att släppa en multimodell offentligt på ett dåligt sätt. Den ena dokumenterade sin utvärdering och undanhöll resultaten; den andra publicerade resultaten och betecknade sin utvärdering som ofullständig. Båda är, i september 2026, icke-falsifierbara påståenden.
Det intressanta att följa är inte vilken av dem som visar sig starkare — de kommer aldrig att testas på samma sak. Det är vilket labb som stänger sitt gap först. Om NVIDIA publicerar tennissiffror har NVIDIA löst det svårare problemet, eftersom ett proprietärt held-out-benchmark med 12 osedda matcher är det enda ärliga sättet att poängsätta en domänfinjustering, och NVIDIA har redan byggt uppdelningen. Om InternLM levererar NVIDIA-checkpoints och den tekniska rapporten har InternLM gjort sin Apache-2.0-modell genuint användbar på den hårdvara som dess användare äger. Vilket som än händer kommer den här jämförelsen att vara värd att läsa om — för just nu är det mest försvarbara som något av modellkorten stöder en axelryckning.
