Una hero card generata per un confronto tra NVIDIA NemotronLabs AI for Media - Sports Tennis e InternLumina U2, che mostra un'icona di clip di un punto di tennis su un lato e una pila di output testo più immagini sull'altro, etichettata specialista 31B con solo output testuale contro 16B unificato con testo e immagini in uscita, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: Il confronto che nessuno dei due modelli può perdere

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Chiedi quale sia migliore — NVIDIA NemotronLabs AI for Media - Sports Tennis o InternLumina U2 — e la risposta onesta è che la domanda non si risolve. Entrambi i repository sono comparsi su Hugging Face a settembre 2026, entrambi sono modelli multimodali mixture-of-experts costruiti da laboratori ben finanziati, e non hanno quasi nient'altro in comune. Il modello di NVIDIA è uno specialista da 31B che legge un singolo punto di tennis e risponde a domande al riguardo. InternLumina U2, del team InternLM dello Shanghai AI Laboratory e pubblicato come internlm/InternLumina-U2, è un modello unificato da 16B che comprende immagini, video e 3D e anche genera e modifica immagini. Non condividono alcun benchmark, alcun utente target e alcun profilo di deployment. Confrontarli è meno come scegliere un telefono e più come scegliere tra uno stetoscopio e una stampante 3D.

Ciò che rende comunque l'abbinamento degno di essere scritto è uno schema che entrambi i modelli condividono: nessuno dei due è stato valutato in modo indipendente, ed entrambi vengono descritti dal proprio fornitore come qualcosa di diverso da finito. Questo è il vero confronto — non quale modello vince, ma quanto di ciascuno dei due puoi effettivamente verificare oggi.

Due lavori diversi che indossano la stessa parola

"Multimodale" copre entrambi questi aspetti e non ti dice nulla. Ecco la distinzione:

• Cosa accetta in ingresso — Sports Tennis: video (mp4 fino a 2 minuti), audio (wav/mp3), immagini, testo. InternLumina U2: testo, immagini, video e 3D. Il modello tennis è l'unico dei due ad avere un materiale percorso audio, collegato tramite un encoder vocale Parakeet che legge il suono della folla e degli impatti insieme ai fotogrammi.

• Cosa restituisce — Tennis sportivo: solo testo. InternLumina U2: testo e immagini generate o modificate, tramite una rappresentazione visiva completamente discreta a 8 codebook costruita su AToken.

• Ciò che chiede l'utente — Sport Tennis: "cosa è successo in questo punto, dov'era posizionato il giocatore, la palla è caduta in campo." InternLumina U2: "descrivi questo grafico, e poi disegnamene una nuova versione."

• Architettura — Sports Tennis: MoE ibrido Mamba2-Transformer, 31B totali con circa 3B attivi per token, che eredita backbone ed encoder da Nemotron 3 Nano Omni. InternLumina U2: un MoE sparso da 16B con 1B parametri attivi, costruito come modello linguistico diffusivo multi-codebook anziché come uno autoregressivo convenzionale.

• Contesto — Sports Tennis pubblica fino a 256k token. La scheda di InternLumina U2 non pubblicizza un valore di contesto.

• Licenza — Sports Tennis è distribuito con licenza OpenMDW-1.1, con la scheda che ne indica l'uso commerciale e non commerciale. InternLumina U2 è Apache 2.0.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

La cosa che li rende davvero incomparabili

Non esiste un tabellone condiviso, e vale la pena essere precisi sul perché invece di lasciare la cosa a un vago alzare di spalle.

Sports Tennis messo a punto su un dataset di tennis proprietario NVIDIA — 1.312.129 esempi di domande e risposte distribuiti su 43.084 clip a livello di punto provenienti da 239 partite, etichettati secondo 38 categorie di annotazione, tutti raccolti nel 2025. Il suo set di test è una partizione tenuta da parte di 12 partite, 2.689 clip e 80.872 domande. Ognuno di questi artefatti è di NVIDIA. Nessun gruppo esterno dispone dei dati, quindi nessun gruppo esterno può riprodurre un punteggio — e, guarda caso, NVIDIA non ha pubblicato alcun punteggio da riprodurre. La scheda documenta in dettaglio il protocollo di valutazione e poi non ne riporta alcun risultato. Nulla sull'accuratezza, nulla per categoria, nulla.

InternLumina U2 si trova sul lato opposto di quello stesso muro. Pubblica numeri, ma sono esplicitamente parziali. La model card lo dice in una riga: "Risultati preliminari e parziali. Le tabelle comparative complete appariranno nel prossimo rapporto tecnico." Ciò che esiste è una serie di cifre dichiarate dai vendor su capacità molto diverse — ChartQA 86.52 e CharXiv-DQ 83.65 sui documenti, MathVision 33.22 e DynaMath 56.37 sulla matematica visiva, VideoMME 51.26 e MVBench 59.74 sul video, 3D MM-Vet 41.8, DPG-Bench 87.10 e GenEval 0.81 sulla generazione, ImgEdit 3.83 sull'editing. E la tabella della pagina del progetto stessa mostra che il modello è dietro ad almeno un concorrente citato su almeno una metrica di punta: GenEval 0.81 contro lo 0.89 di LLaDA2.0-Uni.

Quindi un modello ha una valutazione documentata e nessun risultato, e l'altro ha risultati e una valutazione esplicitamente incompleta. Nessuno dei due ti fornisce un numero che puoi mettere accanto a quello dell'altro. Qualunque pagina che metta in classifica questi due ha inventato la sua classifica.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Dove si sovrappongono davvero, e cosa mostra

La comprensione video è l'unico territorio che entrambi rivendicano, e anche lì la sovrapposizione è più sottile di quanto sembri. InternLumina U2 riporta VideoMME 51,26 e MLVU 57,03 e MVBench 59,74 — punteggi di comprensione video generale, dichiarati dal fornitore. Sports Tennis non riporta nulla, ma la sua scheda descrive un compito molto più ristretto e molto più profondo: ragionamento a livello di punto su uno scambio completo con audio, attraverso 38 categorie di annotazione granulari che includono meccanica dei colpi, posizionamento in campo, movimento e stato del punteggio.

L'inferenza ragionevole è che InternLumina U2 sarebbe il generalista migliore e Sports Tennis il miglior lettore di tennis, ma questa è un'inferenza basata sulla forma del compito, non sui dati. Potrebbe facilmente essere sbagliata in entrambe le direzioni. Ciò che non è un'inferenza è che un benchmark video generale e un benchmark di tennis proprietario a livello di punto non possono essere collocati sullo stesso asse, e che un generatore unificato da 16B e uno specialista da 31B con encoder congelato non sono stati costruiti per rispondere alla stessa domanda.

Gestire l'uno o l'altro è un progetto di tipo diverso

Il deployment è il punto in cui il divario smette di essere filosofico.

Sports Tennis dichiara una soglia minima inderogabile di una GPU con circa 80 GB di memoria in BF16, con pesi intorno ai 62 GB, testata su A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor e RTX 5090. Non esiste un checkpoint quantizzato, quindi oggi il requisito di 80 GB non è negoziabile al ribasso. È inoltre disponibile solo in inglese.

Il problema più interessante di InternLumina U2 non è la memoria, è il silicio. Il repository ospita checkpoint suddivisi per hardware di addestramento: una ascend/ directory completa con sette shard safetensors addestrati su NPU Huawei Ascend, e una nvidia/ directory contrassegnata come "in arrivo". Se usate hardware NVIDIA — che, per un modello il cui fratello è un fine-tune sul tennis di Nemotron, rappresenta la maggior parte delle persone che leggono questo — il checkpoint che vi serve è quello che non è ancora arrivato. Il codice di inferenza e le istruzioni di configurazione si trovano nel repository GitHub di InternLM anziché sull'Hub, e il rapporto tecnico è ancora in sospeso.

Ciò inverte l'aspettativa abituale. Il modello proprietario, non sottoposto a benchmark e dalle sembianze di un'appliance è quello che puoi scaricare ed eseguire subito, fin dal primo giorno. Il modello di ricerca aperto con licenza Apache-2.0 è quello che aspetta una build specifica per l'hardware.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

Dove un router è adatto — e dove non lo è

Nessuno di questi modelli è ospitato su OrcaRouter, e non c'è modo onesto di aggirarlo scrivendo. Sports Tennis non ha endpoint da nessuna parte; NVIDIA ha pubblicato i pesi e nient'altro. Il repository stesso di InternLumina U2 segnala che i checkpoint NVIDIA sono ancora in sospeso, quindi non c'è nulla da servire nemmeno dalla nostra parte. In entrambi i casi si tratta di una decisione di self-hosting, non di routing.

La questione del routing emerge uno strato più in alto. Un team che vuole valutare uno specialista come Sports Tennis rispetto a un generalista come InternLumina U2 non lo fa in isolamento — lo fa come un candidato in una pipeline che necessita anche di trascrizione vocale, gestione dei documenti, riepilogo e della logica applicativa che li circonda. Questi componenti sono ospitati, e sono le parti in cui una singola chiave API che copre oltre 200 modelli con failover automatico tra provider fa risparmiare una settimana di lavoro di integrazione. Una chiave per i modelli che puoi chiamare, così quelli che devi eseguire tu stesso sono l'unica cosa che stai effettivamente mantenendo.

La questione aperta

Messi a confronto, NVIDIA NemotronLabs AI for Media - Sports Tennis e InternLumina U2 sono una discreta illustrazione di due modi di rilasciare male in pubblico un modello multimodale. Uno ha documentato la propria valutazione e ha tenuto nascosti i risultati; l'altro ha pubblicato i risultati e ha etichettato la propria valutazione come incompleta. Entrambi sono, a settembre 2026, affermazioni non falsificabili.

La cosa interessante da osservare non è quale dei due si rivelerà più forte — non verranno mai testati sulla stessa cosa. È quale laboratorio colma per primo il proprio divario. Se NVIDIA pubblica i numeri sul tennis, avrà risolto il problema più difficile, perché un benchmark proprietario con hold-out di 12 partite mai viste è l'unico modo onesto per valutare un fine-tuning di dominio, e NVIDIA ha già costruito lo split. Se InternLM rilascia i checkpoint NVIDIA e il rapporto tecnico, avrà reso il suo modello Apache-2.0 davvero utilizzabile sull'hardware che i suoi utenti possiedono. Qualunque cosa accada, questo confronto varrà la pena di essere riletto — perché al momento, la cosa più difendibile che la scheda di ciascuno dei due modelli supporti è un'alzata di spalle.