
Nemotron Sports Tennis vs InternLumina U2 : la comparaison qu’aucun des deux modèles ne peut perdre
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Demandez lequel est le meilleur — NVIDIA NemotronLabs AI for Media - Sports Tennis ou InternLumina U2 — et la réponse honnête est que la question ne se résout pas. Les deux dépôts sont tous deux apparus sur Hugging Face en septembre 2026, ce sont tous deux des modèles multimodaux à mélange d'experts construits par des laboratoires bien financés, et ils n'ont presque rien d'autre en commun. Le modèle de NVIDIA est un spécialiste de 31B qui lit un seul point de tennis et répond aux questions à son sujet. InternLumina U2, de l'équipe InternLM du Shanghai AI Laboratory et publié sous internlm/InternLumina-U2, est un modèle unifié de 16B qui comprend les images, la vidéo et la 3D et qui, en outre, génère et modifie des images. Ils ne partagent aucun benchmark, aucun utilisateur cible et aucun profil de déploiement. Les comparer ressemble moins à choisir un téléphone qu'à choisir entre un stéthoscope et une imprimante 3D.
Ce qui rend de toute façon ce duo digne d’être évoqué, c’est un schéma que partagent les deux modèles : aucun des deux n’a fait l’objet d’une évaluation indépendante, et tous deux sont décrits par leur propre fournisseur comme autre chose que terminés. Voilà la vraie comparaison — non pas de savoir quel modèle l’emporte, mais quelle part de l’un ou de l’autre on peut réellement vérifier aujourd’hui.
Deux métiers différents sous le même mot
« Multimodal » englobe ces deux cas et ne vous dit rien. Voici la distinction :
• Ce qu'il prend en entrée — Sports Tennis : vidéo (mp4 jusqu'à 2 minutes), audio (wav/mp3), images, texte. InternLumina U2 : texte, images, vidéo et 3D. Le modèle de tennis est le seul des deux avec un matériel chemin audio, câblé via un encodeur vocal Parakeet qui lit les sons de la foule et d'impact avec les images.
• Ce qu'il restitue — Sports Tennis : texte uniquement. InternLumina U2 : texte et des images générées ou modifiées, via une représentation visuelle entièrement discrète à 8 codebooks construite sur AToken.
• Ce que l'utilisateur demande — Tennis : « que s'est-il passé dans ce point, où se tenait le joueur, la balle est-elle retombée dans le court ». InternLumina U2 : « décris ce graphique, puis dessine-m'en une nouvelle version ».
• Architecture — Sports Tennis : MoE hybride Mamba2-Transformer, 31 B au total avec environ 3 B actifs par token, héritant de son backbone et de ses encodeurs de Nemotron 3 Nano Omni. InternLumina U2 : un MoE clairsemé de 16 B avec 1 B de paramètres actifs, conçu comme un modèle de langage de diffusion multi-codebook plutôt qu'un modèle autorégressif conventionnel.
• Contexte — Sports Tennis publie jusqu'à 256k tokens. La fiche de l'InternLumina U2 n'annonce aucun chiffre de contexte.
• Licence — Sports Tennis est distribué sous OpenMDW-1.1, la fiche indiquant une utilisation commerciale et non commerciale. InternLumina U2 est sous Apache 2.0.

Ce qui les rend réellement incomparables
Il n’existe pas de tableau des scores partagé, et il vaut mieux être précis sur la raison plutôt que de laisser cela comme un vague haussement d’épaules.
Sports Tennis affiné sur un jeu de données de tennis propriétaire NVIDIA — 1 312 129 exemples de questions-réponses répartis sur 43 084 clips au niveau du point issus de 239 matchs, annotés selon 38 catégories d'annotation, tous collectés en 2025. Son ensemble de test est une partition mise de côté de 12 matchs, 2 689 clips et 80 872 questions. Chacun de ces artefacts est la propriété de NVIDIA. Aucun groupe extérieur ne dispose des données, donc aucun groupe extérieur ne peut reproduire un score — et il se trouve que NVIDIA n'a publié aucun score à reproduire. La fiche documente en détail le protocole d'évaluation, puis ne rapporte aucun résultat issu de celui-ci. Rien sur la précision, rien par catégorie, rien.
InternLumina U2 se trouve de l’autre côté de ce même mur. Il publie des chiffres, mais ils sont explicitement partiels. La fiche de modèle le dit en une ligne : « Résultats préliminaires et partiels. Les tableaux de comparaison complets figureront dans le prochain rapport technique. » Ce qui existe, c’est un éventail de chiffres rapportés par les fournisseurs sur des capacités très différentes — ChartQA 86,52 et CharXiv-DQ 83,65 sur les documents, MathVision 33,22 et DynaMath 56,37 en mathématiques visuelles, VideoMME 51,26 et MVBench 59,74 sur la vidéo, 3D MM-Vet 41,8, DPG-Bench 87,10 et GenEval 0,81 en génération, ImgEdit 3,83 en édition. Et le tableau de la page du projet montre que le modèle est devancé par au moins un concurrent nommé sur au moins un indicateur phare : GenEval 0,81 contre 0,89 pour LLaDA2.0-Uni.
Donc un modèle a une évaluation documentée et aucun résultat, et l’autre a des résultats et une évaluation explicitement incomplète. Ni l’un ni l’autre ne vous donne un chiffre que vous pouvez mettre côte à côte avec l’autre. Toute page qui classe ces deux modèles a inventé son classement.

Là où ils se recoupent réellement, et ce que cela montre
La compréhension vidéo est le seul territoire que les deux revendiquent, et même là, le chevauchement est plus mince qu'il n'y paraît. InternLumina U2 rapporte VideoMME 51,26 et MLVU 57,03 et MVBench 59,74 — des scores de compréhension vidéo générale, rapportés par le fournisseur. Sports Tennis ne rapporte rien, mais sa fiche décrit une tâche bien plus étroite et bien plus profonde : un raisonnement au niveau du point sur un échange complet avec audio, à travers 38 catégories d'annotation fines incluant la mécanique des coups, le positionnement sur le court, le mouvement et l'état du score.
L’inférence raisonnable est qu’InternLumina U2 serait le meilleur généraliste et Sports Tennis le meilleur lecteur de tennis, mais il s’agit d’une inférence fondée sur la forme de la tâche, non sur les données. Elle pourrait facilement être erronée dans un sens comme dans l’autre. Ce qui n’est pas une inférence, c’est qu’un benchmark vidéo généraliste et un benchmark de tennis propriétaire au niveau du point ne peuvent pas être placés sur le même axe, et qu’un générateur unifié de 16B et un spécialiste à encodeur gelé de 31B n’ont pas été conçus pour répondre à la même question.
Exécuter l’un ou l’autre est un type de projet différent.
Le déploiement est le moment où l'écart cesse d'être philosophique.
Sports Tennis indique un minimum absolu d'un GPU avec environ 80 Go de mémoire en BF16, pour des poids d'environ 62 Go, testé sur A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor et RTX 5090. Il n'existe aucun point de contrôle quantifié, l'exigence de 80 Go ne peut donc pas être revue à la baisse aujourd'hui. Il est également uniquement disponible en anglais.
Le problème plus intéressant d'InternLumina U2 n'est pas la mémoire, c'est le silicium. Le dépôt héberge des checkpoints répartis par matériel d'entraînement : un complet ascend/ répertoire avec sept shards safetensors entraînés sur des NPU Huawei Ascend, et un nvidia/ répertoire marqué « bientôt disponible ». Si vous utilisez du matériel NVIDIA — ce qui, pour un modèle dont le frère est un fine-tune de tennis de Nemotron, représente la plupart des lecteurs — le checkpoint que vous voulez est celui qui n'est pas encore arrivé. Le code d'inférence et les instructions d'installation se trouvent dans le dépôt GitHub d'InternLM plutôt que sur le Hub, et le rapport technique est toujours en attente.
Cela inverse l’attente habituelle. Le modèle propriétaire, non benchmarké et de type appliance est celui que vous pouvez télécharger et exécuter dès maintenant, dès le premier jour. Le modèle de recherche ouvert Apache-2.0 est celui qui attend une build spécifique au matériel.

Là où un routeur convient — et là où il ne convient pas
Aucun de ces modèles n’est hébergé sur OrcaRouter, et il n’existe pas de manière honnête de contourner ce fait. Sports Tennis n’a de point de terminaison nulle part ; NVIDIA a publié des poids et rien d’autre. Le dépôt d’InternLumina U2 lui-même indique que les checkpoints NVIDIA sont encore en attente, donc il n’y a rien à servir de notre côté non plus. Il s’agit d’une décision d’auto-hébergement dans les deux cas, et non d’une décision de routage.
La question du routage apparaît un niveau au-dessus. Une équipe qui souhaite évaluer un spécialiste comme Sports Tennis face à un généraliste comme InternLumina U2 ne le fait pas isolément — elle le fait en tant que candidat parmi d'autres dans un pipeline qui doit aussi gérer la transcription vocale, le traitement de documents, le résumé et la logique applicative qui les entoure. Ces composants sont hébergés, et ce sont les éléments où une seule clé API couvrant plus de 200 modèles avec bascule automatique entre fournisseurs épargne une semaine de travail d'intégration. Une seule clé pour les modèles que vous pouvez appeler, de sorte que ceux que vous devez exécuter vous-même sont la seule chose que vous maintenez réellement.
La question ouverte
Placés côte à côte, NVIDIA NemotronLabs AI for Media - Sports Tennis et InternLumina U2 sont une bonne illustration de deux façons de mal livrer un modèle multimodal en public. L'un a documenté son évaluation et n'a pas divulgué les résultats ; l'autre a publié des résultats et qualifié son évaluation d'incomplète. Toutes deux sont, en date de septembre 2026, des affirmations infalsifiables.
Ce qui est intéressant à observer, ce n’est pas lequel s’avère le plus fort — ils ne seront jamais testés sur la même chose. C’est lequel des deux laboratoires comble son écart en premier. Si NVIDIA publie des chiffres de tennis, elle aura résolu le problème le plus difficile, car un benchmark propriétaire tenu à l’écart, portant sur 12 matchs inédits, est le seul moyen honnête d’évaluer un fine-tuning de domaine, et NVIDIA a déjà construit le découpage. Si InternLM livre les checkpoints NVIDIA et le rapport technique, il aura rendu son modèle Apache-2.0 réellement utilisable sur le matériel que possèdent ses utilisateurs. Quoi qu’il arrive, cette comparaison vaudra la peine d’être relue — car, pour l’instant, la chose la plus défendable que la fiche de l’un ou l’autre modèle puisse soutenir est un haussement d’épaules.
