Une carte hero générée à deux panneaux comparant NVIDIA NemotronLabs AI for Media - Sports Tennis et North Micro Vision Instruct, la moitié gauche étant étiquetée « lecteur de tennis 31B » avec une puce « anglais uniquement » à côté d'une icône de clip de point de tennis, et la moitié droite étiquetée « spécialiste des documents 2,4B » avec une puce « 11+ langues » à côté d'une icône de document et de diagramme à barres, le logo OrcaRouter se trouvant dans le coin inférieur droit.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct : un lecteur de tennis 31B contre un spécialiste des documents 2,4B

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Réponse courte d'abord : NVIDIA NemotronLabs AI for Media - Sports Tennis et North Micro Vision Instruct ne sont pas des substituts, et personne qui choisit entre eux ne choisit réellement entre eux. L'un est un modèle multimodal de 31 B que NVIDIA a affiné pour répondre à des questions sur les points de tennis, nécessite environ 80 Go de mémoire GPU et ne lit que l'anglais. L'autre est un modèle vision-langage de 2,4 B de Cohere qui tient sur une seule carte de station de travail, gère onze langues et a été conçu avant tout pour lire des documents — pages, graphiques, tableaux, OCR.

Ils relèvent de la même grande catégorie et presque d’aucune autre. Ce qui suit est la version honnête de la comparaison : où les deux divergent véritablement, ce que chaque fournisseur a publié et n’a pas publié, et la seule situation où le choix est réel.

Ce que chaque modèle a été conçu pour faire

North Micro Vision Instruct associe un modèle de langage de 2 B — North Micro LLM de Cohere, suivant l'architecture Command A+ — à un encodeur visuel de 400 M de paramètres, entraîné sur mesure à partir de SigLIP 2 SO400M, pour un total de 2,4 B. Sa voie visuelle est en résolution native, préservant les ratios d'aspect plutôt que de redimensionner vers une grille fixe, et un projecteur DeepStack injecte les embeddings de patchs issus de plusieurs couches de l'encodeur dans les couches linguistiques précoces correspondantes plutôt que de préfixer une représentation unique. La présentation officielle de Cohere le décrit comme une base compacte pour le prototypage et l'affinage propre à des tâches, avec la compréhension de documents comme capacité phare. La fiche modèle est inhabituellement franche sur ses limites : North Micro Vision Instruct n'est explicitement pas un modèle de raisonnement, n'offre pas d'appel d'outils et n'a pas été entraîné avec des invites système.

Sports Tennis est de forme opposée dans toutes les dimensions. NVIDIA est parti de son propre checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning — un mélange d’experts hybride Mamba2-Transformer, 31B au total avec environ 3B actifs par token — et l’a affiné sur un corpus de tennis propriétaire, annoté manuellement. L’encodeur visuel (C-RADIOv4-H) et l’encodeur vocal (Parakeet) ont tous deux été gelés ; seuls les paramètres du modèle de langage ont été modifiés. Le résultat est un modèle étroit par conception : il répond à des questions structurées à choix multiples et ouvertes sur un clip complet d’un point de tennis, couvrant la mécanique des coups, le positionnement sur le court, les déplacements des joueurs, les faits de match, la connaissance des règles et les indices audio. NVIDIA le décrit comme fonctionnant au mieux lorsqu’un point entier — du service à la fin de l’échange — est fourni en entrée.

Les dimensions qui les distinguent réellement

• Paramètres — North Micro Vision Instruct : 2,4B (2B de langage, 400M de vision). Sports Tennis : 31B au total, ~3B actifs par token.

• Entrées — North Micro Vision Instruct : texte et images entrelacés, résolution native, multi-images. Sports Tennis : vidéo jusqu'à 2 minutes, audio jusqu'à une heure, images, texte.

• Sortie — les deux renvoient du texte. North Micro Vision Instruct renvoie en plus des boîtes englobantes de grounding sur une échelle normalisée de 0 à 1000.

• Langues — North Micro Vision Instruct : onze et plus, dont l'anglais, l'allemand, le français, l'espagnol, l'italien, le portugais, le hindi, le japonais, le coréen, le chinois et l'arabe. Sports Tennis : anglais uniquement.

• Contexte — North Micro Vision Instruct : un backbone linguistique de 128K tokens, mais Cohere signale que la plage multimodale validée va jusqu'à 8K tokens, les contextes multimodaux plus longs reposant sur l'extrapolation et non évalués. Sports Tennis : jusqu'à 256k tokens.

• Empreinte — North Micro Vision Instruct : environ 4,97 Go en BF16, environ 2,17 Go en 4 bits. Sports Tennis : environ 62 Go en BF16, un seul GPU de 80 Go requis.

• Licence — North Micro Vision Instruct : Apache 2.0. Sports Tennis : OpenMDW-1.1, la fiche précisant une utilisation commerciale et non commerciale.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmarks : un modèle en a, l'autre a un protocole

C'est ici que les deux cartes ne pourraient pas être plus différentes en posture.

Cohere publie des chiffres pour North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — et MMMU 0,329. Tous déclarés par le fournisseur, aucun reproduit indépendamment, et Cohere lui-même signale que les résultats OCR varient fortement selon le découpage. Ce dernier chiffre mérite que l’on s’y arrête : un score MMMU de 0,329 est faible, et cela concorde avec tout le reste de ce que la fiche indique sur la conception du modèle. Il s’agit d’un spécialiste de la lecture, pas d’un modèle de raisonnement général, et l’entreprise qui l’a conçu le dit. Ce type de divulgation est plus utile qu’un chiffre flatteur.

NVIDIA ne publie rien. La fiche Sports Tennis décrit soigneusement son évaluation — une partition de test de 12 matchs entièrement tenus à l'écart, 2 689 clips au niveau des points et 80 872 questions issues de matchs sans chevauchement d'entraînement, évaluées par une précision automatisée à choix multiples et un LLM-as-judge pass@9 sur des réponses ouvertes, avec la division des matchs vus explicitement exclue des tests rapportés — puis ne rapporte aucun résultat de tout cela. Le côté entraînement est tout aussi détaillé : 1 312 129 exemples de questions-réponses, 1 226 081 à choix multiples et 86 048 ouvertes, tirés de 43 084 clips au niveau des points à travers 239 matchs, étiquetés selon 38 catégories d'annotation.

Même si NVIDIA avait publié des scores, ils ne seraient pas comparables. Il n'existe aucun benchmark sur lequel apparaissent à la fois un modèle de compréhension de documents et un modèle de points de tennis. Le chevauchement entre ces deux récits d'évaluation est nul.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Déploiement : où réside la différence pratique

Le modèle 2.4B est, de loin, le plus facile à exploiter. Environ 5 Go de poids BF16 signifient qu’un seul GPU de station de travail moderne suffit à le faire tourner, et la version 4 bits, à environ 2,17 Go, est encore plus compacte. Des ports indépendants existent pour le runtime Core AI d’Apple, avec un débit annoncé d’environ 18,2 jetons/s en int8 sur un iPhone 17 Pro, tandis que la quantification int4 échoue complètement. La friction se situe dans le logiciel : North Micro Vision Instruct nécessite Transformers 5.16.0 — installable depuis les sources jusqu’à sa publication sur PyPI — et la prise en charge publique de vLLM était encore décrite comme bientôt disponible sur la fiche. Le fine-tuning est pris en charge via Axolotl. Il n’existe pas d’API hébergée par l’éditeur ; la voie pratique est l’auto-hébergement.

Sports Tennis est la chose la plus difficile à exploiter, et il n’y a pas moyen d’y échapper. Un GPU de 80 Go en BF16, aucun checkpoint quantifié publié, anglais uniquement, Linux uniquement, sur PyTorch/Transformers, NeMo ou Megatron. NVIDIA a testé sur A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor et RTX 5090 — une liste de matériels qui en dit plus sur ce que NVIDIA voulait valider que sur ce qu’une équipe normale peut provisionner. La politique d’inférence par défaut de la carte est elle aussi réduite à l’essentiel : 2 images par seconde jusqu’à 128 images, 256 nouveaux tokens, décodage glouton.

Aucun des deux modèles n'est servi sur OrcaRouter. North Micro Vision Instruct n'a pas d'endpoint propriétaire et ne figure pas dans notre catalogue ; Sports Tennis n'a d'endpoint nulle part, puisque NVIDIA a publié les poids et aucun service hébergé. Dans les deux cas, il s'agit d'un choix d'auto-hébergement.

Là où une couche de routage est vraiment utile, c'est pour le pipeline qui les entoure — quelle que soit celle de ces solutions que vous exécutez en local, les modèles de transcription, de résumé, de recherche et d'application qui l'entourent sont hébergés, et les placer derrière une seule clé API avec basculement automatique évite de mettre en place un jeu d'identifiants et un contrat distincts pour chacun. Nous répercutons le prix catalogue du fournisseur à 0 % de marge sur les modèles que nous proposons, de sorte que les parties de la pile que vous n'hébergez pas vous-même restent au prix du vendeur.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Quand le choix est réel

Il existe un scénario où choisir entre ces deux options constitue une véritable décision, et il vaut la peine d’être concret à ce sujet parce que ce n’est pas évident.

Il s'agit du cas d'une organisation média ou sportive qui traite déjà des documents et souhaite ajouter une compréhension vidéo au niveau du point. Un diffuseur doté d'un pipeline d'archives, une ligue avec des comptes rendus de match et des PDF statistiques, un détenteur de droits disposant à la fois de texte et de séquences vidéo — pour eux, North Micro Vision Instruct est vraisemblablement déjà dans leur stack pour l'OCR et l'extraction de graphiques, et Sports Tennis est la nouvelle capacité qu'ils ajouteraient. La question n'est pas « laquelle choisir », mais « combien me coûte la seconde en infrastructure », et la réponse est un GPU de datacenter et une contrainte d'anglais uniquement.

En dehors de ce cas, les modèles ne sont tout simplement pas en concurrence. Si vous avez besoin de faire lire des documents en onze langues sur une carte de station de travail, North Micro Vision Instruct est la réponse et Sports Tennis ne vous est d'aucune utilité. Si vous avez besoin de poser des questions structurées sur des points de tennis avec un contexte audio, Sports Tennis est le seul des deux à le faire, et le fait qu'il n'ait pas de benchmarks publiés est un risque que vous accepteriez plutôt qu'une raison de choisir l'autre modèle.

Lequel choisir

Choisissez North Micro Vision Instruct si votre travail implique des documents, des graphiques, de l’OCR, du grounding ou de la compréhension d’images multilingue, et si vous accordez de l’importance à un fournisseur qui publie ses chiffres faibles aux côtés de ses chiffres forts. Il est petit, sous Apache 2.0, bien documenté et honnête sur le fait de ne pas être un modèle de raisonnement. Son MMMU de 0,329 n’est pas un défaut que vous découvrez plus tard ; Cohere vous le dit d’emblée.

Choisissez NVIDIA NemotronLabs AI for Media - Sports Tennis uniquement si vous avez spécifiquement besoin d’un raisonnement tennis au niveau du point avec audio, si vous disposez d’un GPU de 80 Go à consacrer et si vous êtes à l’aise avec le fait d’être la première personne à l’évaluer. Personne n’a publié de score pour ce modèle, donc le téléchargement constitue l’expérience. Ce n’est pas une raison pour l’éviter — un spécialiste étroit avec un ensemble d’entraînement de 43 084 clips méticuleusement annoté est exactement le genre de modèle qui peut battre un généraliste sur sa propre tâche — mais c’est une raison de considérer le premier déploiement comme un essai plutôt qu’un engagement.

La seule chose à ne pas faire est de les traiter comme interchangeables, sous prétexte que tous deux portent la mention « modèle vision-langage » sur la fiche. Un lecteur de documents et un analyste de tennis n’ont jamais été le même produit, et dans ce duo, la différence dans ce qu’ils font est bien plus grande que la différence dans leur niveau de performance.