
Nemotron Sports Tennis vs North Micro Vision Instruct : un lecteur de tennis 31B contre un spécialiste des documents 2,4B
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Réponse courte d'abord : NVIDIA NemotronLabs AI for Media - Sports Tennis et North Micro Vision Instruct ne sont pas des substituts, et personne qui choisit entre eux ne choisit réellement entre eux. L'un est un modèle multimodal de 31 B que NVIDIA a affiné pour répondre à des questions sur les points de tennis, nécessite environ 80 Go de mémoire GPU et ne lit que l'anglais. L'autre est un modèle vision-langage de 2,4 B de Cohere qui tient sur une seule carte de station de travail, gère onze langues et a été conçu avant tout pour lire des documents — pages, graphiques, tableaux, OCR.
Ils relèvent de la même grande catégorie et presque d’aucune autre. Ce qui suit est la version honnête de la comparaison : où les deux divergent véritablement, ce que chaque fournisseur a publié et n’a pas publié, et la seule situation où le choix est réel.
Ce que chaque modèle a été conçu pour faire
North Micro Vision Instruct associe un modèle de langage de 2 B — North Micro LLM de Cohere, suivant l'architecture Command A+ — à un encodeur visuel de 400 M de paramètres, entraîné sur mesure à partir de SigLIP 2 SO400M, pour un total de 2,4 B. Sa voie visuelle est en résolution native, préservant les ratios d'aspect plutôt que de redimensionner vers une grille fixe, et un projecteur DeepStack injecte les embeddings de patchs issus de plusieurs couches de l'encodeur dans les couches linguistiques précoces correspondantes plutôt que de préfixer une représentation unique. La présentation officielle de Cohere le décrit comme une base compacte pour le prototypage et l'affinage propre à des tâches, avec la compréhension de documents comme capacité phare. La fiche modèle est inhabituellement franche sur ses limites : North Micro Vision Instruct n'est explicitement pas un modèle de raisonnement, n'offre pas d'appel d'outils et n'a pas été entraîné avec des invites système.
Sports Tennis est de forme opposée dans toutes les dimensions. NVIDIA est parti de son propre checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning — un mélange d’experts hybride Mamba2-Transformer, 31B au total avec environ 3B actifs par token — et l’a affiné sur un corpus de tennis propriétaire, annoté manuellement. L’encodeur visuel (C-RADIOv4-H) et l’encodeur vocal (Parakeet) ont tous deux été gelés ; seuls les paramètres du modèle de langage ont été modifiés. Le résultat est un modèle étroit par conception : il répond à des questions structurées à choix multiples et ouvertes sur un clip complet d’un point de tennis, couvrant la mécanique des coups, le positionnement sur le court, les déplacements des joueurs, les faits de match, la connaissance des règles et les indices audio. NVIDIA le décrit comme fonctionnant au mieux lorsqu’un point entier — du service à la fin de l’échange — est fourni en entrée.
Les dimensions qui les distinguent réellement
• Paramètres — North Micro Vision Instruct : 2,4B (2B de langage, 400M de vision). Sports Tennis : 31B au total, ~3B actifs par token.
• Entrées — North Micro Vision Instruct : texte et images entrelacés, résolution native, multi-images. Sports Tennis : vidéo jusqu'à 2 minutes, audio jusqu'à une heure, images, texte.
• Sortie — les deux renvoient du texte. North Micro Vision Instruct renvoie en plus des boîtes englobantes de grounding sur une échelle normalisée de 0 à 1000.
• Langues — North Micro Vision Instruct : onze et plus, dont l'anglais, l'allemand, le français, l'espagnol, l'italien, le portugais, le hindi, le japonais, le coréen, le chinois et l'arabe. Sports Tennis : anglais uniquement.
• Contexte — North Micro Vision Instruct : un backbone linguistique de 128K tokens, mais Cohere signale que la plage multimodale validée va jusqu'à 8K tokens, les contextes multimodaux plus longs reposant sur l'extrapolation et non évalués. Sports Tennis : jusqu'à 256k tokens.
• Empreinte — North Micro Vision Instruct : environ 4,97 Go en BF16, environ 2,17 Go en 4 bits. Sports Tennis : environ 62 Go en BF16, un seul GPU de 80 Go requis.
• Licence — North Micro Vision Instruct : Apache 2.0. Sports Tennis : OpenMDW-1.1, la fiche précisant une utilisation commerciale et non commerciale.

Benchmarks : un modèle en a, l'autre a un protocole
C'est ici que les deux cartes ne pourraient pas être plus différentes en posture.
Cohere publie des chiffres pour North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — et MMMU 0,329. Tous déclarés par le fournisseur, aucun reproduit indépendamment, et Cohere lui-même signale que les résultats OCR varient fortement selon le découpage. Ce dernier chiffre mérite que l’on s’y arrête : un score MMMU de 0,329 est faible, et cela concorde avec tout le reste de ce que la fiche indique sur la conception du modèle. Il s’agit d’un spécialiste de la lecture, pas d’un modèle de raisonnement général, et l’entreprise qui l’a conçu le dit. Ce type de divulgation est plus utile qu’un chiffre flatteur.
NVIDIA ne publie rien. La fiche Sports Tennis décrit soigneusement son évaluation — une partition de test de 12 matchs entièrement tenus à l'écart, 2 689 clips au niveau des points et 80 872 questions issues de matchs sans chevauchement d'entraînement, évaluées par une précision automatisée à choix multiples et un LLM-as-judge pass@9 sur des réponses ouvertes, avec la division des matchs vus explicitement exclue des tests rapportés — puis ne rapporte aucun résultat de tout cela. Le côté entraînement est tout aussi détaillé : 1 312 129 exemples de questions-réponses, 1 226 081 à choix multiples et 86 048 ouvertes, tirés de 43 084 clips au niveau des points à travers 239 matchs, étiquetés selon 38 catégories d'annotation.
Même si NVIDIA avait publié des scores, ils ne seraient pas comparables. Il n'existe aucun benchmark sur lequel apparaissent à la fois un modèle de compréhension de documents et un modèle de points de tennis. Le chevauchement entre ces deux récits d'évaluation est nul.

Déploiement : où réside la différence pratique
Le modèle 2.4B est, de loin, le plus facile à exploiter. Environ 5 Go de poids BF16 signifient qu’un seul GPU de station de travail moderne suffit à le faire tourner, et la version 4 bits, à environ 2,17 Go, est encore plus compacte. Des ports indépendants existent pour le runtime Core AI d’Apple, avec un débit annoncé d’environ 18,2 jetons/s en int8 sur un iPhone 17 Pro, tandis que la quantification int4 échoue complètement. La friction se situe dans le logiciel : North Micro Vision Instruct nécessite Transformers 5.16.0 — installable depuis les sources jusqu’à sa publication sur PyPI — et la prise en charge publique de vLLM était encore décrite comme bientôt disponible sur la fiche. Le fine-tuning est pris en charge via Axolotl. Il n’existe pas d’API hébergée par l’éditeur ; la voie pratique est l’auto-hébergement.
Sports Tennis est la chose la plus difficile à exploiter, et il n’y a pas moyen d’y échapper. Un GPU de 80 Go en BF16, aucun checkpoint quantifié publié, anglais uniquement, Linux uniquement, sur PyTorch/Transformers, NeMo ou Megatron. NVIDIA a testé sur A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor et RTX 5090 — une liste de matériels qui en dit plus sur ce que NVIDIA voulait valider que sur ce qu’une équipe normale peut provisionner. La politique d’inférence par défaut de la carte est elle aussi réduite à l’essentiel : 2 images par seconde jusqu’à 128 images, 256 nouveaux tokens, décodage glouton.
Aucun des deux modèles n'est servi sur OrcaRouter. North Micro Vision Instruct n'a pas d'endpoint propriétaire et ne figure pas dans notre catalogue ; Sports Tennis n'a d'endpoint nulle part, puisque NVIDIA a publié les poids et aucun service hébergé. Dans les deux cas, il s'agit d'un choix d'auto-hébergement.
Là où une couche de routage est vraiment utile, c'est pour le pipeline qui les entoure — quelle que soit celle de ces solutions que vous exécutez en local, les modèles de transcription, de résumé, de recherche et d'application qui l'entourent sont hébergés, et les placer derrière une seule clé API avec basculement automatique évite de mettre en place un jeu d'identifiants et un contrat distincts pour chacun. Nous répercutons le prix catalogue du fournisseur à 0 % de marge sur les modèles que nous proposons, de sorte que les parties de la pile que vous n'hébergez pas vous-même restent au prix du vendeur.

Quand le choix est réel
Il existe un scénario où choisir entre ces deux options constitue une véritable décision, et il vaut la peine d’être concret à ce sujet parce que ce n’est pas évident.
Il s'agit du cas d'une organisation média ou sportive qui traite déjà des documents et souhaite ajouter une compréhension vidéo au niveau du point. Un diffuseur doté d'un pipeline d'archives, une ligue avec des comptes rendus de match et des PDF statistiques, un détenteur de droits disposant à la fois de texte et de séquences vidéo — pour eux, North Micro Vision Instruct est vraisemblablement déjà dans leur stack pour l'OCR et l'extraction de graphiques, et Sports Tennis est la nouvelle capacité qu'ils ajouteraient. La question n'est pas « laquelle choisir », mais « combien me coûte la seconde en infrastructure », et la réponse est un GPU de datacenter et une contrainte d'anglais uniquement.
En dehors de ce cas, les modèles ne sont tout simplement pas en concurrence. Si vous avez besoin de faire lire des documents en onze langues sur une carte de station de travail, North Micro Vision Instruct est la réponse et Sports Tennis ne vous est d'aucune utilité. Si vous avez besoin de poser des questions structurées sur des points de tennis avec un contexte audio, Sports Tennis est le seul des deux à le faire, et le fait qu'il n'ait pas de benchmarks publiés est un risque que vous accepteriez plutôt qu'une raison de choisir l'autre modèle.
Lequel choisir
Choisissez North Micro Vision Instruct si votre travail implique des documents, des graphiques, de l’OCR, du grounding ou de la compréhension d’images multilingue, et si vous accordez de l’importance à un fournisseur qui publie ses chiffres faibles aux côtés de ses chiffres forts. Il est petit, sous Apache 2.0, bien documenté et honnête sur le fait de ne pas être un modèle de raisonnement. Son MMMU de 0,329 n’est pas un défaut que vous découvrez plus tard ; Cohere vous le dit d’emblée.
Choisissez NVIDIA NemotronLabs AI for Media - Sports Tennis uniquement si vous avez spécifiquement besoin d’un raisonnement tennis au niveau du point avec audio, si vous disposez d’un GPU de 80 Go à consacrer et si vous êtes à l’aise avec le fait d’être la première personne à l’évaluer. Personne n’a publié de score pour ce modèle, donc le téléchargement constitue l’expérience. Ce n’est pas une raison pour l’éviter — un spécialiste étroit avec un ensemble d’entraînement de 43 084 clips méticuleusement annoté est exactement le genre de modèle qui peut battre un généraliste sur sa propre tâche — mais c’est une raison de considérer le premier déploiement comme un essai plutôt qu’un engagement.
La seule chose à ne pas faire est de les traiter comme interchangeables, sous prétexte que tous deux portent la mention « modèle vision-langage » sur la fiche. Un lecteur de documents et un analyste de tennis n’ont jamais été le même produit, et dans ce duo, la différence dans ce qu’ils font est bien plus grande que la différence dans leur niveau de performance.
