
Nemotron Sports Tennis vs North Micro Vision Instruct: un lettore di tennis da 31B contro uno specialista di documenti da 2,4B
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Prima la risposta breve: NVIDIA NemotronLabs AI for Media - Sports Tennis e North Micro Vision Instruct non sono sostituti, e nessuno che scelga tra i due sta in realtà scegliendo tra i due. Uno è un modello multimodale da 31B che NVIDIA ha messo a punto per rispondere a domande sui punti di tennis, richiede circa 80 GB di memoria GPU e legge solo l'inglese. L'altro è un modello visione-linguaggio da 2,4B di Cohere che entra in una singola scheda da workstation, gestisce undici lingue ed è stato creato soprattutto per leggere documenti — pagine, grafici, tabelle, OCR.
Rientrano nella stessa ampia categoria e quasi in nessun'altra. Quello che segue è la versione onesta del confronto: dove i due divergono davvero, che cosa ciascun fornitore ha pubblicato e che cosa no, e l'unica situazione in cui la scelta è reale.
Cosa è stato progettato per fare ciascun modello
North Micro Vision Instruct abbina un modello linguistico da 2B — North Micro LLM di Cohere, che segue l'architettura Command A+ — a un encoder visivo da 400M di parametri, addestrato su misura a partire da SigLIP 2 SO400M, per un totale di 2,4B. Il suo percorso visivo è a risoluzione nativa, preserva i rapporti d'aspetto anziché ridimensionare a una griglia fissa, e un proiettore DeepStack inietta gli embedding di patch provenienti da più livelli dell'encoder nei corrispondenti primi livelli linguistici anziché anteporre un'unica rappresentazione. L'inquadramento dichiarato da Cohere è quello di una base compatta per la prototipazione e il fine-tuning specifico per attività, con la comprensione dei documenti come capacità di punta. La model card è insolitamente schietta riguardo al limite: North Micro Vision Instruct è esplicitamente non un modello di ragionamento, non dispone di chiamata agli strumenti ed è stato addestrato senza prompt di sistema.
Sports Tennis è la forma opposta in ogni dimensione. NVIDIA è partita dal proprio checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning — un ibrido Mamba2-Transformer mixture of experts, 31B in totale con circa 3B attivi per token — e lo ha messo a punto su un corpus tennistico proprietario, etichettato manualmente. L'encoder visivo (C-RADIOv4-H) e l'encoder vocale (Parakeet) erano entrambi congelati; solo i parametri del modello linguistico sono stati modificati. Il risultato è un modello ristretto per design: risponde a domande strutturate a scelta multipla e aperte su una clip completa di un punto di tennis, spaziando dalla meccanica dei colpi al posizionamento in campo, dal movimento dei giocatori ai fatti della partita, dalla conoscenza delle regole ai segnali audio. NVIDIA lo descrive come funzionante al meglio quando un intero punto — dal servizio fino alla fine dello scambio — viene passato come input.
Le dimensioni che effettivamente li separano
• Parametri — North Micro Vision Instruct: 2,4 miliardi (2 miliardi per il linguaggio, 400 milioni per la visione). Sports Tennis: 31 miliardi in totale, ~3 miliardi attivi per token.
• Input — North Micro Vision Instruct: testo e immagini interlacciati, risoluzione nativa, multi-immagine. Sports Tennis: video fino a 2 minuti, audio fino a un'ora, immagini, testo.
• Output — entrambi restituiscono testo. North Micro Vision Instruct restituisce inoltre bounding box di grounding su una scala normalizzata 0–1000.
• Lingue — North Micro Vision Instruct: undici e più, tra cui inglese, tedesco, francese, spagnolo, italiano, portoghese, hindi, giapponese, coreano, cinese e arabo. Sports Tennis: solo inglese.
• Contesto — North Micro Vision Instruct: un backbone linguistico da 128K token, ma Cohere segnala che l'intervallo multimodale convalidato arriva fino a 8K token, con contesti multimodali più lunghi che si affidano all'estrapolazione e non sono sottoposti a benchmark. Sport Tennis: fino a 256k token.
• Impronta di memoria — North Micro Vision Instruct: circa 4,97 GB in BF16, all'incirca 2,17 GB a 4 bit. Sports Tennis: circa 62 GB in BF16, richiesta una GPU da 80 GB.
• Licenza — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, con la scheda che ne indica l'uso commerciale e non commerciale.

Benchmark: un modello li ha, l'altro ha un protocollo
È qui che le due carte non potrebbero essere più diverse quanto a postura.
Cohere pubblica i punteggi per North Micro Vision Instruct. DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 — e MMMU 0.329. Tutti riportati dal fornitore, nessuno riprodotto in modo indipendente, e Cohere stessa segnala che i risultati OCR variano nettamente a seconda dello split. Vale la pena soffermarsi su quest'ultimo dato: un punteggio MMMU di 0.329 è basso, ed è coerente con tutto il resto che la scheda dice sul design del modello. Questo è uno specialista di lettura, non un modello di ragionamento generale, e l'azienda che l'ha costruito lo dice. Quel tipo di divulgazione è più utile di un numero lusinghiero.
NVIDIA non pubblica nulla. La scheda Sports Tennis descrive accuratamente la sua valutazione — una partizione di test di 12 partite completamente escluse, 2.689 clip a livello di punto e 80.872 domande da partite senza sovrapposizione con l'addestramento, valutate tramite accuratezza automatizzata a scelta multipla e LLM-as-judge pass@9 su risposte aperte, con la suddivisione delle partite viste esplicitamente esclusa dai test riportati — e poi non riporta alcun risultato da nulla di tutto ciò. Anche il lato dell'addestramento è ugualmente dettagliato: 1.312.129 esempi di domande e risposte, 1.226.081 a scelta multipla e 86.048 aperte, tratti da 43.084 clip a livello di punto in 239 partite, etichettati secondo 38 categorie di annotazione.
Anche se NVIDIA avesse pubblicato dei punteggi, non sarebbero comunque comparabili. Non esiste un benchmark in cui compaiano sia un modello di comprensione dei documenti sia un modello per i punti del tennis. La sovrapposizione tra queste due storie di valutazione è zero.

Deployment: dove sta la differenza pratica
Il modello 2.4B è, di gran lunga, la soluzione più semplice da gestire. Circa 5 GB di pesi BF16 significano che una singola GPU moderna da workstation lo gestisce, e la build a 4 bit da circa 2,17 GB è ancora più ridotta. Esistono port indipendenti per il runtime Core AI di Apple, con una velocità segnalata di ~18,2 token/s in int8 su un iPhone 17 Pro e la quantizzazione int4 che fallisce del tutto. L'attrito è nel software: North Micro Vision Instruct richiede Transformers 5.16.0 — installabile dal sorgente finché non arriva su PyPI — e il supporto pubblico a vLLM era ancora descritto come prossimamente sulla scheda. Il fine-tuning è supportato tramite Axolotl. Non esiste un'API ospitata di prima parte; il percorso pratico è il self-hosting.
Sports Tennis è la cosa più difficile da mettere in funzione e non c'è modo di aggirarlo. Una GPU da 80 GB in BF16, nessun checkpoint quantizzato pubblicato, solo in inglese, solo su Linux, su PyTorch/Transformers o NeMo o Megatron. NVIDIA ha testato su A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor e RTX 5090 — un elenco di hardware che dice più su ciò che NVIDIA voleva convalidare che su ciò che un team normale può procurarsi. Anche la policy di inferenza predefinita della scheda è ridotta all'osso: 2 frame al secondo fino a 128 frame, 256 nuovi token, decodifica greedy.
Nessuno dei due modelli è servito su OrcaRouter. North Micro Vision Instruct non ha un endpoint first-party e non è nel nostro catalogo; Sports Tennis non ha un endpoint da nessuna parte, dato che NVIDIA ha pubblicato i pesi e nessun servizio hosted. Entrambi richiedono una scelta di self-hosting.
Dove uno strato di routing aiuta davvero è nella pipeline attorno a loro — qualunque di questi tu esegua localmente, i modelli di trascrizione, riassunto, recupero e applicazione che lo circondano sono ospitati, e mettere quelli dietro una singola chiave API con failover automatico evita di dover predisporre un insieme di credenziali e un contratto separati per ciascuno. Trasmettiamo il prezzo di listino del fornitore con margine 0% sui modelli che effettivamente offriamo, così le parti dello stack che non ospiti autonomamente restano al prezzo del fornitore.

Quando la scelta è reale
C'è uno scenario in cui scegliere tra questi due è una vera decisione, e vale la pena essere concreti al riguardo perché non è ovvio.
È il caso di un'organizzazione media o sportiva che già elabora documenti e vuole aggiungere la comprensione video a livello di punto. Un broadcaster con una pipeline di archivio, una lega con resoconti di partite e PDF statistici, un detentore di diritti con sia testo che filmati — per loro, North Micro Vision Instruct è plausibilmente già nello stack per OCR ed estrazione di grafici, e Sports Tennis è la nuova capacità che aggiungerebbero. La domanda non è "quale dei due" ma "quanto mi costa il secondo in termini di infrastruttura", e la risposta è una GPU da datacenter e un vincolo di solo inglese.
Al di fuori di quel caso, i modelli semplicemente non competono. Se hai bisogno di leggere documenti in undici lingue su una scheda workstation, North Micro Vision Instruct è la risposta e Sports Tennis è irrilevante per te. Se hai bisogno di porre domande strutturate sui punti nel tennis con contesto audio, Sports Tennis è l'unico dei due che lo fa, e il fatto che non abbia benchmark pubblicati è un rischio che accetteresti anziché una ragione per scegliere l'altro modello.
Quale scegliere
Scegli North Micro Vision Instruct se il tuo lavoro riguarda documenti, grafici, OCR, grounding o comprensione di immagini multilingue, e se apprezzi un fornitore che pubblica i suoi numeri deboli accanto a quelli forti. È piccolo, Apache 2.0, ben documentato e onesto sul fatto di non essere un modello di ragionamento. Il suo MMMU di 0.329 non è un difetto che scopri dopo; Cohere te lo dice in anticipo.
Scegli NVIDIA NemotronLabs AI for Media - Sports Tennis solo se ti serve specificamente un ragionamento sul tennis a livello di punto con l'audio, se hai una GPU da 80 GB da dedicare e se te la senti di essere la prima persona a valutarlo. Nessuno ha pubblicato un punteggio per questo modello, quindi il download è l'esperimento. Non è un motivo per evitarlo — uno specialista di nicchia con un set di addestramento di 43.084 clip meticolosamente etichettato è esattamente il tipo di modello che può battere un generalista nel suo stesso compito — ma è un motivo per considerare la prima messa in produzione una prova, non un impegno.
L'unica cosa che non dovresti fare è trattarli come intercambiabili perché entrambi riportano "vision-language model" sulla scheda. Un lettore di documenti e un analista di tennis non sono mai stati lo stesso prodotto, e in questa coppia la differenza in ciò che fanno è molto più grande della differenza in quanto bene lo fanno.
