Ett genererat hero-kort med delad panel som jämför NVIDIA NemotronLabs AI for Media - Sports Tennis och North Micro Vision Instruct, där den vänstra halvan är märkt 31B tennisläsare och en chip för endast engelska bredvid en ikon för tennispoängklipp, och den högra halvan är märkt 2.4B dokumentspecialist och en chip för 11+ språk bredvid en dokument- och stapeldiagramikon, med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct: En 31B-tennisläsare mot en 2,4B-dokumentspecialist

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Kort svar först: NVIDIA NemotronLabs AI for Media - Sports Tennis och North Micro Vision Instruct är inte substitut, och ingen som väljer mellan dem väljer egentligen mellan dem. Det ena är en 31B multimodal modell som NVIDIA finjusterade för att svara på frågor om tennispoäng, kräver ungefär 80 GB GPU-minne och läser endast engelska. Det andra är en 2,4B visionsspråkmodell från Cohere som får plats på ett enda arbetsstationskort, hanterar elva språk och framför allt byggdes för att läsa dokument – sidor, diagram, tabeller, OCR.

De ligger i samma breda kategori och nästan ingen annanstans. Det som följer är den ärliga versionen av jämförelsen: där de två verkligen går isär, vad varje leverantör har och inte har publicerat, och den enda situationen där valet är reellt.

Vad varje modell byggdes för att göra

North Micro Vision Instruct kombinerar en 2B-språkmodell – Coheres North Micro LLM, som följer Command A+-arkitekturen – med en visionskodare på 400M parametrar, specialtränad från SigLIP 2 SO400M, för totalt 2,4B. Dess visionsväg har nativ upplösning och bevarar bildförhållanden i stället för att skala om till ett fast rutnät, och en DeepStack-projektor injicerar patch-embeddingar från flera kodarlager i motsvarande tidiga språklager i stället för att lägga en enda representation först. Coheres uttalade inramning är en kompakt grund för prototypframtagning och uppgiftsspecifik finjustering, med dokumentförståelse som flaggskeppsförmåga. Modellkortet är ovanligt uppriktigt om taket: North Micro Vision Instruct är uttryckligen inte en resonemangsmodell, saknar verktygsanrop och tränades inte med systempromptar.

Sports Tennis har motsatt form i varje dimension. NVIDIA utgick från sin egen Nemotron 3 Nano Omni 30B-A3B-Reasoning-checkpoint – en Mamba2-Transformer-hybrid som är en mixture of experts, 31B totalt med cirka 3B aktiva per token – och finjusterade den på en proprietär, manuellt märkt tenniskorpus. Både vision-encodern (C-RADIOv4-H) och talencodern (Parakeet) frystes; endast språkmodellens parametrar ändrades. Resultatet är en medvetet smal modell: den besvarar strukturerade flervalsfrågor och öppna frågor utifrån ett klipp med en hel tennispoäng, och spänner över slagmekanik, positionering på banan, spelarrörelser, matchfakta, regelkunskap och ljudsignaler. NVIDIA beskriver att den fungerar bäst när en hel poäng – från serve till slutet av rallyt – skickas in som indata.

De dimensioner som faktiskt skiljer dem åt

• Parametrar — North Micro Vision Instruct: 2,4B (2B språk, 400M vision). Sports Tennis: 31B totalt, ~3B aktiva per token.

• Indata — North Micro Vision Instruct: sammanflätad text och bilder, ursprunglig upplösning, flera bilder. Sports Tennis: video på upp till 2 minuter, ljud upp till en timme, bilder, text.

• Utdata — båda returnerar text. North Micro Vision Instruct returnerar dessutom avgränsningsrutor för grounding på en normaliserad 0–1000-skala.

• Språk – North Micro Vision Instruct: elva plus, inklusive engelska, tyska, franska, spanska, italienska, portugisiska, hindi, japanska, koreanska, kinesiska och arabiska. Sports Tennis: endast engelska.

• Kontext — North Micro Vision Instruct: en språklig basmodell med 128K tokens, men Cohere anger att det validerade multimodala intervallet är upp till 8K tokens, där längre multimodala kontexter bygger på extrapolering och inte är benchmarkade. Sports Tennis: upp till 256k tokens.

• Minnesavtryck — North Micro Vision Instruct: cirka 4,97 GB vid BF16, ungefär 2,17 GB vid 4-bitars. Sports Tennis: cirka 62 GB vid BF16, en 80 GB GPU krävs.

• Licens — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, där kortet anger kommersiell och icke-kommersiell användning.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmarks: en modell har dem, den andra har ett protokoll

Det här är där de två korten inte skulle kunna vara mer olika i hållning.

Cohere publicerar siffror för North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 – och MMMU 0,329. Alla är rapporterade av tillverkaren, ingen av dem har oberoende reproducerats, och Cohere påpekar själva att OCR-resultaten varierar kraftigt beroende på delmängd. Den sista siffran är värd att stanna upp vid: en MMMU-poäng på 0,329 är låg, och den stämmer med allt annat som modellkortet säger om modellens design. Det här är en lässpecialist, inte en allmän resonemangsmodell, och företaget som byggde den säger det själva. Den typen av öppenhet är mer användbar än en smickrande siffra.

NVIDIA publicerar ingenting. Sports Tennis-kortet beskriver sin utvärdering noggrant – en testpartition med 12 helt undanhållna matcher, 2 689 klipp på poängnivå och 80 872 frågor från matcher utan överlappning med träningen, poängsatta genom automatisk noggrannhet för flervalsfrågor och LLM-as-judge pass@9 på öppna svar, med uppdelningen för sedda matcher uttryckligen utesluten från den rapporterade testningen – och rapporterar sedan inget resultat från något av detta. Träningssidan är lika detaljerad: 1 312 129 Q&A-exempel, 1 226 081 flervalsfrågor och 86 048 öppna frågor, hämtade från 43 084 klipp på poängnivå spridda över 239 matcher, etiketterade utifrån 38 annoteringskategorier.

Även om NVIDIA hade publicerat resultat skulle de inte vara jämförbara. Det finns ingen benchmark där både en dokumentförståelsemodell och en tennispoängmodell förekommer. Överlappningen mellan dessa två utvärderingsberättelser är noll.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Driftsättning: där den praktiska skillnaden ligger

2,4B-modellen är med god marginal den enklare att hantera. Ungefär 5 GB BF16-vikter innebär att ett enda modernt GPU i en arbetsstation klarar den, och 4-bitarsbygget på omkring 2,17 GB blir ännu mindre. Det finns oberoende portningar för Apples Core AI-runtime, med rapporterade ~18,2 tokens/s vid int8 på en iPhone 17 Pro, medan int4-kvantisering misslyckas helt. Friktionen ligger i mjukvaran: North Micro Vision Instruct kräver Transformers 5.16.0 – installerbart från källkod tills det når PyPI – och offentligt vLLM-stöd beskrevs fortfarande som kommande på modellkortet. Finjustering stöds via Axolotl. Det finns inget förstaparts hostat API; den praktiska vägen är egen hosting.

Sports Tennis är det svårare att driva och det går inte att komma runt. En 80 GB GPU i BF16, ingen kvantiserad checkpoint publicerad, endast engelska, endast Linux, på PyTorch/Transformers eller NeMo eller Megatron. NVIDIA testade på A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor och RTX 5090 – en hårdvarulista som säger mer om vad NVIDIA ville validera än om vad ett normalt team kan anskaffa. Kortets standardpolicy för inferens är också avskalad: 2 bildrutor per sekund upp till 128 bildrutor, 256 nya token, greedy decoding.

Ingen av modellerna serveras på OrcaRouter. North Micro Vision Instruct har ingen förstaparts-endpoint och finns inte i vår katalog; Sports Tennis har ingen endpoint någonstans, eftersom NVIDIA publicerade vikterna och ingen hostad tjänst. Båda är beslut om egen hosting.

Där ett routinglager verkligen gör nytta är pipelinen runt dem – oavsett vilka av dessa du kör lokalt, så hostas transkriberings-, sammanfattnings-, retrieval- och applikationsmodellerna som omger det, och att placera dem bakom en enda API-nyckel med automatisk failover gör att du slipper sätta upp en separat uppsättning autentiseringsuppgifter och ett separat avtal för var och en. Vi för vidare leverantörens listpris med 0 % påslag på de modeller vi tillhandahåller, så de delar av stacken som du inte självhostar ligger kvar på leverantörens prissättning.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

När valet är verkligt

Det finns ett scenario där valet mellan dessa två är ett genuint beslut, och det är värt att vara konkret kring det eftersom det inte är självklart.

Det gäller en medie- eller sportorganisation som redan bearbetar dokument och vill lägga till videoförståelse på poängnivå. Ett TV-bolag med en arkivpipeline, en liga med matchrapporter och statistiska PDF:er, en rättighetsinnehavare med både text och videomaterial – för dem finns North Micro Vision Instruct troligen redan i stacken för OCR och diagramextraktion, och Sports Tennis är den nya förmåga de skulle lägga till. Frågan är inte "vilken av dem" utan "vad kostar den andra mig i infrastruktur", och svaret är en datacenter-GPU och en begränsning till enbart engelska.

Bortsett från det fallet konkurrerar modellerna helt enkelt inte. Om du behöver få dokument lästa på elva språk på ett arbetsstationskort är North Micro Vision Instruct svaret och Sports Tennis är irrelevant för dig. Om du behöver ställa strukturerade frågor om tennispoäng med ljudkontext är Sports Tennis den enda av de två som gör det, och att den saknar publicerade prestandamätningar är en risk du skulle acceptera snarare än ett skäl att välja den andra modellen.

Vilken ska man välja?

Välj North Micro Vision Instruct om ditt arbete involverar dokument, diagram, OCR, grounding eller flerspråkig bildförståelse, och om du värdesätter en leverantör som publicerar sina svaga siffror tillsammans med sina starka. Den är liten, Apache 2.0, väl dokumenterad och ärlig med att den inte är en resonemangsmodell. Dess MMMU på 0,329 är inte en brist du upptäcker senare; Cohere berättar det för dig redan från början.

Välj NVIDIA NemotronLabs AI for Media - Sports Tennis endast om du specifikt behöver tennisresonemang på poängnivå med ljud, har ett 80 GB GPU över och är bekväm med att vara den första som utvärderar den. Ingen har publicerat något resultat för den här modellen, så nedladdningen är experimentet. Det är inte ett skäl att undvika den — en smal specialist med ett minutiöst märkt träningsset på 43 084 klipp är precis den typ av modell som kan slå en generalist på sin egen uppgift — men det är ett skäl att behandla den första driftsättningen som ett prov snarare än ett åtagande.

Det enda du inte ska göra är att behandla dessa som utbytbara bara för att båda säger "vision-language model" på kortet. En dokumentläsare och en tennisanalytiker har aldrig varit samma produkt, och i det här paret är skillnaden i vad de gör mycket större än skillnaden i hur bra de gör det.