Een gegenereerde herokaart met gesplitst paneel die NVIDIA NemotronLabs AI for Media - Sports Tennis en North Micro Vision Instruct vergelijkt, waarbij de linkerhelft het label 31B tennislezer heeft en een chip 'alleen Engels' naast een tennispunt-clipicoon, en de rechterhelft het label 2.4B documentspecialist heeft en een chip '11+ talen' naast een document- en staafdiagramicoon, met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct: een 31B-tennislezer tegen een 2,4B-documentspecialist

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Kort antwoord eerst: NVIDIA NemotronLabs AI for Media - Sports Tennis en North Micro Vision Instruct zijn geen vervangers, en niemand die tussen hen kiest, kiest in werkelijkheid tussen hen. De ene is een 31B-multimodaal model dat NVIDIA heeft gefinetuned om vragen over tennispunten te beantwoorden, ongeveer 80 GB GPU-geheugen nodig heeft en alleen Engels leest. De andere is een 2,4B vision-language model van Cohere dat op één enkele werkstationkaart past, elf talen aankan en bovenal is gebouwd om documenten te lezen — pagina's, grafieken, tabellen, OCR.

Ze vallen in dezelfde brede categorie en vrijwel nergens anders. Wat volgt is de eerlijke versie van de vergelijking: waar de twee werkelijk uiteenlopen, wat elke leverancier wel en niet heeft gepubliceerd, en de ene situatie waarin de keuze echt is.

Waarvoor elk model is gebouwd

North Micro Vision Instruct combineert een 2B-taalmodel — Cohere's North Micro LLM, die de Command A+ architectuur volgt — met een vision-encoder met 400M parameters, op maat getraind op basis van SigLIP 2 SO400M, voor een totaal van 2,4B. Het visiepad is native-resolution en behoudt beeldverhoudingen in plaats van te herschalen naar een vast raster, en een DeepStack-projector injecteert patch-embeddings van meerdere encoderlagen in de overeenkomstige vroege taallagen in plaats van een enkele representatie vooraan te plaatsen. Cohere's geformuleerde framing is een compacte basis voor prototyping en taakspecifieke fine-tuning, met documentbegrip als de vlaggenschipcapaciteit. De modelkaart is ongewoon openhartig over het plafond: North Micro Vision Instruct is expliciet geen redeneermodel, heeft geen tool calling, en is niet getraind met systeemprompts.

Sports Tennis heeft in elke dimensie de tegenovergestelde vorm. NVIDIA begon met zijn eigen Nemotron 3 Nano Omni 30B-A3B-Reasoning-checkpoint — een Mamba2-Transformer hybride mixture of experts, in totaal 31B met ongeveer 3B actief per token — en fine-tunede het op een propriëtair, handmatig gelabeld tennis-corpus. De vision-encoder (C-RADIOv4-H) en de spraakencoder (Parakeet) werden beide bevroren; alleen de parameters van het taalmodel werden aangepast. Het resultaat is een bewust smal model: het beantwoordt gestructureerde meerkeuzevragen en open vragen over een volledige clip van een tennispunt, variërend van slagmechanica, positie op de baan, spelersbewegingen, wedstrijdfeiten, regelkennis en audiosignalen. NVIDIA beschrijft dat het het beste werkt wanneer een volledig punt — van de service tot het einde van de rally — als invoer wordt doorgegeven.

De dimensies die hen daadwerkelijk scheiden

• Parameters — North Micro Vision Instruct: 2,4B (2B taal, 400M visie). Sports Tennis: 31B totaal, ~3B actief per token.

• Invoer — North Micro Vision Instruct: afgewisselde tekst en afbeeldingen, native resolutie, meerdere afbeeldingen. Sports Tennis: video tot 2 minuten, audio tot een uur, afbeeldingen, tekst.

• Uitvoer — beide retourneren tekst. North Micro Vision Instruct retourneert daarnaast grounding-boundingboxes op een genormaliseerde schaal van 0–1000.

• Talen — North Micro Vision Instruct: elf of meer, waaronder Engels, Duits, Frans, Spaans, Italiaans, Portugees, Hindi, Japans, Koreaans, Chinees en Arabisch. Sports Tennis: alleen Engels.

• Context — North Micro Vision Instruct: een 128K-token taalbackbone, maar Cohere geeft aan dat het gevalideerde multimodale bereik maximaal 8K tokens is, waarbij langere multimodale contexten op extrapolatie vertrouwen en niet gebenchmarkt zijn. Sport Tennis: tot 256k tokens.

• Voetafdruk — North Micro Vision Instruct: ongeveer 4,97 GB bij BF16, ruwweg 2,17 GB bij 4-bit. Sports Tennis: ongeveer 62 GB bij BF16, één 80 GB GPU vereist.

• Licentie — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, waarbij op de kaart staat dat het voor commercieel en niet-commercieel gebruik is.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmarks: het ene model heeft ze, het andere heeft een protocol

Dit is waar de twee kaarten qua houding niet meer van elkaar kunnen verschillen.

Cohere publiceert cijfers voor North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — en MMMU 0,329. Allemaal door de leverancier gerapporteerd, geen ervan onafhankelijk gereproduceerd, en Cohere zelf geeft aan dat OCR-resultaten sterk variëren per split. Bij dat laatste cijfer moeten we even stilstaan: een MMMU-score van 0,329 is laag, en dat komt overeen met al het andere dat de modelkaart over het ontwerp van het model zegt. Dit is een leesspecialist, geen algemeen redeneermodel, en het bedrijf dat het heeft gebouwd zegt dat ook. Dat soort openheid is nuttiger dan een vleiend cijfer.

NVIDIA publiceert niets. De Sports Tennis-kaart beschrijft de evaluatie zorgvuldig — een testpartitie van 12 volledig achtergehouden wedstrijden, 2.689 clips op puntniveau en 80.872 vragen uit wedstrijden zonder overlap met de training, gescoord via geautomatiseerde accuratesse bij meerkeuzevragen en LLM-as-judge pass@9 op open antwoorden, waarbij de split met geziene wedstrijden expliciet is uitgesloten van de gerapporteerde tests — en rapporteert vervolgens geen enkel resultaat uit al dat alles. De trainingskant is even gedetailleerd: 1.312.129 Q&A-voorbeelden, waarvan 1.226.081 meerkeuze en 86.048 open, afkomstig uit 43.084 clips op puntniveau verspreid over 239 wedstrijden, gelabeld volgens 38 annotatiecategorieën.

Zelfs als NVIDIA de scores had gepubliceerd, zouden ze niet vergelijkbaar zijn. Er is geen benchmark waarop zowel een documentbegripmodel als een tennispuntmodel voorkomt. De overlap tussen deze twee evaluatieverhalen is nul.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Deployment: waar het praktische verschil zit

Het 2,4B-model is met een ruime marge het gemakkelijkst om te bedienen. Ongeveer 5 GB aan BF16-gewichten betekent dat één enkele moderne workstation-GPU het aankan, en de 4-bit-build van ongeveer 2,17 GB gaat nog kleiner. Er bestaan onafhankelijke ports voor Apple's Core AI-runtime, met naar verluidt ~18,2 tokens/s bij int8 op een iPhone 17 Pro, terwijl int4-kwantisatie helemaal faalt. De wrijving zit in de software: North Micro Vision Instruct vereist Transformers 5.16.0 — installeerbaar uit de broncode tot het PyPI bereikt — en publieke vLLM-ondersteuning werd op de modelkaart nog steeds beschreven als binnenkort beschikbaar. Fine-tuning wordt ondersteund via Axolotl. Er is geen first-party gehoste API; het praktische pad is self-hosting.

Sports Tennis is het lastiger om te draaien en je komt er niet omheen. Eén 80 GB GPU in BF16, geen gekwantiseerd checkpoint gepubliceerd, alleen Engels, alleen Linux, op PyTorch/Transformers of NeMo of Megatron. NVIDIA heeft getest op A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor en RTX 5090 — een hardwarelijst die meer zegt over wat NVIDIA wilde valideren dan over wat een normaal team kan aanschaffen. Het standaard inferentiebeleid van de kaart is ook minimaal: 2 frames per seconde tot 128 frames, 256 nieuwe tokens, greedy decoding.

Geen van beide modellen wordt aangeboden op OrcaRouter. North Micro Vision Instruct heeft geen first-party-endpoint en staat niet in onze catalogus; Sports Tennis heeft nergens een endpoint, aangezien NVIDIA gewichten heeft gepubliceerd en er geen gehoste service is. Beide zijn self-hostingbeslissingen.

Waar een routeringslaag wél helpt, is de pipeline eromheen — welke van deze je ook lokaal draait, de transcriptie-, samenvattings-, retrieval- en applicatiemodellen eromheen worden gehost, en die achter één API-sleutel met automatische failover plaatsen voorkomt dat je voor elk afzonderlijk een aparte set inloggegevens en een apart contract moet opzetten. Wij rekenen de listprijs van de provider door met 0% opslag op de modellen die wij wel aanbieden, zodat de delen van de stack die je niet zelf host tegen leveranciersprijzen blijven.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Wanneer de keuze echt is

Er is één scenario waarin het kiezen tussen deze twee een echte beslissing is, en het is de moeite waard om daar concreet over te zijn, omdat het niet voor de hand ligt.

Het gaat om een media- of sportorganisatie die al documenten verwerkt en video-analyse op puntniveau wil toevoegen. Een omroep met een archiefpijplijn, een league met wedstrijdverslagen en statistische pdf's, een rechthebbende met zowel tekst als beeldmateriaal — voor hen staat North Micro Vision Instruct waarschijnlijk al in de stack voor OCR en grafiekextractie, en Sports Tennis is de nieuwe mogelijkheid die ze zouden toevoegen. De vraag is niet 'welke' maar 'wat kost de tweede me aan infrastructuur', en het antwoord is een datacenter-GPU en een beperking tot alleen Engels.

Buiten dat geval concurreren de modellen simpelweg niet. Als u documenten in elf talen wilt laten lezen op een workstationkaart, is North Micro Vision Instruct het antwoord en is Sports Tennis voor u irrelevant. Als u gestructureerde vragen over tennispunten met audiocontext wilt stellen, is Sports Tennis de enige van de twee die dat doet, en het feit dat het geen gepubliceerde benchmarks heeft, is een risico dat u zou aanvaarden in plaats van een reden om het andere model te kiezen.

Welke te kiezen?

Kies North Micro Vision Instruct als je werk documenten, grafieken, OCR, grounding of meertalige beeldinterpretatie omvat, en als je waarde hecht aan een leverancier die zijn zwakke cijfers naast zijn sterke cijfers publiceert. Het is klein, Apache 2.0, goed gedocumenteerd en eerlijk over dat het geen redeneermodel is. De MMMU van 0,329 is geen gebrek dat je pas later ontdekt; Cohere vertelt het je vooraf.

Kies NVIDIA NemotronLabs AI for Media - Sports Tennis alleen als je specifiek behoefte hebt aan tennisredenering op puntniveau met audio, je een extra GPU van 80 GB hebt en je het prima vindt om de eerste persoon te zijn die het model evalueert. Niemand heeft een score voor dit model gepubliceerd, dus de download is het experiment. Dat is geen reden om het te vermijden — een smalle specialist met een nauwkeurig gelabelde trainingsset van 43.084 clips is precies het soort model dat een generalist kan verslaan in diens eigen taak — maar het is wel een reden om de eerste implementatie als een proef te beschouwen en niet als een verbintenis.

Het enige dat je niet moet doen, is deze als inwisselbaar behandelen omdat er op de kaart bij beide "vision-language model" staat. Een documentlezer en een tennisanalist waren nooit hetzelfde product, en in dit paar is het verschil in wat ze doen veel groter dan het verschil in hoe goed ze het doen.