Eine generierte Hero-Karte mit geteiltem Panel, die NVIDIA NemotronLabs AI for Media - Sports Tennis und North Micro Vision Instruct vergleicht, wobei die linke Hälfte mit 31B-Tennis-Reader und einem Nur-Englisch-Chip neben einem Tennis-Punkt-Clip-Symbol beschriftet ist und die rechte Hälfte mit 2.4B-Dokumentenspezialist und einem 11+-Sprachen-Chip neben einem Dokument- und Balkendiagramm-Symbol, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Nemotron Sports Tennis vs. North Micro Vision Instruct: Ein 31B-Tennis-Leser gegen einen 2,4B-Dokumentspezialisten

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Kurze Antwort zuerst: NVIDIA NemotronLabs AI for Media - Sports Tennis und North Micro Vision Instruct sind keine Alternativen zueinander, und niemand, der zwischen ihnen wählt, wählt tatsächlich zwischen ihnen. Das eine ist ein multimodales 31B-Modell, das NVIDIA feinabgestimmt hat, um Fragen zu Tennis-Punkten zu beantworten, rund 80 GB GPU-Speicher benötigt und nur Englisch liest. Das andere ist ein 2,4B-Vision-Language-Modell von Cohere, das auf eine einzelne Workstation-Karte passt, elf Sprachen verarbeitet und vor allem dafür gebaut wurde, Dokumente zu lesen – Seiten, Diagramme, Tabellen, OCR.

Sie liegen in derselben groben Kategorie und fast nirgendwo sonst. Was folgt, ist die ehrliche Version des Vergleichs: wo die beiden wirklich auseinandergehen, was jeder Anbieter veröffentlicht hat und was nicht, und die eine Situation, in der die Wahl wirklich eine ist.

Wofür jedes Modell entwickelt wurde

North Micro Vision Instruct kombiniert ein 2B-Sprachmodell – Coheres North Micro LLM, das der Command A+ Architektur folgt – mit einem 400M-Parameter-Vision-Encoder, der eigens aus SigLIP 2 SO400M trainiert wurde, bei insgesamt 2,4B. Sein Vision-Pfad arbeitet mit nativer Auflösung und bewahrt Seitenverhältnisse, statt auf ein festes Raster zu skalieren, und ein DeepStack-Projektor injiziert Patch-Embeddings aus mehreren Encoder-Schichten in die entsprechenden frühen Sprachschichten, statt eine einzelne Repräsentation voranzustellen. Coheres angegebene Positionierung ist eine kompakte Grundlage für Prototyping und aufgabenspezifisches Fine-Tuning, mit Dokumentenverständnis als Flaggschiff-Fähigkeit. Die Modellkarte ist ungewöhnlich offen über die Obergrenze: North Micro Vision Instruct ist ausdrücklich kein Reasoning-Modell, verfügt über kein Tool-Calling und wurde nicht mit System-Prompts trainiert.

Sports Tennis ist in jeder Dimension entgegengesetzt aufgebaut. NVIDIA ging von seinem eigenen Checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning aus – einem hybriden Mixture-of-Experts aus Mamba2 und Transformer, insgesamt 31B mit etwa 3B aktiv pro Token – und stimmte ihn auf einem proprietären, manuell gelabelten Tennis-Korpus fein ab. Der Vision-Encoder (C-RADIOv4-H) und der Sprach-Encoder (Parakeet) waren beide eingefroren; nur die Parameter des Sprachmodells wurden angepasst. Das Ergebnis ist bewusst ein schmales Modell: Es beantwortet strukturierte Multiple-Choice- und offene Fragen zu einem Clip eines vollständigen Tennis-Punkts, von Schlagmechanik über Platzpositionierung, Spielerbewegung, Match-Fakten und Regelwissen bis hin zu Audio-Hinweisen. NVIDIA beschreibt, dass es am besten funktioniert, wenn ein ganzer Punkt – vom Aufschlag bis zum Ende des Ballwechsels – als Eingabe übergeben wird.

Die Dimensionen, die sie tatsächlich trennen

• Parameter — North Micro Vision Instruct: 2,4 Mrd. (2 Mrd. Sprache, 400 Mio. Vision). Sports Tennis: 31 Mrd. insgesamt, ~3 Mrd. aktiv pro Token.

• Eingaben — North Micro Vision Instruct: Text und Bilder im Wechsel, native Auflösung, mehrere Bilder. Sports Tennis: Video bis zu 2 Minuten, Audio bis zu einer Stunde, Bilder, Text.

• Ausgabe — beide geben Text zurück. North Micro Vision Instruct gibt zusätzlich Grounding-Bounding-Boxes auf einer normalisierten Skala von 0–1000 zurück.

• Sprachen — North Micro Vision Instruct: elf oder mehr, darunter Englisch, Deutsch, Französisch, Spanisch, Italienisch, Portugiesisch, Hindi, Japanisch, Koreanisch, Chinesisch und Arabisch. Sport Tennis: nur Englisch.

• Kontext — North Micro Vision Instruct: ein 128K-Token-Sprach-Backbone, aber Cohere gibt den validierten multimodalen Bereich mit bis zu 8K Token an, wobei längere multimodale Kontexte auf Extrapolation angewiesen und nicht benchmarkiert sind. Sport Tennis: bis zu 256k Token.

• Speicherbedarf — North Micro Vision Instruct: etwa 4,97 GB bei BF16, ungefähr 2,17 GB bei 4-Bit. Sports Tennis: etwa 62 GB bei BF16, eine 80-GB-GPU erforderlich.

• Lizenz — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, wobei die Karte kommerzielle und nicht-kommerzielle Nutzung ausweist.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmarks: Das eine Modell hat sie, das andere hat ein Protokoll.

Hier könnten die beiden Karten in ihrer Haltung nicht unterschiedlicher sein.

Cohere veröffentlicht Zahlen für North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 – und MMMU 0,329. Alle vom Anbieter gemeldet, keine unabhängig reproduziert, und Cohere weist selbst darauf hin, dass die OCR-Ergebnisse je nach Split stark schwanken. Bei der letzten Zahl lohnt es sich kurz innezuhalten: Ein MMMU-Wert von 0,329 ist niedrig, und er passt zu allem anderen, was die Karte über das Design des Modells aussagt. Das ist ein Spezialist fürs Lesen, kein allgemeines Reasoning-Modell, und das Unternehmen, das es entwickelt hat, sagt das selbst. Diese Art der Offenlegung ist nützlicher als eine schmeichelhafte Zahl.

NVIDIA veröffentlicht nichts. Die Sports Tennis-Karte beschreibt ihre Evaluierung sorgfältig – eine Testpartition aus 12 vollständig zurückgehaltenen Matches, 2.689 Clips auf Punkt-Ebene und 80.872 Fragen aus Matches ohne Trainingsüberschneidung, bewertet anhand automatisierter Multiple-Choice-Genauigkeit und LLM-as-judge pass@9 bei offenen Antworten, wobei der Split der gesehenen Matches ausdrücklich von den berichteten Tests ausgeschlossen ist – und berichtet dann aus alledem kein Ergebnis. Die Trainingsseite ist ebenso detailliert: 1.312.129 Q&A-Beispiele, 1.226.081 Multiple-Choice- und 86.048 offene Beispiele, entnommen aus 43.084 Clips auf Punkt-Ebene aus 239 Matches, entlang von 38 Annotationskategorien gekennzeichnet.

Selbst wenn NVIDIA Ergebnisse veröffentlicht hätte, wären sie nicht vergleichbar. Es gibt keinen Benchmark, auf dem sowohl ein Dokumentverständnis-Modell als auch ein Tennis-Punkt-Modell auftaucht. Die Überschneidung zwischen diesen beiden Evaluierungsgeschichten ist null.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Deployment: wo der praktische Unterschied liegt

Das 2,4B-Modell lässt sich mit großem Abstand am einfachsten betreiben. Rund 5 GB BF16-Gewichte bedeuten, dass eine einzelne moderne Workstation-GPU damit zurechtkommt, und der 4-Bit-Build mit rund 2,17 GB ist noch kleiner. Für Apples Core-AI-Runtime existieren unabhängige Ports, mit berichteten ~18,2 Tokens/s bei int8 auf einem iPhone 17 Pro, während die int4-Quantisierung vollständig fehlschlägt. Die Reibung liegt in der Software: North Micro Vision Instruct erfordert Transformers 5.16.0 – aus dem Quellcode installierbar, bis es in PyPI verfügbar ist – und öffentliche vLLM-Unterstützung wurde auf der Modellkarte noch als „demnächst verfügbar“ beschrieben. Fine-Tuning wird über Axolotl unterstützt. Es gibt keine gehostete Erstanbieter-API; der praktische Weg ist das Selbsthosting.

Sports Tennis ist die schwieriger zu betreibende Sache, und daran führt kein Weg vorbei. Eine einzige 80-GB-GPU bei BF16, kein quantisierter Checkpoint veröffentlicht, nur Englisch, nur Linux, auf PyTorch/Transformers oder NeMo oder Megatron. NVIDIA hat auf A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor und RTX 5090 getestet – eine Hardwareliste, die mehr darüber aussagt, was NVIDIA validieren wollte, als darüber, was ein normales Team bereitstellen kann. Auch die standardmäßige Inferenzrichtlinie der Karte ist äußerst spartanisch: 2 Frames pro Sekunde bis zu 128 Frames, 256 neue Tokens, Greedy Decoding.

Keines der beiden Modelle wird auf OrcaRouter bereitgestellt. North Micro Vision Instruct hat keinen First-Party-Endpunkt und steht nicht in unserem Katalog; Sports Tennis hat nirgends einen Endpunkt, da NVIDIA nur Gewichte veröffentlicht hat und keinen gehosteten Dienst. Bei beiden handelt es sich um Self-Hosting-Entscheidungen.

Wo eine Routing-Schicht tatsächlich hilft, ist die Pipeline drumherum – welche davon auch immer Sie lokal betreiben, die Transkriptions-, Zusammenfassungs-, Retrieval- und Anwendungsmodelle, die sie umgeben, werden gehostet, und diese hinter einem API-Schlüssel mit automatischem Failover zu legen, erspart es, für jedes Einzelne einen separaten Satz an Zugangsdaten und einen eigenen Vertrag aufzusetzen. Bei den Modellen, die wir führen, geben wir die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass die Teile des Stacks, die Sie nicht selbst hosten, beim Anbieterpreis bleiben.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Wenn die Wahl echt ist

Es gibt ein Szenario, in dem die Wahl zwischen diesen beiden eine echte Entscheidung ist, und es lohnt sich, hier konkret zu werden, weil das nicht offensichtlich ist.

Es handelt sich um den Fall einer Medien- oder Sportorganisation, die bereits Dokumente verarbeitet und nun Video-Verständnis auf Punktebene hinzufügen möchte. Ein Sender mit einer Archiv-Pipeline, eine Liga mit Spielberichten und statistischen PDFs, ein Rechteinhaber mit sowohl Text als auch Filmmaterial – für sie ist North Micro Vision Instruct plausibel bereits im Stack für OCR und Diagrammextraktion, und Sports Tennis ist die neue Fähigkeit, die sie hinzufügen würden. Die Frage ist nicht „welche“, sondern „was kostet mich die zweite an Infrastruktur“, und die Antwort ist eine Datacenter-GPU und eine Einschränkung auf Englisch.

Außerhalb dieses Falls konkurrieren die Modelle schlicht nicht. Wenn Sie Dokumente in elf Sprachen auf einer Workstation-Karte gelesen bekommen müssen, ist North Micro Vision Instruct die Antwort, und Sports Tennis ist für Sie irrelevant. Wenn Sie strukturierte Fragen zu Tennis-Punkten mit Audio-Kontext stellen müssen, ist Sports Tennis das einzige der beiden, das dies leistet, und die Tatsache, dass veröffentlichte Benchmarks fehlen, ist ein Risiko, das Sie in Kauf nehmen würden, statt ein Grund, das andere Modell zu wählen.

Welche wählen?

Wählen Sie North Micro Vision Instruct, wenn Ihre Arbeit Dokumente, Diagramme, OCR, Grounding oder mehrsprachiges Bildverständnis umfasst und wenn Sie einen Anbieter schätzen, der seine schwachen Zahlen neben seinen starken veröffentlicht. Es ist klein, Apache 2.0, gut dokumentiert und ehrlich darüber, kein Reasoning-Modell zu sein. Sein MMMU-Wert von 0,329 ist kein Mangel, den Sie erst später entdecken; Cohere sagt es Ihnen von vornherein.

Wähle NVIDIA NemotronLabs AI for Media - Sports Tennis nur, wenn du speziell punktgenaues Tennis-Reasoning mit Audio brauchst, eine 80-GB-GPU übrig hast und es dir nichts ausmacht, der erste Mensch zu sein, der es bewertet. Niemand hat eine Punktzahl für dieses Modell veröffentlicht, der Download ist also das Experiment. Das ist kein Grund, es zu meiden – ein schmaler Spezialist mit einem akribisch gelabelten Trainingsset aus 43.084 Clips ist genau die Art von Modell, die einen Generalisten in ihrer eigenen Aufgabe schlagen kann –, aber es ist ein Grund, den ersten Einsatz als Versuch statt als Festlegung zu behandeln.

Das Einzige, was Sie nicht tun sollten, ist, diese beiden als austauschbar zu behandeln, nur weil auf beiden „Vision-Language-Modell“ steht. Ein Dokumentenleser und ein Tennisanalyst waren nie dasselbe Produkt, und bei diesem Paar ist der Unterschied darin, was sie tun, weit größer als der Unterschied darin, wie gut sie es tun.