Eine generierte Hero-Card für einen Vergleich zwischen NVIDIA NemotronLabs AI for Media - Sports Tennis und InternLumina U2, die auf einer Seite ein Tennis-Punkt-Clip-Symbol und auf der anderen einen Text-plus-Bild-Ausgabestapel zeigt, beschriftet mit 31B-Spezialist mit nur Textausgabe gegenüber 16B Unified mit Text- und Bildausgabe, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: Der Vergleich, den keines der beiden Modelle verlieren kann

Autor

Elias Hawthorne

Veröffentlicht am

Zurück zu allen Beiträgen

Fragen Sie, welches besser ist — NVIDIA NemotronLabs AI for Media - Sports Tennis oder InternLumina U2 — und die ehrliche Antwort ist, dass sich die Frage nicht auflösen lässt. Die beiden Repositories erschienen beide im September 2026 auf Hugging Face, beide sind multimodale Mixture-of-Experts-Modelle, die von gut finanzierten Labors entwickelt wurden, und sie haben ansonsten kaum etwas gemeinsam. NVIDIAs Modell ist ein 31B-Spezialist, der einen einzelnen Tennispunkt liest und Fragen dazu beantwortet. InternLumina U2, vom InternLM-Team des Shanghai AI Laboratory und veröffentlicht als internlm/InternLumina-U2, ist ein 16B-Unified-Modell, das Bilder, Video und 3D versteht; außerdem generiert und bearbeitet es Bilder. Sie teilen keinen Benchmark, keine Zielgruppe und kein Einsatzprofil. Sie zu vergleichen gleicht weniger der Wahl eines Telefons als vielmehr der Wahl zwischen einem Stethoskop und einem 3D-Drucker.

Was dieses Paar ohnehin zu einem lohnenden Thema macht, ist ein Muster, das beide Modelle teilen: Keines von beiden wurde unabhängig evaluiert, und beide werden von ihrem eigenen Anbieter als etwas anderes als fertig beschrieben. Das ist der eigentliche Vergleich – nicht, welches Modell gewinnt, sondern wie viel von jedem der beiden man heute tatsächlich überprüfen kann.

Zwei verschiedene Tätigkeiten, die dasselbe Wort tragen

„Multimodal“ umfasst beides und sagt nichts aus. Hier ist die Aufteilung:

• Was es entgegennimmt — Sports Tennis: Video (mp4 bis zu 2 Minuten), Audio (wav/mp3), Bilder, Text. InternLumina U2: Text, Bilder, Video und 3D. Das Tennis-Modell ist das einzige der beiden mit einem materiellen Audiopfad, der über einen Parakeet-Sprach-Encoder geleitet wird, der neben den Frames auch Publikums- und Aufprallgeräusche liest.

• Was es zurückgibt — Sports Tennis: nur Text. InternLumina U2: Text und generierte oder bearbeitete Bilder, über eine auf AToken basierende, vollständig diskrete visuelle Repräsentation mit 8 Codebooks.

• Was der Nutzer fragt — Sport Tennis: „Was ist in diesem Punkt passiert, wo stand der Spieler, ist der Ball im Feld gelandet?“ InternLumina U2: „Beschreibe dieses Diagramm und zeichne mir dann eine neue Version davon.“

• Architektur — Sports Tennis: Mamba2-Transformer-Hybrid-MoE, 31B insgesamt mit etwa 3B aktiv pro Token, wobei Backbone und Encoder von Nemotron 3 Nano Omni übernommen werden. InternLumina U2: eine 16B sparse MoE mit 1B aktiven Parametern, aufgebaut als Multi-Codebook-Diffusions-Sprachmodell statt als herkömmliches autoregressives.

• Kontext — Sports Tennis veröffentlicht bis zu 256k Token. Auf der Karte von InternLumina U2 wird keine Kontextgröße angegeben.

• Lizenz — Sports Tennis wird unter OpenMDW-1.1 veröffentlicht, wobei die Karte kommerzielle und nichtkommerzielle Nutzung angibt. InternLumina U2 ist Apache 2.0.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

Das, was sie tatsächlich unvergleichlich macht

Es gibt keine gemeinsame Anzeigetafel, und es lohnt sich, präzise zu benennen, warum, anstatt es bei einem vagen Schulterzucken zu belassen.

Sports Tennis, feinabgestimmt auf einem proprietären NVIDIA-Tennisdatensatz – 1.312.129 Q&A-Beispiele aus 43.084 Clips auf Punktebene aus 239 Matches, beschriftet in 38 Annotationskategorien, alle im Jahr 2025 erhoben. Sein Testsatz ist eine Hold-out-Partition aus 12 Matches, 2.689 Clips und 80.872 Fragen. Jedes einzelne dieser Artefakte ist Eigentum von NVIDIA. Keine externe Gruppe besitzt die Daten, also kann keine externe Gruppe einen Score reproduzieren – und wie es der Zufall will, hat NVIDIA keinen Score veröffentlicht, den man reproduzieren könnte. Die Model Card dokumentiert das Evaluierungsprotokoll detailliert und berichtet dann kein Ergebnis daraus. Nichts zur Genauigkeit, nichts pro Kategorie, nichts.

InternLumina U2 steht auf der gegenüberliegenden Seite derselben Wand. Es veröffentlicht Zahlen, doch sie sind ausdrücklich nur teilweise. Die Modellkarte sagt es in einer Zeile: „Vorläufige, partielle Ergebnisse. Vollständige Vergleichstabellen werden im kommenden technischen Bericht erscheinen.“ Was vorliegt, ist eine Streuung von vom Anbieter berichteten Werten über sehr unterschiedliche Fähigkeiten hinweg — ChartQA 86.52 und CharXiv-DQ 83.65 bei Dokumenten, MathVision 33.22 und DynaMath 56.37 bei visueller Mathematik, VideoMME 51.26 und MVBench 59.74 bei Video, 3D MM-Vet 41.8, DPG-Bench 87.10 und GenEval 0.81 bei Generierung, ImgEdit 3.83 bei Bearbeitung. Und die eigene Tabelle der Projektseite zeigt, dass das Modell bei mindestens einer wichtigen Kennzahl hinter mindestens einem namentlich genannten Wettbewerber zurückliegt: GenEval 0.81 gegenüber LLaDA2.0-Uni mit 0.89.

Also hat das eine Modell eine dokumentierte Evaluierung und keine Ergebnisse, und das andere hat Ergebnisse und eine ausdrücklich unvollständige Evaluierung. Keines von beiden liefert eine Zahl, die man neben die andere halten kann. Jede Seite, die diese beiden in eine Rangfolge bringt, hat ihre Rangfolge erfunden.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Wo sie sich tatsächlich überschneiden, und was es zeigt

Videoverständnis ist das eine Terrain, das beide für sich beanspruchen, und selbst dort ist die Überschneidung dünner, als es den Anschein hat. InternLumina U2 meldet VideoMME 51,26 und MLVU 57,03 und MVBench 59,74 – allgemeine Videoverständnis-Werte, vom Anbieter angegeben. Sports Tennis meldet nichts, doch seine Karte beschreibt eine viel engere und viel tiefere Aufgabe: Reasoning auf Punktebene über einen vollständigen Ballwechsel mit Audio, über 38 feinkörnige Annotationskategorien hinweg, darunter Schlagmechanik, Platzpositionierung, Bewegung und Spielstand.

Die vernünftige Schlussfolgerung ist, dass InternLumina U2 der bessere Generalist und Sports Tennis der bessere Tennis-Reader wäre, aber das ist eine Schlussfolgerung aus der Aufgabenform, nicht aus Daten. Sie könnte in beide Richtungen leicht falsch sein. Was keine Schlussfolgerung ist, ist, dass ein allgemeiner Video-Benchmark und ein proprietärer Tennis-Benchmark auf Punktebene nicht auf dieselbe Achse gestellt werden können und dass ein 16B-Unified-Generator und ein 31B-Frozen-Encoder-Spezialist nicht gebaut wurden, um dieselbe Frage zu beantworten.

Eines von beiden zu betreiben, ist eine andere Art von Projekt.

Deployment ist der Punkt, an dem die Lücke aufhört, philosophisch zu sein.

Sports Tennis nennt eine harte Untergrenze von einer GPU mit rund 80 GB Speicher bei BF16, mit Gewichten von etwa 62 GB, getestet auf A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor und RTX 5090. Es gibt keinen quantisierten Checkpoint, daher ist die 80-GB-Anforderung heute nicht nach unten verhandelbar. Außerdem ist es nur auf Englisch verfügbar.

Das interessantere Problem bei InternLumina U2 ist nicht der Speicher, sondern das Silizium. Das Repository hostet Checkpoints, die nach Trainingshardware aufgeteilt sind: ein vollständiges ascend/Verzeichnis mit sieben Safetensors-Shards, trainiert auf Huawei Ascend NPUs, und ein nvidia/Verzeichnis, das mit „demnächst verfügbar“ gekennzeichnet ist. Wenn Sie NVIDIA-Hardware verwenden – was auf die meisten Leser dieses Textes zutrifft, bei einem Modell, dessen Schwestermodell ein Tennis-Fine-Tuning von Nemotron ist –, ist der Checkpoint, den Sie wollen, derjenige, der noch nicht verfügbar ist. Inferenzcode und Einrichtungsanleitungen befinden sich im InternLM-GitHub-Repository statt auf dem Hub, und der technische Bericht steht noch aus.

Das kehrt die übliche Erwartung um. Das proprietäre, nicht gebenchmarkte, Appliance-förmige Modell ist dasjenige, das man sofort ab Tag eins herunterladen und ausführen kann. Das offene Forschungsmodell unter Apache-2.0 ist dasjenige, das auf einen hardwarespezifischen Build wartet.

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

Wo ein Router passt – und wo nicht

Keines dieser beiden Modelle wird auf OrcaRouter gehostet, und es gibt keine ehrliche Möglichkeit, darum herumzuschreiben. Sports Tennis hat nirgendwo einen Endpoint; NVIDIA hat Gewichte veröffentlicht und sonst nichts. Das eigene Repository von InternLumina U2 vermerkt, dass die NVIDIA-Checkpoints noch ausstehen, also gibt es auch auf unserer Seite nichts bereitzustellen. Dies ist in beiden Punkten eine Entscheidung für Self-Hosting, keine Routing-Entscheidung.

Die Routing-Frage stellt sich eine Ebene höher. Ein Team, das einen Spezialisten wie Sports Tennis gegen einen Generalisten wie InternLumina U2 evaluieren möchte, tut das nicht isoliert – es tut es als einen Kandidaten in einer Pipeline, die außerdem Sprachtranskription, Dokumentenverarbeitung, Zusammenfassung und die Anwendungslogik um sie herum benötigt. Diese Komponenten werden gehostet, und sie sind die Teile, bei denen ein einzelner API-Schlüssel, der über 200 Modelle abdeckt mit automatischem Failover über Anbieter hinweg eine Woche Integrationsarbeit spart. Ein Schlüssel für die Modelle, die Sie aufrufen können, sodass diejenigen, die Sie selbst betreiben müssen, das Einzige sind, das Sie tatsächlich pflegen.

Die offene Frage

Nebeneinandergestellt sind NVIDIA NemotronLabs AI for Media - Sports Tennis und InternLumina U2 ein ganz ordentliches Beispiel für zwei Arten, ein multimodales Modell öffentlich schlecht auszuliefern. Das eine dokumentierte seine Evaluierung und hielt die Ergebnisse zurück; das andere veröffentlichte Ergebnisse und bezeichnete seine Evaluierung als unvollständig. Beide sind, Stand September 2026, nicht falsifizierbare Behauptungen.

Das Interessante daran ist nicht, welches von beiden stärker abschneidet – sie werden nie an derselben Sache getestet werden. Es ist, welches Labor seine Lücke zuerst schließt. Wenn NVIDIA Tennis-Zahlen veröffentlicht, wird es das schwierigere Problem gelöst haben, denn ein proprietärer zurückgehaltener Benchmark mit 12 ungesehenen Spielen ist der einzige ehrliche Weg, ein Domain-Fine-Tuning zu bewerten, und NVIDIA hat den Split bereits erstellt. Wenn InternLM die NVIDIA-Checkpoints und den technischen Bericht ausliefert, wird es sein Apache-2.0-Modell auf der Hardware, die seine Nutzer besitzen, wirklich nutzbar gemacht haben. Was auch immer passiert, dieser Vergleich wird es wert sein, erneut gelesen zu werden – denn im Moment ist das Stichhaltigste, was die Model Card eines der beiden Modelle hergibt, ein Schulterzucken.