
CARI4D Commercial: NVIDIA öffnete sein 4D-Interaktionsmodell still für Unternehmen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Irgendwann um den 30. August 2026 herum tauchte auf Hugging Face ein zugangsbeschränktes Repository namens nvidia/cari4d_commercial auf. Seine Modellkarte beschreibt einen Checkpoint, den der Anbieter „CARI4D CoCoNet Native Momentum Human Rig (MHR)“ nennt – ein Netzwerk mit 231 Millionen Parametern, das ein gewöhnliches MP4-Video entgegennimmt und Frame für Frame die Pose eines Menschen sowie eines starren Objekts, das dieser handhabt, zurückgibt, plus zwei Handkontakt-Logits. In der Lizenzzeile steht nvidia-open-model-agreement, und die Karte gibt an, dass das Modell für kommerzielle wie nicht-kommerzielle Nutzung bereit ist. Das ist eine bedeutende Veränderung gegenüber CARI4Ds früherem Dasein. Das Forschungs-Repository, nvidia/CARI4D, liefert dieselbe Modellfamilie – CoCoNet, 194 Mio. Parameter – unter der NVIDIA License, mit dem auf der Karte aufgedruckten Hinweis „nur für Forschung und Entwicklung“. Es ist der Unterschied zwischen einem Paper, das man lesen kann, und einer Komponente, die man ausliefern kann.
Was diese Meldung berichtenswert macht, ist nicht die Veröffentlichung. Es ist die Stille darum herum. Dies ist kein Launch: NVIDIA hat keinen Blogbeitrag, keinen Newsroom-Eintrag, keine Benchmark-Tabelle und keine Preisangabe für cari4d_commercial veröffentlicht, und zum Zeitpunkt des Schreibens ist das Repository nur erreichbar, nachdem man die Bedingungen akzeptiert und Kontaktinformationen angegeben hat. Alles im Folgenden stammt aus den beiden Modellkarten und der öffentlichen Code-Veröffentlichung. Wo eine Aussage von NVIDIA selbst stammt und nicht reproduziert wurde, sagt dieser Artikel dies.
Was hat sich am 30. August tatsächlich geändert?
Die Versuchung ist, dies als Lizenzänderung abzustempeln. Es ist mehr als das. Liest man die beiden Karten gegeneinander, haben sich drei Dinge auf einmal verschoben – die Lizenz, die Größe des Checkpoints und das darunterliegende menschliche Körpermodell.
• Parameter — CARI4D Forschungs-Release 194M vs. CARI4D CoCoNet MHR 231M
• Checkpoint – step031397.pth (31.397 Trainingsschritte) im Vergleich zum Versionsstring 2026-08-25-09-35-57, Schritt 200.000, Status „Training abgeschlossen“
• Körper-Rig — Pose und Form von SMPL / SMPL-H vs. Parameter des Native Momentum Human Rig (MHR)
• Lizenz — NVIDIA-Lizenz, „nur für Forschung und Entwicklung“ vs. NVIDIA Open Model Agreement, kommerzielle Nutzung erlaubt
• Zugriff — offener Download vs. zugangsbeschränkt, Bedingungen müssen akzeptiert werden
• Ausgaben — aktualisierte SMPL-Pose, -Form und -Translation, Objektrotation und -translation, binärer Handkontakt vs. Pro-Frame-Objektpose und MHR-Residuen, plus zwei Handkontakt-Logits

Die Schrittzahl ist die Zeile, die Aufmerksamkeit verdient. Ein Forschungs-Checkpoint, eingefroren bei ungefähr 31k Schritten, und ein Produktions-Checkpoint, der bis 200.000 lief, sind nicht dasselbe Objekt, dem lediglich ein anderer Lizenzheader angeheftet wurde. NVIDIA gibt außerdem die 231M-Zahl als „gemessen vom Modellzustand bei Schritt 84.000, ohne registrierte Puffer“ an, was verrät, dass die Karte eher eine Trainingsabstammung als ein einzelnes eingefrorenes Artefakt beschreibt.
Der Austausch des Body-Rigs ist genauso wichtig für alle, die bereits gegen CARI4D entwickelt haben. Die Forschungslinie basiert durchgängig auf SMPL — die Optimierungsterme des Papers regressieren SMPL-Pose, SMPL-Shape und SMPL-Translation, und der Code hängt von SMPL-H-Pickle-Dateien plus einem VolumetricSMPL-Patch ab. MHR ist eine andere Parametrisierung. Wenn Sie Integrationscode gegen die Ausgabe-Tensoren des Forschungs-Checkpoints geschrieben haben, ist die Ausgabeform der kommerziellen Karte kein Drop-in.
Das Forschungs-Release, auf dem dies basiert, ist acht Monate alt.
Es lohnt sich, in Bezug auf die zeitliche Abfolge präzise zu sein, denn der Ausdruck „neues Modell“ wäre hier falsch, und der Ausdruck „altes Modell“ wäre ebenfalls falsch.
Das CARI4D-Paper — Kategorieagnostische 4D-Rekonstruktion der Mensch-Objekt-Interaktion, von Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll und Stan Birchfield — erschien am 16. Dezember 2025 auf arXiv als 2512.11988 und wurde bei der CVPR 2026 angenommen. Die NVlabs-Codeveröffentlichung folgte am 28. Februar 2026. Trainingscode und die Vorverarbeitung eigener Videos kamen am 4. April hinzu. Nach jedem normalen Maßstab ist diese Forschungslinie eine abgeschlossene, acht Monate alte Arbeit mit einer vollständig abgehakten TODO-Liste.

Die ehrliche Einordnung ist also diese: Die Methode ist Schnee von gestern, und das kommerzielle Artefakt ist drei Wochen alt. Wenn Sie im März nach CARI4D gesucht und zu dem Schluss gekommen sind, dass es sich um eine Forschungskuriosität mit restriktiver Lizenz handelte, war diese Schlussfolgerung damals korrekt und ist heute veraltet. Das ist der ganze Grund, warum das in einen News-Slot gehört.
Was das Modell tatsächlich tut und wie gut.
CARI4D rekonstruiert die Mensch-Objekt-Interaktion in 4D — drei Raumdimensionen plus Zeit — im metrischen Maßstab, aus einem einzigen monokularen RGB-Video. Die letzte Einschränkung ist die eigentlich interessante. Die metrische Skala eines Objekts, das eine Person hält, aus einer einzigen gewöhnlichen Kamera zurückzugewinnen, ohne Tiefensensor und ohne Multi-View-Rig, ist das Problem, um das herum das Paper aufgebaut ist.
Die Pipeline ist eine Kette von Foundation-Modellen statt eines einzigen End-to-End-Netzwerks: UniDepth für metrische Tiefe, NLF und GENMO für menschliche Pose, Hunyuan3D für Objekt-Meshes aus einem einzelnen Bild, FoundationPose für Objekt-Tracking, VolumetricSMPL für ein Signed-Distance-Körpermodell. CoCoNet — der Teil, den NVIDIA tatsächlich veröffentlicht — sitzt in der Mitte und übernimmt das Kontakt-Reasoning. Es rendert die aktuelle Schätzung von Mensch und Objekt in RGB, Tiefe und Masken, vergleicht dieses Rendering dann mit der realen Beobachtung mithilfe eines DINOv2 ViT-B/14 RGB-Encoders und eines ViT-S/14-Sechskanal-Encoders für XYZ und Maske, führt zwei räumlich-zeitliche Attention-Blöcke aus und regressiert Pro-Frame-Korrekturen über MLP-Heads.
Die berichteten Zahlen, aus dem Paper und der eigenen Karte des Anbieters: 38 % geringerer Rekonstruktionsfehler als der Stand der Technik bei In-Distribution-Datensätzen, 36 % bei ungesehenen Datensätzen. Die Ablation, die die Architektur nachvollziehbar macht, setzt die Objekt-Chamfer-Distanz auf 1.565,42 cm von rohem NLF plus FoundationPose-Tracking, 16,85 cm nach CARI4D-Initialisierung, und 11,59 bis 11,57 cm, sobald CoCoNet-Verfeinerung und die vollständige gemeinsame Optimierung aktiviert sind. Das sind Anbieterangaben aus einem peer-reviewten Paper – bessere Provenienz als eine Marketingseite, aber immer noch keine unabhängige Reproduktion, und kein Dritter hat eine veröffentlicht.
Die kommerzielle Modellkarte fügt ein Detail hinzu, das das Paper nicht liefern konnte: Das Modell wurde auf FORM-HOI trainiert, beschrieben als 2.126 interne Sequenzen, und die Karte sagt unmissverständlich, dass es keinen separaten Testdatensatz gibt — die Evaluierung ist ein qualitatives Demo-Set. Sie merkt außerdem an, dass das interne Trainingskorpus „Daniel“ nicht weitergegeben wird. Zusammen gelesen ergibt das einen Anbieter, der Ihnen sagt, dass die Trainingsverteilung seine ist und die Generalisierungsbelege dünner sind, als die Ablationstabelle vermuten lässt.
Was die Lizenz tatsächlich gewährt, und was nicht
Die NVIDIA Open Model Agreement ist eine permissive kommerzielle Lizenz, aber „kommerzielle Nutzung erlaubt“ ist nicht dasselbe wie „keine Verpflichtungen“. Die Model Card führt das Modell als vorgesehen für Entwickler und Forscher auf, die kommerzielle oder nichtkommerzielle Vision-Systeme für 3D-/4D-Posenschätzung von Mensch und Objekt, Bewegungsanalyse, Visualisierung, Datenkuratierung und Robotik-Wahrnehmung entwickeln, und schließt direkte autonome Aktuierung oder lebenskritische Entscheidungen ausdrücklich aus.

Zwei praktische Hinweise für alle, die das bewerten. Erstens ist das Repository zugangsbeschränkt: Man akzeptiert Bedingungen und teilt Kontaktdaten mit, bevor die Dateien erscheinen, sodass Beschaffungs- und Rechtsprüfung vor dem Download stattfinden, nicht danach. Zweitens ist das bereitgestellte Modell nicht eigenständig lauffähig. CoCoNet hat 231 Mio. Parameter, läuft aber nicht allein – die größere Pipeline zieht weiterhin NLF-TorchScript-Gewichte, FoundationPose-Gewichte, SMPL-H-Assets, eine `kid_template.npy` heran und benötigt außerdem Hunyuan3D, um überhaupt die Objekt-Meshes zu erzeugen. Die kommerzielle Lizenz deckt den Teil ab, den NVIDIA veröffentlicht. Sie deckt nicht die Abhängigkeiten von Drittanbietern ringsum ab, und jede davon bringt ihre eigenen Bedingungen mit. Das ist die häufigste Art und Weise, wie eine Veröffentlichung wie diese ein Rechtsteam überrascht.
Was das für Menschen bedeutet, die mit Modellen bauen
Um den Umfang direkt klarzustellen: CARI4D ist ein Computer-Vision-Rekonstruktionsmodell, kein Sprachmodell, und OrcaRouter stellt es nicht bereit. Nichts in diesem Artikel sollte als gegenteilige Aussage verstanden werden — das Selbsthosting mit PyTorch auf einer GPU der Ampere-Klasse, der Konfiguration, auf der es laut der Karte validiert wurde, ist heute die einzige Möglichkeit, es auszuführen.
Der Grund, warum es hier trotzdem einen Absatz verdient, ist, dass die Karten Datenkuratierung als primären vorgesehenen Anwendungsfall nennen, und genau das ist der Teil einer 4D-Pipeline, in dem Sprachmodelle tatsächlich leben. Einen Datensatz für Mensch-Objekt-Interaktionen aufzubauen bedeutet, Clips zu beschriften, Kontaktereignisse zu labeln, QC-Prompts zu schreiben und Fehlschläge herauszufiltern — Arbeit, die über Vision-Language- und Sprachmodelle läuft, und Arbeit, die schlecht skaliert, wenn jede einzelne ein separater Vertrag und ein separater Schlüssel ist. Mehr als 200 Modelle hinter einer einzigen API bei OrcaRouter zu routen, wobei der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird und automatisches Failover, wenn ein Anbieter schlechter wird, ist genau das, wie diese Ebene aussieht, wenn sie nicht maßgeschneidert ist. Preissenkungen der Anbieter erreichen den Endpunkt noch am selben Tag, weil es keinen Aufschlag gibt, der neu hergeleitet werden müsste. Das ist eine andere Aufgabe als die, die CARI4D erledigt, und es ist die Aufgabe, die sie umgibt.
Was würde diese Lesart ändern?
Vier Dinge. Eine NVIDIA-Ankündigung würde ein ruhiges Repository in ein unterstütztes Produkt verwandeln, und damit kämen die Preis- und Supportbedingungen, die derzeit fehlen. Eine veröffentlichte Evaluierung auf einem Datensatz, den NVIDIA nicht erstellt hat, würde die Generalisierungsfrage klären, die die Karte offen lässt. Eine Dokumentation darüber, was MHR im Verhältnis zu SMPL ändert, würde bestehenden CARI4D-Integratoren sagen, wie teuer die Migration tatsächlich ist — derzeit nennt die Karte das Rig, ohne das Delta zu erklären. Und eine Entscheidung über die Drittanbieter-Abhängigkeiten würde klären, ob „kommerziell lizenziert“ bedeutet, was ein Beschaffungsteam annehmen wird.
Bis dahin ist die korrekte Beschreibung eng gefasst und wenig glamourös, und sie ist die, die durch die Belege gestützt wird: Die CARI4D-Reihe von NVIDIA verfügt seit dem 30. August 2026 über einen kommerziell lizenzierten, größeren, länger trainierten Checkpoint, und der Anbieter hat kein Wort darüber verloren. Wenn Sie 4D-Mensch-Objekt-Interaktion in metrischem Maßstab benötigen und dies als reine Forschungsangelegenheit abgetan hatten, ist der Blocker, den Sie umgangen haben, verschwunden.
