Carte de héros générée intitulée « CARI4D est passé au commercial — discrètement », avec un badge portant la mention « SORTIE NON ANNONCÉE » ; le sous-titre « NVIDIA a ouvert son modèle d'interaction humain-objet en 4D le 30 août 2026. Sans aucune annonce. » ; trois cartes indiquant « Licence : NVIDIA Open Model Agreement », « Point de contrôle : 231 M de paramètres, étape 200 000 » et « Accès : soumis à autorisation sur Hugging Face » ; une bande de pied de page indiquant « La ligne de recherche : arXiv déc. 2025, code févr. 2026 » ; et une silhouette humaine en fil de fer soulevant une boîte en fil de fer. Le logo OrcaRouter est intégré dans le coin inférieur droit.
Engineering & Research

CARI4D Commercial : NVIDIA a ouvert son modèle d'interaction 4D aux entreprises, discrètement

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Vers le 30 août 2026 environ, un dépôt à accès restreint appelé nvidia/cari4d_commercial est apparu sur Hugging Face. Sa fiche de modèle décrit un point de contrôle que le fournisseur appelle « CARI4D CoCoNet Native Momentum Human Rig (MHR) » — un réseau de 231 millions de paramètres qui prend une vidéo MP4 ordinaire et renvoie, image par image, la pose d'un humain et d'un objet rigide qu'il manipule, ainsi que deux logits de contact main-objet. La ligne de licence indique nvidia-open-model-agreement, et la fiche précise que le modèle est prêt pour un usage commercial ou non commercial. C'est un changement notable par rapport à la vie antérieure de CARI4D. Le dépôt de recherche, nvidia/CARI4D, fournit la même famille de modèles — CoCoNet, 194 millions de paramètres — sous la licence NVIDIA avec les mots « pour la recherche et le développement uniquement » imprimés sur la fiche. C'est la différence entre un article que l'on peut lire et un composant que l'on peut livrer.

Ce qui rend ce sujet digne d'intérêt, ce n'est pas la publication. C'est le silence qui l'entoure. Il ne s'agit pas d'un lancement : NVIDIA n'a publié ni article de blog, ni entrée dans sa salle de presse, ni tableau de benchmarks, ni tarification pour cari4d_commercial, et au moment de la rédaction, le dépôt n'est accessible qu'après avoir accepté les conditions et communiqué des informations de contact. Tout ce qui suit est tiré des deux fiches de modèle et de la version publique du code. Lorsqu'une affirmation est propre à NVIDIA et n'a pas été reproduite, cet article le précise.

Qu’est-ce qui a réellement changé le 30 août ?

La tentation est de classer cela comme un changement de licence. C’est plus que cela. Lisez les deux cartes l’une par rapport à l’autre et trois choses ont bougé en même temps — la licence, la taille du point de contrôle, et le modèle de corps humain qui le sous-tend.

• Paramètres — version de recherche CARI4D 194M vs CARI4D CoCoNet MHR 231M

• Point de contrôle — step031397.pth (31 397 étapes d'entraînement) vs chaîne de version 2026-08-25-09-35-57, étape 200 000, statut « Entraînement terminé »

• Rig de corps — pose et forme SMPL / SMPL-H vs paramètres Native Momentum Human Rig (MHR)

• Licence — NVIDIA License, « recherche et développement uniquement » vs NVIDIA Open Model Agreement, utilisation commerciale autorisée

• Accès — téléchargement libre ou restreint, les conditions doivent être acceptées

• Sorties — pose SMPL mise à jour, forme, translation, rotation et translation de l'objet, contact binaire de la main vs pose d'objet par image et résidus MHR, plus deux logits de contact de la main

A single-column generated infographic titled 'CARI4D — the scoreboard', listing 'Commercial checkpoint: 231M parameters, step 200,000', 'Research checkpoint: 194M, step 31,397', 'Licence: NVIDIA Open Model Agreement, commercial use', 'Access: gated, terms must be accepted', 'Body rig: Native Momentum Human Rig (MHR)' and 'Independent score: none yet', above a footer reading 'NVIDIA figures from the vendor's own model cards; no independent reproduction.' The OrcaRouter logo is composited in the bottom-right corner.

Le nombre de pas est la ligne qui mérite que l’on s’y attarde. Un checkpoint de recherche figé à environ 31 k pas et un checkpoint de production qui a tourné jusqu’à 200 000 ne sont pas le même objet auquel on a agrafé un en-tête de licence différent. NVIDIA indique aussi que le chiffre de 231 M est « mesuré à partir de l’état du modèle au pas 84 000, en excluant les tampons enregistrés », ce qui vous dit que la fiche décrit une lignée d’entraînement plutôt qu’un artefact unique figé.

Le changement de rig corporel compte tout autant pour quiconque a déjà développé du code contre CARI4D. La ligne de recherche est entièrement basée sur SMPL — les termes d’optimisation de l’article régressent la pose, la forme et la translation SMPL, et le code dépend de fichiers pickle SMPL-H ainsi que d’un patch VolumetricSMPL. MHR est une paramétrisation différente. Si vous avez écrit du code d’intégration en fonction des tenseurs de sortie du checkpoint de recherche, la forme de sortie de la carte commerciale n’est pas directement interchangeable.

La version de recherche sur laquelle ceci est basé a huit mois.

Il est utile d’être précis au sujet de la chronologie, car l’expression « nouveau modèle » serait incorrecte ici, et l’expression « ancien modèle » le serait aussi.

L'article CARI4D — Reconstruction 4D d'interaction humain-objet indépendante de la catégorie, par Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll et Stan Birchfield — a été mis en ligne sur arXiv le 16 décembre 2025 sous la référence 2512.11988, et a été accepté pour CVPR 2026. La publication du code de NVlabs a suivi le 28 février 2026. Le code d'entraînement et le prétraitement des vidéos personnalisées ont été mis en ligne le 4 avril. Selon toute logique normale, cette ligne de recherche est un travail bien établi, vieux de huit mois, dont la liste de tâches à faire est terminée.

A screenshot of the NVlabs/CARI4D GitHub repository, captured September 18 2026, showing the README heading 'CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction', the Project Page and arXiv links, the line 'This is the official implementation of our CVPR paper CARI4D', the author list, a source file listing including learning, docker, prep, scripts and tools, and a sidebar showing Python 99.9%, 216 stars, 24 forks and no releases published.

Donc, la présentation honnête est la suivante : la méthode est de l'histoire ancienne, et l'artefact commercial a trois semaines. Si vous avez cherché CARI4D en mars et conclu qu'il s'agissait d'une curiosité de recherche avec une licence restrictive, cette conclusion était correcte à l'époque et est obsolète aujourd'hui. C'est là toute la raison pour laquelle cela a sa place dans une rubrique d'actualités.

Ce que le modèle fait réellement, et avec quelle efficacité

CARI4D reconstruit l'interaction humain-objet en 4D — trois dimensions de l'espace plus le temps — à l'échelle métrique, à partir d'une seule vidéo RGB monoculaire. Cette dernière contrainte est la plus intéressante. Récupérer l'échelle métrique d'un objet qu'une personne tient, à partir d'une caméra ordinaire, sans capteur de profondeur ni dispositif multi-vues, voilà le problème autour duquel s'articule l'article.

Le pipeline est une chaîne de modèles de fondation plutôt qu'un réseau de bout en bout : UniDepth pour la profondeur métrique, NLF et GENMO pour la pose humaine, Hunyuan3D pour les maillages d'objets à partir d'une seule image, FoundationPose pour le suivi d'objets, VolumetricSMPL pour un modèle de corps à distance signée. CoCoNet — la partie que NVIDIA publie réellement — se trouve au milieu et effectue le raisonnement de contact. Il rend l'estimation actuelle de l'humain et de l'objet en RGB, profondeur et masques, puis compare ce rendu à l'observation réelle à l'aide d'un encodeur RGB DINOv2 ViT-B/14 et d'un encodeur XYZ-et-masque à six canaux ViT-S/14, exécute deux blocs d'attention spatio-temporelle et régresse les corrections par image via des têtes MLP.

Les chiffres rapportés, issus de l'article et de la fiche technique du fournisseur : une erreur de reconstruction inférieure de 38 % à l'état de l'art sur les jeux de données en distribution, et de 36 % sur des jeux de données inédits. L'ablation qui rend l'architecture lisible situe la distance de Chamfer de l'objet à 1 565,42 cm avec le NLF brut plus le suivi FoundationPose, à 16,85 cm après l'initialisation CARI4D, et à 11,59 à 11,57 cm une fois l'affinage CoCoNet et l'optimisation conjointe complète activés. Ce sont des chiffres du fournisseur tirés d'un article évalué par les pairs — une provenance meilleure qu'une page marketing, mais qui n'est toujours pas une reproduction indépendante, et aucun tiers n'en a publié.

La fiche commerciale ajoute un détail que l'article ne pouvait pas fournir : le modèle a été entraîné sur FORM-HOI, décrit comme 2 126 séquences internes, et la fiche indique sans détour qu'il n'existe pas de jeu de données de test distinct — l'évaluation repose sur un ensemble de démonstration qualitatif. Elle note aussi que le corpus d'entraînement interne « Daniel » n'est pas distribué. Lus ensemble, cela revient à un fournisseur qui vous dit que la distribution d'entraînement lui appartient et que les preuves de généralisation sont plus minces que ne le suggère le tableau d'ablation.

Ce que la licence accorde réellement, et ce qu’elle n’accorde pas

L’accord NVIDIA Open Model est une licence commerciale permissive, mais « utilisation commerciale autorisée » n’est pas synonyme d’« aucune obligation ». La fiche indique que le modèle est destiné aux développeurs et aux chercheurs qui construisent des systèmes de vision commerciaux ou non commerciaux pour l’estimation de pose humain-objet en 3D/4D, l’analyse du mouvement, la visualisation, la curation de données et la perception robotique, et exclut explicitement l’actionnement autonome direct ou les décisions critiques pour la vie.

A screenshot of the nvidia/cari4d_commercial model page on Hugging Face, captured September 18 2026, showing the licence tag 'nvidia-open-model-agreement', the gate notice reading 'You need to agree to share your contact information to access this model', the heading 'CARI4D CoCoNet Native MHR Overview', the description stating the model 'is ready for commercial or non-commercial use', the governing terms naming the NVIDIA Open Model Agreement, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

Deux remarques pratiques pour quiconque évalue cela. Premièrement, le dépôt est soumis à conditions : vous acceptez des conditions et communiquez des informations de contact avant que les fichiers n'apparaissent, de sorte que l'examen des achats et l'examen juridique ont lieu avant le téléchargement, et non après. Deuxièmement, le modèle déployé n'est pas autonome. CoCoNet compte 231 M de paramètres, mais il ne fonctionne pas seul — le pipeline global va encore chercher des poids torchscript de NLF, des poids FoundationPose, des ressources SMPL-H, un `kid_template.npy`, et il a toujours besoin de Hunyuan3D pour produire les maillages d'objets au départ. La licence commerciale couvre la partie que NVIDIA publie. Elle ne couvre pas les dépendances tierces qui l'entourent, et chacune d'elles a ses propres conditions. C'est la façon la plus courante dont une publication comme celle-ci surprend une équipe juridique.

Ce que cela implique pour les personnes qui construisent avec des modèles

Pour être direct sur le périmètre : CARI4D est un modèle de reconstruction en vision par ordinateur, pas un modèle de langage, et OrcaRouter ne le sert pas. Rien dans cet article ne doit être interprété comme affirmant le contraire — l'auto-héberger avec PyTorch sur un GPU de classe Ampere, qui est la configuration sur laquelle la fiche indique qu'il a été validé, est aujourd'hui la seule façon de l'exécuter.

La raison pour laquelle cela vaut encore un paragraphe ici est que la fiche mentionne la curation de données comme utilisation principale prévue, et c'est la partie d'un pipeline 4D où les modèles de langage vivent réellement. Construire un jeu de données d'interaction humain-objet implique de légender des clips, d'étiqueter des événements de contact, de rédiger des invites de contrôle qualité et de filtrer les échecs — un travail qui passe par des modèles vision-langage et de langage, et un travail qui passe mal à l'échelle si chacun est un contrat séparé et une clé séparée. Router plus de 200 modèles derrière une API unique chez OrcaRouter, avec le prix catalogue du fournisseur répercuté à 0 % de marge et un basculement automatique en cas de dégradation d'un fournisseur, voilà à quoi ressemble cette couche lorsqu'elle n'est pas sur mesure. Les baisses de prix des fournisseurs atteignent le point de terminaison le jour même, car il n'y a pas de marge à recalculer. C'est un travail différent de ce que fait CARI4D, et c'est le travail qui l'entoure.

Qu'est-ce qui changerait cette lecture ?

Quatre points. Une annonce de NVIDIA transformerait un dépôt peu actif en un produit pris en charge, et avec elle viendraient les conditions tarifaires et de support qui sont actuellement absentes. Une évaluation publiée sur un jeu de données que NVIDIA n’a pas construit trancherait la question de la généralisation que la fiche laisse en suspens. Une documentation sur ce que MHR change par rapport à SMPL indiquerait aux intégrateurs CARI4D existants combien la migration coûte réellement — pour l’instant, la fiche nomme le rig sans expliquer le delta. Et une décision sur les dépendances tierces déterminerait si « sous licence commerciale » signifie ce qu’une équipe achats supposera que cela signifie.

D’ici là, la description correcte est étroite et peu reluisante, et c’est celle que les preuves étayent : la gamme CARI4D de NVIDIA dispose depuis le 30 août 2026 d’un checkpoint plus grand, entraîné plus longtemps et sous licence commerciale, et le fournisseur n’en a pas dit un mot. Si vous avez besoin d’interaction 4D humain-objet à l’échelle métrique et que vous l’aviez écartée en la considérant comme réservée à la recherche, l’obstacle que vous cherchiez à contourner a disparu.