Une carte hero générée intitulée « CARI4D vs ABot-Earth 0.7 » avec pour sous-titre « Deux modèles 4D qui ne sont jamais en concurrence — l'un reconstruit, l'autre génère » ; deux panneaux séparés par un fin séparateur « vs », celui de gauche étiqueté « CARI4D » avec la légende « Reconstruit une personne manipulant un objet, à l'échelle métrique, à partir d'une vidéo ordinaire » et une main en fil de fer tenant un cube en fil de fer, celui de droite étiqueté « ABot-Earth 0.7 » avec la légende « Génère un kilomètre de ville 3D explorable à partir d'une seule image satellite » et une ligne d'horizon urbaine en fil de fer ; et une bande de bannière indiquant « Un seul de ces modèles peut être téléchargé et exécuté aujourd'hui ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

CARI4D vs ABot-Earth 0.7 : deux modèles 4D qui ne sont jamais en concurrence

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si vous avez cherché CARI4D contre ABot-Earth 0.7 en vous attendant à un duel, la réponse honnête est qu'aucune comparaison de ce genre n'existe et qu'aucune n'est à venir. Ces deux systèmes ne font pas le même travail, ne prennent pas les mêmes entrées, ne produisent pas la même chose, et ne seraient jamais mis en regard l'un de l'autre par quiconque comprendrait ne serait-ce que l'un des deux. CARI4D est la reconstruction 4D d'interactions humain-objet, indépendante de la catégorie, signée NVIDIA — il observe une personne manipulant un objet dans une vidéo ordinaire et restitue leurs poses à l'échelle métrique au fil du temps. ABot-Earth 0.7 est le modèle de monde urbain 3D natif d'Amap — il prend une image satellite ou une invite textuelle et génère une ville explorable à l'échelle du kilomètre sous forme de scène Gaussian splatting. Si cette page existe malgré tout, c'est parce que l'axe qui les sépare est réellement utile, et que tous deux diffèrent bien davantage par ce que vous pouvez faire avec eux que par ce qu'ils paraissent être.

Il y a aussi une seconde raison, plus incisive. Ces deux versions se situent aux extrémités opposées d’un spectre qui compte davantage que n’importe quelle ligne de spécifications : l’une d’elles peut être téléchargée et exécutée cet après-midi, tandis que l’autre ne peut pas être exécutée du tout.

La réponse que personne cherchant cette requête ne veut

Tous deux sont décrits comme 4D. Tous deux viennent de grands fournisseurs. Tous deux sont sortis au cours de l’année écoulée. C’est à peu près là que s’arrêtent les points communs.

CARI4D reconstruit. À partir d'une vidéo, il estime ce qui s'y trouvait. L'article — Reconstruction 4D agnostique quant à la catégorie de l'interaction humain-objet par Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll et Stan Birchfield — est paru sur arXiv sous la référence 2512.11988 en décembre 2025 et a été accepté à CVPR 2026. Son sujet est un humain et un objet rigide en contact, et son affirmation centrale porte sur l'échelle : récupérer des dimensions métriques à partir d'une caméra monoculaire sans capteur de profondeur ni dispositif multivue, ce qui est la partie qui a posé problème aux travaux antérieurs.

ABot-Earth 0.7 génère. À partir d’une image satellite géoréférencée ou d’une description textuelle, il produit une scène qui n’existait pas en tant que données auparavant. Amap, la société chinoise de cartographie et de navigation, l’a dévoilé le 10 septembre 2026 lors de son gala Street Stars à Hangzhou, succédant à ABot-Earth 0.5 du 8 juin. Il produit des splats gaussiens 3D, s’exporte vers Unreal Engine et Unity, et couvre, selon Amap, plus de 196 pays et régions, contre plus de 190 dans la version 0.5.

L’un est un estimateur. L’autre est un générateur. Cette distinction fait plus de travail que n’importe quel tableau de benchmarks ne saurait le faire.

Une personne et une chaise, ou une ville

L’écart d’échelle est celui que les gens sous-estiment. L’unité d’intérêt de CARI4D est un corps humain et un objet tenu à la main, mesurés en centimètres, suivis à travers les images d’un seul clip. L’unité d’intérêt d’ABot-Earth 0.7 est un kilomètre carré de ville, généré en une dizaine de minutes environ sur un seul GPU grand public, de l’aveu même d’Amap.

• Entrée — CARI4D une vidéo RVB monoculaire, MP4 vs ABot-Earth 0.7 une image satellite ou un prompt textuel

• Sortie — CARI4D : pose et forme humaines image par image, rotation et translation des objets, et deux logits de contact des mains, contre ABot-Earth 0.7, une scène de splatting gaussien 3D, exportable vers Unreal Engine et Unity

• Unité d’analyse — CARI4D : un humain et un objet rigide en contact vs ABot-Earth 0.7 : terrain, bâtiments, végétation et repères à l’échelle de la ville

• Affirmation temporelle — CARI4D reconstruit le mouvement observé image par image, tandis qu'ABot-Earth 0.7 est présenté comme un modèle du monde doté d'une couche de prédiction pour ce qui se produit ensuite

• Échelle métrique — échelle métrique CARI4D récupérée à partir d’une vidéo monoculaire via UniDepth et une recherche d’échelle coarse-to-fine par rapport à ABot-Earth 0.7 géoréférencé depuis une image satellite, sans problème de récupération métrique

• Coût d'exécution — CARI4D PyTorch sur un GPU NVIDIA Ampere, validé sur A100, 38 heures sur 8×A100 pour l'exécution d'entraînement de recherche, contre ABot-Earth 0.7 environ dix minutes par km² sur un GPU grand public, selon la propre comparaison d'Amap

A generated two-column scoreboard titled 'CARI4D vs ABot-Earth 0.7 — the scoreboard'. The CARI4D column lists Task: Reconstructs; Input: Monocular RGB video; Output: Human and object poses, contact logits; Unit of scale: One person, one object; Weights: Downloadable, gated; Evidence: CVPR 2026, vendor-reported. The ABot-Earth 0.7 column lists Task: Generates; Input: Satellite image or text prompt; Output: 3D Gaussian splatting city; Unit of scale: One square kilometre; Weights: None published; Evidence: Vendor-reported, unreproduced. A footer reads 'CARI4D weights are downloadable today; ABot-Earth 0.7 figures are Amap's own, unaudited.' The OrcaRouter logo is composited in the bottom-right corner.

Remarquez qu'aucune des deux colonnes n'est meilleure que l'autre sur une seule ligne. Elles mesurent des mondes différents. Un modèle qui retrouve le point de contact entre une main et une bouteille de gaz n'est pas amélioré par le fait de savoir aussi où se trouvent les bâtiments, et un modèle qui génère une ligne d'horizon plausible n'est pas amélioré par la connaissance de l'angle exact du poignet d'un piéton.

L'asymétrie qui décide réellement

Voici la différence qu’un acheteur ressentira dès la première heure, et elle n’a rien à voir avec la capacité.

CARI4D dispose d'un code et de poids que vous pouvez obtenir dès aujourd'hui. Le dépôt NVlabs contient l'implémentation officielle, publiée le 28 février 2026, avec le code d'entraînement et le prétraitement des vidéos personnalisées ajoutés le 4 avril. Le point de contrôle CoCoNet pré-entraîné se télécharge depuis Hugging Face, l'image Docker xiexh20/cari4d est publiée, et depuis le 30 août 2026, un point de contrôle de 231 M sous licence commerciale est disponible sous le nom nvidia/cari4d_commercial en vertu du NVIDIA Open Model Agreement — à accès restreint, mais obtainable. Les dépendances sont documentées, y compris les aspects délicats : les poids torchscript NLF, les poids FoundationPose, les ressources SMPL-H, un kid_template.npy provenant d'AGORA, et Hunyuan3D pour les maillages d'objets. Vous pouvez exécuter l'inférence sur la démo BEHAVE, sur un clip in-the-wild fourni, ou sur votre propre vidéo, et l'évaluer avec les scripts fournis.

A screenshot of the nvidia/CARI4D model page on Hugging Face, captured September 18 2026, showing the arXiv:2512.11988 tag, the heading 'Model Card - CARI4D', the description of the CoCoNet model and the line 'This model is for research and development only', governing terms listing the NVIDIA License alongside a DINOv2 licence link, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

ABot-Earth 0.7 ne peut être obtenu dans aucun de ces sens. Amap n’a publié ni poids de modèle, ni fiche de modèle, ni API publique, ni tarification, ni documentation pour développeurs. Le site d’expérimentation est en ligne, mais Amap décrit la génération comme réservée sur invitation ou sur liste blanche, l’interface est uniquement en chinois simplifié, et le dépôt GitHub de l’époque 0.5 ne contenait, selon les informations rapportées, qu’un rapport technique et rien d’exécutable. Tous les chiffres phares — dix minutes par kilomètre carré, environ 1 000 fois l’efficacité de la reconstruction traditionnelle, environ un centième du coût, plus de 196 pays — proviennent d’Amap et n’ont été reproduits de manière indépendante par personne en dehors d’Amap. Ce sont des chiffres déclarés par le fournisseur, et il n’existe actuellement aucune voie par laquelle ils pourraient devenir autre chose.

Donc la comparaison pratique n'est pas « quel modèle est meilleur ». C'est que l'un d'eux est un artefact de recherche avec une licence commerciale et une image Docker, et l'autre est une démonstration de produit avec un cycle de presse. Les deux sont des réalisations légitimes. Un seul est quelque chose que vous pouvez mettre dans un build.

Là où les deux se rencontreraient véritablement

Il y a ici une véritable composition, et il vaut la peine d’être concret à ce sujet, car c’est le seul sens dans lequel ces éléments appartiennent à la même conversation.

La sortie de CARI4D est une interaction humain-objet dans un repère mondial métrique. La sortie d'ABot-Earth 0.7 est un environnement. Peuplez le second avec la première et vous obtenez quelque chose qu'aucun des deux ne produit seul : une ville générée dans laquelle des personnes font des choses qui sont mesurées physiquement plutôt que placées artistiquement. La simulation robotique, la planification d'agencement commercial et la génération de jeux de données d'interaction veulent exactement cette combinaison — un environnement assez peu coûteux à régénérer et un mouvement humain assez précis pour servir de base d'entraînement.

A screenshot of the OrcaRouter Models page, captured September 18 2026, headed 'Models' with the subheading '200 models · 16 providers · one API key, one bill', showing the OpenAI-compatible POST endpoint in a 'How to call any model' panel, modality tabs reading Text 165, Image 10, Embeddings 5, Video 10 and TTS 10, prepaid credit plans from USD 50 to USD 1000 per month, and model cards including Orca: OrcaCyber Zero 1.0, Orca: OrcaVerify Text 1.0, DeepSeek V4.1 Flash, OpenAI GPT-6 Astra, Google Gemini 3.8 Flash and Qwen3.8 Max.

Le raccord entre les deux est une transformation de coordonnées et une convention d’échelle, et il n’est pas trivial, car le référentiel métrique de CARI4D est défini relativement à une caméra unique et celui d’ABot-Earth 0.7 est défini par géolocalisation. Personne n’a publié cette intégration. C’est le genre de chose qu’une équipe construit en une semaine et ne documente pas.

L'étape que l'on oublie dans ce pipeline est la partie qui transforme des données d'interaction brutes en quelque chose d'interrogeable — légender des clips, étiqueter des événements de contact, construire des index de recherche et des filtres de contrôle qualité sur la sortie. Ce travail passe par des modèles vision-langage et des modèles de langage, et c'est la couche que couvre OrcaRouter : plus de 200 modèles derrière une seule API, le prix catalogue du fournisseur répercuté à 0 % de marge, basculement automatique lorsqu'un fournisseur se dégrade, et un DSL de routage qui compose plusieurs modèles en un seul appel afin que le légendage et la passe de contrôle qualité n'aient pas à être des intégrations séparées. Ni CARI4D ni ABot-Earth 0.7 n'y sont servis, et aucun des deux n'est un LLM — mais l'outillage dont vous les entourez l'est presque certainement.

Lequel tu veux vraiment ?

Choisissez CARI4D si vous disposez d’une vidéo d’une personne interagissant avec un objet et que vous avez besoin de ses poses, en unités métriques, image par image — pour l’analyse du mouvement, la perception en robotique, une référence d’animation ou la constitution d’un jeu de données d’interaction. Il est disponible dès maintenant, il est documenté, et la licence commerciale est arrivée le 30 août 2026. Prévoyez un budget pour la chaîne de dépendances, et lisez les conditions de licence relatives aux parties que NVIDIA ne détient pas.

Choisissez ABot-Earth 0.7 si vous avez besoin d'environnements plutôt que d'acteurs — des scènes à l'échelle d'une ville générées à partir d'un lieu ou d'une description, rapidement, exportables dans un moteur de jeu. Comprenez que vous évaluez une capacité démontrée plutôt que d'adopter un outil, que l'accès est discrétionnaire et que les chiffres d'efficacité sont ceux d'Amap.

Ne choisissez les deux que si vous construisez le système composé décrit ci-dessus, et allez-y en sachant que vous écrirez la couture vous-même.

La question qui vaut la peine d’être posée n’est pas de savoir laquelle de ces deux l’emporte. C’est de savoir si ce que vous êtes réellement en train de construire a besoin d’un modèle de reconstruction, d’un modèle de génération, ou ni de l’un ni de l’autre — et sur cette question, ces deux réponses ne se recoupent jamais.