
CARI4D vs ABot-Earth 0.7: Twee 4D-modellen die nooit met elkaar concurreren
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Als je zocht naar CARI4D tegen ABot-Earth 0.7 in de verwachting van een directe vergelijking, dan is het eerlijke antwoord dat zo'n vergelijking niet bestaat en er ook geen komt. Deze twee systemen doen niet hetzelfde werk, nemen niet dezelfde input, leveren niet dezelfde output, en zouden door niemand die een van beide begrijpt ooit tegen elkaar worden gebenchmarkt. CARI4D is NVIDIA's categorie-agnostische 4D-reconstructie van mens-objectinteractie — het kijkt naar één persoon die één object hanteert in een gewone video en herstelt diens poses op metrische schaal in de loop van de tijd. ABot-Earth 0.7 is het 3D-native stedelijke wereldmodel van Amap — het neemt een satellietbeeld of een tekstprompt en genereert een verkennbare stad op kilometerschaal als een Gaussian-splatting-scène. De reden dat deze pagina toch bestaat, is dat de as die hen scheidt echt nuttig is, en de twee verschillen veel meer in wat je kunt doen met hen dan in wat ze lijken te zijn.
Er is ook een tweede, scherpere reden. Deze twee releases staan aan tegenovergestelde uiteinden van een spectrum dat meer ertoe doet dan welke specificatieregel dan ook: de ene kun je vanmiddag downloaden en draaien, en de andere kun je helemaal niet draaien.
Het antwoord dat niemand die deze zoekopdracht zoekt wil
Beide worden beschreven als 4D. Beide zijn afkomstig van grote leveranciers. Beide zijn in het afgelopen jaar uitgebracht. Dat is ongeveer waar de overlap ophoudt.
CARI4D reconstrueert. Gegeven een video schat het wat er was. Het artikel — Category Agnostic 4D Reconstruction of Human-Object Interaction van Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll en Stan Birchfield — verscheen in december 2025 op arXiv als 2512.11988 en werd geaccepteerd op CVPR 2026. Het onderwerp is een mens en een star object in contact, en de kernclaim is schaal: metrische afmetingen herstellen met een monoculaire camera zonder dieptesensor en zonder multi-view-opstelling, en dat is precies het onderdeel waar eerder werk moeite mee had.
ABot-Earth 0.7 genereert. Gegeven een georeferentieerde satellietafbeelding of een tekstbeschrijving, produceert het een scène die niet eerder als data bestond. Amap, het Chinese bedrijf voor kaarten en navigatie, onthulde het op 10 september 2026 tijdens zijn Street Stars-gala in Hangzhou, als opvolger van ABot-Earth 0.5 van 8 juni. Het levert 3D Gaussian splats op, exporteert naar Unreal Engine en Unity, en bestrijkt volgens Amap meer dan 196 landen en regio's, tegen meer dan 190 in 0.5.
De een is een schatter. De ander is een generator. Dat onderscheid doet meer werk dan welke benchmarktabel dan ook zou kunnen.
Een persoon en een stoel, of een stad
Het schaalverschil is degene die mensen onderschatten. CARI4D's eenheid van interesse is een menselijk lichaam en een object in de hand, gemeten in centimeters, gevolgd over de frames van één clip. ABot-Earth 0.7's eenheid van interesse is een vierkante kilometer stad, gegenereerd in ongeveer tien minuten op één enkele consumenten-GPU volgens Amap's eigen verklaring.
• Invoer — CARI4D een monoculaire RGB-video, MP4 vs. ABot-Earth 0.7 een satellietafbeelding of een tekstprompt
• Uitvoer — CARI4D per-frame menselijke pose en vorm, objectrotatie en -translatie, en twee handcontact-logits versus ABot-Earth 0.7, een 3D Gaussian splatting-scène, exporteerbaar naar Unreal Engine en Unity
• Analyse-eenheid — CARI4D: één mens en één star object in contact versus ABot-Earth 0.7: terrein, gebouwen, vegetatie en oriëntatiepunten op stadsniveau
• Temporele claim — CARI4D reconstrueert waargenomen beweging frame voor frame, tegenover ABot-Earth 0.7, dat gepositioneerd is als een wereldmodel met een voorspellingslaag voor wat er daarna gebeurt
• Metrische schaal — CARI4D-metrische schaal herwonnen uit monoscopische video via UniDepth en een van grof naar fijn schaalzoekproces vs ABot-Earth 0.7 georefereerd vanuit een satellietbeeld, geen metrisch-herstelprobleem
• Kosten per run — CARI4D PyTorch op een NVIDIA Ampere-GPU, gevalideerd op A100, 38 uur op 8×A100 voor de trainingsrun van het onderzoek, tegenover ABot-Earth 0.7 ongeveer tien minuten per km² op één consumenten-GPU, volgens Amaps eigen vergelijking

Merk op dat geen van beide kolommen op een enkele rij beter is dan de andere. Ze meten verschillende werelden. Een model dat het contactpunt tussen een hand en een gasfles bepaalt, wordt niet beter door ook te weten waar de gebouwen staan, en een model dat een plausibele skyline genereert, wordt niet beter door de exacte polshoek van een voetganger te kennen.
De asymmetrie die de doorslag geeft
Dit is het verschil dat een koper binnen het eerste uur zal voelen, en het heeft niets met capaciteit te maken.
CARI4D heeft code en gewichten die je vandaag kunt verkrijgen. De NVlabs-repository bevat de officiële implementatie, uitgebracht op 28 februari 2026, met trainingscode en preprocessing voor aangepaste video's toegevoegd op 4 april. Het vooraf getrainde CoCoNet-checkpoint is te downloaden van Hugging Face, de Docker-image xiexh20/cari4d is gepubliceerd, en sinds 30 augustus 2026 is een commercieel gelicentieerd checkpoint van 231M beschikbaar als nvidia/cari4d_commercialonder de NVIDIA Open Model Agreement — met toegangsbeperking, maar verkrijgbaar. De afhankelijkheden zijn gedocumenteerd, inclusief de lastige onderdelen: NLF torchscript-gewichten, FoundationPose-gewichten, SMPL-H-assets, een kid_template.npy van AGORA, en Hunyuan3D voor de object-meshes. Je kunt inference uitvoeren op de BEHAVE-demo, op een meegeleverde in-the-wild clip, of op je eigen video, en deze evalueren met de meegeleverde scripts.

ABot-Earth 0.7 is op geen van die manieren beschikbaar. Amap heeft geen modelgewichten, geen modelkaart, geen publieke API, geen prijsstelling en geen ontwikkelaarsdocumentatie gepubliceerd. De experiencesite is live, maar Amap beschrijft generatie als alleen op uitnodiging of via een whitelist, de interface is alleen in Vereenvoudigd Chinees, en de GitHub-repository uit het 0.5-tijdperk bevatte naar verluidt een technisch rapport en niets uitvoerbaars. Elk getal in de koppen — tien minuten per vierkante kilometer, ruwweg 1.000× de efficiëntie van traditionele reconstructie, ongeveer een honderdste van de kosten, meer dan 196 landen — is terug te voeren op Amap en is door niemand buiten Amap onafhankelijk gereproduceerd. Dat zijn door de leverancier gerapporteerde cijfers, en momenteel is er geen enkele weg waarlangs ze iets anders zouden kunnen worden.
Dus de praktische vergelijking is niet "welk model is beter." Het is dat een van deze een onderzoeksartefact is met een commerciële licentie en een Docker-image, en de andere een productdemonstratie met een perscyclus. Het zijn allebei legitieme prestaties. Slechts één ervan is iets wat je in een build kunt opnemen.
Waar de twee elkaar werkelijk zouden ontmoeten
Er is hier sprake van een echte compositie, en het is de moeite waard daar concreet over te zijn, want het is de enige zin waarin deze in hetzelfde gesprek thuishoren.
De output van CARI4D is mens-objectinteractie in een metrisch wereldkader. De output van ABot-Earth 0.7 is een omgeving. Vul de tweede met de eerste en je krijgt iets dat geen van beide alleen produceert: een gegenereerde stad waarin mensen dingen doen die fysiek gemeten zijn in plaats van artistiek geplaatst. Robotica-simulatie, winkelindelingsplanning en het genereren van interactiedatasets willen allemaal precies die combinatie — een omgeving die goedkoop genoeg is om opnieuw te genereren en menselijke beweging die nauwkeurig genoeg is om op te trainen.

De naad tussen beide is een coördinatentransformatie en een schaalconventie, en die is niet triviaal, omdat het metrische frame van CARI4D is gedefinieerd ten opzichte van één enkele camera en dat van ABot-Earth 0.7 wordt gedefinieerd door geolocatie. Niemand heeft die integratie gepubliceerd. Het is het soort ding dat een team in een week bouwt en niet documenteert.
De stap die in die pipeline wordt vergeten, is het deel dat ruwe interactiedata omzet in iets wat bevraagbaar is — het genereren van captions voor clips, het taggen van contactgebeurtenissen, het bouwen van retrieval-indexen en kwaliteitscontrolefilters over de output. Dat werk verloopt via vision-language- en taalmodellen, en het is de laag die OrcaRouter dekt: meer dan 200 modellen achter één API, de lijstprijs van de provider doorgegeven tegen 0% opslag, automatische failover wanneer een provider degradeert, en een routing-DSL die meerdere modellen in één aanroep samenbrengt, zodat de captioning en de QC-pass geen aparte integraties hoeven te zijn. Noch CARI4D noch ABot-Earth 0.7 wordt daar aangeboden, en geen van beide is een LLM — maar de tooling waarmee je ze omringt is dat vrijwel zeker wel.
Welke je eigenlijk wilt
Kies CARI4D als je video hebt van een persoon die met een object interacteert en je hun poses nodig hebt, in metrische eenheden, frame voor frame — voor bewegingsanalyse, roboticaperceptie, animatiereferentie of het bouwen van een interactiedataset. Het is nu beschikbaar, het is gedocumenteerd, en de commerciële licentie is op 30 augustus 2026 verschenen. Reserveer budget voor de afhankelijkheidsketen, en lees de licentievoorwaarden voor de onderdelen die NVIDIA niet bezit.
Kies ABot-Earth 0.7 als je omgevingen nodig hebt in plaats van actoren — stadsbrede scènes die snel worden gegenereerd op basis van een locatie of een beschrijving en die naar een game-engine kunnen worden geëxporteerd. Besef dat je een gedemonstreerde capaciteit beoordeelt in plaats van een tool te adopteren, dat toegang naar goeddunken wordt verleend, en dat de efficiëntiecijfers van Amap zelf afkomstig zijn.
Kies beide alleen als je het hierboven beschreven samengestelde systeem bouwt, en begin eraan in de wetenschap dat je de naad zelf zult schrijven.
De vraag die het waard is om te stellen is niet welke van deze twee wint. Het is of het ding dat je daadwerkelijk aan het bouwen bent een reconstructiemodel, een generatiemodel, of geen van beide nodig heeft — en op die vraag overlappen deze twee antwoorden elkaar nooit.
