
CARI4D vs ABot-Earth 0.7: Två 4D-modeller som aldrig konkurrerar
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Om du sökte efter CARI4D mot ABot-Earth 0.7 i hopp om en direkt jämförelse är det ärliga svaret att någon sådan jämförelse inte finns och inte heller är på väg. Dessa två system gör inte samma sak, tar inte samma indata, ger inte samma utdata, och skulle aldrig ställas mot varandra i en benchmark av någon som förstod sig på endera. CARI4D är NVIDIAs kategorioberoende 4D-rekonstruktion av interaktion mellan människa och objekt — den betraktar en person som hanterar ett objekt i en vanlig video och återvinner deras poser i metrisk skala över tid. ABot-Earth 0.7 är Amaps 3D-native urbana världsmodell — den tar en satellitbild eller en textprompt och genererar en kilometerstor, utforskningsbar stad som en Gaussian-splatting-scen. Anledningen till att den här sidan ändå finns är att axeln som skiljer dem åt är genuint användbar, och de två skiljer sig mycket mer i vad du kan göra med dem än i vad de verkar vara.
Det finns också en andra, skarpare anledning. Dessa två utgåvor befinner sig i motsatta ändar av ett spektrum som spelar större roll än någon specifikationsrad: en av dem kan du ladda ner och köra redan i eftermiddag, och den andra kan du inte köra alls.
Svaret som ingen som söker på den här frågan vill ha
Båda beskrivs som 4D. Båda kommer från stora leverantörer. Båda släpptes under det senaste året. Det är ungefär där överlappningen upphör.
CARI4D rekonstruerar. Givet video uppskattar den vad som fanns där. Artikeln — Kategoriagnostisk 4D-rekonstruktion av människa-objekt-interaktion av Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll och Stan Birchfield — publicerades på arXiv som 2512.11988 i december 2025 och antogs till CVPR 2026. Dess ämne är en människa och ett stelt objekt i kontakt, och dess kärnpåstående är skala: att återvinna metriska dimensioner från en monokulär kamera utan djupavkännare och utan multi-view-rigg, vilket är den del som tidigare arbeten hade svårt med.
ABot-Earth 0.7 genererar. Givet en georefererad satellitbild eller en textbeskrivning skapar den en scen som inte tidigare fanns som data. Amap, det kinesiska kart- och navigationsföretaget, avtäckte den 10 september 2026 på sin Street Stars-gala i Hangzhou, som efterträdare till ABot-Earth 0.5 från 8 juni. Den producerar 3D-gaussiska splats, exporterar till Unreal Engine och Unity och täcker vad Amap säger är fler än 196 länder och regioner, upp från fler än 190 i 0.5.
Den ena är en estimator. Den andra är en generator. Den distinktionen uträttar mer än någon benchmarktabell skulle kunna.
En person och en stol, eller en stad
Skalglappet är det som folk underskattar. Den enhet CARI4D intresserar sig för är en människokropp och ett handhållet föremål, uppmätta i centimeter och följda över bildrutorna i ett enda klipp. Den enhet ABot-Earth 0.7 intresserar sig för är en kvadratkilometer stad, genererad på ungefär tio minuter på en enda konsument-GPU enligt Amaps egen uppgift.
• Indata — CARI4D en monokulär RGB-video, MP4 vs ABot-Earth 0.7 en satellitbild eller en textprompt
• Utdata — CARI4D:s mänskliga pose och form per bildruta, objektrotation och translation, samt två handkontakt-logits mot ABot-Earth 0.7, en 3D Gaussian splatting-scen, exporterbar till Unreal Engine och Unity
• Analysenhet — CARI4D en människa och ett stelt objekt i kontakt vs ABot-Earth 0.7 terräng, byggnader, vegetation och landmärken i stadsskala
• Tidsmässigt påstående — CARI4D rekonstruerar observerad rörelse bildruta för bildruta, medan ABot-Earth 0.7 positioneras som en världsmodell med ett prediktionslager för vad som händer härnäst
• Metrisk skala — CARI4D:s metriska skala återvunnen från monokulär video via UniDepth och en skalsökning från grovt till fint mot ABot-Earth 0.7 georefererad från en satellitbild, inget problem med metrisk återvinning
• Körningskostnad — CARI4D PyTorch på en NVIDIA Ampere-GPU, validerad på A100, 38 timmar på 8×A100 för forskningsträningskörningen jämfört med ABot-Earth 0.7 cirka tio minuter per km² på en konsumentklassad GPU, enligt Amaps egen jämförelse

Notera att ingen av kolumnerna är bättre än den andra i en enskild rad. De mäter olika världar. En modell som återfinner kontaktpunkten mellan en hand och en gasflaska förbättras inte av att också veta var byggnaderna finns, och en modell som genererar en trovärdig skyline förbättras inte av att känna till den exakta handledsvinkeln hos en fotgängare.
Asymmetrin som faktiskt avgör det
Här är skillnaden som en köpare kommer att känna av inom den första timmen, och den har ingenting med kapacitet att göra.
CARI4D har kod och vikter du kan få tag på idag. NVlabs-repositoriet innehåller den officiella implementeringen, släppt 28 februari 2026, med träningskod och förbearbetning av anpassad video tillagda 4 april. Den förtränade CoCoNet-checkpointen laddas ner från Hugging Face, Docker-avbildningen xiexh20/cari4d är publicerad, och sedan 30 augusti 2026 har en kommersiellt licensierad 231M-checkpoint varit tillgänglig som nvidia/cari4d_commercial under NVIDIA Open Model Agreement — begränsad, men åtkomlig. Beroendena är dokumenterade, inklusive de besvärliga delarna: NLF torchscript-vikter, FoundationPose-vikter, SMPL-H-tillgångar, en kid_template.npy från AGORA, och Hunyuan3D för objektmesharna. Du kan köra inferens på BEHAVE-demon, på ett medföljande in-the-wild-klipp, eller på din egen video, och utvärdera den med de medföljande skripten.

ABot-Earth 0.7 är inte tillgängligt i någon av dessa bemärkelser. Amap har inte publicerat några modellvikter, något modellkort, något publikt API, någon prissättning och ingen utvecklardokumentation. Upplevelswebbplatsen är live, men Amap beskriver generering som endast på inbjudan eller vitlistad, gränssnittet finns bara på förenklad kinesiska, och GitHub-förrådet från 0.5-eran uppges ha innehållit en teknisk rapport och inget körbart. Varje siffra i rubrikerna – tio minuter per kvadratkilometer, ungefär 1 000 gånger effektiviteten hos traditionell rekonstruktion, omkring en hundradel av kostnaden, fler än 196 länder – kan spåras till Amap och har inte oberoende reproducerats av någon utanför Amap. Det är siffror som leverantören rapporterar, och för närvarande finns det ingen väg genom vilken de skulle kunna bli något annat.
Så den praktiska jämförelsen handlar inte om ”vilken modell som är bättre”. Den handlar om att en av dem är en forskningsartefakt med en kommersiell licens och en Docker-avbild, och den andra är en produktdemonstration med en presscykel. Båda är legitima prestationer. Bara en av dem är något man kan lägga in i en build.
Där de två verkligen skulle mötas
Det finns en verklig komposition här, och det är värt att vara konkret om den, eftersom det är den enda bemärkelse i vilken dessa hör hemma i samma samtal.
Utdata från CARI4D är människa–objekt-interaktion i ett metriskt världskoordinatsystem. Utdata från ABot-Earth 0.7 är en miljö. Befolka den andra med den första och du har något som ingen av dem producerar på egen hand: en genererad stad där människor gör saker som mäts fysiskt snarare än placeras konstnärligt. Robotiksimulering, planering av butikslayouter och generering av interaktionsdataset vill alla ha exakt den kombinationen – en miljö som är billig nog att återskapa och mänsklig rörelse som är tillräckligt noggrann att träna mot.

Skarvet mellan dem är en koordinattransform och en skalkonvention, och den är inte trivial, eftersom CARI4D:s metriska ram definieras relativt en enskild kamera och ABot-Earth 0.7:s definieras av geolokalisering. Ingen har publicerat den integrationen. Det är sådant som ett team bygger på en vecka och inte skriver ner.
Steget som glöms bort i den pipelinen är den del som omvandlar rå interaktionsdata till något som går att söka i — att generera bildtexter till klipp, tagga kontakthändelser, bygga sökindex och kvalitetskontrollfilter över utdata. Det arbetet går genom vision-language- och språkmodeller, och det är det lager som OrcaRouter täcker: fler än 200 modeller bakom ett enda API, leverantörens listpris som förs vidare med 0 % påslag, automatisk failover när en leverantör försämras, och ett routing-DSL som sätter samman flera modeller till ett enda anrop så att bildtextningen och QC-körningen inte behöver vara separata integrationer. Varken CARI4D eller ABot-Earth 0.7 tillhandahålls där, och ingen av dem är en LLM — men verktygen du omger dem med är nästan säkert det.
Vilken av dem du faktiskt vill ha
Välj CARI4D om du har video av en person som interagerar med ett objekt och behöver deras poser, i metriska enheter, bildruta för bildruta – för rörelseanalys, robotuppfattning, animationsreferens eller för att bygga ett interaktionsdataset. Det är tillgängligt nu, det är dokumenterat, och den kommersiella licensen kom den 30 augusti 2026. Budgetera för beroendekedjan och läs licensvillkoren för de delar som NVIDIA inte äger.
Välj ABot-Earth 0.7 om du behöver miljöer snarare än aktörer — scener i stadsskala som genereras från en plats eller en beskrivning, snabbt, och som kan exporteras till en spelmotor. Var medveten om att du utvärderar en demonstrerad förmåga snarare än att införa ett verktyg, att tillgången är diskretionär, och att effektivitetssiffrorna är Amaps egna.
Välj båda endast om du bygger det sammansatta system som beskrivs ovan, och gå in i det med vetskapen att du själv kommer att skriva skarven.
Frågan som är värd att ställa är inte vilken av dessa två som vinner. Det är huruvida det du faktiskt bygger behöver en rekonstruktionsmodell, en generativ modell eller ingen av dem – och i den frågan överlappar dessa två svar aldrig.
