
CARI4D vs ABot-Earth 0.7: Due modelli 4D che non competono mai
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Se hai cercato CARI4D contro ABot-Earth 0.7aspettandoti un confronto diretto, la risposta onesta è che un simile confronto non esiste e non arriverà. Questi due sistemi non svolgono lo stesso compito, non accettano lo stesso input, non producono lo stesso output, e nessuno che capisse l'uno o l'altro li metterebbe mai a confronto in un benchmark. CARI4D è la ricostruzione 4D agnostica rispetto alla categoria dell'interazione uomo-oggetto di NVIDIA — osserva una persona che maneggia un oggetto in un normale video e ne ricostruisce le pose in scala metrica nel tempo. ABot-Earth 0.7 è il modello urbano nativo 3D di Amap — prende un'immagine satellitare o un prompt testuale e genera una città esplorabile su scala chilometrica come scena di Gaussian splatting. Il motivo per cui questa pagina esiste comunque è che l'asse che li separa è davvero utile, e i due sono molto più diversi in ciò che puoi fare con loro che in ciò che sembrano essere.
C'è anche una seconda ragione, più incisiva. Questi due rilasci sono agli estremi opposti di uno spettro che conta più di qualsiasi riga di specifiche: uno lo puoi scaricare ed eseguire questo pomeriggio, e l'altro non lo puoi eseguire affatto.
La risposta che nessuno vuole quando cerca questa query
Entrambi sono descritti come 4D. Entrambi provengono da importanti fornitori. Entrambi sono stati rilasciati nell'ultimo anno. Più o meno qui finisce ciò che hanno in comune.
CARI4D ricostruisce. Dato un video, stima ciò che c'era. L'articolo — Ricostruzione 4D agnostica rispetto alla categoria dell'interazione uomo-oggetto di Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll e Stan Birchfield — è apparso su arXiv come 2512.11988 a dicembre 2025 ed è stato accettato al CVPR 2026. Il suo tema è un essere umano e un oggetto rigido a contatto, e la sua tesi centrale è la scala: recuperare dimensioni metriche da una fotocamera monoculare senza sensore di profondità e senza sistema multi-vista, che è l'aspetto con cui i lavori precedenti avevano maggiori difficoltà.
ABot-Earth 0.7 genera. Data un'immagine satellitare georeferenziata o una descrizione testuale, produce una scena che prima non esisteva come dato. Amap, l'azienda cinese di mappe e navigazione, l'ha presentato il 10 settembre 2026 al suo gala Street Stars a Hangzhou, subentrando ad ABot-Earth 0.5 dell'8 giugno. Produce splat gaussiani 3D, esporta in Unreal Engine e Unity e copre quelli che, secondo Amap, sono oltre 196 paesi e regioni, in aumento rispetto a oltre 190 nella 0.5.
Uno è uno stimatore. Uno è un generatore. Questa distinzione fa più di quanto potrebbe fare qualsiasi tabella di benchmark.
Una persona e una sedia, o una città
Il divario di scala è quello che le persone sottovalutano. L'unità di interesse di CARI4D è un corpo umano e un oggetto tenuto in mano, misurati in centimetri, tracciati attraverso i fotogrammi di una singola clip. L'unità di interesse di ABot-Earth 0.7 è un chilometro quadrato di città, generato in circa dieci minuti su una singola GPU di fascia consumer, secondo quanto dichiarato da Amap stessa.
• Input — CARI4D un video RGB monoculare, MP4 vs ABot-Earth 0.7 un'immagine satellitare o un prompt testuale
• Output — CARI4D posa e forma umana per fotogramma, rotazione e traslazione dell'oggetto, e due logit di contatto della mano rispetto a ABot-Earth 0.7, una scena di Gaussian splatting 3D, esportabile in Unreal Engine e Unity
• Unità di analisi — CARI4D un umano e un oggetto rigido in contatto vs ABot-Earth 0.7 terreno, edifici, vegetazione e punti di riferimento su scala urbana
• Affermazione temporale — CARI4D ricostruisce il movimento osservato fotogramma per fotogramma, mentre ABot-Earth 0.7 viene presentato come modello del mondo con un livello di predizione per ciò che accade dopo
• Scala metrica — scala metrica di CARI4D recuperata da video monoculare tramite UniDepth e una ricerca della scala dal grossolano al fine rispetto ad ABot-Earth 0.7 georeferenziato da un'immagine satellitare, nessun problema di recupero metrico
• Costo di esecuzione — CARI4D PyTorch su una GPU NVIDIA Ampere, validato su A100, 38 ore su 8×A100 per l'esecuzione di addestramento di ricerca rispetto a ABot-Earth 0.7 circa dieci minuti per km² su una GPU di fascia consumer, secondo il confronto di Amap stesso

Si noti che nessuna delle due colonne è migliore dell'altra su una singola riga. Stanno misurando mondi diversi. Un modello che recupera il punto di contatto tra una mano e una bombola del gas non migliora sapendo anche dove si trovano gli edifici, e un modello che genera uno skyline plausibile non migliora conoscendo l'angolo esatto del polso di un pedone.
L'asimmetria che in realtà decide tutto
Ecco la differenza che un acquirente sentirà entro la prima ora, e non ha nulla a che fare con le capacità.
CARI4D ha codice e pesi che puoi ottenere oggi. Il repository NVlabs contiene l'implementazione ufficiale, rilasciata il 28 febbraio 2026, con codice di addestramento e preprocessing di video personalizzati aggiunti il 4 aprile. Il checkpoint preaddestrato CoCoNet si scarica da Hugging Face, l'immagine Docker xiexh20/cari4d è pubblicata, e dal 30 agosto 2026 un checkpoint da 231M con licenza commerciale è disponibile come nvidia/cari4d_commercial secondo il NVIDIA Open Model Agreement — con accesso controllato, ma ottenibile. Le dipendenze sono documentate, incluse le parti scomode: pesi torchscript di NLF, pesi FoundationPose, asset SMPL-H, un kid_template.npy da AGORA, e Hunyuan3D per le mesh degli oggetti. Puoi eseguire l'inferenza sulla demo BEHAVE, su una clip in-the-wild fornita o sul tuo video, e valutarla con gli script forniti.

ABot-Earth 0.7 non è ottenibile in nessuno di quei sensi. Amap non ha pubblicato pesi del modello, model card, API pubbliche, prezzi né documentazione per sviluppatori. Il sito esperienziale è attivo, ma Amap descrive la generazione come su invito o in whitelist, l'interfaccia è solo in cinese semplificato, e il repository GitHub dell'era 0.5 conteneva, secondo quanto riferito, un rapporto tecnico e nulla di eseguibile. Ogni cifra di richiamo — dieci minuti per chilometro quadrato, circa 1.000 volte l'efficienza della ricostruzione tradizionale, circa un centesimo del costo, oltre 196 paesi — risale ad Amap e non è stata riprodotta in modo indipendente da nessuno al di fuori di Amap. Si tratta di cifre dichiarate dal fornitore, e attualmente non esiste alcuna via per cui possano diventare qualcos'altro.
Quindi il confronto pratico non è «quale modello è migliore». È che uno di questi è un artefatto di ricerca con una licenza commerciale e un'immagine Docker, e l'altro è una dimostrazione di prodotto con un ciclo di copertura mediatica. Entrambi sono risultati legittimi. Solo uno è qualcosa che puoi mettere in una build.
Dove i due si incontrerebbero davvero
C'è una vera composizione qui, e vale la pena essere concreti al riguardo, perché è l'unico senso in cui questi appartengono alla stessa conversazione.
L'output di CARI4D è l'interazione umano-oggetto in un sistema di riferimento mondiale metrico. L'output di ABot-Earth 0.7 è un ambiente. Popola il secondo con il primo e ottieni qualcosa che nessuno dei due produce da solo: una città generata in cui le persone fanno cose che sono misurate fisicamente anziché disposte artisticamente. La simulazione robotica, la pianificazione del layout retail e la generazione di dataset di interazione vogliono esattamente quella combinazione: un ambiente abbastanza economico da rigenerare e un movimento umano abbastanza accurato su cui addestrare.

La giunzione tra i due è una trasformazione di coordinate e una convenzione di scala, e non è banale, perché il sistema di riferimento metrico di CARI4D è definito rispetto a una singola camera, mentre quello di ABot-Earth 0.7 è definito dalla geolocalizzazione. Nessuno ha pubblicato quell'integrazione. È il tipo di cosa che un team costruisce in una settimana e non documenta.
Il passaggio che viene dimenticato in quella pipeline è la parte che trasforma i dati di interazione grezzi in qualcosa di interrogabile — l'aggiunta di didascalie ai clip, l'etichettatura degli eventi di contatto, la costruzione di indici di recupero e filtri di controllo qualità sull'output. Quel lavoro passa attraverso modelli vision-language e modelli linguistici, ed è lo strato che OrcaRouter copre: oltre 200 modelli dietro un'unica API, il prezzo di listino del provider passato con uno 0% di markup, failover automatico quando un provider degrada, e un DSL di routing che compone diversi modelli in un'unica chiamata, così che la didascalia e la fase di QC non debbano essere integrazioni separate. Lì non vengono serviti né CARI4D né ABot-Earth 0.7, e nessuno dei due è un LLM — ma gli strumenti con cui li circondate quasi certamente lo sono.
Quale vuoi davvero
Scegli CARI4D se hai un video di una persona che interagisce con un oggetto e hai bisogno delle sue pose, in unità metriche, fotogramma per fotogramma — per l'analisi del movimento, la percezione robotica, il riferimento per l'animazione o la creazione di un dataset di interazione. È disponibile ora, è documentato, e la licenza commerciale è arrivata il 30 agosto 2026. Prevedi un budget per la catena di dipendenze e leggi i termini della licenza sulle parti che NVIDIA non possiede.
Scegli ABot-Earth 0.7 se ti servono ambienti anziché attori — scene su scala urbana generate da una località o da una descrizione, rapidamente, esportabili in un motore di gioco. Tieni presente che stai valutando una capacità dimostrata anziché adottare uno strumento, che l'accesso è discrezionale e che i dati sull'efficienza sono di Amap.
Scegli entrambi solo se stai costruendo il sistema composto descritto sopra, e affrontalo sapendo che sarai tu a scrivere la cucitura.
La domanda che vale la pena porsi non è quale delle due vince. È se ciò che stai effettivamente costruendo richiede un modello di ricostruzione, un modello di generazione, o nessuno dei due — e su questa domanda queste due risposte non si sovrappongono mai.
