Una tarjeta principal generada titulada 'CARI4D vs ABot-Earth 0.7' con el subtítulo 'Dos modelos 4D que nunca compiten: uno reconstruye, el otro genera'; dos paneles separados por un fino divisor con la palabra 'vs', el de la izquierda etiquetado como 'CARI4D' con la leyenda 'Reconstruye a una persona manipulando un objeto, a escala métrica, a partir de vídeo corriente' y una mano en wireframe sosteniendo un cubo en wireframe, el de la derecha etiquetado como 'ABot-Earth 0.7' con la leyenda 'Genera un kilómetro de ciudad 3D explorable a partir de una sola imagen satelital' y un horizonte urbano en wireframe; y una franja de banner que dice 'Solo uno de estos puedes descargarlo y ejecutarlo hoy'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

CARI4D vs ABot-Earth 0.7: Dos modelos 4D que nunca compiten

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si buscaste CARI4D frente a ABot-Earth 0.7 esperando un cara a cara, la respuesta honesta es que esa comparación no existe y no va a existir. Estos dos sistemas no hacen el mismo trabajo, no reciben la misma entrada, no producen lo mismo a la salida, y nadie que entendiera cualquiera de los dos los sometería jamás a un benchmark comparativo. CARI4D es la reconstrucción 4D agnóstica de categoría de la interacción persona-objeto de NVIDIA: observa a una persona manipulando un objeto en un vídeo corriente y recupera sus poses a escala métrica a lo largo del tiempo. ABot-Earth 0.7 es el modelo de mundo urbano nativo 3D de Amap: toma una imagen de satélite o un prompt de texto y genera una ciudad explorable a escala de kilómetros como una escena de Gaussian splatting. La razón por la que esta página existe de todos modos es que el eje que los separa es realmente útil, y ambos son mucho más distintos en lo que puedes hacer con ellos que en lo que parecen ser.

También hay una segunda razón, más aguda. Estas dos versiones están en extremos opuestos de un espectro que importa más que cualquier línea de especificaciones: una de ellas puedes descargarla y ejecutarla esta tarde, y la otra no puedes ejecutarla en absoluto.

La respuesta que nadie buscando esta consulta quiere

Ambos se describen como 4D. Ambos son de grandes proveedores. Ambos se lanzaron en el último año. Ahí es, más o menos, donde termina la coincidencia.

CARI4D reconstruye. Dado un video, estima lo que había allí. El artículo — Reconstrucción 4D de la interacción humano-objeto agnóstica a la categoría de Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll y Stan Birchfield — apareció en arXiv como 2512.11988 en diciembre de 2025 y fue aceptado en CVPR 2026. Su tema es un humano y un objeto rígido en contacto, y su afirmación central es la escala: recuperar dimensiones métricas a partir de una cámara monocular sin sensor de profundidad y sin sistema multivista, que es la parte con la que los trabajos previos tenían dificultades.

ABot-Earth 0.7 genera. Dada una imagen satelital georreferenciada o una descripción textual, produce una escena que no existía como datos antes. Amap, la empresa china de cartografía y navegación, lo presentó el 10 de septiembre de 2026 en su gala Street Stars en Hangzhou, como sucesor de ABot-Earth 0.5, del 8 de junio. Genera splats gaussianos 3D, exporta a Unreal Engine y Unity, y cubre lo que Amap afirma que son más de 196 países y regiones, frente a más de 190 en la 0.5.

Uno es un estimador. El otro es un generador. Esa distinción hace más trabajo que cualquier tabla de benchmarks.

Una persona y una silla, o una ciudad

La brecha de escala es la que la gente subestima. La unidad de interés de CARI4D es un cuerpo humano y un objeto sostenido en la mano, medidos en centímetros, rastreados a lo largo de los fotogramas de un solo clip. La unidad de interés de ABot-Earth 0.7 es un kilómetro cuadrado de ciudad, generado en aproximadamente diez minutos en una sola GPU de consumo, según la propia Amap.

• Entrada — CARI4D: un video RGB monocular, MP4 vs. ABot-Earth 0.7: una imagen satelital o un prompt de texto

• Salida — pose y forma humanas por fotograma de CARI4D, rotación y traslación de objetos, y dos logits de contacto de manos frente a ABot-Earth 0.7, una escena de splatting gaussiano 3D, exportable a Unreal Engine y Unity

• Unidad de análisis — CARI4D: un ser humano y un objeto rígido en contacto frente a ABot-Earth 0.7: terreno, edificios, vegetación y puntos de referencia a escala de ciudad

• Afirmación temporal — CARI4D reconstruye el movimiento observado fotograma a fotograma, mientras que ABot-Earth 0.7 se posiciona como un modelo del mundo con una capa de predicción de lo que sucederá a continuación

• Escala métrica — escala métrica de CARI4D recuperada de vídeo monocular mediante UniDepth y una búsqueda de escala de gruesa a fina frente a ABot-Earth 0.7 georreferenciado a partir de una imagen satelital, sin problema de recuperación métrica

• Coste de ejecución — CARI4D PyTorch en una GPU NVIDIA Ampere, validado en A100, 38 horas en 8×A100 para la ejecución de entrenamiento de la investigación frente a ABot-Earth 0.7, unos diez minutos por km² en una sola GPU de gama de consumo, según la propia comparación de Amap

A generated two-column scoreboard titled 'CARI4D vs ABot-Earth 0.7 — the scoreboard'. The CARI4D column lists Task: Reconstructs; Input: Monocular RGB video; Output: Human and object poses, contact logits; Unit of scale: One person, one object; Weights: Downloadable, gated; Evidence: CVPR 2026, vendor-reported. The ABot-Earth 0.7 column lists Task: Generates; Input: Satellite image or text prompt; Output: 3D Gaussian splatting city; Unit of scale: One square kilometre; Weights: None published; Evidence: Vendor-reported, unreproduced. A footer reads 'CARI4D weights are downloadable today; ABot-Earth 0.7 figures are Amap's own, unaudited.' The OrcaRouter logo is composited in the bottom-right corner.

Observa que ninguna columna es mejor que la otra en una sola fila. Están midiendo mundos diferentes. Un modelo que recupera el punto de contacto entre una mano y un cilindro de gas no mejora por saber también dónde están los edificios, y un modelo que genera un horizonte urbano plausible no mejora por conocer el ángulo exacto de la muñeca de un peatón.

La asimetría que en realidad lo decide

Esta es la diferencia que un comprador sentirá en la primera hora, y no tiene nada que ver con la capacidad.

CARI4D tiene código y pesos que puedes obtener hoy mismo. El repositorio de NVlabs contiene la implementación oficial, publicada el 28 de febrero de 2026, con el código de entrenamiento y el preprocesamiento de vídeo personalizado añadidos el 4 de abril. El checkpoint preentrenado de CoCoNet se descarga desde Hugging Face, la imagen de Docker xiexh20/cari4d está publicada y, desde el 30 de agosto de 2026, hay disponible un checkpoint de 231M con licencia comercial como nvidia/cari4d_commercial bajo el NVIDIA Open Model Agreement: con acceso restringido, pero obtenible. Las dependencias están documentadas, incluidas las partes complicadas: los pesos torchscript de NLF, los pesos de FoundationPose, los recursos de SMPL-H, un kid_template.npy de AGORA y Hunyuan3D para las mallas de los objetos. Puedes ejecutar la inferencia en la demo de BEHAVE, en un clip in-the-wild proporcionado o en tu propio vídeo, y evaluarla con los scripts incluidos.

A screenshot of the nvidia/CARI4D model page on Hugging Face, captured September 18 2026, showing the arXiv:2512.11988 tag, the heading 'Model Card - CARI4D', the description of the CoCoNet model and the line 'This model is for research and development only', governing terms listing the NVIDIA License alongside a DINOv2 licence link, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

ABot-Earth 0.7 no se puede obtener en ninguno de esos sentidos. Amap no ha publicado pesos del modelo, ni tarjeta del modelo, ni API pública, ni precios, ni documentación para desarrolladores. El sitio de experiencia está activo, pero Amap describe la generación como solo por invitación o mediante lista blanca, la interfaz está únicamente en chino simplificado y, según se informa, el repositorio de GitHub de la era 0.5 contenía un informe técnico y nada ejecutable. Todas las cifras destacadas —diez minutos por kilómetro cuadrado, aproximadamente 1.000 veces la eficiencia de la reconstrucción tradicional, alrededor de una centésima parte del costo, más de 196 países— se remontan a Amap y no han sido reproducidas de forma independiente por nadie fuera de Amap. Esas son cifras reportadas por el proveedor, y actualmente no existe ninguna vía por la que puedan convertirse en otra cosa.

Así que la comparación práctica no es «qué modelo es mejor». Es que uno de estos es un artefacto de investigación con una licencia comercial y una imagen de Docker, y el otro es una demostración de producto con un ciclo de prensa. Ambos son logros legítimos. Solo uno es algo que puedes incluir en una compilación.

Donde los dos se encontrarían realmente

Aquí hay una composición real, y vale la pena ser concreto al respecto, porque es el único sentido en el que estos pertenecen a la misma conversación.

La salida de CARI4D es interacción humano-objeto en un marco global métrico. La salida de ABot-Earth 0.7 es un entorno. Puebla el segundo con el primero y obtienes algo que ninguno produce por sí solo: una ciudad generada en la que las personas hacen cosas que se miden físicamente en lugar de colocarse artísticamente. La simulación robótica, la planificación de diseños de tiendas y la generación de conjuntos de datos de interacción quieren exactamente esa combinación: un entorno lo bastante barato como para regenerarlo y un movimiento humano lo bastante preciso como para entrenar con él.

A screenshot of the OrcaRouter Models page, captured September 18 2026, headed 'Models' with the subheading '200 models · 16 providers · one API key, one bill', showing the OpenAI-compatible POST endpoint in a 'How to call any model' panel, modality tabs reading Text 165, Image 10, Embeddings 5, Video 10 and TTS 10, prepaid credit plans from USD 50 to USD 1000 per month, and model cards including Orca: OrcaCyber Zero 1.0, Orca: OrcaVerify Text 1.0, DeepSeek V4.1 Flash, OpenAI GPT-6 Astra, Google Gemini 3.8 Flash and Qwen3.8 Max.

La costura entre ambos es una transformación de coordenadas y una convención de escala, y no es trivial, porque el marco métrico de CARI4D se define con respecto a una sola cámara y el de ABot-Earth 0.7 se define por geolocalización. Nadie ha publicado esa integración. Es el tipo de cosa que un equipo construye en una semana y no documenta.

El paso que se olvida en ese pipeline es la parte que convierte los datos de interacción sin procesar en algo consultable: descripción de clips, etiquetado de eventos de contacto, creación de índices de recuperación y filtros de control de calidad sobre la salida. Ese trabajo pasa por modelos de visión-lenguaje y de lenguaje, y es la capa que cubre OrcaRouter: más de 200 modelos detrás de una sola API, el precio de lista del proveedor trasladado con un 0 % de margen, conmutación automática por error cuando un proveedor se degrada, y un DSL de enrutamiento que compone varios modelos en una sola llamada para que la descripción de clips y la pasada de QC no tengan que ser integraciones separadas. Ni CARI4D ni ABot-Earth 0.7 se sirven allí, y ninguno de los dos es un LLM, pero las herramientas con las que los rodeas casi con seguridad lo son.

¿Cuál quieres realmente?

Elige CARI4D si tienes video de una persona interactuando con un objeto y necesitas sus poses, en unidades métricas, fotograma a fotograma — para análisis de movimiento, percepción robótica, referencia de animación o creación de un conjunto de datos de interacción. Ya está disponible, está documentado y la licencia comercial llegó el 30 de agosto de 2026. Presupuesta para la cadena de dependencias y lee los términos de la licencia sobre las partes que NVIDIA no posee.

Elige ABot-Earth 0.7 si necesitas entornos en lugar de actores — escenas a escala de ciudad generadas a partir de una ubicación o una descripción, rápidamente, exportables a un motor de juego. Ten en cuenta que estás evaluando una capacidad demostrada en lugar de adoptar una herramienta, que el acceso es discrecional y que las cifras de eficiencia son de Amap.

Elige ambos solo si vas a construir el sistema compuesto descrito arriba, y hazlo sabiendo que serás tú quien escriba la costura.

La pregunta que vale la pena hacerse no es cuál de estos dos gana. Es si lo que realmente estás construyendo necesita un modelo de reconstrucción, un modelo de generación o ninguno de los dos — y en esa cuestión, estas dos respuestas nunca se superponen.