
CARI4D Comercial: NVIDIA abrió en silencio su modelo de interacción 4D a las empresas
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
En algún momento alrededor del 30 de agosto de 2026, un repositorio de acceso restringido llamado nvidia/cari4d_commercial apareció en Hugging Face. Su ficha de modelo describe un checkpoint que el proveedor llama "CARI4D CoCoNet Native Momentum Human Rig (MHR)" — una red de 231 millones de parámetros que toma un vídeo MP4 corriente y devuelve, fotograma a fotograma, la pose de un ser humano y de un objeto rígido que este manipula, además de dos logits de contacto de las manos. La línea de licencia dice nvidia-open-model-agreement, y la ficha indica que el modelo está listo para uso comercial o no comercial. Eso supone un cambio significativo respecto a la etapa anterior de CARI4D. El repositorio de investigación, nvidia/CARI4D, distribuye la misma familia de modelo — CoCoNet, 194 M de parámetros — bajo la Licencia de NVIDIA con las palabras "solo para investigación y desarrollo" impresas en la ficha. Es la diferencia entre un artículo que puedes leer y un componente que puedes poner en producción.
Lo que hace que esto sea noticia no es la publicación. Es el silencio que la rodea. Esto no es un lanzamiento: NVIDIA no ha publicado ninguna entrada de blog, ninguna entrada en la sala de prensa, ninguna tabla de benchmarks ni precios para cari4d_commercial, y en el momento de redactar esto, solo se puede acceder al repositorio después de aceptar los términos y compartir información de contacto. Todo lo que sigue está extraído de las dos tarjetas de modelo y de la publicación pública del código. Cuando una afirmación es de NVIDIA y no ha sido reproducida, este artículo lo indica.
¿Qué cambió realmente el 30 de agosto?
La tentación es archivarlo como un cambio de licencia. Es más que eso. Lee las dos tarjetas una frente a otra y tres cosas se movieron a la vez — la licencia, el tamaño del punto de control y el modelo del cuerpo humano que hay debajo.
• Parámetros — versión de investigación de CARI4D 194M vs CARI4D CoCoNet MHR 231M
• Checkpoint — step031397.pth (31.397 pasos de entrenamiento) frente a la cadena de versión 2026-08-25-09-35-57, paso 200.000, estado "Entrenamiento completado"
• Rig corporal — pose y forma de SMPL / SMPL-H frente a los parámetros de Native Momentum Human Rig (MHR)
• Licencia — NVIDIA License, «solo para investigación y desarrollo» vs NVIDIA Open Model Agreement, uso comercial permitido
• Acceso — descarga abierta vs. restringida, se deben aceptar las condiciones
• Salidas — pose, forma y traslación de SMPL actualizados, rotación y traslación del objeto, contacto de mano binario frente a pose del objeto por fotograma y residuos de MHR, además de dos logits de contacto de mano

El número de pasos es la línea que merece atención. Un checkpoint de investigación congelado en aproximadamente 31k pasos y un checkpoint de producción que llegó hasta 200.000 no son el mismo objeto con una cabecera de licencia distinta pegada encima. NVIDIA también reporta la cifra de 231M como «medida a partir del estado del modelo en el paso 84.000, excluyendo los búferes registrados», lo que te indica que la ficha describe un linaje de entrenamiento en lugar de un único artefacto congelado.
El cambio de rig del cuerpo es igual de importante para cualquiera que ya haya integrado o desarrollado contra CARI4D. La línea de investigación está basada en SMPL de principio a fin: los términos de optimización del artículo estiman por regresión la pose, la forma y la traslación de SMPL, y el código depende de archivos pickle de SMPL-H además de un parche de VolumetricSMPL. MHR es una parametrización diferente. Si escribiste código de integración contra los tensores de salida del checkpoint de investigación, la forma de salida de la tarjeta comercial no es directamente intercambiable.
El lanzamiento de investigación en el que se basa esto tiene ocho meses de antigüedad.
Vale la pena ser precisos con la cronología, porque la frase "nuevo modelo" sería incorrecta aquí y la frase "viejo modelo" también sería incorrecta.
El artículo CARI4D — Reconstrucción 4D agnóstica a la categoría de la interacción humano-objeto, de Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll y Stan Birchfield — se publicó en arXiv el 16 de diciembre de 2025 como 2512.11988, y fue aceptado en CVPR 2026. La publicación del código de NVlabs llegó después, el 28 de febrero de 2026. El código de entrenamiento y el preprocesamiento de vídeos personalizados llegaron el 4 de abril. A juzgar por cualquier criterio normal, la línea de investigación es un trabajo ya concluido, de ocho meses de antigüedad y con una lista de TODO completada.

Así que el planteamiento honesto es este: el método ya es historia antigua, y el artefacto comercial tiene tres semanas de vida. Si buscaste CARI4D en marzo y concluiste que era una curiosidad de investigación con una licencia restrictiva, esa conclusión era correcta entonces y ahora está obsoleta. Esa es la razón por la que esto merece un hueco en noticias.
Lo que el modelo realmente hace, y qué tan bien
CARI4D reconstruye la interacción entre humanos y objetos en 4D —tres dimensiones de espacio más el tiempo— a escala métrica, a partir de un único vídeo RGB monocular. Esa última restricción es la interesante. Recuperar la escala métrica de un objeto que una persona sostiene, a partir de una cámara corriente, sin sensor de profundidad y sin un sistema de múltiples vistas, es el problema en torno al cual se construye el artículo.
El pipeline es una cadena de modelos fundacionales en lugar de una única red de extremo a extremo: UniDepth para profundidad métrica, NLF y GENMO para pose humana, Hunyuan3D para mallas de objetos a partir de una sola imagen, FoundationPose para el seguimiento de objetos y VolumetricSMPL para un modelo corporal de distancia con signo. CoCoNet —la parte que NVIDIA está lanzando en realidad— se sitúa en el medio y se encarga del razonamiento de contacto. Renderiza la estimación actual del humano y del objeto en RGB, profundidad y máscaras, luego compara ese render con la observación real usando un codificador RGB DINOv2 ViT-B/14 y un codificador ViT-S/14 de seis canales XYZ y máscara, ejecuta dos bloques de atención espaciotemporal y estima por regresión correcciones por fotograma mediante cabezas MLP.
Las cifras reportadas, procedentes del artículo y de la propia ficha del proveedor: un 38 % menos de error de reconstrucción que el trabajo previo en conjuntos de datos en distribución, y un 36 % en conjuntos de datos no vistos. La ablación que hace comprensible la arquitectura sitúa la distancia de Chamfer del objeto en 1.565,42 cm con NLF sin procesar más el seguimiento con FoundationPose, en 16,85 cm tras la inicialización con CARI4D, y en 11,59 a 11,57 cm una vez que se activan el refinamiento con CoCoNet y la optimización conjunta completa. Son cifras del proveedor procedentes de un artículo revisado por pares: mejor procedencia que una página de marketing, pero siguen sin ser una reproducción independiente, y ningún tercero ha publicado una.
La ficha comercial añade un detalle que el artículo no podía incluir: el modelo se entrenó con FORM-HOI, descrito como 2.126 secuencias internas, y la ficha declara claramente que no hay un conjunto de datos de prueba separado —la evaluación es un conjunto de demostración cualitativa—. También señala que el corpus de entrenamiento interno «Daniel» no se distribuye. Si se leen en conjunto, eso es un proveedor que te dice que la distribución de entrenamiento es suya y que la evidencia de generalización es más débil de lo que sugiere la tabla de ablación.
Lo que la licencia realmente concede, y lo que no
El NVIDIA Open Model Agreement es una licencia comercial permisiva, pero «se permite el uso comercial» no es lo mismo que «sin obligaciones». La ficha describe el modelo como destinado a desarrolladores e investigadores que crean sistemas de visión comerciales o no comerciales para la estimación de pose humano-objeto en 3D/4D, el análisis de movimiento, la visualización, la curación de datos y la percepción robótica, y excluye explícitamente la actuación autónoma directa o las decisiones críticas para la vida.

Dos notas prácticas para cualquiera que evalúe esto. Primero, el repositorio tiene acceso restringido: se aceptan condiciones y se comparte información de contacto antes de que aparezcan los archivos, por lo que la revisión de compras y del equipo legal ocurre antes de la descarga, no después. Segundo, el modelo desplegado no es autónomo. CoCoNet tiene 231M de parámetros, pero no funciona por sí solo: el pipeline más amplio sigue obteniendo los pesos de NLF torchscript, los pesos de FoundationPose, los recursos de SMPL-H, un `kid_template.npy`, y además sigue necesitando Hunyuan3D para producir las mallas de los objetos en primer lugar. La licencia comercial cubre la parte que NVIDIA está publicando. No cubre las dependencias de terceros que la rodean, y cada una de ellas tiene sus propios términos. Esa es la forma más común en que un lanzamiento como este sorprende a un equipo legal.
Dónde encaja esto para quienes construyen con modelos
Para ser directos en cuanto al alcance: CARI4D es un modelo de reconstrucción de visión por computadora, no un modelo de lenguaje, y OrcaRouter no lo sirve. Nada en este artículo debe leerse como si dijera lo contrario — autoalojarlo con PyTorch en una GPU de clase Ampere, que es la configuración en la que la ficha dice que fue validado, es la única forma de ejecutarlo hoy.
La razón por la que todavía merece un párrafo aquí es que la ficha nombra la curación de datos como uso principal previsto, y esa es la parte de un pipeline 4D en la que los modelos de lenguaje realmente viven. Construir un conjunto de datos de interacción humano-objeto implica describir clips, etiquetar eventos de contacto, escribir prompts de control de calidad y filtrar fallos — un trabajo que pasa por modelos de visión-lenguaje y de lenguaje, y un trabajo que escala mal si cada uno es un contrato aparte y una clave aparte. Enrutar más de 200 modelos detrás de una única API en OrcaRouter, con el precio de lista del proveedor trasladado con un 0 % de margen y conmutación automática por error cuando un proveedor se degrada, es lo que parece esa capa cuando no es a medida. Los recortes de precios de los proveedores llegan al endpoint el mismo día, porque no hay margen que volver a calcular. Ese es un trabajo distinto del que hace CARI4D, y es el trabajo que lo rodea.
¿Qué cambiaría esta lectura?
Cuatro cosas. Un anuncio de NVIDIA convertiría un repositorio silencioso en un producto con soporte, y con él llegarían las condiciones de precios y soporte que actualmente están ausentes. Una evaluación publicada sobre un conjunto de datos que NVIDIA no creó resolvería la cuestión de la generalización que la ficha deja abierta. La documentación de lo que MHR cambia con respecto a SMPL les diría a los integradores existentes de CARI4D cuán costosa es en realidad la migración; ahora mismo, la ficha nombra el rig sin explicar la diferencia. Y una resolución sobre las dependencias de terceros decidiría si «con licencia comercial» significa lo que un equipo de compras asumirá que significa.
Hasta entonces, la descripción correcta es limitada y poco glamurosa, y es la que respaldan las pruebas: la línea CARI4D de NVIDIA tiene un checkpoint con licencia comercial, más grande y entrenado durante más tiempo, disponible desde el 30 de agosto de 2026, y el proveedor no ha dicho ni una palabra al respecto. Si necesitas interacción 4D entre humanos y objetos a escala métrica y habías descartado esto por considerarlo solo de investigación, el obstáculo que estabas sorteando ha desaparecido.
