
Comercial da CARI4D: NVIDIA abriu seu Modelo de Interação 4D para empresas, discretamente
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Por volta de 30 de agosto de 2026, um repositório com acesso restrito chamado nvidia/cari4d_commercial apareceu no Hugging Face. O cartão do modelo descreve um checkpoint que o fornecedor chama de "CARI4D CoCoNet Native Momentum Human Rig (MHR)" — uma rede de 231 milhões de parâmetros que recebe um vídeo MP4 comum e retorna, quadro a quadro, a pose de uma pessoa e de um objeto rígido que ela está manuseando, além de dois logits de contato com as mãos. A linha da licença diz nvidia-open-model-agreement, e o cartão afirma que o modelo está pronto para uso comercial ou não comercial. Essa é uma mudança significativa em relação à antiga vida do CARI4D. O repositório de pesquisa, nvidia/CARI4D, distribui a mesma família de modelo — CoCoNet, 194M parâmetros — sob a NVIDIA License, com as palavras "apenas para pesquisa e desenvolvimento" impressas no cartão. É a diferença entre um artigo que você pode ler e um componente que você pode distribuir.
O que torna isto digno de notícia não é o lançamento. É o silêncio ao redor dele. Isto não é um lançamento: a NVIDIA não publicou nenhuma postagem no blog, nenhuma entrada na sala de imprensa, nenhuma tabela de benchmarks nem preços para cari4d_commercial, e, no momento em que escrevo, o repositório só é acessível após aceitar os termos e compartilhar informações de contato. Tudo o que se segue foi extraído das duas fichas de modelo e da versão pública do código. Quando uma afirmação é da própria NVIDIA e não foi reproduzida, este artigo diz isso.
O que realmente mudou em 30 de agosto
A tentação é registar isto como uma alteração de licença. É mais do que isso. Leia os dois cartões um contra o outro e três coisas mudaram ao mesmo tempo — a licença, a dimensão do checkpoint e o modelo do corpo humano que lhe está por baixo.
Parâmetros — versão de pesquisa CARI4D 194M vs CARI4D CoCoNet MHR 231M
• Checkpoint — step031397.pth (31.397 etapas de treinamento) vs. string de versão 2026-08-25-09-35-57, etapa 200.000, status "Treinamento concluído"
• Rig corporal — pose e forma SMPL / SMPL-H vs parâmetros do Native Momentum Human Rig (MHR)
Licença — Licença NVIDIA, “apenas para pesquisa e desenvolvimento” vs. Acordo de Modelo Aberto da NVIDIA, uso comercial permitido
• Acesso — download aberto vs. restrito, as condições devem ser aceitas
• Saídas — pose, forma e translação SMPL, rotação e translação do objeto atualizadas, contato binário da mão vs. pose do objeto por quadro e resíduos MHR, além de dois logits de contato da mão

A contagem de passos é a linha que merece atenção. Um checkpoint de pesquisa congelado em cerca de 31 mil passos e um checkpoint de produção que chegou a 200.000 não são o mesmo objeto com um cabeçalho de licença diferente grampeado por cima. A NVIDIA também relata o número de 231M como "medido a partir do estado do modelo do passo 84.000, excluindo buffers registrados", o que indica que o cartão está descrevendo uma linhagem de treinamento, e não um único artefato congelado.
A troca de rig corporal é igualmente importante para quem já construiu algo em cima do CARI4D. A linha de pesquisa é toda baseada em SMPL — os termos de otimização do artigo fazem regressão de pose, shape e translação SMPL, e o código depende de arquivos pickle SMPL-H além de um patch do VolumetricSMPL. O MHR é uma parametrização diferente. Se você escreveu código de integração contra os tensores de saída do checkpoint de pesquisa, o shape de saída do card comercial não é uma substituição direta.
A versão de pesquisa na qual isto se baseia tem oito meses.
Vale a pena ser preciso quanto à linha do tempo, porque a expressão "novo modelo" estaria errada aqui e a expressão "modelo antigo" também estaria errada.
O artigo CARI4D — Reconstrução 4D Agnóstica de Categoria de Interação Humano-Objeto, de Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll e Stan Birchfield — foi publicado no arXiv em 16 de dezembro de 2025 como 2512.11988, e foi aceito na CVPR 2026. O lançamento do código da NVlabs veio em 28 de fevereiro de 2026. O código de treinamento e o pré-processamento de vídeos personalizados chegaram em 4 de abril. Por qualquer critério normal, a linha de pesquisa é um trabalho consolidado de oito meses, com uma lista de TODO concluída.

Então, o enquadramento honesto é este: o método é notícia velha, e o artefato comercial tem três semanas. Se você pesquisou por CARI4D em março e concluiu que era uma curiosidade de pesquisa com uma licença restritiva, essa conclusão estava correta na época e está desatualizada agora. É exatamente por isso que isto pertence a uma seção de notícias.
O que o modelo realmente faz, e quão bem
CARI4D reconstrói a interação humano-objeto em 4D — três dimensões do espaço mais o tempo — em escala métrica, a partir de um único vídeo RGB monocular. Essa última restrição é a interessante. Recuperar a escala métrica de um objeto que uma pessoa está segurando, a partir de uma câmera comum, sem sensor de profundidade e sem uma configuração de múltiplas vistas, é o problema em torno do qual o artigo se estrutura.
O pipeline é uma cadeia de modelos de fundação, e não uma única rede ponta a ponta: UniDepth para profundidade métrica, NLF e GENMO para pose humana, Hunyuan3D para malhas de objetos a partir de uma única imagem, FoundationPose para rastreamento de objetos, VolumetricSMPL para um modelo corporal de distância assinada. O CoCoNet — a parte que a NVIDIA está de fato lançando — fica no meio e faz o raciocínio de contato. Ele renderiza a estimativa atual de humano e objeto em RGB, profundidade e máscaras, depois compara essa renderização com a observação real usando um codificador RGB DINOv2 ViT-B/14 e um codificador ViT-S/14 de seis canais para XYZ e máscara, executa dois blocos de atenção espaço-temporal e faz a regressão de correções por quadro por meio de cabeças MLP.
Os números relatados, do artigo e do próprio cartão do fornecedor: erro de reconstrução 38% menor do que trabalhos anteriores em conjuntos de dados dentro da distribuição, 36% em conjuntos de dados não vistos. A ablação que torna a arquitetura legível coloca a distância de Chamfer do objeto em 1.565,42 cm a partir do NLF bruto mais o rastreamento FoundationPose, 16,85 cm após a inicialização do CARI4D, e 11,59 a 11,57 cm assim que o refinamento CoCoNet e a otimização conjunta completa são ativados. Esses são números do fornecedor de um artigo revisado por pares — proveniência melhor do que uma página de marketing, mas ainda não uma reprodução independente, e nenhum terceiro publicou uma.
O cartão comercial acrescenta um detalhe que o artigo não podia: o modelo foi treinado no FORM-HOI, descrito como 2.126 sequências internas, e o cartão afirma claramente que não há conjunto de dados de teste separado — a avaliação é um conjunto de demonstração qualitativo. Também observa que o corpus de treino interno "Daniel" não é distribuído. Lidos em conjunto, isso é um fornecedor dizendo-lhe que a distribuição de treino é dele e que a evidência de generalização é mais tênue do que a tabela de ablação sugere.
O que a licença realmente concede, e o que não concede
O Contrato de Modelo Aberto da NVIDIA é uma licença comercial permissiva, mas “uso comercial permitido” não é o mesmo que “sem obrigações”. A ficha lista o modelo como destinado a desenvolvedores e pesquisadores que criam sistemas de visão comerciais ou não comerciais para estimativa de pose humano-objeto em 3D/4D, análise de movimento, visualização, curadoria de dados e percepção para robótica, e exclui explicitamente atuação autônoma direta ou decisões críticas para a vida.

Duas observações práticas para quem for avaliar isto. Primeiro, o repositório tem acesso restrito: você aceita condições e compartilha informações de contato antes que os arquivos apareçam, então a revisão de compras e jurídica acontece antes do download, não depois. Segundo, o modelo implantado não é autossuficiente. O CoCoNet tem 231 milhões de parâmetros, mas não funciona sozinho — o pipeline mais amplo ainda puxa os pesos NLF torchscript, os pesos do FoundationPose, os assets SMPL-H, um `kid_template.npy`, e ainda precisa do Hunyuan3D para produzir as malhas dos objetos em primeiro lugar. A licença comercial cobre a parte que a NVIDIA está liberando. Não cobre as dependências de terceiros ao redor dela, e cada uma delas traz seus próprios termos. Essa é a forma mais comum de um lançamento como este surpreender um time jurídico.
O que isso significa para quem constrói com modelos
Para ser direto sobre o escopo: o CARI4D é um modelo de reconstrução de visão computacional, não um modelo de linguagem, e o OrcaRouter não o disponibiliza. Nada neste artigo deve ser interpretado como dizendo o contrário — hospedá-lo por conta própria com PyTorch em uma GPU da classe Ampere, que é a configuração na qual o card afirma que ele foi validado, é a única maneira de executá-lo hoje.
A razão pela qual ainda merece um parágrafo aqui é que o cartão indica curadoria de dados como um uso principal pretendido, e essa é a parte de um pipeline 4D onde os modelos de linguagem realmente residem. Construir um conjunto de dados de interação humano-objeto significa legendar clipes, rotular eventos de contacto, escrever prompts de QC e filtrar falhas — trabalho que passa por modelos de visão-linguagem e de linguagem, e trabalho que escala mal se cada um for um contrato separado e uma chave separada. Encaminhar mais de 200 modelos por trás de uma única API na OrcaRouter, com o preço de tabela do fornecedor repassado com 0% de margem e failover automático quando um fornecedor se degrada, é o que essa camada parece quando não é feita à medida. Os cortes de preços dos fornecedores chegam ao endpoint no mesmo dia, porque não há margem para recalcular. Esse é um trabalho diferente do que o CARI4D faz, e é o trabalho que o rodeia.
O que mudaria essa leitura?
Quatro coisas. Um anúncio da NVIDIA transformaria um repositório discreto em um produto com suporte e, com ele, viriam as condições de preço e suporte que atualmente estão ausentes. Uma avaliação publicada em um conjunto de dados que a NVIDIA não criou resolveria a questão de generalização que a ficha deixa em aberto. Documentação do que o MHR muda em relação ao SMPL informaria aos integradores existentes do CARI4D quão caro é, de fato, migrar — no momento, a ficha nomeia o rig sem explicar a diferença. E uma definição sobre as dependências de terceiros decidiria se "licenciado comercialmente" significa o que uma equipe de compras vai presumir que significa.
Até então, a descrição correta é restrita e pouco glamourosa, e é a que as evidências sustentam: a linha CARI4D da NVIDIA tem um checkpoint licenciado comercialmente, maior e treinado por mais tempo, disponível desde 30 de agosto de 2026, e o fornecedor não disse uma palavra sobre isso. Se você precisa de interação humano-objeto 4D em escala métrica e tinha descartado isso como apenas pesquisa, o obstáculo que você estava contornando deixou de existir.
