
CARI4D vs ABot-Earth 0.7: 결코 경쟁하지 않는 두 개의 4D 모델
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
만약 당신이 CARI4D 대 ABot-Earth 0.7의 일대일 맞대결을 기대하며 검색했다면, 솔직한 답은 그런 비교는 존재하지 않고 앞으로도 없을 것이라는 점입니다. 이 두 시스템은 같은 일을 하지 않고, 같은 입력을 받지 않으며, 같은 결과를 내지 않으며, 둘 중 하나라도 이해하는 사람이라면 서로를 벤치마크하지 않을 것입니다. CARI4D는 NVIDIA의 카테고리 불문 4D 인간-객체 상호작용 복원입니다 — 일반 영상에서 한 사람이 한 객체를 다루는 모습을 관찰하고 시간에 따른 그들의 미터법 스케일 포즈를 복원합니다. ABot-Earth 0.7은 Amap의 3D 네이티브 도시 세계 모델입니다 — 위성 이미지나 텍스트 프롬프트를 받아 킬로미터 규모의 탐험 가능한 도시를 가우시안 스플래팅 장면으로 생성합니다. 그럼에도 이 페이지가 존재하는 이유는 두 시스템을 가르는 축이 정말로 유용한 축이고, 이 둘은 당신이 그것들로 무엇을 할 수 있는지에서, 그것들이 겉보이는 모습보다 훨씬 더 다르기 때문입니다.
또 하나의, 더 예리한 이유도 있습니다. 이 두 릴리스는 어떤 스펙 항목보다 더 중요한 스펙트럼의 양 극단에 있습니다. 하나는 오늘 오후에 다운로드해 실행할 수 있고, 다른 하나는 전혀 실행할 수 없습니다.
이 검색어로 검색하는 사람이라면 누구도 원하지 않을 답
둘 다 4D라고 설명된다. 둘 다 주요 벤더의 제품이다. 둘 다 지난 1년 이내에 출시되었다. 겹치는 부분은 대략 거기까지다.
CARI4D는 재구성한다. 비디오가 주어지면, 거기에 무엇이 있었는지 추정한다. 그 논문은 — 인간-객체 상호작용의 범주 무관 4D 재구성 저자: Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield — 2025년 12월에 arXiv에 2512.11988로 게재되었고 CVPR 2026에 채택되었다. 주제는 접촉 상태의 인간과 강체 객체이며, 핵심 주장은 스케일이다: 깊이 센서와 다시점 장비 없이 단안 카메라로부터 미터법 치수를 복구하는 것, 이것이 기존 연구가 어려워했던 부분이다.
ABot-Earth 0.7이 생성합니다. 지리 참조된 위성 이미지나 텍스트 설명이 주어지면, 이전에는 데이터로 존재하지 않았던 장면을 만들어냅니다. 중국의 지도 및 내비게이션 회사인 Amap은 2026년 9월 10일 항저우에서 열린 자사의 Street Stars 갈라에서 이를 공개했으며, 6월 8일에 나온 ABot-Earth 0.5를 잇습니다. 이는 3D 가우시안 스플랫을 출력하고 Unreal Engine과 Unity로 내보내며, Amap에 따르면 196개 이상의 국가와 지역을 포괄하는데, 이는 0.5의 190개 이상에서 늘어난 수치입니다.
하나는 추정기다. 하나는 생성기다. 그 구분은 어떤 벤치마크 표보다도 더 큰 역할을 한다.
한 사람과 한 의자, 또는 한 도시
규모 격차는 사람들이 과소평가하는 부분이다. CARI4D의 관심 단위는 인체와 손에 든 물체로, 센티미터 단위로 측정되며 단일 클립의 프레임 전반에 걸쳐 추적된다. ABot-Earth 0.7의 관심 단위는 도시 1제곱킬로미터이며, Amap 자체 설명에 따르면 단일 소비자용 GPU에서 약 10분 만에 생성된다.
• 입력 — CARI4D 단안 RGB 비디오, MP4 vs ABot-Earth 0.7 위성 이미지 또는 텍스트 프롬프트
• 출력 — CARI4D의 프레임별 인간 포즈 및 형상, 객체 회전 및 이동, 두 개의 손 접촉 로짓 vs ABot-Earth 0.7이라는 3D 가우시안 스플래팅 장면, Unreal Engine 및 Unity로 내보내기 가능
• 분석 단위 — CARI4D는 접촉 상태에 있는 사람 한 명과 강체 물체 하나 vs ABot-Earth 0.7은 도시 규모의 지형, 건물, 식생 및 랜드마크
• 시간적 주장 — CARI4D는 관측된 움직임을 프레임별로 재구성하는 반면, ABot-Earth 0.7은 다음에 일어날 일을 위한 예측 레이어를 갖춘 세계 모델로 포지셔닝된다
• 메트릭 스케일 — CARI4D 메트릭 스케일은 UniDepth와 조대-정밀(coarse-to-fine) 스케일 탐색을 통해 단안 비디오로부터 복원되며, 이와 달리 ABot-Earth 0.7은 위성 이미지로부터 지리참조되어 메트릭 복원 문제가 없음
• 실행 비용 — CARI4D PyTorch는 NVIDIA Ampere GPU에서 실행되며 A100에서 검증되었고, 연구 학습 실행의 경우 8×A100에서 38시간이 걸린 반면, ABot-Earth 0.7은 Amap 자체 비교에 따르면 소비자용 GPU 한 대에서 km²당 약 10분이 걸립니다.

한 행에서 두 열 중 어느 쪽도 다른 쪽보다 낫지 않다는 점에 주목하세요. 이들은 서로 다른 세계를 측정하고 있습니다. 손과 가스 실린더 사이의 접촉점을 복원하는 모델은 건물이 어디에 있는지까지 안다고 해서 개선되지 않으며, 그럴듯한 스카이라인을 생성하는 모델은 보행자의 정확한 손목 각도를 안다고 해서 개선되지 않습니다.
실제로 판가름하는 비대칭
구매자가 첫 한 시간 안에 느끼게 될 차이는 바로 이것이며, 그것은 역량과는 아무런 관련이 없습니다.
CARI4D에는 오늘 바로 받을 수 있는 코드와 가중치가 있습니다. NVlabs 저장소에는 2026년 2월 28일에 공개된 공식 구현이 있으며, 4월 4일에는 학습 코드와 커스텀 비디오 전처리가 추가되었습니다. 사전 학습된 CoCoNet 체크포인트는 Hugging Face에서 다운로드할 수 있고, Docker 이미지 xiexh20/cari4d가 게시되어 있으며, 2026년 8월 30일부터는 상업적 라이선스가 적용된 231M 체크포인트가 nvidia/cari4d_commercial로 NVIDIA Open Model Agreement에 따라 제공되고 있습니다 — 게이트가 걸려 있지만 받을 수는 있습니다. 의존성은 까다로운 부분까지 문서화되어 있습니다: NLF torchscript 가중치, FoundationPose 가중치, SMPL-H 에셋, AGORA의 kid_template.npy, 그리고 객체 메시를 위한 Hunyuan3D입니다. BEHAVE 데모, 제공된 인더와일드 클립, 또는 자신의 비디오에서 추론을 실행할 수 있으며, 함께 제공되는 스크립트로 평가할 수 있습니다.

ABot-Earth 0.7은 그 어느 의미로도 입수할 수 없다. Amap은 모델 가중치도, 모델 카드도, 공개 API도, 가격도, 개발자 문서도 공개하지 않았다. 체험 사이트는 운영 중이지만 Amap은 생성을 초대 전용 또는 허용 목록 방식이라고 설명하며, 인터페이스는 중국어 간체만 지원하고, 0.5 시절 GitHub 저장소에는 기술 보고서만 있었고 실행 가능한 것은 아무것도 없었다고 한다. 모든 대표 수치 — 제곱킬로미터당 10분, 전통적 재구성 대비 약 1,000배 효율, 비용은 약 100분의 1, 196개국 이상 — 는 Amap에서 비롯되었으며 Amap 외부의 누구도 독립적으로 재현하지 못했다. 이는 공급업체가 보고한 수치이며, 현재로서는 그것들이 다른 무엇이 될 수 있는 경로가 없다.
그래서 실질적인 비교는 "어느 모델이 더 나은가"가 아니다. 그것은 이들 중 하나는 상용 라이선스와 Docker 이미지를 갖춘 연구 아티팩트이고, 다른 하나는 언론 보도 주기를 동반한 제품 시연이라는 점이다. 둘 다 정당한 성과다. 다만 빌드에 넣을 수 있는 것은 오직 하나뿐이다.
둘이 진정으로 만날 수 있는 곳
여기에는 실제적인 구성이 있으며, 그것에 대해 구체적으로 말할 가치가 있습니다. 왜냐하면 그것이 이것들이 같은 대화에 속하는 유일한 의미이기 때문입니다.
CARI4D의 출력은 미터 단위의 월드 프레임에서 이루어지는 인간-객체 상호작용이다. ABot-Earth 0.7의 출력은 환경이다. 후자에 전자를 채워 넣으면 어느 쪽도 단독으로는 만들어내지 못하는 결과가 나온다: 사람들이 예술적으로 배치되는 대신 물리적으로 측정되는 행동을 하고 있는, 생성된 도시다. 로보틱스 시뮬레이션, 리테일 레이아웃 기획, 상호작용 데이터셋 생성은 모두 정확히 이 조합을 원한다 — 재생성하기에 충분히 저렴한 환경과, 훈련 대상으로 삼기에 충분히 정확한 인간 모션을.

둘 사이의 접합부는 좌표 변환과 스케일 규약이며, 결코 사소한 문제가 아니다. 왜냐하면 CARI4D의 메트릭 프레임은 단일 카메라를 기준으로 정의되고, ABot-Earth 0.7의 프레임은 지리적 위치로 정의되기 때문이다. 아무도 그 통합을 공개하지 않았다. 그것은 팀이 일주일 만에 만들어 내고도 문서로 남기지 않는 종류의 일이다.
그 파이프라인에서 잊히곤 하는 단계는 원시 상호작용 데이터를 쿼리 가능한 무언가로 바꾸는 부분입니다 — 클립에 캡션을 달고, 접촉 이벤트에 태그를 붙이고, 검색 인덱스를 구축하고, 출력물에 대한 품질 관리 필터를 만드는 일이죠. 그 작업은 비전-언어 모델과 언어 모델을 거쳐 이루어지며, 바로 이것이 OrcaRouter가 담당하는 계층입니다: 하나의 API 뒤에 200개 이상의 모델, 제공업체의 정가를 0% 마크업으로 그대로 전달, 제공업체 성능이 저하될 때 자동 장애 조치, 그리고 캡셔닝과 QC 패스가 별도의 통합이 될 필요 없도록 여러 모델을 단일 호출로 구성하는 라우팅 DSL. CARI4D도 ABot-Earth 0.7도 그곳에서 제공되지 않으며, 둘 다 LLM이 아닙니다 — 하지만 이들을 둘러싼 툴링은 거의 확실히 그렇습니다.
어느 걸 진짜 원해
사람이 물체와 상호작용하는 영상이 있고, 그 사람의 포즈를 미터 단위로 프레임별로 필요로 한다면 CARI4D를 선택하세요. 동작 분석, 로보틱스 인식, 애니메이션 참고 자료, 또는 상호작용 데이터셋 구축을 위해서라면 말입니다. 지금 이용할 수 있고, 문서화되어 있으며, 상업용 라이선스는 2026년 8월 30일에 나왔습니다. 의존성 체인에 대한 예산을 잡고, NVIDIA가 소유하지 않은 부분에 대해서는 라이선스 조건을 읽어 보세요.
액터보다 환경이 필요하다면 ABot-Earth 0.7을 선택하세요 — 위치나 설명으로부터 빠르게 생성되고 게임 엔진으로 내보낼 수 있는 도시 규모 장면입니다. 이것은 도구를 도입하는 것이 아니라 입증된 역량을 평가하는 것임을, 접근은 재량에 달려 있음을, 그리고 효율 수치는 Amap 자체의 것임을 이해하세요.
위에서 설명한 합성 시스템을 구축하는 경우에만 둘 다 선택하고, 이음새(seam)는 직접 작성하게 된다는 점을 알고 시작하세요.
물어볼 가치가 있는 질문은 이 둘 중 어느 쪽이 이기는가가 아니다. 정작 당신이 실제로 만들고 있는 것이 재구성 모델이 필요한지, 생성 모델이 필요한지, 아니면 둘 다 아닌지다 — 그리고 그 질문에 관해서는 이 두 답이 결코 겹치지 않는다.
