Wygenerowana karta bohatera zatytułowana „CARI4D vs ABot-Earth 0.7" z podtytułem „Dwa modele 4D, które nigdy nie konkurują — jeden rekonstruuje, drugi generuje"; dwa panele rozdzielone cienkim separatorem „vs", po lewej oznaczony „CARI4D" z podpisem „Rekonstruuje osobę manipulującą przedmiotem, w skali metrycznej, ze zwykłego wideo" oraz szkieletową dłonią trzymającą szkieletowy sześcian, po prawej oznaczony „ABot-Earth 0.7" z podpisem „Generuje kilometr eksplorowalnego miasta 3D z jednego zdjęcia satelitarnego" oraz szkieletową sylwetką miasta; a także pasek z napisem „Tylko jeden z nich możesz dziś pobrać i uruchomić". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

CARI4D kontra ABot-Earth 0.7: Dwa modele 4D, które nigdy nie konkurują

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeśli szukałeś CARI4D w zestawieniu z ABot-Earth 0.7 spodziewając się bezpośredniego starcia, szczera odpowiedź brzmi: takie porównanie nie istnieje i nie powstanie. Te dwa systemy nie wykonują tej samej pracy, nie przyjmują tych samych danych wejściowych, nie zwracają tego samego wyniku i nigdy nie zostałyby porównane w benchmarku przez kogokolwiek, kto rozumie którykolwiek z nich. CARI4D to niezależna od kategorii rekonstrukcja 4D interakcji człowieka z obiektem autorstwa NVIDIA — obserwuje jedną osobę manipulującą jednym obiektem w zwykłym wideo i odtwarza ich pozycje w skali metrycznej w czasie. ABot-Earth 0.7 to natywny dla 3D miejski model świata firmy Amap — przyjmuje zdjęcie satelitarne lub prompt tekstowy i generuje miasto w skali kilometrowej, które można eksplorować, jako scenę w technologii Gaussian splatting. Powód, dla którego ta strona jednak istnieje, jest taki, że oś, która je dzieli, jest naprawdę użyteczna, a te dwa systemy różnią się znacznie bardziej pod względem tego, co można zrobić z nimi, niż pod względem tego, czym się wydają.

Jest też drugi, bardziej zasadniczy powód. Te dwa wydania znajdują się na przeciwnych krańcach spektrum, które ma większe znaczenie niż jakakolwiek pozycja w specyfikacji: jedno z nich możesz pobrać i uruchomić jeszcze dziś po południu, a drugiego nie możesz uruchomić wcale.

Odpowiedź, której nie chce nikt szukający tego zapytania

Oba są opisywane jako 4D. Oba pochodzą od dużych dostawców. Oba zostały wydane w ciągu ostatniego roku. I na tym mniej więcej kończy się to, co je łączy.

CARI4D rekonstruuje. Na podstawie wideo szacuje, co się tam znajdowało. Artykuł — Niezależna od kategorii rekonstrukcja 4D interakcji człowiek–obiekt autorstwa Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll i Stan Birchfield — ukazał się na arXiv jako 2512.11988 w grudniu 2025 i został przyjęty na CVPR 2026. Jego tematem jest człowiek i sztywny obiekt w kontakcie, a jego kluczowym twierdzeniem jest skala: odzyskiwanie metrycznych wymiarów z kamery monokularowej bez czujnika głębi i bez zestawu wielowidokowego, co było tym, z czym zmagały się wcześniejsze prace.

ABot-Earth 0.7 generuje. Na podstawie georeferencyjnego obrazu satelitarnego lub opisu tekstowego tworzy scenę, która wcześniej nie istniała jako dane. Amap, chińska firma zajmująca się mapami i nawigacją, zaprezentowała go 10 września 2026 r. podczas swojej gali Street Stars w Hangzhou, zastępując ABot-Earth 0.5 z 8 czerwca. Generuje splaty 3D Gaussa, eksportuje do Unreal Engine i Unity oraz obejmuje — jak podaje Amap — ponad 196 krajów i regionów, w porównaniu z ponad 190 w wersji 0.5.

Jeden jest estymatorem. Jeden jest generatorem. Ta różnica znaczy więcej niż jakakolwiek tabela benchmarków.

Osoba i krzesło, albo miasto

Różnica skali to ta, którą ludzie nie doceniają. Jednostką zainteresowania CARI4D jest ludzkie ciało i trzymany w dłoni przedmiot, mierzone w centymetrach, śledzone w klatkach pojedynczego klipu. Jednostką zainteresowania ABot-Earth 0.7 jest kilometr kwadratowy miasta, generowany w ciągu około dziesięciu minut na pojedynczym GPU klasy konsumenckiej, jak podaje sam Amap.

• Dane wejściowe — CARI4D monokularowy film RGB, MP4 vs ABot-Earth 0.7 obraz satelitarny lub prompt tekstowy

• Dane wyjściowe — CARI4D: poza i kształt człowieka dla każdej klatki, obrót i przesunięcie obiektu oraz dwa logity kontaktu dłoni w porównaniu z ABot-Earth 0.7 — scena 3D Gaussian splatting, z możliwością eksportu do Unreal Engine i Unity

• Jednostka analizy — CARI4D jeden człowiek i jeden sztywny obiekt w kontakcie vs ABot-Earth 0.7 teren, budynki, roślinność i punkty orientacyjne w skali miasta

• Twierdzenie temporalne — CARI4D rekonstruuje obserwowany ruch klatka po klatce, podczas gdy ABot-Earth 0.7 jest pozycjonowany jako model świata z warstwą predykcyjną tego, co wydarzy się dalej

• Skala metryczna — skala metryczna CARI4D odtworzona z monokularowego wideo za pomocą UniDepth i przeszukiwania skali od zgrubnego do dokładnego w porównaniu z ABot-Earth 0.7 zgeoreferencjonowanym na podstawie zdjęcia satelitarnego, bez problemu odtwarzania skali metrycznej

• Koszt uruchomienia — CARI4D PyTorch na GPU NVIDIA Ampere, zwalidowany na A100, 38 godzin na 8×A100 w przypadku badawczego przebiegu treningowego w porównaniu z ABot-Earth 0.7, który potrzebuje około dziesięciu minut na km² na jednym GPU klasy konsumenckiej, według własnego porównania Amap

A generated two-column scoreboard titled 'CARI4D vs ABot-Earth 0.7 — the scoreboard'. The CARI4D column lists Task: Reconstructs; Input: Monocular RGB video; Output: Human and object poses, contact logits; Unit of scale: One person, one object; Weights: Downloadable, gated; Evidence: CVPR 2026, vendor-reported. The ABot-Earth 0.7 column lists Task: Generates; Input: Satellite image or text prompt; Output: 3D Gaussian splatting city; Unit of scale: One square kilometre; Weights: None published; Evidence: Vendor-reported, unreproduced. A footer reads 'CARI4D weights are downloadable today; ABot-Earth 0.7 figures are Amap's own, unaudited.' The OrcaRouter logo is composited in the bottom-right corner.

Zauważ, że w pojedynczym wierszu żadna z kolumn nie jest lepsza od drugiej. Mierzą one różne światy. Model, który odtwarza punkt styku między dłonią a butlą gazową, nie zyskuje na tym, że zna również położenie budynków, a model, który generuje wiarygodną panoramę miasta, nie zyskuje na tym, że zna dokładny kąt nadgarstka pieszego.

Asymetria, która tak naprawdę to rozstrzyga

Oto różnica, którą kupujący odczuje w ciągu pierwszej godziny, i nie ma ona nic wspólnego z możliwościami.

CARI4D ma kod i wagi, które możesz zdobyć już dziś. Repozytorium NVlabs zawiera oficjalną implementację, wydaną 28 lutego 2026 r., a 4 kwietnia dodano kod treningowy oraz przetwarzanie wstępne niestandardowego wideo. Wstępnie wytrenowany checkpoint CoCoNet można pobrać z Hugging Face, obraz Dockera xiexh20/cari4d jest opublikowany, a od 30 sierpnia 2026 r. dostępny jest objęty licencją komercyjną checkpoint 231M jako nvidia/cari4d_commercial w ramach NVIDIA Open Model Agreement — z ograniczonym dostępem, ale do uzyskania. Zależności są udokumentowane, w tym te kłopotliwe elementy: wagi torchscript NLF, wagi FoundationPose, zasoby SMPL-H, plik kid_template.npy z AGORA oraz Hunyuan3D do siatek obiektów. Możesz uruchomić wnioskowanie na demo BEHAVE, na udostępnionym klipie z warunków rzeczywistych lub na własnym wideo, i ocenić je za pomocą dołączonych skryptów.

A screenshot of the nvidia/CARI4D model page on Hugging Face, captured September 18 2026, showing the arXiv:2512.11988 tag, the heading 'Model Card - CARI4D', the description of the CoCoNet model and the line 'This model is for research and development only', governing terms listing the NVIDIA License alongside a DINOv2 licence link, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

ABot-Earth 0.7 nie jest dostępny w żadnym z tych sensów. Amap nie opublikował żadnych wag modelu, karty modelu, publicznego API, cennika ani dokumentacji dla deweloperów. Strona z doświadczeniem jest dostępna, ale Amap opisuje generowanie jako tylko na zaproszenie lub dla wpisanych na białą listę, interfejs jest wyłącznie w uproszczonym chińskim, a repozytorium GitHub z ery 0.5 miało zawierać raport techniczny i nic, co dałoby się uruchomić. Każda kluczowa liczba — dziesięć minut na kilometr kwadratowy, około 1000× większa wydajność niż tradycyjna rekonstrukcja, około jednej setnej kosztu, ponad 196 krajów — wywodzi się od Amap i nie została niezależnie odtworzona przez nikogo spoza Amap. To dane raportowane przez dostawcę i obecnie nie istnieje żadna droga, by mogły stać się czymkolwiek innym.

A więc praktyczne porównanie nie polega na tym, „który model jest lepszy”. Chodzi o to, że jeden z nich to artefakt badawczy z licencją komercyjną i obrazem Dockera, a drugi to demonstracja produktu z cyklem prasowym. Oba są prawdziwymi osiągnięciami. Tylko jeden z nich można umieścić w kompilacji.

Gdzie te dwa naprawdę by się spotkały

Jest tu prawdziwa kompozycja i warto być konkretnym na jej temat, ponieważ jest to jedyny sens, w jakim te rzeczy należą do tej samej rozmowy.

Wynik CARI4D to interakcja człowiek–obiekt w metrycznym układzie odniesienia świata. Wynik ABot-Earth 0.7 to środowisko. Wypełnij to drugie tym pierwszym, a otrzymasz coś, czego żadne z nich nie wytwarza w pojedynkę: wygenerowane miasto, w którym ludzie wykonują czynności mierzone fizycznie, a nie umieszczane artystycznie. Symulacja robotyki, planowanie układu przestrzeni handlowej i generowanie zbiorów danych o interakcjach — wszystkie potrzebują dokładnie takiej kombinacji: środowiska wystarczająco taniego, by generować je od nowa, oraz ruchu człowieka wystarczająco dokładnego, by na nim trenować.

A screenshot of the OrcaRouter Models page, captured September 18 2026, headed 'Models' with the subheading '200 models · 16 providers · one API key, one bill', showing the OpenAI-compatible POST endpoint in a 'How to call any model' panel, modality tabs reading Text 165, Image 10, Embeddings 5, Video 10 and TTS 10, prepaid credit plans from USD 50 to USD 1000 per month, and model cards including Orca: OrcaCyber Zero 1.0, Orca: OrcaVerify Text 1.0, DeepSeek V4.1 Flash, OpenAI GPT-6 Astra, Google Gemini 3.8 Flash and Qwen3.8 Max.

Styk między nimi to transformacja współrzędnych i konwencja skali, i nie jest to trywialne, ponieważ metryczny układ odniesienia CARI4D jest zdefiniowany względem pojedynczej kamery, a ten dla ABot-Earth 0.7 — przez geolokalizację. Nikt nie opublikował tej integracji. To coś, co zespół buduje w ciągu tygodnia i nie dokumentuje.

Krok, o którym zapomina się w tym potoku, to część, która zamienia surowe dane interakcyjne w coś, co da się odpytywać — opisywanie klipów, tagowanie zdarzeń kontaktowych, budowanie indeksów wyszukiwania i filtrów kontroli jakości na wynikach. Ta praca przechodzi przez modele wizyjno-językowe i modele językowe, i to jest warstwa, którą obejmuje OrcaRouter: ponad 200 modeli za jednym API, cena katalogowa dostawcy przekazywana dalej przy 0% marży, automatyczne przełączanie awaryjne, gdy dostawca zaczyna działać gorzej, oraz DSL routingu, który komponuje kilka modeli w jedno wywołanie, dzięki czemu opisanie i przebieg kontroli jakości nie muszą być osobnymi integracjami. Ani CARI4D, ani ABot-Earth 0.7 nie są tam udostępniane, podobnie jak żaden LLM — ale narzędzia, którymi je otaczasz, prawie na pewno tak.

Którego właściwie chcesz

Wybierz CARI4D, jeśli masz wideo osoby wchodzącej w interakcję z obiektem i potrzebujesz jej póz w jednostkach metrycznych, klatka po klatce — do analizy ruchu, percepcji robotycznej, referencji animacji lub budowania zbioru danych interakcji. Jest już dostępny, jest udokumentowany, a licencja komercyjna pojawiła się 30 sierpnia 2026 r. Zaplanuj budżet na łańcuch zależności i przeczytaj warunki licencji dotyczące części, które nie należą do NVIDIA.

Wybierz ABot-Earth 0.7, jeśli potrzebujesz środowisk, a nie aktorów — scen w skali miasta generowanych na podstawie lokalizacji lub opisu, szybko i z możliwością eksportu do silnika gry. Pamiętaj, że oceniasz zademonstrowaną możliwość, a nie przyjmujesz narzędzie, że dostęp jest uznaniowy, a dane liczbowe dotyczące wydajności pochodzą od samego Amap.

Wybierz oba tylko wtedy, gdy budujesz opisany powyżej system złożony, i przystępuj do tego ze świadomością, że szew będziesz pisać samodzielnie.

Pytanie, które warto zadać, nie brzmi, które z tych dwóch wygrywa. Brzmi ono: czy to, co faktycznie budujesz, potrzebuje modelu rekonstrukcyjnego, modelu generatywnego, czy żadnego z nich — i w tej kwestii te dwie odpowiedzi nigdy się nie pokrywają.