
CARI4D Commercial: NVIDIA po cichu udostępniła biznesowi swój 4D Interaction Model
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Gdzieś około 30 sierpnia 2026 r. w Hugging Face zamknięte repozytorium o nazwie nvidia/cari4d_commercial pojawiło się. Jego karta modelu opisuje checkpoint, który dostawca nazywa „CARI4D CoCoNet Native Momentum Human Rig (MHR)” — sieć o 231 milionach parametrów, która przyjmuje zwykły film MP4 i zwraca, klatka po klatce, pozę jednej osoby i jednego sztywnego obiektu, którym ta osoba manipuluje, a także dwa logity kontaktu dłoni. Wiersz licencji brzmi nvidia-open-model-agreement, a karta stwierdza, że model jest gotowy do użytku komercyjnego lub niekomercyjnego. To znacząca zmiana w porównaniu z poprzednim życiem CARI4D. Repozytorium badawcze, nvidia/CARI4D, dostarcza tę samą rodzinę modeli — CoCoNet, 194 mln parametrów — na licencji NVIDIA z napisem „tylko do badań i rozwoju” na karcie. To różnica między artykułem, który można przeczytać, a komponentem, który można wdrożyć.
To, co czyni z tego newsa, to nie samo wydanie. Tym czymś jest cisza wokół niego. To nie jest premiera: NVIDIA nie opublikowała żadnego wpisu na blogu, żadnej notki w newsroomie, żadnej tabeli wyników ani cennika dla cari4d_commercial, a w chwili pisania tego tekstu repozytorium jest osiągalne dopiero po zaakceptowaniu warunków i podaniu danych kontaktowych. Wszystko poniżej odczytano z dwóch kart modeli i publicznego wydania kodu. Tam, gdzie twierdzenie pochodzi od samej NVIDIA i nie zostało odtworzone, artykuł to odnotowuje.
Co właściwie zmieniło się 30 sierpnia?
Pokusa jest taka, żeby zaklasyfikować to jako zmianę licencji. To coś więcej. Zestaw ze sobą obie karty, a trzy rzeczy zmieniły się naraz — licencja, rozmiar punktu kontrolnego i model ludzkiego ciała, który się pod tym kryje.
• Parametry — wersja badawcza CARI4D 194M vs CARI4D CoCoNet MHR 231M
• Punkt kontrolny — step031397.pth (31 397 kroków treningowych) vs ciąg wersji 2026-08-25-09-35-57, krok 200 000, status „Trening zakończony”
• Rig ciała — poza i kształt SMPL / SMPL-H vs parametry Native Momentum Human Rig (MHR)
• Licencja — licencja NVIDIA, „wyłącznie badania i rozwój" vs NVIDIA Open Model Agreement, dozwolone użycie komercyjne
• Dostęp — pobieranie otwarte vs za bramką, warunki muszą zostać zaakceptowane
• Wyjścia — zaktualizowana poza SMPL, kształt, translacja, rotacja i translacja obiektu, binarny kontakt dłoni vs poza obiektu na klatkę i reszty MHR, plus dwa logity kontaktu dłoni

Liczba kroków to wiersz, który zasługuje na uwagę. Badawczy checkpoint zamrożony na około 31 tys. kroków i produkcyjny checkpoint, który dotarł do 200 000, to nie ten sam obiekt z doczepionym innym nagłówkiem licencji. NVIDIA podaje również wartość 231M jako „zmierzoną na podstawie stanu modelu z kroku 84 000, z wyłączeniem zarejestrowanych buforów”, co wskazuje, że karta opisuje rodowód treningowy, a nie pojedynczy zamrożony artefakt.
Podmiana riga ciała ma równie duże znaczenie dla każdego, kto już tworzył integracje z CARI4D. Linia badawcza jest w całości oparta na SMPL — składniki optymalizacji z artykułu regresują pozę, kształt i translację SMPL, a kod zależy od plików pickle SMPL-H oraz łatki VolumetricSMPL. MHR to inna parametryzacja. Jeśli pisałeś kod integracyjny pod tensory wyjściowe checkpointu badawczego, kształt wyjściowy karty komercyjnej nie jest zamiennikiem drop-in.
Wydanie badawcze, na którym to zbudowano, ma osiem miesięcy.
Warto zachować precyzję, jeśli chodzi o os czasu, ponieważ określenie „nowy model” byłoby tu błędne, a określenie „stary model” również byłoby błędne.
Artykuł CARI4D — Niezależna od kategorii rekonstrukcja 4D interakcji człowiek–obiekt, autorstwa Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll i Stan Birchfield — pojawił się na arXiv 16 grudnia 2025 r. jako 2512.11988 i został przyjęty na CVPR 2026. Wydanie kodu NVlabs nastąpiło 28 lutego 2026 r. Kod treningowy i przetwarzanie wstępne niestandardowych wideo trafiły 4 kwietnia. Według wszelkich normalnych standardów ta linia badawcza jest ugruntowaną, ośmiomiesięczną pracą z ukończoną listą TODO.

Mówiąc uczciwie, sprawa wygląda tak: metoda to stare wieści, a artefakt komercyjny ma trzy tygodnie. Jeśli szukałeś CARI4D w marcu i doszedłeś do wniosku, że to ciekawostka badawcza z restrykcyjną licencją, ten wniosek był wtedy słuszny, a teraz jest nieaktualny. To jest cały powód, dla którego to należy do rubryki wiadomości.
Co model faktycznie robi i jak dobrze sobie radzi
CARI4D rekonstruuje interakcję człowieka z obiektem w 4D — trzy wymiary przestrzeni plus czas — w skali metrycznej, na podstawie pojedynczego monokularowego nagrania RGB. To ostatnie ograniczenie jest szczególnie interesujące. Odtworzenie skali metrycznej obiektu, który trzyma człowiek, na podstawie jednej zwykłej kamery, bez czujnika głębi i bez układu wielowidokowego, to problem, wokół którego zbudowano tę pracę.
Pipeline to łańcuch modeli bazowych, a nie jedna sieć end-to-end: UniDepth do głębi metrycznej, NLF i GENMO do pozy człowieka, Hunyuan3D do siatek obiektów z pojedynczego obrazu, FoundationPose do śledzenia obiektów, VolumetricSMPL do modelu ciała z funkcją pola odległości ze znakiem. CoCoNet — część, którą NVIDIA faktycznie udostępnia — znajduje się pośrodku i wykonuje wnioskowanie o kontakcie. Renderuje bieżące oszacowanie człowieka i obiektu do RGB, głębi i masek, a następnie porównuje ten render z rzeczywistą obserwacją za pomocą enkodera RGB DINOv2 ViT-B/14 oraz enkodera sześciokanałowego XYZ-i-maska ViT-S/14, uruchamia dwa bloki uwagi czasoprzestrzennej i regresuje korekty dla każdej klatki przez głowice MLP.
Podane liczby, z artykułu i własnej karty dostawcy: o 38% niższy błąd rekonstrukcji niż wcześniejsze rozwiązania na zbiorach danych w rozkładzie, o 36% na niewidzianych zbiorach danych. Ablacja, która czyni architekturę czytelną, podaje odległość Chamfera dla obiektu na 1 565,42 cm przy surowym NLF plus śledzenie FoundationPose, 16,85 cm po inicjalizacji CARI4D oraz od 11,59 do 11,57 cm, gdy włączone zostaną dopracowanie CoCoNet i pełna wspólna optymalizacja. To liczby dostawcy z recenzowanego artykułu — lepsze pochodzenie niż strona marketingowa, wciąż jednak nie niezależna reprodukcja, a żaden podmiot trzeci takiej nie opublikował.
Komercyjna karta dodaje szczegół, którego artykuł nie mógł dodać: model wytrenowano na FORM-HOI, opisanym jako 2 126 wewnętrznych sekwencji, a karta wprost stwierdza, że nie istnieje osobny zbiór testowy — ewaluacja odbywa się na jakościowym zbiorze demonstracyjnym. Zauważa też, że wewnętrzny korpus treningowy „Daniel” nie jest udostępniany. Czytane razem, to dostawca mówiący ci, że rozkład danych treningowych należy do niego, a dowody na generalizację są słabsze, niż sugeruje tabela ablacji.
Co licencja faktycznie przyznaje, a czego nie
NVIDIA Open Model Agreement to permisywna licencja komercyjna, ale „dozwolone użycie komercyjne” nie jest tym samym co „brak zobowiązań”. Karta wymienia model jako przeznaczony dla deweloperów i badaczy tworzących komercyjne lub niekomercyjne systemy wizyjne do szacowania pozy człowieka i obiektów w 3D/4D, analizy ruchu, wizualizacji, kuracji danych i percepcji robotycznej, i wyraźnie wyklucza bezpośrednie autonomiczne sterowanie lub decyzje krytyczne dla życia.

Dwie praktyczne uwagi dla każdego, kto to ocenia. Po pierwsze, dostęp do repozytorium jest warunkowany: akceptujesz warunki i podajesz dane kontaktowe, zanim pojawią się pliki, więc przegląd zakupowy i prawny odbywa się przed pobraniem, a nie po nim. Po drugie, wdrożony model nie jest samowystarczalny. CoCoNet ma 231 mln parametrów, ale nie działa sam — szerszy pipeline nadal pobiera wagi NLF torchscript, wagi FoundationPose, zasoby SMPL-H, plik `kid_template.npy`, a do tego wciąż potrzebuje Hunyuan3D, aby w ogóle wytworzyć siatki obiektów. Licencja komercyjna obejmuje część, którą udostępnia NVIDIA. Nie obejmuje jednak zależności firm trzecich wokół niej, a każda z nich ma własne warunki. To najczęstszy sposób, w jaki takie wydanie potrafi zaskoczyć dział prawny.
Co to oznacza dla osób budujących z modelami
Mówiąc wprost o zakresie: CARI4D to model rekonstrukcji oparty na wizji komputerowej, a nie model językowy, i OrcaRouter go nie obsługuje. Niczego w tym artykule nie należy rozumieć jako twierdzenia przeciwnego — samodzielne hostowanie go z PyTorch na GPU klasy Ampere, czyli w konfiguracji, w której według karty został zweryfikowany, to jedyny sposób, aby uruchomić go dziś.
Powód, dla którego wciąż warto poświęcić mu tutaj akapit, jest taki, że karta wymienia kuration danych jako główne zamierzone zastosowanie, i to jest ta część potoku 4D, w której tak naprawdę żyją modele językowe. Zbudowanie zbioru danych dotyczących interakcji człowiek-obiekt oznacza opisywanie klipów, etykietowanie zdarzeń kontaktu, pisanie promptów QC i filtrowanie błędów — praca, która przechodzi przez modele wizyjno-językowe i językowe, i która źle się skaluje, jeśli każdy z nich to osobny kontrakt i osobny klucz. Routing ponad 200 modeli za pośrednictwem jednego API w OrcaRouter, z ceną katalogową dostawcy przekazywaną przy 0% marży i automatyczne przełączanie awaryjne, gdy dostawca ulega degradacji, to właśnie tak wygląda ta warstwa, gdy nie jest robiona na zamówienie. Obniżki cen dostawców docierają do endpointu tego samego dnia, ponieważ nie ma marży do ponownego wyliczenia. To inna praca niż to, co robi CARI4D, i to jest praca, która ją otacza.
Co zmieniłoby ten odczyt?
Cztery rzeczy. Ogłoszenie firmy NVIDIA przekształciłoby ciche repozytorium w produkt objęty wsparciem, a wraz z nim pojawiłyby się warunki cenowe i warunki wsparcia, których obecnie brakuje. Opublikowana ewaluacja na zbiorze danych, którego NVIDIA nie stworzyła, rozstrzygnęłaby kwestię generalizacji, którą karta pozostawia otwartą. Dokumentacja tego, co MHR zmienia względem SMPL, powiedziałaby istniejącym integratorom CARI4D, jak kosztowna jest w rzeczywistości migracja — obecnie karta podaje nazwę riga, nie wyjaśniając różnicy. A rozstrzygnięcie w sprawie zależności firm trzecich zdecydowałoby, czy „licencjonowany komercyjnie” oznacza to, co zespół ds. zakupów założy, że oznacza.
Do tego czasu właściwy opis jest wąski i nieefektowny, i to ten, który potwierdzają dowody: linia CARI4D firmy NVIDIA ma od 30 sierpnia 2026 r. dostępny komercyjnie licencjonowany, większy, dłużej trenowany checkpoint, a dostawca nie powiedział o tym ani słowa. Jeśli potrzebujesz interakcji człowiek–obiekt 4D w skali metrycznej i spisałeś to na straty jako wyłącznie badawcze, przeszkoda, którą obchodziłeś, zniknęła.
