
CARI4D Commercial: NVIDIA öppnade sin 4D-interaktionsmodell för företag, i tysthet
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Någon gång omkring den 30 augusti 2026 dök det upp ett åtkomstbegränsat arkiv som kallades nvidia/cari4d_commercial på Hugging Face. Dess modellkort beskriver en checkpoint som leverantören kallar "CARI4D CoCoNet Native Momentum Human Rig (MHR)" — ett nätverk med 231 miljoner parametrar som tar en vanlig MP4-video och returnerar, bildruta för bildruta, posen hos en människa och ett stelt objekt som hen hanterar, plus två handkontaktlogits. Licensraden lyder nvidia-open-model-agreement, och kortet anger att modellen är redo för kommersiell eller icke-kommersiell användning. Det är en betydande förändring från CARI4Ds tidigare liv. Forskningsrepot, nvidia/CARI4D, tillhandahåller samma modellfamilj — CoCoNet, 194 miljoner parametrar — under NVIDIA-licensen med orden "endast för forskning och utveckling" tryckta på kortet. Det är skillnaden mellan en artikel du kan läsa och en komponent du kan leverera.
Det som gör detta nyhetsvärt är inte släppet. Det är tystnaden kring det. Detta är inte en lansering: NVIDIA har inte publicerat något blogginlägg, ingen nyhetspost, ingen benchmarktabell och ingen prissättning för cari4d_commercial, och vid skrivandets stund är förvaret endast åtkomligt efter att man accepterat villkor och delat kontaktuppgifter. Allt nedan är läst från de två modellkorten och den offentliga kodutgivningen. Där ett påstående är NVIDIAs eget och inte reproducerat, säger den här artikeln det.
Vad förändrades faktiskt den 30 augusti?
Frestelsen är att kategorisera detta som en licensändring. Det är mer än så. Läs de två korten mot varandra, och tre saker förändrades samtidigt — licensen, storleken på kontrollpunkten och den mänskliga kroppsmodellen under den.
• Parametrar — CARI4D forskningsversion 194M mot CARI4D CoCoNet MHR 231M
• Kontrollpunkt — step031397.pth (31 397 träningssteg) mot versionssträng 2026-08-25-09-35-57, steg 200 000, status "Träningen slutförd"
• Kroppsrigg — SMPL / SMPL-H-pose och form kontra Native Momentum Human Rig (MHR)-parametrar
• Licens — NVIDIA License, "endast forskning och utveckling" vs NVIDIA Open Model Agreement, kommersiell användning tillåten
• Åtkomst — öppen nedladdning kontra spärrad, villkor måste accepteras
• Utdata — uppdaterad SMPL-pose, form, translation, objektrotation och translation, binär handkontakt vs per-frame-objektpose och MHR-residualer, plus två handkontakt-logits

Stegantalet är raden som förtjänar uppmärksamhet. En forskningscheckpoint fryst vid ungefär 31k steg och en produktionscheckpoint som kördes till 200 000 är inte samma objekt med ett annat licenshuvud påhäftat. NVIDIA rapporterar också 231M-siffran som "uppmätt från modelltillståndet vid steg 84 000, exklusive registrerade buffertar", vilket säger dig att kortet beskriver en träningshärstamning snarare än en enda fryst artefakt.
Bytet av kroppsrigg spelar precis lika stor roll för alla som redan har byggt mot CARI4D. Forskningslinjen är genomgående SMPL-baserad – artikelns optimeringstermer regresserar SMPL-pose, form och translation, och koden är beroende av SMPL-H pickle-filer plus en VolumetricSMPL-patch. MHR är en annan parameterisering. Om du skrev integrationskod mot forskningscheckpointens utdatatensorer är det kommersiella kortets utdataform inte direkt utbytbar.
Forskningsreleasen som detta bygger på är åtta månader gammal.
Det är värt att vara precis om tidslinjen, för frasen "ny modell" skulle vara fel här och frasen "gammal modell" skulle också vara fel.
CARI4D-artikeln — Kategoriagnostisk 4D-rekonstruktion av människa–objekt-interaktion, av Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll och Stan Birchfield — lades upp på arXiv den 16 december 2025 som 2512.11988 och antogs till CVPR 2026. Kodsläppet från NVlabs följde den 28 februari 2026. Träningskod och förbearbetning av anpassade videor kom den 4 april. Enligt alla normala måttstockar är forskningslinjen ett färdigt, åtta månader gammalt arbete med en avklarad TODO-lista.

Så den ärliga framställningen är denna: metoden är en gammal nyhet, och den kommersiella artefakten är tre veckor gammal. Om du sökte efter CARI4D i mars och drog slutsatsen att det var en forskningskuriositet med en restriktiv licens, var den slutsatsen korrekt då och är inaktuell nu. Det är hela anledningen till att detta hör hemma i ett nyhetsutrymme.
Vad modellen faktiskt gör, och hur väl
CARI4D rekonstruerar människa–objekt-interaktion i 4D – tre rumsdimensioner plus tid – i metrisk skala, från en enda monokulär RGB-video. Den sista begränsningen är den intressanta. Att återvinna den metriska skalan hos ett föremål som en person håller, från en enda vanlig kamera, utan djupkamera och utan multivy-rigg, är problemet som artikeln kretsar kring.
Pipelinen är en kedja av grundmodeller snarare än ett end-to-end-nätverk: UniDepth för metriskt djup, NLF och GENMO för mänsklig pose, Hunyuan3D för objektmesh från en enda bild, FoundationPose för objektspårning, VolumetricSMPL för en kroppsmodell med signerat avstånd. CoCoNet — den del NVIDIA faktiskt släpper — sitter i mitten och utför kontaktresonemanget. Den renderar den aktuella uppskattningen av människa och objekt till RGB, djup och masker, jämför sedan den renderingen med den verkliga observationen med en DINOv2 ViT-B/14 RGB-kodare och en ViT-S/14 sexkanalig XYZ- och mask-kodare, kör två spatiotemporala uppmärksamhetsblock och regredierar korrigeringar per bildruta genom MLP-huvuden.
De rapporterade siffrorna, från artikeln och leverantörens eget kort: 38 % lägre rekonstruktionsfel än tidigare teknik på datauppsättningar inom distributionen, 36 % på osedda datauppsättningar. Ablationen som gör arkitekturen begriplig anger objektets Chamfer-avstånd till 1 565,42 cm från rå NLF plus FoundationPose-spårning, 16,85 cm efter CARI4D-initialisering, och 11,59 till 11,57 cm när CoCoNet-förfinning och den fullständiga gemensamma optimeringen aktiveras. Det är leverantörssiffror från en peer-reviewad artikel – bättre proveniens än en marknadsföringssida, fortfarande inte en oberoende reproduktion, och ingen tredje part har publicerat någon sådan.
Det kommersiella kortet tillför en detalj som artikeln inte kunde förmedla: modellen tränades på FORM-HOI, som beskrivs som 2 126 interna sekvenser, och kortet säger rent ut att det inte finns någon separat testdatauppsättning – utvärderingen är en kvalitativ demouppsättning. Det påpekar också att den interna träningskorpusen "Daniel" inte distribueras. Läst tillsammans är det en leverantör som talar om för dig att träningsdistributionen är deras och att generaliseringsevidensen är tunnare än vad ablationstabellen antyder.
Vad licensen faktiskt ger, och vad den inte ger
NVIDIA Open Model Agreement är en tillåtande kommersiell licens, men ”kommersiell användning tillåten” är inte samma sak som ”inga skyldigheter”. Modellkortet listar modellen som avsedd för utvecklare och forskare som bygger kommersiella eller icke-kommersiella visionssystem för 3D/4D-uppskattning av människa–objekt-pose, rörelseanalys, visualisering, datakurering och robotikperception, och utesluter uttryckligen direkt autonom aktivering eller livskritiska beslut.

Två praktiska anmärkningar för den som utvärderar detta. För det första är arkivet gated: du accepterar villkor och delar kontaktinformation innan filerna visas, så inköps- och juridisk granskning sker före nedladdningen, inte efter. För det andra är den driftsatta modellen inte fristående. CoCoNet har 231M parametrar, men det körs inte ensamt — den bredare pipelinen hämtar fortfarande NLF torchscript-vikter, FoundationPose-vikter, SMPL-H-tillgångar, en `kid_template.npy`, och den behöver fortfarande Hunyuan3D för att överhuvudtaget producera objektnäten. Den kommersiella licensen täcker den del NVIDIA släpper. Den täcker inte tredjepartsberoendena runt omkring, och vart och ett av dessa har sina egna villkor. Det är det vanligaste sättet en sådan här lansering överraskar ett juridiskt team.
Vad detta innebär för dem som bygger med modeller
För att vara tydlig om omfattningen: CARI4D är en rekonstruktionsmodell för datorseende, inte en språkmodell, och OrcaRouter tillhandahåller den inte. Inget i den här artikeln bör läsas som att det säger något annat — att självhosta den med PyTorch på en GPU av Ampere-klass, vilket är den konfiguration som kortet uppger att den validerades på, är det enda sättet att köra den i dag.
Anledningen till att det fortfarande är värt ett stycke här är att kortet anger datakurering som en primär avsedd användning, och det är den delen av en 4D-pipeline där språkmodeller faktiskt lever. Att bygga ett dataset för människa–objekt-interaktion innebär att texta klipp, märka kontakthändelser, skriva QC-prompter och filtrera bort fel — arbete som går genom vision-språk- och språkmodeller, och arbete som skalas dåligt om vart och ett är ett separat avtal och en separat nyckel. Att dirigera fler än 200 modeller bakom ett enda API hos OrcaRouter, med leverantörens listpris vidarebefordrat med 0 % påslag och automatisk failover när en leverantör försämras, är hur det lagret ser ut när det inte är skräddarsytt. Leverantörers prissänkningar når slutpunkten samma dag, eftersom det inte finns något påslag att räkna om. Det är ett annat jobb än vad CARI4D gör, och det är jobbet som omger det.
Vad skulle ändra den här avläsningen?
Fyra saker. Ett besked från NVIDIA skulle förvandla ett tyst kodförråd till en produkt med support, och med det skulle de pris- och supportvillkor som i dag saknas följa. En publicerad utvärdering på en datamängd som NVIDIA inte har byggt skulle avgöra den generaliseringsfråga som kortet lämnar öppen. Dokumentation av vad MHR ändrar i förhållande till SMPL skulle tala om för befintliga CARI4D-integratörer hur dyr migreringen faktiskt är — just nu namnger kortet riggen utan att förklara deltat. Och ett beslut om tredjepartsberoendena skulle avgöra huruvida "kommersiellt licensierad" betyder vad ett inköpsteam kommer att anta att det betyder.
Fram till dess är den korrekta beskrivningen snäv och oglamorös, och det är den som bevisningen stöder: NVIDIAs CARI4D-linje har haft en kommersiellt licensierad, större och under längre tid tränad checkpoint tillgänglig sedan den 30 augusti 2026, och leverantören har inte sagt ett ord om det. Om du behöver 4D-interaktion mellan människa och objekt i metrisk skala och du hade avfärdat detta som enbart forskning, är hindret du kringgick borta.
