一張生成的主視覺卡片,標題為「CARI4D 悄悄商業化了」,上有一枚寫著「未公告的發布」的徽章;副標題為「NVIDIA 於 2026 年 8 月 30 日開放其 4D 人體與物件互動模型。沒有任何公告。」;三張卡片分別寫著「授權:NVIDIA 開放模型協議」、「檢查點:2.31 億參數,第 200,000 步」與「存取:在 Hugging Face 上需經審核」;一條頁尾橫條寫著「研究脈絡:arXiv 2025 年 12 月,程式碼 2026 年 2 月」;以及一個線框人形舉起一個線框方塊。OrcaRouter 標誌合成於右下角。
Engineering & Research

CARI4D 商用版:NVIDIA 悄然向企業開放其 4D 互動模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

大約在 2026 年 8 月 30 日前後,一個名為nvidia/cari4d_commercial的受限存取儲存庫出現在 Hugging Face 上。其模型卡描述了一個供應商稱為「CARI4D CoCoNet Native Momentum Human Rig (MHR)」的檢查點——一個擁有 2.31 億參數的網路,能接收普通的 MP4 影片,並逐幀回傳一個人與其正在處理的一件剛體物件的姿勢,外加兩個手部接觸 logits。授權條款寫著nvidia-open-model-agreement,且模型卡載明該模型已可供商業或非商業用途使用。這與CARI4D過去的情況相比是一項重大改變。研究儲存庫nvidia/CARI4D提供同一系列的模型——CoCoNet,1.94 億參數——採用 NVIDIA License,且模型卡上印有「僅供研究與開發使用」的字樣。這就是一篇你能閱讀的論文,與一個你能出貨的元件之間的差別。

這件事之所以有新聞價值,不在於發布本身,而在於圍繞它的沉默。這不是一次正式發布:NVIDIA 沒有發布任何部落格文章、沒有新聞室公告、沒有基準測試表,也沒有公布 cari4d_commercial 的定價,而且在撰寫本文時,該儲存庫只有在接受條款並提供聯絡資訊後才能存取。以下所有內容都是從兩份模型卡與公開程式碼發布中解讀而來。若某項說法是 NVIDIA 自己提出且未經重現,本文會如實說明。

8月30日究竟有什麼改變?

很容易把這歸類為授權變更。但事情不只如此。把這兩張卡片對照著讀,就會發現有三件事同時變動——授權、檢查點的大小,以及其下的人體模型。

• 參數 — CARI4D 研究版本 194M 對比 CARI4D CoCoNet MHR 231M

• 檢查點 — step031397.pth(31,397 個訓練步驟)與版本字串 2026-08-25-09-35-57、步驟 200,000、狀態「訓練完成」相比

• 身體骨架 — SMPL / SMPL-H 的姿態與身形對比原生 Momentum Human Rig (MHR) 參數

• 授權 — NVIDIA 授權條款,「僅限研究與開發」 vs NVIDIA 開放模型協議,允許商業使用

• 存取 — 開放下載 vs 需通過閘門,必須接受條件

輸出 — 更新後的 SMPL 姿勢、形狀、平移,物體旋轉與平移,二元手部接觸對比逐幀物體姿勢與 MHR 殘差,以及兩個手部接觸 logits

A single-column generated infographic titled 'CARI4D — the scoreboard', listing 'Commercial checkpoint: 231M parameters, step 200,000', 'Research checkpoint: 194M, step 31,397', 'Licence: NVIDIA Open Model Agreement, commercial use', 'Access: gated, terms must be accepted', 'Body rig: Native Momentum Human Rig (MHR)' and 'Independent score: none yet', above a footer reading 'NVIDIA figures from the vendor's own model cards; no independent reproduction.' The OrcaRouter logo is composited in the bottom-right corner.

步數才是值得注意的那一行。一個凍結在約 31k 步的研究檢查點,和一個跑到 200,000 步的正式環境檢查點,並不是同一個物件再釘上不同的授權標頭而已。NVIDIA 也把 231M 這個數字註明為「在第 84,000 步的模型狀態下量測,排除已註冊緩衝區」,這說明了這張卡描述的是訓練譜系,而不是單一凍結的產物。

身體骨架替換對任何已經以 CARI4D 為基礎開發的人來說也同樣重要。整條研究路線從頭到尾都基於 SMPL——論文的最佳化項會對 SMPL 的姿勢、形狀與平移進行迴歸,而程式碼依賴 SMPL-H pickle 檔以及 VolumetricSMPL 修補程式。MHR 是不同的參數化方式。如果你撰寫的整合程式碼是針對研究 checkpoint 的輸出張量,商業版的輸出形狀並非可直接替換。

這項成果所依據的研究版本已經發布八個月了

值得把時間線說得精確一點,因為在這裡「新模式」這個說法會是錯的,而「舊模式」這個說法也一樣不對。

CARI4D 論文——類別無關的人–物互動 4D 重建,由 Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll 與 Stan Birchfield 撰寫,於 2025 年 12 月 16 日以 2512.11988 登上 arXiv,並獲 CVPR 2026 接受。NVlabs 的程式碼釋出隨後於 2026 年 2 月 28 日推出。訓練程式碼與自訂影片前處理則於 4 月 4 日上線。依任何正常標準來看,這條研究路線都是一項已定案、歷時八個月、且待辦清單已完成的成果。

A screenshot of the NVlabs/CARI4D GitHub repository, captured September 18 2026, showing the README heading 'CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction', the Project Page and arXiv links, the line 'This is the official implementation of our CVPR paper CARI4D', the author list, a source file listing including learning, docker, prep, scripts and tools, and a sidebar showing Python 99.9%, 216 stars, 24 forks and no releases published.

所以,誠實的表述是這樣:方法已是舊聞,而商業成品問世才三週。如果你在三月搜尋 CARI4D,並認定它是個授權條款嚴格的研究新奇事物,那麼那個結論在當時是正確的,如今則已過時。這正是它該出現在新聞版位的全部原因。

模型實際做什麼,以及做得如何

CARI4D 以單一單眼 RGB 影片,在公制尺度下重建人與物件的互動於 4D——三維空間加上時間。最後那項限制才是有意思的地方。從一部普通相機、沒有深度感測器、也沒有多視角裝置,還原一個人手中所持物件的公制尺度,正是這篇論文所圍繞的核心問題。

這條管線並非單一的端到端網路,而是一連串基礎模型:用 UniDepth 取得公制深度,用 NLF 與 GENMO 取得人體姿態,用 Hunyuan3D 從單張影像生成物件網格,用 FoundationPose 進行物件追蹤,用 VolumetricSMPL 建立有號距離人體模型。CoCoNet——也就是 NVIDIA 實際釋出的部分——位於中間,負責接觸推理。它會將當前的人體與物件估計渲染成 RGB、深度與遮罩,再以 DINOv2 ViT-B/14 RGB 編碼器與 ViT-S/14 六通道 XYZ 加遮罩編碼器,將該渲染結果與真實觀測相比較,執行兩個時空注意力區塊,並透過 MLP 頭迴歸出逐幀修正。

論文中與廠商自家規格卡所報告的數字:在分布內資料集上,重建誤差比先前技術低 38%;在未見資料集上低 36%。那項讓此架構變得可理解的消融實驗顯示,物件 Chamfer 距離在原始 NLF 加上 FoundationPose 追蹤下為 1,565.42 公分,CARI4D 初始化後為 16.85 公分,而一旦啟用 CoCoNet 細化與完整聯合最佳化,則為 11.59 至 11.57 公分。這些是來自同儕審查論文的廠商數據——出處比行銷頁面更可靠,但仍不是獨立重現,且沒有第三方發表過獨立重現結果。

商業模型卡補充了論文無法提供的細節:該模型是在 FORM-HOI 上訓練的,其描述為 2,126 個內部序列,而模型卡明確指出沒有獨立的測試資料集——評估用的是一組質性示範集。它也指出內部的「Daniel」訓練語料庫並未對外發布。合起來看,這是廠商在告訴你:訓練資料分布是他們自家的,而泛化證據比消融表所顯示的更薄弱。

授權條款實際授予什麼,以及它不授予什麼

NVIDIA 開放模型協議是一份寬鬆的商業授權,但「允許商業使用」不等同於「毫無義務」。該模型卡將此模型列為適合開發者與研究人員打造商業或非商業視覺系統,用於 3D/4D 人物-物件姿態估計、動作分析、視覺化、資料策展與機器人感知,並明確排除直接自主致動或生命關鍵決策。

A screenshot of the nvidia/cari4d_commercial model page on Hugging Face, captured September 18 2026, showing the licence tag 'nvidia-open-model-agreement', the gate notice reading 'You need to agree to share your contact information to access this model', the heading 'CARI4D CoCoNet Native MHR Overview', the description stating the model 'is ready for commercial or non-commercial use', the governing terms naming the NVIDIA Open Model Agreement, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

給任何評估這項發布的人兩點實用提醒。首先,該儲存庫設有管制:你必須在檔案出現之前接受條件並提供聯絡資訊,因此採購與法務審查是在下載之前發生,而不是之後。其次,所部署的模型並非獨立自足。CoCoNet 有 2.31 億個參數,但它無法單獨運行——整體流程仍會拉取 NLF torchscript 權重、FoundationPose 權重、SMPL-H 資產、一個 `kid_template.npy`,而且它一開始仍需要 Hunyuan3D 來產生物件網格。商業授權涵蓋的是 NVIDIA 所發布的部分。它並不涵蓋其周邊的第三方依賴項目,而這些依賴各自帶有自身的條款。這就是這類發布最常讓法務團隊措手不及的方式。

這對使用模型開發的人來說意味著什麼

直接講清楚範圍:CARI4D 是電腦視覺重建模型,不是語言模型,而 OrcaRouter 並不提供它。本文中沒有任何內容應被解讀為與此相反的說法——用 PyTorch 在 Ampere 等級的 GPU 上自行架設,也就是該卡所稱經過驗證的配置,是現今唯一能執行它的方式。

這裡仍然值得用一段來說明,是因為這張卡把 資料策展列為主要的預期用途之一,而這正是 4D 流程中語言模型真正派得上用場的部分。建立人機互動資料集意味著要為影片片段下字幕、標註接觸事件、撰寫品管提示詞、過濾失敗案例——這些工作全都得經過視覺語言模型與語言模型,而且如果每一項都是獨立合約、獨立金鑰,規模化就會慘不忍睹。在 OrcaRouter 把超過 200 個模型調度到單一 API 之後,以 0% 加成原封不動轉嫁供應商的定價,並在供應商服務降級時自動容錯移轉,這就是這一層不必客製化時的樣子。供應商降價當天就會反映到端點上,因為沒有加成需要重新推算。這和 CARI4D 做的工作不同,而它是圍繞著 CARI4D 的那一層工作。

什麼會改變這個讀數?

四件事。NVIDIA 的一項公告,將能把一個沉寂的儲存庫變成受支援的產品,並隨之帶來目前所欠缺的定價與支援條款。一份在 NVIDIA 並未自行建立的資料集上發表的評估,將能解決模型卡所留下的泛化問題。關於 MHR 相對於 SMPL 有何變動的文件,將能告訴現有的 CARI4D 整合者,實際的遷移成本有多高——目前模型卡只列出該骨架,卻未解釋差異。而對第三方相依性的決議,將決定「商業授權」是否就是採購團隊會假設的意思。

在那之前,正確的描述既狹隘又不起眼,而且這正是證據所支持的那一種:NVIDIA 的 CARI4D 系列自 2026 年 8 月 30 日起,就已提供一個商業授權、更大、訓練更久的檢查點,而廠商對此隻字未提。如果你需要公制尺度下的 4D 人與物件互動,而且你曾把它當成僅供研究而放棄,那麼你一直設法繞過的那個障礙已經消失了。