『CARI4D Went Commercial — Quietly』と題された生成ヒーローカード。『UNANNOUNCED RELEASE』と記されたバッジ。サブタイトルは『NVIDIA opened its 4D human-object interaction model on August 30, 2026. No announcement.』。3枚のカードにはそれぞれ『Licence: NVIDIA Open Model Agreement』『Checkpoint: 231M parameters, step 200,000』『Access: gated on Hugging Face』と記されている。フッター帯には『The research line: arXiv Dec 2025, code Feb 2026』。そしてワイヤーフレームの人間がワイヤーフレームの箱を持ち上げている。OrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

CARI4D Commercial:NVIDIA、4D Interaction Modelを企業向けにひっそりと公開

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月30日ごろ、nvidia/cari4d_commercialというゲート付きリポジトリが Hugging Face に登場した。そのモデルカードには、ベンダーが「CARI4D CoCoNet Native Momentum Human Rig(MHR)」と呼ぶチェックポイントが記載されている。2億3,100万パラメータのネットワークで、普通の MP4 動画を入力すると、1人の人物と、その人物が扱っている1つの剛体オブジェクトのポーズをフレームごとに返し、さらに2つの手の接触ロジットも出力する。ライセンスの行にはnvidia-open-model-agreementと記されており、カードにはこのモデルが商用・非商用のいずれでも利用可能と明記されている。これはCARI4Dのこれまでの姿からの大きな変化だ。研究用リポジトリnvidia/CARI4Dは同じモデルファミリー——CoCoNet、1億9,400万パラメータ——を NVIDIA License の下で提供しており、カードには「研究開発専用」と記されている。これは、読める論文と出荷できるコンポーネントの違いである。

これをニュース価値のあるものにしているのは、リリースそのものではない。それは周囲の沈黙だ。これはローンチではない。NVIDIAはブログ投稿も、ニュースルーム記事も、ベンチマーク表も、cari4d_commercialの価格も公開していない。執筆時点で、リポジトリは利用規約に同意し連絡先情報を提供した後にのみアクセスできる。以下はすべて、2つのモデルカードと公開コードリリースから読み取ったものである。NVIDIA自身の主張であり、再現されていないものについては、本記事はその旨を明記する。

8月30日に実際に何が変わったのか

それをライセンス変更として片付けてしまいたくなる。だが、話はそれだけではない。二つのカードを突き合わせて読めば、三つのものが同時に動いたことがわかる——ライセンス、チェックポイントの規模、そしてその下にある人体モデルだ。

• パラメータ — CARI4D 研究リリース 194M vs CARI4D CoCoNet MHR 231M

• チェックポイント — step031397.pth(トレーニング31,397ステップ)対 バージョン文字列 2026-08-25-09-35-57、ステップ200,000、ステータス「トレーニング完了」

• ボディリグ — SMPL / SMPL-H のポーズとシェイプ 対 ネイティブ Momentum Human Rig(MHR)パラメータ

• ライセンス — NVIDIA License、「研究開発のみ」対 NVIDIA Open Model Agreement、商用利用可能

• アクセス — オープンダウンロードかゲート付きか、条件への同意が必須

• 出力 — 更新されたSMPLポーズ、形状、並進、オブジェクトの回転と並進、バイナリ手接触 対 フレームごとのオブジェクトポーズとMHR残差、さらに2つの手接触ロジット

A single-column generated infographic titled 'CARI4D — the scoreboard', listing 'Commercial checkpoint: 231M parameters, step 200,000', 'Research checkpoint: 194M, step 31,397', 'Licence: NVIDIA Open Model Agreement, commercial use', 'Access: gated, terms must be accepted', 'Body rig: Native Momentum Human Rig (MHR)' and 'Independent score: none yet', above a footer reading 'NVIDIA figures from the vendor's own model cards; no independent reproduction.' The OrcaRouter logo is composited in the bottom-right corner.

注目に値するのは、ステップ数の行だ。およそ31kステップで凍結された研究用チェックポイントと、200,000まで実行された本番用チェックポイントは、異なるライセンスヘッダーを後付けしただけの同一オブジェクトではない。NVIDIAはまた、231Mという数値について「step-84,000のモデル状態から測定され、登録済みバッファは除外されている」と報告しており、これはそのカードが単一の凍結された成果物ではなく、トレーニングの系譜を説明していることを示している。

ボディリグの差し替えは、すでに CARI4D を前提に構築した人にとっても同じくらい重要です。研究系のラインは全体を通して SMPL ベースです — 論文の最適化項は SMPL のポーズ、形状、並進を回帰し、コードは SMPL-H の pickle ファイルと VolumetricSMPL パッチに依存しています。MHR は別のパラメータ化です。研究チェックポイントの出力テンソルに対して統合コードを書いたのであれば、商用カードの出力形状はそのまま差し替えられるものではありません。

これが基づいている研究リリースは8か月前のものです

ここでは時間の流れについて正確に述べておく価値がある。というのも、ここで「新しいモデル」という表現は誤りであり、「古いモデル」という表現もまた誤りだからだ。

CARI4D論文 — 人間と物体のインタラクションのカテゴリ非依存4D再構成、Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll、Stan Birchfield による — は2025年12月16日に2512.11988としてarXivに公開され、CVPR 2026に採択された。NVlabsによるコード公開は2026年2月28日に続いた。学習コードとカスタム動画の前処理は4月4日に公開された。通常の判断基準で言えば、この研究ラインはTODOリストが完了した、8か月前に決着済みの研究成果である。

A screenshot of the NVlabs/CARI4D GitHub repository, captured September 18 2026, showing the README heading 'CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction', the Project Page and arXiv links, the line 'This is the official implementation of our CVPR paper CARI4D', the author list, a source file listing including learning, docker, prep, scripts and tools, and a sidebar showing Python 99.9%, 216 stars, 24 forks and no releases published.

正直に言えばこうだ:手法はすでに古い話であり、商用成果物は3週間前のものだ。もし3月にCARI4Dを検索して、制限的なライセンスを伴う研究上の珍しい対象だと結論づけていたなら、その結論は当時は正しく、今では陳腐化している。それこそが、これがニュース枠に入るべき理由のすべてだ。

モデルが実際に何をするのか、そしてどの程度うまくやるのか

CARI4Dは、単一の単眼RGB動画から、メートルスケールで、人と物体のインタラクションを4D——空間の3次元と時間——で再構成する。その最後の制約こそが興味深い点だ。人が持っている物体のメートルスケールを、深度センサーも多視点リグも使わず、1台の通常のカメラから復元することこそ、この論文が中心に据えている問題である。

このパイプラインは、単一のエンドツーエンドネットワークではなく、基盤モデルの連鎖である。メトリック深度には UniDepth、人間のポーズには NLF と GENMO、単一画像からのオブジェクトメッシュには Hunyuan3D、オブジェクト追跡には FoundationPose、符号付き距離ボディモデルには VolumetricSMPL を使う。NVIDIA が実際に公開している部分である CoCoNet は、その中間に位置し、接触推論を担う。現在の人間とオブジェクトの推定を RGB、深度、マスクにレンダリングし、そのレンダリングを実際の観測と、DINOv2 ViT-B/14 RGB エンコーダーおよび ViT-S/14 の6チャンネル XYZ・マスクエンコーダーを使って比較し、2つの時空間アテンションブロックを実行し、MLP ヘッドを通じてフレームごとの補正を回帰する。

報告されている数値は、論文とベンダー自身のカードによるもので、分布内データセットでは先行技術より再構成誤差が38%低く、未見データセットでは36%低い。アーキテクチャを読み解けるようにするアブレーションでは、物体Chamfer距離は生のNLF+FoundationPoseトラッキングで1,565.42 cm、CARI4D初期化後で16.85 cm、CoCoNetリファインメントと完全な同時最適化を有効にすると11.59~11.57 cmになる。これらは査読済み論文に基づくベンダー公表値であり、マーケティングページより出所は確かだが、依然として独立した再現ではなく、第三者による再現は公表されていない。

商用カードは、論文には加えられなかった詳細を補っている。モデルは、2,126件の内部シーケンスと説明されるFORM-HOIで訓練された。そしてカードは、別個のテストデータセットは存在せず、評価は定性的なデモセットであると明言している。また、内部の「Daniel」訓練コーパスは配布されていないとも記している。併せて読むと、これはベンダーが訓練分布は自社のものだと告げていることであり、汎化の証拠はアブレーション表が示唆するよりも薄いということだ。

ライセンスが実際に付与するもの、および付与しないもの

NVIDIA Open Model Agreement は寛容な商用ライセンスですが、「商用利用可」は「義務なし」と同じではありません。モデルカードには、このモデルが、3D/4D の人物-物体ポーズ推定、動作解析、可視化、データキュレーション、ロボティクス知覚のための商用または非商用のビジョンシステムを構築する開発者や研究者を対象としていることが記載されており、直接的な自律作動や生命に関わる判断は明示的に除外されています。

A screenshot of the nvidia/cari4d_commercial model page on Hugging Face, captured September 18 2026, showing the licence tag 'nvidia-open-model-agreement', the gate notice reading 'You need to agree to share your contact information to access this model', the heading 'CARI4D CoCoNet Native MHR Overview', the description stating the model 'is ready for commercial or non-commercial use', the governing terms naming the NVIDIA Open Model Agreement, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

これを評価する人向けの実用的な注意点が2つある。第一に、リポジトリはゲート制だ。ファイルが表示される前に条件に同意し、連絡先情報を提供する必要がある。つまり、調達と法務のレビューはダウンロードの後ではなく、前に起こる。第二に、デプロイされたモデルは自己完結していない。CoCoNetは2億3100万パラメータだが、単体では動作しない。より広いパイプラインは依然としてNLF torchscriptの重み、FoundationPoseの重み、SMPL-Hのアセット、`kid_template.npy`を取得し、そもそもオブジェクトメッシュを生成するためにHunyuan3Dを必要とする。商用ライセンスが対象とするのは、NVIDIAがリリースしている部分だけだ。その周辺のサードパーティ依存関係は対象外であり、それぞれに独自の条件がある。これが、このようなリリースが法務チームを驚かせる最もよくあるパターンだ。

モデルを使って構築する人々にとって、これがどこに位置づけられるか

範囲について率直に言うと、CARI4Dはコンピュータビジョンの再構成モデルであり、言語モデルではありません。また、OrcaRouterはそれを提供していません。この記事のいかなる部分も、それに反することを述べていると読まれるべきではありません——カードが検証済みとしている構成である、AmpereクラスのGPU上でPyTorchを使ってセルフホストすることが、今日それを実行する唯一の方法です。

ここでなお一段落を割く価値があるのは、このカードがデータキュレーションを主たる想定用途として挙げているからであり、それこそが4Dパイプラインのうち、言語モデルが実際に生きている部分である。人間と物体のインタラクションのデータセットを構築するとは、クリップへのキャプション付け、接触イベントのラベリング、QCプロンプトの作成、失敗事例のフィルタリングを意味する——ビジョン言語モデルと言語モデルを通る作業であり、それぞれが別々の契約と別々のキーであれば、まったくスケールしない作業である。OrcaRouterで200を超えるモデルを単一のAPIの背後にルーティングし、プロバイダーの定価を0%のマークアップでそのまま通し、プロバイダーが性能劣化したときの自動フェイルオーバーを備えること——それが、このレイヤーがオーダーメイドでないときの姿である。ベンダーの値下げは、再計算すべきマークアップが存在しないため、同じ日のうちにエンドポイントへ届く。それはCARI4Dが行っていることとは別の仕事であり、そしてそれを取り囲む仕事である。

何がこの読みを変えるだろうか

四点。NVIDIAの発表があれば、ひっそりとしたリポジトリはサポート対象製品に変わり、それに伴って、現在は欠けている価格とサポート条件も付いてくる。NVIDIAが構築していないデータセットでの評価が公開されれば、このカードが未解決のままにしている汎化の疑問に決着がつく。MHRがSMPLと比べて何を変えるのかを文書化すれば、既存のCARI4Dインテグレーターに、移行が実際どれほど高コストかを伝えられる——現時点では、カードはリグの名前を挙げているだけで、差分を説明していない。そして、サードパーティ依存関係についての決着がつけば、「商用ライセンス」が調達チームの想定する意味を本当に持つのかどうかが決まる。

それまでは、正確な説明は狭く地味なものであり、そしてそれは証拠が支持する唯一の説明だ。NVIDIAのCARI4Dラインには、2026年8月30日以降、商用ライセンスされた、より大きく、より長く学習させたチェックポイントが利用可能であり、ベンダーはそれについて一言も触れていない。メートルスケールでの4D人間-物体インタラクションが必要で、これを研究専用として切り捨てていたなら、あなたが回避していた障害はもう存在しない。