
CARI4D vs ABot-Earth 0.7:決して競合しない2つの4Dモデル
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
もしあなたがCARI4D対ABot-Earth 0.7の一騎打ちを期待して検索したのなら、正直に言って、そのような比較は存在せず、今後も出てくることはない。この2つのシステムは同じ仕事をするわけではなく、同じ入力を受け取るわけでもなく、同じものを出力するわけでもなく、どちらかを理解している人なら両者をベンチマークで比べることなど決してない。CARI4DはNVIDIAによるカテゴリー非依存の人と物体のインタラクションの4D再構成であり、普通の動画の中で1人の人物が1つの物体を扱っている様子を観察し、その人物のメートルスケールの姿勢を時間軸に沿って復元する。ABot-Earth 0.7はAmapの3Dネイティブな都市世界モデルであり、衛星画像またはテキストプロンプトを受け取り、キロメートル規模で探索可能な都市をガウススプラッティングのシーンとして生成する。それでもこのページが存在する理由は、両者を隔てる軸が本当に有用なものであり、そして両者がどれほど異なっているかは、見た目に表れる違いよりも、それらで何ができるかという点のほうがはるかに大きいからだ。
もう一つ、さらに鋭い理由があります。これら2つのリリースは、どんな仕様の一行よりも重要なスペクトルの両端に位置しています。一方は今日の午後にダウンロードして実行できますが、もう一方はまったく実行できません。
このクエリを検索している誰もが望まない答え
どちらも4Dと称されている。どちらも大手ベンダーの製品だ。どちらも過去1年以内にリリースされた。重なり合うのはおおよそそこまでだ。
CARI4Dは再構築する。動画が与えられると、そこに何があったのかを推定する。論文 — カテゴリーに依存しない人と物体のインタラクションの4D再構築(著:Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll、Stan Birchfield)は、2025年12月にarXivで2512.11988として公開され、CVPR 2026に採択された。その主題は、接触している人間と剛体物体であり、中核的な主張はスケールにある。つまり、深度センサーもマルチビューリグも使わずに単眼カメラからメートル単位の寸法を復元することであり、これは先行研究が苦戦した部分である。
ABot-Earth 0.7が生成する。地理参照された衛星画像またはテキスト記述が与えられると、以前はデータとして存在しなかったシーンを生成する。中国の地図・ナビゲーション企業Amapは、2026年9月10日に杭州で開催されたStreet Starsガラでこれを発表し、6月8日のABot-Earth 0.5の後継となった。3Dガウシアンスプラットを出力し、Unreal EngineとUnityにエクスポートでき、Amapによれば196以上の国と地域をカバーし、0.5の190以上から増加している。
一方は推定器であり、もう一方は生成器である。その区別は、どんなベンチマーク表よりもはるかに大きな意味を持つ。
人と椅子、あるいは都市
スケールの差は、人が過小評価しがちな点だ。CARI4D の関心の単位は人体と手持ちの物体で、センチメートル単位で測られ、1本のクリップのフレームをまたいで追跡される。ABot-Earth 0.7 の関心の単位は都市の1平方キロメートルであり、Amap 自身の説明によれば、単一のコンシューマー向け GPU でおよそ10分で生成される。
• 入力 — CARI4D:単眼RGB動画、MP4 対 ABot-Earth 0.7:衛星画像またはテキストプロンプト
• 出力 — CARI4D のフレームごとの人物ポーズと形状、オブジェクトの回転と並進、および2つの手接触ロジット 対 ABot-Earth 0.7 の3Dガウシアンスプラッティングシーン、Unreal Engine と Unity にエクスポート可能
• 分析単位 — CARI4D:接触している人間1人と剛体1つ 対 ABot-Earth 0.7:都市規模の地形、建物、植生、ランドマーク
• 時間軸に関する主張 — CARI4Dは観測された動きをフレームごとに再構築するのに対し、ABot-Earth 0.7は次に何が起こるかを予測する層を備えた世界モデルとして位置づけられている
• メートルスケール — CARI4D のメートルスケールは、UniDepth と粗から細へのスケール探索によって単眼動画から復元されるのに対し、ABot-Earth 0.7 は衛星画像から地理参照され、メートルスケール復元の問題はない
• 実行コスト — NVIDIA Ampere GPU 上の CARI4D PyTorch、A100 で検証済み、研究トレーニング実行では 8×A100 で 38 時間。一方、ABot-Earth 0.7 は Amap 自身の比較によれば、1 台のコンシューマー向け GPU で 1km² あたり約 10 分。

単一の行では、どちらの列も他方より優れているわけではないことに注意してください。それらは異なる世界を測定しています。手とガスシリンダーの接触点を復元するモデルは、建物がどこにあるかも知ることで改善されるわけではなく、もっともらしいスカイラインを生成するモデルは、歩行者の正確な手首角度を知ることで改善されるわけではありません。
実際に決め手となる非対称性
これが、購入者が最初の1時間で感じる違いであり、それは能力とは何の関係もない。
CARI4Dには、今日入手できるコードと重みがあります。NVlabsのリポジトリには、2026年2月28日にリリースされた公式実装があり、4月4日にはトレーニングコードとカスタム動画の前処理が追加されました。事前学習済みのCoCoNetチェックポイントはHugging Faceからダウンロードでき、Dockerイメージ xiexh20/cari4dが公開されており、2026年8月30日以降、商用ライセンスの231Mチェックポイントがnvidia/cari4d_commercialとしてNVIDIA Open Model Agreementの下で利用可能です — ゲートはありますが、入手できます。依存関係は、厄介な部分も含めて文書化されています。NLFのtorchscript重み、FoundationPoseの重み、SMPL-Hアセット、AGORAのkid_template.npy、そしてオブジェクトメッシュ用のHunyuan3Dなどです。BEHAVEデモ、提供されているin-the-wildクリップ、または自分の動画で推論を実行でき、同梱のスクリプトで評価できます。

ABot-Earth 0.7は、これらのいずれの意味でも入手できない。Amapはモデルの重みも、モデルカードも、公開APIも、価格も、開発者向けドキュメントも公開していない。体験サイトは公開されているが、Amapは生成を招待制またはホワイトリスト制と説明しており、インターフェースは簡体字中国語のみで、0.5時代のGitHubリポジトリには技術レポートが置かれていただけで、実行可能なものは何もなかったと報じられている。見出しに掲げられたあらゆる数字——1平方キロメートルあたり10分、従来の再構築の約1,000倍の効率、約100分の1のコスト、196か国以上——はAmapに由来し、Amap外部の誰によっても独立に再現されていない。これらはベンダー報告の数字であり、現在それらがそれ以外のものになり得る道筋は存在しない。
したがって、実用的な比較は「どちらのモデルが優れているか」ではない。一方は商用ライセンスとDockerイメージを備えた研究用成果物であり、もう一方はプレスサイクルを伴う製品デモだ、ということである。どちらも正当な成果ではある。ビルドに組み込めるのは、そのうちの一方だけだ。
二つが本当に出会うところ
ここには実際の構成があり、それについて具体的に述べる価値がある。なぜなら、これらが同じ会話に属すると言えるのは、その意味においてのみだからだ。
CARI4Dの出力は、メートル基準の世界座標系における人と物体のインタラクションです。ABot-Earth 0.7の出力は環境です。後者に前者を投入すれば、どちらか一方だけでは生み出せないものが得られます。それは、人々が芸術的に配置されるのではなく物理的に計測された行為を行っている生成都市です。ロボティクスシミュレーション、小売レイアウト計画、インタラクションデータセット生成はいずれも、まさにその組み合わせ——再生成するのに十分安価な環境と、学習に使えるほど正確な人間の動作——を求めています。

両者の間の継ぎ目は座標変換とスケールの取り決めであり、それは些細なことではない。なぜなら、CARI4D の計量フレームは単一のカメラを基準に定義され、ABot-Earth 0.7 のそれは地理位置情報によって定義されているからだ。その統合を公表した者は誰もいない。それはチームが1週間で構築し、文書には書かない類のものだ。
そのパイプラインで忘れられがちな工程は、生のインタラクションデータをクエリ可能なものに変える部分です — クリップへのキャプション付け、接触イベントへのタグ付け、検索インデックスの構築、そして出力に対する品質管理フィルター。その作業は視覚言語モデルと言語モデルを通じて行われ、OrcaRouter が担うのはまさにその層です: 1つのAPIの背後に200以上のモデル、プロバイダーの定価を0%のマークアップでそのまま適用し、プロバイダーが劣化したときの自動フェイルオーバー、そして複数のモデルを1回の呼び出しに組み合わせるルーティングDSL。これにより、キャプション付けとQCパスを別々の統合にする必要がありません。CARI4D も ABot-Earth 0.7 もそこでは提供されておらず、どちらもLLMではありません — しかし、それらを取り巻くツール類はほぼ間違いなくLLMです。
実際にどっちが欲しいの?
人物が物体と相互作用している動画があり、その人物のポーズをメートル法の単位でフレームごとに必要とするなら、CARI4Dを選びましょう — モーション解析、ロボティクスの知覚、アニメーションの参照、あるいはインタラクションのデータセット構築のために。それは今すぐ利用可能で、ドキュメントも整備されており、商用ライセンスは2026年8月30日に成立しました。依存関係の連鎖も含めて予算を見積もり、NVIDIAが権利を持たない部分についてはライセンス条件を読んでください。
アクターではなく環境が必要なら、ABot-Earth 0.7を選ぼう——場所や説明文から生成される都市規模のシーンを、すばやくゲームエンジンへエクスポートできる。これはツールを導入するのではなく、実証された能力を評価しているのだと理解しておくこと。アクセスは裁量的であり、効率の数値はAmap自身によるものであることも。
上記で説明した複合システムを構築する場合に限り、両方を選び、そのシーム(つなぎ目)は自分で書くことになると承知の上で臨んでください。
問う価値があるのは、この二つのうちどちらが勝つかではない。あなたが実際に作っているものに必要なのは、再構成モデルなのか、生成モデルなのか、それともどちらでもないのか——そしてその問いにおいて、この二つの答えが重なることは決してない。
