一張生成的 hero card,標題為「CARI4D vs ABot-Earth 0.7」,副標題為「兩個從不相互競爭的 4D 模型——一個負責重建,一個負責生成」;兩個面板以一條細長的「vs」分隔線隔開,左側標示為「CARI4D」,說明文字為「從一般影片中以公制尺度重建正在操作物件的人物」,並搭配一隻線框手拿著線框立方體;右側標示為「ABot-Earth 0.7」,說明文字為「從單張衛星影像生成一公里範圍的可探索 3D 城市」,並搭配線框城市天際線;以及一條寫著「這兩者當中,只有一個是你今天就能下載並執行的」的橫幅條。OrcaRouter 標誌合成於右下角。
Guides & Insights

CARI4D 對上 ABot-Earth 0.7:兩個從不競爭的 4D 模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果你搜尋的是 CARI4D對上 ABot-Earth 0.7,期待看到一場正面對決,那麼誠實的答案是:這種比較根本不存在,而且也不會出現。這兩套系統做的工作不同,接收的輸入不同,輸出的東西不同,任何了解其中任何一套的人,都絕不會拿它們來互相比較。CARI4D 是 NVIDIA 的類別無關人–物互動 4D 重建技術——它觀看一段普通影片中一個人操作一個物體,並還原出他們隨時間變化的公制尺度姿態。ABot-Earth 0.7 則是 Amap 的 3D 原生城市世界模型——它接收一張衛星影像或一段文字提示,生成一座公里級、可探索的城市,並以高斯潑濺場景呈現。這個頁面之所以還是存在,是因為區隔這兩者的那條軸線確實很有用,而且它們在你實際上能用它們什麼這件事上的差異,遠比它們表面上看起來的樣子來得大。

還有第二個更尖銳的理由。這兩個發行版位於一個比任何規格條目都更重要的光譜兩端:其中一個你今天下午就能下載並執行,另一個則完全無法執行。

沒有人搜尋這個查詢時想得到的答案

兩者都被描述為 4D。兩者都出自大型廠商。兩者都在過去一年內推出。它們的交集大致上就到此為止。

CARI4D 會進行重建。給定一段影片,它推斷出原本存在的事物。該論文——類別無關的人–物互動 4D 重建由 Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll 與 Stan Birchfield 撰寫——於 2025 年 12 月以 2512.11988 登上 arXiv,並獲 CVPR 2026 接受。其主題是相互接觸的人與剛性物體,而其核心主張在於尺度:在沒有深度感測器、也沒有多視角設備的情況下,從單眼相機還原公制尺寸,而這正是先前研究難以處理的部分。

ABot-Earth 0.7 誕生。輸入一張地理參照衛星影像或一段文字描述,它便能生成一個先前未曾以資料形式存在的場景。中國地圖與導航公司高德(Amap)於 2026 年 9 月 10 日在杭州舉行的 Street Stars 盛典上揭曉此版本,接棒 6 月 8 日推出的 ABot-Earth 0.5。它會輸出 3D 高斯潑濺,並可匯出至 Unreal Engine 和 Unity,涵蓋範圍達 Amap 所稱的 196 多個國家與地區,多於 0.5 版的 190 多個。

一個是估計器。一個是生成器。這個區別所發揮的作用,比任何基準測試表格都來得大。

一個人與一張椅子,或一座城市

尺度落差是人們最容易低估的一點。CARI4D 所關注的單位,是一個人體和一個手持物件,以公分為尺度,並在單一短片的各個影格中追蹤。ABot-Earth 0.7 所關注的單位,則是一平方公里的城市,根據 Amap 自己的說法,是在單一消費級 GPU 上約十分鐘內生成。

• 輸入 — CARI4D 為單眼 RGB 影片,MP4;對比 ABot-Earth 0.7 為衛星影像或文字提示

• 輸出 — CARI4D 的逐幀人體姿態與形狀、物體旋轉與平移,以及兩個手部接觸 logits,對比 ABot-Earth 0.7(一個 3D Gaussian splatting 場景),可匯出至 Unreal Engine 與 Unity

• 分析單位 — CARI4D 一個人和一個接觸中的剛性物體,對比 ABot-Earth 0.7 城市尺度下的地形、建築物、植被與地標

• 時序性主張 — CARI4D 逐幀重建觀測到的運動,而 ABot-Earth 0.7 則被定位為一個世界模型,具備用來預測接下來會發生什麼的預測層

• 公制尺度 — CARI4D 的公制尺度是透過 UniDepth 從單目影片中還原,並經由由粗到細的尺度搜尋;對比之下,ABot-Earth 0.7 是從衛星影像進行地理參照,沒有公制還原的問題

• 執行成本 —— 在 NVIDIA Ampere GPU 上的 CARI4D PyTorch,已在 A100 上驗證,研究訓練運行在 8×A100 上耗時 38 小時,而根據 Amap 自己的比較,ABot-Earth 0.7 在單一消費級 GPU 上每平方公里約需十分鐘

A generated two-column scoreboard titled 'CARI4D vs ABot-Earth 0.7 — the scoreboard'. The CARI4D column lists Task: Reconstructs; Input: Monocular RGB video; Output: Human and object poses, contact logits; Unit of scale: One person, one object; Weights: Downloadable, gated; Evidence: CVPR 2026, vendor-reported. The ABot-Earth 0.7 column lists Task: Generates; Input: Satellite image or text prompt; Output: 3D Gaussian splatting city; Unit of scale: One square kilometre; Weights: None published; Evidence: Vendor-reported, unreproduced. A footer reads 'CARI4D weights are downloadable today; ABot-Earth 0.7 figures are Amap's own, unaudited.' The OrcaRouter logo is composited in the bottom-right corner.

請注意,就單一橫列來看,這兩欄並沒有哪一欄比另一欄更好。它們衡量的是不同的世界。一個能還原手與瓦斯鋼瓶之間接觸點的模型,不會因為同時知道建築物在哪裡而變得更好;而一個能生成看似合理天際線的模型,也不會因為知道行人的確切手腕角度而變得更好。

真正決定這一切的不對稱性

這就是買家會在最初一個小時內感受到的差異,而這與能力無關。

CARI4D 現在就能取得程式碼與權重。NVlabs 儲存庫提供官方實作,於 2026 年 2 月 28 日發布,並於 4 月 4 日加入訓練程式碼與自訂影片前處理。預訓練的 CoCoNet 檢查點可從 Hugging Face 下載,Docker 映像檔 xiexh20/cari4d 已發布,且自 2026 年 8 月 30 日起,一個商業授權的 231M 檢查點已以 nvidia/cari4d_commercial 形式,依 NVIDIA 開放模型協議提供——需經審核授權,但仍可取得。依賴項目皆有文件說明,包括那些棘手的部分:NLF torchscript 權重、FoundationPose 權重、SMPL-H 資產、來自 AGORA 的 kid_template.npy,以及用於物件網格的 Hunyuan3D。你可以在 BEHAVE 示範、提供的實地影片片段,或你自己的影片上執行推論,並用隨附的腳本進行評估。

A screenshot of the nvidia/CARI4D model page on Hugging Face, captured September 18 2026, showing the arXiv:2512.11988 tag, the heading 'Model Card - CARI4D', the description of the CoCoNet model and the line 'This model is for research and development only', governing terms listing the NVIDIA License alongside a DINOv2 licence link, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

ABot-Earth 0.7 在上述任何一種意義上都無法取得。Amap 並未發布任何模型權重、模型卡、公開 API、定價或開發者文件。體驗網站已經上線,但 Amap 將生成功能描述為僅限邀請或白名單,介面僅有簡體中文,而據報導,0.5 時期的 GitHub 儲存庫只放了一份技術報告,沒有任何可執行的內容。每一個宣傳數字——每平方公里十分鐘、效率約為傳統重建的一千倍、成本約為百分之一、一百九十六個以上的國家——全都源自 Amap,且未經 Amap 以外的任何人獨立重現。這些都是廠商自行報告的數字,而目前也沒有任何途徑能讓它們變成其他性質。

所以實務上的比較並不是「哪個模型比較好」。而是其中一個是帶有商業授權和 Docker 映像檔的研究產物,另一個則是伴隨媒體宣傳週期的產品展示。兩者都是實實在在的成就。但只有其中一個是你能放進建置裡的東西。

兩者真正會相遇的地方

這裡確實有一個真實的構成,值得具體說明,因為這是它們屬於同一場對話的唯一意義。

CARI4D 的輸出是公制世界座標框架中的人—物互動。ABot-Earth 0.7 的輸出則是一個環境。把前者填入後者,你就能得到兩者單獨都無法產出的東西:一座生成的城市,其中人們所做的事是經過物理量測的,而非出於藝術性的擺放。機器人模擬、零售空間佈局規劃與互動資料集生成,全都想要的正是一這樣的組合——一個便宜到足以重新生成的環境,以及準確到足以作為訓練依據的人體動作。

A screenshot of the OrcaRouter Models page, captured September 18 2026, headed 'Models' with the subheading '200 models · 16 providers · one API key, one bill', showing the OpenAI-compatible POST endpoint in a 'How to call any model' panel, modality tabs reading Text 165, Image 10, Embeddings 5, Video 10 and TTS 10, prepaid credit plans from USD 50 to USD 1000 per month, and model cards including Orca: OrcaCyber Zero 1.0, Orca: OrcaVerify Text 1.0, DeepSeek V4.1 Flash, OpenAI GPT-6 Astra, Google Gemini 3.8 Flash and Qwen3.8 Max.

它們之間的銜接處是一項座標轉換與一種尺度慣例,而這並不簡單,因為 CARI4D 的度量框架是相對於單一相機定義的,而 ABot-Earth 0.7 的度量框架則由地理定位定義。沒有人發表過那項整合。這種東西,團隊花一週就能做出來,卻不會寫成文件。

在那條流程裡最常被遺忘的步驟,就是把原始互動資料轉換成可查詢內容的那一塊——為影片片段上字幕、標記接觸事件、建立檢索索引,以及對輸出套用品質管控篩選。這項工作要靠視覺語言模型與語言模型來完成,而這正是 OrcaRouter 所涵蓋的層級:超過 200 個模型藏在單一 API 之後,供應商的定價以 0% 加成原樣傳遞,當供應商服務品質下滑時自動容錯切換,以及一套路由 DSL,能把多個模型組合成單一次呼叫,讓上字幕與品質管控不必拆成各自獨立的整合。CARI4D 與 ABot-Earth 0.7 都不在那裡提供服務,兩者也都不是 LLM——但你圍繞它們所用的工具,幾乎肯定是。

你真正想要哪一個?

若你有個人與物體互動的影片,而你需要他們的姿勢,以公制單位、逐格呈現——用於動作分析、機器人感知、動畫參考,或建立互動資料集——那就選 CARI4D。它現在已經推出,有完整文件說明,而商業授權已於 2026 年 8 月 30 日到位。請為相依鏈編列預算,並詳讀 NVIDIA 並不擁有之部分的授權條款。

如果你需要的是環境而非角色,就選擇 ABot-Earth 0.7——可從某個地點或一段描述快速生成城市規模的場景,並可匯出至遊戲引擎。請理解,你是在評估一項已展示的能力,而非採用一套工具;使用權限由對方斟酌決定;而效率數據是 Amap 自家的數字。

唯有在你正在建構上述的組合系統時,才兩者都選;並且要明白,接縫得由你自己來寫。

值得問的問題不是這兩者哪一個勝出。而是你實際上正在打造的東西,究竟需要的是重建模型、生成模型,還是兩者皆非——而在這個問題上,這兩個答案從不重疊。