
CARI4D 對上 ABot-Earth 0.7:兩個從不競爭的 4D 模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
如果你搜尋的是 CARI4D對上 ABot-Earth 0.7,期待看到一場正面對決,那麼誠實的答案是:這種比較根本不存在,而且也不會出現。這兩套系統做的工作不同,接收的輸入不同,輸出的東西不同,任何了解其中任何一套的人,都絕不會拿它們來互相比較。CARI4D 是 NVIDIA 的類別無關人–物互動 4D 重建技術——它觀看一段普通影片中一個人操作一個物體,並還原出他們隨時間變化的公制尺度姿態。ABot-Earth 0.7 則是 Amap 的 3D 原生城市世界模型——它接收一張衛星影像或一段文字提示,生成一座公里級、可探索的城市,並以高斯潑濺場景呈現。這個頁面之所以還是存在,是因為區隔這兩者的那條軸線確實很有用,而且它們在你實際上能用它們做什麼這件事上的差異,遠比它們表面上看起來的樣子來得大。
還有第二個更尖銳的理由。這兩個發行版位於一個比任何規格條目都更重要的光譜兩端:其中一個你今天下午就能下載並執行,另一個則完全無法執行。
沒有人搜尋這個查詢時想得到的答案
兩者都被描述為 4D。兩者都出自大型廠商。兩者都在過去一年內推出。它們的交集大致上就到此為止。
CARI4D 會進行重建。給定一段影片,它推斷出原本存在的事物。該論文——類別無關的人–物互動 4D 重建由 Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll 與 Stan Birchfield 撰寫——於 2025 年 12 月以 2512.11988 登上 arXiv,並獲 CVPR 2026 接受。其主題是相互接觸的人與剛性物體,而其核心主張在於尺度:在沒有深度感測器、也沒有多視角設備的情況下,從單眼相機還原公制尺寸,而這正是先前研究難以處理的部分。
ABot-Earth 0.7 誕生。輸入一張地理參照衛星影像或一段文字描述,它便能生成一個先前未曾以資料形式存在的場景。中國地圖與導航公司高德(Amap)於 2026 年 9 月 10 日在杭州舉行的 Street Stars 盛典上揭曉此版本,接棒 6 月 8 日推出的 ABot-Earth 0.5。它會輸出 3D 高斯潑濺,並可匯出至 Unreal Engine 和 Unity,涵蓋範圍達 Amap 所稱的 196 多個國家與地區,多於 0.5 版的 190 多個。
一個是估計器。一個是生成器。這個區別所發揮的作用,比任何基準測試表格都來得大。
一個人與一張椅子,或一座城市
尺度落差是人們最容易低估的一點。CARI4D 所關注的單位,是一個人體和一個手持物件,以公分為尺度,並在單一短片的各個影格中追蹤。ABot-Earth 0.7 所關注的單位,則是一平方公里的城市,根據 Amap 自己的說法,是在單一消費級 GPU 上約十分鐘內生成。
• 輸入 — CARI4D 為單眼 RGB 影片,MP4;對比 ABot-Earth 0.7 為衛星影像或文字提示
• 輸出 — CARI4D 的逐幀人體姿態與形狀、物體旋轉與平移,以及兩個手部接觸 logits,對比 ABot-Earth 0.7(一個 3D Gaussian splatting 場景),可匯出至 Unreal Engine 與 Unity
• 分析單位 — CARI4D 一個人和一個接觸中的剛性物體,對比 ABot-Earth 0.7 城市尺度下的地形、建築物、植被與地標
• 時序性主張 — CARI4D 逐幀重建觀測到的運動,而 ABot-Earth 0.7 則被定位為一個世界模型,具備用來預測接下來會發生什麼的預測層
• 公制尺度 — CARI4D 的公制尺度是透過 UniDepth 從單目影片中還原,並經由由粗到細的尺度搜尋;對比之下,ABot-Earth 0.7 是從衛星影像進行地理參照,沒有公制還原的問題
• 執行成本 —— 在 NVIDIA Ampere GPU 上的 CARI4D PyTorch,已在 A100 上驗證,研究訓練運行在 8×A100 上耗時 38 小時,而根據 Amap 自己的比較,ABot-Earth 0.7 在單一消費級 GPU 上每平方公里約需十分鐘

請注意,就單一橫列來看,這兩欄並沒有哪一欄比另一欄更好。它們衡量的是不同的世界。一個能還原手與瓦斯鋼瓶之間接觸點的模型,不會因為同時知道建築物在哪裡而變得更好;而一個能生成看似合理天際線的模型,也不會因為知道行人的確切手腕角度而變得更好。
真正決定這一切的不對稱性
這就是買家會在最初一個小時內感受到的差異,而這與能力無關。
CARI4D 現在就能取得程式碼與權重。NVlabs 儲存庫提供官方實作,於 2026 年 2 月 28 日發布,並於 4 月 4 日加入訓練程式碼與自訂影片前處理。預訓練的 CoCoNet 檢查點可從 Hugging Face 下載,Docker 映像檔 xiexh20/cari4d 已發布,且自 2026 年 8 月 30 日起,一個商業授權的 231M 檢查點已以 nvidia/cari4d_commercial 形式,依 NVIDIA 開放模型協議提供——需經審核授權,但仍可取得。依賴項目皆有文件說明,包括那些棘手的部分:NLF torchscript 權重、FoundationPose 權重、SMPL-H 資產、來自 AGORA 的 kid_template.npy,以及用於物件網格的 Hunyuan3D。你可以在 BEHAVE 示範、提供的實地影片片段,或你自己的影片上執行推論,並用隨附的腳本進行評估。

ABot-Earth 0.7 在上述任何一種意義上都無法取得。Amap 並未發布任何模型權重、模型卡、公開 API、定價或開發者文件。體驗網站已經上線,但 Amap 將生成功能描述為僅限邀請或白名單,介面僅有簡體中文,而據報導,0.5 時期的 GitHub 儲存庫只放了一份技術報告,沒有任何可執行的內容。每一個宣傳數字——每平方公里十分鐘、效率約為傳統重建的一千倍、成本約為百分之一、一百九十六個以上的國家——全都源自 Amap,且未經 Amap 以外的任何人獨立重現。這些都是廠商自行報告的數字,而目前也沒有任何途徑能讓它們變成其他性質。
所以實務上的比較並不是「哪個模型比較好」。而是其中一個是帶有商業授權和 Docker 映像檔的研究產物,另一個則是伴隨媒體宣傳週期的產品展示。兩者都是實實在在的成就。但只有其中一個是你能放進建置裡的東西。
兩者真正會相遇的地方
這裡確實有一個真實的構成,值得具體說明,因為這是它們屬於同一場對話的唯一意義。
CARI4D 的輸出是公制世界座標框架中的人—物互動。ABot-Earth 0.7 的輸出則是一個環境。把前者填入後者,你就能得到兩者單獨都無法產出的東西:一座生成的城市,其中人們所做的事是經過物理量測的,而非出於藝術性的擺放。機器人模擬、零售空間佈局規劃與互動資料集生成,全都想要的正是一這樣的組合——一個便宜到足以重新生成的環境,以及準確到足以作為訓練依據的人體動作。

它們之間的銜接處是一項座標轉換與一種尺度慣例,而這並不簡單,因為 CARI4D 的度量框架是相對於單一相機定義的,而 ABot-Earth 0.7 的度量框架則由地理定位定義。沒有人發表過那項整合。這種東西,團隊花一週就能做出來,卻不會寫成文件。
在那條流程裡最常被遺忘的步驟,就是把原始互動資料轉換成可查詢內容的那一塊——為影片片段上字幕、標記接觸事件、建立檢索索引,以及對輸出套用品質管控篩選。這項工作要靠視覺語言模型與語言模型來完成,而這正是 OrcaRouter 所涵蓋的層級:超過 200 個模型藏在單一 API 之後,供應商的定價以 0% 加成原樣傳遞,當供應商服務品質下滑時自動容錯切換,以及一套路由 DSL,能把多個模型組合成單一次呼叫,讓上字幕與品質管控不必拆成各自獨立的整合。CARI4D 與 ABot-Earth 0.7 都不在那裡提供服務,兩者也都不是 LLM——但你圍繞它們所用的工具,幾乎肯定是。
你真正想要哪一個?
若你有個人與物體互動的影片,而你需要他們的姿勢,以公制單位、逐格呈現——用於動作分析、機器人感知、動畫參考,或建立互動資料集——那就選 CARI4D。它現在已經推出,有完整文件說明,而商業授權已於 2026 年 8 月 30 日到位。請為相依鏈編列預算,並詳讀 NVIDIA 並不擁有之部分的授權條款。
如果你需要的是環境而非角色,就選擇 ABot-Earth 0.7——可從某個地點或一段描述快速生成城市規模的場景,並可匯出至遊戲引擎。請理解,你是在評估一項已展示的能力,而非採用一套工具;使用權限由對方斟酌決定;而效率數據是 Amap 自家的數字。
唯有在你正在建構上述的組合系統時,才兩者都選;並且要明白,接縫得由你自己來寫。
值得問的問題不是這兩者哪一個勝出。而是你實際上正在打造的東西,究竟需要的是重建模型、生成模型,還是兩者皆非——而在這個問題上,這兩個答案從不重疊。
