
CARI4D 对比 ABot-Earth 0.7:两个永不相争的 4D 模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
如果你搜索CARI4D与ABot-Earth 0.7的对比,期待着一场正面交锋,那么诚实的答案是:这样的比较并不存在,也不会有。这两个系统做的工作不同,接受的输入不同,输出的结果也不同,任何了解其中任何一方的人都不会把它们放在一起做基准测试。CARI4D 是 NVIDIA 的类别无关 4D 人-物交互重建——它观察普通视频中一个人操作一个物体,并随时间恢复出二者具有真实度量尺度的姿态。ABot-Earth 0.7 是 Amap 的 3D 原生城市世界模型——它接收一张卫星图像或一段文本提示,生成一座千米尺度、可探索的城市,以高斯泼溅场景的形式呈现。这个页面之所以仍然存在,是因为区分二者的那条轴线确实很有用,而且这两者在你能用它们做什么这件事上的差异,远大于它们在表面上看起来的差异。
还有一个更尖锐的理由。这两个版本处在一个光谱的两端,而这个光谱比任何一条规格都更重要:其中一个你今天下午就能下载并运行,而另一个则根本无法运行。
搜索这个查询的人都不想要的答案
两者都被描述为4D。两者都来自主要厂商。两者都是在过去一年内发布的。而相似之处大致到此为止。
CARI4D 进行重建。给定一段视频,它会估计出那里原本有什么。论文——类别无关的人-物交互 4D 重建由 Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll 和 Stan Birchfield 撰写——于 2025 年 12 月以编号 2512.11988 出现在 arXiv 上,并被 CVPR 2026 接收。它研究的对象是一个人与一个刚性物体相接触,其核心主张在于尺度:在既无深度传感器、也无多视角设备的条件下,仅凭单目相机恢复出度量尺寸,而这正是此前工作难以攻克的环节。
ABot-Earth 0.7 生成。给定一张带地理坐标的卫星影像或一段文本描述,它会生成一个此前并不作为数据存在的场景。中国地图与导航公司 Amap 于 2026 年 9 月 10 日在杭州举办的 Street Stars 盛典上揭晓了它,接替 6 月 8 日发布的 ABot-Earth 0.5。它输出 3D 高斯泼溅,可导出至 Unreal Engine 和 Unity,并覆盖 Amap 所说的 196 多个国家和地区,多于 0.5 的 190 多个。
一个是估计器。一个是生成器。这一区别所起的作用,是任何基准测试表都比不上的。
一个人和一把椅子,或者一座城市
尺度上的鸿沟,恰恰是人们最容易低估的一点。CARI4D 所关注的基本单元是一具人体和一件手持物体,以厘米为单位,在单个片段的各帧中对其进行追踪。而 ABot-Earth 0.7 所关注的基本单元,则是一平方公里的城市,按 Amap 自己的说法,只需在单块消费级 GPU 上花约十分钟即可生成。
• 输入 — CARI4D:单目RGB视频,MP4 对比 ABot-Earth 0.7:卫星图像或文本提示
• 输出 — CARI4D 逐帧人体姿态与形状、物体旋转与平移,以及两个手部接触 logits,对比 ABot-Earth 0.7 的三维高斯泼溅场景,可导出至 Unreal Engine 和 Unity
• 分析单元 — CARI4D 为一个人与一个刚性物体相接触,而 ABot-Earth 0.7 则为城市尺度的地形、建筑、植被和地标
• 时间维度上的主张——CARI4D 逐帧重建观测到的运动,而 ABot-Earth 0.7 则被定位为一个世界模型,带有一个用于预测接下来会发生什么的预测层
• 度量尺度——CARI4D 的度量尺度通过 UniDepth 从单目视频中恢复,并采用由粗到细的尺度搜索;与从卫星图像进行地理配准的 ABot-Earth 0.7 相比,不存在度量恢复问题
• 运行成本——CARI4D PyTorch 在 NVIDIA Ampere GPU 上,已在 A100 上验证,研究训练运行在 8×A100 上耗时 38 小时;而根据 Amap 自己的比较,ABot-Earth 0.7 在单块消费级 GPU 上每平方公里约十分钟

注意,在单行上,两列并不比另一列更好。它们衡量的是不同的世界。一个能恢复手与气瓶之间接触点的模型,不会因为还知道建筑物在哪里而变得更好;而一个能生成合理天际线的模型,也不会因为知道行人的精确手腕角度而变得更好。
真正起决定作用的不对称性
这就是买家在第一个小时内就能感受到的差别,而它与能力无关。
CARI4D 的代码和权重现在就能获取。NVlabs 仓库提供官方实现,于 2026 年 2 月 28 日发布,4 月 4 日新增了训练代码和自定义视频预处理功能。预训练的 CoCoNet 检查点可从 Hugging Face 下载,Docker 镜像 xiexh20/cari4d 已发布,并且自 2026 年 8 月 30 日起,一个商业授权的 231M 检查点已以 nvidia/cari4d_commercial 的形式在 NVIDIA 开放模型协议下提供——虽然需要申请授权,但可以获取。依赖项均有文档说明,包括那些棘手的部分:NLF torchscript 权重、FoundationPose 权重、SMPL-H 资源、来自 AGORA 的 kid_template.npy,以及用于物体网格的 Hunyuan3D。你可以在 BEHAVE 演示、提供的真实场景视频片段或你自己的视频上运行推理,并使用随附脚本进行评估。

ABot-Earth 0.7 在上述任何一种意义上都无法获取。Amap 没有发布任何模型权重、模型卡、公开 API、定价或开发者文档。体验站点已经上线,但 Amap 称生成功能仅限邀请或白名单用户使用,界面仅支持简体中文,而据称 0.5 时期的 GitHub 仓库中只有一份技术报告,没有任何可执行内容。所有头条数字——每平方公里十分钟、效率约为传统重建的 1,000 倍、成本约为其百分之一、覆盖 196 个以上国家——都源自 Amap,且未经 Amap 以外的任何人独立复现。这些都是厂商自报的数据,而目前没有任何途径能让它们变成其他性质的东西。
所以,实际的比较并不是“哪个模型更好”。而在于:其中一个是带有商业许可证和 Docker 镜像的研究产物,另一个则是带有媒体宣传周期的产品演示。两者都是正当的成就。但只有一个能真正放进构建里。
两者真正交汇之处
这里确实有一种真正的组合,值得具体说明,因为只有在这个意义上,它们才属于同一次对话。
CARI4D 的输出是在度量世界坐标系中的人-物交互。ABot-Earth 0.7 的输出是一个环境。用前者填充后者,你就能得到两者单独都无法产生的东西:一座生成的城市,其中人们所做的事情是经过物理测量的,而不是艺术化摆放的。机器人仿真、零售布局规划和交互数据集生成都想要正是这种组合——一个足够廉价、可以反复重新生成的环境,以及足够准确、可用于训练的人类运动。

它们之间的衔接处是一项坐标变换和一种尺度约定,而且这并非小事,因为 CARI4D 的度量坐标系是相对于单个相机定义的,而 ABot-Earth 0.7 的则是由地理定位定义的。没有人发表过这种整合。这种事,一个团队一周就能做出来,却不会把它写下来。
在那条流水线中,最容易被遗忘的一步,是把原始交互数据变成可查询内容的那部分——为视频片段生成描述、为接触事件打标签、构建检索索引,以及对输出施加质量控制过滤。这项工作要经由视觉-语言模型和语言模型来完成,而这正是 OrcaRouter 所覆盖的层面:一个 API 背后接入 200 多个模型,供应商标价按 0% 加价原样透传,供应商服务劣化时自动故障转移,以及一种路由 DSL,可把多个模型组合进单次调用,这样描述生成和质量控制环节就不必各自单独集成。CARI4D 和 ABot-Earth 0.7 都不在该平台上提供服务,它们也都不是 LLM——但你围绕它们搭建的工具体系,几乎可以肯定都是 LLM。
你到底想要哪一个?
如果你有一个人与物体互动的视频,并且需要以公制单位、逐帧获取他们的姿态——用于动作分析、机器人感知、动画参考,或构建交互数据集——那就选 CARI4D。它现在已经可用,有文档,商业许可已于 2026 年 8 月 30 日落地。要为依赖链预留预算,并阅读 NVIDIA 不拥有的那部分内容的许可条款。
如果你需要的是环境而不是角色,就选择 ABot-Earth 0.7——它能根据一个地点或一段描述快速生成城市级场景,并可导出到游戏引擎中。要明白,你是在评估一项已展示的能力,而不是在采用一款工具;访问权限由对方酌情决定,而且效率数据是 Amap 自己提供的。
只有当你正在构建上文所述的组合系统时,才应两者都选,并且要清楚:接缝得由你自己来编写。
值得问的问题不是这两者中哪一个胜出。而是你真正在构建的东西到底需要一个重建模型、一个生成模型,还是两者都不需要——而在这个问题上,这两个答案从不相交。
