一张生成的 hero 卡片,标题为“CARI4D vs ABot-Earth 0.7”,副标题为“两个 4D 模型从不竞争——一个负责重建,一个负责生成”;两个面板由一条细细的“vs”分隔条隔开,左侧标注为“CARI4D”,配文为“从普通视频中,以公制尺度重建一个人手持物体的场景”,并配有一只线框手拿着线框立方体;右侧标注为“ABot-Earth 0.7”,配文为“从一张卫星图像生成一公里的可探索 3D 城市”,并配有线框城市天际线;还有一条横幅,写着“其中只有一个,是你今天就能下载并运行的”。OrcaRouter 徽标合成在右下角。
Guides & Insights

CARI4D 对比 ABot-Earth 0.7:两个永不相争的 4D 模型

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你搜索CARI4DABot-Earth 0.7的对比,期待着一场正面交锋,那么诚实的答案是:这样的比较并不存在,也不会有。这两个系统做的工作不同,接受的输入不同,输出的结果也不同,任何了解其中任何一方的人都不会把它们放在一起做基准测试。CARI4D 是 NVIDIA 的类别无关 4D 人-物交互重建——它观察普通视频中一个人操作一个物体,并随时间恢复出二者具有真实度量尺度的姿态。ABot-Earth 0.7 是 Amap 的 3D 原生城市世界模型——它接收一张卫星图像或一段文本提示,生成一座千米尺度、可探索的城市,以高斯泼溅场景的形式呈现。这个页面之所以仍然存在,是因为区分二者的那条轴线确实很有用,而且这两者在你能用它们什么这件事上的差异,远大于它们在表面上看起来的差异。

还有一个更尖锐的理由。这两个版本处在一个光谱的两端,而这个光谱比任何一条规格都更重要:其中一个你今天下午就能下载并运行,而另一个则根本无法运行。

搜索这个查询的人都不想要的答案

两者都被描述为4D。两者都来自主要厂商。两者都是在过去一年内发布的。而相似之处大致到此为止。

CARI4D 进行重建。给定一段视频,它会估计出那里原本有什么。论文——类别无关的人-物交互 4D 重建由 Xianghui Xie、Bowen Wen、Yan Chang、Hesam Rabeti、Jiefeng Li、Ye Yuan、Gerard Pons-Moll 和 Stan Birchfield 撰写——于 2025 年 12 月以编号 2512.11988 出现在 arXiv 上,并被 CVPR 2026 接收。它研究的对象是一个人与一个刚性物体相接触,其核心主张在于尺度:在既无深度传感器、也无多视角设备的条件下,仅凭单目相机恢复出度量尺寸,而这正是此前工作难以攻克的环节。

ABot-Earth 0.7 生成。给定一张带地理坐标的卫星影像或一段文本描述,它会生成一个此前并不作为数据存在的场景。中国地图与导航公司 Amap 于 2026 年 9 月 10 日在杭州举办的 Street Stars 盛典上揭晓了它,接替 6 月 8 日发布的 ABot-Earth 0.5。它输出 3D 高斯泼溅,可导出至 Unreal Engine 和 Unity,并覆盖 Amap 所说的 196 多个国家和地区,多于 0.5 的 190 多个。

一个是估计器。一个是生成器。这一区别所起的作用,是任何基准测试表都比不上的。

一个人和一把椅子,或者一座城市

尺度上的鸿沟,恰恰是人们最容易低估的一点。CARI4D 所关注的基本单元是一具人体和一件手持物体,以厘米为单位,在单个片段的各帧中对其进行追踪。而 ABot-Earth 0.7 所关注的基本单元,则是一平方公里的城市,按 Amap 自己的说法,只需在单块消费级 GPU 上花约十分钟即可生成。

• 输入 — CARI4D:单目RGB视频,MP4 对比 ABot-Earth 0.7:卫星图像或文本提示

• 输出 — CARI4D 逐帧人体姿态与形状、物体旋转与平移,以及两个手部接触 logits,对比 ABot-Earth 0.7 的三维高斯泼溅场景,可导出至 Unreal Engine 和 Unity

• 分析单元 — CARI4D 为一个人与一个刚性物体相接触,而 ABot-Earth 0.7 则为城市尺度的地形、建筑、植被和地标

• 时间维度上的主张——CARI4D 逐帧重建观测到的运动,而 ABot-Earth 0.7 则被定位为一个世界模型,带有一个用于预测接下来会发生什么的预测层

• 度量尺度——CARI4D 的度量尺度通过 UniDepth 从单目视频中恢复,并采用由粗到细的尺度搜索;与从卫星图像进行地理配准的 ABot-Earth 0.7 相比,不存在度量恢复问题

• 运行成本——CARI4D PyTorch 在 NVIDIA Ampere GPU 上,已在 A100 上验证,研究训练运行在 8×A100 上耗时 38 小时;而根据 Amap 自己的比较,ABot-Earth 0.7 在单块消费级 GPU 上每平方公里约十分钟

A generated two-column scoreboard titled 'CARI4D vs ABot-Earth 0.7 — the scoreboard'. The CARI4D column lists Task: Reconstructs; Input: Monocular RGB video; Output: Human and object poses, contact logits; Unit of scale: One person, one object; Weights: Downloadable, gated; Evidence: CVPR 2026, vendor-reported. The ABot-Earth 0.7 column lists Task: Generates; Input: Satellite image or text prompt; Output: 3D Gaussian splatting city; Unit of scale: One square kilometre; Weights: None published; Evidence: Vendor-reported, unreproduced. A footer reads 'CARI4D weights are downloadable today; ABot-Earth 0.7 figures are Amap's own, unaudited.' The OrcaRouter logo is composited in the bottom-right corner.

注意,在单行上,两列并不比另一列更好。它们衡量的是不同的世界。一个能恢复手与气瓶之间接触点的模型,不会因为还知道建筑物在哪里而变得更好;而一个能生成合理天际线的模型,也不会因为知道行人的精确手腕角度而变得更好。

真正起决定作用的不对称性

这就是买家在第一个小时内就能感受到的差别,而它与能力无关。

CARI4D 的代码和权重现在就能获取。NVlabs 仓库提供官方实现,于 2026 年 2 月 28 日发布,4 月 4 日新增了训练代码和自定义视频预处理功能。预训练的 CoCoNet 检查点可从 Hugging Face 下载,Docker 镜像 xiexh20/cari4d 已发布,并且自 2026 年 8 月 30 日起,一个商业授权的 231M 检查点已以 nvidia/cari4d_commercial 的形式在 NVIDIA 开放模型协议下提供——虽然需要申请授权,但可以获取。依赖项均有文档说明,包括那些棘手的部分:NLF torchscript 权重、FoundationPose 权重、SMPL-H 资源、来自 AGORA 的 kid_template.npy,以及用于物体网格的 Hunyuan3D。你可以在 BEHAVE 演示、提供的真实场景视频片段或你自己的视频上运行推理,并使用随附脚本进行评估。

A screenshot of the nvidia/CARI4D model page on Hugging Face, captured September 18 2026, showing the arXiv:2512.11988 tag, the heading 'Model Card - CARI4D', the description of the CoCoNet model and the line 'This model is for research and development only', governing terms listing the NVIDIA License alongside a DINOv2 licence link, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

ABot-Earth 0.7 在上述任何一种意义上都无法获取。Amap 没有发布任何模型权重、模型卡、公开 API、定价或开发者文档。体验站点已经上线,但 Amap 称生成功能仅限邀请或白名单用户使用,界面仅支持简体中文,而据称 0.5 时期的 GitHub 仓库中只有一份技术报告,没有任何可执行内容。所有头条数字——每平方公里十分钟、效率约为传统重建的 1,000 倍、成本约为其百分之一、覆盖 196 个以上国家——都源自 Amap,且未经 Amap 以外的任何人独立复现。这些都是厂商自报的数据,而目前没有任何途径能让它们变成其他性质的东西。

所以,实际的比较并不是“哪个模型更好”。而在于:其中一个是带有商业许可证和 Docker 镜像的研究产物,另一个则是带有媒体宣传周期的产品演示。两者都是正当的成就。但只有一个能真正放进构建里。

两者真正交汇之处

这里确实有一种真正的组合,值得具体说明,因为只有在这个意义上,它们才属于同一次对话。

CARI4D 的输出是在度量世界坐标系中的人-物交互。ABot-Earth 0.7 的输出是一个环境。用前者填充后者,你就能得到两者单独都无法产生的东西:一座生成的城市,其中人们所做的事情是经过物理测量的,而不是艺术化摆放的。机器人仿真、零售布局规划和交互数据集生成都想要正是这种组合——一个足够廉价、可以反复重新生成的环境,以及足够准确、可用于训练的人类运动。

A screenshot of the OrcaRouter Models page, captured September 18 2026, headed 'Models' with the subheading '200 models · 16 providers · one API key, one bill', showing the OpenAI-compatible POST endpoint in a 'How to call any model' panel, modality tabs reading Text 165, Image 10, Embeddings 5, Video 10 and TTS 10, prepaid credit plans from USD 50 to USD 1000 per month, and model cards including Orca: OrcaCyber Zero 1.0, Orca: OrcaVerify Text 1.0, DeepSeek V4.1 Flash, OpenAI GPT-6 Astra, Google Gemini 3.8 Flash and Qwen3.8 Max.

它们之间的衔接处是一项坐标变换和一种尺度约定,而且这并非小事,因为 CARI4D 的度量坐标系是相对于单个相机定义的,而 ABot-Earth 0.7 的则是由地理定位定义的。没有人发表过这种整合。这种事,一个团队一周就能做出来,却不会把它写下来。

在那条流水线中,最容易被遗忘的一步,是把原始交互数据变成可查询内容的那部分——为视频片段生成描述、为接触事件打标签、构建检索索引,以及对输出施加质量控制过滤。这项工作要经由视觉-语言模型和语言模型来完成,而这正是 OrcaRouter 所覆盖的层面:一个 API 背后接入 200 多个模型,供应商标价按 0% 加价原样透传,供应商服务劣化时自动故障转移,以及一种路由 DSL,可把多个模型组合进单次调用,这样描述生成和质量控制环节就不必各自单独集成。CARI4D 和 ABot-Earth 0.7 都不在该平台上提供服务,它们也都不是 LLM——但你围绕它们搭建的工具体系,几乎可以肯定都是 LLM。

你到底想要哪一个?

如果你有一个人与物体互动的视频,并且需要以公制单位、逐帧获取他们的姿态——用于动作分析、机器人感知、动画参考,或构建交互数据集——那就选 CARI4D。它现在已经可用,有文档,商业许可已于 2026 年 8 月 30 日落地。要为依赖链预留预算,并阅读 NVIDIA 不拥有的那部分内容的许可条款。

如果你需要的是环境而不是角色,就选择 ABot-Earth 0.7——它能根据一个地点或一段描述快速生成城市级场景,并可导出到游戏引擎中。要明白,你是在评估一项已展示的能力,而不是在采用一款工具;访问权限由对方酌情决定,而且效率数据是 Amap 自己提供的。

只有当你正在构建上文所述的组合系统时,才应两者都选,并且要清楚:接缝得由你自己来编写。

值得问的问题不是这两者中哪一个胜出。而是你真正在构建的东西到底需要一个重建模型、一个生成模型,还是两者都不需要——而在这个问题上,这两个答案从不相交。