文章《ABot-Earth 0.7》的主视觉标题卡,副标题为“Amap 的 3D 世界模型——一张卫星图像,10 分钟生成一座城市”,带有徽章“供应商自述——无独立基准测试”,以及三张卡片:“覆盖范围:196+ 个国家/地区”“生成:单张消费级 GPU 上每平方公里约 10 分钟”“方法:3D Gaussian Splatting,端到端生成”,上方页脚条写着“Amap 数据,未经审计。为 Flying Street View 2.0 提供支持。”OrcaRouter 徽标合成于右下角。
Engineering & Research

ABot-Earth 0.7:Amap 的 3D 世界模型可在 10 分钟内将一张卫星图像变成一座城市

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Amap 在 2026 年 9 月 10 日公布了一个具体数字:在单张消费级 GPU 上,大约十分钟即可生成一平方公里可探索的街景级 3D 城市。支撑这个数字的模型是ABot-Earth 0.7,它在杭州举行的公司年度 Street Stars 盛典上亮相,并被 Amap——阿里巴巴的地图与导航业务——称为全球首个原生 3D 城市世界模型。它接替了 6 月发布的 ABot-Earth 0.5;与大多数这类研究发布不同,它已经进入 Amap 自家消费级应用的生产环境,该公司称,如今由它驱动的 Street Stars 功能已有超过 8.8 亿人使用。

最后那一点正是让它不只是一段演示片的原因。一个只存在于论文和项目页面中的世界模型,只是一个承诺。一个能在数以亿计的人打开来决定去哪吃饭的应用里渲染场景的世界模型,才是一个产品。ABot-Earth 0.7 属于后者,而有趣的问题在于这对其他所有人意味着什么,而不在于这次发布是否发生了。

实际发布的内容

机制才是值得理解的部分,因为它与数字地球产品历来的构建方式确实不同。Goog​le Earth 及其前身是通过捕捉现实——航空测绘飞行、卫星过境、摄影测量、点云重建——并将结果拼接成一幅可浏览的镶嵌图而组装起来的。其结果是:一个记录各地在被拍摄那一刻的高保真档案;而对于从未以足够分辨率被飞越过的地点,它什么也告诉不了你。

ABot-Earth 转而采用原生 3D 路径。它在时空数据上训练,并生成 3D 高斯泼溅(3DGS)城市场景,端到端地基于带地理空间参考的卫星影像——或者,在 Amap 展示的界面中,基于文本提示生成。由于场景是生成而非重建的,Amap 表示它可以自主补全和扩展空间,而不局限于预定义路线,并且在观看者从全城概览移动到地标细节时保持空间一致性。该公司还表示,输出的是可编辑资产,兼容 Unreal Engine 和 Unity,这一点比听起来更重要:这意味着生成的环境可以接入现有的仿真和游戏管线,而不只是存在于 Amap 的查看器内。

Amap 对 0.7 的主要宣传说法,全部由厂商自行报告,且没有任何一项经过独立基准测试:

速度——在单块消费级 GPU 上,大约 10 分钟即可生成公里级的 3D 城市场景。

效率 — 据高德自身的对比,比传统三维重建方法快最多 1,000 倍,成本仅约为其 1/100。

覆盖范围 — 超过 196 个国家和地区,高于 Amap 为 ABot-Earth 0.5 所宣称的 190 多个。

模态——以卫星影像或文本提示作为输入;Amap 还称该模型具备完整的多模态与预测能力。

输出 — 具有分层细节层次结构的 3DGS 场景,可导出至 Unreal Engine 和 Unity。

A single-column infographic titled 'ABot-Earth 0.7 — the scoreboard' with six rows: 'Coverage: 196+ countries and regions', 'Generation speed: ~10 minutes per km2', 'Hardware: one consumer-grade GPU', 'Input: satellite image or text prompt', 'Output: 3DGS, Unreal and Unity ready', 'Public API: none announced'. The footer reads 'All performance figures Amap-reported; no independent benchmark of ABot-Earth 0.7 has been published.' The OrcaRouter logo is composited in the bottom-right corner.

六个月换来了什么

ABot-Earth 0.5 于 2026 年 6 月 8 日发布,随附一篇 arXiv 技术报告以及高德计算机视觉实验室旗下的配套代码仓库。该版本确立了核心主张——在单块消费级 GPU 上,以每平方公里不到十分钟的速度,将卫星影像转化为无缝的 3DGS 环境,并通过分层细节层级实现实时网页可视化——且覆盖了 190 多个国家。将两个版本并排阅读会发现,0.7 的进步与其说体现在 0.5 早已宣传的 headline 生成速度上,不如说体现在其之上的那个层级。

世界模型定位 —— 0.5 被介绍为生成式 3D 重建系统。0.7 则被介绍为带有预测层的世界模型,这是关于这东西用途的另一种说法。

覆盖范围 — 从 190 多个国家增至 196 个以上,属于小幅扩张,而非跨越式变化。

产品化 — 0.5 指向测试站点与白名单。0.7 随 Flying Street View 2.0 及 Street Stars 应用界面一同发布。

导出目标 — 明确支持虚幻引擎与 Unity 兼容性,而 0.5 的报告并未突出这一点。

代码——值得注意的是,0.5 的 GitHub 仓库被描述为托管技术报告和学术讨论,但其中没有实现代码。目前发布的任何内容都不表明 0.7 改变了这一点。

Flying Street View 2.0 是包含用户的那部分

这一切面向消费者的呈现形式就是 Flying Street View 2.0,它以可自由探索的 3D 空间取代了原版的固定路线飞览。Amap 自己给出的例子很具体:在买票之前预览某个剧院具体座位的实际视线,在购物中心内部导航,在决定出行之前判断景区的地形。用户通过摇杆调整位置、角度和高度,该功能覆盖复杂建筑和大型景区,而不仅仅是街道走廊。目前,包括北京和杭州在内的一些城市的特定场所已上线试用,可通过应用中的 Street Stars 板块访问。

A screenshot of Alibaba's official English-language newsroom (Alizila) post 'Amap Street Stars Marks the First Anniversary with Spatial Intelligence Upgrade', published Sept. 10, 2026, whose summary bullets read 'Amap unveils ABot-Earth 0.7, the world's first native 3D urban world model to power Flying Street View 2.0' and 'More than 880 million users used Amap Street Stars over the past year.'

Amap 所处的规模,正是这件事并非小众工具故事的原因。Street Stars 于 2025 年 9 月推出,是一个 AI 驱动的本地发现排名;Amap 表示,已有超过 8.8 亿用户使用过它,并通过它累计出行 366 亿公里。该公司还声称,该排名具有商业威力——其 2025 年“Local Favorites”榜单中的商家平均订单同比增长 424%,而“Top Picks”商家则增长 159%。这些是 Amap 关于自家产品的数据,应当被视作营销算术来解读,但用户数才是承重的那一项:无论 ABot-Earth 0.7 做得好还是坏,它都是在相当于一个大国人口规模的受众面前做的。

为什么“不是 Google Earth”才是诚实的框架

高德的定位刻意不是“一个更好的地球仪”。公司首席执行官郭宁将其界定为一种品类上的区隔:“如果说大语言模型帮助我们处理文本,我希望Amap的空间智能能帮助我们更好地探索世界。”他所描述的架构分为三层——三维空间表征(世界的结构,从星球到室内空间)、动态感知(交通、人流与路况等实时变化),以及时空推理(预测接下来会发生什么)。

第三层正是世界模型主张的立足点,也正因如此,将其与静态档案相比,低估了Amap正在尝试的事情。重建向你展示一个地方。一个可以被查询并向前推演的世界模型,则是你可以据此进行规划的东西——而Amap所指向的应用,明确就是物理AI的那些:具身机器人的模拟训练场、城市的数字孪生系统、自动驾驶的合成数据,以及低空飞行。该公司还在将该模型与一个名为Navigation Live的对话层配对,后者通过手机摄像头读取附近的建筑、景点和商家,并以自然对话回答关于它们的问题。

这一切底层的数据位势,才是竞争对手无法快速复制的东西。高德拥有近十亿月活跃用户,北斗定位日调用峰值接近一万亿次,以及数十年积累的时空数据,覆盖路网、兴趣点和实时交通。通用模型实验室并不具备这些,而这才是真正的护城河——并非3DGS架构,那只是已发表的研究成果。

Amap 尚未发布的内容

这正是发布报道最为薄弱之处,而对于任何试图判断ABot-Earth 0.7是否应纳入计划的人来说,这一点至关重要。

没有公开 API。abot-earth.amap.com 上的体验站点已上线,但生成功能仅限邀请——界面将创作功能描述为处于测试阶段,并提供白名单申请,而它背后的账户显示积分余额为零。没有公布定价,没有价目表,也没有开发者文档说明外部系统将如何调用该模型。该网站还通篇使用简体中文,没有区域语言切换器,也没有英文版本,因此目前要用英文评估它,就只能依据高德的新闻材料。

既没有模型权重,也没有模型卡。0.5 版本在 arXiv 上发布了一份技术报告,并在 GitHub 上建了一个仓库,而那个仓库明确是这份报告的存放处,而不是实现。0.7 发布时宣布的内容没有任何迹象表明是开放权重发布,Amap 也没有作其他表示。

最重要的是,并没有独立的基准测试。本文中的每一项性能数字——每平方公里十分钟、1000 倍效率、百分之一的成本、196 个以上国家——都源自 Amap。这并不是不相信它们的理由;同一实验室已发表的 3DGS 研究一直对同行可见,而面向消费者的推出本身也是一种证明:该系统能够大规模运行。它只是一个理由,让我们在 Amap 之外的某个人用自己的硬件复现这些结果之前,将它们视为主张而非测量结果。“全球首个原生 3D 城市世界模型”同样是 Amap 的提法,而这一类别边界也由 Amap 划定。

如果你用模型来构建,这意味着什么

ABot-Earth 0.7 不是语言模型,也不是你今天能通过 API 路由调用的东西——OrcaRouter 不提供它,Amap 白名单之外的任何人也无法调用它。把这一点说清楚才是关键,因为对大多数团队来说,实际的启示比发布时的新闻标题所暗示的更窄,也更有用。

空间应用真正需要的是两件不同的事:一个生成或重建环境的世界模型,以及一个能在对话中对其展开推理的语言模型。Amap 自身的技术栈正体现了这种分工——ABot-Earth 负责渲染地点,而另有一个独立的对话层来处理 Navigation Live 关于它的提问。如果你要构建这一模式的另一半,语言这一侧就是常规的路由模型工作,而且它现在就已经可用:一个 API 覆盖 200 多个模型,按供应商标价、0% 加价当供应商服务劣化时自动故障转移,一个可将多个模型组合成单次调用的路由 DSL,以及在你希望由一组模型共同作答时的模型融合。这就是你今天便可基于其构建的那一层,而 ABot-Earth 0.7 仍处于白名单之内。

A screenshot of the Hugging Face Papers page for 'ABot-Earth 0.5: Generative 3D Earth Model' (arXiv 2606.09967, published June 8, attributed to Alibaba AMAP CV Lab), showing the abstract describing 3D Gaussian Splatting generation from geospatially referenced satellite imagery at under 10 minutes per square kilometre on a consumer-grade single GPU, and a community note confirming the companion GitHub repo 'does not contain implementation code'.

什么会改变这一解读?

有四件事值得关注,而每一件都会让 ABot-Earth 0.7 从一份令人印象深刻的厂商公告,变成技术团队可以据此做规划的东西。第一,独立评估——任何人在自己的单块 GPU 上复现“每平方公里十分钟”的说法,都会把一个营销数字变成参考基准。第二,公布 API 和价格,这才会让该模型可被调用,而不仅仅是可见。第三,0.7 的技术报告到底会不会出现;0.5 在几天内就有了一份,而六个月后若仍没有,这本身就会成为一个信号,说明 0.7 有多少是架构性的,而非增量式的。第四,开放权重的问题是否会得到答案,因为一个带有可下载权重的 3DGS 世界模型,对于 Amap 声称正在争取的具身智能和仿真团队而言,将是一个本质上不同的方案。

在那之前,诚实的总结是这样的:Amap 已经交付了迄今为止任何人推向消费者的最具产品化的 3D 世界模型,其覆盖范围和成本特征确实非同寻常;而它做到这一点,却并未公布那些能让外界核验其工作的数字、权重或接口。这句话的两半都是真的,而后半句并不是对前半句的批评——它只是目前证据所能支撑的结论。