
Gemini Robotics ER 2:Google DeepMind 的具身推理机器人大脑,详解
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 206 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- google新Google: Gemini 3.6 Flash2026-07-2150智能69代码
- google新Google: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
- anthropicAnthropic: Claude Fable 52026-06-0960智能77代码
Google DeepMind 的Gemini Robotics ER 2——于2026年7月30日开放公开预览——是一款专为充当机器人高层"大脑"而构建的视觉-语言模型。"ER"代表"具身推理"(Embodied Reasoning):ER 2 并非直接驱动电机,而是观察并理解物理世界,对空间和时间进行推理,规划多步骤任务,编排工具,并协调机器人。它还提供实时流式版本,用于低延迟的交互式控制。本指南介绍了 ER 2 是什么、它与直接控制模型有何不同、相较于 ER 1.6 有哪些新特性,以及它的适用场景——并附有能力来源。
准确性说明:能力、可用性和安全声明均来自 Google DeepMind 的公告及 Gemini API 变更日志(2026-07-30)。机器人技术基准测试尚处于早期阶段,且由供应商自行报告;定价遵循标准 Gemini API 计费方式,具体细节未公布。细节可能会有变化——请在构建前核实。
TL;DR。Gemini Robotics ER 2 是一个具身推理 VLM,充当机器人的规划与感知大脑:视频理解、空间推理、多步骤工具编排、视频时刻定位、进度跟踪、多机器人协调以及自我纠错,并提供流式变体以支持实时双向音视频交互。它可通过 Gemini API(code>gemini-robotics-er-2-preview/code> 和 code>gemini-robotics-er-2-streaming-preview/code>)以及 Google AI Studio 获取,目前为封闭预览版。Google 称其为迄今最安全的机器人模型,与 ER 1.6 相比,在多机器人协调和进度跟踪方面有显著提升。它是一个推理层,而非底层执行器控制器。
关键要点
• 具身推理(ER):ER 2 是高层感知与规划大脑,而非直接的运动控制器(那是独立的 VLA/设备端路线)。
• 核心技能:视频理解、空间推理、多步骤工具编排、视频时刻定位、进度分类、多机器人协调、自我修正。
• 流式变体:code>gemini-robotics-er-2-streaming-preview/code> 为实时控制和对话提供低延迟的双向音视频交互。
• 安全优先:在安全约束遵守和人类接近性方面,谷歌将 ER 2 定位为其最安全的机器人模型,并在 ASIMOV2 基准测试中取得进展。
• 可用性:Gemini API + Google AI Studio(公开预览);Enterprise Agent Platform(私有预览);VLA/端侧模型仅限于早期合作伙伴。已关闭。
“具身推理”是什么意思?
现代机器人技术栈日益分为两个层次。高层推理大脑理解场景、决定做什么并制定计划;低层动作模型则将计划转化为精确的运动指令。Gemini Robotics ER 2 属于第一层:一个具身推理视觉语言模型。它接收视频(以及音频和文本),构建对物体、空间和随时间进展的理解,并输出计划和工具调用——包括调用 Google Search 等外部工具——供独立的动作系统或人类执行。换言之,ER 2 是机器人中负责“思考”的部分,而非“移动”的部分;谷歌的直接控制视觉语言动作(VLA)模型和端侧模型是另一条产品线,目前仅限于早期合作伙伴。

ER 2 能做什么
Google 描述了一整套广泛的具身推理技能。ER 2 能够理解视频并定位其中的特定时刻(“杯子是何时掉落的?”)、对三维空间及物体关系进行推理、对任务进度进行分类(该步骤是已完成、部分完成还是失败?),并编排多步骤工具使用以实现目标。它能与人对话,规划持续数分钟的任务,在出错时自我纠正,并且——值得注意的是——协调多台机器人协同工作。这些正是机器人在杂乱的真实环境而非脚本化演示中运行所需的能力。
流式变体:实时交互
除了标准预览版之外,Google 还推出了 code>gemini-robotics-er-2-streaming-preview/code>,该模型针对低延迟、双向音视频进行了优化。这对具身智能应用至关重要:机器人需要持续地感知、推理和响应,而不是在缓慢的请求-响应循环中工作。流式模型支持实时交互——观看实时画面、与人对话、即时调整计划——这对于交互式助手、远程操作支持和动态多步任务来说不可或缺。
与 ER 1.6 相比的新内容
ER 2 相较于 Gemini Robotics ER 1.6 是一次明显的升级。Google 强调其多机器人协调和任务进度跟踪能力显著提升,多步骤工具编排能力更强,安全行为也有所改善。具体到安全方面,Google 将 ER 2 定位为其迄今最安全的机器人模型,理由是它更严格地遵守安全约束、改善了人机接近行为,并在 ASIMOV2 安全基准上取得了进步。对于构建实际部署的团队而言,协调能力、进度跟踪和安全性的改进是最重要的升级。
安全与评估
安全性是 ER 2 定位的核心。谷歌报告称,它在安全约束遵守以及行为与人类安全判断的接近程度方面领先,在 ASIMOV2(一个以安全为导向的机器人基准)上分数有所提高。由于机器人作用于物理世界,这些安全属性远比聊天机器人重要得多——规划错误可能造成实际伤害。与任何供应商基准一样,应将具体数据视为早期方向性指标;独立的机器人评估仍在成熟中。

供货情况与定价
ER 2 现可通过 Gemini API 公开预览使用——模型 ID 为 code>gemini-robotics-er-2-preview/code> 和 code>gemini-robotics-er-2-streaming-preview/code>——也可在 Google AI Studio 中使用。Enterprise Agent Platform 集成处于私有预览阶段,直接控制 VLA 和端侧模型仍仅限早期合作伙伴使用。这些功能不公开。定价遵循标准 Gemini API 计费;Google 在发布时未公布机器人专属费率。请在 Gemini API 文档中确认当前访问权限和费用。
ER 2 适用的三种场景
1. 仓库与物流机器人
空间推理、进度跟踪和多机器人协调适用于抓取与放置、分拣及集群任务,在这些任务中,机器人需要理解场景并相互协作。
2. 交互式辅助机器人
流式变体的实时音视频交互使机器人能够观看、聆听、交谈,并与人类一起规划多分钟的任务。
3. 检查与监控
视频理解与时刻定位使 ER 2 适用于分析实时或录制的视频流——识别事件、分类状态,并标记进展或失败。
它如何融入更广泛的AI技术栈
Gemini Robotics ER 2 是一种通过 Google Gemini API 访问的专用机器人模型,并非通用大语言模型——因此通用模型路由器不会托管它。对于围绕机器人的应用中的通用语言和多模态部分——自然语言界面、推理、编排、分析——一个供应商中立的端点可以让你保留更多选择:a href="https://www.orcarouter.ai/">OrcaRouter/a> 为多种文本和多模态 LLM(包括 Google 的通用 Gemini 模型)提供一个 OpenAI 兼容端点,而 ER 2 的具身控制则通过 Google 的专用机器人 API 运行。这种分离很自然:将专用机器人大脑用于具身,将供应商中立端点用于其他一切。
限制与注意事项
ER 2 是一个推理/规划层,而不是一个开箱即用的机器人——你仍然需要一个动作系统(Google 的 VLA/端侧模型,仅限于合作伙伴,或你自己的),才能在物理世界中执行计划。这是一项封闭预览,因此可用性和行为可能会发生变化,且具体定价尚未公布。其基准测试和安全声明均为厂商报告,且处于早期阶段;独立的机器人评估尚不成熟。并且具身部署带来了远超软件测试的现实世界安全责任。将其视为一个用于原型开发的强大预览版,而非成品级的生产控制器。
常见问题
什么是Gemini Robotics ER 2?
Google DeepMind的具身推理视觉语言模型——机器人的高层感知与规划大脑——于2026年7月30日公开发布预览版,并提供实时流式变体。
ER 2 是否直接控制机器人电机?
不。ER 2 是推理/规划层;直接电机控制由独立的视觉-语言-动作(VLA)模型和端侧模型处理,目前仅限于早期合作伙伴。
ER 2 能做什么?
视频理解与时刻定位、空间推理、多步骤工具编排、进度分类、多机器人协调、自我纠正,以及实时交互(流式变体)。
ER 2 与 ER 1.6 有何不同?
Google报告称,其多机器人协调与进度跟踪能力更佳,工具编排能力更强,安全性也有所提升——包括在ASIMOV2安全基准测试上取得的进步——使ER 2成为其迄今为止最安全的机器人模型。
我如何访问 Gemini Robotics ER 2?
通过 Gemini API(code>gemini-robotics-er-2-preview/code>、code>gemini-robotics-er-2-streaming-preview/code>)和 Google AI Studio 以封闭公开预览形式提供。定价遵循标准 Gemini API 计费。
ER 2 对真实机器人安全吗?
Google将其定位为在安全约束遵循和人类接近性方面最安全的机器人模型,但具身部署承担着现实世界中的安全义务;应将安全声明视为早期声明,并严格验证。
底线
Gemini Robotics ER 2 是具身智能(embodied AI)迈出的重要一步:一个以安全为核心的推理大脑,让机器人能够理解视频、对空间与时间进行推理、规划长达数分钟的任务、与其他机器人协同,并通过其流式变体进行实时交互。它是一个规划层,而非电机控制器;目前处于早期封闭预览阶段,基准测试数据由供应商提供——但与 ER 1.6 相比,在协同、进度跟踪和安全性方面的提升意义重大。你可以通过用于具身智能的 Gemini API 进行原型开发,并借助 OrcaRouter 之类的端点,让技术栈中的通用语言/多模态部分保持供应商中立。
