Gemini Robotics ER 2: El cerebro robótico de razonamiento encarnado de Google DeepMind, explicado
Engineering & Research

Gemini Robotics ER 2: El cerebro robótico de razonamiento encarnado de Google DeepMind, explicado

Autor

jinhao song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

de Google DeepMindGemini Robotics ER 2 — lanzado en vista previa pública el 30 de julio de 2026 — es un modelo especializado de visión y lenguaje diseñado para ser el "cerebro" de alto nivel de un robot. "ER" significa Embodied Reasoning (Razonamiento Encarnado): en lugar de controlar directamente los motores, ER 2 ve y comprende el mundo físico, razona sobre el espacio y el tiempo, planifica tareas de varios pasos, orquesta herramientas y coordina robots. También incluye una variante de streaming en tiempo real para control interactivo de baja latencia. Esta guía explica qué es ER 2, en qué se diferencia de un modelo de control directo, qué hay de nuevo frente a ER 1.6 y dónde encaja — con capacidades documentadas.

En cuanto a la exactitud, {{1}}nota:{{/1}} las capacidades, la {{2}}disponibilidad{{/2}} y las {{3}}afirmaciones{{/3}} de seguridad provienen del anuncio de Google DeepMind y del registro de cambios de la API de Gemini (2026-07-30). Las {{4}}pruebas de referencia{{/4}} de robótica son preliminares y {{5}}reportadas por el proveedor;{{/5}} los precios se rigen por la facturación estándar de la API de Gemini y no se publicaron {{6}}detalles específicos{{/6}}. Los detalles {{7}}cambian{{/7}} — {{8}}verifica{{/8}} antes de construir.

TL;DR. Gemini Robotics ER 2 es un VLM de razonamiento incorporado que actúa como cerebro de planificación y percepción de un robot: comprensión de video, razonamiento espacial, orquestación de herramientas de múltiples pasos, localización de momentos en video, seguimiento de progreso, coordinación multi-robot y autocorrección, con una variante de streaming para interacción bidireccional de audio y video en tiempo real. Está disponible en la API de Gemini (code>gemini-robotics-er-2-preview/code> y code>gemini-robotics-er-2-streaming-preview/code>) y en Google AI Studio, como vista previa cerrada. Google lo posiciona como su modelo de robótica más seguro hasta la fecha, con mejoras notables sobre ER 1.6 en coordinación multi-robot y seguimiento de progreso. Es una capa de razonamiento, no un controlador de actuadores de bajo nivel.

Conclusiones clave

• Razonamiento Encarnado (ER): ER 2 es el cerebro de alto nivel de percepción y planificación, no un controlador motor directo (esa es la línea separada de VLA/en el dispositivo).

- Habilidades principales: comprensión de video, razonamiento espacial, orquestación de herramientas multipaso, localización de momentos en video, clasificación de progreso, coordinación multi-robot, autocorrección.

• Variante de streaming: code>gemini-robotics-er-2-streaming-preview/code> añade interacción bidireccional de audio y vídeo de baja latencia para control y diálogo en tiempo real.

• Seguridad ante todo: Google posiciona ER 2 como su modelo de robótica más seguro en el cumplimiento de restricciones de seguridad y proximidad humana, con mejoras en el benchmark ASIMOV2.

• Disponibilidad: Gemini API + Google AI Studio (vista previa pública); Enterprise Agent Platform en vista previa privada; modelos VLA/en el dispositivo limitados a socios iniciales. Cerrado.

Qué significa "Embodied Reasoning"

Las arquitecturas de robótica moderna se dividen cada vez más en dos capas. Un cerebro de razonamiento de alto nivel comprende la escena, decide qué hacer y planifica; un modelo de acción de bajo nivel traduce los planes en comandos motores precisos. Gemini Robotics ER 2 es la primera capa: un modelo de visión-lenguaje con razonamiento encarnado. Recibe video (y audio y texto), construye una comprensión de los objetos, el espacio y el progreso a lo largo del tiempo, y genera planes y llamadas a herramientas — incluyendo invocar herramientas externas como Google Search — que un sistema de acción separado o un humano pueden ejecutar. En otras palabras, ER 2 es la parte del robot que piensa, no la que se mueve; el modelo de visión-lenguaje-acción (VLA) de control directo de Google y los modelos en el dispositivo son una línea separada, actualmente limitada a los primeros socios.

Qué puede hacer ER 2

Google describe un amplio conjunto de habilidades de razonamiento encarnado. ER 2 puede entender vídeo y localizar momentos específicos dentro de él ("¿cuándo se cayó la taza?"), razonar sobre el espacio 3D y las relaciones entre objetos, clasificar el progreso de una tarea (¿está el paso completado, a medias o fallido?), y orquestar el uso de herramientas en múltiples pasos para lograr un objetivo. Puede mantener un diálogo con una persona y planificar tareas que abarcan varios minutos, autocorregirse cuando algo sale mal y — notablemente — coordinar múltiples robots que trabajan juntos. Estas son exactamente las capacidades que un robot necesita para operar en entornos reales y desordenados, en lugar de demostraciones guionizadas.

La variante de streaming: interacción en tiempo real

Junto con la vista previa estándar, Google lanzó code>gemini-robotics-er-2-streaming-preview/code>, optimizado para audio y vídeo bidireccionales de baja latencia. Esto es importante para el uso encarnado: un robot necesita percibir, razonar y responder continuamente, no en lentas rondas de solicitud-respuesta. El modelo de streaming permite la interacción en tiempo real — observar una transmisión en vivo, hablar con una persona y ajustar un plan sobre la marcha — algo esencial para asistentes interactivos, soporte de teleoperación y tareas dinámicas de varios pasos.

Novedades frente a ER 1.6

ER 2 es un claro paso adelante respecto a Gemini Robotics ER 1.6. Google destaca una coordinación multi-robot y un seguimiento del progreso de las tareas notablemente mejores, una orquestación de herramientas de varios pasos más sólida y un comportamiento de seguridad mejorado. Específicamente en el ámbito de la seguridad, Google posiciona a ER 2 como su modelo de robótica más seguro hasta la fecha, citando un mejor cumplimiento de las restricciones de seguridad, un mejor comportamiento en proximidad humana y avances en el punto de referencia de seguridad ASIMOV2. Para los equipos que desarrollan implementaciones reales, las mejoras en coordinación, seguimiento del progreso y seguridad son las actualizaciones más importantes.

Seguridad y evaluación

La seguridad es central para el posicionamiento de ER 2. Google informa que lidera en el cumplimiento de restricciones de seguridad y en qué tan cerca está su comportamiento del juicio humano seguro en torno a las personas, con puntuaciones mejoradas en ASIMOV2 (un punto de referencia de robótica orientado a la seguridad). Debido a que la robótica actúa en el mundo físico, estas propiedades de seguridad importan mucho más que para un chatbot — un error de planificación puede causar daños reales. Como con cualquier punto de referencia de un proveedor, trate los detalles como preliminares y direccionales; la evaluación independiente de la robótica aún está madurando.

Disponibilidad y precios

ER 2 está disponible en vista previa pública a través de la API de Gemini — los ID de modelo code>gemini-robotics-er-2-preview/code> y code>gemini-robotics-er-2-streaming-preview/code> — y en Google AI Studio. Una integración con Enterprise Agent Platform está en vista previa privada, y los modelos VLA de control directo y los modelos en el dispositivo siguen limitados a socios iniciales. Está cerrado. Los precios siguen la facturación estándar de la API de Gemini; Google no publicó tarifas específicas de robótica en el lanzamiento. Verifica el acceso actual y los costos en la documentación de la API de Gemini.

Tres escenarios donde encaja ER 2

1. Robots de almacén y logística

El razonamiento espacial, el seguimiento de progreso y la coordinación multi-robot se adaptan a tareas de pick-and-place, clasificación y flotas, donde los robots deben entender escenas y cooperar.

2. Robots asistentes interactivos

La interacción audiovisual en tiempo real de la variante de streaming permite que los robots observen, escuchen, conversen y planifiquen tareas de varios minutos con una persona.

3. Inspección y monitoreo

La comprensión de video y la localización de momentos hacen que ER 2 sea útil para analizar transmisiones en vivo o grabadas — detectar eventos, clasificar estados y señalar progresos o fallos.

Cómo encaja en un stack de IA más amplio

Gemini Robotics ER 2 es un modelo de robótica especializado al que se accede a través de la API de Gemini de Google, no un LLM de propósito general; por lo tanto, no es algo que un enrutador de modelos generales aloje. Para las partes de lenguaje y multimodales de propósito general de una aplicación en torno a un robot (interfaces de lenguaje natural, razonamiento, orquestación, análisis), un endpoint independiente del proveedor mantiene abiertas tus opciones: a href="https://www.orcarouter.ai/">OrcaRouter/a> proporciona un endpoint compatible con OpenAI para muchos LLM de texto y multimodales (incluidos los modelos Gemini generales de Google), mientras que el control corpóreo de ER 2 se ejecuta a través de la API de robótica dedicada de Google. Esa separación es natural: usa el cerebro robótico especializado para la corporeización, y un endpoint independiente del proveedor para todo lo demás.

Limitaciones y advertencias

ER 2 es una capa de razonamiento/planificación, no un robot llave en mano — todavía necesitas un sistema de acción (los modelos VLA/en el dispositivo de Google, limitados a socios, o los tuyos propios) para ejecutar planes físicamente. Es una vista previa cerrada, por lo que la disponibilidad y el comportamiento pueden cambiar, y los detalles de precios no están publicados. Sus afirmaciones sobre benchmarks y seguridad son reportadas por el proveedor y preliminares; la evaluación robótica independiente es inmadura. Y el despliegue físico conlleva obligaciones de seguridad en el mundo real que van mucho más allá de las pruebas de software. Trátalo como una vista previa potente para crear prototipos, no como un controlador de producción terminado.

Preguntas frecuentes

¿Qué es Gemini Robotics ER 2?

Modelo de visión y lenguaje con razonamiento encarnado de Google DeepMind — el cerebro de alto nivel de percepción y planificación de un robot — lanzado en vista previa pública el 30 de julio de 2026, con una variante de transmisión en tiempo real.

¿Controla ER 2 los motores del robot directamente?

No. ER 2 es la capa de razonamiento/planificación; el control motor directo está gestionado por modelos separados: {{KEEP}}vision-language-action (VLA){{/KEEP}} y modelos en el dispositivo, actualmente limitados a los primeros socios.

¿Qué puede hacer ER 2?

Comprensión de video y localización de momentos, razonamiento espacial, orquestación de herramientas de múltiples pasos, clasificación de progreso, coordinación multi-robot, autocorrección e interacción en tiempo real (variante de streaming).

¿En qué se diferencia ER 2 de ER 1.6?

Google informa de una mejor coordinación multi-robot y un mejor seguimiento del progreso, una orquestación de herramientas más sólida y una mayor seguridad, incluidos avances en el benchmark de seguridad ASIMOV2, lo que posiciona a ER 2 como su modelo de robótica más seguro hasta la fecha.

¿Cómo accedo a Gemini Robotics ER 2?

A través de la API de Gemini (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) y Google AI Studio, como una vista previa pública cerrada. Los precios siguen la facturación estándar de la API de Gemini.

¿Es ER 2 seguro para robots reales?

Google lo posiciona como su modelo de robótica más seguro en cuanto al cumplimiento de restricciones de seguridad y proximidad humana, pero el despliegue encarnado conlleva obligaciones de seguridad en el mundo real; trate las afirmaciones de seguridad como preliminares y valídelas rigurosamente.

En resumen

Gemini Robotics ER 2 es un gran paso para la IA encarnada: un cerebro de razonamiento centrado en la seguridad que permite a los robots comprender video, razonar sobre el espacio y el tiempo, planificar tareas de varios minutos, coordinarse con otros robots e interactuar en tiempo real mediante su variante de streaming. Es una capa de planificación, no un controlador de motores, y es una vista previa cerrada en etapa temprana con benchmarks reportados por el proveedor — pero las mejoras en coordinación, seguimiento de progreso y seguridad respecto a ER 1.6 son significativas. Prototipa con él a través de la API de Gemini para la encarnación, y mantén las partes de lenguaje general y multimodales de tu stack neutrales respecto al proveedor mediante un endpoint como OrcaRouter.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube