Gemini Robotics ER 2: объясняем воплощённый рассуждающий мозг робота Google DeepMind
Engineering & Research

Gemini Robotics ER 2: объясняем воплощённый рассуждающий мозг робота Google DeepMind

Автор

jinhao song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

от Google DeepMindGemini Robotics ER 2, выпущенная в публичной предварительной версии 30 июля 2026 года, — это специализированная визуально-языковая модель, созданная как высокоуровневый «мозг» робота. «ER» расшифровывается как Embodied Reasoning («воплощённое рассуждение»): вместо непосредственного управления моторами, ER 2 видит и понимает физический мир, рассуждает о пространстве и времени, планирует многошаговые задачи, управляет инструментами и координирует роботов. Она также включает вариант потоковой передачи в реальном времени для интерактивного управления с малой задержкой. Это руководство объясняет, что такое ER 2, чем она отличается от модели прямого управления, что нового в ней по сравнению с ER 1.6 и какое место она занимает — с указанием источников сведений о возможностях.

Примечание о точности: сведения о возможностях, доступности и безопасности взяты из анонса Google DeepMind и журнала изменений Gemini API (2026-07-30). Показатели робототехники предварительные и предоставлены поставщиком; ценообразование соответствует стандартной тарификации Gemini API, конкретные детали не публиковались. Детали меняются — проверяйте перед созданием.

TL;DR. Gemini Robotics ER 2 — это VLM воплощённого мышления, которая выступает в роли планировщика и перцептивного мозга робота: понимание видео, пространственные рассуждения, многошаговая оркестрация инструментов, локализация моментов в видео, отслеживание прогресса, координация нескольких роботов и самокоррекция, а также потоковый вариант для двустороннего аудио-видео взаимодействия в реальном времени. Модель доступна в Gemini API (code>gemini-robotics-er-2-preview/code> и code>gemini-robotics-er-2-streaming-preview/code>) и Google AI Studio в режиме закрытого предварительного доступа. Google считает её своей самой безопасной робототехнической моделью на сегодняшний день, с заметными улучшениями по сравнению с ER 1.6 в координации нескольких роботов и отслеживании прогресса. Это рассуждающий слой, а не низкоуровневый контроллер приводов.

Основные выводы

• Воплощённое рассуждение (ER): ER 2 — это высокоуровневый мозг для восприятия и планирования, а не прямой контроллер двигателя (это отдельная линия VLA/на устройстве).

• Ключевые навыки: понимание видео, пространственное рассуждение, многоэтапная оркестрация инструментов, локализация моментов в видео, классификация прогресса, координация нескольких роботов, самокоррекция.

• Потоковый вариант: code>gemini-robotics-er-2-streaming-preview/code> добавляет двунаправленное аудио-видео взаимодействие с низкой задержкой для управления и диалога в реальном времени.

Безопасность прежде всего: Google позиционирует ER 2 как свою самую безопасную робототехническую модель по соблюдению ограничений безопасности и нахождению рядом с человеком, с улучшениями на бенчмарке ASIMOV2.

• Доступность: Gemini API + Google AI Studio (публичная предварительная версия); Enterprise Agent Platform — в закрытой предварительной версии; модели VLA/on-device доступны только ранним партнёрам. Закрыто.

Что означает «воплощённое рассуждение»?

Современные стеки робототехники всё чаще разделяются на два уровня. Мозг высокого уровня, отвечающий за рассуждения, понимает сцену, решает, что делать, и планирует; низкоуровневая модель действий преобразует планы в точные команды двигателей. Gemini Robotics ER 2 — это первый уровень: визуально-языковая модель воплощённого рассуждения. Она принимает на вход видео (а также аудио и текст), формирует понимание объектов, пространства и изменений во времени и выдаёт планы и вызовы инструментов — включая обращение к внешним инструментам, таким как Google Search, — которые может выполнить отдельная система действий или человек. Другими словами, ER 2 — это часть робота, которая думает, а не та, которая движется; модели Google прямого управления (vision-language-action, VLA) и модели на устройстве представляют собой отдельную линейку, в настоящее время ограниченную ранними партнёрами.

Что умеет ER 2

Google описывает широкий набор навыков воплощённого мышления. ER 2 может понимать видео и локализовать в нём конкретные моменты («когда упала чашка?»), рассуждать о трёхмерном пространстве и отношениях между объектами, классифицировать прогресс выполнения задачи (шаг выполнен, выполнен частично или не удался?) и организовывать многошаговое использование инструментов для достижения цели. Она может вести диалог с человеком и планировать задачи на несколько минут, самостоятельно исправляться, когда что-то идёт не так, и — что примечательно — координировать совместную работу нескольких роботов. Именно такие возможности нужны роботу, чтобы работать в реальных, неструктурированных средах, а не в отрепетированных демонстрациях.

Потоковый вариант: взаимодействие в реальном времени

Наряду со стандартной предварительной версией Google выпустила code>gemini-robotics-er-2-streaming-preview/code>, оптимизированную для двунаправленного аудио-видео с низкой задержкой. Это важно для воплощённых систем: роботу необходимо непрерывно воспринимать, рассуждать и реагировать, а не работать в медленном цикле «запрос-ответ». Потоковая модель позволяет взаимодействовать в реальном времени — наблюдать за прямым видеопотоком, разговаривать с человеком и корректировать план на лету, — что необходимо для интерактивных ассистентов, поддержки телеуправления и динамических многошаговых задач.

Что нового по сравнению с ER 1.6

ER 2 — это явный шаг вперёд по сравнению с Gemini Robotics ER 1.6. Google отмечает заметно более качественную координацию нескольких роботов и отслеживание прогресса выполнения задач, более надёжную оркестрацию многошаговых инструментов и улучшенное поведение с точки зрения безопасности. Что касается непосредственно безопасности, Google позиционирует ER 2 как свою самую безопасную робототехническую модель на сегодняшний день, ссылаясь на улучшенное соблюдение ограничений безопасности и поведение при нахождении людей поблизости, а также на улучшенные показатели в бенчмарке безопасности ASIMOV2. Для команд, работающих над реальными внедрениями, улучшения координации, отслеживания прогресса и безопасности являются наиболее значимыми обновлениями.

Безопасность и оценка

Безопасность является центральным элементом позиционирования ER 2. Google сообщает, что она лидирует по соблюдению ограничений безопасности и по тому, насколько её поведение соответствует безопасным человеческим суждениям о людях, с улучшенными показателями на ASIMOV2 (ориентированном на безопасность робототехническом бенчмарке). Поскольку робототехника действует в физическом мире, эти свойства безопасности важны гораздо больше, чем для чат-бота — ошибка планирования может причинить реальный вред. Как и в случае с любым бенчмарком от вендора, относитесь к конкретным цифрам как к предварительным и ориентировочным; независимая оценка робототехники всё ещё развивается.

Наличие и цены

ER 2 доступен в публичной предварительной версии через Gemini API — идентификаторы моделей code>gemini-robotics-er-2-preview/code> и code>gemini-robotics-er-2-streaming-preview/code> — а также в Google AI Studio. Интеграция с Enterprise Agent Platform находится в закрытой предварительной версии, а модели VLA с прямым управлением и on-device модели остаются доступными только ранним партнёрам. Доступ закрыт. Цены соответствуют стандартной тарификации Gemini API; Google не публиковал специальные тарифы для робототехники на момент запуска. Уточняйте актуальный доступ и стоимость в документации Gemini API.

Три сценария, где подходит ER 2

1. Складские и логистические роботы

Пространственное мышление, отслеживание прогресса и координация нескольких роботов подходят для задач подбора и размещения, сортировки и управления флотом, где роботы должны понимать сцены и взаимодействовать.

2. Интерактивные роботы-ассистенты

Потоковый вариант обеспечивает взаимодействие в реальном времени на основе аудио и видео, что позволяет роботам наблюдать, слушать, общаться и планировать многоэтапные задачи вместе с человеком.

3. Осмотр и мониторинг

Понимание видео и локализация моментов делают ER 2 полезным для анализа прямых или записанных трансляций — обнаружения событий, классификации состояний и фиксации прогресса или сбоев.

Как это вписывается в более широкий AI-стек

Gemini Robotics ER 2 — это специализированная робототехническая модель, доступная через Gemini API от Google, а не универсальная LLM, поэтому её нет в маршрутизаторе моделей общего назначения. Для универсальных языковых и мультимодальных компонентов приложения, построенного вокруг робота, — таких как интерфейсы на естественном языке, рассуждения, оркестрация и аналитика, — не зависящая от поставщика конечная точка оставляет вам свободу выбора: a href="https://www.orcarouter.ai/">OrcaRouter/a> предоставляет одну OpenAI-совместимую конечную точку для доступа ко множеству текстовых и мультимодальных LLM (включая универсальные модели Gemini от Google), в то время как воплощённое управление ER 2 работает через выделенный API робототехники от Google. Такое разделение естественно: используйте специализированный мозг робота для воплощения, а не зависящую от поставщика конечную точку — для всего остального.

Ограничения и оговорки

ER 2 — это уровень рассуждения/планирования, а не готовый робот: вам всё равно нужна система действий (модели Google VLA/on-device, доступные только партнёрам, или ваша собственная), чтобы физически выполнять планы. Это закрытая предварительная версия, поэтому доступность и поведение могут меняться, а конкретные цены не опубликованы. Заявления о бенчмарках и безопасности исходят от вендора и носят ранний характер; независимая оценка в робототехнике пока незрелая. Развёртывание на физических системах несёт реальные обязательства по безопасности, выходящие далеко за рамки тестирования ПО. Воспринимайте это как мощную предварительную версию для прототипирования, а не как готовый производственный контроллер.

Часто задаваемые вопросы

Что такое Gemini Robotics ER 2?

Воплощённая рассуждающая визуально-языковая модель Google DeepMind — высокоуровневый мозг восприятия и планирования робота — выпущена в публичной предварительной версии 30 июля 2026 года с вариантом потоковой передачи в реальном времени.

Управляет ли ER 2 двигателями робота напрямую?

Нет. ER 2 — это слой рассуждений/планирования; прямое управление моторами осуществляется отдельными моделями vision-language-action (VLA) и встроенными моделями, которые в настоящее время доступны только ранним партнёрам.

Что может делать ER 2?

Понимание видео и локализация моментов, пространственное рассуждение, многошаговая оркестрация инструментов, классификация прогресса, координация нескольких роботов, самокоррекция и взаимодействие в реальном времени (потоковый вариант).

Чем ER 2 отличается от ER 1.6?

Google сообщает об улучшенной координации нескольких роботов и отслеживании прогресса, более надёжной оркестрации инструментов и повышенной безопасности — включая прирост по бенчмарку безопасности ASIMOV2 — что позиционирует ER 2 как самую безопасную робототехническую модель компании на сегодняшний день.

Как мне получить доступ к Gemini Robotics ER 2?

Через Gemini API (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) и Google AI Studio, как закрытая публичная предварительная версия. Цены соответствуют стандартной тарификации Gemini API.

Безопасен ли ER 2 для реальных роботов?

Google позиционирует его как свою самую безопасную робототехническую модель по соблюдению ограничений безопасности и нахождению вблизи человека, однако физическое развертывание накладывает реальные обязательства в области безопасности; относитесь к заявлениям о безопасности как к предварительным и проверяйте их со всей строгостью.

Суть

Gemini Robotics ER 2 — это важный шаг для воплощённого ИИ: сфокусированный на безопасности рассуждающий мозг, который позволяет роботам понимать видео, рассуждать о пространстве и времени, планировать задачи на несколько минут, координировать действия с другими роботами и взаимодействовать в реальном времени через его потоковый вариант. Это слой планирования, а не контроллер двигателей, и это ранняя закрытая предварительная версия с бенчмарками, заявленными производителем, — но улучшения в координации, отслеживании прогресса и безопасности по сравнению с ER 1.6 значительны. Прототипируйте с ним через Gemini API для воплощённого ИИ и сохраняйте общие языковые/мультимодальные части вашего стека независимыми от вендора через такой эндпоинт, как OrcaRouter.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube