Gemini Robotics ER 2: O Cérebro Robótico com Raciocínio Corporificado do Google DeepMind, Explicado
Engineering & Research

Gemini Robotics ER 2: O Cérebro Robótico com Raciocínio Corporificado do Google DeepMind, Explicado

Autor

jinhao song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

da Google DeepMindGemini Robotics ER 2— lançado em pré-visualização pública em 30 de julho de 2026 — é um modelo especializado de visão-linguagem criado para ser o "cérebro" de alto nível de um robô. "ER" significa Embodied Reasoning (Raciocínio Incorporado): em vez de acionar motores diretamente, o ER 2 vê e compreende o mundo físico, raciocina sobre espaço e tempo, planeja tarefas de múltiplas etapas, orquestra ferramentas e coordena robôs. Ele também inclui uma variante de streaming em tempo real para controle interativo de baixa latência. Este guia explica o que é o ER 2, como ele difere de um modelo de controle direto, o que há de novo em relação ao ER 1.6 e onde ele se encaixa — com capacidades referenciadas.

Nota de precisão: as afirmações sobre capacidades, disponibilidade e segurança vêm do anúncio do Google DeepMind e do changelog da API Gemini (2026-07-30). Os benchmarks de robótica são preliminares e reportados pelo fornecedor; os preços seguem a cobrança padrão da API Gemini e detalhes específicos não foram publicados. Os detalhes mudam — verifique antes de construir.

TL;DR. O Gemini Robotics ER 2 é um VLM de raciocínio corporificado que atua como cérebro de planejamento e percepção de um robô: compreensão de vídeo, raciocínio espacial, orquestração de ferramentas em várias etapas, localização de momentos em vídeo, acompanhamento de progresso, coordenação de múltiplos robôs e autocorreção, com uma variante de streaming para interação bidirecional de áudio e vídeo em tempo real. Ele está disponível na API Gemini (code>gemini-robotics-er-2-preview/code> e code>gemini-robotics-er-2-streaming-preview/code>) e no Google AI Studio, como prévia fechada. O Google o posiciona como seu modelo de robótica mais seguro até agora, com ganhos notáveis em relação ao ER 1.6 em coordenação de múltiplos robôs e acompanhamento de progresso. É uma camada de raciocínio, não um controlador de atuadores de baixo nível.

Principais conclusões

• Raciocínio Incorporado (ER): O ER 2 é o cérebro de alto nível para percepção e planejamento, não um controlador motor direto (essa é a linha separada de VLA/on-device).

• Competências essenciais: compreensão de vídeo, raciocínio espacial, orquestração de ferramentas em múltiplas etapas, localização de momentos em vídeo, classificação de progresso, coordenação multi-robô, autocorreção.

• Variante de streaming: code>gemini-robotics-er-2-streaming-preview/code> adiciona interação de áudio-vídeo bidirecional de baixa latência para controle e diálogo em tempo real.

Segurança em primeiro lugar: a Google posiciona o ER 2 como seu modelo de robótica mais seguro em conformidade com restrições de segurança e proximidade humana, com ganhos no benchmark ASIMOV2.

• Disponibilidade: Gemini API + Google AI Studio (pré-visualização pública); Enterprise Agent Platform em pré-visualização privada; modelos VLA/on-device limitados a parceiros de acesso antecipado. Encerrado.

O que "Raciocínio Incorporado" significa

As pilhas de robótica moderna cada vez mais se dividem em duas camadas. Um cérebro de raciocínio de alto nível entende a cena, decide o que fazer e planeja; um modelo de ação de baixo nível traduz os planos em comandos motores precisos. O Gemini Robotics ER 2 é a primeira camada: um modelo visão-linguagem de raciocínio incorporado. Ele recebe vídeo (e áudio e texto), constrói uma compreensão de objetos, espaço e progresso ao longo do tempo, e gera planos e chamadas de ferramentas — incluindo a invocação de ferramentas externas como o Google Search — que um sistema de ação separado ou um humano pode executar. Em outras palavras, o ER 2 é a parte do robô que pensa, não a parte que se move; os modelos visão-linguagem-ação (VLA) de controle direto do Google e os modelos no dispositivo são uma linha separada, atualmente limitada a parceiros iniciais.

O que o ER 2 pode fazer

A Google descreve um amplo conjunto de habilidades de raciocínio incorporado. O ER 2 pode entender vídeo e localizar momentos específicos dentro dele ("quando o copo caiu?"), raciocinar sobre o espaço 3D e relações entre objetos, classificar o progresso de tarefas (a etapa está concluída, parcial ou falhou?) e orquestrar o uso de ferramentas em várias etapas para realizar um objetivo. Ele pode manter um diálogo com uma pessoa e planejar tarefas que duram vários minutos, autocorrigir-se quando algo dá errado e — notavelmente — coordenar múltiplos robôs trabalhando juntos. Essas são exatamente as capacidades que um robô precisa para operar em ambientes reais e bagunçados, em vez de demonstrações roteirizadas.

A variante de streaming: interação em tempo real

Junto com a prévia padrão, o Google lançou code>gemini-robotics-er-2-streaming-preview/code>, otimizado para áudio-vídeo bidirecional de baixa latência. Isso é importante para o uso incorporado: um robô precisa perceber, raciocinar e responder continuamente, não em lentos turnos de requisição-resposta. O modelo de streaming permite interação em tempo real — assistir a um feed ao vivo, conversar com uma pessoa e ajustar um plano em movimento — o que é essencial para assistentes interativos, suporte a teleoperação e tarefas dinâmicas de múltiplas etapas.

Novidades em relação ao ER 1.6

ER 2 é um claro passo à frente do Gemini Robotics ER 1.6. O Google destaca coordenação multi-robô e rastreamento de progresso de tarefas visivelmente melhores, orquestração de ferramentas multi-etapas mais forte e comportamento de segurança aprimorado. Especificamente no quesito segurança, o Google posiciona o ER 2 como seu modelo de robótica mais seguro até hoje, citando maior adesão às restrições de segurança e ao comportamento em proximidade humana, além de ganhos no benchmark de segurança ASIMOV2. Para equipes que constroem implementações reais, as melhorias em coordenação, rastreamento de progresso e segurança são as atualizações mais relevantes.

Segurança e avaliação

A segurança é central para o posicionamento do ER 2. O Google relata que ele lidera na adesão às restrições de segurança e na proximidade entre seu comportamento e o julgamento humano seguro em relação às pessoas, com pontuações melhores no ASIMOV2 (um benchmark de robótica voltado para segurança). Como a robótica atua no mundo físico, essas propriedades de segurança importam muito mais do que para um chatbot — um erro de planejamento pode causar danos reais. Como acontece com qualquer benchmark de fornecedor, trate os detalhes como preliminares e indicativos; a avaliação independente de robótica ainda está amadurecendo.

Disponibilidade e preços

O ER 2 está disponível em prévia pública por meio da API Gemini — os IDs de modelo code>gemini-robotics-er-2-preview/code> e code>gemini-robotics-er-2-streaming-preview/code> — e no Google AI Studio. Uma integração com a Enterprise Agent Platform está em prévia privada, e os modelos VLA de controle direto e os modelos on-device permanecem limitados a parceiros iniciais. O acesso é fechado. Os preços seguem a cobrança padrão da API Gemini; o Google não publicou taxas específicas para robótica no lançamento. Confirme o acesso atual e os custos na documentação da API Gemini.

Três cenários onde o ER 2 se encaixa

1. Robôs de armazém e logística

Raciocínio espacial, rastreamento de progresso e coordenação multi-robô são adequados para tarefas de pick-and-place, classificação e frota, onde robôs precisam entender cenas e cooperar.

2. Robôs assistentes interativos

A variante de streaming possibilita interação audiovisual em tempo real, permitindo que robôs observem, ouçam, conversem e planejem tarefas de vários minutos com uma pessoa.

3. Inspeção e monitoramento

A compreensão de vídeo e a localização de momentos tornam o ER 2 útil para analisar feeds ao vivo ou gravados — identificando eventos, classificando estados e sinalizando progressos ou falhas.

Como isso se encaixa em uma stack de IA mais ampla

O Gemini Robotics ER 2 é um modelo de robótica especializado acessado pela API Gemini do Google, e não um LLM de propósito geral — portanto, não é algo que um roteador de modelos de propósito geral hospede. Para as partes de linguagem geral e multimodais de um aplicativo em torno de um robô — interfaces de linguagem natural, raciocínio, orquestração, análise — um endpoint neutro em relação ao fornecedor mantém suas opções em aberto: a href="https://www.orcarouter.ai/">OrcaRouter/a> fornece um endpoint compatível com OpenAI para vários LLMs de texto e multimodais (incluindo os modelos Gemini gerais do Google), enquanto o controle incorporado do ER 2 é executado por meio da API de robótica dedicada do Google. Essa separação é natural: use o cérebro especializado do robô para a incorporação e um endpoint neutro em relação ao fornecedor para todo o resto.

Limitações e ressalvas

ER 2 é uma camada de raciocínio/planejamento, não um robô pronto para uso — você ainda precisa de um sistema de ação (os modelos VLA/on-device do Google, limitados a parceiros, ou os seus próprios) para executar planos fisicamente. É uma prévia fechada, então a disponibilidade e o comportamento podem mudar, e os detalhes de preço não são publicados. Suas alegações de benchmark e segurança são informadas pelo fornecedor e iniciais; a avaliação robótica independente é imatura. E a implantação física carrega obrigações de segurança no mundo real que vão muito além dos testes de software. Trate-o como uma prévia poderosa para prototipar, não como um controlador de produção finalizado.

Perguntas Frequentes

O que é o Gemini Robotics ER 2?

O modelo de visão-linguagem com raciocínio incorporado do Google DeepMind — o cérebro de percepção e planejamento de alto nível de um robô — lançado em prévia pública em 30 de julho de 2026, com uma variante de streaming em tempo real.

O ER 2 controla os motores do robô diretamente?

Não. O ER 2 é a camada de raciocínio/planejamento; o controle motor direto é tratado por modelos separados de visão-linguagem-ação (VLA) e modelos no dispositivo, atualmente limitados a parceiros iniciais.

O que o ER 2 pode fazer?

Compreensão de vídeo e localização de momentos, raciocínio espacial, orquestração de ferramentas em múltiplas etapas, classificação de progresso, coordenação multi-robô, autocorreção e interação em tempo real (variante de streaming).

Como o ER 2 é diferente do ER 1.6?

A Google relata melhor coordenação entre múltiplos robôs e rastreamento de progresso, orquestração de ferramentas mais robusta e segurança aprimorada — incluindo ganhos no benchmark de segurança ASIMOV2 — posicionando o ER 2 como seu modelo de robótica mais seguro até agora.

Como posso acessar o Gemini Robotics ER 2?

Através da API Gemini (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) e do Google AI Studio, como uma prévia pública fechada. Os preços seguem a cobrança padrão da API Gemini.

O ER 2 é seguro para robôs reais?

A Google o posiciona como seu modelo de robótica mais seguro em adesão a restrições de segurança e proximidade humana, mas a implantação incorporada acarreta obrigações reais de segurança; trate as alegações de segurança como prematuras e valide rigorosamente.

Conclusão

O Gemini Robotics ER 2 é um grande passo para a IA incorporada: um cérebro de raciocínio focado em segurança que permite que os robôs entendam vídeo, raciocinem sobre espaço e tempo, planejem tarefas de vários minutos, coordenem-se com outros robôs e interajam em tempo real por meio de sua variante de streaming. É uma camada de planejamento, não um controlador de motor, e é uma prévia fechada em estágio inicial com benchmarks relatados pelo fornecedor — mas os ganhos em coordenação, acompanhamento de progresso e segurança em relação ao ER 1.6 são significativos. Faça protótipos com ele por meio da API Gemini para incorporação e mantenha as partes gerais de linguagem/multimodal da sua pilha neutras em relação ao fornecedor por meio de um endpoint como o OrcaRouter.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube