Gemini Robotics ER 2 : le cerveau robotique à raisonnement incarné de Google DeepMind, expliqué
Engineering & Research

Gemini Robotics ER 2 : le cerveau robotique à raisonnement incarné de Google DeepMind, expliqué

Auteur

jinhao song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

de Google DeepMindGemini Robotics ER 2 — publié en aperçu public le 30 juillet 2026 — est un modèle de vision-langage spécialisé conçu pour être le « cerveau » de haut niveau d'un robot. « ER » signifie « Embodied Reasoning » (raisonnement incarné) : plutôt que de piloter directement les moteurs, ER 2 voit et comprend le monde physique, raisonne sur l'espace et le temps, planifie des tâches en plusieurs étapes, orchestre les outils et coordonne les robots. Il inclut également une variante de streaming en temps réel pour un contrôle interactif à faible latence. Ce guide explique ce qu'est ER 2, en quoi il diffère d'un modèle de contrôle direct, ce qui est nouveau par rapport à ER 1.6, et où il se situe — avec des capacités sourcées.

Note de précision : les affirmations concernant les capacités, la disponibilité et la sécurité proviennent de l'annonce de Google DeepMind et du journal des modifications de l'API Gemini (2026-07-30). Les benchmarks robotiques sont préliminaires et rapportés par le fournisseur ; la tarification suit la facturation standard de l'API Gemini et les spécificités n'ont pas été publiées. Les détails peuvent changer — vérifiez avant de créer.

En bref. Gemini Robotics ER 2 est un VLM de raisonnement incarné qui fait office de cerveau de planification et de perception pour un robot : compréhension vidéo, raisonnement spatial, orchestration d'outils en plusieurs étapes, localisation de moments vidéo, suivi de progression, coordination multi-robot et auto-correction, avec une variante en streaming pour l'interaction audio-vidéo bidirectionnelle en temps réel. Il est disponible dans l'API Gemini (code>gemini-robotics-er-2-preview/code> et code>gemini-robotics-er-2-streaming-preview/code>) et Google AI Studio, en aperçu fermé. Google le présente comme son modèle robotique le plus sûr à ce jour, avec des gains notables par rapport à ER 1.6 en matière de coordination multi-robot et de suivi de progression. Il s'agit d'une couche de raisonnement, et non d'un contrôleur d'actionneurs de bas niveau.

Points clés

• Raisonnement incarné (ER) : ER {{2}} est le cerveau de haut niveau chargé de la perception et de la planification, et non un contrôleur moteur direct (c'est la ligne distincte VLA/sur l'appareil).{{/2}}

- Compétences clés : compréhension vidéo, raisonnement spatial, orchestration d'outils multi-étapes, localisation de moments vidéo, classification de progression, coordination multi-robots, auto-correction.

• Variante de streaming : code>gemini-robotics-er-2-streaming-preview/code> ajoute une interaction audio-vidéo bidirectionnelle à faible latence pour le contrôle et le dialogue en temps réel.

• La sécurité d'abord : Google positionne ER 2 comme son modèle de robotique le plus sûr en matière de respect des contraintes de sécurité et de proximité avec les humains, avec des gains sur le benchmark ASIMOV2.

• Disponibilité : API Gemini + Google AI Studio (aperçu public) ; plateforme d'agents d'entreprise en aperçu privé ; modèles VLA/sur appareil limités aux premiers partenaires. Fermé.

Ce que signifie « raisonnement incarné »

Les piles logicielles de robotique moderne se divisent de plus en plus en deux couches. Un cerveau de raisonnement de haut niveau comprend la scène, décide quoi faire et planifie ; un modèle d’action de bas niveau traduit les plans en commandes motrices précises. Gemini Robotics ER 2 est la première couche : un modèle vision-langage à raisonnement incarné. Il prend en entrée la vidéo (ainsi que l’audio et le texte), construit une compréhension des objets, de l’espace et de la progression dans le temps, et génère des plans et des appels d’outils — y compris l’invocation d’outils externes comme Google Search — qu’un système d’action séparé ou qu’un humain peut exécuter. En d’autres termes, ER 2 est la partie du robot qui pense, et non celle qui bouge ; les modèles vision-langage-action (VLA) à contrôle direct de Google et les modèles sur appareil constituent une ligne distincte, actuellement limitée aux premiers partenaires.

Ce que ER 2 peut faire

Google décrit un large éventail de compétences de raisonnement incarné. ER 2 peut comprendre une vidéo et localiser des moments précis dans celle-ci (« quand la tasse est-elle tombée ? »), raisonner sur l'espace 3D et les relations entre objets, classifier la progression d'une tâche (l'étape est-elle accomplie, partielle ou échouée ?), et orchestrer l'utilisation d'outils en plusieurs étapes pour atteindre un objectif. Il peut tenir un dialogue avec une personne et planifier des tâches qui s'étendent sur plusieurs minutes, se corriger lorsque quelque chose tourne mal et — fait notable — coordonner plusieurs robots qui travaillent ensemble. Ce sont exactement les capacités dont un robot a besoin pour évoluer dans des environnements réels et désordonnés plutôt que dans des démos scriptées.

La variante en streaming : interaction en temps réel

En plus de l’aperçu standard, Google a publié code>gemini-robotics-er-2-streaming-preview/code>, optimisé pour un flux audio-vidéo bidirectionnel à faible latence. Cela compte pour l’usage incarné : un robot doit percevoir, raisonner et répondre en continu, et non selon de lents cycles de requête-réponse. Le modèle en streaming permet une interaction en temps réel — observer un flux en direct, parler avec une personne et ajuster un plan à la volée — ce qui est essentiel pour les assistants interactifs, l’assistance à la téléopération et les tâches dynamiques en plusieurs étapes.

Nouveautés par rapport à ER 1.6

ER 2 est un net pas en avant par rapport à Gemini Robotics ER 1.6. Google met en avant une coordination multi-robots nettement meilleure et un suivi de l'avancement des tâches, une orchestration d'outils multi-étapes plus robuste, et un comportement de sécurité amélioré. Côté sécurité spécifiquement, Google présente ER 2 comme son modèle de robotique le plus sûr à ce jour, citant une meilleure adhésion aux contraintes de sécurité et au comportement en proximité humaine, ainsi que des gains sur le benchmark de sécurité ASIMOV2. Pour les équipes qui construisent des déploiements réels, les améliorations en matière de coordination, de suivi de l'avancement et de sécurité sont les mises à niveau les plus importantes.

Sécurité et évaluation

La sécurité est au cœur du positionnement d'ER 2. Google indique qu'il est en tête en matière de respect des contraintes de sécurité et de proximité de son comportement avec le jugement humain sûr autour des personnes, avec des scores améliorés sur ASIMOV2 (un benchmark de robotique orienté sécurité). Parce que la robotique agit dans le monde physique, ces propriétés de sécurité comptent bien plus que pour un chatbot — une erreur de planification peut causer des dommages réels. Comme pour tout benchmark de fournisseur, traitez les spécificités comme préliminaires et indicatives ; l'évaluation indépendante de la robotique est encore en cours de maturation.

Disponibilité et tarifs

ER 2 est disponible en aperçu public via l'API Gemini — les identifiants de modèle code>gemini-robotics-er-2-preview/code> et code>gemini-robotics-er-2-streaming-preview/code> — et dans Google AI Studio. Une intégration Enterprise Agent Platform est en aperçu privé, et les modèles VLA à contrôle direct et sur appareil restent limités aux premiers partenaires. C'est fermé. La facturation suit la facturation standard de l'API Gemini ; Google n'a pas publié de tarifs spécifiques à la robotique au lancement. Confirmez l'accès et les coûts actuels dans la documentation de l'API Gemini.

Trois scénarios où ER 2 convient

1. Robots d'entrepôt et de logistique

Le raisonnement spatial, le suivi de progression et la coordination multi-robots conviennent aux tâches de pick-and-place, de tri et de flotte où les robots doivent comprendre les scènes et coopérer.

2. Robots assistants interactifs

L'interaction audio-vidéo en temps réel de la variante en streaming permet aux robots de regarder, d'écouter, de converser et de planifier des tâches de plusieurs minutes avec une personne.

3. Inspection et surveillance

La compréhension vidéo et la localisation de moments rendent ER 2 utile pour analyser des flux en direct ou enregistrés — repérer des événements, classifier des états et signaler des progrès ou des échecs.

Comment cela s'intègre dans une stack IA plus large

Gemini Robotics ER 2 est un modèle de robotique spécialisé accessible via l'API Gemini de Google, et non un LLM à usage général — ce n'est donc pas quelque chose qu'un routeur de modèles généraliste héberge. Pour les parties langage et multimodales à usage général d'une application autour d'un robot — interfaces en langage naturel, raisonnement, orchestration, analytique — un point de terminaison neutre vis-à-vis des fournisseurs vous laisse vos options ouvertes : a href="https://www.orcarouter.ai/">OrcaRouter/a> fournit un point de terminaison compatible OpenAI pour de nombreux LLM textuels et multimodaux (y compris les modèles Gemini généraux de Google), tandis que le contrôle incarné de ER 2 passe par l'API robotique dédiée de Google. Cette séparation est naturelle : utilisez le cerveau robotique spécialisé pour l'incarnation, et un point de terminaison neutre pour tout le reste.

Limitations et mises en garde

ER 2 est une couche de raisonnement/planification, pas un robot clé en main — vous avez toujours besoin d'un système d'action (les modèles VLA/sur appareil de Google, limités aux partenaires, ou les vôtres) pour exécuter physiquement les plans. Il s'agit d'un aperçu fermé, donc la disponibilité et le comportement peuvent changer, et les détails de tarification ne sont pas publiés. Ses affirmations de référence et de sécurité sont rapportées par le fournisseur et préliminaires ; l'évaluation indépendante de la robotique est immature. Et le déploiement incarné comporte des obligations de sécurité dans le monde réel qui vont bien au-delà des tests logiciels. Traitez-le comme un aperçu puissant pour prototyper, pas comme un contrôleur de production abouti.

FAQ

Qu'est-ce que Gemini Robotics ER 2 ?

Le modèle vision-langage à raisonnement incarné de Google DeepMind — un cerveau de haut niveau pour la perception et la planification d'un robot — publié en aperçu public le 30 juillet 2026, avec une variante de streaming en temps réel.

Est-ce que ER 2 contrôle directement les moteurs du robot ?

Non. ER 2 est la couche de raisonnement/planification ; le contrôle moteur direct est géré par des modèles distincts vision-language-action (VLA) et sur appareil, actuellement limités aux premiers partenaires.

Que peut faire ER 2 ?

Compréhension vidéo et localisation de moments, raisonnement spatial, orchestration d'outils multi-étapes, classification de progression, coordination multi-robots, auto-correction et interaction en temps réel (variante streaming).

En quoi ER 2 diffère-t-il de ER 1.6 ?

Google fait état d'une meilleure coordination multi-robots et d'un meilleur suivi de la progression, d'une orchestration plus robuste des outils et d'une sécurité améliorée — notamment des gains sur le benchmark de sécurité ASIMOV2 — positionnant ER 2 comme son modèle de robotique le plus sûr à ce jour.

Comment accéder à Gemini Robotics ER 2 ?

Via l'API Gemini (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) et Google AI Studio, en tant qu'aperçu public fermé. La tarification suit la facturation standard de l'API Gemini.

ER 2 est-il sûr pour de vrais robots ?

Google le positionne comme son modèle robotique le plus sûr en matière de respect des contraintes de sécurité et de proximité humaine, mais le déploiement incarné comporte des obligations de sécurité dans le monde réel ; considérez ces affirmations de sécurité comme prématurées et validez-les rigoureusement.

En résumé

Gemini Robotics ER 2 est une étape majeure pour l'IA incarnée : un cerveau de raisonnement axé sur la sécurité qui permet aux robots de comprendre la vidéo, de raisonner sur l'espace et le temps, de planifier des tâches de plusieurs minutes, de se coordonner avec d'autres robots et d'interagir en temps réel via sa variante en streaming. C'est une couche de planification, pas un contrôleur moteur, et c'est un aperçu fermé précoce avec des benchmarks rapportés par le fournisseur — mais les gains en matière de coordination, de suivi de progression et de sécurité par rapport à ER 1.6 sont significatifs. Prototypez avec lui via l'API Gemini pour l'incarnation, et gardez les parties générales langage/multimodales de votre pile neutres vis-à-vis du fournisseur via un endpoint comme OrcaRouter.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube