
Gemini Robotics ER 2: Google DeepMinds Roboter-Gehirn für verkörpertes Denken, erklärt
- deepseekNEUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenz69Coding
- qwenNEUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 206 tok/s
- orcaNEUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEUAnthropic: Claude Opus 52026-07-2461Intelligenz78Coding
- googleNEUGoogle: Gemini 3.6 Flash2026-07-2150Intelligenz69Coding
- googleNEUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1651Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0854Intelligenz72Coding
- tencentTencent: Hy32026-07-0641Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenz69Coding60Mathe
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenz61Coding61Mathe
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligenz77Coding
Google DeepMinds Gemini Robotics ER 2 — das am 30. Juli 2026 in der öffentlichen Vorschau veröffentlicht wurde — ist ein spezialisiertes Vision-Language-Modell, das als übergeordnetes „Gehirn“ eines Roboters dienen soll. „ER“ steht für Embodied Reasoning: Statt direkt Motoren anzusteuern, sieht und versteht ER 2 die physische Welt, denkt über Raum und Zeit nach, plant mehrstufige Aufgaben, orchestriert Werkzeuge und koordiniert Roboter. Zudem enthält es eine Echtzeit-Streaming-Variante für latenzarme, interaktive Steuerung. Dieser Leitfaden erklärt, was ER 2 ist, wie es sich von einem Direktsteuerungsmodell unterscheidet, was gegenüber ER 1.6 neu ist und wo es sich einfügt — mit bezogenen Fähigkeiten.
Genauigkeitshinweis: Aussagen zu Fähigkeiten, Verfügbarkeit und Sicherheit stammen aus der Ankündigung von Google DeepMind und dem Gemini-API-Änderungsprotokoll (2026-07-30). Robotics-Benchmarks sind vorläufig und stammen vom Anbieter; die Preisgestaltung folgt der Standardabrechnung der Gemini-API, Einzelheiten wurden nicht veröffentlicht. Details ändern sich — vor dem Erstellen verifizieren.
TL;DR. Gemini Robotics ER 2 ist ein Embodied-Reasoning-VLM, das als Planungs- und Wahrnehmungsgehirn eines Roboters fungiert: Videoverständnis, räumliches Denken, mehrstufige Tool-Orchestrierung, Videomoment-Lokalisierung, Fortschrittsverfolgung, Multi-Roboter-Koordination und Selbstkorrektur, mit einer Streaming-Variante für bidirektionale Audio-Video-Interaktion in Echtzeit. Es ist in der Gemini API (code>gemini-robotics-er-2-preview/code>code>gemini-robotics-er-2-streaming-preview/code>) verfügbar. Google positioniert es als sein bisher sicherstes Robotikmodell, mit beachtlichen Verbesserungen gegenüber ER 1.6 bei der Multi-Roboter-Koordination und Fortschrittsverfolgung. Es ist eine Reasoning-Ebene, kein Low-Level-Aktuator-Controller.
Wichtige Erkenntnisse
• Verkörperte Argumentation (ER): ER 2 ist das Gehirn für hochrangige Wahrnehmung und Planung, nicht eine direkte Motorsteuerung (das ist die separate VLA-/On-Device-Linie).
• Kernkompetenzen: Videoverständnis, räumliches Denken, mehrstufige Werkzeugorchestrierung, Lokalisierung von Videomomenten, Fortschrittsklassifizierung, Koordination mehrerer Roboter, Selbstkorrektur.
• Streaming-Variante: code>gemini-robotics-er-2-streaming-preview/code> bietet eine latenzarme, bidirektionale Audio-Video-Interaktion für Echtzeitsteuerung und Dialog.
Sicherheit an erster Stelle: Google positioniert ER 2 als sein sicherstes Robotikmodell bei der Einhaltung von Sicherheitsvorgaben und der Nähe zu Menschen, mit Verbesserungen beim ASIMOV2-Benchmark.
• Verfügbarkeit: Gemini API + Google AI Studio (öffentliche Vorschau); Enterprise Agent Platform in privater Vorschau; VLA/On-Device-Modelle nur für frühe Partner. Geschlossen.
Was bedeutet „Embodied Reasoning“?
Moderne Robotik-Stacks teilen sich zunehmend in zwei Ebenen. Ein übergeordnetes Denkgehirn versteht die Szene, entscheidet, was zu tun ist, und plant; ein untergeordnetes Aktionsmodell übersetzt Pläne in präzise Motorsteuerungsbefehle. Gemini Robotics ER 2 ist die erste Ebene: ein Vision-Language-Modell mit verkörpertem Denken. Es nimmt Video (sowie Audio und Text) auf, entwickelt ein Verständnis von Objekten, Raum und Fortschritt im Zeitverlauf und gibt Pläne und Tool-Aufrufe aus – einschließlich der Einbindung externer Tools wie Google Search – die ein separates Aktionssystem oder ein Mensch ausführen kann. Mit anderen Worten: ER 2 ist der Teil des Roboters, der denkt, nicht der, der sich bewegt; Googles Vision-Language-Action-Modelle (VLA) zur direkten Steuerung und On-Device-Modelle sind eine separate Linie, die derzeit auf frühe Partner beschränkt ist.

Was ER 2 kann
Google beschreibt ein breites Spektrum an Fähigkeiten des verkörperten Denkens. ER 2 kann Videos verstehen und bestimmte Momente darin lokalisieren („Wann ist die Tasse gefallen?“), über den 3D-Raum und Objektbeziehungen nachdenken, den Aufgabenfortschritt klassifizieren (ist der Schritt abgeschlossen, teilweise erledigt oder fehlgeschlagen?) und mehrstufige Werkzeugnutzung orchestrieren, um ein Ziel zu erreichen. Es kann einen Dialog mit einer Person führen und Aufgaben planen, die sich über mehrere Minuten erstrecken, sich selbst korrigieren, wenn etwas schiefgeht, und – bemerkenswerterweise – mehrere Roboter koordinieren, die zusammenarbeiten. Genau das sind die Fähigkeiten, die ein Roboter benötigt, um in unübersichtlichen, realen Umgebungen zu arbeiten und nicht nur in skriptgesteuerten Demonstrationen.
Die Streaming-Variante: Echtzeit-Interaktion
Neben dem Standard-Preview hat Google auch code>gemini-robotics-er-2-streaming-preview/code> veröffentlicht, optimiert für geringe Latenz und bidirektionales Audio-Video. Das ist für verkörperte Anwendungen wichtig: Ein Roboter muss kontinuierlich wahrnehmen, denken und reagieren — nicht in langsamen Anfrage-Antwort-Zyklen. Das Streaming-Modell ermöglicht Echtzeit-Interaktion — einen Live-Feed zu beobachten, mit einer Person zu sprechen und einen Plan im laufenden Betrieb anzupassen — was für interaktive Assistenten, Teleoperationsunterstützung und dynamische mehrstufige Aufgaben unerlässlich ist.
Was ist neu gegenüber ER 1.6
ER 2 ist eine klare Verbesserung gegenüber Gemini Robotics ER 1.6. Google hebt deutlich bessere Multi-Roboter-Koordination und Aufgabenfortschrittsverfolgung, stärkere Multi-Step-Tool-Orchestrierung und verbessertes Sicherheitsverhalten hervor. Was die Sicherheit betrifft, positioniert Google ER 2 als sein bisher sicherstes Robotikmodell und verweist auf verbesserte Einhaltung von Sicherheitsvorgaben, besseres Verhalten in der Nähe von Menschen sowie Verbesserungen beim ASIMOV2-Sicherheitsbenchmark. Für Teams, die reale Bereitstellungen aufbauen, sind die Verbesserungen bei Koordination, Fortschrittsverfolgung und Sicherheit die bedeutendsten Upgrades.
Sicherheit und Bewertung
Sicherheit steht im Mittelpunkt der Positionierung von ER 2. Google berichtet, dass es bei der Einhaltung von Sicherheitsbeschränkungen und der Übereinstimmung seines Verhaltens mit sicherem menschlichem Urteilsvermögen im Umgang mit Menschen führend ist, mit verbesserten Ergebnissen bei ASIMOV2 (einer sicherheitsorientierten Robotik-Benchmark). Da Robotik in der physischen Welt agiert, sind diese Sicherheitseigenschaften weitaus wichtiger als bei einem Chatbot – ein Planungsfehler kann echten Schaden verursachen. Wie bei jedem Anbieter-Benchmark sind die Einzelheiten als vorläufig und richtungsweisend zu betrachten; die unabhängige Robotik-Evaluierung befindet sich noch in der Entwicklung.

Verfügbarkeit und Preise
ER 2 ist in der öffentlichen Vorschau über die Gemini-API verfügbar — Modell-IDs code>gemini-robotics-er-2-preview/code> und code>gemini-robotics-er-2-streaming-preview/code> — und in Google AI Studio. Eine Integration der Enterprise Agent Platform befindet sich in der privaten Vorschau, und die direkt gesteuerten VLA-Modelle sowie On-Device-Modelle bleiben auf frühe Partner beschränkt. Der Zugriff ist geschlossen. Die Preisgestaltung folgt der standardmäßigen Gemini-API-Abrechnung; Google hat zum Start keine robotikspezifischen Preise veröffentlicht. Prüfen Sie aktuellen Zugriff und Kosten in der Dokumentation der Gemini-API.
Drei Szenarien, in denen ER 2 passt
1. Lager- und Logistikroboter
Räumliches Denken, Fortschrittsverfolgung und Multi-Roboter-Koordination eignen sich für Pick-and-Place-, Sortier- und Flottenaufgaben, bei denen Roboter Szenen verstehen und zusammenarbeiten müssen.
2. Interaktive Assistenzroboter
Die Echtzeit-Audio-Video-Interaktion der Streaming-Variante ermöglicht Roboter, die mit einer Person zuschauen, zuhören, sich unterhalten und mehrminütige Aufgaben planen.
3. Inspektion und Überwachung
Videoverständnis und Momentlokalisierung machen ER 2 nützlich für die Analyse von Live- oder aufgezeichneten Feeds — Ereignisse erkennen, Zustände klassifizieren und Fortschritte oder Fehler kennzeichnen.
Wie es in einen breiteren KI-Stack passt
Gemini Robotics ER 2 ist ein spezialisiertes Robotik-Modell, das über die Gemini-API von Google aufgerufen wird, kein Allzweck-LLM – es ist also nichts, was ein allgemeiner Modell-Router hostet. Für die allgemeinen Sprach- und Multimodal-Teile einer Anwendung rund um einen Roboter – natürlichsprachliche Schnittstellen, Reasoning, Orchestrierung, Analysen – hält Ihnen ein anbieterneutraler Endpoint alle Optionen offen: a href="https://www.orcarouter.ai/">OrcaRouter/a> bietet einen OpenAI-kompatiblen Endpoint, der viele Text- und Multimodal-LLMs abdeckt (einschließlich der allgemeinen Gemini-Modelle von Google), während die Embodied Control von ER 2 über die dedizierte Robotik-API von Google läuft. Diese Trennung ist naheliegend: Nutzen Sie das spezialisierte Roboter-Gehirn für das Embodiment und einen anbieterneutralen Endpoint für alles andere.
Einschränkungen und Vorbehalte
ER 2 ist eine Reasoning-/Planungsebene, kein schlüsselfertiger Roboter — Sie benötigen weiterhin ein Aktionssystem (Googles VLA-/On-Device-Modelle, auf Partner beschränkt, oder Ihr eigenes), um Pläne physisch auszuführen. Es ist eine geschlossene Vorschau, daher können sich Verfügbarkeit und Verhalten ändern, und Preisdetails sind nicht veröffentlicht. Seine Benchmark- und Sicherheitsaussagen stammen vom Anbieter und sind vorläufig; die unabhängige Robotik-Evaluation steckt noch in den Kinderschuhen. Und der physische Einsatz bringt reale Sicherheitspflichten mit sich, die weit über Softwaretests hinausgehen. Betrachten Sie es als leistungsfähige Vorschau zum Prototypisieren, nicht als produktionsreifen Controller.
FAQ
Was ist Gemini Robotics ER 2?
Googles DeepMind-Modell für verkörperte visuell-sprachliche Argumentation – das hochrangige Wahrnehmungs- und Planungsgehirn eines Roboters – wurde am 30. Juli 2026 als öffentliche Vorschau mit einer Echtzeit-Streaming-Variante veröffentlicht.
Steuert ER 2 Roboter-Motoren direkt?
Nein. ER 2 ist die Reasoning-/Planungsebene; die direkte Motorsteuerung wird von separaten Vision-Language-Action- (VLA-) und On-Device-Modellen übernommen, die derzeit auf frühe Partner beschränkt sind.
Was kann ER 2 tun?
Videoverständnis und Momentlokalisierung, räumliches Denken, mehrstufige Tool-Orchestrierung, Fortschrittsklassifizierung, Multi-Roboter-Koordination, Selbstkorrektur und Echtzeitinteraktion (Streaming-Variante).
Wie unterscheidet sich ER 2 von ER 1.6?
Google berichtet über bessere Multi-Roboter-Koordination und Fortschrittsverfolgung, stärkere Tool-Orchestrierung und verbesserte Sicherheit — darunter Zugewinne beim ASIMOV2-Sicherheitsbenchmark — und positioniert ER 2 als sein bisher sicherstes Robotikmodell.
Wie greife ich auf Gemini Robotics ER 2 zu?
Über die Gemini-API (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) und Google AI Studio, als geschlossene öffentliche Vorschau. Die Preisgestaltung folgt der standardmäßigen Gemini-API-Abrechnung.
Ist ER 2 für echte Roboter sicher?
Google positioniert es als sein sicherstes Robotikmodell hinsichtlich der Einhaltung von Sicherheitsauflagen und der Nähe zu Menschen, aber der physische Einsatz bringt Sicherheitspflichten in der realen Welt mit sich; behandeln Sie Sicherheitsaussagen als vorläufig und validieren Sie sie rigoros.
Fazit
Gemini Robotics ER 2 ist ein großer Schritt für Embodied AI: ein sicherheitsorientiertes Reasoning-Gehirn, das Robotern ermöglicht, Videos zu verstehen, über Raum und Zeit zu schlussfolgern, mehrminütige Aufgaben zu planen, sich mit anderen Robotern zu koordinieren und über seine Streaming-Variante in Echtzeit zu interagieren. Es ist eine Planungsebene, kein Motorregler, und es ist eine frühe geschlossene Vorschau mit vom Anbieter gemeldeten Benchmarks – aber die Koordination, Fortschrittsverfolgung und Sicherheitsgewinne gegenüber ER 1.6 sind bedeutend. Prototypisieren Sie damit über die Gemini-API für Embodiment, und halten Sie die allgemeinen Sprach-/Multimodale-Teile Ihres Stacks über einen Endpunkt wie OrcaRouter anbieterneutral.
