Gemini Robotics ER 2: Google DeepMinds förkroppsligad resonerande robothjärna, förklarad
Engineering & Research

Gemini Robotics ER 2: Google DeepMinds förkroppsligad resonerande robothjärna, förklarad

Författare

jinhao song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Google DeepMinds Gemini Robotics ER 2 — släpptes som publik förhandsvisning den 30 juli 2026 — är en specialiserad vision-språkmodell byggd för att vara en robots högnivå ”hjärna”. ”ER” står för Embodied Reasoning: i stället för att direkt driva motorer ser och förstår ER 2 den fysiska världen, resonerar kring rum och tid, planerar flerstegsuppgifter, orkestrerar verktyg och koordinerar robotar. Den levereras också med en realtidsströmmande variant för interaktiv styrning med låg latens. Den här guiden förklarar vad ER 2 är, hur den skiljer sig från en modell med direkt styrning, vad som är nytt jämfört med ER 1.6 och var den passar in — med källbelagda kapaciteter.

Notering om noggrannhet: funktioner, tillgänglighet och säkerhetspåståenden kommer från Google DeepMinds tillkännagivande och Gemini API:s ändringslogg (2026-07-30). Robotik-benchmarks är tidiga och leverantörsrapporterade; prissättning följer standardfakturering för Gemini API och specifika detaljer publicerades inte. Detaljer ändras — verifiera innan du bygger.

TL;DR. Gemini Robotics ER 2 är en VLM med förkroppsligat resonemang som fungerar som en robots planerings- och perceptionshjärna: videoförståelse, spatialt resonemang, orkestrering av verktyg i flera steg, videomomentlokalisering, framstegsspårning, multi-robotkoordinering och självkorrigering, med en strömmande variant för dubbelriktad audio-video-interaktion i realtid. Den finns tillgänglig i Gemini API (code>gemini-robotics-er-2-preview/code> och code>gemini-robotics-er-2-streaming-preview/code>) och Google AI Studio, som en sluten förhandsversion. Google positionerar den som sin säkraste robotmodell hittills, med tydliga förbättringar jämfört med ER 1.6 inom multi-robotkoordinering och framstegsspårning. Det är ett resonemangslager, inte en lågnivåkontroller för ställdon.

Viktiga slutsatser

• Embodied Reasoning (ER): ER 2 är hjärnan för perception och planering på hög nivå, inte en direkt motorstyrenhet (det är den separata VLA/on-device-linjen).

• Kärnfärdigheter: videoförståelse, spatialt resonemang, flerstegsverktygsorkestrering, videomomentlokalisering, framstegsklassificering, multi-robotkoordinering, självkorrigering.

• Streamingvariant: code>gemini-robotics-er-2-streaming-preview/code> tillför låg latens, tvåvägs ljud-videointeraktion för realtidskontroll och dialog.

• Säkerhet först: Google positionerar ER 2 som sin säkraste robotmodell när det gäller efterlevnad av säkerhetsbegränsningar och människors närhet, med förbättrade ASIMOV2-benchmarkresultat.

• Tillgänglighet: Gemini API + Google AI Studio (offentlig förhandsvisning); Enterprise Agent Platform i privat förhandsvisning; VLA/enhetsmodeller begränsade till tidiga partners. Stängt.

Vad "Embodied Reasoning" betyder

Moderna robotikstackar delas allt oftare upp i två lager. En högnivåhjärna för resonemang förstår scenen, bestämmer vad som ska göras och planerar; en lågnivåaktionsmodell översätter planer till precisa motorkommandon. Gemini Robotics ER 2 är det första lagret: en förkroppsligad resonerande vision-språk-modell. Den tar in video (och ljud och text), bygger upp en förståelse av objekt, rum och framsteg över tid, och levererar planer och verktygsanrop – inklusive att anropa externa verktyg som Google Search – som ett separat aktionssystem eller en människa kan utföra. Med andra ord är ER 2 den del av roboten som tänker, inte den del som rör sig; Googles direktstyrda vision-språk-handlingsmodeller (VLA) och enhetsmodeller är en separat linje, som för närvarande är begränsad till tidiga partners.

Vad ER 2 kan göra

Google beskriver en bred uppsättning färdigheter inom förkroppsligat resonemang. ER 2 kan förstå video och lokalisera specifika ögonblick i den ({{1}}”när föll koppen?”{{/1}}), resonera om 3D-rymden och objektrelationer, klassificera uppgiftsframsteg ({{2}}är steget klart, delvis klart eller misslyckat?{{/2}}) och orkestrera verktygsanvändning i flera steg för att nå ett mål. Den kan föra en dialog med en person och planera uppgifter som sträcker sig över flera minuter, självkorrigera när något går fel, och — anmärkningsvärt nog — {{3}}samordna flera robotar som arbetar tillsammans{{/3}}. Detta är exakt de förmågor en robot behöver för att verka i röriga, verkliga miljöer snarare än i manusstyrda demonstrationer.

Strömningsvarianten: realtidsinteraktion

Vid sidan av standardförhandsvisningen släppte Google code>gemini-robotics-er-2-streaming-preview/code>, optimerad för låg latens och dubbelriktad ljud-video. Detta är viktigt för förkroppsligad användning: en robot måste uppfatta, resonera och svara kontinuerligt, inte i långsamma förfrågan-svar-sekvenser. Streamingmodellen möjliggör realtidsinteraktion — att titta på ett live-flöde, prata med en person och justera en plan i farten — vilket är avgörande för interaktiva assistenter, teleoperationsstöd och dynamiska flerstegsuppgifter.

Vad är nytt jämfört med ER 1.6

ER 2 är ett tydligt steg upp från Gemini Robotics ER 1.6. Google lyfter fram markant bättre multi-robotkoordinering och spårning av uppgiftsframsteg, starkare orkestrering av flerstegsverktyg och förbättrat säkerhetsbeteende. På säkerhetssidan specifikt positionerar Google ER 2 som sin hittills säkraste robotmodell, med hänvisning till förbättrad efterlevnad av säkerhetsbegränsningar och beteende vid mänsklig närhet samt framsteg inom ASIMOV2-säkerhetsriktmärket. För team som bygger verkliga driftsättningar är koordineringen, framstegsspårningen och säkerhetsförbättringarna de mest betydelsefulla uppgraderingarna.

Säkerhet och utvärdering

Säkerhet är centralt för ER 2:s positionering. Google rapporterar att den leder när det gäller efterlevnad av säkerhetsbegränsningar och hur nära dess beteende matchar säkra mänskliga bedömningar kring människor, med förbättrade poäng på ASIMOV2 (ett säkerhetsinriktat robotikriktmärke). Eftersom robotik verkar i den fysiska världen betyder dessa säkerhetsegenskaper mycket mer än de gör för en chattbot — ett planeringsfel kan orsaka verklig skada. Som med alla leverantörsriktmärken bör man behandla detaljerna som tidiga och vägledande; oberoende robotikutvärdering är fortfarande under utveckling.

Tillgänglighet och prissättning

ER 2 finns tillgänglig i offentlig förhandsversion via Gemini API — modell-ID code>gemini-robotics-er-2-preview/code> och code>gemini-robotics-er-2-streaming-preview/code> — och i Google AI Studio. En integration med Enterprise Agent Platform är i privat förhandsversion, och de direktstyrda VLA-modellerna och de inbyggda modellerna är fortfarande begränsade till tidiga partners. Det är stängt. Prissättningen följer standardfaktureringen för Gemini API; Google publicerade inga robotspecifika priser vid lanseringen. Bekräfta aktuell åtkomst och kostnader i Gemini API-dokumentationen.

Tre scenarier där ER 2 passar

1. Lager- och logistikrobotar

Spatialt resonemang, framstegsspårning och multi-robotkoordinering lämpar sig för plocka-och-placera, sortering och flottuppgifter där robotar måste förstå scener och samarbeta.

2. Interaktiva assistentrobotar

Streamningsvariantens realtidsinteraktion mellan ljud och video gör det möjligt för robotar att se, lyssna, samtala och planera flera minuter långa uppgifter tillsammans med en person.

3. Inspektion och övervakning

Videoförståelse och ögonblickslokalisering gör ER 2 användbar för att analysera live- eller inspelade flöden — identifiera händelser, klassificera tillstånd och flagga framsteg eller misslyckanden.

Hur det passar in i en bredare AI-stack

Gemini Robotics ER 2 är en specialiserad robotmodell som nås via Googles Gemini API, inte en allmän LLM – så det är inte något som en generell modellrouter tillhandahåller. För de allmänna språk- och multimodala delarna av en applikation runt en robot – naturliga språkgränssnitt, resonemang, orkestrering, analys – håller en leverantörsneutral endpoint dina alternativ öppna:a href="https://www.orcarouter.ai/">OrcaRouter/a> ger en OpenAI-kompatibel endpoint för många text- och multimodala LLM:er (inklusive Googles allmänna Gemini-modeller), medan ER 2:s kroppsliga styrning körs via Googles dedikerade robotik-API. Den uppdelningen är naturlig: använd den specialiserade robothjärnan för förkroppsligande, och en leverantörsneutral endpoint för allt annat.

Begränsningar och förbehåll

ER 2 är ett resonemangs-/planeringslager, inte en nyckelfärdig robot — du behöver fortfarande ett actionsystem (Googles VLA/enhetsmodeller, begränsade till partners, eller ditt eget) för att fysiskt utföra planer. Det är en sluten förhandsversion, så tillgänglighet och beteende kan ändras, och prissättningsdetaljer är inte publicerade. Dess benchmark- och säkerhetspåståenden är leverantörsrapporterade och tidiga; oberoende robotikutvärdering är omogen. Och fysisk driftsättning medför verkliga säkerhetsåtaganden som går långt bortom mjukvarutestning. Se det som en kraftfull förhandsversion att prototypa med, inte en färdig produktionskontroller.

FAQ

Vad är Gemini Robotics ER 2?

Google DeepMinds vision-språkmodell för förkroppsligat resonemang – en robots högnivåhjärna för perception och planering – släpptes i offentlig förhandsvisning den 30 juli 2026, med en variant för realtidsströmning.

Styr ER 2 robotmotorer direkt?

Nej. ER 2 är resonemangs-/planeringslagret; direkt motorstyrning hanteras av separata vision-språk-handlingsmodeller (VLA) och enhetsmodeller, för närvarande begränsade till tidiga partners.

Vad kan ER 2 göra?

Videoförståelse och ögonblickslokalisering, spatialt resonemang, flerstegsorkestrering av verktyg, framstegsklassificering, samordning av flera robotar, självkorrigering och realtidsinteraktion (streaming-variant).

Hur skiljer sig ER 2 från ER 1.6?

Google rapporterar bättre multi-robotkoordinering och framstegsspårning, starkare verktygsorkestrering och förbättrad säkerhet — inklusive förbättringar på ASIMOV2-säkerhetsriktmärket — vilket positionerar ER 2 som dess säkraste robotmodell hittills.

Hur kommer jag åt Gemini Robotics ER 2?

Via Gemini API (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) och Google AI Studio, som en sluten offentlig förhandsversion. Prissättningen följer standardfakturering för Gemini API.

Är ER 2 säker för riktiga robotar?

Google positionerar den som sin säkraste robotmodell när det gäller efterlevnad av säkerhetsbegränsningar och närhet till människor, men fysisk driftsättning medför verkliga säkerhetsåtaganden; behandla säkerhetspåståenden som tidiga och validera rigoröst.

Slutsats

Gemini Robotics ER 2 är ett stort steg för embodied AI: en säkerhetsfokuserad resonerande hjärna som låter robotar förstå video, resonera om rum och tid, planera flera minuter långa uppgifter, koordinera med andra robotar och interagera i realtid via dess strömmande variant. Det är ett planeringslager, inte en motorstyrenhet, och det är en tidig sluten förhandsversion med leverantörsrapporterade riktmärken – men koordineringen, framstegsspårningen och säkerhetsvinsterna jämfört med ER 1.6 är betydande. Prototypa med det via Gemini API för embodiment, och håll de allmänna språk-/multimodala delarna av din stack leverantörsneutrala genom en slutpunkt som OrcaRouter.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube