Gemini Robotics ER 2: Mózg robota Google DeepMind oparty na ucieleśnionym rozumowaniu — wyjaśniamy
Engineering & Research

Gemini Robotics ER 2: Mózg robota Google DeepMind oparty na ucieleśnionym rozumowaniu — wyjaśniamy

Autor

jinhao song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Należący do Google DeepMindGemini Robotics ER 2 — udostępniony w publicznej wersji zapoznawczej 30 lipca 2026 roku — to specjalistyczny model wizyjno-językowy zaprojektowany jako wysokopoziomowy „mózg” robota. „ER” oznacza Embodied Reasoning (ucieleśnione rozumowanie): zamiast bezpośrednio sterować silnikami, ER 2 widzi i rozumie świat fizyczny, rozumuje o przestrzeni i czasie, planuje zadania wieloetapowe, koordynuje narzędzia i roboty. Oferuje również wariant przesyłania strumieniowego w czasie rzeczywistym do interaktywnego sterowania o niskim opóźnieniu. Ten przewodnik wyjaśnia, czym jest ER 2, czym różni się od modelu bezpośredniego sterowania, co nowego wprowadza w porównaniu z ER 1.6 oraz gdzie ma zastosowanie — wraz z podaniem źródeł możliwości.

Uwaga o dokładności: deklaracje dotyczące możliwości, dostępności i bezpieczeństwa pochodzą z ogłoszenia Google DeepMind oraz dziennika zmian interfejsu Gemini API (2026-07-30). Wyniki benchmarków robotyki są wstępne i raportowane przez dostawcę; ceny podlegają standardowemu rozliczeniu Gemini API, a szczegóły nie zostały opublikowane. Szczegóły mogą się zmieniać — zweryfikuj przed wdrożeniem.

TL;DR. Gemini Robotics ER 2 to VLM rozumowania ucieleśnionego, który pełni rolę mózgu planowania i percepcji robota: rozumienie wideo, rozumowanie przestrzenne, wieloetapowa orkiestracja narzędzi, lokalizacja momentów w wideo, śledzenie postępów, koordynacja wielu robotów i samokorekta, z wariantem strumieniowym do dwukierunkowej interakcji audio-wideo w czasie rzeczywistym. Jest dostępny w Gemini API (code>gemini-robotics-er-2-preview/code> i code>gemini-robotics-er-2-streaming-preview/code>) oraz Google AI Studio, jako zamknięta wersja zapoznawcza. Google pozycjonuje go jako swój dotychczas najbezpieczniejszy model robotyczny, ze znaczną poprawą w porównaniu z ER 1.6 w koordynacji wielu robotów i śledzeniu postępów. To warstwa rozumowania, a nie niskopoziomowy kontroler siłowników.

Najważniejsze wnioski

• Rozumowanie ucieleśnione (ER): ER 2 to mózg wysokiego poziomu odpowiedzialny za percepcję i planowanie, a nie bezpośredni kontroler motoryczny (to rola osobnej linii VLA/na urządzeniu).

• Kluczowe umiejętności: rozumienie wideo, rozumowanie przestrzenne, wieloetapowa orkiestracja narzędzi, lokalizacja momentów w wideo, klasyfikacja postępu, koordynacja wielu robotów, samokorekta.

• Wariant strumieniowy: code>gemini-robotics-er-2-streaming-preview/code> dodaje dwukierunkową interakcję audio-wideo o niskim opóźnieniu do sterowania i dialogu w czasie rzeczywistym.

• Bezpieczeństwo przede wszystkim: Google pozycjonuje ER 2 jako swój najbezpieczniejszy model robotyczny pod względem przestrzegania ograniczeń bezpieczeństwa i bliskości człowieka, z przyrostami w benchmarku ASIMOV2.

Dostępność: Gemini API + Google AI Studio (publiczna wersja preview); Enterprise Agent Platform w prywatnej wersji preview; modele VLA/na urządzeniu ograniczone do partnerów wczesnego dostępu. Zamknięte.

Co oznacza „rozumowanie ucieleśnione”?

Nowoczesne stosy robotyki coraz częściej dzielą się na dwie warstwy. Mózg rozumowania wysokiego poziomu rozumie scenę, decyduje, co zrobić, i planuje; model działania niskiego poziomu tłumaczy plany na precyzyjne polecenia ruchowe. Gemini Robotics ER 2 to pierwsza warstwa: model wizyjno-językowy rozumowania ucieleśnionego. Przyjmuje wideo (oraz audio i tekst), buduje zrozumienie obiektów, przestrzeni i postępu w czasie, a następnie generuje plany i wywołania narzędzi — w tym wywoływanie narzędzi zewnętrznych, takich jak Google Search — które może wykonać oddzielny system działania lub człowiek. Innymi słowy, ER 2 to część robota, która myśli, a nie część, która się porusza; modele wizyjno-językowo-akcyjne (VLA) z bezpośrednim sterowaniem Google oraz modele działające na urządzeniu to osobna linia, obecnie ograniczona do wczesnych partnerów.

Co potrafi ER 2

Google opisuje szeroki zestaw umiejętności rozumowania ucieleśnionego. ER 2 potrafi rozumieć wideo i lokalizować konkretne momenty w nim („kiedy spadła szklanka?"), rozumować o przestrzeni 3D i relacjach między obiektami, klasyfikować postęp zadania (czy krok jest ukończony, częściowo wykonany, czy nieudany?) oraz zarządzać wieloetapowym użyciem narzędzi, aby osiągnąć cel. Potrafi prowadzić dialog z człowiekiem i planować zadania trwające kilka minut, samokorygować się, gdy coś pójdzie nie tak, oraz — co istotne — koordynować pracę wielu robotów jednocześnie. To dokładnie te możliwości, których robot potrzebuje, aby działać w nieprzewidywalnych, rzeczywistych środowiskach, a nie w zaprogramowanych demonstracjach.

Wariant strumieniowy: interakcja w czasie rzeczywistym

Oprócz standardowej wersji zapoznawczej Google udostępniło code>gemini-robotics-er-2-streaming-preview/code>, zoptymalizowany pod kątem niskich opóźnień i dwukierunkowej transmisji audio-wideo. Ma to znaczenie dla zastosowań związanych z robotyką: robot musi stale postrzegać, rozumować i reagować, a nie w wolnych cyklach żądanie-odpowiedź. Model strumieniowy umożliwia interakcję w czasie rzeczywistym — obserwowanie na żywo, rozmowę z człowiekiem i bieżące dostosowywanie planu — co jest niezbędne dla interaktywnych asystentów, wsparcia teleoperacji i dynamicznych zadań wieloetapowych.

Co nowego względem ER 1.6

{{1}}ER 2{{/1}} to wyraźny krok naprzód w porównaniu z {{2}}Gemini Robotics ER 1.6{{/2}}. Google podkreśla znacznie lepszą koordynację wielu robotów i śledzenie postępu zadań, mocniejszą orkiestrację narzędzi wieloetapowych oraz poprawione zachowania w zakresie bezpieczeństwa. Jeśli chodzi konkretnie o bezpieczeństwo, Google pozycjonuje {{3}}ER 2{{/3}} jako swój najbezpieczniejszy dotychczas model robotyczny, powołując się na lepsze przestrzeganie ograniczeń bezpieczeństwa, poprawę zachowania w obecności ludzi oraz postępy w teście bezpieczeństwa {{4}}ASIMOV2{{/4}}. Dla zespołów budujących realne wdrożenia, ulepszenia w zakresie koordynacji, śledzenia postępu i bezpieczeństwa są najbardziej istotnymi zmianami.

Bezpieczeństwo i ewaluacja

Bezpieczeństwo jest centralnym elementem pozycjonowania ER 2. Google podaje, że przoduje ono pod względem przestrzegania ograniczeń bezpieczeństwa oraz zgodności swojego zachowania z bezpiecznym ludzkim osądem w obecności ludzi, z poprawionymi wynikami w ASIMOV2 (benchmarku robotyki ukierunkowanym na bezpieczeństwo). Ponieważ robotyka działa w świecie fizycznym, te właściwości bezpieczeństwa mają znacznie większe znaczenie niż w przypadku chatbota — błąd planowania może wyrządzić realną szkodę. Podobnie jak w przypadku każdego benchmarku dostawcy, traktuj szczegóły jako wstępne i orientacyjne; niezależna ocena robotyki wciąż dojrzewa.

Dostępność i ceny

ER 2 jest dostępny w publicznej wersji zapoznawczej za pośrednictwem Gemini API — identyfikatory modeli code>gemini-robotics-er-2-preview/code> i code>gemini-robotics-er-2-streaming-preview/code> — oraz w Google AI Studio. Integracja z Enterprise Agent Platform jest w prywatnej wersji zapoznawczej, a modele VLA z bezpośrednim sterowaniem oraz modele na urządzeniu pozostają ograniczone do wczesnych partnerów. Dostęp do nich jest zamknięty. Cennik opiera się na standardowych rozliczeniach Gemini API; Google nie opublikował stawek specyficznych dla robotyki przy premierze. Potwierdź bieżący dostęp i koszty w dokumentacji Gemini API.

Trzy scenariusze, w których ER 2 pasuje

1. Roboty magazynowe i logistyczne

Rozumowanie przestrzenne, śledzenie postępów i koordynacja wielu robotów są odpowiednie do zadań pick-and-place, sortowania i floty, gdzie roboty muszą rozumieć sceny i współpracować.

2. Interaktywne roboty asystujące

Interakcja audio-wideo w czasie rzeczywistym wariantu strumieniowego umożliwia robotom obserwowanie, słuchanie, rozmawianie i planowanie wielominutowych zadań z człowiekiem.

3. Kontrola i monitorowanie

Rozumienie wideo i lokalizacja momentów sprawiają, że ER 2 jest przydatny do analizowania strumieni na żywo lub nagranych — wykrywania zdarzeń, klasyfikowania stanów oraz oznaczania postępów lub niepowodzeń.

Jak wpisuje się w szerszy stos AI

Gemini Robotics ER 2 to specjalistyczny model robotyki, dostępny przez API Gemini od Google, a nie ogólny model językowy — więc nie jest to coś, co hostuje ogólny router modeli. W przypadku ogólnych elementów językowych i multimodalnych aplikacji wokół robota — interfejsów języka naturalnego, rozumowania, orkiestracji, analityki — endpoint niezależny od dostawcy daje ci swobodę wyboru: a href="https://www.orcarouter.ai/">OrcaRouter/a> zapewnia jeden endpoint zgodny z OpenAI dla wielu modeli tekstowych i multimodalnych (w tym ogólnych modeli Gemini od Google), podczas gdy kontrola ucieleśniona ER 2 działa przez dedykowane API robotyki Google. To rozdzielenie jest naturalne: użyj specjalistycznego mózgu robota do ucieleśnienia, a endpointu niezależnego od dostawcy do wszystkiego innego.

Ograniczenia i zastrzeżenia

ER 2 to warstwa rozumowania/planowania, a nie gotowy robot — nadal potrzebujesz systemu wykonawczego (modele VLA/on-device od Google, ograniczone do partnerów, lub własne), aby fizycznie realizować plany. To zamknięta wersja zapoznawcza, więc dostępność i zachowanie mogą się zmienić, a szczegóły cenowe nie zostały opublikowane. Jego wyniki benchmarkowe i twierdzenia o bezpieczeństwie są raportowane przez dostawcę i mają charakter wstępny; niezależna ocena robotyki jest jeszcze niedojrzała. A wdrożenie systemów ucieleśnionych niesie ze sobą obowiązki bezpieczeństwa w świecie rzeczywistym, które wykraczają daleko poza testowanie oprogramowania. Traktuj to jako zaawansowaną wersję zapoznawczą do prototypowania, a nie gotowy kontroler produkcyjny.

Często zadawane pytania

Czym jest Gemini Robotics ER 2?

Model wizyjno-językowy Google DeepMind do rozumowania ucieleśnionego — mózg robota wysokiego poziomu odpowiadający za percepcję i planowanie — udostępniony w publicznej wersji zapoznawczej 30 lipca 2026 r., z wariantem przesyłania strumieniowego w czasie rzeczywistym.

Czy ER 2 steruje silnikami robota bezpośrednio?

Nie. ER 2 to warstwa rozumowania/planowania; bezpośrednia kontrola motoryczna jest obsługiwana przez osobne modele wizja-język-akcja (VLA) oraz modele na urządzeniu, obecnie ograniczone do wczesnych partnerów.

Co potrafi ER 2?

Rozumienie wideo i lokalizacja momentów, rozumowanie przestrzenne, wieloetapowa orkiestracja narzędzi, klasyfikacja postępu, koordynacja wielu robotów, samokorekta i interakcja w czasie rzeczywistym (wariant strumieniowy).

Czym różni się ER 2 od ER 1.6?

Google informuje o lepszej koordynacji wielu robotów i śledzeniu postępów, skuteczniejszej orkiestracji narzędzi oraz poprawie bezpieczeństwa — w tym o wzrostach w benchmarku bezpieczeństwa ASIMOV2 — pozycjonując ER 2 jako swój najbezpieczniejszy dotychczas model robotyki.

Jak uzyskać dostęp do Gemini Robotics ER 2?

Za pośrednictwem API Gemini (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) oraz Google AI Studio, w ramach zamkniętej publicznej wersji zapoznawczej. Ceny podlegają standardowym opłatom za korzystanie z API Gemini.

Czy ER 2 jest bezpieczny dla prawdziwych robotów?

Google pozycjonuje go jako swój najbezpieczniejszy model robotyki pod względem przestrzegania ograniczeń bezpieczeństwa i bliskości człowieka, ale wdrożenie w środowisku fizycznym wiąże się z realnymi obowiązkami bezpieczeństwa; traktuj twierdzenia o bezpieczeństwie jako wstępne i weryfikuj je rygorystycznie.

Sedno sprawy

Gemini Robotics ER 2 to duży krok dla sztucznej inteligencji ucieleśnionej: mózg rozumowania skoncentrowany na bezpieczeństwie, który pozwala robotom rozumieć wideo, wnioskować o przestrzeni i czasie, planować wielominutowe zadania, koordynować działania z innymi robotami oraz wchodzić w interakcje w czasie rzeczywistym dzięki swojej odmianie strumieniowej. To warstwa planowania, a nie sterownik silników, i to wczesna zamknięta wersja zapoznawcza z benchmarkami raportowanymi przez producenta — ale zyski w koordynacji, śledzeniu postępów i bezpieczeństwie względem ER 1.6 są znaczące. Prototypuj z nią przez Gemini API dla ucieleśnienia, a ogólne części językowe/multimodalne swojego stosu utrzymuj neutralne względem dostawcy dzięki punktowi końcowemu takiemu jak OrcaRouter.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube