
Gemini Robotics ER 2: Mózg robota Google DeepMind oparty na ucieleśnionym rozumowaniu — wyjaśniamy
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 206 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOWOŚĆAnthropic: Claude Opus 52026-07-2461Inteligencja78Kod
- googleNOWOŚĆGoogle: Gemini 3.6 Flash2026-07-2150Inteligencja69Kod
- googleNOWOŚĆGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1651Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0854Inteligencja72Kod
- tencentTencent: Hy32026-07-0641Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencja69Kod60Matematyka
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencja61Kod61Matematyka
- anthropicAnthropic: Claude Fable 52026-06-0960Inteligencja77Kod
Należący do Google DeepMindGemini Robotics ER 2 — udostępniony w publicznej wersji zapoznawczej 30 lipca 2026 roku — to specjalistyczny model wizyjno-językowy zaprojektowany jako wysokopoziomowy „mózg” robota. „ER” oznacza Embodied Reasoning (ucieleśnione rozumowanie): zamiast bezpośrednio sterować silnikami, ER 2 widzi i rozumie świat fizyczny, rozumuje o przestrzeni i czasie, planuje zadania wieloetapowe, koordynuje narzędzia i roboty. Oferuje również wariant przesyłania strumieniowego w czasie rzeczywistym do interaktywnego sterowania o niskim opóźnieniu. Ten przewodnik wyjaśnia, czym jest ER 2, czym różni się od modelu bezpośredniego sterowania, co nowego wprowadza w porównaniu z ER 1.6 oraz gdzie ma zastosowanie — wraz z podaniem źródeł możliwości.
Uwaga o dokładności: deklaracje dotyczące możliwości, dostępności i bezpieczeństwa pochodzą z ogłoszenia Google DeepMind oraz dziennika zmian interfejsu Gemini API (2026-07-30). Wyniki benchmarków robotyki są wstępne i raportowane przez dostawcę; ceny podlegają standardowemu rozliczeniu Gemini API, a szczegóły nie zostały opublikowane. Szczegóły mogą się zmieniać — zweryfikuj przed wdrożeniem.
TL;DR. Gemini Robotics ER 2 to VLM rozumowania ucieleśnionego, który pełni rolę mózgu planowania i percepcji robota: rozumienie wideo, rozumowanie przestrzenne, wieloetapowa orkiestracja narzędzi, lokalizacja momentów w wideo, śledzenie postępów, koordynacja wielu robotów i samokorekta, z wariantem strumieniowym do dwukierunkowej interakcji audio-wideo w czasie rzeczywistym. Jest dostępny w Gemini API (code>gemini-robotics-er-2-preview/code> i code>gemini-robotics-er-2-streaming-preview/code>) oraz Google AI Studio, jako zamknięta wersja zapoznawcza. Google pozycjonuje go jako swój dotychczas najbezpieczniejszy model robotyczny, ze znaczną poprawą w porównaniu z ER 1.6 w koordynacji wielu robotów i śledzeniu postępów. To warstwa rozumowania, a nie niskopoziomowy kontroler siłowników.
Najważniejsze wnioski
• Rozumowanie ucieleśnione (ER): ER 2 to mózg wysokiego poziomu odpowiedzialny za percepcję i planowanie, a nie bezpośredni kontroler motoryczny (to rola osobnej linii VLA/na urządzeniu).
• Kluczowe umiejętności: rozumienie wideo, rozumowanie przestrzenne, wieloetapowa orkiestracja narzędzi, lokalizacja momentów w wideo, klasyfikacja postępu, koordynacja wielu robotów, samokorekta.
• Wariant strumieniowy: code>gemini-robotics-er-2-streaming-preview/code> dodaje dwukierunkową interakcję audio-wideo o niskim opóźnieniu do sterowania i dialogu w czasie rzeczywistym.
• Bezpieczeństwo przede wszystkim: Google pozycjonuje ER 2 jako swój najbezpieczniejszy model robotyczny pod względem przestrzegania ograniczeń bezpieczeństwa i bliskości człowieka, z przyrostami w benchmarku ASIMOV2.
Dostępność: Gemini API + Google AI Studio (publiczna wersja preview); Enterprise Agent Platform w prywatnej wersji preview; modele VLA/na urządzeniu ograniczone do partnerów wczesnego dostępu. Zamknięte.
Co oznacza „rozumowanie ucieleśnione”?
Nowoczesne stosy robotyki coraz częściej dzielą się na dwie warstwy. Mózg rozumowania wysokiego poziomu rozumie scenę, decyduje, co zrobić, i planuje; model działania niskiego poziomu tłumaczy plany na precyzyjne polecenia ruchowe. Gemini Robotics ER 2 to pierwsza warstwa: model wizyjno-językowy rozumowania ucieleśnionego. Przyjmuje wideo (oraz audio i tekst), buduje zrozumienie obiektów, przestrzeni i postępu w czasie, a następnie generuje plany i wywołania narzędzi — w tym wywoływanie narzędzi zewnętrznych, takich jak Google Search — które może wykonać oddzielny system działania lub człowiek. Innymi słowy, ER 2 to część robota, która myśli, a nie część, która się porusza; modele wizyjno-językowo-akcyjne (VLA) z bezpośrednim sterowaniem Google oraz modele działające na urządzeniu to osobna linia, obecnie ograniczona do wczesnych partnerów.

Co potrafi ER 2
Google opisuje szeroki zestaw umiejętności rozumowania ucieleśnionego. ER 2 potrafi rozumieć wideo i lokalizować konkretne momenty w nim („kiedy spadła szklanka?"), rozumować o przestrzeni 3D i relacjach między obiektami, klasyfikować postęp zadania (czy krok jest ukończony, częściowo wykonany, czy nieudany?) oraz zarządzać wieloetapowym użyciem narzędzi, aby osiągnąć cel. Potrafi prowadzić dialog z człowiekiem i planować zadania trwające kilka minut, samokorygować się, gdy coś pójdzie nie tak, oraz — co istotne — koordynować pracę wielu robotów jednocześnie. To dokładnie te możliwości, których robot potrzebuje, aby działać w nieprzewidywalnych, rzeczywistych środowiskach, a nie w zaprogramowanych demonstracjach.
Wariant strumieniowy: interakcja w czasie rzeczywistym
Oprócz standardowej wersji zapoznawczej Google udostępniło code>gemini-robotics-er-2-streaming-preview/code>, zoptymalizowany pod kątem niskich opóźnień i dwukierunkowej transmisji audio-wideo. Ma to znaczenie dla zastosowań związanych z robotyką: robot musi stale postrzegać, rozumować i reagować, a nie w wolnych cyklach żądanie-odpowiedź. Model strumieniowy umożliwia interakcję w czasie rzeczywistym — obserwowanie na żywo, rozmowę z człowiekiem i bieżące dostosowywanie planu — co jest niezbędne dla interaktywnych asystentów, wsparcia teleoperacji i dynamicznych zadań wieloetapowych.
Co nowego względem ER 1.6
{{1}}ER 2{{/1}} to wyraźny krok naprzód w porównaniu z {{2}}Gemini Robotics ER 1.6{{/2}}. Google podkreśla znacznie lepszą koordynację wielu robotów i śledzenie postępu zadań, mocniejszą orkiestrację narzędzi wieloetapowych oraz poprawione zachowania w zakresie bezpieczeństwa. Jeśli chodzi konkretnie o bezpieczeństwo, Google pozycjonuje {{3}}ER 2{{/3}} jako swój najbezpieczniejszy dotychczas model robotyczny, powołując się na lepsze przestrzeganie ograniczeń bezpieczeństwa, poprawę zachowania w obecności ludzi oraz postępy w teście bezpieczeństwa {{4}}ASIMOV2{{/4}}. Dla zespołów budujących realne wdrożenia, ulepszenia w zakresie koordynacji, śledzenia postępu i bezpieczeństwa są najbardziej istotnymi zmianami.
Bezpieczeństwo i ewaluacja
Bezpieczeństwo jest centralnym elementem pozycjonowania ER 2. Google podaje, że przoduje ono pod względem przestrzegania ograniczeń bezpieczeństwa oraz zgodności swojego zachowania z bezpiecznym ludzkim osądem w obecności ludzi, z poprawionymi wynikami w ASIMOV2 (benchmarku robotyki ukierunkowanym na bezpieczeństwo). Ponieważ robotyka działa w świecie fizycznym, te właściwości bezpieczeństwa mają znacznie większe znaczenie niż w przypadku chatbota — błąd planowania może wyrządzić realną szkodę. Podobnie jak w przypadku każdego benchmarku dostawcy, traktuj szczegóły jako wstępne i orientacyjne; niezależna ocena robotyki wciąż dojrzewa.

Dostępność i ceny
ER 2 jest dostępny w publicznej wersji zapoznawczej za pośrednictwem Gemini API — identyfikatory modeli code>gemini-robotics-er-2-preview/code> i code>gemini-robotics-er-2-streaming-preview/code> — oraz w Google AI Studio. Integracja z Enterprise Agent Platform jest w prywatnej wersji zapoznawczej, a modele VLA z bezpośrednim sterowaniem oraz modele na urządzeniu pozostają ograniczone do wczesnych partnerów. Dostęp do nich jest zamknięty. Cennik opiera się na standardowych rozliczeniach Gemini API; Google nie opublikował stawek specyficznych dla robotyki przy premierze. Potwierdź bieżący dostęp i koszty w dokumentacji Gemini API.
Trzy scenariusze, w których ER 2 pasuje
1. Roboty magazynowe i logistyczne
Rozumowanie przestrzenne, śledzenie postępów i koordynacja wielu robotów są odpowiednie do zadań pick-and-place, sortowania i floty, gdzie roboty muszą rozumieć sceny i współpracować.
2. Interaktywne roboty asystujące
Interakcja audio-wideo w czasie rzeczywistym wariantu strumieniowego umożliwia robotom obserwowanie, słuchanie, rozmawianie i planowanie wielominutowych zadań z człowiekiem.
3. Kontrola i monitorowanie
Rozumienie wideo i lokalizacja momentów sprawiają, że ER 2 jest przydatny do analizowania strumieni na żywo lub nagranych — wykrywania zdarzeń, klasyfikowania stanów oraz oznaczania postępów lub niepowodzeń.
Jak wpisuje się w szerszy stos AI
Gemini Robotics ER 2 to specjalistyczny model robotyki, dostępny przez API Gemini od Google, a nie ogólny model językowy — więc nie jest to coś, co hostuje ogólny router modeli. W przypadku ogólnych elementów językowych i multimodalnych aplikacji wokół robota — interfejsów języka naturalnego, rozumowania, orkiestracji, analityki — endpoint niezależny od dostawcy daje ci swobodę wyboru: a href="https://www.orcarouter.ai/">OrcaRouter/a> zapewnia jeden endpoint zgodny z OpenAI dla wielu modeli tekstowych i multimodalnych (w tym ogólnych modeli Gemini od Google), podczas gdy kontrola ucieleśniona ER 2 działa przez dedykowane API robotyki Google. To rozdzielenie jest naturalne: użyj specjalistycznego mózgu robota do ucieleśnienia, a endpointu niezależnego od dostawcy do wszystkiego innego.
Ograniczenia i zastrzeżenia
ER 2 to warstwa rozumowania/planowania, a nie gotowy robot — nadal potrzebujesz systemu wykonawczego (modele VLA/on-device od Google, ograniczone do partnerów, lub własne), aby fizycznie realizować plany. To zamknięta wersja zapoznawcza, więc dostępność i zachowanie mogą się zmienić, a szczegóły cenowe nie zostały opublikowane. Jego wyniki benchmarkowe i twierdzenia o bezpieczeństwie są raportowane przez dostawcę i mają charakter wstępny; niezależna ocena robotyki jest jeszcze niedojrzała. A wdrożenie systemów ucieleśnionych niesie ze sobą obowiązki bezpieczeństwa w świecie rzeczywistym, które wykraczają daleko poza testowanie oprogramowania. Traktuj to jako zaawansowaną wersję zapoznawczą do prototypowania, a nie gotowy kontroler produkcyjny.
Często zadawane pytania
Czym jest Gemini Robotics ER 2?
Model wizyjno-językowy Google DeepMind do rozumowania ucieleśnionego — mózg robota wysokiego poziomu odpowiadający za percepcję i planowanie — udostępniony w publicznej wersji zapoznawczej 30 lipca 2026 r., z wariantem przesyłania strumieniowego w czasie rzeczywistym.
Czy ER 2 steruje silnikami robota bezpośrednio?
Nie. ER 2 to warstwa rozumowania/planowania; bezpośrednia kontrola motoryczna jest obsługiwana przez osobne modele wizja-język-akcja (VLA) oraz modele na urządzeniu, obecnie ograniczone do wczesnych partnerów.
Co potrafi ER 2?
Rozumienie wideo i lokalizacja momentów, rozumowanie przestrzenne, wieloetapowa orkiestracja narzędzi, klasyfikacja postępu, koordynacja wielu robotów, samokorekta i interakcja w czasie rzeczywistym (wariant strumieniowy).
Czym różni się ER 2 od ER 1.6?
Google informuje o lepszej koordynacji wielu robotów i śledzeniu postępów, skuteczniejszej orkiestracji narzędzi oraz poprawie bezpieczeństwa — w tym o wzrostach w benchmarku bezpieczeństwa ASIMOV2 — pozycjonując ER 2 jako swój najbezpieczniejszy dotychczas model robotyki.
Jak uzyskać dostęp do Gemini Robotics ER 2?
Za pośrednictwem API Gemini (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) oraz Google AI Studio, w ramach zamkniętej publicznej wersji zapoznawczej. Ceny podlegają standardowym opłatom za korzystanie z API Gemini.
Czy ER 2 jest bezpieczny dla prawdziwych robotów?
Google pozycjonuje go jako swój najbezpieczniejszy model robotyki pod względem przestrzegania ograniczeń bezpieczeństwa i bliskości człowieka, ale wdrożenie w środowisku fizycznym wiąże się z realnymi obowiązkami bezpieczeństwa; traktuj twierdzenia o bezpieczeństwie jako wstępne i weryfikuj je rygorystycznie.
Sedno sprawy
Gemini Robotics ER 2 to duży krok dla sztucznej inteligencji ucieleśnionej: mózg rozumowania skoncentrowany na bezpieczeństwie, który pozwala robotom rozumieć wideo, wnioskować o przestrzeni i czasie, planować wielominutowe zadania, koordynować działania z innymi robotami oraz wchodzić w interakcje w czasie rzeczywistym dzięki swojej odmianie strumieniowej. To warstwa planowania, a nie sterownik silników, i to wczesna zamknięta wersja zapoznawcza z benchmarkami raportowanymi przez producenta — ale zyski w koordynacji, śledzeniu postępów i bezpieczeństwie względem ER 1.6 są znaczące. Prototypuj z nią przez Gemini API dla ucieleśnienia, a ogólne części językowe/multimodalne swojego stosu utrzymuj neutralne względem dostawcy dzięki punktowi końcowemu takiemu jak OrcaRouter.
