
Gemini Robotics ER 2: 구글 딥마인드의 체화 추론 로봇 두뇌, 설명
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 206 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461지능78코딩
- googleNEWGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleNEWGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
- anthropicAnthropic: Claude Fable 52026-06-0960지능77코딩
Google DeepMind의 Gemini Robotics ER 2는 2026년 7월 30일에 공개 미리보기로 출시된, 로봇의 고수준 "두뇌" 역할을 하도록 만들어진 특화된 비전-언어 모델입니다. "ER"은 Embodied Reasoning(체화된 추론)을 뜻합니다. 즉, 모터를 직접 구동하는 대신, ER 2는 물리적 세계를 보고 이해하며, 공간과 시간에 대해 추론하고, 다단계 작업을 계획하며, 도구를 조율하고, 로봇들을 조정합니다. 또한 저지연의 인터랙티브 제어를 위한 실시간 스트리밍 변형도 함께 제공됩니다. 이 가이드에서는 ER 2가 무엇인지, 직접 제어 모델과 어떻게 다른지, ER 1.6 대비 새로운 점, 그리고 어디에 적합한지 — 기능 출처와 함께 — 설명합니다.
정확성 참고: 역량, 가용성 및 안전 관련 주장은 Google DeepMind의 발표와 Gemini API 변경 로그(2026-07-30)에 기반합니다. 로보틱스 벤치마크는 초기 단계이며 공급업체가 보고한 수치입니다. 가격은 표준 Gemini API 청구 체계를 따르며 구체적인 세부 사항은 공개되지 않았습니다. 세부 사항은 변경될 수 있으니 빌드 전에 확인하세요.
TL;DR. Gemini Robotics ER 2는 로봇의 플래너이자 지각 두뇌 역할을 하는 체화 추론 VLM으로, 비디오 이해, 공간 추론, 다단계 도구 오케스트레이션, 비디오 순간 위치 파악, 진행 상황 추적, 다중 로봇 조정, 자기 교정을 지원하며, 실시간 양방향 오디오-비디오 상호작용을 위한 스트리밍 변형도 제공합니다. Gemini API(code>gemini-robotics-er-2-preview/code> 및 code>gemini-robotics-er-2-streaming-preview/code>) 및 Google AI Studio에서 비공개 미리보기로 제공됩니다. Google은 이를 지금까지 가장 안전한 로보틱스 모델로 내세우며, 다중 로봇 조정과 진행 상황 추적에서 ER 1.6 대비 눈에 띄는 개선을 보여줍니다. 이는 추론 레이어이지, 저수준 액추에이터 컨트롤러가 아닙니다.
주요 시사점
• Embodied Reasoning (ER): ER 2는 고수준의 지각 및 계획을 담당하는 두뇌로, 직접적인 모터 컨트롤러가 아닙니다(그것은 별도의 VLA/온디바이스 라인입니다).
핵심 기술: 영상 이해, 공간 추론, 다단계 도구 조율, 비디오 순간 위치 파악, 진행 상황 분류, 다중 로봇 협조, 자기 교정.
• 스트리밍 변형: code>gemini-robotics-er-2-streaming-preview/code>은(는) 실시간 제어 및 대화를 위한 저지연 양방향 오디오-비디오 상호작용을 추가합니다.
• 안전 최우선: Google은 ER 2를 안전 제약 준수 및 인간 근접성 측면에서 가장 안전한 로보틱스 모델로 내세우며, ASIMOV2 벤치마크에서 성과 향상을 달성했습니다.
• 가용성: Gemini API + Google AI Studio(공개 미리보기); Enterprise Agent Platform은 비공개 미리보기; VLA/온디바이스 모델은 초기 파트너에게만 제한. 비공개.
"체화된 추론(Embodied Reasoning)이란 무엇인가"
현대 로보틱스 스택은 점점 두 계층으로 나뉩니다. 고수준 추론 두뇌는 장면을 이해하고, 무엇을 할지 결정하며, 계획을 수립합니다. 저수준 동작 모델은 계획을 정밀한 모터 명령으로 변환합니다. Gemini Robotics ER 2는 첫 번째 계층, 즉 체화된 추론을 수행하는 비전-언어 모델입니다. 비디오(그리고 오디오와 텍스트)를 입력받아 객체, 공간, 시간에 따른 진행 상황에 대한 이해를 구축하고, 계획과 도구 호출(Google Search와 같은 외부 도구 호출 포함)을 출력합니다. 이러한 출력은 별도의 동작 시스템이나 사람이 실행할 수 있습니다. 다시 말해, ER 2는 로봇에서 생각하는 부분이지 움직이는 부분이 아닙니다. Google의 직접 제어 비전-언어-동작(VLA) 모델과 온디바이스 모델은 별도의 라인으로, 현재 초기 파트너에게만 제한적으로 제공됩니다.

ER 2가 할 수 있는 것
Google은 광범위한 체화된 추론 기술 세트를 설명합니다. ER 2는 비디오를 이해하고 그 안의 특정 순간을 찾아낼 수 있으며("컵이 언제 떨어졌나?"), 3D 공간과 객체 관계를 추론하고, 작업 진행 상황을 분류하며(단계가 완료되었는지, 부분 진행되었는지, 실패했는지), 목표 달성을 위해 다단계 도구 사용을 조율할 수 있습니다. 또한 사람과 대화를 나누고 몇 분에 걸친 작업을 계획할 수 있으며, 문제가 발생하면 스스로 수정하고, 특히 여러 로봇이 함께 협력하도록 조정할 수 있습니다. 이것이야말로 로봇이 스크립트된 데모가 아닌 실제의 복잡한 환경에서 작동하는 데 필요한 능력입니다.
스트리밍 변형: 실시간 상호작용
표준 프리뷰와 함께 Google은 code>gemini-robotics-er-2-streaming-preview/code>를 출시했으며, 이는 저지연 양방향 오디오-비디오에 최적화되어 있습니다. 이는 구현(embodied) 사용에 중요합니다: 로봇은 느린 요청-응답 방식이 아니라 지속적으로 인지하고, 추론하고, 반응해야 합니다. 스트리밍 모델은 실시간 상호작용을 가능하게 합니다 — 라이브 피드를 보면서, 사람과 대화하고, 즉석에서 계획을 조정하는 것 — 이는 대화형 어시스턴트, 원격 조작 지원, 동적 다단계 작업에 필수적입니다.
ER 1.6 대비 새로운 기능
ER 2는 Gemini Robotics ER 1.6에서 한 단계 확실히 도약한 모델입니다. Google은 훨씬 더 나은 다중 로봇 조정 및 작업 진행 추적, 더 강력한 다단계 도구 오케스트레이션, 개선된 안전 동작을 강조합니다. 특히 안전 측면에서 Google은 ER 2를 현재까지 가장 안전한 로보틱스 모델로 자리매김하며, 안전 제약 준수와 인간 근접 행동의 개선, ASIMOV2 안전 벤치마크에서의 성과 향상을 근거로 제시합니다. 실제 배포를 구축하는 팀에게는 조정, 진행 추적, 안전 개선이 가장 중요한 업그레이드입니다.
안전 및 평가
안전은 ER 2의 포지셔닝에서 핵심입니다. Google은 ER 2가 안전 제약 준수와 사람 주변에서의 안전한 인간 판단과 얼마나 가깝게 일치하는지에 있어서 선도적이라고 보고하며, 안전 중심 로봇 벤치마크인 ASIMOV2에서 개선된 점수를 기록했습니다. 로봇은 물리적 세계에서 작동하기 때문에 이러한 안전 속성은 챗봇의 경우보다 훨씬 더 중요합니다. 계획 오류는 실제 피해를 초래할 수 있기 때문입니다. 다른 공급업체 벤치마크와 마찬가지로, 구체적인 수치는 초기 단계의 방향성 지표로 간주해야 하며, 독립적인 로봇 평가는 아직 성숙하는 중입니다.

가용성 및 가격
ER 2는 Gemini API를 통해 공개 미리보기로 제공됩니다 — 모델 ID: code>gemini-robotics-er-2-preview/code> 및 code>gemini-robotics-er-2-streaming-preview/code> — 그리고 Google AI Studio에서도 제공됩니다. Enterprise Agent Platform 통합은 비공개 미리보기 단계이며, 직접 제어 VLA 및 온디바이스 모델은 초기 파트너에게만 제한됩니다. 비공개입니다. 가격은 표준 Gemini API 요금제를 따르며, Google은 출시 시 로보틱스 전용 요율을 공개하지 않았습니다. 현재 액세스 및 비용은 Gemini API 문서에서 확인하세요.
ER 2가 적합한 세 가지 시나리오
1. 창고 및 물류 로봇
공간 추론, 진행 상황 추적, 다중 로봇 조정은 로봇이 장면을 이해하고 협력해야 하는 픽 앤 플레이스, 분류, 플릿 작업에 적합합니다.
2. 대화형 보조 로봇
스트리밍 변형의 실시간 오디오-비디오 상호작용은 사람과 함께 보고, 듣고, 대화하며, 수 분에 걸친 작업을 계획하는 로봇을 가능하게 한다.
3. 검사 및 모니터링
비디오 이해와 순간 위치 파악 기능 덕분에 ER 2는 라이브 또는 녹화된 영상 분석에 유용합니다. 이벤트를 감지하고, 상태를 분류하며, 진행 상황이나 실패를 표시할 수 있습니다.
더 넓은 AI 스택에 어떻게 맞는지
Gemini Robotics ER 2는 Google의 Gemini API를 통해 액세스되는 특수 로보틱스 모델로, 범용 LLM이 아닙니다. 그래서 일반 모델 라우터가 호스팅하는 대상도 아닙니다. 로봇 주변 애플리케이션의 범용 언어 및 멀티모달 부분(자연어 인터페이스, 추론, 오케스트레이션, 분석)에서는 벤더 중립적 엔드포인트가 선택지를 열어 둡니다: a href="https://www.orcarouter.ai/">OrcaRouter/a>는 다양한 텍스트 및 멀티모달 LLM(Google의 일반 Gemini 모델 포함)에 대해 하나의 OpenAI 호환 엔드포인트를 제공하며, ER 2의 구현 제어는 Google의 전용 로보틱스 API를 통해 실행됩니다. 이러한 분리는 자연스럽습니다: 구현에는 특수 로봇 두뇌를 사용하고, 그 외 모든 것에는 벤더 중립적 엔드포인트를 사용하세요.
제한 사항 및 주의 사항
ER 2는 레디메이드 로봇이 아닌 추론/계획 계층입니다. 계획을 물리적으로 실행하려면 여전히 액션 시스템(Google의 VLA/온디바이스 모델—파트너로 제한됨—또는 자체 시스템)이 필요합니다. 비공개 미리보기이므로 가용성과 동작이 변경될 수 있으며, 가격 세부 사항은 공개되지 않았습니다. 벤치마크와 안전성 주장은 공급업체가 보고한 초기 수준이며, 독립적인 로보틱스 평가는 아직 성숙하지 않습니다. 또한 실제 배포는 소프트웨어 테스트를 훨씬 넘어서는 현실 세계의 안전 의무를 수반합니다. 이를 완성된 프로덕션 컨트롤러가 아닌 프로토타이핑을 위한 강력한 미리보기로 취급하십시오.
자주 묻는 질문
Gemini Robotics ER 2란 무엇인가요?
Google DeepMind의 체화된 추론 비전-언어 모델 — 로봇의 고수준 지각 및 계획 두뇌 — 2026년 7월 30일 공개 미리보기로 출시되었으며, 실시간 스트리밍 변형도 함께 제공됩니다.
ER 2가 로봇 모터를 직접 제어하나요?
아니요. ER 2는 추론/계획 계층입니다. 직접 모터 제어는 별도의 비전-언어-행동(VLA) 및 온디바이스 모델이 담당하며, 현재는 초기 파트너에게만 제한됩니다.
ER 2는 무엇을 할 수 있나요?
비디오 이해 및 순간 위치 파악, 공간 추론, 다단계 도구 오케스트레이션, 진행 상황 분류, 다중 로봇 협력, 자기 교정 및 실시간 상호작용(스트리밍 변형).
ER 2는 ER 1.6과 어떻게 다른가요?
Google은 더 나은 다중 로봇 조정 및 진행 상황 추적, 더 강력한 도구 오케스트레이션, 그리고 개선된 안전성을 보고했습니다. 여기에는 ASIMOV2 안전 벤치마크에서의 성과 향상도 포함되며, 이로써 ER 2는 현재까지 가장 안전한 로보틱스 모델로 자리 잡았습니다.
Gemini Robotics ER 2에 어떻게 액세스하나요?
Gemini API를 통해(code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) 및 Google AI Studio를 통해 제한적 공개 미리보기로 제공됩니다. 요금은 표준 Gemini API 요금 체계를 따릅니다.
ER 2는 실제 로봇에 안전한가요?
Google은 안전 제약 준수와 인간 근접성 측면에서 이를 가장 안전한 로보틱스 모델로 평가하지만, 실물 배포는 현실 세계의 안전 의무를 수반합니다. 안전 주장은 조기에 검토하고 엄격히 검증하십시오.
결론
Gemini Robotics ER 2는 구현형 AI(embodied AI)의 큰 진전입니다. 안전 중심의 추론 브레인으로, 로봇이 비디오를 이해하고, 공간과 시간을 추론하며, 수 분에 걸친 작업을 계획하고, 다른 로봇과 협력하며, 스트리밍 버전을 통해 실시간으로 상호작용할 수 있게 해줍니다. 이는 모터 컨트롤러가 아닌 플래닝 레이어이며, 벤더가 보고한 벤치마크를 포함한 초기 비공개 프리뷰입니다. 그러나 ER 1.6 대비 협력, 진행 상황 추적, 안전 측면의 개선은 의미가 있습니다. 구현형 AI를 위해 Gemini API를 통해 프로토타이핑하고, 스택의 일반 언어/멀티모달 부분은 OrcaRouter와 같은 엔드포인트를 통해 벤더 중립적으로 유지하세요.
