
Gemini Robotics ER 2:Google DeepMindの身体化推論ロボットの頭脳を解説
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 206 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleNEWGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleNEWGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
- anthropicAnthropic: Claude Fable 52026-06-0960知能77コーディング
Google DeepMindのGemini Robotics ER 2は、2026年7月30日にパブリックプレビューとして公開された、ロボットの高次の「頭脳」となるよう設計された専門的な視覚言語モデルです。「ER」は「Embodied Reasoning(具現化推論)」の略で、モーターを直接駆動するのではなく、ER 2は物理世界を視覚的に理解し、空間と時間について推論して、複数ステップのタスクを計画し、ツールを統括し、ロボットを連携させます。また、低遅延で対話的な制御を可能にするリアルタイムストリーミング版も提供されています。本ガイドでは、ER 2とは何か、直接制御モデルとの違い、ER 1.6からの新機能、そしてその位置づけについて、機能の出典とともに説明します。
正確性に関する注記:機能、利用可能性、安全性に関する主張は、Google DeepMindの発表およびGemini API変更ログ(2026-07-30)に基づいています。ロボティクスのベンチマークは初期段階であり、ベンダー報告によるものです。価格設定は標準的なGemini APIの課金体系に従っており、詳細は公開されていませんでした。詳細は変更される可能性があるため、構築前にご確認ください。
TL;DR(要約)。Gemini Robotics ER 2は、ロボットのプランナーおよび知覚ブレインとして機能する身体化推論VLMです。動画理解、空間推論、多段階ツールオーケストレーション、動画モーメント位置特定、進捗追跡、複数ロボット協調、自己修正に対応し、リアルタイム双方向音声・動画インタラクションのためのストリーミング版も用意されています。Gemini APIで利用可能です(code>gemini-robotics-er-2-preview/code>およびcode>gemini-robotics-er-2-streaming-preview/code>)とGoogle AI Studioで、クローズドプレビューとして提供されています。Googleはこれを同社のロボティクスモデルの中で最も安全なものと位置づけており、複数ロボット協調と進捗追跡においてER 1.6からの顕著な改善が見られます。これは推論レイヤーであり、低レベルのアクチュエータコントローラーではありません。
重要なポイント
• Embodied Reasoning (ER):ER 2は高レベルの知覚・計画を司る頭脳であり、直接のモーター制御装置ではありません(それを担うのは別のVLA/オンデバイス系統です)。
• コアスキル: 動画理解、空間推論、マルチステップのツール連携、動画モーメント位置特定、進捗分類、マルチロボット協調、自己修正。
• ストリーミングバリアント: code>gemini-robotics-er-2-streaming-preview/code> は、低遅延・双方向のオーディオビデオ対話を追加し、リアルタイムの制御と対話を実現します。
• 安全性最優先:GoogleはER 2を、安全制約の順守と人間接近に関して最も安全なロボティクスモデルとして位置付けており、ASIMOV2ベンチマークの向上も達成しています。
• 提供状況: Gemini API + Google AI Studio (パブリックプレビュー); Enterprise Agent Platform (プライベートプレビュー); VLA/オンデバイスモデルは初期パートナーのみに限定。クローズ。
「Embodied Reasoning」とはどういう意味か
現代のロボティクススタックは、ますます2つの層に分かれつつあります。高レベルの推論ブレインはシーンを理解し、何をすべきかを決定して計画を立てます。低レベルのアクションモデルは、計画を正確なモーターコマンドに変換します。Gemini Robotics ER 2は最初の層、すなわち身体化された推論を行うビジョン・ランゲージモデルです。ビデオ(およびオーディオとテキスト)を受け取り、物体、空間、時間の経過に伴う進捗の理解を構築し、プランやツール呼び出しを出力します。これにはGoogle Searchなどの外部ツールの呼び出しも含まれ、別個のアクションシステムまたは人間が実行できます。言い換えれば、ER 2はロボットの「考える」部分であり、「動く」部分ではありません。Googleの直接制御ビジョン・ランゲージ・アクション(VLA)およびオンデバイスモデルは別系統であり、現在は初期パートナーに限定されています。

ER 2 ができること
Googleは、広範な身体化推論スキルセットについて説明している。ER 2は、ビデオを理解し、その中の特定の瞬間を特定することができる(「カップはいつ落ちたのか?」)。3D空間と物体間の関係について推論し、タスクの進捗を分類する(ステップが完了したか、途中か、失敗したか?)。そして、目標を達成するためにマルチステップのツール使用を調整する。また、人と対話し、数分にわたるタスクを計画することができ、何かがうまくいかないときは自己修正し、そして特筆すべきは、複数のロボットが協調して動作するように調整することである。これらはまさに、ロボットがスクリプト化されたデモではなく、混沌とした実際の環境で動作するために必要な能力である。
ストリーミング版:リアルタイム対話
標準プレビューに加えて、Googleは以下を出荷しました:code>gemini-robotics-er-2-streaming-preview/code>、低遅延・双方向の音声・映像向けに最適化されています。これは身体性を伴う利用にとって重要です。ロボットは、遅いリクエスト・レスポンス方式ではなく、知覚・推論・応答を継続的に行う必要があります。ストリーミングモデルは、ライブフィードの視聴、人との対話、計画のその場での調整といったリアルタイムのインタラクションを可能にし、これは対話型アシスタント、遠隔操作サポート、動的なマルチステップタスクに不可欠です。
ER 1.6 と比較した新機能
ER 2 は、Gemini Robotics ER 1.6 からの明確なステップアップです。Google は、マルチロボットの協調とタスク進捗の追跡が著しく向上し、マルチステップのツールオーケストレーションがより強力になり、安全性の動作が改善されたことを強調しています。安全性に関しては特に、Google は ER 2 をこれまでで最も安全なロボティクスモデルと位置づけており、安全制約への適合と人への近接動作の改善、そして ASIMOV2 安全性ベンチマークでの向上を挙げています。実際のデプロイメントを構築するチームにとって、協調、進捗追跡、安全性の改善が最も重要なアップグレードです。
安全性と評価
安全性はER 2のポジショニングにおいて中心的な位置を占めています。Googleは、ER 2が安全性制約の順守と、人の周囲での行動が安全な人間の判断とどの程度一致しているかにおいてリードしており、ASIMOV2(安全性に重点を置いたロボティクスベンチマーク)で改善されたスコアを達成したと報告しています。ロボティクスは物理的な世界で動作するため、これらの安全性の特性はチャットボットの場合よりもはるかに重要です。計画エラーは実際の危害を引き起こす可能性があります。どのベンダーのベンチマークでも同様に、具体的な数値は初期段階の方向性を示すものとして捉えるべきです。独立したロボティクス評価はまだ発展途上にあります。

在庫状況と価格
ER 2 は、Gemini API を通じてパブリックプレビューで利用できます — モデル ID: code>gemini-robotics-er-2-preview/code> と code>gemini-robotics-er-2-streaming-preview/code> — および Google AI Studio でも利用できます。Enterprise Agent Platform インテグレーションはプライベートプレビュー中で、直接制御型 VLA とオンデバイスモデルは初期パートナーのみに限定されています。クローズドです。料金は標準の Gemini API 課金に従います。Google はローンチ時にロボティクス専用の料金を公開していません。現在のアクセスとコストは Gemini API ドキュメントで確認してください。
ER 2が当てはまる3つのシナリオ
1. 倉庫および物流ロボット
空間認識、進捗追跡、およびマルチロボット協調は、ロボットがシーンを理解して協力する必要がある、ピックアンドプレース、仕分け、およびフリートタスクに適しています。
2. 対話型アシスタントロボット
ストリーミング版のリアルタイム音声・映像インタラクションは、人を観察し、話を聞き、会話し、人と共に数分間にわたるタスクを計画できるロボットを実現する。
3. 点検と監視
ビデオ理解とモーメント位置特定により、ER 2はライブまたは録画フィードの分析に役立ちます。イベントの発見、状態の分類、進捗や失敗のフラグ付けが可能です。
より広いAIスタックにどう適合するか
Gemini Robotics ER 2 は、Google の Gemini API 経由でアクセスされる専門的なロボティクスモデルであり、汎用 LLM ではありません。したがって、一般的なモデルルーターがホストするようなものではありません。ロボットを取り巻くアプリケーションの汎用言語・マルチモーダル部分(自然言語インターフェース、推論、オーケストレーション、分析)には、ベンダーニュートラルなエンドポイントを利用することで選択肢が広がります: a href="https://www.orcarouter.ai/">OrcaRouter/a> は、多数のテキスト・マルチモーダル LLM(Google の汎用 Gemini モデルを含む)に対して、OpenAI 互換の単一エンドポイントを提供します。一方、ER 2 の身体制御は Google の専用ロボティクス API を通じて実行されます。この分離は自然です。身体性には専門のロボット脳を、それ以外のすべてにはベンダーニュートラルなエンドポイントを使用してください。
制限事項と注意事項
「ER 2」は推論/計画レイヤーであり、ターンキーロボットではありません。プランを物理的に実行するには、アクションシステム(GoogleのVLA/オンデバイスモデル。パートナー限定ですが、自前のものを含む)が依然として必要です。これはクローズドプレビューであるため、利用可能性や動作は変更される可能性があり、価格の詳細も公開されていません。ベンチマークと安全性に関する主張はベンダーによる報告であり、初期段階のものです。独立したロボティクス評価は未熟であり、実世界への展開(embodied deployment)には、ソフトウェアテストをはるかに超える現実世界の安全上の義務が伴います。プロトタイピング用の強力なプレビューとして扱い、完成された本番用コントローラとは見なさないでください。
よくある質問
Gemini Robotics ER 2とは何ですか?
Google DeepMindの身体化推論ビジョン言語モデル — ロボットの高水準の知覚・計画を担うブレイン — は、2026年7月30日にパブリックプレビューとして公開され、リアルタイムストリーミング版も提供された。
ER 2はロボットモーターを直接制御しますか?
いいえ。ER 2 は推論/計画層です。直接的なモーター制御は、別個の視覚-言語-行動 (VLA) モデルとオンデバイスモデルによって処理されており、現在は初期パートナーに限定されています。
ER 2 は何ができますか?
動画理解とモーメント位置特定、空間推論、マルチステップのツールオーケストレーション、進捗分類、マルチロボット協調、自己修正、およびリアルタイムインタラクション(ストリーミング版)。
ER 2はER 1.6とどう違いますか?
グーグルは、より優れたマルチロボット連携と進捗追跡、より強力なツールオーケストレーション、そして安全性の向上(ASIMOV2安全ベンチマークでの進歩を含む)を報告しており、ER 2をこれまでで最も安全なロボットモデルとして位置づけている。
Gemini Robotics ER 2 にはどうやってアクセスすればいいですか?
Gemini API(code>gemini-robotics-er-2-preview/code>、code>gemini-robotics-er-2-streaming-preview/code>)および Google AI Studio を通じて、限定公開プレビューとして提供されます。料金は標準の Gemini API 課金に従います。
ER 2 は実際のロボットにとって安全ですか?
Googleはこれを、安全性制約の順守と人間への近接性において最も安全なロボティクスモデルとして位置づけていますが、具現化された展開には現実世界での安全上の義務が伴います。安全性に関する主張は初期段階として扱い、厳密に検証してください。
結論
Gemini Robotics ER 2 は、具現化AIにとって大きな一歩です。安全性に焦点を当てた推論ブレインであり、ロボットがビデオを理解し、空間と時間について推論し、数分単位のタスクを計画し、他のロボットと連携し、ストリーミング版を介してリアルタイムで対話することを可能にします。これはモーターコントローラーではなくプランニング層であり、ベンダー報告のベンチマークによる初期のクローズドプレビューですが、ER 1.6 と比較した連携、進捗追跡、安全性の向上は意義深いものです。具現化用の Gemini API を通じてプロトタイプを作成し、スタックの一般的な言語/マルチモーダル部分は OrcaRouter のようなエンドポイントを通じてベンダーニュートラルに保ってください。
