
Gemini Robotics ER 2: Otak Robot dengan Penalaran Berwujud Google DeepMind, Dijelaskan
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 206 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleBARUGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleBARUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Kecerdasan61Koding61Matematika
- anthropicAnthropic: Claude Fable 52026-06-0960Kecerdasan77Koding
dari Google DeepMindGemini Robotics ER 2 — dirilis dalam pratinjau publik pada 30 Juli 2026 — adalah model visi-bahasa khusus yang dirancang untuk menjadi "otak" tingkat tinggi dari sebuah robot. "ER" adalah singkatan dari Embodied Reasoning: alih-alih menggerakkan motor secara langsung, ER 2 melihat dan memahami dunia fisik, bernalar tentang ruang dan waktu, merencanakan tugas multi-langkah, mengorkestrasi alat, dan mengoordinasikan robot. Model ini juga dilengkapi dengan varian streaming real-time untuk kontrol interaktif berlatensi rendah. Panduan ini menjelaskan apa itu ER 2, bagaimana perbedaannya dengan model kontrol langsung, apa yang baru dibandingkan ER 1.6, dan di mana posisinya — dengan kemampuan yang bersumber.
Catatan akurasi: klaim kemampuan, ketersediaan, dan keamanan berasal dari pengumuman Google DeepMind dan log perubahan Gemini API (2026-07-30). Tolok ukur robotika masih tahap awal dan dilaporkan oleh vendor; harga mengikuti penagihan standar Gemini API dan detail spesifiknya tidak dipublikasikan. Detail dapat berubah — verifikasi sebelum membangun.
TL;DR. Gemini Robotics ER 2 adalah VLM dengan penalaran berwujud yang berperan sebagai otak perencana dan persepsi robot: pemahaman video, penalaran spasial, orkestrasi alat multi-langkah, lokalisasi momen video, pelacakan progres, koordinasi multi-robot, dan koreksi diri, dengan varian streaming untuk interaksi audio-video dua arah secara real-time. Model ini tersedia di Gemini API (code>gemini-robotics-er-2-preview/code> dan code>gemini-robotics-er-2-streaming-preview/code>) dan Google AI Studio, sebagai pratinjau tertutup. Google memposisikannya sebagai model robotika teraman mereka sejauh ini, dengan peningkatan signifikan dibanding ER 1.6 dalam koordinasi multi-robot dan pelacakan progres. Ini adalah lapisan penalaran, bukan pengontrol aktuator tingkat rendah.
Poin-poin penting
• Penalaran Berwujud (ER): ER 2 adalah otak persepsi-dan-perencanaan tingkat tinggi, bukan pengontrol motorik langsung (itu adalah lini VLA/pada-perangkat yang terpisah).
• Keterampilan inti: pemahaman video, penalaran spasial, orkestrasi alat multi-langkah, lokalisasi momen video, klasifikasi kemajuan, koordinasi multi-robot, koreksi diri.
• Varian streaming: code>gemini-robotics-er-2-streaming-preview/code> menambahkan interaksi audio-video dua arah dengan latensi rendah untuk kontrol dan dialog real-time.
• Mengutamakan keselamatan: Google memposisikan ER 2 sebagai model robotika paling aman dalam hal kepatuhan terhadap kendala keselamatan dan kedekatan dengan manusia, dengan peningkatan tolok ukur ASIMOV2.
• Ketersediaan: Gemini API + Google AI Studio (pratinjau publik); Enterprise Agent Platform dalam pratinjau privat; model VLA/on-device terbatas untuk mitra awal. Tertutup.
Apa arti "Penalaran Berwujud"?
Tumpukan robotika modern semakin terbagi menjadi dua lapisan. Otak penalaran tingkat tinggi memahami pemandangan, memutuskan apa yang harus dilakukan, dan menyusun rencana; model tindakan tingkat rendah menerjemahkan rencana menjadi perintah motorik yang presisi. Gemini Robotics ER 2 adalah lapisan pertama: model visi-bahasa dengan penalaran berwujud (embodied reasoning). Model ini menerima video (serta audio dan teks), membangun pemahaman tentang objek, ruang, dan perkembangan dari waktu ke waktu, lalu mengeluarkan rencana dan panggilan alat — termasuk memanggil alat eksternal seperti Google Search — yang dapat dieksekusi oleh sistem tindakan terpisah atau manusia. Dengan kata lain, ER 2 adalah bagian robot yang berpikir, bukan bagian yang bergerak; model visi-bahasa-tindakan (VLA) kendali langsung dan model on-device milik Google adalah lini terpisah, yang saat ini terbatas pada mitra awal.

Apa yang dapat dilakukan ER 2
Google mendeskripsikan seperangkat keterampilan penalaran berwujud yang luas. ER 2 dapat memahami video dan menemukan momen-momen spesifik di dalamnya ("kapan cangkirnya jatuh?"), menalar tentang ruang 3D dan hubungan antarobjek, mengklasifikasikan progres tugas (apakah langkahnya selesai, sebagian, atau gagal?), dan mengorkestrasi penggunaan alat multi-langkah untuk mencapai tujuan. Ia dapat berdialog dengan seseorang dan merencanakan tugas yang berlangsung beberapa menit, mengoreksi diri saat terjadi kesalahan, dan — yang penting — mengoordinasikan banyak robot untuk bekerja sama. Inilah tepatnya kemampuan yang dibutuhkan robot untuk beroperasi di lingkungan nyata yang berantakan, bukan demo yang telah diprogram.
Varian streaming: interaksi waktu nyata
Selain pratinjau standar, Google merilis code>gemini-robotics-er-2-streaming-preview/code>, yang dioptimalkan untuk audio-video dua arah dengan latensi rendah. Ini penting untuk penggunaan embodied: robot perlu mempersepsi, menalar, dan merespons secara terus-menerus, bukan dalam siklus permintaan-respons yang lambat. Model streaming memungkinkan interaksi real-time — mengamati umpan langsung, berbicara dengan seseorang, dan menyesuaikan rencana saat itu juga — yang sangat penting untuk asisten interaktif, dukungan teleoperasi, dan tugas multi-langkah yang dinamis.
Apa yang baru dibandingkan dengan ER 1.6
ER 2 merupakan peningkatan yang jelas dari Gemini Robotics ER 1.6. Google menyoroti koordinasi multi-robot dan pelacakan kemajuan tugas yang jauh lebih baik, orkestrasi alat multi-langkah yang lebih kuat, serta perilaku keselamatan yang lebih baik. Secara khusus di sisi keselamatan, Google memposisikan ER 2 sebagai model robotika paling aman yang pernah ada, dengan mengutip peningkatan kepatuhan terhadap batasan keselamatan dan perilaku jarak dekat dengan manusia, serta peningkatan pada tolok ukur keselamatan ASIMOV2. Bagi tim yang membangun penerapan nyata, peningkatan koordinasi, pelacakan kemajuan, dan keselamatan adalah peningkatan yang paling signifikan.
Keamanan dan Evaluasi
Keselamatan adalah inti dari posisi ER 2. Google melaporkan bahwa ia unggul dalam kepatuhan terhadap batasan keselamatan dan dalam seberapa dekat perilakunya dengan penilaian manusia yang aman di sekitar orang, dengan skor yang lebih baik pada ASIMOV2 (sebuah tolok ukur robotika yang berorientasi keselamatan). Karena robotika bertindak di dunia fisik, properti keselamatan ini jauh lebih penting dibandingkan untuk chatbot — kesalahan perencanaan dapat menyebabkan bahaya nyata. Seperti halnya tolok ukur dari vendor mana pun, perlakukan spesifikasinya sebagai awal dan indikatif; evaluasi robotika independen masih berkembang.

Ketersediaan dan harga
ER 2 tersedia dalam pratinjau publik melalui Gemini API — ID model code>gemini-robotics-er-2-preview/code> dan code>gemini-robotics-er-2-streaming-preview/code> — dan di Google AI Studio. Integrasi Enterprise Agent Platform sedang dalam pratinjau privat, dan model VLA kendali langsung serta model on-device tetap terbatas untuk mitra awal. Ini tertutup. Harga mengikuti penagihan standar Gemini API; Google tidak menerbitkan tarif khusus robotika saat peluncuran. Konfirmasi akses dan biaya saat ini di dokumentasi Gemini API.
Tiga skenario yang cocok untuk ER 2
1. Robot gudang dan logistik
Penalaran spasial, pelacakan kemajuan, dan koordinasi multi-robot cocok untuk tugas pick-and-place, pemilahan, dan armada di mana robot harus memahami situasi dan bekerja sama.
2. Robot asisten interaktif
Interaksi audio-video real-time dari varian streaming memungkinkan robot untuk melihat, mendengarkan, berbicara, dan merencanakan tugas multi-menit dengan seseorang.
3. Inspeksi dan pemantauan
Pemahaman video dan lokalisasi momen membuat ER 2 berguna untuk menganalisis umpan langsung atau rekaman — mendeteksi peristiwa, mengklasifikasikan status, dan menandai kemajuan atau kegagalan.
Bagaimana ia cocok dalam stack AI yang lebih luas
Gemini Robotics ER 2 adalah model robotika khusus yang diakses melalui API Gemini Google, bukan LLM tujuan umum — jadi bukan sesuatu yang dihosting oleh router model umum. Untuk bagian bahasa tujuan umum dan multimodal dari aplikasi di sekitar robot — antarmuka bahasa alami, penalaran, orkestrasi, analitik — endpoint netral vendor menjaga opsi Anda tetap terbuka: a href="https://www.orcarouter.ai/">OrcaRouter/a> menyediakan satu endpoint yang kompatibel dengan OpenAI di berbagai LLM teks dan multimodal (termasuk model Gemini umum Google), sedangkan kontrol embodiment ER 2 berjalan melalui API robotika khusus Google. Pemisahan itu wajar: gunakan otak robot khusus untuk embodiment, dan endpoint netral vendor untuk yang lainnya.
Keterbatasan dan peringatan
ER 2 adalah lapisan penalaran/perencanaan, bukan robot siap pakai — Anda tetap memerlukan sistem aksi (model VLA/on-device milik Google, yang terbatas bagi mitra, atau sistem Anda sendiri) untuk mengeksekusi rencana secara fisik. Ini adalah pratinjau tertutup, jadi ketersediaan dan perilakunya dapat berubah, dan rincian harga tidak dipublikasikan. Klaim tolok ukur dan keamanannya dilaporkan oleh vendor dan masih awal; evaluasi robotika independen belum matang. Selain itu, penerapan embodied membawa kewajiban keselamatan dunia nyata yang jauh melampaui pengujian perangkat lunak. Anggap saja sebagai pratinjau yang kuat untuk membuat prototipe, bukan pengontrol produksi yang sudah jadi.
FAQ
Apa itu Gemini Robotics ER 2?
Model bahasa-visi penalaran-berwujud Google DeepMind — otak persepsi-dan-perencanaan tingkat tinggi untuk robot — dirilis sebagai pratinjau publik pada 30 Juli 2026, dengan varian streaming waktu nyata.
Apakah ER 2 mengontrol motor robot secara langsung?
Tidak. ER 2 adalah lapisan penalaran/perencanaan; kontrol motorik langsung ditangani oleh model vision-language-action (VLA) terpisah dan model on-device, yang saat ini terbatas untuk mitra awal.
Apa yang bisa dilakukan ER 2?
Pemahaman video dan lokalisasi momen, penalaran spasial, orkestrasi alat multi-langkah, klasifikasi progres, koordinasi multi-robot, koreksi diri, dan interaksi waktu nyata (varian streaming).
Bagaimana ER 2 berbeda dari ER 1.6?
Google melaporkan koordinasi multi-robot dan pelacakan progres yang lebih baik, orkestrasi alat yang lebih kuat, serta keamanan yang ditingkatkan — termasuk peningkatan pada tolok ukur keamanan ASIMOV2 — menempatkan ER 2 sebagai model robotika paling aman yang pernah ada.
Bagaimana cara mengakses Gemini Robotics ER 2?
Melalui Gemini API (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) dan Google AI Studio, sebagai pratinjau publik tertutup. Harga mengikuti penagihan standar Gemini API.
Apakah ER 2 aman untuk robot sungguhan?
Google memposisikannya sebagai model robotika paling aman dalam hal kepatuhan batasan keselamatan dan kedekatan dengan manusia, tetapi penerapan dalam wujud fisik membawa kewajiban keselamatan dunia nyata; perlakukan klaim keselamatan sebagai hal yang masih awal dan validasi secara ketat.
Intinya
Gemini Robotics ER 2 adalah langkah besar untuk AI berwujud: otak penalaran yang berfokus pada keselamatan yang memungkinkan robot memahami video, menalar tentang ruang dan waktu, merencanakan tugas multi-menit, berkoordinasi dengan robot lain, dan berinteraksi secara real-time melalui varian streaming-nya. Ini adalah lapisan perencanaan, bukan pengontrol motor, dan ini merupakan pratinjau tertutup awal dengan tolok ukur yang dilaporkan vendor — tetapi peningkatan koordinasi, pelacakan kemajuan, dan keselamatan dibandingkan ER 1.6 sangat signifikan. Buat prototipe dengannya melalui Gemini API untuk perwujudan, dan pertahankan bagian bahasa umum/multimodal dari tumpukan Anda agar netral terhadap vendor melalui endpoint seperti OrcaRouter.
