
Gemini Robotics ER 2: il cervello robotico con ragionamento incarnato di Google DeepMind, spiegato
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 206 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUOVOAnthropic: Claude Opus 52026-07-2461Intelligenza78Codice
- googleNUOVOGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleNUOVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligenza77Codice
di Google DeepMindGemini Robotics ER 2 — rilasciato in anteprima pubblica il 30 luglio 2026 — è un modello visione-linguaggio specializzato, progettato per essere il "cervello" di alto livello di un robot. "ER" sta per Embodied Reasoning: piuttosto che azionare direttamente i motori, ER 2 vede e comprende il mondo fisico, ragiona in termini di spazio e tempo, pianifica attività multi-step, orchestra strumenti e coordina robot. Include anche una variante di streaming in tempo reale per il controllo interattivo a bassa latenza. Questa guida spiega cos'è ER 2, in cosa si differenzia da un modello a controllo diretto, cosa c'è di nuovo rispetto a ER 1.6 e dove si colloca — con le capacità documentate.
Nota sull'accuratezza: le affermazioni su capacità, disponibilità e sicurezza provengono dall'annuncio di Google DeepMind e dal changelog dell'API Gemini (2026-07-30). I benchmark di robotica sono preliminari e riportati dai fornitori; i prezzi seguono la fatturazione standard dell'API Gemini e i dettagli specifici non sono stati pubblicati. I dettagli possono cambiare — verifica prima di procedere.
TL;DR. Gemini Robotics ER 2 è un VLM di ragionamento embodied che funge da cervello di pianificazione e percezione per i robot: comprensione video, ragionamento spaziale, orchestrazione multi-step di strumenti, localizzazione di momenti video, monitoraggio dei progressi, coordinamento multi-robot e autocorrezione, con una variante streaming per l'interazione audio-video bidirezionale in tempo reale. È disponibile nell'API Gemini (code>gemini-robotics-er-2-preview/code> e code>gemini-robotics-er-2-streaming-preview/code>) e Google AI Studio, in anteprima chiusa. Google lo presenta come il suo modello di robotica più sicuro finora, con miglioramenti notevoli rispetto a ER 1.6 nel coordinamento multi-robot e nel monitoraggio dei progressi. È un livello di ragionamento, non un controllore di attuatori di basso livello.
Punti chiave
Ragionamento Incarnato (ER): ER 2 è il cervello di alto livello per percezione e pianificazione, non un controllore motorio diretto (è invece la linea separata VLA/su dispositivo).
• Competenze principali: comprensione video, ragionamento spaziale, orchestrazione di strumenti multi-step, localizzazione di momenti video, classificazione del progresso, coordinamento multi-robot, autocorrezione.
• Variante streaming: code>gemini-robotics-er-2-streaming-preview/code> aggiunge un'interazione audio-video bidirezionale a bassa latenza per il controllo e il dialogo in tempo reale.
• Sicurezza al primo posto: Google posiziona ER 2 come il suo modello robotico più sicuro per quanto riguarda l'aderenza ai vincoli di sicurezza e la prossimità umana, con miglioramenti nel benchmark ASIMOV2.
• Disponibilità: Gemini API + Google AI Studio (anteprima pubblica); Enterprise Agent Platform in anteprima privata; modelli VLA/on-device limitati ai primi partner. Chiuso.
Cosa significa "Embodied Reasoning".
Gli stack della robotica moderna si suddividono sempre più in due livelli. Un cervello di ragionamento di alto livello comprende la scena, decide cosa fare e pianifica; un modello di azione di basso livello traduce i piani in comandi motori precisi. Gemini Robotics ER 2 è il primo livello: un modello visione-linguaggio con ragionamento incarnato. Elabora video (e audio e testo), costruisce una comprensione di oggetti, spazio e progresso nel tempo, e produce piani e chiamate a strumenti — inclusa l'invocazione di strumenti esterni come Google Search — che un sistema di azione separato o un essere umano possono eseguire. In altre parole, ER 2 è la parte del robot che pensa, non quella che si muove; i modelli visione-linguaggio-azione (VLA) a controllo diretto e on-device di Google sono una linea separata, attualmente limitata a partner iniziali.

Cosa può fare ER 2
Google descrive un ampio insieme di capacità di ragionamento incarnato. ER 2 è in grado di comprendere video e individuare momenti specifici al loro interno ("quando è caduta la tazza?"), ragionare sullo spazio 3D e sulle relazioni tra oggetti, classificare lo stato di avanzamento di un'attività (il passaggio è completato, parziale o fallito?) e orchestrare l'uso di strumenti multi-step per raggiungere un obiettivo. Può sostenere un dialogo con una persona e pianificare attività che si estendono su diversi minuti, autocorreggersi quando qualcosa va storto e — in particolare — coordinare più robot che lavorano insieme. Queste sono esattamente le capacità di cui un robot ha bisogno per operare in ambienti reali e disordinati, piuttosto che in demo scriptate.
La variante streaming: interazione in tempo reale
Accanto all'anteprima standard, Google ha rilasciato code>gemini-robotics-er-2-streaming-preview/code>, ottimizzato per audio-video bidirezionale a bassa latenza. Questo è importante per l'uso embodied: un robot deve percepire, ragionare e rispondere in modo continuo, non in lente sequenze richiesta-risposta. Il modello streaming consente un'interazione in tempo reale — guardare un feed dal vivo, parlare con una persona e adattare un piano al volo — che è essenziale per assistenti interattivi, supporto alla teleoperazione e attività dinamiche multi-step.
Novità rispetto a ER 1.6
ER 2 rappresenta un chiaro passo avanti rispetto a Gemini Robotics ER 1.6. Google evidenzia una nettamente migliore coordinazione multi-robot e il monitoraggio dell'avanzamento delle attività, una più forte orchestrazione degli strumenti in più passaggi e un comportamento di sicurezza migliorato. Sul fronte specifico della sicurezza, Google presenta ER 2 come il suo modello di robotica più sicuro finora, citando una migliore aderenza ai vincoli di sicurezza e al comportamento in prossimità degli esseri umani, oltre ai progressi nel benchmark di sicurezza ASIMOV2. Per i team che realizzano implementazioni reali, i miglioramenti in termini di coordinazione, monitoraggio dell'avanzamento e sicurezza sono gli aggiornamenti più significativi.
Sicurezza e valutazione
La sicurezza è centrale per il posizionamento di ER 2. Google riferisce che ER 2 è leader nell'aderenza ai vincoli di sicurezza e nella corrispondenza del suo comportamento al giudizio umano sicuro intorno alle persone, con punteggi migliorati su ASIMOV2 (un benchmark di robotica incentrato sulla sicurezza). Poiché la robotica agisce nel mondo fisico, queste proprietà di sicurezza contano molto più che per un chatbot — un errore di pianificazione può causare danni reali. Come per qualsiasi benchmark di un venditore, considerate i dettagli come preliminari e indicativi; la valutazione indipendente della robotica è ancora in fase di maturazione.

Disponibilità e prezzi
ER 2 è disponibile in anteprima pubblica tramite l'API Gemini — ID dei modelli code>gemini-robotics-er-2-preview/code> e code>gemini-robotics-er-2-streaming-preview/code> — e in Google AI Studio. Un'integrazione con Enterprise Agent Platform è in anteprima privata, mentre i modelli VLA a controllo diretto e i modelli on-device rimangono limitati ai primi partner. L'accesso è chiuso. I prezzi seguono la fatturazione standard dell'API Gemini; Google non ha pubblicato tariffe specifiche per la robotica al lancio. Verifica l'accesso e i costi attuali nella documentazione dell'API Gemini.
Tre scenari in cui ER 2 si adatta
1. Robot per magazzino e logistica
Ragionamento spaziale, monitoraggio dei progressi e coordinamento multi-robot si adattano a compiti di prelievo e posizionamento, smistamento e gestione di flotte, in cui i robot devono comprendere le scene e cooperare.
2. Robot assistenti interattivi
L'interazione audio-video in tempo reale della variante streaming consente ai robot di guardare, ascoltare, conversare e pianificare attività di più minuti con una persona.
3. Ispezione e monitoraggio
La comprensione video e la localizzazione dei momenti rendono ER 2 utile per analizzare feed live o registrati — individuando eventi, classificando stati e segnalando progressi o errori.
Come si integra in uno stack AI più ampio.
Gemini Robotics ER 2 è un modello robotico specializzato a cui si accede tramite l'API Gemini di Google, non un LLM generico — quindi non è qualcosa che un router di modelli generali ospita. Per le parti linguistiche e multimodali di uso generale di un'applicazione attorno a un robot — interfacce in linguaggio naturale, ragionamento, orchestrazione, analisi — un endpoint neutrale rispetto al fornitore ti mantiene aperte le opzioni: a href="https://www.orcarouter.ai/">OrcaRouter/a> fornisce un endpoint compatibile con OpenAI su molti LLM testuali e multimodali (inclusi i modelli Gemini generali di Google), mentre il controllo embodied di ER 2 passa attraverso l'API robotica dedicata di Google. Questa separazione è naturale: usa il cervello robotico specializzato per l'embodiment e un endpoint neutrale rispetto al fornitore per tutto il resto.
Limitazioni e avvertenze
ER 2 è un livello di ragionamento/pianificazione, non un robot chiavi in mano — serve comunque un sistema di azione (i modelli VLA/on-device di Google, limitati ai partner, o uno proprio) per eseguire fisicamente i piani. È un'anteprima chiusa, quindi disponibilità e comportamento potrebbero cambiare, e i dettagli sui prezzi non sono pubblicati. Le sue affermazioni su benchmark e sicurezza sono dichiarate dal fornitore e preliminari; la valutazione indipendente della robotica è ancora immatura. Inoltre, l'implementazione embodied comporta obblighi di sicurezza nel mondo reale che vanno ben oltre i test software. Trattalo come un'anteprima potente con cui prototipare, non come un controller di produzione finito.
Domande frequenti
Che cos'è Gemini Robotics ER 2?
Il modello visione-linguaggio con ragionamento incarnato di Google DeepMind — il cervello di alto livello per percezione e pianificazione di un robot — rilasciato in anteprima pubblica il 30 luglio 2026, con una variante in streaming in tempo reale.
ER 2 controlla direttamente i motori del robot?
No. ER 2 è il livello di ragionamento/pianificazione; il controllo motorio diretto è gestito da modelli separati visione-linguaggio-azione (VLA) e on-device, attualmente limitati a partner iniziali.
Cosa può fare ER 2?
Comprensione video e localizzazione dei momenti, ragionamento spaziale, orchestrazione di strumenti in più fasi, classificazione dei progressi, coordinamento multi-robot, auto-correzione e interazione in tempo reale (variante streaming).
Che differenza c'è tra ER 2 e ER 1.6?
Google riporta una migliore coordinazione multi-robot e un migliore monitoraggio dei progressi, una più solida orchestrazione degli strumenti e una sicurezza migliorata — inclusi progressi sul benchmark di sicurezza ASIMOV2 — posizionando ER 2 come il suo modello robotico più sicuro finora.
Come posso accedere a Gemini Robotics ER 2?
Tramite l'API Gemini (code>gemini-robotics-er-2-preview/code>, code>gemini-robotics-er-2-streaming-preview/code>) e Google AI Studio, come anteprima pubblica chiusa. I prezzi seguono la fatturazione standard dell'API Gemini.
ER 2 è sicuro per robot reali?
Google lo posiziona come il suo modello robotico più sicuro per quanto riguarda l'aderenza ai vincoli di sicurezza e la prossimità umana, ma l'implementazione embodied comporta obblighi di sicurezza nel mondo reale; trattate le affermazioni sulla sicurezza come preliminari e validatele rigorosamente.
Il risultato finale
Gemini Robotics ER 2 è un passo importante per l'IA embodied: un cervello di ragionamento incentrato sulla sicurezza che consente ai robot di comprendere video, ragionare su spazio e tempo, pianificare attività di più minuti, coordinarsi con altri robot e interagire in tempo reale tramite la sua variante in streaming. È un livello di pianificazione, non un controller motorio, ed è un'anteprima chiusa iniziale con benchmark forniti dal fornitore — ma i miglioramenti in termini di coordinamento, monitoraggio dei progressi e sicurezza rispetto a ER 1.6 sono significativi. Prototipa con esso tramite l'API Gemini per l'embodiment e mantieni le parti linguistiche/multimodali generali del tuo stack indipendenti dal fornitore tramite un endpoint come OrcaRouter.
