Gemini Robotics ER 2

Jul 30, 2026

|

Gemini Robotics ER 2 representa un cambio radical en la forma en que otorga comprensión de vídeo, orquestación de tareas y colaboración entre múltiples robots, lo que permite que sean más útiles en el mundo físico.


Steven Hansen

Senior Staff Software Engineer

Peng Xu

Staff Software Engineer


Dos robots: Duo y Apollo

Para que los robots puedan ayudar a los humanos en entornos cotidianos, un razonamiento espacial preciso no es suficiente. Los robots también deben pensar con rapidez, adaptando sus decisiones y razonamientos a la velocidad del mundo físico en tiempo real.

Por eso, hoy lanzamos Gemini Robotics ER 2 , nuestro modelo de razonamiento integrado más avanzado para robótica. Gemini Robotics ER 2 funciona como un cerebro de alto nivel para robots. Permite que los robots interactúen con humanos, comprendan el mundo físico y planifiquen tareas complejas. Posteriormente, delega la ejecución motora a cualquier modelo de visión, lenguaje y acción (VLA) de nivel inferior. Gemini Robotics ER 2 también puede acceder de forma nativa a herramientas como la Búsqueda de Google para encontrar información o cualquier otra función definida por el Gemini . Su diseño permite que el robot anticipe las acciones futuras mientras las ejecuta simultáneamente.

Gemini Robotics ER 2 representa una mejora significativa con respecto a Gemini Robotics ER 1.6 . Gracias a la monitorización continua de la señal de vídeo, los robots ahora pueden supervisar su propio progreso, adaptarse si surge algún problema y saber con precisión cuándo pasar al siguiente paso. Además, introducimos la colaboración entre múltiples robots, lo que les permite trabajar juntos en espacios compartidos y completar flujos de trabajo complejos que un solo robot no podría realizar.

Gemini Robotics ER 2 ya está disponible para desarrolladores a través de la API de Gemini , Google AI Studio y en versión preliminar privada en Gemini Enterprise Agent Platform . Para ayudarte a empezar, compartimos ejemplos de cómo configurar el modelo y cómo usarlo para realizar tareas de IA física más útiles.

Avances en las capacidades de los agentes físicos

La mayoría de las tareas en el mundo físico son complejas y requieren varios pasos para completarse. Gemini Robotics ER 2 es un agente físico que coordina los pasos del robot, permitiéndole autocorregirse y generalizar a situaciones más novedosas. Para crear una configuración de agente, los desarrolladores pueden declarar interfaces de control de bajo nivel —como modelos de Visión-Lenguaje-Acción (VLA) o API de navegación— como herramientas, y transmitir vídeo, audio o texto multimodal directamente al modelo.

Gemini Robotics ER 2 mejora este flujo de trabajo de orquestación de herramientas. Podemos evaluar su rendimiento con robots en simulación, utilizando el control de robots en el mundo real, e incluso combinarlo con un humano que controle el robot de forma remota.

Gemini Robotics ER 2 supera sistemáticamente a ER 1.6 en la orquestación de herramientas en tres modos de control: VLA real, VLA simulado y teleoperación humana.

Gráfico que compara el rendimiento de los agentes físicos de Gemini Robotics ER 1.6 y Gemini Robotics ER 2.

En robótica, el razonamiento de alto nivel depende de la velocidad de ejecución. Gemini Robotics ER 2 se integra con la API de Gemini Live , utilizando un punto final de transmisión bidireccional optimizado para tareas sensibles a la latencia. El resultado es una orquestación fluida: Gemini Robotics ER 2 ordena a los modelos de acción y a las API de robótica que completen tareas de varios pasos sin las molestas pausas de "parar y pensar".

Para ilustrar esto, hemos creado una demostración con Spot, de nuestros socios de Boston Dynamics . Utilizamos Gemini Robotics ER 2 para coordinar las API de Spot , como la navegación y el movimiento del manipulador, creando un robot interactivo que recoge objetos.

El robot Boston Dynamic Spot, impulsado por Gemini Robotics ER 2, trae un snack de palomitas de maíz siguiendo una orden en lenguaje natural.

El código está disponible en Github junto con otros ejemplos.

Desbloquear la inteligencia temporal para una sólida finalización de tareas

Uno de los mayores desafíos de la robótica es saber cuándo se ha completado una tarea. Gemini Robotics ER 2 supone un avance significativo en la comprensión del vídeo y el seguimiento del progreso para verificar que tareas complejas, como apretar una bombilla o atar una bolsa de basura, se hayan completado según las especificaciones antes de pasar a la siguiente tarea.

En esta actualización, hemos avanzado en dos capacidades fundamentales para comprender el progreso de las tareas: la clasificación del progreso y la detección de momentos clave.

Clasificación de progreso continuo

La clasificación del progreso se refiere a la capacidad de un robot para monitorizar el avance hacia la finalización de una tarea. En nuestras evaluaciones, asignamos cada fotograma de una transmisión de vídeo a cinco niveles de progreso (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Al cuantificar el progreso de la tarea, Gemini Robotics ER 2 proporciona a los robots información situacional en tiempo real y les permite ajustar acciones sobre la marcha o reintentar pasos fallidos sin reiniciar todo el flujo de trabajo.

El Gemini Robotics ER 2 logra una precisión del 57,4 % en las tareas de clasificación de progreso, superando a los modelos de la generación anterior y a los modelos de vanguardia de la competencia.

Gráfico que compara la clasificación del progreso de diferentes robots

Detección precisa de momentos

La detección de momentos clave mide la capacidad de un modelo para identificar el fotograma exacto del vídeo donde ocurre un evento crítico (por ejemplo, cuándo dejar de servir café en una taza). Gemini Robotics ER 2 logra mejoras significativas en el rendimiento de la detección de momentos clave, lo que permite a los robots cambiar con precisión entre tareas, verificar el éxito y sugerir correcciones.

Para tareas de detección de momentos, Gemini Robotics ER 2 alcanza una precisión del 91,3 % y una distancia absoluta media de 0,96 s. Compite de cerca con modelos de categorías mucho más grandes, pero ofrece esta precisión con un coste computacional mucho menor y una velocidad de ejecución cuatro veces superior: la latencia inferior a un segundo necesaria para operar robots físicos de forma segura en el mundo real.

Gráfico de determinación de momentos: precisión vs distancia

Colaboración entre múltiples robots

Ningún robot es apto para todas las tareas: un robot con ruedas destaca en interiores, mientras que un robot humanoide sobresale en terrenos irregulares. Gemini Robotics 2 permite la colaboración entre múltiples robots, facilitando la comunicación entre máquinas diversas mediante un entendimiento semántico compartido para transferir y completar tareas complejas. Descubra cómo Gemini Robotics ER 2 permite la colaboración entre Apollo 2 de Apptronik y Franka F3 Duo aquí .

Mejorar la inteligencia espacial general

Gemini Robotics ER 2 mejora nuestra capacidad central de razonamiento espacial, medida mediante tres parámetros de referencia:

  • Detección de éxito/fracaso: Ahora funciona con transmisiones de vídeo sin procesar en lugar de instantáneas estáticas para detectar fallos durante la ejecución, como derrames, deslizamientos o desalineaciones.
  • Lectura general de instrumentos: Va más allá de los diales circulares y los visores, e incluye pantallas digitales, escalas lineales, reglas y termómetros líquidos. Lo probamos con 10 tipos diferentes de instrumentos.
  • Respuesta visual a preguntas espacial mejorada: Mejora la respuesta visual a preguntas gracias a los avances de Gemini en la comprensión multimodal.

El Gemini Robotics ER 2 logra sistemáticamente la máxima precisión en todas sus funciones principales, entre las que destacan la detección de éxito (imagen/vídeo), la respuesta a preguntas (ERQA) y la lectura generalizada de instrumentos.

Comparación de las métricas ER de diferentes robots

Promover la seguridad para la inteligencia encarnada

Gemini Robotics ER 2 es nuestro modelo más seguro, logrando mejoras significativas en los puntos de referencia de Seguimiento de Instrucciones de Seguridad y Proximidad Humana, que evalúan cómo un modelo se adhiere a las restricciones físicas durante las tareas de razonamiento y la conciencia espacial para detectar personas. Descubrimos que Gemini Robotics ER 2 detiene con éxito un robot humanoide cuando hay una persona cerca y reanuda el trabajo de forma autónoma solo cuando el área está despejada. Para mejorar la seguridad de los agentes físicos, estamos introduciendo un punto de referencia que evalúa la capacidad de un modelo base para actuar como un orquestador VLA seguro al probar su capacidad para hacer cumplir las restricciones de seguridad, monitorear el entorno, evaluar la viabilidad física y buscar aclaraciones humanas. Para obtener más detalles, consulte nuestro informe técnico de seguridad .

El robot Gemini Robotics ER 2 supera al ER 1.6 y a otros modelos de vanguardia en las pruebas comparativas de seguimiento de instrucciones de seguridad y proximidad humana.

Comparación del rendimiento de seguridad de diferentes robots

De cara al futuro, nuestros planes consisten en llevar estos modelos hacia tareas aún más complejas para acelerar el desarrollo de robots útiles y apoyar a la comunidad robótica.

Get the latest news from Google in your inbox

Sign up for our newsletters with product updates, event information, special offers, and more.

Your information will be used in accordance with Google's privacy policy. You may opt out at any time.