Présentation de Gemini Robotics ER 2

30 Jul, 2026

|

Gemini Robotics ER 2 représente un changement radical dans la capacité des robots à comprendre la vidéo, à orchestrer les tâches et à collaborer entre plusieurs robots, leur permettant ainsi d'être plus utiles dans le monde physique.


Steven Hansen

Senior Staff Software Engineer

Peng Xu

Staff Software Engineer


Deux robots : Duo et Apollo

Pour que les robots puissent aider les humains au quotidien, un raisonnement spatial précis ne suffit pas. Ils doivent aussi être capables de penser vite, de prendre des décisions et de raisonner au rythme du monde physique.

C'est pourquoi nous lançons aujourd'hui Gemini Robotics ER 2 , notre modèle de « raisonnement incarné » le plus performant pour la robotique. Imaginez Gemini Robotics ER 2 comme un cerveau de haut niveau pour les robots. Il leur permet de dialoguer avec les humains, de comprendre le monde physique et de planifier des tâches complexes. Il délègue ensuite l'exécution motrice à n'importe quel modèle vision-langage-action (VLA) de niveau inférieur. Gemini Robotics ER 2 peut aussi utiliser nativement des outils comme la Recherche Google pour trouver des informations, ou toute autre fonction définie par l’utilisateur. La conception de Gemini Robotics ER 2 permet au robot de prévoir les actions à venir tout en les exécutant.

Gemini Robotics ER 2 représente une avancée majeure par rapport à Gemini Robotics ER 1.6 . Grâce à la visualisation continue des flux vidéo, les robots peuvent maintenant suivre leur progression, s'adapter en cas d'imprévu et savoir précisément quand passer à l'étape suivante. Nous introduisons également la collaboration multi-robots, leur permettant de travailler ensemble dans des espaces partagés et de réaliser des tâches complexes qu'un seul robot ne pourrait accomplir.

Gemini Robotics ER 2 est maintenant disponible pour les développeurs via l' API Gemini et Google AI Studio , et en avant-première privée sur la plateforme Gemini Enterprise Agent. Pour vous aider à démarrer, nous proposons des exemples de configuration du modèle et d'utilisation pour réaliser des tâches d'IA physique plus utiles.

Amélioration des capacités physiques des agents

La plupart des tâches du monde physique sont complexes et nécessitent plusieurs étapes. Gemini Robotics ER 2 est un agent physique qui orchestre les actions du robot et lui permet de s'autocorriger et de s'adapter à des situations inédites. Pour créer une configuration d'agent, les développeurs peuvent déclarer des interfaces de contrôle de bas niveau — comme des modèles Vision-Langage-Action (VLA) ou des API de navigation — comme des outils, et diffuser directement des flux vidéo, audio ou textuels multimodaux dans le modèle.

Gemini Robotics ER 2 améliore ce flux de travail d'orchestration d'outils. Nous pouvons évaluer ses performances avec des robots en simulation, en utilisant le contrôle de robots réels, et même le coupler avec un opérateur humain contrôlant le robot à distance.

Gemini Robotics ER 2 surpasse constamment ER 1.6 en matière d'orchestration d'outils dans trois modes de contrôle : VLA réel, VLA simulé et téléopération humaine.

Tableau comparatif des performances des agents physiques Gemini Robotics ER 1.6 et Gemini Robotics ER 2

En robotique, le raisonnement de haut niveau dépend de la vitesse d'exécution. Gemini Robotics ER 2 s'intègre à l' API Gemini Live via un point de terminaison de flux bidirectionnel optimisé pour les tâches sensibles à la latence. Il en résulte une orchestration fluide : Gemini Robotics ER 2 pilote les modèles d'action et les API robotiques pour réaliser des tâches complexes sans les interruptions brusques dues aux temps de réflexion.

Pour illustrer cela, nous avons créé une démo avec Spot , un robot développé par notre partenaire Boston Dynamics . Nous utilisons Gemini Robotics ER 2 pour orchestrer les API de Spot , notamment la navigation et les mouvements des manipulateurs, afin de créer un robot interactif qui récupère des objets pour vous.

Le robot Spot de Boston Dynamics, équipé du système Gemini Robotics ER 2, va chercher du maïs soufflé sur commande vocale.

Le code est disponible sur GitHub avec d'autres exemples.

Exploiter l'intelligence temporelle pour une réalisation de tâches robuste

L'un des plus grands défis de la robotique est de savoir quand une tâche est terminée. Le robot Gemini Robotics ER 2 révolutionne la compréhension vidéo et le suivi de la progression pour vérifier que les tâches complexes — comme visser une ampoule ou fermer un sac-poubelle — sont réalisées conformément aux spécifications avant de passer à la suivante.

Dans cette mise à jour, nous avons progressé sur deux capacités fondamentales pour la compréhension de l'avancement des tâches : la classification de l'avancement et la détection des moments clés.

Classification des progrès continus

La classification de la progression fait référence à la capacité d'un robot à suivre la progression d'une tâche. Dans nos évaluations, nous attribuons à chaque image d'un flux vidéo cinq niveaux de progression (0-20 %, 20-40 %, 40-60 %, 60-80 %, 80-100 %). En quantifiant la progression de la tâche, Gemini Robotics ER 2 offre aux robots une perception situationnelle en temps réel et leur permet d'ajuster leurs actions instantanément ou de réessayer les étapes qui ont échoué sans avoir à redémarrer l'ensemble du processus.

Le robot Gemini Robotics ER 2 atteint une précision de 57,4 % sur les tâches de classification de progression, surpassant les modèles de la génération précédente et les modèles concurrents de pointe.

Tableau comparatif de la classification des progrès de différents robots

Détermination précise du moment

La détection de moments clés mesure la capacité d'un modèle à identifier l'image vidéo précise où se produit un événement critique (par exemple, le moment où il faut arrêter de verser du café dans une tasse). Le robot Gemini Robotics ER 2 réalise des gains de performance significatifs dans ce domaine, lui permettant de passer d'une tâche à l'autre avec précision, de vérifier leur réussite et de suggérer des corrections.

Pour les tâches de localisation de moments, le robot Gemini Robotics ER 2 atteint une précision de 91,3 % et une distance moyenne absolue de 0,96 s. Il rivalise avec des modèles beaucoup plus imposants, tout en offrant cette précision à un coût de calcul considérablement réduit et une vitesse d'exécution quatre fois supérieure — la latence inférieure à la seconde requise pour une utilisation sécuritaire des robots physiques dans le monde réel.

Graphique de la méthode des moments : précision en fonction de la distance

Collaboration multirobots

Aucun robot n'est universel : un rover à roues excelle à l'intérieur, tandis qu'un robot humanoïde est plus performant sur un terrain accidenté. Gemini Robotics 2 permet la collaboration entre plusieurs robots, permettant à des machines de natures diverses de communiquer grâce à une compréhension sémantique partagée afin de se relayer et d'accomplir des tâches complexes. Découvrez comment Gemini Robotics ER 2 permet aux robots Apollo 2 et Franka F3 Duo d' Apptronik de collaborer ici .

Améliorer l'intelligence spatiale générale

Gemini Robotics ER 2 fait progresser nos capacités fondamentales de raisonnement spatial, mesurées par trois critères de référence :

  • Détection de succès/d'échec : fonctionne désormais sur des flux vidéo bruts plutôt que sur des instantanés statiques afin de détecter les défaillances en cours d'exécution telles que les déversements, les glissements ou les désalignements.
  • Lecture générale des instruments : Compatible avec les cadrans circulaires, les voyants et les affichages numériques, les échelles linéaires, les règles et les thermomètres à liquide. Testée sur 10 types d'instruments différents.
  • VQA spatiale améliorée : améliore la réponse aux questions visuelles grâce aux progrès de Gemini en matière de compréhension multimodale.

Gemini Robotics ER 2 atteint systématiquement la plus haute précision dans toutes ses capacités principales, avec notamment la détection de succès (image/vidéo), la réponse aux questions (ERQA) et la lecture généralisée des instruments.

Comparaison des métriques ER de différents robots

Promouvoir la sécurité pour l'intelligence incarnée

Gemini Robotics ER 2 est notre modèle le plus sécuritaire, avec des gains significatifs sur les tests de suivi des consignes de sécurité et de proximité humaine. Ces tests évaluent la capacité d'un modèle à respecter les contraintes physiques lors de tâches de raisonnement et sa perception spatiale pour la détection des personnes. Nous avons constaté que Gemini Robotics ER 2 arrête avec succès un robot humanoïde lorsqu'une personne se trouve à proximité et reprend son travail de manière autonome une fois la zone dégagée. Afin d'améliorer la sécurité des agents physiques, nous introduisons un test qui évalue la capacité d'un modèle de base à agir comme un orchestrateur VLA sûr. Ce test évalue sa capacité à appliquer les contraintes de sécurité, à surveiller l'environnement, à évaluer la faisabilité physique et à solliciter la clarification humaine. Pour plus de détails, veuillez consulter notre rapport technique sur la sécurité .

Gemini Robotics ER 2 surpasse ER 1.6 et d'autres modèles de pointe sur les critères de suivi des instructions de sécurité et de proximité humaine.

Comparaison des performances de sécurité de différents robots

À l'avenir, nous prévoyons d'orienter ces modèles vers des tâches encore plus complexes afin d'accélérer le développement de robots utiles et de soutenir la communauté robotique.

Get the latest news from Google in your inbox

Sign up for our newsletters with product updates, event information, special offers, and more.

Your information will be used in accordance with Google's privacy policy. You may opt out at any time.