Présentation de Gemini Robotics ER 2
Pour que les robots puissent aider les humains au quotidien, un raisonnement spatial précis ne suffit pas. Ils doivent aussi être capables de penser vite, de prendre des décisions et de raisonner au rythme du monde physique.
C'est pourquoi nous lançons aujourd'hui Gemini Robotics ER 2 , notre modèle de « raisonnement incarné » le plus performant pour la robotique. Imaginez Gemini Robotics ER 2 comme un cerveau de haut niveau pour les robots. Il leur permet de dialoguer avec les humains, de comprendre le monde physique et de planifier des tâches complexes. Il délègue ensuite l'exécution motrice à n'importe quel modèle vision-langage-action (VLA) de niveau inférieur. Gemini Robotics ER 2 peut aussi utiliser nativement des outils comme la Recherche Google pour trouver des informations, ou toute autre fonction définie par l’utilisateur. La conception de Gemini Robotics ER 2 permet au robot de prévoir les actions à venir tout en les exécutant.
Gemini Robotics ER 2 représente une avancée majeure par rapport à Gemini Robotics ER 1.6 . Grâce à la visualisation continue des flux vidéo, les robots peuvent maintenant suivre leur progression, s'adapter en cas d'imprévu et savoir précisément quand passer à l'étape suivante. Nous introduisons également la collaboration multi-robots, leur permettant de travailler ensemble dans des espaces partagés et de réaliser des tâches complexes qu'un seul robot ne pourrait accomplir.
Gemini Robotics ER 2 est maintenant disponible pour les développeurs via l' API Gemini et Google AI Studio , et en avant-première privée sur la plateforme Gemini Enterprise Agent. Pour vous aider à démarrer, nous proposons des exemples de configuration du modèle et d'utilisation pour réaliser des tâches d'IA physique plus utiles.
Amélioration des capacités physiques des agents
La plupart des tâches du monde physique sont complexes et nécessitent plusieurs étapes. Gemini Robotics ER 2 est un agent physique qui orchestre les actions du robot et lui permet de s'autocorriger et de s'adapter à des situations inédites. Pour créer une configuration d'agent, les développeurs peuvent déclarer des interfaces de contrôle de bas niveau — comme des modèles Vision-Langage-Action (VLA) ou des API de navigation — comme des outils, et diffuser directement des flux vidéo, audio ou textuels multimodaux dans le modèle.
Gemini Robotics ER 2 améliore ce flux de travail d'orchestration d'outils. Nous pouvons évaluer ses performances avec des robots en simulation, en utilisant le contrôle de robots réels, et même le coupler avec un opérateur humain contrôlant le robot à distance.
Gemini Robotics ER 2 surpasse constamment ER 1.6 en matière d'orchestration d'outils dans trois modes de contrôle : VLA réel, VLA simulé et téléopération humaine.
En robotique, le raisonnement de haut niveau dépend de la vitesse d'exécution. Gemini Robotics ER 2 s'intègre à l' API Gemini Live via un point de terminaison de flux bidirectionnel optimisé pour les tâches sensibles à la latence. Il en résulte une orchestration fluide : Gemini Robotics ER 2 pilote les modèles d'action et les API robotiques pour réaliser des tâches complexes sans les interruptions brusques dues aux temps de réflexion.
Pour illustrer cela, nous avons créé une démo avec Spot , un robot développé par notre partenaire Boston Dynamics . Nous utilisons Gemini Robotics ER 2 pour orchestrer les API de Spot , notamment la navigation et les mouvements des manipulateurs, afin de créer un robot interactif qui récupère des objets pour vous.
Le robot Spot de Boston Dynamics, équipé du système Gemini Robotics ER 2, va chercher du maïs soufflé sur commande vocale.
Le code est disponible sur GitHub avec d'autres exemples.
Exploiter l'intelligence temporelle pour une réalisation de tâches robuste
L'un des plus grands défis de la robotique est de savoir quand une tâche est terminée. Le robot Gemini Robotics ER 2 révolutionne la compréhension vidéo et le suivi de la progression pour vérifier que les tâches complexes — comme visser une ampoule ou fermer un sac-poubelle — sont réalisées conformément aux spécifications avant de passer à la suivante.
Dans cette mise à jour, nous avons progressé sur deux capacités fondamentales pour la compréhension de l'avancement des tâches : la classification de l'avancement et la détection des moments clés.
Classification des progrès continus
La classification de la progression fait référence à la capacité d'un robot à suivre la progression d'une tâche. Dans nos évaluations, nous attribuons à chaque image d'un flux vidéo cinq niveaux de progression (0-20 %, 20-40 %, 40-60 %, 60-80 %, 80-100 %). En quantifiant la progression de la tâche, Gemini Robotics ER 2 offre aux robots une perception situationnelle en temps réel et leur permet d'ajuster leurs actions instantanément ou de réessayer les étapes qui ont échoué sans avoir à redémarrer l'ensemble du processus.
Le robot Gemini Robotics ER 2 atteint une précision de 57,4 % sur les tâches de classification de progression, surpassant les modèles de la génération précédente et les modèles concurrents de pointe.
Détermination précise du moment
La détection de moments clés mesure la capacité d'un modèle à identifier l'image vidéo précise où se produit un événement critique (par exemple, le moment où il faut arrêter de verser du café dans une tasse). Le robot Gemini Robotics ER 2 réalise des gains de performance significatifs dans ce domaine, lui permettant de passer d'une tâche à l'autre avec précision, de vérifier leur réussite et de suggérer des corrections.
Pour les tâches de localisation de moments, le robot Gemini Robotics ER 2 atteint une précision de 91,3 % et une distance moyenne absolue de 0,96 s. Il rivalise avec des modèles beaucoup plus imposants, tout en offrant cette précision à un coût de calcul considérablement réduit et une vitesse d'exécution quatre fois supérieure — la latence inférieure à la seconde requise pour une utilisation sécuritaire des robots physiques dans le monde réel.
Collaboration multirobots
Aucun robot n'est universel : un rover à roues excelle à l'intérieur, tandis qu'un robot humanoïde est plus performant sur un terrain accidenté. Gemini Robotics 2 permet la collaboration entre plusieurs robots, permettant à des machines de natures diverses de communiquer grâce à une compréhension sémantique partagée afin de se relayer et d'accomplir des tâches complexes. Découvrez comment Gemini Robotics ER 2 permet aux robots Apollo 2 et Franka F3 Duo d' Apptronik de collaborer ici .
Améliorer l'intelligence spatiale générale
Gemini Robotics ER 2 fait progresser nos capacités fondamentales de raisonnement spatial, mesurées par trois critères de référence :
- Détection de succès/d'échec : fonctionne désormais sur des flux vidéo bruts plutôt que sur des instantanés statiques afin de détecter les défaillances en cours d'exécution telles que les déversements, les glissements ou les désalignements.
- Lecture générale des instruments : Compatible avec les cadrans circulaires, les voyants et les affichages numériques, les échelles linéaires, les règles et les thermomètres à liquide. Testée sur 10 types d'instruments différents.
- VQA spatiale améliorée : améliore la réponse aux questions visuelles grâce aux progrès de Gemini en matière de compréhension multimodale.
Gemini Robotics ER 2 atteint systématiquement la plus haute précision dans toutes ses capacités principales, avec notamment la détection de succès (image/vidéo), la réponse aux questions (ERQA) et la lecture généralisée des instruments.
Promouvoir la sécurité pour l'intelligence incarnée
Gemini Robotics ER 2 est notre modèle le plus sécuritaire, avec des gains significatifs sur les tests de suivi des consignes de sécurité et de proximité humaine. Ces tests évaluent la capacité d'un modèle à respecter les contraintes physiques lors de tâches de raisonnement et sa perception spatiale pour la détection des personnes. Nous avons constaté que Gemini Robotics ER 2 arrête avec succès un robot humanoïde lorsqu'une personne se trouve à proximité et reprend son travail de manière autonome une fois la zone dégagée. Afin d'améliorer la sécurité des agents physiques, nous introduisons un test qui évalue la capacité d'un modèle de base à agir comme un orchestrateur VLA sûr. Ce test évalue sa capacité à appliquer les contraintes de sécurité, à surveiller l'environnement, à évaluer la faisabilité physique et à solliciter la clarification humaine. Pour plus de détails, veuillez consulter notre rapport technique sur la sécurité .
Gemini Robotics ER 2 surpasse ER 1.6 et d'autres modèles de pointe sur les critères de suivi des instructions de sécurité et de proximité humaine.
À l'avenir, nous prévoyons d'orienter ces modèles vers des tâches encore plus complexes afin d'accélérer le développement de robots utiles et de soutenir la communauté robotique.