Apresentando o Gemini Robotics ER 2

30 Jul, 2026

|

O Gemini Robotics ER 2 representa uma mudança radical na capacitação de robôs com compreensão de vídeo, orquestração de tarefas e colaboração entre múltiplos robôs — possibilitando que os robôs sejam mais úteis no mundo físico.


Steven Hansen

Senior Staff Software Engineer

Peng Xu

Staff Software Engineer


Dois robôs: Duo e Apollo

Para que os robôs auxiliem os humanos em ambientes cotidianos, o raciocínio espacial preciso não é suficiente. Os robôs também precisam pensar rápido, sincronizando suas decisões e raciocinando na velocidade do mundo físico em tempo real.

É por isso que hoje estamos lançando o Gemini Robotics ER 2 , nosso modelo de "raciocínio incorporado" mais avançado para robótica. Imagine o Gemini Robotics ER 2 como um cérebro de alto nível para robôs. Ele permite que os robôs conversem com humanos, compreendam o mundo físico e planejem tarefas complexas. Em seguida, delega a execução dos motores a qualquer modelo de visão-linguagem-ação (VLA) de nível inferior. O Gemini Robotics ER 2 também pode acessar ferramentas como o Google Search para encontrar informações ou qualquer outra função definida pelo usuário. O design do Gemini Robotics ER 2 permite que o robô "pense" sobre o que vem a seguir enquanto executa suas ações simultaneamente.

O Gemini Robotics ER 2 representa uma atualização significativa em relação ao Gemini Robotics ER 1.6 . Ao monitorar transmissões de vídeo contínuas, os robôs agora podem acompanhar seu próprio progresso, adaptar-se caso algo dê errado e saber exatamente quando prosseguir para a próxima etapa. Também estamos introduzindo a colaboração entre múltiplos robôs, permitindo que trabalhem juntos em espaços compartilhados e concluam fluxos de trabalho complexos que um único robô não conseguiria realizar sozinho.

O Gemini Robotics ER 2 já está disponível publicamente para desenvolvedores por meio da API Gemini , do Google AI Studio e em versão prévia privada na Gemini Enterprise Agent Platform . Para ajudar você a começar, estamos compartilhando exemplos de como configurar o modelo e utilizá-lo para executar tarefas de IA física mais úteis.

Aprimorando as capacidades de agentes físicos

A maioria das tarefas no mundo físico é complexa e requer várias etapas para ser concluída. O Gemini Robotics ER 2 é um agente físico que orquestra as etapas para o robô, permitindo que ele se autocorrija e se adapte a situações mais novas. Para construir uma configuração de agente, os desenvolvedores podem declarar interfaces de controle de baixo nível — como modelos de Visão-Linguagem-Ação (VLA) ou APIs de navegação — como ferramentas e transmitir vídeo, áudio ou texto multimodal diretamente para o modelo.

O Gemini Robotics ER 2 aprimora esse fluxo de trabalho de orquestração de ferramentas. Podemos avaliar seu desempenho com robôs em simulação, usando controle de robôs no mundo real e até mesmo combiná-lo com um humano controlando o robô remotamente.

O Gemini Robotics ER 2 supera consistentemente o ER 1.6 na orquestração de ferramentas em três modos de controle: VLA real, VLA simulado e teleoperação humana.

Gráfico comparativo do desempenho do agente físico do Gemini Robotics ER 1.6 e do Gemini Robotics ER 2.

Em robótica, o raciocínio de alto nível depende da velocidade de execução. O Gemini Robotics ER 2 integra-se à API Gemini Live , utilizando um endpoint de streaming bidirecional otimizado para tarefas sensíveis à latência. O resultado é uma orquestração fluida: o Gemini Robotics ER 2 comanda modelos de ação e APIs de robótica para concluir tarefas de múltiplas etapas sem as interrupções abruptas de "parar e pensar".

Para ilustrar isso, criamos uma demonstração com o Spot , desenvolvido por nossos parceiros da Boston Dynamics . Utilizamos o Gemini Robotics ER 2 para orquestrar as APIs do Spot , como navegação e movimentação do manipulador, criando um robô interativo que busca objetos para você.

O robô Boston Dynamic Spot, equipado com o motor Gemini ER 2, busca um lanche de pipoca mediante um comando de linguagem natural.

O código está disponível no Github , juntamente com outros exemplos.

Desbloqueando a inteligência temporal para a conclusão robusta de tarefas.

Um dos maiores desafios da robótica é saber quando uma tarefa está concluída. O Gemini Robotics ER 2 representa um avanço significativo na compreensão de vídeo e no rastreamento do progresso, permitindo verificar se tarefas complexas — como apertar uma lâmpada ou amarrar um saco de lixo — foram concluídas conforme as especificações antes de passar para a próxima tarefa.

Nesta atualização, avançamos em duas capacidades fundamentais para a compreensão do progresso da tarefa: classificação do progresso e identificação de momentos.

Classificação de progresso contínuo

A classificação de progresso refere-se à capacidade de um robô de acompanhar o progresso em direção à conclusão de uma tarefa. Em nossas avaliações, atribuímos cada quadro de um fluxo de vídeo a cinco níveis de progresso (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Ao quantificar o progresso da tarefa, o Gemini Robotics ER 2 fornece aos robôs consciência situacional em tempo real, permitindo que eles ajustem ações instantaneamente ou repitam etapas com falha sem precisar reiniciar todo o fluxo de trabalho.

O robô Gemini Robotics ER 2 alcançou uma precisão de 57,4% em tarefas de classificação de progresso, superando os modelos da geração anterior e os modelos de ponta concorrentes.

Gráfico comparativo da classificação de progresso de diferentes robôs

determinação precisa do momento

A detecção de momentos avalia a capacidade de um modelo identificar o quadro exato de um vídeo onde ocorre um evento crítico (por exemplo, quando parar de servir café em uma xícara). O Gemini Robotics ER 2 alcança ganhos significativos de desempenho na detecção de momentos, permitindo que os robôs alternem entre tarefas com precisão, verifiquem o sucesso e sugiram correções.

Para tarefas de detecção de momentos, o Gemini Robotics ER 2 atinge 91,3% de precisão e uma distância média absoluta de 0,96 segundos. Ele compete de perto com categorias de modelos muito maiores, mas oferece essa precisão a uma fração do custo computacional e com velocidade de execução 4 vezes maior — a latência inferior a um segundo realmente necessária para operar robôs físicos com segurança no mundo real.

Gráfico de determinação de momentos: Precisão versus distância

Colaboração entre múltiplos robôs

Nenhum robô sozinho é adequado para todas as tarefas — um rover com rodas se destaca em ambientes internos, enquanto um robô humanoide pode se sair melhor em terrenos irregulares. O Gemini Robotics 2 permite a colaboração entre múltiplos robôs, possibilitando que máquinas diversas se comuniquem por meio de um entendimento semântico compartilhado para transferir e concluir tarefas complexas. Veja aqui como o Gemini Robotics ER 2 permite que o Apollo 2 e o Franka F3 Duo da Apptronik colaborem.

Aprimorando a inteligência espacial geral

O Gemini Robotics ER 2 aprimora nossa capacidade fundamental de raciocínio espacial, conforme medido por três parâmetros de referência:

  • Detecção de sucesso/falha: Agora opera em fluxos de vídeo brutos em vez de instantâneos estáticos para detectar falhas durante a execução, como interrupções, deslizes ou desalinhamentos.
  • Leitura geral de instrumentos: Vai além de mostradores circulares e visores de nível, incluindo displays digitais, escalas lineares, réguas e termômetros de líquidos. Testamos em 10 tipos diferentes de instrumentos.
  • Resposta a perguntas visuais espacial aprimorada: Melhora a resposta a perguntas visuais por meio dos avanços da Gemini na compreensão multimodal.

O robô Gemini Robotics ER 2 atinge consistentemente a maior precisão em todas as suas principais funcionalidades, com destaque para a detecção de sucesso (imagem/vídeo), Resposta a Perguntas (ERQA) e leitura generalizada de instrumentos.

Comparação das métricas ER de diferentes robôs

Promovendo a segurança para a inteligência incorporada

O Gemini Robotics ER 2 é o nosso modelo mais seguro, alcançando ganhos significativos nos benchmarks de Seguimento de Instruções de Segurança e Proximidade Humana, que avaliam como um modelo adere às restrições físicas durante tarefas de raciocínio e à percepção espacial para detecção de humanos. Descobrimos que o Gemini Robotics ER 2 interrompe com sucesso um robô humanoide quando uma pessoa está por perto e retoma o trabalho autonomamente somente quando a área está livre. Para aprimorar a segurança de agentes físicos, estamos introduzindo um benchmark que avalia a capacidade de um modelo base de atuar como um orquestrador VLA seguro, testando sua capacidade de impor restrições de segurança, monitorar o ambiente, avaliar a viabilidade física e buscar esclarecimentos humanos. Para mais detalhes, consulte nosso relatório técnico de segurança .

O robô Gemini Robotics ER 2 supera o ER 1.6 e outros modelos de ponta nos testes de Seguimento de Instruções de Segurança e Proximidade Humana.

Comparação do desempenho de segurança de diferentes robôs

Olhando para o futuro, nossos planos são direcionar esses modelos para tarefas ainda mais complexas, a fim de acelerar o desenvolvimento de robôs úteis e apoiar a comunidade da robótica.

Get the latest news from Google in your inbox

Sign up for our newsletters with product updates, event information, special offers, and more.

Your information will be used in accordance with Google's privacy policy. You may opt out at any time.