A Google DeepMind anunciou o lançamento do Gemini Robotics ER 2, um modelo concebido para atuar como um sistema de processamento central de alto nível em aplicações robóticas. Esta tecnologia visa colmatar a lacuna entre o raciocínio abstrato e a execução física, permitindo que as máquinas compreendam o ambiente que as rodeia com maior precisão. Ao contrário de sistemas anteriores, este modelo foca-se na capacidade de raciocínio incorporado, essencial para que os robôs possam operar de forma autónoma em espaços partilhados com seres humanos, onde a rapidez de decisão e a adaptação ao meio são fatores críticos para o sucesso operacional.

Uma das principais inovações introduzidas pelo Gemini Robotics ER 2 reside na sua capacidade avançada de processamento de vídeo em tempo real. Através da análise contínua de fluxos visuais, o modelo permite que os robôs monitorizem o progresso das suas próprias ações, detetem erros de execução e ajustem o seu comportamento de forma dinâmica. Esta funcionalidade de autocorreção representa um avanço significativo face à versão anterior, a ER 1.6, conferindo às máquinas uma maior autonomia na gestão de tarefas complexas que exigem uma sequência lógica de passos, sem a necessidade de intervenção humana constante para corrigir desvios no plano original.

Além da gestão individual, o modelo introduz capacidades de colaboração multi-robô, permitindo que várias unidades trabalhem em conjunto num mesmo espaço para completar fluxos de trabalho que seriam impossíveis de realizar por um único dispositivo. Esta coordenação é facilitada pela orquestração de ferramentas, onde o modelo pode invocar funções externas, como pesquisas no Google ou comandos definidos pelo utilizador, para obter informações necessárias à conclusão de uma tarefa. Esta versatilidade amplia o potencial de aplicação da robótica em ambientes industriais, logísticos ou de assistência, onde a cooperação entre diferentes agentes é fundamental.

A arquitetura do Gemini Robotics ER 2 foi desenhada para separar o raciocínio de alto nível da execução motora. Enquanto o modelo processa o planeamento e a estratégia, a execução física é delegada a modelos de visão-linguagem-ação específicos, garantindo uma separação eficiente entre a tomada de decisão e o movimento mecânico. Esta abordagem modular permite que o sistema seja integrado em diversas plataformas robóticas, mantendo a capacidade de interagir com humanos através de linguagem natural, o que facilita a comunicação e a supervisão das tarefas em curso num ambiente de trabalho partilhado.

O acesso ao Gemini Robotics ER 2 já se encontra disponível para a comunidade de programadores através da API Gemini e do Google AI Studio. Adicionalmente, a tecnologia está a ser disponibilizada em pré-visualização privada na plataforma Gemini Enterprise Agent Platform. Com este lançamento, a Google pretende acelerar o desenvolvimento de agentes de inteligência artificial físicos, fornecendo as ferramentas necessárias para que empresas e investigadores possam criar soluções robóticas mais capazes, seguras e eficazes para os desafios do mundo real, marcando um passo importante na evolução da robótica autónoma.

Porque importa

O Gemini Robotics ER 2 é relevante por permitir que robôs passem de tarefas isoladas e rígidas para uma colaboração dinâmica e adaptável. Ao melhorar a compreensão visual e o planeamento em tempo real, a Google aproxima a robótica de uma integração mais fluida em ambientes humanos, reduzindo a necessidade de programação manual exaustiva e aumentando a autonomia operacional em cenários complexos.

Fontes

Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaborationGoogle DeepMind ↗