A Google DeepMind anunciou a implementação de uma funcionalidade de compreensão de vídeo baseada em agentes, disponível para os modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. Esta atualização altera a forma como os modelos de inteligência artificial processam conteúdos audiovisuais, afastando-se do método tradicional de análise estática, que dependia de uma taxa fixa de fotogramas por segundo. A nova abordagem permite que o modelo utilize ferramentas nativas para pesquisar, digitalizar e inspecionar segmentos específicos de vídeo de forma dinâmica, integrando informações visuais, áudio e transcrições.
A inovação reside na capacidade do modelo em decidir ativamente quais as partes do vídeo que requerem uma análise mais profunda, em vez de processar a totalidade do ficheiro de forma uniforme. Esta autonomia na gestão da atenção do modelo resulta em ganhos de eficiência. De acordo com os dados divulgados pela Google, a utilização desta funcionalidade pode reduzir o consumo de tokens em até 88% e os custos operacionais em até 66%. Estes números são relevantes para o processamento de vídeos de longa duração, como palestras ou tutoriais extensos, onde a gestão de recursos é um desafio para os programadores.
Para além da eficiência económica e técnica, a Google afirma que a precisão das tarefas de análise beneficia desta nova arquitetura. A empresa reporta uma melhoria de até 7% na precisão em benchmarks padrão de análise de vídeo. Esta capacidade permite realizar operações com maior fiabilidade, incluindo a recuperação de momentos específicos em frações de segundo, a deteção de anomalias e a contagem de elementos presentes no conteúdo. A integração destas capacidades visa resolver o compromisso entre a necessidade de manter detalhes críticos e a limitação de custos associada ao processamento de grandes volumes de dados.
A funcionalidade encontra-se disponível para utilização através da API do Gemini, tanto no Google AI Studio como na Gemini Enterprise Agent Platform. Os utilizadores podem ativar esta capacidade configurando a API para o modo 'agentic', permitindo o processamento de vídeos carregados diretamente ou através de links do YouTube. A Google sublinha que, embora os ganhos de eficiência sejam transversais aos três modelos suportados, o Gemini 3.7 Flash oferece o desempenho de qualidade superior quando combinado com esta nova tecnologia de compreensão agentic.
Esta evolução reflete uma tendência na indústria de inteligência artificial, onde a eficiência computacional se torna crucial para a capacidade de raciocínio dos modelos. Ao permitir que o sistema interaja com o vídeo como um agente, a Google procura oferecer uma solução mais escalável para empresas e criadores que dependem da análise automatizada de grandes bibliotecas de vídeo. A tecnologia visa proporcionar uma alternativa robusta aos métodos de processamento tradicionais, permitindo uma gestão mais eficaz de recursos em cenários de utilização que exigem o processamento de conteúdos extensos e complexos.
Porque importa
A introdução de capacidades agentic na análise de vídeo permite que empresas e programadores processem grandes volumes de conteúdos audiovisuais de forma mais económica e precisa. Ao reduzir o custo e o consumo de tokens, a Google torna a IA generativa mais viável para aplicações de larga escala, como a gestão de arquivos de vídeo, monitorização de segurança e análise de conteúdos educativos, superando as limitações técnicas dos métodos de processamento tradicionais.