A fiabilidade dos agentes de inteligência artificial em ambientes de produção continua a ser um desafio técnico significativo. Embora muitos modelos demonstrem capacidades impressionantes em testes controlados, a sua consistência em tarefas repetidas é frequentemente ignorada pelos métodos de avaliação convencionais. Uma equipa de investigadores da IBM publicou recentemente um estudo que destaca como a variabilidade no comportamento dos agentes pode comprometer a sua utilidade em contextos críticos, como a reconciliação de transações financeiras ou a verificação de contratos, onde a previsibilidade é um requisito fundamental para a implementação industrial.

O problema reside na forma como os benchmarks atuais reportam o desempenho. A métrica padrão, frequentemente designada por Mean@k, calcula a taxa média de sucesso ao longo de várias tentativas, oferecendo uma visão que não reflete a experiência real do utilizador final. Segundo os dados apresentados, um agente baseado no GPT-4.1 pode atingir uma média de sucesso de 77,4% em cinco execuções, mas apenas completar com êxito todas as cinco tentativas em 53% dos casos. Esta discrepância de 24,4 pontos percentuais é definida pelos investigadores como o fosso de consistência.

Para diagnosticar esta instabilidade, a equipa introduziu o Consistency Analyzer, uma ferramenta que analisa as trajetórias de decisão do agente sem necessitar de dados de referência. O sistema identifica pontos de decisão propensos a alterações, onde o modelo se encontra num estado de incerteza entre várias opções. Ao reamostrar estes pontos específicos, o analisador consegue detetar decisões planas, onde a distribuição de probabilidade dos tokens é demasiado equilibrada, tornando o resultado final vulnerável a pequenas variações aleatórias ou ruído computacional inerente ao processamento.

A investigação sugere que a instabilidade não é necessariamente um problema de capacidade do modelo, mas sim uma característica da forma como as decisões são tomadas. Decisões afiadas, onde existe uma preferência clara por um token, tendem a ser resilientes a perturbações. Em contrapartida, decisões planas funcionam como um lançamento de moeda, onde pequenas alterações no ambiente de execução podem levar a caminhos divergentes. Este fenómeno explica por que razão um agente pode falhar uma tarefa que, noutra ocasião, executou sem qualquer erro aparente, criando um problema de fiabilidade.

Como solução, os investigadores propõem a utilização de diretrizes de consistência integradas no sistema ALTK-Evolve. Ao converter as falhas diagnosticadas em orientações reutilizáveis, a equipa conseguiu reduzir o fosso de consistência para 12 pontos percentuais, sem sacrificar a precisão média. Esta abordagem demonstra que é possível melhorar a robustez dos agentes de IA através de uma análise mais rigorosa das suas trajetórias, garantindo que o desempenho observado em ambiente de teste se traduza de forma mais fiável para a utilização real em produção.

Porque importa

Este estudo é fundamental para a indústria, pois expõe uma falha estrutural na avaliação de agentes autónomos. Ao focar na consistência em vez da média, a investigação da IBM oferece uma metodologia prática para tornar sistemas de IA mais fiáveis para aplicações empresariais críticas, onde a incerteza de comportamento é inaceitável.

Fontes

Your Agent Aced the Task. Will It Do It Again?Hugging Face ↗