O Allen Institute for AI (Ai2) apresentou o BenchMIRT, uma metodologia desenhada para auditar benchmarks de modelos de linguagem (LLMs) ao nível de cada pergunta individual. Numa altura em que a avaliação de modelos é um pilar central do desenvolvimento tecnológico, a equipa de investigadores procurou compreender se os testes atuais medem efetivamente as capacidades que prometem avaliar, como o raciocínio geral ou a segurança. A premissa é que um benchmark, embora desenhado para um objetivo específico, pode conter tarefas que dependem de competências distintas, o que pode obscurecer a interpretação dos resultados finais.
A metodologia baseia-se na Teoria de Resposta ao Item (IRT), uma técnica oriunda da psicometria que analisa padrões de resposta para medir traços e habilidades. Enquanto abordagens anteriores utilizavam modelos unidimensionais, o BenchMIRT aplica a Teoria de Resposta ao Item Multidimensional (MIRT). Esta técnica permite separar múltiplas capacidades que contribuem para o desempenho numa mesma tarefa. Ao analisar 100 modelos de linguagem em 16 benchmarks diferentes, abrangendo mais de 34 mil questões, o sistema conseguiu identificar, de forma independente, duas dimensões dominantes: a segurança e o raciocínio geral.
Os resultados revelam nuances importantes sobre ferramentas amplamente utilizadas. Por exemplo, o benchmark BBQ, frequentemente associado à avaliação de preconceitos sociais e segurança, demonstrou uma correlação muito mais forte com o raciocínio geral do que com a segurança propriamente dita. Isto sugere que uma pontuação baixa no BBQ pode refletir dificuldades de compreensão lógica por parte do modelo, em vez de uma falha específica no comportamento ético ou na mitigação de preconceitos, desafiando a forma como a indústria interpreta estas métricas.
Outro caso notável é o do benchmark WMDP, que avalia conhecimentos perigosos em áreas como a biologia e a cibersegurança. A análise do BenchMIRT indicou que os resultados neste teste estão mais associados ao raciocínio geral do que à segurança. Curiosamente, modelos com maior capacidade de raciocínio tendem a obter pontuações mais baixas neste benchmark, uma vez que o teste penaliza a capacidade de fornecer informações perigosas, exigindo que o modelo recuse a tarefa. Este fenómeno demonstra como a estrutura de um teste pode distorcer a perceção sobre as capacidades reais de um sistema.
O estudo também destacou a heterogeneidade dentro de um único benchmark, como é o caso do HarmBench. Enquanto as questões sobre pedidos prejudiciais se alinham com a segurança, as perguntas sobre direitos de autor, como a geração de letras de músicas, estão mais ligadas ao raciocínio geral. Ao separar estes sinais, o BenchMIRT oferece uma visão mais granular, permitindo aos investigadores compreender o que está realmente a impulsionar a pontuação de um modelo e promovendo uma avaliação mais rigorosa e transparente na área da inteligência artificial.
Porque importa
A avaliação de modelos de IA é frequentemente baseada em pontuações agregadas que podem ser enganadoras. O BenchMIRT oferece uma forma científica de auditar estes testes, garantindo que os investigadores saibam exatamente o que um modelo está a demonstrar, evitando interpretações erradas sobre a segurança ou a inteligência dos sistemas.