A Hugging Face divulgou recentemente os resultados de uma iniciativa de grande escala focada na reprodutibilidade científica, realizada entre 15 de julho e 2 de agosto de 2026. Durante este período, mais de 1.200 membros da comunidade utilizaram agentes de codificação autónomos para tentar reproduzir as alegações contidas em 2.226 artigos aceites na conferência ICML 2026. Este esforço, que abrangeu cerca de um terço de todos os trabalhos aceites no evento, gerou 6.816 registos de auditoria, tornando-se um dos maiores exercícios de verificação científica alguma vez realizados no domínio da inteligência artificial.
O contexto desta iniciativa prende-se com o crescimento exponencial do número de submissões em conferências académicas, impulsionado pela facilidade com que agentes de IA permitem realizar experiências e redigir artigos. Com a ICML 2026 a receber 23.918 submissões, a capacidade de revisão humana tornou-se insuficiente, levando a situações em que revisores admitem não ter verificado cuidadosamente todas as provas matemáticas ou experimentais. A Hugging Face propôs, assim, que a mesma tecnologia que acelera a produção científica pode ser utilizada para auditar a sua veracidade, permitindo que agentes executem testes em paralelo de forma eficiente.
A metodologia do desafio envolveu a extração das alegações centrais de cada artigo, permitindo que os participantes utilizassem diversas ferramentas de codificação para replicar os resultados. Cada tentativa de reprodução foi submetida a um sistema de avaliação automatizado, o Logbook Judge, que utilizou o modelo GLM-5.2 para classificar as alegações como verificadas, falsificadas, inconclusivas ou validadas apenas em escala reduzida. Este processo garantiu que a própria auditoria fosse transparente e passível de escrutínio público, com todos os dados e rastreios de execução publicados na plataforma.
Os resultados revelaram um panorama complexo sobre a fiabilidade da investigação atual. Cerca de 51% dos artigos examinados tiveram pelo menos uma alegação confirmada de forma independente, sendo que 266 trabalhos foram totalmente reproduzidos. Por outro lado, 23% dos artigos apresentaram pelo menos uma alegação falsificada ou contestada, incluindo 242 casos em que equipas diferentes chegaram a conclusões opostas sobre as mesmas premissas. Estes dados sublinham que a reprodutibilidade não é um conceito binário, mas sim um processo frequentemente adversarial e dependente da disponibilidade de artefactos.
A iniciativa demonstrou que, embora os agentes de IA sejam ferramentas poderosas para a automatização de testes, a intervenção humana continua a ser essencial para interpretar discrepâncias e validar contextos onde os dados são proprietários ou os modelos não foram disponibilizados. A falta de acesso a checkpoints e datasets originais foi identificada como o principal obstáculo para a verificação completa de muitos trabalhos. O projeto reforça a necessidade de maior rigor na partilha de recursos científicos para assegurar que o progresso na área da inteligência artificial se mantenha sólido e verificável perante o aumento constante do volume de publicações.
Porque importa
A explosão no número de publicações científicas em IA, facilitada por agentes de codificação, cria uma crise de reprodutibilidade. Este estudo demonstra que a automatização pode ajudar a auditar a ciência, mas também revela que uma parte significativa da investigação atual não resiste a uma verificação independente, levantando questões críticas sobre a qualidade e a transparência do conhecimento produzido.