A compressão de modelos de linguagem de grande escala (LLMs) enfrenta desafios significativos quando se procura reduzir a profundidade da arquitetura sem comprometer o desempenho. A remoção de blocos inteiros, conhecida como 'depth pruning', é uma técnica eficaz para acelerar a inferência e reduzir o consumo de memória, mas a seleção dos blocos a eliminar é uma tarefa complexa. Tradicionalmente, os métodos existentes avaliam cada bloco de forma isolada, tratando-os como entidades independentes. Contudo, esta abordagem ignora as interações críticas entre diferentes camadas, o que pode levar a uma degradação acentuada da qualidade do modelo final.
Uma equipa de investigadores da Multiverse Computing apresentou uma nova metodologia que reformula o problema da seleção de blocos como uma questão de otimização combinatória. Ao aplicar princípios da física estatística, o estudo propõe tratar a remoção de blocos como um sistema de spins, especificamente um 'Ising glass'. Neste modelo, cada bloco é representado por uma variável binária, onde o estado '0' indica a manutenção do bloco e o '1' a sua remoção. Esta analogia permite capturar as interações complexas entre as camadas, tratando-as como acoplamentos num sistema físico.
O núcleo desta inovação reside na utilização de uma expansão de Taylor de segunda ordem da perda do modelo, que resulta numa matriz Hessiana. Os elementos diagonais desta matriz representam a importância individual de cada bloco, enquanto os elementos fora da diagonal capturam os acoplamentos, ou seja, a influência mútua entre as decisões de remoção. Ao minimizar a energia deste sistema, os investigadores conseguem identificar configurações de blocos que preservam a integridade do modelo, transformando um problema de pesquisa exponencial num desafio de otimização binária restrita.
A grande vantagem desta abordagem é a eficiência computacional. A matriz Hessiana é calculada apenas uma vez, utilizando um conjunto de dados de calibração, o que permite avaliar inúmeras configurações de compressão sem a necessidade de executar o modelo completo ou realizar benchmarks exaustivos. Esta técnica funciona como um indicador fiável da qualidade do modelo comprimido, permitindo que os investigadores identifiquem estados de baixa energia que correspondem a modelos de alto desempenho, otimizando o processo de seleção de forma rápida e precisa.
Os resultados experimentais demonstram a eficácia desta metodologia, particularmente em regimes de compressão profunda. Ao aplicar este método ao modelo Llama-3.3-70B-Instruct com uma taxa de compressão de 50%, a equipa obteve uma melhoria de quase 23 pontos percentuais no benchmark MMLU em comparação com os métodos de remoção de blocos convencionais. Esta abordagem não só valida a utilidade de ferramentas de física estatística na inteligência artificial, como também oferece uma solução robusta para tornar modelos complexos mais leves e eficientes para aplicações práticas.
Porque importa
Esta investigação demonstra como a aplicação de princípios da física estatística pode resolver problemas de otimização complexos em inteligência artificial, permitindo criar modelos mais leves e rápidos sem sacrificar a precisão, um passo crucial para a implementação de modelos de grande escala em hardware com recursos limitados.