A equipa de investigação da Multiverse Computing apresentou uma nova abordagem técnica denominada Quantization-Aware Healing (QAH), que promete alterar o paradigma da compressão de grandes modelos de linguagem. Tradicionalmente, o processo de redução de um modelo envolve duas etapas críticas: a compressão estrutural, que remove camadas ou neurónios, e a quantização, que reduz a precisão dos pesos para 4 bits. Embora estas técnicas sejam essenciais para reduzir o consumo de memória e os custos computacionais, a prática corrente resulta habitualmente numa degradação significativa das capacidades de raciocínio, matemática e programação do modelo original.

O problema central reside na fase de recuperação, ou 'cura', que sucede à compressão. Métodos convencionais, como o Treino Consciente de Quantização (QAT), tentam mitigar perdas através de um ajuste fino dispendioso, que frequentemente se torna instável. Por outro lado, a Destilação Consciente de Quantização (QAD) utiliza um modelo de precisão total como professor, mas falha quando a arquitetura do modelo comprimido é diferente da original, forçando o aluno a seguir um alvo já degradado. A técnica QAH propõe uma solução inovadora ao destilar o conhecimento diretamente do modelo original, de tamanho completo e precisão total, para o modelo comprimido de 4 bits.

Ao utilizar a divergência de Kullback-Leibler para alinhar as distribuições de saída, a QAH permite que o modelo comprimido aprenda diretamente com a fonte original, ignorando as limitações impostas pela arquitetura reduzida. Segundo os investigadores, esta abordagem transforma a quantização de um processo de pós-processamento com perdas numa nova etapa de destilação. Desta forma, o modelo de 4 bits não tenta apenas compensar a informação perdida, mas absorve conhecimentos que o ponto de controlo intermédio em bfloat16 nunca chegou a processar adequadamente.

Os resultados práticos desta metodologia são notáveis. Ao aplicar a QAH a um modelo GPT-OSS de 120 mil milhões de parâmetros, comprimido para 60 mil milhões e quantizado para MXFP4, a equipa obteve um sistema que supera a versão original de precisão total em sete de nove parâmetros de avaliação. Este feito inverte a relação habitual entre modelos comprimidos e os seus antecessores, demonstrando que é possível obter um modelo mais pequeno, mais económico e, simultaneamente, mais preciso do que o original.

Além do ganho de desempenho, a técnica oferece uma estabilidade superior durante o treino. Ao contrário das perdas de entropia cruzada, que podem levar o modelo a desviar-se se o treino for prolongado, a destilação por divergência de KL mantém o aluno ancorado na distribuição do professor. Para lidar com contextos longos, a equipa integrou uma função de perda de divergência KL segmentada, permitindo que o processo de cura seja aplicado eficazmente a documentos com até 32 mil tokens, consolidando a QAH como uma ferramenta robusta para a implementação de modelos de IA de alto desempenho.

Porque importa

Esta descoberta é fundamental para a indústria, pois desafia a premissa de que a compressão de modelos de linguagem implica obrigatoriamente uma perda de qualidade. Ao permitir que modelos mais pequenos e eficientes superem os seus antecessores, a QAH reduz drasticamente os custos de infraestrutura e energia necessários para a implementação de IA avançada, tornando a tecnologia mais acessível e sustentável sem sacrificar a precisão ou a capacidade de raciocínio.

Fontes

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision originalHugging Face ↗