Pesquisadores Propõem Método de Otimização para Remoção de Blocos em Modelos de Linguagem
Nova abordagem utiliza técnicas de física estatística para melhorar a compressão de modelos de linguagem.
Publicidade
A compressão de modelos de linguagem é uma técnica importante para melhorar a eficiência e reduzir os custos de treinamento e inferência. Uma das formas mais simples e eficazes de compressão é a remoção de blocos inteiros de transformadores, conhecida como "block removal" ou "depth pruning". No entanto, a escolha dos blocos a serem removidos é um problema complexo, pois a remoção de blocos errados pode levar a uma perda significativa de desempenho do modelo.
Recentemente, pesquisadores propuseram uma nova abordagem para resolver esse problema, utilizando técnicas de física estatística. Eles reformularam a seleção de blocos como um problema de otimização binária constrangida, que pode ser mapeado diretamente em um sistema de spin desordenado, conhecido como "Ising glass". A energia desse sistema de spin é uma proxy forte para o desempenho do modelo comprimido, o que significa que é possível avaliar uma grande quantidade de configurações candidatas sem precisar executar o modelo ou realizar benchmarking.
A abordagem proposta pelos pesquisadores é baseada na ideia de que os blocos de transformadores não são independentes, mas sim interagem entre si. Eles utilizam uma expansão de Taylor de segunda ordem da perda do modelo com relação às variáveis binárias que representam a remoção de blocos, o que produz uma matriz de Hessian que contém as interações entre os blocos. A diagonal da matriz de Hessian representa a importância de cada bloco individualmente, enquanto as entradas fora da diagonal representam as interações entre os blocos.
Publicidade
A reformulação do problema de seleção de blocos como um problema de otimização binária constrangida permite que os pesquisadores utilizem técnicas de física estatística para encontrar a solução ótima. Eles demonstram que a energia do sistema de spin é uma proxy forte para o desempenho do modelo comprimido, o que significa que a minimização da energia é equivalente à maximização do desempenho do modelo.
A abordagem proposta pelos pesquisadores tem várias vantagens em relação às técnicas existentes. Em primeiro lugar, ela é mais eficiente do que as técnicas de remoção de blocos baseadas em heurísticas, que podem levar a uma perda significativa de desempenho do modelo. Além disso, a abordagem proposta é mais escalável do que as técnicas de otimização exata, que podem ser computacionalmente caras para modelos grandes.
Os pesquisadores também demonstram que a abordagem proposta pode ser utilizada em conjunto com outras técnicas de compressão, como quantização e compressão de baixa ordem. Eles mostram que a remoção de blocos pode ser combinada com essas técnicas para obter uma compressão ainda maior do modelo.
Em resumo, a abordagem proposta pelos pesquisadores é uma técnica inovadora para a compressão de modelos de linguagem, que utiliza técnicas de física estatística para encontrar a solução ótima para o problema de seleção de blocos. A abordagem é mais eficiente e escalável do que as técnicas existentes e pode ser utilizada em conjunto com outras técnicas de compressão para obter uma compressão ainda maior do modelo.
Fontes
Esta análise é original do i-a-trend e foi elaborada a partir das reportagens publicadas pelas fontes acima, consultadas para apuração dos fatos. O crédito pela apuração é dos veículos citados — recomendamos a leitura das matérias originais.
Texto produzido com apoio de inteligência artificial e publicado sob responsabilidade editorial do i-a-trend. Encontrou um erro? Escreva para contato@i-a-trend.com.
Publicidade
Leia também
Lançamento do Gemini 3.8 Live com Live Avatar
Nova tecnologia de IA para interações mais naturais
Aceleração do Treinamento de Aprendizado por Reforço com SkyRL no Amazon SageMaker HyperPod
Acelerando o treinamento de modelos de linguagem com SkyRL e Amazon SageMaker HyperPod.
AWS Lança Contêiner de Aprendizado de Máquina WhisperX para Transcrição de Áudio
WhisperX oferece transcrição de áudio com precisão e identificação de falantes.