O Multiverse publicou um artigo detalhando um método que reencaminha a poda de modelos de linguagem grandes como um problema de otimização binária restrita mapeado para um vidro de Ising. Ao tratar os blocos do transformer como spins com acoplamentos pares derivados da Hessiana da perda, a abordagem identifica configurações ótimas de remoção de blocos sem exigir benchmarking iterativo.

  • O método calcula uma matriz Hessiana uma vez em um conjunto de dados de calibração para capturar interações entre blocos, permitindo que cálculos de energia sirvam como proxies para a qualidade do modelo.
  • Ele utiliza solucionadores clássicos e inspirados na quântica para encontrar estados de baixa energia no espaço de configuração, possibilitando a busca eficiente por bilhões de combinações.
  • No Llama-3.3-70B-Instruct com 50% de compressão, o método ganha quase 23 pontos percentuais no MMLU em comparação à melhor linha de base concorrente de remoção de blocos.
  • A abordagem se generaliza para arquiteturas heterogêneas como NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, onde supera as linhas de base ao identificar padrões de remoção não consecutivos.

Os autores argumentam que explorar estados excitados de baixa energia em vez de apenas o estado fundamental frequentemente produz modelos podados superiores, particularmente em regimes de compressão profunda onde as interações entre blocos são críticas.