Multiverse ha publicado un artículo que detalla un método que reformula la poda de modelos de lenguaje grandes como un problema de optimización binaria restringida mapeado a un vidrio de Ising. Al tratar los bloques del transformador como espines con acoplamientos por pares derivados de la Hessiana de la pérdida, el enfoque identifica configuraciones óptimas de eliminación de bloques sin requerir evaluación iterativa.
- El método calcula una matriz de Hessiana una vez en un conjunto de calibración para capturar las interacciones entre bloques, permitiendo que los cálculos de energía sirvan como proxies para la calidad del modelo.
- Utiliza solucionadores clásicos e inspirados en la computación cuántica para encontrar estados de baja energía en el espacio de configuraciones, lo que permite buscar miles de millones de combinaciones de manera eficiente.
- En Llama-3.3-70B-Instruct con una compresión del 50%, el método obtiene casi 23 puntos porcentuales más en MMLU en comparación con la mejor línea base de eliminación de bloques competidora.
- El enfoque se generaliza a arquitecturas heterogéneas como NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, donde supera a las líneas base al identificar patrones de eliminación no consecutivos.
Los autores argumentan que explorar estados excitados de baja energía en lugar de solo el estado fundamental suele producir modelos podados superiores, particularmente en regímenes de compresión profunda donde las interacciones entre bloques son críticas.