Multiverse a publié un article détaillant une méthode qui reformule l'élagage des grands modèles de langage comme un problème d'optimisation binaire sous contrainte mappé à un verre d'Ising. En traitant les blocs transformeur comme des spins avec des couplages par paire dérivés de l'hessienne de la perte, l'approche identifie les configurations optimales de suppression de blocs sans nécessiter de benchmarking itératif.

  • La méthode calcule une matrice hessienne une fois sur un jeu de données d'étalonnage pour capturer les interactions entre les blocs, permettant aux calculs d'énergie de servir de substituts à la qualité du modèle.
  • Elle utilise des solveurs classiques et inspirés de l'informatique quantique pour trouver des états de basse énergie dans l'espace de configuration, permettant la recherche efficace de milliards de combinaisons.
  • Sur Llama-3.3-70B-Instruct à 50 % de compression, la méthode gagne près de 23 points de pourcentage sur MMLU par rapport à la meilleure ligne de base concurrente de suppression de blocs.
  • L'approche se généralise aux architectures hétérogènes comme NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, où elle surpasse les lignes de base en identifiant des motifs de suppression non consécutifs.

Les auteurs soutiennent que l'exploration des états excités de basse énergie plutôt que seulement l'état fondamental produit souvent des modèles élagués supérieurs, particulièrement dans les régimes de compression profonde où les interactions entre blocs sont critiques.