Команда Multiverse опубликовала статью, в которой описывается метод, переформулирующий прунинг больших языковых моделей как задачу бинарной оптимизации с ограничениями, отображаемую на модель Изинга. Рассматривая блоки трансформера как спины с парными связями, выведенными из гессиана функции потерь, подход определяет оптимальные конфигурации удаления блоков без необходимости итеративного бенчмаркинга.

  • Метод вычисляет матрицу Гессе один раз на калибровочном наборе данных для захвата взаимодействий между блоками, позволяя расчетам энергии служить прокси-показателями качества модели.
  • Он использует классические и квантово-вдохновленные решатели для поиска состояний с низкой энергией в пространстве конфигураций, что позволяет эффективно исследовать миллиарды комбинаций.
  • На модели Llama-3.3-70B-Instruct при 50% сжатии метод показывает почти на 23 процентных пункта выше результат по MMLU по сравнению с лучшим базовым методом удаления блоков.
  • Подход обобщается на гетерогенные архитектуры, такие как NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, где он превосходит базовые методы за счет выявления непоследовательных паттернов удаления.

Авторы утверждают, что исследование возбужденных состояний с низкой энергией, а не только основного состояния, часто приводит к созданию более качественных пруненных моделей, особенно в режимах глубокого сжатия, где критически важны взаимодействия между блоками.