Multiverse는 대규모 언어 모델의 프루닝을 이징 글래스에 매핑된 제약 조건 이진 최적화 문제로 재정의하는 방법을 상세히 설명한 논문을 발표했습니다. 트랜스포머 블록을 손실 헤시안에서 유도된 쌍상호작용을 가진 스핀으로 취급함으로써, 이 접근법은 반복적인 벤치마킹 없이도 최적의 블록 제거 구성을 식별합니다.

  • 이 방법은 교정 데이터셋에서 헤시안 행렬을 한 번 계산하여 블록 간 상호작용을 포착하며, 에너지 계산을 모델 품질의 대리 지표로 활용합니다.
  • 구성 공간에서 저에너지 상태를 찾기 위해 고전적 및 양자 영감 기반 솔버를 활용하여 수십억 개의 조합을 효율적으로 탐색할 수 있습니다.

Llama-3.3-70B-Instruct에서 50% 압축 시, 이 방법은 기존 최고 블록 제거 베이스라인 대비 MMLU에서 거의 23%p의 성능 향상을 보입니다. -NVIDIA-Nemotron-3-Nano-30B-A3B-FP8와 같은 이종 아키텍처에도 일반화되어, 비연속적 제거 패턴을 식별함으로써 베이스라인을 능가합니다.

저자들은 바닥 상태뿐만 아니라 저에너지 들뜬 상태를 탐색하는 것이 특히 블록 간 상호작용이 중요한 심층 압축 영역에서 더 우수한 프루닝 모델을 생성한다고 주장합니다.