Multiverse telah merilis makalah yang mendetailkan metode yang membingkai ulang pemangkasan model bahasa besar sebagai masalah optimasi biner terkendali yang dipetakan ke kaca Ising. Dengan memperlakukan blok transformer sebagai spin dengan kopling berpasangan yang diturunkan dari Hessian kerugian, pendekatan ini mengidentifikasi konfigurasi penghapusan blok optimal tanpa memerlukan benchmarking iteratif.

  • Metode ini menghitung matriks Hessian sekali pada dataset kalibrasi untuk menangkap interaksi antar blok, memungkinkan perhitungan energi berfungsi sebagai proksi untuk kualitas model.
  • Metode ini memanfaatkan solver klasik dan terinspirasi kuantum untuk menemukan keadaan berenergi rendah dalam ruang konfigurasi, memungkinkan pencarian miliaran kombinasi secara efisien.
  • Pada Llama-3.3-70B-Instruct dengan kompresi 50%, metode ini memperoleh hampir 23 poin persentase pada MMLU dibandingkan baseline penghapusan blok saingan terbaik.
  • Pendekatan ini dapat digeneralisasi ke arsitektur heterogen seperti NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, di mana ia mengungguli baseline dengan mengidentifikasi pola penghapusan yang tidak berurutan.

Para penulis berpendapat bahwa mengeksplorasi keadaan tereksitasi berenergi rendah daripada hanya keadaan dasar sering kali menghasilkan model yang dipangkas lebih unggul, terutama dalam rezim kompresi mendalam di mana interaksi blok sangat kritis.