मल्टीवर्स ने एक पेपर जारी किया है जिसमें एक विधि का विवरण दिया गया है जो बड़े भाषा मॉडल प्रूनिंग को एक बाध्य द्विआधारी अनुकूलन समस्या के रूप में पुनर्परिभाषित करती है और इसे आइसिंग ग्लास पर मैप करती है। ट्रान्सफॉर्मर ब्लॉकों को स्पिन के रूप में मानते हुए, जिसमें हानि हेसियन से व्युत्पन्न युग्मन होते हैं, यह दृष्टिकोण पुनरावृत्ति बेंचमार्किंग की आवश्यकता के बिना इष्टतम ब्लॉक हटाने की विन्यासों की पहचान करता है।
- विधि एक कैलिब्रेशन डेटासेट पर हेसियन मैट्रिक्स को एक बार गणना करती है ताकि ब्लॉकों के बीच अंतःक्रियाओं को पकड़ा जा सके, जिससे ऊर्जा की गणनाएँ मॉडल गुणवत्ता के लिए प्रतिस्थापन के रूप में कार्य कर सकें।
- यह विन्यास स्थान में निम्न-ऊर्जा अवस्थाओं को खोजने के लिए शास्त्रीय और क्वांटम-प्रेरित सॉल्वर का उपयोग करता है, जिससे अरबों संयोजनों की कुशलतापूर्वक खोज संभव होती है।
- 50% संपीड़न पर Llama-3.3-70B-Instruct पर, यह विधि सर्वश्रेष्ठ प्रतिस्पर्धी ब्लॉक-हटाने वाले आधार के मुकाबले MMLU पर लगभग 23 प्रतिशत अंक की वृद्धि प्राप्त करती है।
- यह दृष्टिकोण NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 जैसे विषम आर्किटेक्चर तक सामान्यीकृत होता है, जहाँ यह गैर-अनुक्रमिक हटाने के पैटर्न की पहचान करके आधारों को पार करता है।
लेखकों का तर्क है कि केवल भूमि अवस्था के बजाय निम्न-ऊर्जा उत्तेजित अवस्थाओं का अन्वेषण करना अक्सर श्रेष्ठ प्रून किए गए मॉडल देता है, विशेष रूप से गहन संपीड़न शासनों में जहाँ ब्लॉक अंतःक्रियाएँ महत्वपूर्ण होती हैं।