शोधकर्ताओं ने Isospectral Optimization (ISO) का प्रस्ताव रखा है, जो सत्यापित पुरस्कारों के साथ पुनर्बल सीखने (RLVR) के लिए एक फ्रेमवर्क है जो मॉडल वजन स्पेक्ट्रा को स्थिर रखते हुए इनपुट और आउटपुट सिंगुलर फ्रेम को ऑप्टिमाइज़ करके अनुपस्थित ऑप्टिमाइज़ेशन परत को संबोधित करता है।
इस दृष्टिकोण में ISO-Merger शामिल है, जो विशेष क्षमताओं को एक ही मॉडल में मिलाता है बिना पोस्ट-मर्ज डेटा या ग्रेडिएंट अपडेट के, और ISO-Optimizer, जो फ्रेम चरों पर AdamW जैसे मानक ऑप्टिमाइज़र लागू करता है। Qwen3-8B-Base पर, ISO-AdamW ने केवल 100 प्रशिक्षण चरणों में 0.495 का संचयी सटीकता हासिल किया, जबकि मानक AdamW को 270 चरणों की आवश्यकता थी, और अंततः 210 चरणों के बाद 0.509 तक पहुँचा।
ISO मूल मॉडल के स्पेक्ट्रम को विरासत में लेने और केवल पुरस्कार-चालित परिवर्तनों से जुड़े फ्रेम को ऑप्टिमाइज़ करके प्रशिक्षणोपरान्त अनुकूलन के लिए एक ठोस विधि प्रदान करता है।