Peneliti mengusulkan Isospectral Optimization (ISO), sebuah kerangka kerja untuk Pembelajaran Penguatan dengan Had Terverifikasi (RLVR) yang mengatasi lapisan optimasi yang hilang dengan menjaga spektrum bobot model tetap sambil mengoptimalkan frame singular input dan output.
Pendekatan ini mencakup ISO-Merger, yang menggabungkan kemampuan spesialis menjadi satu model tanpa data pasca-penggabungan atau pembaruan gradien, dan ISO-Optimizer, yang menerapkan optimizer standar seperti AdamW ke variabel frame. Pada Qwen3-8B-Base, ISO-AdamW mencocokkan akurasi agregat 0.495 hanya dalam 100 langkah pelatihan dibandingkan dengan 270 untuk AdamW standar, akhirnya mencapai 0.509 setelah 210 langkah.
ISO menyediakan metode konkret untuk adaptasi pasca-pelatihan dengan mewarisi spektrum model dasar dan mengoptimalkan hanya frame yang terkait dengan perubahan yang didorong oleh hadiah.