Исследователи предлагают Isospectral Optimization (ISO), фреймворк для обучения с подкреплением по верифицируемым наградам (RLVR), который устраняет недостающий слой оптимизации за счёт фиксации спектров весов модели при оптимизации входных и выходных сингулярных кадров.

Подход включает ISO-Merger, объединяющий специализированные возможности в единую модель без пост-слияния данных или обновлений градиентов, и ISO-Optimizer, применяющий стандартные оптимизаторы, такие как AdamW, к переменным кадров. На модели Qwen3-8B-Base ISO-AdamW достиг совокупной точности 0.495 всего за 100 шагов обучения по сравнению с 270 шагами для стандартного AdamW, в конечном итоге достигнув 0.509 после 210 шагов.

ISO предоставляет конкретный метод пост-обучения адаптации путём наследования спектра базовой модели и оптимизации только кадров, связанных с изменениями, обусловленными наградами.