Los investigadores proponen Isospectral Optimization (ISO), un marco para el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) que aborda la capa de optimización faltante manteniendo fijos los espectros de pesos del modelo mientras se optimizan los marcos singulares de entrada y salida.
El enfoque incluye ISO-Merger, que combina capacidades especializadas en un solo modelo sin datos posteriores a la fusión ni actualizaciones de gradiente, e ISO-Optimizer, que aplica optimizadores estándar como AdamW a las variables del marco. En Qwen3-8B-Base, ISO-AdamW igualó una precisión agregada de 0.495 en solo 100 pasos de entrenamiento en comparación con 270 para AdamW estándar, alcanzando eventualmente 0.509 después de 210 pasos.
ISO proporciona un método concreto para la adaptación posterior al entrenamiento heredando el espectro del modelo base y optimizando solo los marcos asociados con cambios impulsados por recompensas.