Les chercheurs proposent Isospectral Optimization (ISO), un cadre pour l'apprentissage par renforcement avec récompenses vérifiables (RLVR) qui comble la couche d'optimisation manquante en maintenant fixes les spectres de poids du modèle tout en optimisant les cadres singuliers d'entrée et de sortie.

L'approche inclut ISO-Merger, qui combine des capacités spécialisées en un seul modèle sans données post-fusion ni mises à jour de gradient, et ISO-Optimizer, qui applique des optimiseurs standard comme AdamW aux variables de cadre. Sur Qwen3-8B-Base, ISO-AdamW a atteint une précision agrégée de 0.495 en seulement 100 étapes d'entraînement par rapport à 270 pour AdamW standard, atteignant finalement 0.509 après 210 étapes.

ISO fournit une méthode concrète pour l'adaptation post-entraînement en héritant du spectre du modèle de base et en optimisant uniquement les cadres associés aux changements pilotés par la récompense.