Pesquisadores propõem a Isospectral Optimization (ISO), um framework para Aprendizado por Reforço com Recompensas Verificáveis (RLVR) que aborda a camada de otimização ausente ao manter os espectros de pesos do modelo fixos enquanto otimiza os quadros singulares de entrada e saída.
A abordagem inclui o ISO-Merger, que combina capacidades especializadas em um único modelo sem dados pós-fusão ou atualizações de gradiente, e o ISO-Optimizer, que aplica otimizadores padrão como AdamW às variáveis do quadro. No Qwen3-8B-Base, o ISO-AdamW igualou uma precisão agregada de 0.495 em apenas 100 passos de treinamento em comparação com 270 para o AdamW padrão, eventualmente alcançando 0.509 após 210 passos.
O ISO fornece um método concreto para adaptação pós-treinamento ao herdar o espectro do modelo base e otimizar apenas os quadros associados a mudanças impulsionadas por recompensas.