研究人员提出了等谱优化(Isospectral Optimization, ISO),这是一个针对可验证奖励强化学习(RLVR)的框架,通过在优化输入和输出奇异帧的同时保持模型权重谱固定,解决了缺失的优化层问题。
该方法包括ISO-Merger,它将专家能力合并到单个模型中,无需后融合数据或梯度更新;以及ISO-Optimizer,它对帧变量应用AdamW等标准优化器。在Qwen3-8B-Base上,ISO-AdamW仅用100个训练步骤就达到了0.495的综合准确率,而标准AdamW需要270步,最终在210步后达到0.509。
ISO通过继承基础模型的谱并仅优化与奖励驱动变化相关的帧,为训练后适应提供了一种具体方法。