연구자들은 검증 가능한 보상 강화 학습(RLVR)을 위한 프레임워크인 Isospectral Optimization (ISO)을 제안했습니다. 이는 입력 및 출력 특이 프레임을 최적화하는 동안 모델 가중치 스펙트럼을 고정하여 누락된 최적화 계층을 해결합니다.

이 접근 방식에는 사후 병합 데이터나 그래디언트 업데이트 없이 전문가 기능을 단일 모델로 결합하는 ISO-Merger와 프레임 변수에 AdamW와 같은 표준 옵티마이저를 적용하는 ISO-Optimizer가 포함됩니다. Qwen3-8B-Base에서 ISO-AdamW는 표준 AdamW의 270단계 대비 단 100개의 학습 단계 만에 집계 정확도 0.495를 달성했으며, 최종적으로 210단계 후에 0.509에 도달했습니다.

ISO는 기본 모델의 스펙트럼을 상속하고 보상 기반 변화와 관련된 프레임만 최적화하여 사후 훈련 적응을 위한 구체적인 방법을 제공합니다.