研究者たちは、検証可能な報酬による強化学習(RLVR)のためのフレームワークであるIsospectral Optimization(ISO)を提案しました。これは、入力と出力の特異フレームを最適化しながらモデル重みスペクトルを固定することで、欠落していた最適化層に対応します。

このアプローチには、専門的な能力をマージ後のデータや勾配更新なしで単一モデルに統合するISO-Mergerと、フレーム変数にAdamWなどの標準オプティマイザを適用するISO-Optimizerが含まれます。Qwen3-8B-Baseにおいて、ISO-AdamWは標準的なAdamWの270ステップに対してわずか100トレーニングステップで総合精度0.495を達成し、最終的に210ステップ後に0.509に達しました。

ISOは、ベースモデルのスペクトルを継承し、報酬駆動の変化に関連するフレームのみを最適化することで、トレーニング後の適応のための具体的な方法を提供します。