يقترح الباحثون Isospectral Optimization (ISO)، وهو إطار لتعلم التعزيز مع المكافآت القابلة للتحقق (RLVR) يعالج طبقة التحسين المفقودة عن طريق الحفاظ على أطياف أوزونة النموذج ثابتة أثناء تحسين الإطارات المفردة للإدخال والإخراج.

تشمل النهج ISO-Merger، الذي يدمج قدرات متخصصة في نموذج واحد دون بيانات ما بعد الدمج أو تحديثات التدرج، وISO-Optimizer، الذي يطبق محسّنات قياسية مثل AdamW على متغيرات الإطار. على Qwen3-8B-Base، حقق ISO-AdamW دقة مجمعة تبلغ 0.495 في 100 خطوة تدريب فقط مقارنة بـ 270 لـ AdamW القياسي، وصولاً في النهاية إلى 0.509 بعد 210 خطوة.

يوفر ISO طريقة ملموسة للتكيف ما بعد التدريب عن طريق توريث طيف النموذج الأساسي وتحسين الإطارات المرتبطة بالتغيرات المدفوعة بالمكافأة فقط.