Исследователи представляют Зону Проксимальной Оптимизации Политики (ZPPO), метод, который внедряет знания учителя в промпты, а не в градиенты политики, чтобы устранить хрупкость при дистилляции знаний и дрейф в обучении с подкреплением. ZPPO формирует Бинарные Вопросы с Включённым Кандидатом (BCQ) и Негативные Вопросы с Включённым Кандидатом (NCQ) для сложных вопросов, повторно используя их через буфер воспроизведения до тех пор, пока точность студента не улучшится или они не будут исключены.
- ZPPO объединяет один правильный ответ учителя с неправильным ответом студента в BCQ для принуждения к дискриминации, тогда как NCQ агрегируют ошибки студента, чтобы выявить общие режимы ошибок.
- Метод был протестирован на семействе Qwen3.5 в масштабах от 0.8B до 9B с использованием учителя размером 27B.
- Оценка охватила набор из 31 бенчмарка, включая 16 задач VLM, 10 LLM и 5 видеозадач.
- ZPPO превзошёл дистилляцию off/on-policy и GRPO, при этом наибольшие улучшения наблюдались на наименьшем масштабе модели.
Сохраняя учителя внутри промпта, а не в градиенте политики, ZPPO избегает нарушения предположений on-policy, одновременно усиливая обучение в текущей зоне ближайшего развития студента.