Исследователи предлагают метод неконтролируемой самодистилляции на основе текущей политики (U-OPSD), который обеспечивает улучшение после дообучения больших языковых моделей исключительно за счёт собственных генераций модели без внешнего контроля. Подход выбирает несколько последовательностей для построения псевдорешения с помощью большинства голосов, а затем дистиллирует распределение учителя в префиксы самого длинного неверного завершения модели.
- U-OPSD улучшает базовые модели на 8,5% и 10,7% в режиме без размышлений Qwen3 при масштабах 4B и 8B по таким бенчмаркам, как AIME24, MATH500 и AMC23.
- Он превосходит методы с контролем, такие как OPSD, в среднем на 3,2% и 2,3% в режиме без размышлений.
- В режиме с размышлениями U-OPSD соответствует или превосходит OPSD и GRPO, превосходя последний до 1,1% при масштабе 8B.
Этот метод демонстрирует, что настоящая самодистилляция возможна через внутреннюю согласованность, предлагая конкурентоспособную альтернативу сигналам контролируемого обучения.