Исследователи представляют PLVR (Program Learning with Verifiable Rewards), метод постобучения, который обучает явные программы рассуждений, состоящие из детерминированных и нейронных примитивов, вместо обновления весов модели. Подход использует символическое обратное распространение, где распределение заслуг выполняется через вывод типов по сигнатурам примитивов, а не через оценку.
- На LiveCodeBench v6 и Tau2Bench базовые модели 30B с PLVR превосходят обучение с подкреплением в среднем на 27.8 баллов при сопоставимом бюджете.
- Метод также превосходит передовые модели, превышающие его по размеру в десять раз, на 13.6 балла.
- Одна библиотека примитивов обслуживает оба бенчмарка, требуя всего 100 примеров для новых задач без дополнительных данных для дообучения.
- Эксперименты показывают, что обратный проход является источником преимущества перед равномерной выборкой.
Авторы выпускают библиотеку символического обратного распространения и проверщик соответствия, чтобы позволить применение к другим библиотекам примитивов.