Исследователи представляют PLVR (Program Learning with Verifiable Rewards), метод постобучения, который обучает явные программы рассуждений, состоящие из детерминированных и нейронных примитивов, вместо обновления весов модели. Подход использует символическое обратное распространение, где распределение заслуг выполняется через вывод типов по сигнатурам примитивов, а не через оценку.

  • На LiveCodeBench v6 и Tau2Bench базовые модели 30B с PLVR превосходят обучение с подкреплением в среднем на 27.8 баллов при сопоставимом бюджете.
  • Метод также превосходит передовые модели, превышающие его по размеру в десять раз, на 13.6 балла.
  • Одна библиотека примитивов обслуживает оба бенчмарка, требуя всего 100 примеров для новых задач без дополнительных данных для дообучения.
  • Эксперименты показывают, что обратный проход является источником преимущества перед равномерной выборкой.

Авторы выпускают библиотеку символического обратного распространения и проверщик соответствия, чтобы позволить применение к другим библиотекам примитивов.