研究人员介绍了 PLVR(Program Learning with Verifiable Rewards),这是一种后训练方法,它学习由确定性原语和神经原语组成的显式推理程序,而不是更新模型权重。该方法利用符号反向传播,其中信用分配通过原语签名的类型推断完成,而非估计。

  • 在 LiveCodeBench v6 和 Tau2Bench 上,配备 PLVR 的 30B 基础模型在预算匹配的情况下平均比强化学习高出 27.8 分。
  • 该方法还以 13.6 分的优势超越了规模大一个数量级的前沿模型。
  • 单个原语库同时服务于这两个基准测试,仅需 100 个示例即可处理新任务,无需额外的微调数据。
  • 实验确定反向传播是相对于均匀采样的优势来源。

作者发布了一个符号反向传播库和一致性检查器,以允许将其应用于其他原语库。