Shehab Anwer 开源了 Agent-ProSAT,这是一个通过让智能体编写代码并迭代改进可验证的程序化求解器(而非依赖模型生成的文本)来生成思维链 (CoT) 数据集的流水线。
- 该系统使用自我纠正循环,针对真实标签和保留样本验证逻辑健全性。
- 它在 NVIDIA 的 Nemotron Reasoning Challenge 上进行了基准测试,使用《爱丽丝梦游仙境》的逻辑谜题来测试空间和逻辑约束。
- 该方法旨在通过程序化审查降低幻觉风险,并提高 SFT/RL 流水线中的令牌利用率。
作者分享了代码库、用于微调的 Kaggle 笔记本以及 Hugging Face 上的 ProSAT CoT 数据集。