Shehab Anwerは、モデル生成テキストに依存するのではなくエージェントがコードを書き検証可能なプログラムmaticソルバーを反復的に改善することでChain-of-Thought (CoT) データセットを生成するパイプラインであるAgent-ProSATをオープンソース化しました。
- システムは自己修正ループを使用して、グラウンドトゥルースとホールドアウトサンプルに対して論理的健全性を検証します。
- NVIDIAのNemotron Reasoning Challengeで「アリス・イン・ワンダーランド」の論理パズルを用いて空間的および論理的制約をテストするベンチマークが行われました。
- このアプローチは、プログラムmaticレビューを通じてSFT/RLパイプラインにおける幻覚リスクを低減し、トークン利用率を向上させることを目的としています。
著者はコードベース、ファインチューニング用のKaggleノートブック、およびHugging Face上の結果のProSAT CoTデータセットを共有しています。