Шебхан Анвер выложил в открытый доступ Agent-ProSAT, конвейер, который генерирует наборы данных с цепочкой рассуждений (CoT), заставляя агента писать код и итеративно улучшать верифицируемые программные решатели вместо того, чтобы полагаться на текст, сгенерированный моделью.
- Система использует самокорректирующие циклы для проверки логической корректности относительно эталонных данных и отложенных выборок.
- Она была протестирована в рамках NVIDIA’s Nemotron Reasoning Challenge на логических головоломках из «Алисы в Стране чудес» для проверки пространственных и логических ограничений.
- Подход направлен на снижение рисков галлюцинаций и улучшение использования токенов в конвейерах SFT/RL посредством программной проверки.
Автор делится кодовой базой, ноутбуком Kaggle для тонкой настройки и полученным набором данных ProSAT CoT на Hugging Face.