Шебхан Анвер выложил в открытый доступ Agent-ProSAT, конвейер, который генерирует наборы данных с цепочкой рассуждений (CoT), заставляя агента писать код и итеративно улучшать верифицируемые программные решатели вместо того, чтобы полагаться на текст, сгенерированный моделью.

  • Система использует самокорректирующие циклы для проверки логической корректности относительно эталонных данных и отложенных выборок.
  • Она была протестирована в рамках NVIDIA’s Nemotron Reasoning Challenge на логических головоломках из «Алисы в Стране чудес» для проверки пространственных и логических ограничений.
  • Подход направлен на снижение рисков галлюцинаций и улучшение использования токенов в конвейерах SFT/RL посредством программной проверки.

Автор делится кодовой базой, ноутбуком Kaggle для тонкой настройки и полученным набором данных ProSAT CoT на Hugging Face.