Автор выдвигает гипотезу о том, что неудачные трассы агентов, использующих инструменты (например, неверный выбор инструментов или некорректные аргументы), могут служить ценными данными для тонкой настройки, чтобы обучать модели избегать этих ошибок. В статье запрашивается обратная связь от сообщества относительно того, является ли обучение на исправленных неудачных трассах эффективным или вредным.

  • Автор ставит под сомнение, являются ли "исправленные" неудачные трассы более низкого качества, поскольку исправление выводится, а не проверяется.
  • Ключевой проблемой является определение того, какие ошибки имеют исправления, выводимые исключительно из трассы, а для каких требуется внешняя эталонная информация.
  • Автор создал инструмент командной строки trace2train для проверки этой идеи путем обнаружения ошибок и вывода файлов JSONL формата SFT/DPO LLaMA-Factory.
  • Инструмент пропускает генерацию обучающих пар, когда исправление не может быть выведено из трассы, чтобы избежать создания уверенно неверных меток.

Цель статьи — определить, является ли использование неудачных трасс агентов для тонкой настройки жизнеспособной стратегией или заведомо плохой идеей.