저자는 잘못된 도구 선택이나 비정상적인 인수와 같은 실패한 도구 사용 에이전트 트레이스가 이러한 오류로부터 모델을 학습시키는 데 가치 있는 파인튜닝 데이터가 될 수 있다는 가설을 제시합니다. 이 게시물은 수정된 실패 트레이스에서의 학습이 효과적인지 해로운지에 대한 커뮤니티 피드백을 구합니다.

  • 저자는 "수정된" 실패 트레이스가 검증되지 않고 추론된 수정으로 인해 품질이 낮을 수 있는지 의문을 제기합니다.
  • 식별된 주요 과제는 트레이스만으로 도출 가능한 수정이 있는 실패와 외부 정답이 필요한 실패를 어떻게 구분하느냐입니다.
  • 저자는 이 가설을 테스트하기 위해 실패를 감지하고 LLaMA-Factory SFT/DPO JSONL 파일을 출력하는 trace2train이라는 CLI 도구를 구축했습니다.
  • 이 도구는 트레이스에서 수정을 도출할 수 없는 경우 신뢰성 있는 잘못된 라벨이 생성되는 것을 피하기 위해 학습 쌍 생성을 건너뜁니다.

이 게시물은 실패한 에이전트 트레이스를 파인튜닝에 사용하는 것이 실현 가능한 전략인지 아니면 이미 알려진 나쁜 아이디어인지 결정하는 것을 목표로 합니다.