O autor propõe a hipótese de que rastros de agentes que usam ferramentas e falham, como seleções incorretas de ferramentas ou argumentos malformados, podem servir como dados valiosos de ajuste fino para treinar modelos a se afastarem desses erros. O post busca feedback da comunidade sobre se o treinamento em rastros de falha corrigidos é eficaz ou prejudicial.
- O autor questiona se os rastros de falha "corrigidos" são de menor qualidade porque a correção é inferida em vez de verificada.
- Um desafio-chave identificado é determinar quais falhas têm correções deriváveis exclusivamente do rastro versus aquelas que exigem uma verdade fundamental externa.
- O autor construiu uma ferramenta de linha de comando chamada trace2train para testar isso, detectando falhas e gerando arquivos JSONL de SFT/DPO do LLaMA-Factory.
- A ferramenta ignora a geração de pares de treinamento quando a correção não pode ser derivada do rastro para evitar criar rótulos errados com confiança.
O objetivo do post é determinar se o uso de rastros de agentes com falha para ajuste fino é uma estratégia viável ou uma ideia conhecida como ruim.