L'auteur propose l'hypothèse selon laquelle les traces d'échec des agents utilisant des outils, telles que des sélections d'outils erronées ou des arguments malformés, peuvent constituer des données précieuses pour le réglage afin d'entraîner les modèles à éviter ces erreurs. L'article cherche à recueillir l'avis de la communauté sur l'efficacité ou les effets néfastes de l'entraînement sur des traces d'échec corrigées.
- L'auteur s'interroge sur le fait que les traces d'échec « corrigées » soient de qualité inférieure car la correction est déduite plutôt que vérifiée.
- Un défi majeur identifié consiste à déterminer quels échecs ont des correctibles dérivables uniquement de la trace, par opposition à ceux nécessitant une vérité terrain externe.
- L'auteur a développé un outil en ligne de commande appelé trace2train pour tester cela, en détectant les échecs et en générant des fichiers JSONL SFT/DPO de LLaMA-Factory.
L'article vise à déterminer si l'utilisation des traces d'échec des agents pour le réglage fin est une stratégie viable ou une idée reconnue comme mauvaise.