El autor propone la hipótesis de que las trazas de agentes que utilizan herramientas y fallan, como selecciones incorrectas de herramientas o argumentos malformados, pueden servir como valiosos datos de ajuste fino para entrenar modelos a alejarse de estos errores. La publicación busca retroalimentación de la comunidad sobre si el entrenamiento con trazas de fallo corregidas es efectivo o perjudicial.

  • El autor cuestiona si las trazas de fallo "corregidas" son de menor calidad porque la corrección se infiere en lugar de verificarse.
  • Un desafío clave identificado es determinar qué fallos tienen correcciones derivables únicamente de la traza frente a aquellos que requieren una verdad fundamental externa.
  • El autor construyó una herramienta de línea de comandos llamada trace2train para probar esto detectando fallos y generando archivos JSONL de SFT/DPO de LLaMA-Factory.
  • La herramienta omite la generación de pares de entrenamiento cuando la corrección no puede derivarse de la traza para evitar crear etiquetas incorrectas con confianza.

La publicación tiene como objetivo determinar si el uso de trazas de agentes fallidos para el ajuste fino es una estrategia viable o una idea conocida por ser mala.