लेखक एक परिकल्पना प्रस्तुत करते हैं कि विफल टूल-यूज़िंग एजेंट ट्रेस, जैसे गलत टूल चयन या अवैध तर्क, इन त्रुटियों से मॉडलों को दूर ले जाने के लिए फाइन-ट्यूनिंग डेटा के रूप में मूल्यवान हो सकते हैं। पोस्ट इस बात पर समुदाय की प्रतिक्रिया चाहता है कि सुधारी गई विफल ट्रेस पर प्रशिक्षण प्रभावी है या हानिकारक।

  • लेखक यह सवाल उठाते हैं कि क्या "सुधारी" गई विफल ट्रेस निम्न गुणवत्ता की हैं क्योंकि ठीक करना अनुमानित है न कि सत्यापित।
  • पहचानी गई एक प्रमुख चुनौती यह निर्धारित करना है कि कौन सी विफलताओं के लिए सुधार केवल ट्रेस से व्युत्पन्न किए जा सकते हैं और जिनके लिए बाहरी भू-सत्य की आवश्यकता है।
  • लेखक ने इसका परीक्षण करने के लिए trace2train नामक एक CLI टूल बनाया, जो विफलताओं का पता लगाता है और LLaMA-Factory SFT/DPO JSONL फ़ाइलें आउटपुट करता है।
  • जब सुधार ट्रेस से व्युत्पन्न नहीं किया जा सकता है, तो टूल प्रशिक्षण युग्मों को उत्पन्न करना छोड़ देता है ताकि आत्मविश्वास के साथ गलत लेबल न बनाए जाएं।

पोस्ट का उद्देश्य यह निर्धारित करना है कि फाइन-ट्यूनिंग के लिए विफल एजेंट ट्रेस का उपयोग करना एक व्यावहारिक रणनीति है या एक ज्ञात-खुतरनाक विचार।