एडैप्शन लैब्स ने "इनवेंट ए डेटासेट" पेश किया है, एक सुविधा जो बीज कॉरपस, पूर्वनिर्धारित स्कीमा या लेबलिंग गाइड की आवश्यकता के बिना प्राकृतिक भाषा कार्य विवरणों से सीधे संरचित, प्रशिक्षण-तैयार डेटासेट उत्पन्न करती है। यह टूल एडैप्शन ऐप, पायथन एसडीके और रेस्ट एपीआई के माध्यम से उपलब्ध है, जिससे उपयोगकर्ता JSONL, JSON, CSV या Parquet प्रारूपों में उत्पन्न पंक्तियाँ डाउनलोड कर सकते हैं।

  • `datasets.invent` को एक बार कॉल करने पर डोमेन कोड (जैसे, चिकित्सा) और उप-डोमेन द्वारा नियंत्रित अतुल्यकालिक जनरेशन शुरू होता है।
  • आउटपुट प्रारूपों में सुपरवाइज्ड फाइन-ट्यूनिंग के लिए `instruction_dataset` और DPO जैसी प्राथमिकता-आधारित प्रशिक्षण के लिए `preference_pairs` शामिल हैं।
  • एपीआई 0.01 और 1 के बीच कॉन्फ़िगर करने योग्य नमूना दर के साथ `translate` या `localize` मोड के माध्यम से भाषा विस्तार का समर्थन करता है।
  • उत्पादन पैरामीटर में क्रेडिट जांच के लिए एक `estimate` मोड, 10,000-अक्षरों का प्रॉम्प्ट सीमा और सुरक्षित पुनः प्रयासों के लिए आइडेंपोटेंसी कुंजियाँ शामिल हैं।
  • उत्पन्न डेटासेट आईडी सीधे AutoScientist में जाती है, जो उपयोगकर्ता उद्देश्यों के खिलाफ डेटा और प्रशिक्षण रेसिपी का सह-अनुकूलन करता है।

एडैप्शन की रिपोर्ट के अनुसार, इस कार्यप्रवाह के साथ AutoScientist का उपयोग करने से मैन्युअल रूप से कॉन्फ़िगर किए गए प्रशिक्षण में औसतन 35% बेहतर प्रदर्शन होता है, जिससे Together AI द्वारा प्रदान की गई आर्किटेक्चर पर आठ खड़ीवनों में जीत की दरें 48% से बढ़कर 64% हो जाती हैं।