أعلنت أدابتيون لابز عن ميزة "اخترع مجموعة بيانات"، التي تولّد مجموعات بيانات جاهزة للتدريب ومنظمة مباشرةً من أوصاف المهام باللغة الطبيعية دون الحاجة إلى مجموعة بذرة أو مخطط مسبق أو دليل تسمية. الأداة متاحة عبر تطبيق أدابتيون وواجهة SDK الخاصة بـ Python وواجهة REST API، مما يسمح للمستخدمين بتنزيل الصفوف المولّدة بصيغ JSONL أو JSON أو CSV أو Parquet.

  • يستدعي الاتصال الواحد بـ `datasets.invent` عملية توليد غير متزامنة، تُتحكَّم فيها بواسطة رموز المجال (مثل الطبي) والمجالات الفرعية.
  • تشمل مخرجات الصيغ `instruction_dataset` للتدريب الدقيق الخاضع للإشراف و`preference_pairs` للتدريب القائم على التفضيل مثل DPO.
  • تدعم واجهة API توسيع اللغة عبر وضعي `translate` أو `localize`، مع معدل عيّنة قابل للضبط يتراوح بين 0.01 و1.
  • تشمل معاملات الإنتاج وضع `estimate` للتحقق من الرصيد، وحدّ طول للمُدخلات يبلغ 10,000 حرف، ومفاتيح التكرار المحايد لإعادة المحاولات بأمان.
  • تُغذّى معرّفات مجموعات البيانات المولّدة مباشرةً في AutoScientist، الذي يُحسّن البيانات وصفوف التدريب بشكل مشترك ضد أهداف المستخدم.

تُفيد أدابتيون بأن استخدام AutoScientist ضمن هذا التدفق يتفوّق على التدريب المُهيأ يدوياً بنسبة 35% في المتوسط، مما يرفع معدلات الفوز من 48% إلى 64% عبر ثمانية قطاعات على البنى التي تقدّمها Together AI.