Adaption Labs a introduit « Invent a Dataset », une fonctionnalité qui génère des ensembles de données structurés et prêts pour l'entraînement directement à partir de descriptions de tâches en langage naturel, sans nécessiter de corpus initial, de schéma prédéfini ou de guide d'étiquetage. L'outil est disponible via l'application Adaption, le SDK Python et l'API REST, permettant aux utilisateurs de télécharger les lignes générées au format JSONL, JSON, CSV ou Parquet.

  • Un seul appel à `datasets.invent` lance la génération asynchrone, contrôlée par des codes de domaine (par exemple, médical) et des sous-domaines.
  • Les formats de sortie incluent `instruction_dataset` pour le fine-tuning supervisé et `preference_pairs` pour l'entraînement basé sur les préférences comme DPO.
  • L'API prend en charge l'expansion linguistique via les modes `translate` ou `localize`, avec un taux d'échantillonnage configurable entre 0,01 et 1.
  • Les paramètres de production incluent un mode `estimate` pour la vérification des crédits, une limite de prompt de 10 000 caractères et des clés d'idempotence pour des retours en toute sécurité.
  • Les ID des ensembles de données générés alimentent directement AutoScientist, qui co-optimalise les données et les recettes d'entraînement par rapport aux objectifs de l'utilisateur.

Adaption signale que l'utilisation d'AutoScientist avec ce flux de travail surpasse l'entraînement configuré manuellement en moyenne de 35 %, augmentant les taux de victoire de 48 % à 64 % sur huit verticales, sur des architectures proposées par Together AI.