Adaption Labs는 시드 코퍼스, 사전 정의된 스키마, 또는 라벨링 가이드 없이 자연어 작업 설명에서 구조화된 훈련 준비 완료 데이터셋을 직접 생성하는 기능인 "Invent a Dataset"을 소개했습니다. 이 도구는 Adaption 앱, Python SDK 및 REST API를 통해 사용할 수 있으며, 사용자는 JSONL, JSON, CSV 또는 Parquet 형식으로 생성된 행을 다운로드할 수 있습니다.
- `datasets.invent`에 대한 단일 호출은 도메인 코드(예: 의료) 및 하위 도메인에 의해 제어되는 비동기 생성을 시작합니다.
- 출력 형식에는 지도 학습 미세 조정을 위한 `instruction_dataset`과 DPO와 같은 선호도 기반 훈련을 위한 `preference_pairs`가 포함됩니다.
- API는 0.01에서 1 사이의 구성 가능한 샘플률을 가진 `translate` 또는 `localize` 모드를 통해 언어 확장을 지원합니다.
- 프로덕션 매개변수에는 크레딧 확인을 위한 `estimate` 모드, 10,000자 프롬프트 제한 및 안전한 재시도를 위한 멱등성 키가 포함됩니다.
- 생성된 데이터셋 ID는 AutoScientist에 직접 피드되어 사용자 목표에 대해 데이터와 훈련 레시피를 공동 최적화합니다.
Adaption은 이 워크플로우에서 AutoScientist를 사용하는 것이 수동으로 구성된 훈련보다 평균 35% 더 우수하며, Together AI가 제공하는 아키텍처에서 여덟 가지 수직 분야 전반의 승률을 48%에서 64%로 증가시킨다고 보고합니다.