Adaption Labs推出了“Invent a Dataset”功能,该功能可直接从自然语言任务描述生成结构化、可用于训练的数据集,无需种子语料库、预定义模式或标注指南。该工具可通过Adaption应用、Python SDK和REST API使用,用户可下载生成的行数据,格式包括JSONL、JSON、CSV或Parquet。
- 单次调用`datasets.invent`即可启动异步生成过程,通过领域代码(例如医疗)和子领域进行控制。
- 输出格式包括用于监督微调的`instruction_dataset`以及用于基于偏好的训练(如DPO)的`preference_pairs`。
- API支持通过`translate`或`localize`模式进行语言扩展,采样率可在0.01到1之间配置。
- 生产参数包括用于信用检查的`estimate`模式、10,000个字符的提示长度限制以及用于安全重试的幂等键。
- 生成的数据集ID可直接输入AutoScientist,后者会根据用户目标协同优化数据与训练配方。
Adaption报告称,在此工作流中使用AutoScientist比手动配置的训练平均提升35%,在Together AI提供的架构上,八个垂直领域的胜率从48%提升至64%。