Adaption Labs ha presentado "Invent a Dataset", una función que genera conjuntos de datos estructurados y listos para el entrenamiento directamente a partir de descripciones de tareas en lenguaje natural, sin necesidad de un corpus inicial, un esquema predefinido ni una guía de etiquetado. La herramienta está disponible a través de la aplicación Adaption, el SDK de Python y la API REST, permitiendo a los usuarios descargar las filas generadas en formatos JSONL, JSON, CSV o Parquet.
- Una única llamada a `datasets.invent` inicia la generación asíncrona, controlada por códigos de dominio (por ejemplo, médico) y subdominios.
- Los formatos de salida incluyen `instruction_dataset` para el ajuste fino supervisado y `preference_pairs` para el entrenamiento basado en preferencias como DPO.
- La API admite la expansión de idiomas mediante los modos `translate` o `localize`, con una tasa de muestreo configurable entre 0.01 y 1.
- Los parámetros de producción incluyen un modo `estimate` para verificar créditos, un límite de prompt de 10.000 caracteres y claves de idempotencia para reintentos seguros.
- Los IDs de los conjuntos de datos generados se alimentan directamente en AutoScientist, que optimiza conjuntamente los datos y las recetas de entrenamiento frente a los objetivos del usuario.
Adaption informa de que el uso de AutoScientist con este flujo de trabajo supera al entrenamiento configurado manualmente en un promedio del 35%, aumentando las tasas de victoria del 48% al 64% en ocho verticales en las arquitecturas ofrecidas por Together AI.