A Adaption Labs apresentou o "Invent a Dataset", um recurso que gera conjuntos de dados estruturados e prontos para treinamento diretamente a partir de descrições de tarefas em linguagem natural, sem exigir um corpus semente, esquema predefinido ou guia de rotulagem. A ferramenta está disponível por meio do aplicativo Adaption, SDK Python e API REST, permitindo que os usuários baixem as linhas geradas nos formatos JSONL, JSON, CSV ou Parquet.

  • Uma única chamada para `datasets.invent` inicia a geração assíncrona, controlada por códigos de domínio (por exemplo, médico) e subdomínios.
  • Os formatos de saída incluem `instruction_dataset` para ajuste fino supervisionado e `preference_pairs` para treinamento baseado em preferências como DPO.
  • A API suporta expansão de idiomas por meio dos modos `translate` ou `localize`, com uma taxa de amostragem configurável entre 0,01 e 1.
  • Os parâmetros de produção incluem o modo `estimate` para verificação de créditos, um limite de prompt de 10.000 caracteres e chaves de idempotência para tentativas seguras.
  • Os IDs dos conjuntos de dados gerados alimentam diretamente o AutoScientist, que co-otimiza os dados e as receitas de treinamento em relação aos objetivos do usuário.

A Adaption relata que usar o AutoScientist com este fluxo de trabalho supera o treinamento configurado manualmente em uma média de 35%, aumentando as taxas de vitória de 48% para 64% em oito verticais nas arquiteturas oferecidas pela Together AI.