Компания Adaption Labs представила функцию «Invent a Dataset», которая генерирует структурированные наборы данных, готовые к обучению, непосредственно из текстовых описаний задач на естественном языке, без необходимости наличия начального корпуса, заранее определённой схемы или руководства по разметке. Инструмент доступен через приложение Adaption, Python SDK и REST API, позволяя пользователям скачивать сгенерированные строки в форматах JSONL, JSON, CSV или Parquet.
- Один вызов `datasets.invent` запускает асинхронную генерацию, управляемую кодами домена (например, медицинский) и субдоменами.
- Форматы вывода включают `instruction_dataset` для контролируемой тонкой настройки и `preference_pairs` для обучения на основе предпочтений, такого как DPO.
- API поддерживает расширение языков через режимы `translate` или `localize` с настраиваемой частотой выборки от 0.01 до 1.
- Параметры производства включают режим `estimate` для проверки кредитов, ограничение промпта в 10 000 символов и ключи идемпотентности для безопасных повторных попыток.
- Идентификаторы сгенерированных наборов данных напрямую передаются в AutoScientist, который совместно оптимизирует данные и рецепты обучения в соответствии с целями пользователя.
Adaption сообщает, что использование AutoScientist в этом рабочем процессе превосходит ручную настройку обучения в среднем на 35%, увеличивая частоту побед с 48% до 64% по восьми отраслям на архитектурах, предлагаемых Together AI.