Тема · Training data
arxiv arXiv cs.AI · 5 ч назад · 10 просмотров

VideoX-Qwen представляет центрированную на данных структуру для редактирования видео по инструкциям

Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.

media Hugging Face Forums · 5 д назад · 10 просмотров

Набор данных для оценки предпочтений и безопасности LLM в сфере здравоохранения на хауса

Компьютерный лингвист и специалист по обработке естественного языка на языке хауса представил новый набор данных, предназначенный для оценки больших языковых моделей в контексте здравоохранения и безопасности на языке хауса.

media Hugging Face Forums · 5 д назад · 11 просмотров

FlyEye выпускает escape-neuron-v1: компактный граф из 3 376 нейронов и 78 797 рёбер, полученный из MaleCNS

Проект FlyEye опубликовал первый компактный датасет на уровне нейронов вместе с браузерным и runtime-набором для разработчиков. Этот релиз включает датасет Tubban/flyeye-escape-neuron-v1, размещённый на Hugging Face.

media MarkTechPost · 18 д назад · 27 просмотров

Adaption Labs выпускает «Invent a Dataset» для генерации обучающих данных по описаниям задач

Компания Adaption Labs представила функцию «Invent a Dataset», которая генерирует структурированные наборы данных, готовые к обучению, непосредственно из текстовых описаний задач на естественном языке, без необходимости наличия начального корпуса, заранее определённой схемы или руководства по разметке. Инструмент доступен через приложение Adaption, Python SDK и REST API, позволяя пользователям скачивать сгенерированные строки в форматах JSONL, JSON, CSV или Parquet.

arxiv arXiv cs.CL · 21 д назад · 17 просмотров

TrialGPT 2.0 повышает эффективность и доступность подбора клинических испытаний в многоцентровой оценке

Авторы представляют TrialGPT 2.0, систему рекомендаций по клиническим испытаниям с поддержкой ИИ, предназначенную для развертывания в реальных условиях, которая оценивает, какие испытания заслуживают рассмотрения на основе потребностей пациентов и приоритетов рабочего процесса.

media Hugging Face Forums · 23 д назад · 29 просмотров

Руководство: Создание и обучение байтового BPE-токенизатора с нуля

Новое руководство описывает пошаговый процесс создания и обучения байтового BPE-токенизатора, основанного на первых принципах. В руководстве рассматриваются ключевые детали реализации, такие как предварительная токенизация с учетом Unicode, инкрементное обновление частоты пар и использование максимальной кучи с ленивым удалением.

lab Hugging Face Blog · 25 д назад · 36 просмотров

В рейтинг Open ASR добавлены датасеты Monsoon для хинди и индийского английского

Рейтинг Open ASR представил свои первые языки Глобального Юга с двумя новыми наборами данных для оценки: Monsoon en-IN (индийский английский) и Monsoon hi-IN (хинди). Эти дополнения устраняют недостаток демографического разнообразия в текущих бенчмарках, которые исторически фокусировались на европейских языках.

media Hugging Face Forums · 26 д назад · 24 просмотра

omertt27 выпустил Calibra для наблюдаемости и выбора корсета в датасетах робототехники

Автор выпустил Calibra, инструмент, предназначенный для выявления плохих демонстраций в наборах данных имитационного обучения робототехники до того, как они потребляют ресурсы GPU.

media Hugging Face Forums · 28 д назад · 40 просмотров

Harmonic Frontier выпускает превью датасета Celtic Constellation Reference Sessions

Harmonic Frontier опубликовала превью датасета Celtic Constellation Reference Sessions, содержащего выровненные многодорожечные записи традиционных и современных аранжировок кельтских ансамблей. Архитектура состоит из выровненных пар, где каждый трек включает сухие изолированные стемы, одну и ту же запись, обработанную через производственный цепочку, и готовый микс.

media Hugging Face Forums · 29 д назад · 38 просмотров

vldmrbesk выпускает архив Циолковского из 51 тыс. листов с измеренной точностью распознавания

Опубликован полный личный архив Константина Циолковского, включающий 51 008 листов и 2 019 архивных файлов, в формате набора данных CC0. Коллекция охватывает пятьдесят лет работы самоучки-теоретика ракетостроения и включает рукописные тексты наряду с печатными копиями.