Training data
media Hugging Face Forums · 6 д назад

OpenGauntlet публикует каталог из 168 систем TTS и 106 систем STT

Исследователь опубликовал исследовательский каталог OpenGauntlet, открытый ресурс, содержащий информацию о 168 системах преобразования текста в речь (TTS) и 106 системах преобразования речи в текст (STT). Каталог включает модели с открытым исходным кодом и размещенные модели, лицензии, требования к оборудованию, языки, возможности, статус жизненного цикла, информацию об источнике и опубликованные данные бенчмарков, где они доступны.

media Hugging Face Forums · 7 д назад · 1 просмотр

Ежемесячная матрица соответствия показывает, что 65% из 4893 индийских наборов данных не имеют лицензионных тегов

Опубликована ежемесячно обновляемая матрица соответствия для всех 4893 наборов данных на языках Индии на Hugging Face Hub, которая показывает, что по состоянию на 1 августа 2026 года 65,1% не имеют лицензионного тега.

media Hugging Face Forums · 7 д назад

Calibra v0.7.1 добавляет проверки целостности датасетов для обучения роботов

Calibra v0.7.1 вводит новый этап проверки целостности датасета (Dataset Integrity), который выполняется перед анализом качества и покрытия, чтобы помочь пользователям убедиться в достоверности их робототехнических датасетов.

media Hugging Face Forums · 12 д назад · 2 просмотра

Calibra: инструмент с открытым исходным кодом для наблюдаемости наборов данных роботов

Calibra — это инструмент с открытым исходным кодом, предназначенный для помощи исследователям в аудите наборов данных роботов и выявлении проблем с качеством перед обучением политик. Первый публичный релиз включает интерактивное пространство Robot Dataset Health Check для аудита наборов данных LeRobot и бенчмарк из 30 публичных наборов данных LeRobot с оценками здоровья.

media Hugging Face Forums · 12 д назад · 3 просмотра

Huggy Engine выпустила Huggy Database — крупнейший открытый датасет по французским скачкам

Huggy Engine опубликовала Huggy Database на платформе Hugging Face, описывая её как самый большой открытый набор данных по французским скачкам. Публикация предоставляет 30 лет полных ежедневных данных за период с 1996 по 2026 год для использования в приложениях машинного обучения.

media r/LocalLLaMA · 16 д назад · 4 просмотра

Hugging Face выпустила The Stack v3 — крупнейший открытый датасет кода

Hugging Face выпустила The Stack v3, описываемую как крупнейший на сегодняшний день открытый датасет кода. Выпуск предоставляет два различных способа доступа для удовлетворения потребностей разных пользователей.

media Hugging Face Forums · 23 д назад · 3 просмотра

louidev выпускает GlassBallAI — набор данных с временной блокировкой прогнозов Gemini для изучения поведения LLM

louidev выпустил набор данных GlassBallAI на платформе Hugging Face, фиксирующий поведение прогнозирования в реальном времени моделей Google Gemini до того, как станут известны результаты. Набор данных содержит более 3655 строк, собранных с 17 февраля по 19 мая 2026 года, охватывающих модели Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite и 3.0 Flash Preview.

lab IBM Research (Granite) · 23 д назад HumanEval · 83.5%

IBM открыла исходные коды CodeAlchemy — масштабного синтетического набора данных высококачественного кода

IBM открыла исходные коды CodeAlchemy, конвейера и синтетического набора данных, предназначенных для улучшения производительности ИИ-моделей за счёт сопоставления кода с трассами выполнения. В релиз включено почти 1 триллион токенов по 15 языкам программирования, что как минимум в 200 раз превышает объём Wikipedia.

media Hugging Face Forums · 24 д назад

Обсуждение обработки узких мест в данных для научных ML-симуляций

Пользователь делится опытом вычислительной стоимости генерации обучающих наборов данных на основе физических симуляций, таких как течение жидкости и структурные поля. Он подчеркивает, что основная проблема заключается не в архитектуре модели, а в сложности создания большого и разнообразного набора данных, когда каждый образец дорого получать.

arxiv arXiv cs.LG · 24 д назад

CSFS снижает стоимость отбора признаков для прогнозирования ветровой и солнечной энергии на 21%

Исследователи предлагают кластеризационный последовательный отбор признаков (CSFS), новый обёрточный метод на основе кластеризации для автоматического и эффективного отбора признаков в конвейерах прогнозирования возобновляемой энергии. Этот подход решает проблему отсутствия систематических методов для выбора входных признаков из большого количества доступных переменных мониторинга и окружающей среды.

arxiv arXiv cs.AI · 24 д назад

CSFS снижает вычислительные затраты на 21% при прогнозировании возобновляемой энергии

Исследователи предлагают кластерный последовательный отбор признаков (CSFS), новый обобщённый метод-обёртку, предназначенный для решения проблемы отсутствия систематического отбора признаков в прогнозировании мощности ветряных и солнечных электростанций. Подход направлен на обеспечение автоматического, эффективного и надёжного отбора признаков для конвейеров обработки данных возобновляемой энергии.

arxiv arXiv cs.AI · 24 д назад · 1 просмотр

ViHoRec: Контролируемый набор данных для рекомендации отелей во Вьетнаме и бенчмарк для задачи холодного старта

Исследователи представляют ViHoRec, открытый набор данных из 18 267 взаимодействий между 6 832 пользователями и 560 отелями для рекомендации отелей во Вьетнаме. Ресурс решает проблемы разрешения сущностей между платформами и конфиденциального раскрытия данных с использованием псевдонимов HMAC.

arxiv arXiv cs.AI · 24 д назад

FormalAnalyticGeo генерирует мультимодальные задачи аналитической геометрии с помощью нейросимволического конвейера

Исследователи представляют FormalAnalyticGeo, масштабируемую систему для полностью автоматической генерации мультимодальных задач аналитической геометрии, устраняющую необходимость в ручной аннотации. Система использует формальное промежуточное представление под названием CDL для связывания текста задачи с точной визуализацией диаграммы через движок поля расстояний (Signed Distance Field).

media Hugging Face Forums · 24 д назад

Исследователи используют ДНК-оригами для кодирования секретных сообщений в наноазбуку Морзе

Исследователи разработали метод биомолекулярной криптографии, который использует ДНК-оригами для преобразования секретных сообщений в наноазбуку Морзе. Этот подход направлен на защиту информации с помощью биологических молекул, а не традиционных компьютерных криптографических алгоритмов.

media Hugging Face Forums · 26 д назад · 2 просмотра

Создатель выводит датасет эмоций эмодзи из Ортогональной модели эмоций

Пользователь создал производный датасет на основе «Ортогональной модели эмоций», удалив одно измерение и заменив онтологические метки кластеров 10 категориями эмодзи.

arxiv arXiv cs.CL · 26 д назад · 1 просмотр

Исследователи выпустили датасет ICSL для распознавания бразильского жестового языка в автомобиле

Новый мультимодальный датасет, корпус In-Car Sign Language (ICSL), был представлен для решения проблем использования жестового языка в сервисах совместной мобильности, таких как такси и платформы каршеринга. Ресурс ориентирован на бразильский жестовый язык (Libras) с целью улучшения доступности общественного транспорта для глухой и слабослышащей аудитории внутри тесного салона автомобиля.

arxiv arXiv cs.CL · 26 д назад

Исследование выявило небольшой отрицательный тренд в составной композиционности немецкого и английского языков с течением времени

Исследователи изучают семантические изменения в 23 немецких и 26 английских существительных в составе сложных слов, внедряя задачу предсказания тренда композиционности (Compositionality Trend Prediction), которая оценивается на основе нового набора данных с деcade-ными диахроническими оценками. Вопреки литературным данным, утверждающим о решительной тенденции к снижению композиционности сложных слов, исследование выявило лишь небольшой отрицательный тренд с течением времени.

arxiv arXiv cs.CL · 26 д назад

JobHop v2: Набор данных о карьерных траекториях крупного масштаба из неструктурированных резюме

Исследователи выпустили JobHop v2, улучшенную версию набора данных JobHop, доступного публично и предназначенного для планирования рабочей силы и анализа рынка труда. Набор данных, созданный с помощью сквозного извлечения с помощью больших языковых моделей из примерно 440 000 псевдонимизированных многоязычных резюме, предоставленных VDAB, Фламандской службой занятости, содержит 355 315 карьерных траекторий.

arxiv arXiv cs.LG · 26 д назад

Исследование оценивает подходы NLP для извлечения ключевых слов из краудсорсинговых коллекций

Проект, использующий Онлайн-архив "Their Finest Hour" Оксфордского университета, оценил три подхода обработки естественного языка (NLP) — распознавание именованных сущностей (NER), извлечение ключевых слов и тематическое моделирование — для автоматизации масштабного извлечения ключевых слов. В исследовании эти методы тестировались в диапазоне от традиционных статистических моделей до современных генеративных нейронных сетей ИИ.

arxiv arXiv cs.LG · 26 д назад

Исследование выводит эмпирическую формулу для оценки размера обучающей выборки для классификации с помощью инерциальных датчиков

Исследователи представляют систематическую эмпирическую оценку скоростей сходимости кривых обучения, чтобы восполнить отсутствие руководств на основе данных для определения минимальных размеров выборок в задачах классификации на основе инерциальных датчиков.