Koshur Pixel представляет синтетический набор данных для распознавания текста, содержащий 613 078 пар изображений и текста, сгенерированных на основе корпуса KS-PRET-5M с использованием SynthOCR-Gen. В наборе присутствуют более 25 стратегий усилений и охватывают разнообразные шрифты и масштабы текста, от слов до полных документов, что позволяет масштабируемо обучать системы распознавания текста на кашмирском языке.
Koshur Pixel: Первый масштабный синтетический набор данных для распознавания текста на кашмирском языке
vldmrbesk выпускает архив Циолковского из 51 тыс. листов с измеренной точностью распознавания
Опубликован полный личный архив Константина Циолковского, включающий 51 008 листов и 2 019 архивных файлов, в формате набора данных CC0. Коллекция охватывает пятьдесят лет работы самоучки-теоретика ракетостроения и включает рукописные тексты наряду с печатными копиями.
Hugging Face выпустила The Stack v3 — крупнейший открытый датасет кода
Hugging Face выпустила The Stack v3, описываемую как крупнейший на сегодняшний день открытый датасет кода. Выпуск предоставляет два различных способа доступа для удовлетворения потребностей разных пользователей.
IBM открыла исходные коды CodeAlchemy — масштабного синтетического набора данных высококачественного кода
IBM открыла исходные коды CodeAlchemy, конвейера и синтетического набора данных, предназначенных для улучшения производительности ИИ-моделей за счёт сопоставления кода с трассами выполнения. В релиз включено почти 1 триллион токенов по 15 языкам программирования, что как минимум в 200 раз превышает объём Wikipedia.
MultiSynt/MT выпускает параллельный корпус из 4,8 трлн токенов на 36 языках
Исследователи представляют MultiSynt/MT, открытый синтетический параллельный корпус, содержащий примерно 4,8 триллиона токенов целевого языка на 36 европейских языках. Набор данных получен путем перевода 100 миллиардов высококачественных токенов Nemotron-CC с использованием систем Tower+ и OPUS-MT/HPLT-MT.
Current AI выпустила Open Source AI Gap Map v0.1 с 421 индексированным продуктом
Current AI, некоммерческая организация, основанная на саммите AI Action Summit в феврале 2025 года, выпустила Open Source AI Gap Map v0.1 для индексации состояния открытого исходного кода в ИИ.