QuantVectors ищет аннотированные наборы документов на индийских языках из Индии, включая хинди, маратхи, гуджарати, бенгали, панjabi, тамильский, урду, телугу, оди, каннада, мальяли и ассамский. Наборы должны включать типы документов: счет-фактура, чек, счет-счет, рекомендация по оплате, список упаковки, коммерческий счет-фактура и кредитный документ, приблизительно 400 документов на язык, аннотации, проверенные людьми, и точность не менее 99%. Наборы должны быть коммерчески лицензируемыми и могут быть либо открытого доступа, либо коммерческими, с запросом к наборам на HuggingFace, научным наборам данных или поставщикам, специализирующимся в этой области.
Поиск наборов документов для обучения ИИ/OCR на индийских языках в Индии
vldmrbesk выпускает архив Циолковского из 51 тыс. листов с измеренной точностью распознавания
Опубликован полный личный архив Константина Циолковского, включающий 51 008 листов и 2 019 архивных файлов, в формате набора данных CC0. Коллекция охватывает пятьдесят лет работы самоучки-теоретика ракетостроения и включает рукописные тексты наряду с печатными копиями.
Hugging Face выпустила The Stack v3 — крупнейший открытый датасет кода
Hugging Face выпустила The Stack v3, описываемую как крупнейший на сегодняшний день открытый датасет кода. Выпуск предоставляет два различных способа доступа для удовлетворения потребностей разных пользователей.
IBM открыла исходные коды CodeAlchemy — масштабного синтетического набора данных высококачественного кода
IBM открыла исходные коды CodeAlchemy, конвейера и синтетического набора данных, предназначенных для улучшения производительности ИИ-моделей за счёт сопоставления кода с трассами выполнения. В релиз включено почти 1 триллион токенов по 15 языкам программирования, что как минимум в 200 раз превышает объём Wikipedia.
MultiSynt/MT выпускает параллельный корпус из 4,8 трлн токенов на 36 языках
Исследователи представляют MultiSynt/MT, открытый синтетический параллельный корпус, содержащий примерно 4,8 триллиона токенов целевого языка на 36 европейских языках. Набор данных получен путем перевода 100 миллиардов высококачественных токенов Nemotron-CC с использованием систем Tower+ и OPUS-MT/HPLT-MT.
Current AI выпустила Open Source AI Gap Map v0.1 с 421 индексированным продуктом
Current AI, некоммерческая организация, основанная на саммите AI Action Summit в феврале 2025 года, выпустила Open Source AI Gap Map v0.1 для индексации состояния открытого исходного кода в ИИ.