A QuantVectors está buscando conjuntos de dados de documentos anotados em línguas indic da Índia, incluindo hindi, marata, guzerate, bengali, punjabi, tâmil, urdu, telugu, oriá, canarês, malaiala e assamês. Os conjuntos de dados devem incluir tipos de fatura, recibo, conta de serviços públicos, aviso de pagamento, lista de embalagem, fatura comercial e nota de crédito, com aproximadamente 400 documentos por idioma, anotações verificadas por humanos e precisidade de 99%+. Os conjuntos de dados devem ser licenciáveis comercialmente e podem ser de código aberto ou comerciais, com solicitação de conjuntos de dados do HuggingFace, conjuntos de dados de pesquisa ou fornecedores especializados neste segmento.
Procurando Conjuntos de Dados de Documentos em Línguas Indic para Treinamento de IA/OCR na Índia
vldmrbesk lança arquivo Tsiolkovsky com 51 mil folhas e precisão de reconhecimento medida
Um arquivo pessoal completo de Konstantin Tsiolkovsky, composto por 51.008 folhas e 2.019 arquivos arquivísticos, foi lançado como um conjunto de dados CC0. A coleção abrange cinquenta anos de trabalho do teórico autodidata dos foguetes e inclui manuscritos à mão ao lado de cópias digitadas.
Hugging Face lança The Stack v3, o maior conjunto de dados de código aberto
A Hugging Face lançou o The Stack v3, descrito como o maior conjunto de dados de código aberto até o momento. O lançamento oferece dois métodos de acesso distintos para atender às necessidades de diferentes usuários.
IBM lança o CodeAlchemy, um conjunto de dados sintético massivo de código de alta qualidade
A IBM lançou o CodeAlchemy, um pipeline e um conjunto de dados sintéticos projetados para melhorar o desempenho de modelos de IA ao associar código a rastros de execução. O lançamento inclui quase 1 trilhão de tokens em 15 linguagens de programação, totalizando pelo menos 200 vezes o tamanho da Wikipedia.
MultiSynt/MT lança corpus paralelo de 4.8T tokens em 36 idiomas
Pesquisadores introduzem o MultiSynt/MT, um corpus paralelo sintético aberto contendo aproximadamente 4.8 trilhões de tokens do idioma alvo em 36 idiomas europeus. O conjunto de dados é gerado traduzindo 100 bilhões de tokens de alta qualidade do Nemotron-CC usando os sistemas Tower+ e OPUS-MT/HPLT-MT.
Current AI lança Open Source AI Gap Map v0.1 com 421 produtos indexados
A Current AI, uma organização sem fins lucrativos fundada na Cúpula de Ação de IA em fevereiro de 2025, lançou o Open Source AI Gap Map v0.1 para indexar o estado da IA de código aberto.