QuantVectors está buscando conjuntos de datos de documentos anotados en lenguas indias de la India, incluyendo hindi, maratí, guyaratí, bengalí, punjabi, tamil, urdu, telugu, oriya, kannada, malayalam y asamés. Los conjuntos de datos deben incluir tipos de facturas, recibos, facturas de servicios públicos, avisos de pago, listas de empaque, facturas comerciales y notas de crédito, con aproximadamente 400 documentos por idioma, anotaciones verificadas por humanos y una precisión del 99%+. Los conjuntos de datos deben ser licenciables comercialmente y pueden ser de código abierto o comerciales, solicitando conjuntos de datos de HuggingFace, conjuntos de datos de investigación o proveedores especializados en este ámbito.
Búsqueda de conjuntos de datos de documentos en lenguas indias para entrenamiento de IA/OCR en India
vldmrbesk publica el archivo Tsiolkovsky de 51 mil hojas con precisión de reconocimiento medida
Se ha publicado como un conjunto de datos CC0 un archivo personal completo de Konstantin Tsiolkovsky, que comprende 51.008 hojas y 2.019 archivos de archivo. La colección abarca cincuenta años de trabajo del teórico de cohetes autodidacta e incluye manuscritos a mano junto con copias mecanografiadas.
Hugging Face lanza The Stack v3, el conjunto de datos de código abierto más grande
Hugging Face ha lanzado The Stack v3, descrito como el conjunto de datos de código abierto más grande hasta la fecha. El lanzamiento proporciona dos métodos de acceso distintos para adaptarse a las necesidades de diferentes usuarios.
IBM abre el código fuente de CodeAlchemy, un conjunto de datos sintético masivo de código de alta calidad
IBM ha abierto el código fuente de CodeAlchemy, una canalización y un conjunto de datos sintéticos diseñados para mejorar el rendimiento de los modelos de IA al emparejar código con trazas de ejecución. El lanzamiento incluye casi 1 billón de tokens en 15 lenguajes de programación, sumando al menos 200 veces el tamaño de Wikipedia.
MultiSynt/MT lanza un corpus paralelo de 4.8T tokens en 36 idiomas
Los investigadores presentan MultiSynt/MT, un corpus paralelo sintético abierto que contiene aproximadamente 4.8 billones de tokens del idioma objetivo en 36 idiomas europeos. El conjunto de datos se genera traduciendo 100 mil millones de tokens de alta calidad de Nemotron-CC utilizando los sistemas Tower+ y OPUS-MT/HPLT-MT.
Current AI lanza Open Source AI Gap Map v0.1 con 421 productos indexados
Current AI, una organización sin fines de lucro fundada en la Cumbre de Acción de IA en febrero de 2025, ha lanzado Open Source AI Gap Map v0.1 para indexar el estado de la IA de código abierto.