Koshur Pixel presenta un conjunto de datos sintético de OCR con 613,078 pares de imagen-texto generados a partir del corpus KS-PRET-5M utilizando SynthOCR-Gen. Incluye más de 25 estrategias de aumento y abarca diversas fuentes tipográficas y escalas textuales, desde palabras hasta documentos de página completa, permitiendo un entrenamiento escalable para sistemas de OCR en cachemiro.
Koshur Pixel: Primer conjunto de datos sintético a gran escala de OCR para cachemiro
vldmrbesk publica el archivo Tsiolkovsky de 51 mil hojas con precisión de reconocimiento medida
Se ha publicado como un conjunto de datos CC0 un archivo personal completo de Konstantin Tsiolkovsky, que comprende 51.008 hojas y 2.019 archivos de archivo. La colección abarca cincuenta años de trabajo del teórico de cohetes autodidacta e incluye manuscritos a mano junto con copias mecanografiadas.
Hugging Face lanza The Stack v3, el conjunto de datos de código abierto más grande
Hugging Face ha lanzado The Stack v3, descrito como el conjunto de datos de código abierto más grande hasta la fecha. El lanzamiento proporciona dos métodos de acceso distintos para adaptarse a las necesidades de diferentes usuarios.
IBM abre el código fuente de CodeAlchemy, un conjunto de datos sintético masivo de código de alta calidad
IBM ha abierto el código fuente de CodeAlchemy, una canalización y un conjunto de datos sintéticos diseñados para mejorar el rendimiento de los modelos de IA al emparejar código con trazas de ejecución. El lanzamiento incluye casi 1 billón de tokens en 15 lenguajes de programación, sumando al menos 200 veces el tamaño de Wikipedia.
MultiSynt/MT lanza un corpus paralelo de 4.8T tokens en 36 idiomas
Los investigadores presentan MultiSynt/MT, un corpus paralelo sintético abierto que contiene aproximadamente 4.8 billones de tokens del idioma objetivo en 36 idiomas europeos. El conjunto de datos se genera traduciendo 100 mil millones de tokens de alta calidad de Nemotron-CC utilizando los sistemas Tower+ y OPUS-MT/HPLT-MT.
Current AI lanza Open Source AI Gap Map v0.1 con 421 productos indexados
Current AI, una organización sin fines de lucro fundada en la Cumbre de Acción de IA en febrero de 2025, ha lanzado Open Source AI Gap Map v0.1 para indexar el estado de la IA de código abierto.