QuantVectors recherche des jeux de données de documents annotés en langues indiques d'Inde, y compris le hindi, le marathi, le gujarati, le bengali, le pendjabi, le tamoul, l'ourdou, le télougou, l'odia, le kannada, le malayalam et l'assamais. Les jeux de données doivent inclure des types tels que factures, reçus, factures de services publics, avis de paiement, listes de colisage, factures commerciales et notes de crédit, avec environ 400 documents par langue, des annotations vérifiées par un humain et une précision de 99 %+. Les jeux de données doivent être sous licence commerciale et peuvent être open-source ou commerciaux, avec une demande de jeux de données HuggingFace, de jeux de données de recherche ou de fournisseurs spécialisés dans ce domaine.
Recherche de jeux de données de documents en langues indiques pour l'entraînement IA/OCR en Inde
vldmrbesk publie l'archive Tsiolkovsky de 51 k feuilles avec une précision de reconnaissance mesurée
Un archive personnelle complète de Konstantin Tsiolkovsky, comprenant 51 008 feuilles et 2 019 fichiers d'archives, a été publiée en tant que jeu de données CC0. La collection couvre cinquante ans de travail du théoricien des fusées autodidacte et inclut des manuscrits manuscrits ainsi que des copies tapées.
Hugging Face lance The Stack v3, le plus grand jeu de données de code ouvert
Hugging Face a publié The Stack v3, décrit comme le plus grand jeu de données de code ouvert à ce jour. La publication propose deux méthodes d'accès distinctes pour répondre aux besoins des différents utilisateurs.
IBM open-source CodeAlchemy, un immense jeu de données synthétique de code de haute qualité
IBM a open-sourcé CodeAlchemy, un pipeline et un jeu de données synthétiques conçus pour améliorer les performances des modèles d'IA en associant le code à des traces d'exécution. La publication comprend près de 1 trillion de tokens sur 15 langages de programmation, totalisant au moins 200 fois la taille de Wikipédia.
MultiSynt/MT publie un corpus parallèle de 4,8T de tokens sur 36 langues
Les chercheurs présentent MultiSynt/MT, un corpus parallèle synthétique ouvert contenant environ 4,8 billions de tokens de langue cible sur 36 langues européennes. Le jeu de données est généré en traduisant 100 milliards de tokens Nemotron-CC de haute qualité à l'aide des systèmes Tower+ et OPUS-MT/HPLT-MT.
Current AI lance la carte des lacunes de l'IA open source v0.1 avec 421 produits indexés
Current AI, une organisation à but non lucratif fondée lors du Sommet sur l'IA en février 2025, a lancé la carte des lacunes de l'IA open source v0.1 pour indexer l'état de l'IA open source.