QuantVectors mencari dataset dokumen terannotasi dalam bahasa-bahasa India dari India, termasuk Hindi, Marathi, Gujarati, Bengali, Punjabi, Tamil, Urdu, Telugu, Odia, Kannada, Malayalam, dan Assam. Dataset harus mencakup jenis faktur, tanda terima, tagihan utilitas, saran pembayaran, daftar kemasan, faktur komersial, dan catatan kredit, dengan sekitar 400 dokumen per bahasa, anotasi yang diverifikasi manusia, dan akurasi 99%+. Dataset harus dapat dilisensikan secara komersial dan dapat berupa open-source atau komersial, dengan permintaan dataset HuggingFace, dataset penelitian, atau vendor yang mengkhususkan diri di bidang ini.
Mencari Dataset Dokumen Bahasa India untuk Pelatihan AI/OCR di India
vldmrbesk merilis arsip Tsiolkovsky berisi 51 ribu lembar dengan akurasi pengenalan terukur
Arsip pribadi lengkap Konstantin Tsiolkovsky, yang terdiri dari 51.008 lembar dan 2.019 file arsip, telah dirilis sebagai dataset CC0. Koleksi ini mencakup lima puluh tahun karya sang teoretikus roket autodidak dan mencakup naskah tulisan tangan bersama salinan ketikan.
Hugging Face merilis The Stack v3, dataset kode terbuka terbesar
Hugging Face telah merilis The Stack v3, yang digambarkan sebagai dataset kode terbuka terbesar hingga saat ini. Rilis ini menyediakan dua metode akses berbeda untuk mengakomodasi kebutuhan pengguna yang beragam.
IBM membuka sumber CodeAlchemy, dataset sintetis masif berisi kode berkualitas tinggi
IBM telah membuka sumber CodeAlchemy, sebuah pipeline dan dataset sintetis yang dirancang untuk meningkatkan kinerja model AI dengan memasangkan kode bersama jejak eksekusi. Rilis ini mencakup hampir 1 triliun token di 15 bahasa pemrograman, totalnya setidaknya 200 kali ukuran Wikipedia.
MultiSynt/MT merilis korpus paralel 4,8T token di 36 bahasa
Para peneliti memperkenalkan MultiSynt/MT, sebuah korpus paralel sintetis terbuka yang berisi sekitar 4,8 triliun token bahasa target di 36 bahasa Eropa. Dataset ini dihasilkan dengan menerjemahkan 100 miliar token Nemotron-CC berkualitas tinggi menggunakan sistem Tower+ dan OPUS-MT/HPLT-MT.
Current AI meluncurkan Peta Kesenjangan AI Open Source v0.1 dengan 421 produk terindeks
Current AI, organisasi nirlaba yang didirikan pada AI Action Summit pada Februari 2025, telah meluncurkan Peta Kesenjangan AI Open Source v0.1 untuk mengindeks keadaan AI open source.