Training data
media Hugging Face Forums · 6 hari lalu

OpenGauntlet menerbitkan katalog 168 sistem TTS dan 106 sistem STT

Seorang peneliti telah menerbitkan katalog penelitian OpenGauntlet, sebuah sumber daya publik yang berisi informasi tentang 168 sistem teks-ke-suara (TTS) dan 106 sistem suara-ke-teks (STT). Direktori mencakup model open source dan terhosting, lisensi, persyaratan perangkat keras, bahasa, kemampuan, status siklus hidup, informasi sumber, dan data benchmark yang dipublikasikan jika tersedia.

arxiv arXiv cs.CL · 26 hari lalu · 1 tayangan

Peneliti merilis dataset ICSL untuk pengenalan Bahasa Isyarat Brasil di dalam mobil

Sebuah dataset multimodal baru yang disebut korpus In-Car Sign Language (ICSL) telah diperkenalkan untuk mengatasi tantangan penggunaan bahasa isyarat dalam layanan mobilitas bersama seperti taksi dan platform berbagi tumpangan. Sumber daya ini berfokus pada Bahasa Isyarat Brasil (Libras) untuk meningkatkan aksesibilitas transportasi umum bagi komunitas Tuli dan Tuna Runggu di interior kendaraan yang terbatas.

arxiv arXiv cs.CL · 26 hari lalu

Studi menemukan tren negatif kecil dalam komposisionalitas majemuk Jerman dan Inggris seiring waktu

Peneliti menyelidiki perubahan semantik dalam 23 majemuk kata benda Jerman dan 26 Inggris dengan memperkenalkan tugas Prediksi Tren Komposisionalitas (Compositionality Trend Prediction), yang dievaluasi terhadap dataset baru peringkat diachronic per dekade. Bertentangan dengan literatur yang mengemukakan kecenderungan tegas bahwa majemuk menjadi kurang komposisional, studi ini hanya menemukan tren negatif kecil seiring waktu.

arxiv arXiv cs.CL · 26 hari lalu

JobHop v2: Dataset lintasan karir skala besar dari resume tidak terstruktur

Para peneliti telah merilis JobHop v2, versi yang ditingkatkan dari dataset JobHop yang tersedia secara publik yang dirancang untuk perencanaan tenaga kerja dan analisis pasar kerja. Dibangun melalui ekstraksi model bahasa besar end-to-end dari sekitar 440.000 resume multibahasa yang dianonimkan yang disediakan oleh VDAB, Layanan Pekerjaan Publik Flandria, dataset ini berisi 355.315 lintasan karir.

arxiv arXiv cs.LG · 26 hari lalu

Studi mengevaluasi pendekatan NLP untuk mengekstrak kata kunci dari koleksi crowdsourced

Sebuah proyek yang menggunakan Arsif Online Their Finest Hour Online Archive dari Universitas Oxford mengevaluasi tiga pendekatan Pemrosesan Bahasa Alamiah (NLP)—Pengenalan Entitas Bernama, Ekstraksi Kata Kunci, dan Pemodelan Topik—untuk mengotomatisasi ekstraksi kata kunci secara skala besar. Studi ini menguji metode-metode tersebut di berbagai teknik, mulai dari model statistik tradisional hingga jaringan saraf AI generatif modern.