Voice & audio
lab OpenAI News · 5 hari lalu · 8 tayangan

Insinyur OpenAI mengembangkan GPT-Live, sistem suara full-duplex yang menghapus detektor giliran

OpenAI telah merilis GPT-Live, sistem suara generasi ketiga yang menghilangkan detektor giliran tradisional dengan menggunakan model full-duplex yang mampu mendengarkan dan berbicara secara bersamaan. Arsitektur ini memungkinkan percakapan yang lebih langsung dan alami sambil mempertahankan latensi rendah melalui desain sistem baru yang dioptimalkan untuk kinerja waktu nyata.

media Hugging Face Forums · 6 hari lalu

OpenGauntlet menerbitkan katalog 168 sistem TTS dan 106 sistem STT

Seorang peneliti telah menerbitkan katalog penelitian OpenGauntlet, sebuah sumber daya publik yang berisi informasi tentang 168 sistem teks-ke-suara (TTS) dan 106 sistem suara-ke-teks (STT). Direktori mencakup model open source dan terhosting, lisensi, persyaratan perangkat keras, bahasa, kemampuan, status siklus hidup, informasi sumber, dan data benchmark yang dipublikasikan jika tersedia.

lab xAI News · 11 hari lalu · 10 tayangan

xAI merilis Grok Voice Think Fast 2.0 dengan peningkatan penalaran suara dan akurasi transkripsi

xAI telah mengumumkan Grok Voice Think Fast 2.0, model suara generasi berikutnya berbasis speech-to-speech yang dirancang untuk meningkatkan kecerdasan, akurasi transkripsi, dan kemampuan percakapan. Pembaruan ini dibangun dari pendahulunya dengan memperkenalkan peningkatan signifikan dalam penalaran suara, kemampuan percakapan, dan keandalan penggunaan alat.

media The Batch · 23 hari lalu GPQA Diamond · 84.2% · 3 tayangan

OpenAI merilis model suara full-duplex dan pengadilan Jerman menjatuhkan tanggung jawab kepada Google untuk Ringkasan AI

OpenAI telah meluncurkan GPT-Live-1 dan GPT-Live-1 mini untuk menggerakkan ChatGPT Voice yang dibangun ulang, memperkenalkan pemrosesan audio full-duplex yang memungkinkan mendengarkan dan berbicara secara bersamaan. Sistem ini mendelegasikan pertanyaan kompleks ke model penalaran latar belakang seperti GPT-5.5, memungkinkan percakapan berkelanjutan sambil pemikiran mendalam terjadi.

arxiv arXiv cs.CL · 24 hari lalu

Meningkatkan Pengikut Instruksi Teks-ke-Audio melalui Umpan Balik Halus dari Model Bahasa Besar Sadar Audio

Peneliti mengusulkan kerangka kerja yang menggunakan model bahasa besar sadar audio (ALLMs) sebagai hakim halus untuk memverifikasi keberadaan peristiwa target dan hubungan temporal dalam audio yang dihasilkan. Pendekatan ini mengatasi kesenjangan di mana model teks-ke-audio yang ada sering gagal mengikuti instruksi yang melibatkan beberapa peristiwa suara dan urutannya.

arxiv arXiv cs.CL · 24 hari lalu

Mengaudit Pintasan Tingkat Protokol dalam Hakim Model Bahasa Audio Besar untuk Evaluasi Ucapan

Sebuah studi mengaudit pintasan tingkat protokol dalam model bahasa-audio besar (LALM) yang digunakan sebagai hakim otomatis untuk evaluasi ucapan, mengungkapkan bahwa kesepakatan tinggi dengan penilaian manusia tidak menjamin putusan didasarkan pada audio sebenarnya. Penelitian ini memeriksa tiga protokol penerapan: penjudian cetak biru fitur, penjudian berkondisi referensi, dan perbandingan A/B berpasangan di enam hakim dan empat atribut.

arxiv arXiv cs.CL · 24 hari lalu

DTW pada WavLM memungkinkan penilaian ucapan L2 tanpa teks untuk fonetik, ritme, dan intonasi

Studi ini menyelidiki penggunaan Dynamic Time Warping (DTW) pada representasi WavLM yang dipelajari secara mandiri untuk menilai akurasi fonetik, ritme, dan intonasi dalam ucapan L2 bahasa Inggris dan Jepang tanpa memerlukan data pelatihan berlabel. Pendekatan DTW dasar yang membandingkan ucapan peserta dengan templat asli melampaui kesepakatan manusia dalam penilaian fonetik holistik dan tingkat kalimat.

lab Hugging Face Blog · 25 hari lalu · 14 tayangan

Hume merilis benchmark Real World VoiceEQ untuk kualitas suara AI manusia

Hume telah memperkenalkan Real World VoiceEQ, sebuah benchmark yang dirancang untuk mengevaluasi kualitas interaksi suara manusia dengan menilai seberapa baik sistem mengenali dan menghasilkan informasi akustik di luar transkrip. Benchmark ini mengevaluasi lebih dari 40 model proprietary dan open-source di atas 15+ dimensi menggunakan lebih dari 60 metrik yang berasal dari 785.000 penilaian manusia TTS dan 48.000 penilaian STS.

arxiv arXiv cs.CL · 25 hari lalu

Proyeksi Gradien Terpadu mengurangi lupa katastrofik pada ASR multibahasa

Para peneliti mengusulkan Proyeksi Gradien Terpadu (UGP), sebuah metode untuk meredam lupa katastrofik saat melakukan penalaan halus pada model ASR pra-latih besar seperti Whisper pada bahasa dengan sumber daya rendah. UGP membatasi pembaruan parameter menggunakan gradien referensi dari replika seimbang bahasa dalam ruang proyeksi terpadu, secara efektif menyamakan kontribusi per-bahasa dan mengurangi bias bahasa dominan.

media Hugging Face Forums · 27 hari lalu

Pengembang mengeksplorasi pola orkestrasi untuk agen AI suara produksi

Seorang pengembang di forum Hugging Face berusaha memahami bagaimana platform produksi seperti Bland.ai, Retell, dan Vapi mengelola orkestrasi prompt tanpa bergantung pada prompt sistem besar yang ditulis secara manual. Penulis menggambarkan implementasi saat ini menggunakan FastAPI, Sarvam STT/TTS, dan Pipecat SmartTurn V3, mencatat bahwa injeksi keadaan secara manual menyebabkan kompleksitas yang meningkat dan kegagalan pada kasus tepi.