Topik · Voice & audio
lab OpenAI News · 11 hari lalu · 15 tayangan

Insinyur OpenAI mengembangkan GPT-Live, sistem suara full-duplex yang menghapus detektor giliran

OpenAI telah merilis GPT-Live, sistem suara generasi ketiga yang menghilangkan detektor giliran tradisional dengan menggunakan model full-duplex yang mampu mendengarkan dan berbicara secara bersamaan. Arsitektur ini memungkinkan percakapan yang lebih langsung dan alami sambil mempertahankan latensi rendah melalui desain sistem baru yang dioptimalkan untuk kinerja waktu nyata.

lab xAI News · 16 hari lalu · 28 tayangan

xAI merilis Grok Voice Think Fast 2.0 dengan peningkatan penalaran suara dan akurasi transkripsi

xAI telah mengumumkan Grok Voice Think Fast 2.0, model suara generasi berikutnya berbasis speech-to-speech yang dirancang untuk meningkatkan kecerdasan, akurasi transkripsi, dan kemampuan percakapan. Pembaruan ini dibangun dari pendahulunya dengan memperkenalkan peningkatan signifikan dalam penalaran suara, kemampuan percakapan, dan keandalan penggunaan alat.

media The Batch · 28 hari lalu GPQA Diamond · 84.2% · 4 tayangan

OpenAI merilis model suara full-duplex dan pengadilan Jerman menjatuhkan tanggung jawab kepada Google untuk Ringkasan AI

OpenAI telah meluncurkan GPT-Live-1 dan GPT-Live-1 mini untuk menggerakkan ChatGPT Voice yang dibangun ulang, memperkenalkan pemrosesan audio full-duplex yang memungkinkan mendengarkan dan berbicara secara bersamaan. Sistem ini mendelegasikan pertanyaan kompleks ke model penalaran latar belakang seperti GPT-5.5, memungkinkan percakapan berkelanjutan sambil pemikiran mendalam terjadi.

media MarkTechPost · 5 hari lalu · 13 tayangan

NVIDIA merilis NemotronLabs VoiceChat 11B, model speech-to-speech full-duplex terbuka dengan pergantian giliran ~450 ms

NVIDIA telah merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end 11B parameter yang terbuka dan dirancang untuk percakapan real-time full-duplex. Tidak seperti tumpukan bertingkat yang merangkai ASR, LLM, dan TTS, jaringan terpadu ini melakukan pemahaman dan generasi suara secara streaming secara bersamaan, mencapai latensi pergantian giliran yang mulus sebesar 448 ms di Full-Duplex-Bench 1.0.

media Hugging Face Forums · 12 hari lalu · 8 tayangan

OpenGauntlet menerbitkan katalog 168 sistem TTS dan 106 sistem STT

Seorang peneliti telah menerbitkan katalog penelitian OpenGauntlet, sebuah sumber daya publik yang berisi informasi tentang 168 sistem teks-ke-suara (TTS) dan 106 sistem suara-ke-teks (STT). Direktori mencakup model open source dan terhosting, lisensi, persyaratan perangkat keras, bahasa, kemampuan, status siklus hidup, informasi sumber, dan data benchmark yang dipublikasikan jika tersedia.