Voice & audio
arxiv arXiv cs.CL · 2 hari lalu · 13 tayangan

NemotronLabs merilis VoiceChat, model obrolan suara dua arah penuh dengan panggilan alat

NemotronLabs telah memperkenalkan VoiceChat, model obrolan suara dua arah penuh dengan bobot terbuka yang dirancang untuk mengintegrasikan pendengaran, transkripsi, penalaran, dan pengucapan dalam satu arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel khusus untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi pengguna inkremental.

arxiv arXiv cs.AI · 2 hari lalu · 13 tayangan

NemotronLabs merilis VoiceChat, model obrolan suara dua arah penuh dengan panggilan alat

NemotronLabs telah memperkenalkan NemotronLabs VoiceChat, sebuah model obrolan suara dua arah penuh dengan bobot terbuka yang mengintegrasikan kemampuan panggilan alat asli dalam arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi inkremental dan decoder TTS streaming.

lab xAI News · 5 hari lalu · 24 tayangan

xAI merilis Grok Voice Transcribe 2.0 dengan akurasi dua kali lipat dari v1

xAI telah merilis Grok Voice Transcribe 2.0, sebuah model suara-ke-teks yang dua kali lebih akurat dibandingkan versi 1.0 sambil mempertahankan harga yang sama. Dibangun di atas model dasar audio di balik Grok Voice, model ini memanfaatkan dataset unik audio multibahasa langsung dan bising untuk menangani kondisi dunia nyata yang menantang seperti jalur telepon yang tidak stabil dan suara yang bersaing.

lab OpenAI News · 13 hari lalu τ²-bench · 1.0% · 52 tayangan

OpenAI meluncurkan API GPT-Live-1 untuk pengalaman suara alami

OpenAI telah meluncurkan GPT-Live-1 di dalam API, menyediakan kepada pengembang satu model yang mampu mendengarkan dan berbicara secara bersamaan untuk membangun aplikasi berbasis suara. Rilis ini bertujuan menyederhanakan pengembangan lapisan suara dengan mengganti arsitektur berantai tradisional menggunakan pendekatan terpadu yang menangani interupsi dan konteks lebih alami.

media Hugging Face Forums · 13 hari lalu · 12 tayangan

Aiden mengusulkan pemisahan suara real-time dan eksekusi tugas ke model terpisah

Aiden menggambarkan arsitektur untuk agen yang memerlukan percakapan suara full-duplex bersama dengan penalaran visual kompleks dan tindakan perangkat, menghindari keterbatasan satu model yang menangani keduanya. Solusi membagi tanggung jawab: model suara real-time mengelola percakapan sementara model terpisah yang lebih kuat mengeksekusi tugas latar belakang, berkoordinasi secara asinkron melalui antrian tugas.