Sujet · Voice & audio
lab OpenAI News · il y a 11 j · 15 vues

Les ingénieurs d'OpenAI conçoivent GPT-Live, un système vocal full-duplex qui supprime les détecteurs de tour

OpenAI a publié GPT-Live, un système vocal de troisième génération qui élimine le détecteur de tour traditionnel en utilisant un modèle full-duplex capable d'écouter et de parler simultanément. Cette architecture permet des conversations plus immédiates et naturelles tout en maintenant une faible latence grâce à une nouvelle conception du système optimisée pour les performances en temps réel.

lab xAI News · il y a 16 j · 28 vues

xAI publie Grok Voice Think Fast 2.0 avec une raisonnement et une précision de transcription vocale améliorés

xAI a annoncé Grok Voice Think Fast 2.0, un modèle vocal de nouvelle génération de parole à parole conçu pour améliorer l'intelligence, la précision de la transcription et les capacités conversationnelles. La mise à jour s'appuie sur son prédécesseur en introduisant des gains significatifs dans le raisonnement vocal, la capacité conversationnelle et la fiabilité de l'utilisation d'outils.

media The Batch · il y a 28 j GPQA Diamond · 84.2% · 4 vues

OpenAI publie des modèles vocaux full-duplex et un tribunal allemand tient Google responsable des Résumés IA

OpenAI a lancé GPT-Live-1 et GPT-Live-1 mini pour alimenter une version reconstruite de ChatGPT Voice, introduisant le traitement audio full-duplex qui permet l'écoute et la parole simultanées. Le système délègue les requêtes complexes à des modèles de raisonnement en arrière-plan comme GPT-5.5, permettant une conversation continue tandis qu'une réflexion plus approfondie a lieu.

lab Hugging Face Blog · il y a 4 j · 8 vues

NVIDIA Magpie TTS ajoute l'arabe, le coréen et le portugais, et améliore la qualité

NVIDIA a publié une mise à jour de son modèle Magpie Multilingual TTS, élargissant le support à douze langues avec l'ajout de l'arabe standard moderne, du coréen et du portugais brésilien. La publication inclut également des améliorations de qualité pour les langues existantes grâce à des données d'entraînement mises à jour et des modifications architecturales.

media MarkTechPost · il y a 5 j · 13 vues

NVIDIA publie NemotronLabs VoiceChat 11B, un modèle de parole à parole en duplex intégral ouvert avec une prise de tour d'environ 450 ms

NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de parole à parole de bout en bout ouvert de 11 milliards de paramètres conçu pour la conversation en temps réel et en duplex intégral. Contrairement aux piles en cascade qui enchaînent ASR, LLM et TTS, ce réseau unifié effectue simultanément la compréhension et la génération de flux audio, atteignant une latence mesurée de prise de tour fluide de 448 ms sur Full-Duplex-Bench 1.0.

media Hugging Face Forums · il y a 12 j · 8 vues

OpenGauntlet publie un catalogue de 168 systèmes TTS et 106 systèmes STT

Un chercheur a publié le catalogue de recherche OpenGauntlet, une ressource publique contenant des informations sur 168 systèmes de synthèse vocale (TTS) et 106 systèmes de reconnaissance vocale (STT). Les répertoires couvrent les modèles open source et hébergés, les licences, les exigences matérielles, les langues, les capacités, le statut du cycle de vie, les informations sources et les données de benchmark publiées lorsque disponibles.

media Hugging Face Forums · il y a 29 j · 1 vue

NymphTech recherche le clonage vocal de pointe pour son réseau radio IA

NymphTech cherche des recommandations de modèles de clonage vocal et de synthèse vocale haut de gamme pour améliorer son réseau de stations de radio IA, ciblant spécifiquement plusieurs langues et les diffusions de format long. L'entreprise a déjà lancé une plateforme présentant des personnalités IA persistantes comme Trinity et Mark, Trinity diffusant en continu depuis le 9 juin.