Voice & audio
lab OpenAI News · il y a 5 j · 8 vues

Les ingénieurs d'OpenAI conçoivent GPT-Live, un système vocal full-duplex qui supprime les détecteurs de tour

OpenAI a publié GPT-Live, un système vocal de troisième génération qui élimine le détecteur de tour traditionnel en utilisant un modèle full-duplex capable d'écouter et de parler simultanément. Cette architecture permet des conversations plus immédiates et naturelles tout en maintenant une faible latence grâce à une nouvelle conception du système optimisée pour les performances en temps réel.

media Hugging Face Forums · il y a 6 j

OpenGauntlet publie un catalogue de 168 systèmes TTS et 106 systèmes STT

Un chercheur a publié le catalogue de recherche OpenGauntlet, une ressource publique contenant des informations sur 168 systèmes de synthèse vocale (TTS) et 106 systèmes de reconnaissance vocale (STT). Les répertoires couvrent les modèles open source et hébergés, les licences, les exigences matérielles, les langues, les capacités, le statut du cycle de vie, les informations sources et les données de benchmark publiées lorsque disponibles.

lab xAI News · il y a 11 j · 10 vues

xAI publie Grok Voice Think Fast 2.0 avec une raisonnement et une précision de transcription vocale améliorés

xAI a annoncé Grok Voice Think Fast 2.0, un modèle vocal de nouvelle génération de parole à parole conçu pour améliorer l'intelligence, la précision de la transcription et les capacités conversationnelles. La mise à jour s'appuie sur son prédécesseur en introduisant des gains significatifs dans le raisonnement vocal, la capacité conversationnelle et la fiabilité de l'utilisation d'outils.

media The Batch · il y a 23 j GPQA Diamond · 84.2% · 3 vues

OpenAI publie des modèles vocaux full-duplex et un tribunal allemand tient Google responsable des Résumés IA

OpenAI a lancé GPT-Live-1 et GPT-Live-1 mini pour alimenter une version reconstruite de ChatGPT Voice, introduisant le traitement audio full-duplex qui permet l'écoute et la parole simultanées. Le système délègue les requêtes complexes à des modèles de raisonnement en arrière-plan comme GPT-5.5, permettant une conversation continue tandis qu'une réflexion plus approfondie a lieu.

media Hugging Face Forums · il y a 23 j

NymphTech recherche le clonage vocal de pointe pour son réseau radio IA

NymphTech cherche des recommandations de modèles de clonage vocal et de synthèse vocale haut de gamme pour améliorer son réseau de stations de radio IA, ciblant spécifiquement plusieurs langues et les diffusions de format long. L'entreprise a déjà lancé une plateforme présentant des personnalités IA persistantes comme Trinity et Mark, Trinity diffusant en continu depuis le 9 juin.

arxiv arXiv cs.CL · il y a 24 j

Amélioration du respect des instructions texte-vers-audio grâce à un retour fin issu de grands modèles linguistiques sensibles au son

Les chercheurs proposent un cadre utilisant des grands modèles linguistiques sensibles au son (ALLMs) comme juges fins pour vérifier la présence d'événements cibles et les relations temporelles dans l'audio généré. Cette approche comble le manque où les modèles texte-vers-audio existants échouent souvent à suivre des instructions impliquant plusieurs événements sonores et leur ordre.

arxiv arXiv cs.CL · il y a 24 j

Audit des raccourcis de niveau protocole dans les juges LALM pour l'évaluation de la parole

Une étude audite les raccourcis de niveau protocole dans les grands modèles audio-langage (LALM) utilisés comme juges automatiques pour l'évaluation de la parole, révélant qu'un accord élevé avec les évaluations humaines ne garantit pas que les verdicts sont fondés sur l'audio réel. La recherche examine trois protocoles de déploiement : le jugement par plan de caractéristiques, le jugement conditionné par référence, et la comparaison par paires A/B sur six juges et quatre attributs.

arxiv arXiv cs.CL · il y a 24 j

Le DTW sur WavLM permet l'évaluation sans texte de la parole L2 pour la phonétique, le rythme et l'intonation

L'étude examine l'utilisation du Dynamic Time Warping (DTW) sur les représentations auto-supervisées de WavLM pour évaluer la précision phonétique, le rythme et l'intonation dans la parole L2 en anglais et en japonais, sans nécessiter de données d'entraînement étiquetées. L'approche DTW de base comparant la parole des apprenants aux modèles natifs dépasse l'accord humain sur la notation phonétique holistique et au niveau de la phrase.

lab Hugging Face Blog · il y a 25 j · 14 vues

Hume lance le benchmark Real World VoiceEQ pour la qualité humaine de l'IA vocale

Hume a introduit Real World VoiceEQ, un benchmark conçu pour évaluer la qualité humaine des interactions vocales en mesurant dans quelle mesure les systèmes reconnaissent et produisent des informations acoustiques au-delà des transcriptions. Le benchmark évalue plus de 40 modèles propriétaires et open-source sur plus de 15 dimensions à l'aide de plus de 60 métriques dérivées de 785 000 évaluations humaines TTS et 48 000 évaluations STS.

arxiv arXiv cs.CL · il y a 25 j

La projection de gradient unifiée réduit l'oubli catastrophique dans la reconnaissance automatique de la parole multilingue

Les chercheurs proposent la Projection de Gradient Unifiée (UGP), une méthode pour atténuer l'oubli catastrophique lors du fine-tuning de grands modèles ASR pré-entraînés comme Whisper sur des langues peu dotées. L'UGP contraint les mises à jour des paramètres en utilisant des gradients de référence issus d'une rééquilibrage linguistique dans un espace de projection unifié, égalisant efficacement les contributions par langue et réduisant le biais des langues dominantes.

media Hugging Face Forums · il y a 27 j

Un développeur explore les modèles d'orchestration pour les agents IA vocaux en production

Un développeur sur les forums Hugging Face cherche à comprendre comment des plateformes de production comme Bland.ai, Retell et Vapi gèrent l'orchestration des prompts sans dépendre de systèmes de prompts système massifs et écrits à la main. L'auteur décrit son implémentation actuelle utilisant FastAPI, Sarvam STT/TTS et Pipecat SmartTurn V3, notant que l'injection manuelle état par état entraîne une complexité croissante et des échecs sur des cas limites.