Voice & audio
arxiv arXiv cs.CL · il y a 2 j · 13 vues

NemotronLabs publie VoiceChat, un modèle de parole en parole plein duplex ouvert avec appel d'outils

NemotronLabs a présenté VoiceChat, un modèle poids ouverts de parole en parole plein duplex conçu pour intégrer l'écoute, la transcription, le raisonnement et la parole au sein d'une architecture de streaming unifiée. Le système combine un encodeur de flux audio et un décodeur de modèle de langage avec des flux de sortie spécialisés parallèles pour le texte agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale de l'utilisateur.

arxiv arXiv cs.AI · il y a 2 j · 13 vues

NemotronLabs publie VoiceChat, un modèle de parole à parole en duplex intégral ouvert avec appel d'outils

NemotronLabs a présenté NemotronLabs VoiceChat, un modèle de parole à parole en duplex intégral à poids ouverts qui intègre des capacités natives d'appel d'outils au sein d'une architecture de streaming unifiée. Le système combine un encodeur de parole en streaming et un modèle de langage uniquement décodeur avec des flux de sortie parallèles pour le texte de l'agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale et un décodeur TTS en streaming.

media MarkTechPost · il y a 4 j · 14 vues

SpaceXAI publie l'API Grok Voice Transcribe 2.0 avec une précision supposée deux fois supérieure

SpaceXAI a publié Grok Voice Transcribe 2.0, un modèle de transcription vocale en texte disponible via une API hébergée, qui revendique une précision deux fois supérieure à celle de la version 1.0 pour le même prix. Le modèle cible des conditions audio difficiles telles que les lignes téléphoniques bruyantes et les voix concurrentes, fonctionnant en modes par lots et en streaming en temps réel.

lab xAI News · il y a 5 j · 24 vues

xAI lance Grok Voice Transcribe 2.0 avec une précision deux fois supérieure à celle de la v1

xAI a lancé Grok Voice Transcribe 2.0, un modèle de reconnaissance vocale deux fois plus précis que la version 1.0 tout en maintenant le même prix. Construit sur le modèle fondamental audio derrière Grok Voice, il s'appuie sur un ensemble de données unique d'audio multilingue en direct et bruyant pour gérer des conditions réelles difficiles telles que des lignes téléphoniques instables et des voix concurrentes.

lab OpenAI News · il y a 13 j τ²-bench · 1.0% · 52 vues

OpenAI lance l'API GPT-Live-1 pour des expériences vocales naturelles

OpenAI a lancé GPT-Live-1 dans l'API, offrant aux développeurs un modèle unique capable d'écouter et de parler simultanément pour créer des applications activées par la voix. Cette version vise à simplifier le développement de la couche vocale en remplaçant les architectures traditionnelles en chaîne par une approche unifiée qui gère plus naturellement les interruptions et le contexte.

media Hugging Face Forums · il y a 13 j · 12 vues

Aiden propose de séparer la voix en temps réel et l'exécution des tâches dans des modèles distincts

Aiden décrit une architecture pour les agents qui nécessite une conversation vocale full-duplex ainsi qu'un raisonnement visuel complexe et des actions sur le dispositif, évitant ainsi la limitation d'un modèle unique gérant les deux. La solution divise les responsabilités : un modèle de voix en temps réel gère la conversation tandis qu'un modèle séparé et plus puissant exécute les tâches en arrière-plan, en se coordonnant de manière asynchrone via une file d'attente de tâches.

arxiv arXiv cs.CL · il y a 14 j · 25 vues

TontaubeV1 permet la synthèse vocale en streaming avec un contexte borné

Les chercheurs présentent TontaubeV1, un modèle de synthèse vocale qui préserve une prosodie naturelle tout en permettant une inférence en streaming sur un seul GPU grand public. Le système utilise une représentation DualCodec hiérarchique à 12,5 Hz pour séparer les flux sémantiques des raffinements acoustiques, permettant un décodage causal malgré la nature non causale du codec sous-jacent.