Voice & audio
arxiv arXiv cs.CL · hace 2 d · 13 vistas

NemotronLabs lanza VoiceChat, un modelo de voz a voz en dúplex completo de código abierto con llamada de herramientas

NemotronLabs ha presentado VoiceChat, un modelo de código abierto de peso completo para conversión de voz a voz en dúplex completo, diseñado para integrar la escucha, la transcripción, el razonamiento y la habla dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de voz en streaming y un modelo de lenguaje solo-decodificador con flujos de salida especializados en paralelo para texto de agente y llamadas de función estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental del usuario.

arxiv arXiv cs.AI · hace 2 d · 13 vistas

NemotronLabs lanza VoiceChat, un modelo de voz a voz full-dúplex con capacidad de llamada a herramientas

NemotronLabs ha presentado NemotronLabs VoiceChat, un modelo de voz a voz full-dúplex de pesos abiertos que integra capacidades nativas de llamada a herramientas dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de audio en streaming y un modelo de lenguaje solo-decodificador con flujos de salida paralelos para texto del agente y llamadas a funciones estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental y un decodificador TTS en streaming.

media MarkTechPost · hace 4 d · 14 vistas

SpaceXAI lanza la API de Grok Voice Transcribe 2.0 con una precisión del doble

SpaceXAI ha lanzado Grok Voice Transcribe 2.0, un modelo de voz a texto disponible a través de una API alojada que afirma tener el doble de precisión que la versión 1.0 al mismo precio. El modelo está diseñado para condiciones de audio difíciles, como líneas telefónicas ruidosas y voces en competencia, y funciona tanto en modo por lotes como en transmisión en tiempo real.

lab xAI News · hace 5 d · 24 vistas

xAI lanza Grok Voice Transcribe 2.0 con el doble de precisión que v1

xAI ha lanzado Grok Voice Transcribe 2.0, un modelo de voz a texto que es el doble de preciso que la versión 1.0 mientras mantiene el mismo precio. Construido sobre el modelo base de audio detrás de Grok Voice, aprovecha un conjunto de datos único de audio multilingüe en vivo y ruidoso para manejar condiciones del mundo real desafiantes como líneas telefónicas inestables y voces competitivas.

lab OpenAI News · hace 13 d τ²-bench · 1.0% · 52 vistas

OpenAI lanza la API GPT-Live-1 para experiencias de voz natural

OpenAI ha lanzado GPT-Live-1 en la API, proporcionando a los desarrolladores un único modelo capaz de escuchar y hablar simultáneamente para construir aplicaciones habilitadas por voz. Este lanzamiento tiene como objetivo simplificar el desarrollo de la capa de voz reemplazando las arquitecturas encadenadas tradicionales con un enfoque unificado que maneja interrupciones y contexto de manera más natural.

media Hugging Face Forums · hace 13 d · 12 vistas

Aiden propone dividir la voz en tiempo real y la ejecución de tareas en modelos separados

Aiden describe una arquitectura para agentes que requiere conversación de voz full-duplex junto con razonamiento visual complejo y acciones del dispositivo, evitando la limitación de un único modelo que maneje ambas cosas. La solución divide las responsabilidades: un modelo de voz en tiempo real gestiona la conversación mientras un modelo separado y más potente ejecuta tareas en segundo plano, coordinándose asíncronamente a través de una cola de tareas.

arxiv arXiv cs.CL · hace 14 d · 25 vistas

TontaubeV1 permite texto-a-voz en streaming con contexto acotado

Los investigadores presentan TontaubeV1, un modelo de texto-a-voz que preserva la prosodia natural mientras habilita inferencia en streaming desde una única GPU de consumo. El sistema utiliza una representación DualCodec jerárquica a 12.5 Hz para separar las secuencias semánticas de los refinamientos acústicos, permitiendo la decodificación causal a pesar de la naturaleza no causal del códec subyacente.