Voice & audio
lab OpenAI News · hace 5 d · 8 vistas

Ingenieros de OpenAI desarrollan GPT-Live, un sistema de voz full-dúplex que elimina los detectores de turno

OpenAI ha lanzado GPT-Live, un sistema de voz de tercera generación que elimina el detector de turno tradicional mediante un modelo full-dúplex capaz de escuchar y hablar simultáneamente. Esta arquitectura permite conversaciones más inmediatas y naturales mientras mantiene una baja latencia gracias a un nuevo diseño del sistema optimizado para el rendimiento en tiempo real.

media Hugging Face Forums · hace 6 d

OpenGauntlet publica un catálogo de 168 sistemas TTS y 106 sistemas STT

Un investigador ha publicado el catálogo de investigación OpenGauntlet, un recurso público que contiene información sobre 168 sistemas de texto a voz (TTS) y 106 sistemas de voz a texto (STT). Los directorios cubren modelos de código abierto y alojados, licencias, requisitos de hardware, idiomas, capacidades, estado del ciclo de vida, información de origen y datos de benchmark publicados cuando están disponibles.

lab xAI News · hace 11 d · 10 vistas

xAI lanza Grok Voice Think Fast 2.0 con mejor razonamiento y precisión en transcripción de voz

xAI ha anunciado Grok Voice Think Fast 2.0, un modelo de voz de próxima generación de voz a voz diseñado para mejorar la inteligencia, la precisión de la transcripción y las capacidades conversacionales. La actualización se basa en su predecesor introduciendo mejoras significativas en el razonamiento del habla, la capacidad conversacional y la fiabilidad del uso de herramientas.

media The Batch · hace 23 d GPQA Diamond · 84.2% · 3 vistas

OpenAI lanza modelos de voz full-dúplex y un tribunal alemán considera responsable a Google por las Resúmenes de IA

OpenAI ha lanzado GPT-Live-1 y GPT-Live-1 mini para impulsar una versión reconstruida de ChatGPT Voice, introduciendo procesamiento de audio full-dúplex que permite escuchar y hablar simultáneamente. El sistema delega consultas complejas en modelos de razonamiento en segundo plano como GPT-5.5, lo que permite conversaciones continuas mientras ocurre un pensamiento más profundo.

media Hugging Face Forums · hace 23 d

NymphTech busca clonación de voz de última generación para su red de radio con IA

NymphTech está buscando recomendaciones de modelos de clonación de voz y síntesis de habla de alta gama para mejorar su red de estaciones de radio con IA, apuntando específicamente a múltiples idiomas y transmisiones de formato largo. La empresa ya ha lanzado una plataforma que presenta personalidades persistentes de IA como Trinity y Mark, con Trinity transmitiendo continuamente desde el 9 de junio.

arxiv arXiv cs.CL · hace 24 d

Mejora del seguimiento de instrucciones en la generación de texto a audio mediante retroalimentación fina de modelos de lenguaje grandes conscientes del audio

Los investigadores proponen un marco que utiliza modelos de lenguaje grandes conscientes del audio (ALLMs) como jueces de retroalimentación fina para verificar la presencia de eventos objetivo y las relaciones temporales en el audio generado. Este enfoque aborda la brecha donde los modelos existentes de texto a audio a menudo no siguen instrucciones que involucran múltiples eventos sonoros y su orden.

arxiv arXiv cs.CL · hace 24 d

Auditoría de atajos a nivel de protocolo en jueces de modelos de lenguaje grandes para audio y evaluación del habla

Un estudio audita los atajos a nivel de protocolo en modelos de lenguaje grandes para audio (LALMs) utilizados como jueces automáticos para la evaluación del habla, revelando que un alto acuerdo con las calificaciones humanas no garantiza que los veredictos estén fundamentados en el audio real. La investigación examina tres protocolos de implementación: juzgamiento por esquema de características, juzgamiento condicionado a referencia y comparación A/B por pares entre seis jueces y cuatro atributos.

arxiv arXiv cs.CL · hace 24 d

DTW sobre WavLM permite la puntuación de habla L2 sin texto para fonética, ritmo e entonación

El estudio investiga el uso de la alineación temporal dinámica (DTW) en representaciones autovigilantes de WavLM para evaluar la precisión fonética, el ritmo y la entonación en habla L2 en inglés y japonés sin requerir datos de entrenamiento etiquetados. El enfoque básico de DTW que compara el habla del aprendiz con plantillas nativas supera el acuerdo humano en la puntuación fonética holística y a nivel de oración.

lab Hugging Face Blog · hace 25 d · 14 vistas

Hume lanza el benchmark Real World VoiceEQ para la calidad de voz humana en IA

Hume ha presentado Real World VoiceEQ, un benchmark diseñado para evaluar la calidad humana de la interacción por voz mediante la evaluación de cuán bien los sistemas reconocen y producen información acústica más allá de las transcripciones. El benchmark evalúa más de 40 modelos propietarios y de código abierto en más de 15 dimensiones utilizando más de 60 métricas derivadas de 785,000 valoraciones humanas de TTS y 48,000 de STS.

arxiv arXiv cs.CL · hace 25 d

La proyección de gradiente unificada reduce el olvido catastrófico en ASR multilingüe

Los investigadores proponen la Proyección de Gradiente Unificada (UGP), un método para mitigar el olvido catastrófico al ajustar modelos grandes de ASR previamente entrenados como Whisper en idiomas con pocos recursos. UGP restringe las actualizaciones de parámetros utilizando gradientes de referencia del repliegue equilibrado por idioma dentro de un espacio de proyección unificado, igualando efectivamente las contribuciones por idioma y reduciendo el sesgo del idioma dominante.

media Hugging Face Forums · hace 27 d

Un desarrollador explora patrones de orquestación para agentes de voz con IA en producción

Un desarrollador en los foros de Hugging Face busca entender cómo plataformas de producción como Bland.ai, Retell y Vapi gestionan la orquestación de prompts sin depender de prompts de sistema masivos escritos a mano. El autor describe su implementación actual usando FastAPI, Sarvam STT/TTS y Pipecat SmartTurn V3, señalando que la inyección manual por estado conduce a una complejidad creciente y fallos en casos límite.