Tema · Voice & audio
lab xAI News · hace 5 d · 27 vistas

xAI lanza Grok Voice Transcribe 2.0 con el doble de precisión que v1

xAI ha lanzado Grok Voice Transcribe 2.0, un modelo de voz a texto que es el doble de preciso que la versión 1.0 mientras mantiene el mismo precio. Construido sobre el modelo base de audio detrás de Grok Voice, aprovecha un conjunto de datos único de audio multilingüe en vivo y ruidoso para manejar condiciones del mundo real desafiantes como líneas telefónicas inestables y voces competitivas.

lab OpenAI News · hace 13 d τ²-bench · 1.0% · 53 vistas

OpenAI lanza la API GPT-Live-1 para experiencias de voz natural

OpenAI ha lanzado GPT-Live-1 en la API, proporcionando a los desarrolladores un único modelo capaz de escuchar y hablar simultáneamente para construir aplicaciones habilitadas por voz. Este lanzamiento tiene como objetivo simplificar el desarrollo de la capa de voz reemplazando las arquitecturas encadenadas tradicionales con un enfoque unificado que maneja interrupciones y contexto de manera más natural.

lab Hugging Face Blog · hace 12 h · 10 vistas

NVIDIA lanza el modelo de diarización Nemotron 3 de pesos abiertos

NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de pesos abiertos con 100M de parámetros para diarización de hablantes en tiempo real que admite hasta ocho hablantes. El modelo ocupa el puesto #1 en la lista de clasificación Diarization-Bench de VoiceArena con una Tasa de Error de Diarización (DER) del 14.72%, superando al siguiente sistema clasificado con una reducción relativa aproximada del 24%.

arxiv arXiv cs.CL · hace 3 d · 14 vistas

NemotronLabs lanza VoiceChat, un modelo de voz a voz en dúplex completo de código abierto con llamada de herramientas

NemotronLabs ha presentado VoiceChat, un modelo de código abierto de peso completo para conversión de voz a voz en dúplex completo, diseñado para integrar la escucha, la transcripción, el razonamiento y la habla dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de voz en streaming y un modelo de lenguaje solo-decodificador con flujos de salida especializados en paralelo para texto de agente y llamadas de función estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental del usuario.

arxiv arXiv cs.AI · hace 3 d · 13 vistas

NemotronLabs lanza VoiceChat, un modelo de voz a voz full-dúplex con capacidad de llamada a herramientas

NemotronLabs ha presentado NemotronLabs VoiceChat, un modelo de voz a voz full-dúplex de pesos abiertos que integra capacidades nativas de llamada a herramientas dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de audio en streaming y un modelo de lenguaje solo-decodificador con flujos de salida paralelos para texto del agente y llamadas a funciones estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental y un decodificador TTS en streaming.

media MarkTechPost · hace 5 d · 14 vistas

SpaceXAI lanza la API de Grok Voice Transcribe 2.0 con una precisión del doble

SpaceXAI ha lanzado Grok Voice Transcribe 2.0, un modelo de voz a texto disponible a través de una API alojada que afirma tener el doble de precisión que la versión 1.0 al mismo precio. El modelo está diseñado para condiciones de audio difíciles, como líneas telefónicas ruidosas y voces en competencia, y funciona tanto en modo por lotes como en transmisión en tiempo real.

media Hugging Face Forums · hace 14 d · 14 vistas

Aiden propone dividir la voz en tiempo real y la ejecución de tareas en modelos separados

Aiden describe una arquitectura para agentes que requiere conversación de voz full-duplex junto con razonamiento visual complejo y acciones del dispositivo, evitando la limitación de un único modelo que maneje ambas cosas. La solución divide las responsabilidades: un modelo de voz en tiempo real gestiona la conversación mientras un modelo separado y más potente ejecuta tareas en segundo plano, coordinándose asíncronamente a través de una cola de tareas.