Voice & audio
arxiv arXiv cs.CL · há 2 d · 13 visualizações

NemotronLabs lança VoiceChat, um modelo aberto de fala-para-fala full-duplex com chamada de ferramentas

A NemotronLabs apresentou o VoiceChat, um modelo open-weight de fala-para-fala full-duplex projetado para integrar escuta, transcrição, raciocínio e fala dentro de uma arquitetura de streaming unificada. O sistema combina um codificador de streaming de áudio e um modelo de linguagem decoder-only com fluxos de saída especializados paralelos para texto do agente e chamadas de função estruturadas, além de um ramo auxiliar RNN-T para transcrição incremental do usuário.

arxiv arXiv cs.AI · há 2 d · 13 visualizações

NemotronLabs lança o VoiceChat, um modelo de fala-para-fala full-duplex e aberto com chamada de ferramentas

A NemotronLabs apresentou o NemotronLabs VoiceChat, um modelo de fala-para-fala full-duplex de pesos abertos que integra capacidades nativas de chamada de ferramentas dentro de uma arquitetura de streaming unificada. O sistema combina um codificador de áudio em streaming e um modelo de linguagem decoder-only com fluxos de saída paralelos para texto do agente e chamadas de função estruturadas, além de um ramo RNN-T auxiliar para transcrição incremental e um decodificador TTS em streaming.

lab xAI News · há 5 d · 24 visualizações

xAI lança Grok Voice Transcribe 2.0 com o dobro da precisão do v1

A xAI lançou o Grok Voice Transcribe 2.0, um modelo de fala para texto que é duas vezes mais preciso que a versão 1.0, mantendo o mesmo preço. Construído sobre o modelo base de áudio por trás do Grok Voice, ele utiliza um conjunto de dados exclusivo de áudio multilíngue ao vivo e ruidoso para lidar com condições desafiadoras do mundo real, como linhas telefônicas instáveis e vozes concorrentes.

lab OpenAI News · há 13 d τ²-bench · 1.0% · 52 visualizações

OpenAI lança API GPT-Live-1 para experiências de voz natural

A OpenAI lançou o GPT-Live-1 na API, oferecendo aos desenvolvedores um único modelo capaz de ouvir e falar simultaneamente para construir aplicações habilitadas por voz. Este lançamento visa simplificar o desenvolvimento da camada de voz substituindo arquiteturas encadeadas tradicionais por uma abordagem unificada que lida com interrupções e contexto de forma mais natural.

media Hugging Face Forums · há 13 d · 12 visualizações

Aiden propõe dividir a voz em tempo real e a execução de tarefas em modelos separados

Aiden descreve uma arquitetura para agentes que requer conversa de voz full-duplex junto com raciocínio visual complexo e ações do dispositivo, evitando a limitação de um único modelo lidando com ambos. A solução divide as responsabilidades: um modelo de voz em tempo real gerencia a conversa enquanto um modelo separado e mais forte executa tarefas em segundo plano, coordenando-se assincronamente por meio de uma fila de tarefas.

arxiv arXiv cs.CL · há 14 d · 25 visualizações

TontaubeV1 permite texto-para-fala em streaming com contexto limitado

Pesquisadores apresentam o TontaubeV1, um modelo de texto-para-fala que preserva a prosódia natural enquanto permite inferência em streaming a partir de uma única GPU de consumo. O sistema utiliza uma representação DualCodec hierárquica a 12.5 Hz para separar fluxos semânticos de refinamentos acústicos, permitindo decodificação causal apesar da natureza não causal do codec subjacente.