Tema · Voice & audio
lab OpenAI News · há 11 d · 15 visualizações

Engenheiros da OpenAI desenvolvem GPT-Live, um sistema de voz full-duplex que remove detectores de turno

A OpenAI lançou o GPT-Live, um sistema de voz de terceira geração que elimina o detector de turno tradicional ao usar um modelo full-duplex capaz de ouvir e falar simultaneamente. Essa arquitetura permite conversas mais imediatas e naturais, mantendo baixa latência por meio de um novo design de sistema otimizado para desempenho em tempo real.

lab xAI News · há 16 d · 28 visualizações

xAI lança Grok Voice Think Fast 2.0 com raciocínio e precisão de transcrição aprimorados

A xAI anunciou o Grok Voice Think Fast 2.0, um modelo de voz de próxima geração que converte fala em fala, projetado para melhorar a inteligência, a precisão da transcrição e as capacidades de conversação. A atualização se baseia em seu antecessor, introduzindo ganhos significativos no raciocínio com fala, na habilidade de conversação e na confiabilidade do uso de ferramentas.

media The Batch · há 28 d GPQA Diamond · 84.2% · 4 visualizações

OpenAI lança modelos de voz full-duplex e tribunal alemão responsabiliza o Google por Visões Gerais da IA

A OpenAI lançou o GPT-Live-1 e o GPT-Live-1 mini para impulsionar uma ChatGPT Voice reconstruída, introduzindo processamento de áudio full-duplex que permite escuta e fala simultâneas. O sistema delega consultas complexas a modelos de raciocínio em segundo plano como o GPT-5.5, permitindo conversação contínua enquanto ocorre um pensamento mais profundo.

media MarkTechPost · há 5 d · 12 visualizações

NVIDIA lança NemotronLabs VoiceChat 11B, um modelo de fala-para-fala full-duplex aberto com troca de turno em ~450 ms

A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de ponta a ponta de fala-para-fala aberto com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Diferente das pilhas em cascata que encadeiam ASR, LLM e TTS, esta rede unificada realiza compreensão e geração de streaming de fala simultaneamente, alcançando uma latência medida de troca de turno suave de 448 ms no Full-Duplex-Bench 1.0.

media Hugging Face Forums · há 12 d · 8 visualizações

OpenGauntlet publica catálogo com 168 sistemas TTS e 106 sistemas STT

Um pesquisador publicou o catálogo de pesquisa OpenGauntlet, um recurso público contendo informações sobre 168 sistemas de texto para fala (TTS) e 106 sistemas de fala para texto (STT). Os diretórios cobrem modelos de código aberto e hospedados, licenças, requisitos de hardware, idiomas, capacidades, status do ciclo de vida, informações de origem e dados de benchmark publicados quando disponíveis.

media Hugging Face Forums · há 29 d · 1 visualização

NymphTech busca clonagem de voz de última geração para rede de rádio com IA

A NymphTech está buscando recomendações de modelos de clonagem de voz e síntese de fala de alta gama para aprimorar sua rede de estações de rádio com IA, focando especificamente em múltiplos idiomas e transmissões de formato longo. A empresa já lançou uma plataforma apresentando personalidades persistentes de IA como Trinity e Mark, com a Trinity transmitindo continuamente desde 9 de junho.