Voice & audio
lab OpenAI News · há 5 d · 8 visualizações

Engenheiros da OpenAI desenvolvem GPT-Live, um sistema de voz full-duplex que remove detectores de turno

A OpenAI lançou o GPT-Live, um sistema de voz de terceira geração que elimina o detector de turno tradicional ao usar um modelo full-duplex capaz de ouvir e falar simultaneamente. Essa arquitetura permite conversas mais imediatas e naturais, mantendo baixa latência por meio de um novo design de sistema otimizado para desempenho em tempo real.

media Hugging Face Forums · há 6 d

OpenGauntlet publica catálogo com 168 sistemas TTS e 106 sistemas STT

Um pesquisador publicou o catálogo de pesquisa OpenGauntlet, um recurso público contendo informações sobre 168 sistemas de texto para fala (TTS) e 106 sistemas de fala para texto (STT). Os diretórios cobrem modelos de código aberto e hospedados, licenças, requisitos de hardware, idiomas, capacidades, status do ciclo de vida, informações de origem e dados de benchmark publicados quando disponíveis.

lab xAI News · há 11 d · 10 visualizações

xAI lança Grok Voice Think Fast 2.0 com raciocínio e precisão de transcrição aprimorados

A xAI anunciou o Grok Voice Think Fast 2.0, um modelo de voz de próxima geração que converte fala em fala, projetado para melhorar a inteligência, a precisão da transcrição e as capacidades de conversação. A atualização se baseia em seu antecessor, introduzindo ganhos significativos no raciocínio com fala, na habilidade de conversação e na confiabilidade do uso de ferramentas.

media The Batch · há 23 d GPQA Diamond · 84.2% · 3 visualizações

OpenAI lança modelos de voz full-duplex e tribunal alemão responsabiliza o Google por Visões Gerais da IA

A OpenAI lançou o GPT-Live-1 e o GPT-Live-1 mini para impulsionar uma ChatGPT Voice reconstruída, introduzindo processamento de áudio full-duplex que permite escuta e fala simultâneas. O sistema delega consultas complexas a modelos de raciocínio em segundo plano como o GPT-5.5, permitindo conversação contínua enquanto ocorre um pensamento mais profundo.

media Hugging Face Forums · há 23 d

NymphTech busca clonagem de voz de última geração para rede de rádio com IA

A NymphTech está buscando recomendações de modelos de clonagem de voz e síntese de fala de alta gama para aprimorar sua rede de estações de rádio com IA, focando especificamente em múltiplos idiomas e transmissões de formato longo. A empresa já lançou uma plataforma apresentando personalidades persistentes de IA como Trinity e Mark, com a Trinity transmitindo continuamente desde 9 de junho.

arxiv arXiv cs.CL · há 24 d

Melhorando o Seguimento de Instruções de Texto para Áudio via Feedback Fino de Modelos de Linguagem Grandes Conscientes de Áudio

Pesquisadores propõem um framework que utiliza modelos de linguagem grandes conscientes de áudio (ALLMs) como juízes de feedback fino para verificar a presença de eventos-alvo e relações temporais no áudio gerado. Esta abordagem aborda a lacuna onde os modelos existentes de texto para áudio frequentemente falham em seguir instruções envolvendo múltiplos eventos sonoros e sua ordem.

arxiv arXiv cs.CL · há 24 d

Auditoria de atalhos em nível de protocolo em juízes de modelos de linguagem grandes para áudio na avaliação de fala

Um estudo audita atalhos em nível de protocolo em modelos de linguagem grandes para áudio (LALMs) usados como juízes automáticos para avaliação de fala, revelando que um alto acordo com as classificações humanas não garante que os vereditos estejam fundamentados no áudio real. A pesquisa examina três protocolos de implantação: julgamento por blueprint de características, julgamento condicionado a referência e comparação emparelhada A/B entre seis juízes e quatro atributos.

arxiv arXiv cs.CL · há 24 d

DTW sobre WavLM permite pontuação de fala L2 sem texto para fonética, ritmo e entonação

O estudo investiga o uso da Distorção Temporal Dinâmica (DTW) em representações autossupervisionadas do WavLM para avaliar a precisão fonética, o ritmo e a entonação na fala L2 em inglês e japonês sem exigir dados de treinamento rotulados. A abordagem básica de DTW que compara a fala do aprendiz com modelos nativos supera o acordo humano na pontuação fonética holística e em nível de sentença.

lab Hugging Face Blog · há 25 d · 14 visualizações

Hume lança benchmark Real World VoiceEQ para qualidade de voz humana em IA

A Hume introduziu o Real World VoiceEQ, um benchmark projetado para avaliar a qualidade humana da interação por voz, analisando o quão bem os sistemas reconhecem e produzem informações acústicas além das transcrições. O benchmark avalia mais de 40 modelos proprietários e open-source em mais de 15 dimensões, utilizando mais de 60 métricas derivadas de 785.000 avaliações humanas de TTS e 48.000 de STS.

arxiv arXiv cs.CL · há 25 d

A Projeção de Gradiente Unificada reduz o esquecimento catastrófico em ASR multilíngue

Pesquisadores propõem a Projeção de Gradiente Unificada (UGP), um método para mitigar o esquecimento catastrófico ao ajustar modelos grandes de ASR pré-treinados como Whisper em idiomas com poucos recursos. A UGP restringe as atualizações de parâmetros usando gradientes de referência do replay equilibrado por idioma dentro de um espaço de projeção unificado, igualando efetivamente as contribuições por idioma e reduzindo o viés do idioma dominante.

media Hugging Face Forums · há 27 d

Desenvolvedor explora padrões de orquestração para agentes de voz com IA em produção

Um desenvolvedor nos fóruns do Hugging Face busca entender como plataformas de produção como Bland.ai, Retell e Vapi gerenciam a orquestração de prompts sem depender de prompts de sistema massivos escritos à mão. O autor descreve sua implementação atual usando FastAPI, Sarvam STT/TTS e Pipecat SmartTurn V3, observando que a injeção manual por estado leva a uma complexidade crescente e falhas em casos limite.