A OpenAI lançou o GPT-Live-1 na API, oferecendo aos desenvolvedores um único modelo capaz de ouvir e falar simultaneamente para construir aplicações habilitadas por voz. Este lançamento visa simplificar o desenvolvimento da camada de voz substituindo arquiteturas encadeadas tradicionais por uma abordagem unificada que lida com interrupções e contexto de forma mais natural.
As principais capacidades incluem melhor tratamento de interrupções por meio de raciocínio conjunto sobre áudio entrante e saínte, e a capacidade de delegar tarefas de raciocínio mais profundo para modelos de back-end como GPT-6 Astra ou sistemas de terceiros. O modelo suporta personalização de tom, ritmo e estilo por meio de prompts de sistema, gerencia eficazmente ruído de fundo e silêncio, e garante confiabilidade em sessões longas.
Avaliações mostram que o GPT-Live-1 melhora o desempenho do Full Duplex Bench em 30 pontos percentuais em relação ao GPT-Realtime-2.1 e ocupa a posição #1 no benchmark Tau3 para inteligência de agentes de voz quando pareado com GPT-6 Astra. Está disponível hoje por $0,05 por minuto para a camada de voz front-end, com opções de voz expandidas e disponibilidade de idiomas planejadas para os próximos meses.