A OpenAI lançou o GPT-Live, um sistema de voz de terceira geração que elimina o detector de turno tradicional ao usar um modelo full-duplex capaz de ouvir e falar simultaneamente. Essa arquitetura permite conversas mais imediatas e naturais, mantendo baixa latência por meio de um novo design de sistema otimizado para desempenho em tempo real.
- O sistema transmite áudio entrante para o modelo de voz e fala de saída de volta ao usuário, processando raciocínio mais profundo ou uso de ferramentas por meio de modelos de ponta como GPT-5.5 em um caminho assíncrono separado.
- O fluxo de mídia é separado da lógica do aplicativo usando um caminho rápido dedicado, com a lógica de inferência escrita em Go para melhorar a suavidade da entrega de frames.
- Um mecanismo de transferência contínua permite compactação dinâmica de contexto e transições de instância do modelo sem interromper o loop de mídia.
- O WebRTC Abridged Roundtrip Protocol (WARP) reduz as voltas de rede na inicialização de seis para uma.
Essa base sustenta capacidades no ChatGPT Voice, incluindo controle de computador e coordenação de agentes no aplicativo desktop, garantindo que personalizações do aplicativo não afetem a responsividade do caminho de mídia ao vivo.