OpenAI 엔지니어링팀이 턴 감지기를 제거하는 풀듀플렉스 음성 시스템인 GPT-Live를 개발
OpenAI는 청취와 발화를 동시에 수행할 수 있는 풀듀플렉스 모델을 사용하여 전통적인 턴 감지기를 제거한 3세대 음성 시스템인 GPT-Live를 출시했습니다. 이 아키텍처는 실시간 성능에 최적화된 새로운 시스템 설계를 통해 낮은 지연 시간을 유지하면서 더 즉각적이고 자연스러운 대화를 가능하게 합니다.
OpenAI는 청취와 발화를 동시에 수행할 수 있는 풀듀플렉스 모델을 사용하여 전통적인 턴 감지기를 제거한 3세대 음성 시스템인 GPT-Live를 출시했습니다. 이 아키텍처는 실시간 성능에 최적화된 새로운 시스템 설계를 통해 낮은 지연 시간을 유지하면서 더 즉각적이고 자연스러운 대화를 가능하게 합니다.
xAI는 지능, 전사 정확도, 대화 능력을 강화하기 위해 설계된 차세대 음성-음성 음성 모델인 Grok Voice Think Fast 2.0을 발표했습니다. 이번 업데이트는 기존 전작을 기반으로 음성 추론, 대화 능력, 도구 사용 신뢰성에서 의미 있는 개선을 도입했습니다.
Google은 사용자가 더 풍부한 트랙을 더 많은 창의적 제어 하에 생성할 수 있도록 Google Flow Music 내에서 최신 음악 생성 모델인 Lyria 3.5를 출시했습니다.
OpenAI는 재구축된 ChatGPT Voice를 지원하기 위해 GPT-Live-1과 GPT-Live-1 mini를 출시했으며, 이는 동시 청취와 발화가 가능한 풀듀플렉스 오디오 처리를 도입했습니다. 이 시스템은 복잡한 쿼리를 GPT-5.5와 같은 백그라운드 추론 모델에 위임하여, 더 깊은 사고가 진행되는 동안에도 지속적인 대화를 가능하게 합니다.
llama.cpp 프로젝트가 빌드 b10369를 출시하여 pocket-tts 텍스트 음성 변환 모델에 대한 지원을 도입했습니다. 이 업데이트에는 성능 최적화를 위해 GEMM과 col2im을 사용한 전치 컨볼루션의 새로운 구현이 포함되어 있습니다.
NVIDIA는 Magpie 다국어 TTS 모델의 업데이트를 출시하여 현대 표준 아랍어, 한국어, 브라질 포르투갈어를 추가해 총 12개 언어로 지원을 확대했습니다. 이번 릴리스는 업데이트된 학습 데이터와 아키텍처 변경을 통해 기존 언어 전반에 걸쳐 품질을 개선했습니다.
NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.
llama.cpp 프로젝트는 버전 b10270을 출시하여 Qwen3-TTS 모델에 대한 지원을 도입했습니다. 이 업데이트에는 llama-tts 바이너리에 대한 파괴적 변경 사항이 포함되어 있으며, 새로운 텍스트 음성 변환 워크플로우를 처리하기 위해 중요한 아키텍처 수정이 구현되었습니다.
NVIDIA가 Hugging Face에 NemotronLabs-VoiceChat-11B 음성 채팅 모델을 출시했습니다. 저장소는 풀 듀플렉스 통신 기능을 지원한다고 설명되어 있습니다.
한 연구자가 OpenGauntlet 연구 카탈로그를 게시했습니다. 이는 168개의 텍스트 음성 변환(TTS) 시스템과 106개의 음성 텍스트 변환(STT) 시스템에 대한 정보를 포함하는 공개 리소스입니다. 디렉토리에는 오픈 및 호스팅 모델, 라이선스, 하드웨어 요구 사항, 언어, 기능, 수명 주기 상태, 소스 정보 및 사용 가능한 경우 게시된 벤치마크 데이터가 포함되어 있습니다.
PolyAI는 트랜스크립트에 의존하는 대신 발신자 오디오를 직접 처리하는 대화 모델인 Dialog-RSN-1을 소개했습니다. 이 모델은 턴 테이킹, 음성 인식, 함수 호출 및 응답 생성을 단일 오디오 인식 시스템으로 통합합니다.
알리바바의 퉁이 연구소는 두 가지 변형 버전으로 제공되는 호스팅 텍스트 음성 변환 시스템인 Qwen-Audio-3.0-TTS를 출시했습니다: 실시간 상호작용을 위한 Flash와 고품질 생성을 위한 Plus. 두 등급 모두 다운로드 가능한 가중치 대신 알리바바 클라우드 모델 스튜디오를 통해 제공됩니다.
NymphTech은 여러 언어와 장편 방송을 목표로 하여 AI 라디오 스테이션 네트워크를 강화하기 위해 고급 음성 클로닝 및 음성 합성 모델에 대한 권장 사항을 찾고 있습니다. 이 회사는 이미 Trinity와 Mark와 같은 지속적 AI 캐릭터를 특징으로 하는 플랫폼을 출시했으며, Trinity는 6월 9일 이후 지속적으로 방송해 왔습니다.