주제 · Voice & audio
lab OpenAI News · 11일 전 · 조회수 15회

OpenAI 엔지니어링팀이 턴 감지기를 제거하는 풀듀플렉스 음성 시스템인 GPT-Live를 개발

OpenAI는 청취와 발화를 동시에 수행할 수 있는 풀듀플렉스 모델을 사용하여 전통적인 턴 감지기를 제거한 3세대 음성 시스템인 GPT-Live를 출시했습니다. 이 아키텍처는 실시간 성능에 최적화된 새로운 시스템 설계를 통해 낮은 지연 시간을 유지하면서 더 즉각적이고 자연스러운 대화를 가능하게 합니다.

media The Batch · 29일 전 GPQA Diamond · 84.2% · 조회수 4회

OpenAI, 풀듀플렉스 음성 모델 출시 및 독일 법원이 AI 오버뷰에 대해 구글을 책임 있게 판결

OpenAI는 재구축된 ChatGPT Voice를 지원하기 위해 GPT-Live-1과 GPT-Live-1 mini를 출시했으며, 이는 동시 청취와 발화가 가능한 풀듀플렉스 오디오 처리를 도입했습니다. 이 시스템은 복잡한 쿼리를 GPT-5.5와 같은 백그라운드 추론 모델에 위임하여, 더 깊은 사고가 진행되는 동안에도 지속적인 대화를 가능하게 합니다.

media MarkTechPost · 5일 전 · 조회수 13회

NVIDIA, ~450ms 턴테이킹을 지원하는 오픈 풀듀플렉스 음성-음성 모델 NemotronLabs VoiceChat 11B 출시

NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.

media Hugging Face Forums · 12일 전 · 조회수 8회

OpenGauntlet이 168개 TTS 및 106개 STT 시스템의 카탈로그 게시

한 연구자가 OpenGauntlet 연구 카탈로그를 게시했습니다. 이는 168개의 텍스트 음성 변환(TTS) 시스템과 106개의 음성 텍스트 변환(STT) 시스템에 대한 정보를 포함하는 공개 리소스입니다. 디렉토리에는 오픈 및 호스팅 모델, 라이선스, 하드웨어 요구 사항, 언어, 기능, 수명 주기 상태, 소스 정보 및 사용 가능한 경우 게시된 벤치마크 데이터가 포함되어 있습니다.

media MarkTechPost · 25일 전 · 조회수 2회

알리바바 퉁이 연구소, Qwen-Audio-3.0-TTS를 Flash 및 Plus 등급으로 출시

알리바바의 퉁이 연구소는 두 가지 변형 버전으로 제공되는 호스팅 텍스트 음성 변환 시스템인 Qwen-Audio-3.0-TTS를 출시했습니다: 실시간 상호작용을 위한 Flash와 고품질 생성을 위한 Plus. 두 등급 모두 다운로드 가능한 가중치 대신 알리바바 클라우드 모델 스튜디오를 통해 제공됩니다.

media Hugging Face Forums · 29일 전 · 조회수 1회

NymphTech, AI 라디오 네트워크를 위한 최첨단 음성 클로닝 모색

NymphTech은 여러 언어와 장편 방송을 목표로 하여 AI 라디오 스테이션 네트워크를 강화하기 위해 고급 음성 클로닝 및 음성 합성 모델에 대한 권장 사항을 찾고 있습니다. 이 회사는 이미 Trinity와 Mark와 같은 지속적 AI 캐릭터를 특징으로 하는 플랫폼을 출시했으며, Trinity는 6월 9일 이후 지속적으로 방송해 왔습니다.