Voice & audio
lab OpenAI News · 5일 전 · 조회수 8회

OpenAI 엔지니어링팀이 턴 감지기를 제거하는 풀듀플렉스 음성 시스템인 GPT-Live를 개발

OpenAI는 청취와 발화를 동시에 수행할 수 있는 풀듀플렉스 모델을 사용하여 전통적인 턴 감지기를 제거한 3세대 음성 시스템인 GPT-Live를 출시했습니다. 이 아키텍처는 실시간 성능에 최적화된 새로운 시스템 설계를 통해 낮은 지연 시간을 유지하면서 더 즉각적이고 자연스러운 대화를 가능하게 합니다.

media Hugging Face Forums · 6일 전

OpenGauntlet이 168개 TTS 및 106개 STT 시스템의 카탈로그 게시

한 연구자가 OpenGauntlet 연구 카탈로그를 게시했습니다. 이는 168개의 텍스트 음성 변환(TTS) 시스템과 106개의 음성 텍스트 변환(STT) 시스템에 대한 정보를 포함하는 공개 리소스입니다. 디렉토리에는 오픈 및 호스팅 모델, 라이선스, 하드웨어 요구 사항, 언어, 기능, 수명 주기 상태, 소스 정보 및 사용 가능한 경우 게시된 벤치마크 데이터가 포함되어 있습니다.

media MarkTechPost · 19일 전 · 조회수 1회

알리바바 퉁이 연구소, Qwen-Audio-3.0-TTS를 Flash 및 Plus 등급으로 출시

알리바바의 퉁이 연구소는 두 가지 변형 버전으로 제공되는 호스팅 텍스트 음성 변환 시스템인 Qwen-Audio-3.0-TTS를 출시했습니다: 실시간 상호작용을 위한 Flash와 고품질 생성을 위한 Plus. 두 등급 모두 다운로드 가능한 가중치 대신 알리바바 클라우드 모델 스튜디오를 통해 제공됩니다.

media The Batch · 23일 전 GPQA Diamond · 84.2% · 조회수 3회

OpenAI, 풀듀플렉스 음성 모델 출시 및 독일 법원이 AI 오버뷰에 대해 구글을 책임 있게 판결

OpenAI는 재구축된 ChatGPT Voice를 지원하기 위해 GPT-Live-1과 GPT-Live-1 mini를 출시했으며, 이는 동시 청취와 발화가 가능한 풀듀플렉스 오디오 처리를 도입했습니다. 이 시스템은 복잡한 쿼리를 GPT-5.5와 같은 백그라운드 추론 모델에 위임하여, 더 깊은 사고가 진행되는 동안에도 지속적인 대화를 가능하게 합니다.

media Hugging Face Forums · 23일 전

NymphTech, AI 라디오 네트워크를 위한 최첨단 음성 클로닝 모색

NymphTech은 여러 언어와 장편 방송을 목표로 하여 AI 라디오 스테이션 네트워크를 강화하기 위해 고급 음성 클로닝 및 음성 합성 모델에 대한 권장 사항을 찾고 있습니다. 이 회사는 이미 Trinity와 Mark와 같은 지속적 AI 캐릭터를 특징으로 하는 플랫폼을 출시했으며, Trinity는 6월 9일 이후 지속적으로 방송해 왔습니다.

arxiv arXiv cs.CL · 24일 전

오디오 인식 대형 언어 모델의 세분화된 피드백을 통한 텍스트-오디오 지시 따름 개선

연구자들은 생성된 오디오에서 대상 이벤트의 존재와 시간적 관계를 검증하기 위해 오디오 인식 대형 언어 모델(ALLMs)을 세분화된 심판으로 사용하는 프레임워크를 제안합니다. 이 접근 방식은 기존 텍스트-오디오 모델이 여러 사운드 이벤트 및 그 순서와 관련된 지시를 따르는 데 종종 실패하는 격차를 해결합니다.

arxiv arXiv cs.CL · 24일 전

음성 평가를 위한 대규모 오디오 언어 모델 판사의 프로토콜 수준 단축 경로 감사

한 연구는 음성 평가를 위한 자동 판사로 사용되는 대규모 오디오-언어 모델(LALM)의 프로토콜 수준 단축 경로를 감사하여, 인간 평가와의 높은 일치율이 판단이 실제 오디오에 기반함을 보장하지 않는다는 사실을 드러냈다. 이 연구는 6개의 판사와 4가지 속성에 걸쳐 세 가지 배포 프로토콜을 조사했다: 피처 블루프린트 판정, 참조 조건부 판정, 및 쌍별 A/B 비교.

arxiv arXiv cs.CL · 24일 전

WavLM에 대한 DTW는 음운론, 리듬, 억양을 위한 텍스트 없는 L2 발화 점수 매기를 가능하게 합니다

이 연구는 레이블이 지정된 학습 데이터 없이 영어 및 일본어 제2언어(L2) 발화의 음운 정확도, 리듬, 억양을 평가하기 위해 자기지도형 WavLM 표현에 동적 시간 압축(DTW)을 사용하는 것을 조사합니다. 학습자 발화를 원어민 템플릿과 비교하는 기본 DTW 접근 방식은 전체 및 문장 수준의 음운 점수 매기에서 인간 동의율을 초과합니다.

lab Hugging Face Blog · 25일 전 · 조회수 14회

Hume, 인간 음성 AI의 품질을 위한 Real World VoiceEQ 벤치마크 출시

Hume은 시스템이 트랜스크립트를 넘어 음향 정보를 얼마나 잘 인식하고 생성하는지를 평가함으로써 음성 상호작용의 인간 품질을 측정하도록 설계된 벤치마크인 Real World VoiceEQ를 소개했습니다. 이 벤치마크는 785,000개의 TTS 및 48,000개의 STS 인간 평가에서 도출된 60개 이상의 지표를 사용하여 15개 이상의 차원에서 40개 이상의 독점 및 오픈소스 모델을 평가합니다.

arxiv arXiv cs.CL · 25일 전

Unified Gradient Projection은 다국어 ASR에서 파국적 망각을 줄입니다

연구자들은 Whisper와 같은 대규모 사전 학습 ASR 모델을 저자원 언어로 파인튜닝할 때 파국적 망각을 완화하기 위한 방법론인 Unified Gradient Projection (UGP)를 제안했습니다. UGP는 통합 투영 공간 내의 언어 균형 잡힌 리플레이에서 참조 기울기를 사용하여 매개변수 업데이트를 제약하고, 언어별 기여도를 효과적으로 균등화하여 지배적인 언어의 편향을 줄입니다.

media Hugging Face Forums · 27일 전

개발자가 프로덕션 음성 AI 에이전트를 위한 오케스트레이션 패턴 탐색

Hugging Face 포럼의 한 개발자는 Bland.ai, Retell, Vapi와 같은 프로덕션 플랫폼이 방대한 수동 작성 시스템 프롬프트에 의존하지 않고 프롬프트 오케스트레이션을 어떻게 관리하는지 이해하려고 합니다. 저자는 FastAPI, Sarvam STT/TTS, Pipecat SmartTurn V3를 사용한 현재 구현을 설명하며, 수동 상태별 주입이 복잡성 증가와 엣지 케이스 실패로 이어진다고 지적합니다.