주제 · Voice & audio
lab xAI News · 12일 전 · 조회수 30회

xAI, v1보다 정확도가 두 배인 Grok Voice Transcribe 2.0 출시

xAI는 버전 1.0보다 정확도가 두 배 높으면서도 동일한 가격을 유지하는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했습니다. Grok Voice의 오디오 파운데이션 모델 위에 구축되었으며, 불안정한 전화 회선과 경쟁하는 음성 같은 어려운 현실 세계 조건을 처리하기 위해 라이브 노이즈가 있는 다국어 오디오의 고유한 데이터셋을 활용합니다.

lab OpenAI News · 20일 전 τ²-bench · 1.0% · 조회수 58회

OpenAI, 자연스러운 음성 경험을 위한 GPT-Live-1 API 출시

OpenAI가 API에 GPT-Live-1을 출시하여 개발자에게 음성 기반 애플리케이션 구축을 위해 동시에 청취와 발화가 가능한 단일 모델을 제공합니다. 이번 릴리스는 전통적인 연결된 아키텍처를 중단과 맥락을 더 자연스럽게 처리하는 통합 방식으로 대체함으로써 음성 레이어 개발을 간소화하는 것을 목표로 합니다.

lab Hugging Face Blog · 4시간 전 · 조회수 1회

오픈 TTS 리더보드가 확장 가능한 다국어 TTS 평가를 출시하다

오픈 TTS 리더보드는 느린 아레나 기반 인간 선호도 점수에 의존하는 대신 객관적 지표를 사용하여 텍스트 음성 변환(TTS) 평가의 단편화와 표준화 부재를 해결하기 위해 출시되었습니다. 이 리더보드는 Qwen3 ASR과 WavLM 임베딩을 사용하여 모델의 가청성, 속도 및 화자 유사성을 평가합니다.

media MarkTechPost · 1일 전 · 조회수 3회

알리바바 Qwen이 전이중 음성 모델인 Qwen-Audio-3.1-Realtime를 출시

알리바바의 Qwen 팀은 새로운 Qwen-Audio-3.1-Realtime-plus를 포함한 5개 모델로 구성된 오디오 스택인 Qwen-Audio-3.1을 출시했으며, 이는 추론과 도구 사용이 가능한 음성 에이전트를 위해 설계된 전이중 음성 모델입니다. 이번 출시에서는 ASR 서비스에 최대 95%의 가격 인하도 도입되었습니다.

media MarkTechPost · 7일 전 · 조회수 5회

구글, 프롬프트 기반 음성 디자인을 지원하는 Gemini 3.8 Flash TTS 및 Flash-Lite TTS 출시

구글은 Gemini 오디오 패밀리의 일환으로 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS라는 두 가지 새로운 텍스트 음성 변환 모델을 출시했습니다. 이 모델들은 Gemini API와 Google AI Studio를 통해 자연어 프롬프트에서 생성되는 음성 디자인과 줄 단위의 연기 지시를 도입합니다.

lab Hugging Face Blog · 7일 전 · 조회수 27회

NVIDIA가 오픈 가중치 Nemotron 3 화자 분할 모델을 출시

NVIDIA는 실시간 화자 분할을 위한 오픈 가중치 100M 파라미터 모델인 Nemotron 3 Diarization을 출시했으며, 최대 8명의 화자를 지원합니다. 이 모델은 VoiceArena의 Diarization-Bench 리더보드에서 14.72%의 화자 오류율(DER)로 1위를 차지했으며, 이는 다음 순위 시스템보다 약 24% 상대적 감소를 의미합니다.

arxiv arXiv cs.CL · 10일 전 · 조회수 17회

NemotronLabs가 도구 호출 기능을 갖춘 오픈 풀듀플렉스 음성-음성 모델 VoiceChat 출시

NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.

arxiv arXiv cs.AI · 10일 전 · 조회수 17회

NemotronLabs가 도구 호출 기능을 갖춘 오픈 풀듀플렉스 음성-음성 모델 VoiceChat 출시

NemotronLabs는 통합 스트리밍 아키텍처 내에서 네이티브 도구 호출 기능을 통합한 오픈 가중치 풀듀플렉스 음성-음성 모델인 NemotronLabs VoiceChat을 출시했습니다. 이 시스템은 에이전트 텍스트와 구조화된 함수 호출을 위한 병렬 출력 스트림, 증분 전사를 위한 보조 RNN-T 브랜치, 그리고 스트리밍 TTS 디코더를 결합한 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합합니다.

media MarkTechPost · 12일 전 · 조회수 16회

SpaceXAI,claimed 2배 정확도를 내세운 Grok Voice Transcribe 2.0 API 출시

SpaceXAI가 호스팅 API를 통해 제공되는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했으며, 이는 동일한 가격대에서 버전 1.0 대비 두 배의 정확도를 주장합니다. 이 모델은 시끄러운 전화 회선과 경쟁하는 음성 등 어려운 오디오 조건을 대상으로 하며, 배치 및 실시간 스트리밍 모드에서 실행됩니다.

media Hugging Face Forums · 21일 전 · 조회수 15회

Aiden, 실시간 음성 및 작업 실행을 별도 모델로 분할 제안

Aiden은 복잡한 시각적 추론과 디바이스 작업을 동반한 풀듀플렉스 음성 대화를 필요로 하며, 두 가지를 모두 처리하는 단일 모델의 한계를 피하는 에이전트용 아키텍처를 설명합니다. 이 솔루션은 책임을 분할합니다: 실시간 음성 모델이 대화를 관리하고 별도의 더 강력한 모델이 백그라운드 작업을 실행하며 작업 큐를 통해 비동기적으로 조정합니다.