Voice & audio
arxiv arXiv cs.CL · 2일 전 · 조회수 13회

NemotronLabs가 도구 호출 기능을 갖춘 오픈 풀듀플렉스 음성-음성 모델 VoiceChat 출시

NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.

arxiv arXiv cs.AI · 2일 전 · 조회수 13회

NemotronLabs가 도구 호출 기능을 갖춘 오픈 풀듀플렉스 음성-음성 모델 VoiceChat 출시

NemotronLabs는 통합 스트리밍 아키텍처 내에서 네이티브 도구 호출 기능을 통합한 오픈 가중치 풀듀플렉스 음성-음성 모델인 NemotronLabs VoiceChat을 출시했습니다. 이 시스템은 에이전트 텍스트와 구조화된 함수 호출을 위한 병렬 출력 스트림, 증분 전사를 위한 보조 RNN-T 브랜치, 그리고 스트리밍 TTS 디코더를 결합한 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합합니다.

media MarkTechPost · 4일 전 · 조회수 14회

SpaceXAI,claimed 2배 정확도를 내세운 Grok Voice Transcribe 2.0 API 출시

SpaceXAI가 호스팅 API를 통해 제공되는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했으며, 이는 동일한 가격대에서 버전 1.0 대비 두 배의 정확도를 주장합니다. 이 모델은 시끄러운 전화 회선과 경쟁하는 음성 등 어려운 오디오 조건을 대상으로 하며, 배치 및 실시간 스트리밍 모드에서 실행됩니다.

lab xAI News · 5일 전 · 조회수 24회

xAI, v1보다 정확도가 두 배인 Grok Voice Transcribe 2.0 출시

xAI는 버전 1.0보다 정확도가 두 배 높으면서도 동일한 가격을 유지하는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했습니다. Grok Voice의 오디오 파운데이션 모델 위에 구축되었으며, 불안정한 전화 회선과 경쟁하는 음성 같은 어려운 현실 세계 조건을 처리하기 위해 라이브 노이즈가 있는 다국어 오디오의 고유한 데이터셋을 활용합니다.

lab OpenAI News · 13일 전 τ²-bench · 1.0% · 조회수 52회

OpenAI, 자연스러운 음성 경험을 위한 GPT-Live-1 API 출시

OpenAI가 API에 GPT-Live-1을 출시하여 개발자에게 음성 기반 애플리케이션 구축을 위해 동시에 청취와 발화가 가능한 단일 모델을 제공합니다. 이번 릴리스는 전통적인 연결된 아키텍처를 중단과 맥락을 더 자연스럽게 처리하는 통합 방식으로 대체함으로써 음성 레이어 개발을 간소화하는 것을 목표로 합니다.

media Hugging Face Forums · 13일 전 · 조회수 12회

Aiden, 실시간 음성 및 작업 실행을 별도 모델로 분할 제안

Aiden은 복잡한 시각적 추론과 디바이스 작업을 동반한 풀듀플렉스 음성 대화를 필요로 하며, 두 가지를 모두 처리하는 단일 모델의 한계를 피하는 에이전트용 아키텍처를 설명합니다. 이 솔루션은 책임을 분할합니다: 실시간 음성 모델이 대화를 관리하고 별도의 더 강력한 모델이 백그라운드 작업을 실행하며 작업 큐를 통해 비동기적으로 조정합니다.

arxiv arXiv cs.LG · 14일 전 · 조회수 24회

TontaubeV1은 제한된 컨텍스트로 스트리밍 텍스트 음성 변환을 가능하게 합니다

연구자들은 단일 소비자 GPU에서 스트리밍 추론을 가능하게 하면서 자연스러운 운율을 보존하는 텍스트 음성 변환 모델인 TontaubeV1을 제시했습니다. 이 시스템은 의미 있는 스트림과 음향적 정제를 분리하기 위해 12.5 Hz의 계층적 DualCodec 표현을 사용하며, 이를 통해 낮은 지연 시간 생성이 가능합니다.

arxiv arXiv cs.CL · 14일 전 · 조회수 25회

TontaubeV1은 제한된 문맥으로 스트리밍 텍스트 음성 변환을 가능하게 합니다

연구자들은 단일 소비자용 GPU에서 스트리밍 추론을 가능하게 하면서도 자연스러운 운율을 보존하는 텍스트 음성 변환 모델인 TontaubeV1을 제시했습니다. 이 시스템은 12.5 Hz의 계층적 DualCodec 표현을 사용하여 의미 있는 스트림과 음향 보정을 분리하며, 이는 근본적으로 비인과적인 코덱의 특성에도 불구하고 인과적 디코딩을 가능하게 합니다.

media MarkTechPost · 21일 전 · 조회수 26회

메타 슈퍼인텔리전스 랩스가 뮤즈 보이스 트랜스크라이브 출시

메타 슈퍼인텔리전스 랩스는 스트리밍 자동 음성 인식(ASR), 20명 이상의 화자 분할, 그리고 엔드포인트 검출을 한 번의 처리로 수행하는 단일 자기회귀 모델을 출시한 뮤즈 보이스 트랜스크라이브를 발표했습니다. 이 모델은 메타 모델 API를 통해 muse-voice-transcribe-1.0이라는 이름으로 호스팅된 API 형태로 제공됩니다.