구글, 제미니 3.8 플래시 및 플래시-라이트 텍스트 음성 변환 모델 출시
구글은 크리에이터, 개발자, 기업에게 동적 음성 생성 기능을 제공하기 위해 제미니 오디오 패밀리를 확장하는 두 가지 새로운 텍스트 음성 변환(TTS) 모델인 제미니 3.8 플래시 TTS와 제미니 3.8 플래시-라이트 TTS를 출시했습니다.
구글은 크리에이터, 개발자, 기업에게 동적 음성 생성 기능을 제공하기 위해 제미니 오디오 패밀리를 확장하는 두 가지 새로운 텍스트 음성 변환(TTS) 모델인 제미니 3.8 플래시 TTS와 제미니 3.8 플래시-라이트 TTS를 출시했습니다.
xAI는 버전 1.0보다 정확도가 두 배 높으면서도 동일한 가격을 유지하는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했습니다. Grok Voice의 오디오 파운데이션 모델 위에 구축되었으며, 불안정한 전화 회선과 경쟁하는 음성 같은 어려운 현실 세계 조건을 처리하기 위해 라이브 노이즈가 있는 다국어 오디오의 고유한 데이터셋을 활용합니다.
OpenAI가 API에 GPT-Live-1을 출시하여 개발자에게 음성 기반 애플리케이션 구축을 위해 동시에 청취와 발화가 가능한 단일 모델을 제공합니다. 이번 릴리스는 전통적인 연결된 아키텍처를 중단과 맥락을 더 자연스럽게 처리하는 통합 방식으로 대체함으로써 음성 레이어 개발을 간소화하는 것을 목표로 합니다.
구글은 이제 70억 명 이상의 사용자를 위해 300개 이상의 언어를 지원하는 기술을 발표하며, 음성 이해 개선, 소외된 언어의 데이터 수집 및 접근성 향상을 위한 새로운 도구를 소개했습니다.
Google은 Gemini API와 AI Studio를 통해 Gemini 3.8 Flash TTS 및 Flash-Lite TTS를 출시했으며, Hume의 Voice Design Benchmark 및 Voice Arena에서 6개 언어로 상위 랭킹을 달성했습니다.
Google은 대화 흐름을 끊지 않고 추론하고 도구를 실행하는 실시간 음성 에이전트용으로 설계된 네이티브 스피치-투-스피치 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking를 소개했습니다.
오픈 TTS 리더보드는 느린 아레나 기반 인간 선호도 점수에 의존하는 대신 객관적 지표를 사용하여 텍스트 음성 변환(TTS) 평가의 단편화와 표준화 부재를 해결하기 위해 출시되었습니다. 이 리더보드는 Qwen3 ASR과 WavLM 임베딩을 사용하여 모델의 가청성, 속도 및 화자 유사성을 평가합니다.
알리바바의 Qwen 팀은 새로운 Qwen-Audio-3.1-Realtime-plus를 포함한 5개 모델로 구성된 오디오 스택인 Qwen-Audio-3.1을 출시했으며, 이는 추론과 도구 사용이 가능한 음성 에이전트를 위해 설계된 전이중 음성 모델입니다. 이번 출시에서는 ASR 서비스에 최대 95%의 가격 인하도 도입되었습니다.
llama.cpp 프로젝트는 LFM2 오디오 모델에 사용되는 mel 전처리에 대한 수정을 포함한 버전 b11190을 출시했습니다. 이 변경은 영어 4.5% 및 일본어 테스트 발화 6.5%에서 서로 다른 탐욕스러운 트랜스크립트를 유발한 불일치를 해결합니다.
구글은 Gemini 오디오 패밀리의 일환으로 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS라는 두 가지 새로운 텍스트 음성 변환 모델을 출시했습니다. 이 모델들은 Gemini API와 Google AI Studio를 통해 자연어 프롬프트에서 생성되는 음성 디자인과 줄 단위의 연기 지시를 도입합니다.
NVIDIA는 Hugging Face에서 OpenMDW License 1.1 하에 공개된 오픈 가중치 화자 분할 모델인 Nemotron 3 Diarization을 출시했습니다. 이 1억 파라미터 모델은 단일 체크포인트를 사용하여 실시간 또는 오프라인 모드에서 최대 8명의 중첩 화자를 추적합니다.
Google은 2,000개 이상의 음성 라이브러리를 갖춘 두 가지 새로운 텍스트-음성 변환 모델인 gemini-3.8-flash-tts와 gemini-3.8-flash-lite-tts를 출시했습니다.
NVIDIA는 실시간 화자 분할을 위한 오픈 가중치 100M 파라미터 모델인 Nemotron 3 Diarization을 출시했으며, 최대 8명의 화자를 지원합니다. 이 모델은 VoiceArena의 Diarization-Bench 리더보드에서 14.72%의 화자 오류율(DER)로 1위를 차지했으며, 이는 다음 순위 시스템보다 약 24% 상대적 감소를 의미합니다.
NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.
NemotronLabs는 통합 스트리밍 아키텍처 내에서 네이티브 도구 호출 기능을 통합한 오픈 가중치 풀듀플렉스 음성-음성 모델인 NemotronLabs VoiceChat을 출시했습니다. 이 시스템은 에이전트 텍스트와 구조화된 함수 호출을 위한 병렬 출력 스트림, 증분 전사를 위한 보조 RNN-T 브랜치, 그리고 스트리밍 TTS 디코더를 결합한 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합합니다.
SpaceXAI가 호스팅 API를 통해 제공되는 음성-텍스트 모델인 Grok Voice Transcribe 2.0을 출시했으며, 이는 동일한 가격대에서 버전 1.0 대비 두 배의 정확도를 주장합니다. 이 모델은 시끄러운 전화 회선과 경쟁하는 음성 등 어려운 오디오 조건을 대상으로 하며, 배치 및 실시간 스트리밍 모드에서 실행됩니다.
Google은 OpenAI의 GPT-Live 모델과 형태가 유사한 두 가지 새로운 음성-to-음성 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다.
한 AI 개발자가 약 500ms 이하의 첫 토큰 지연 시간을 달성하면서도 비용 효율적이고 확장 가능한 실시간 음성 AI 시스템을 구축하기 위한 아키텍처 조언을 요청하고 있습니다.
Aiden은 복잡한 시각적 추론과 디바이스 작업을 동반한 풀듀플렉스 음성 대화를 필요로 하며, 두 가지를 모두 처리하는 단일 모델의 한계를 피하는 에이전트용 아키텍처를 설명합니다. 이 솔루션은 책임을 분할합니다: 실시간 음성 모델이 대화를 관리하고 별도의 더 강력한 모델이 백그라운드 작업을 실행하며 작업 큐를 통해 비동기적으로 조정합니다.
한 사용자가 클라우드 API 없이 Windows에서 Coqui XTTS-v2 및 Qwen 2.5의 완전한 로컬 배포를 가능하게 하는 종속성 없는 래퍼인 F-0310을 출시했습니다.