llama.cpp b10270이 Qwen3-TTS 지원을 추가하고 llama-tts에 파괴적 변경을 도입
llama.cpp 프로젝트는 버전 b10270을 출시하여 Qwen3-TTS 모델에 대한 지원을 도입했습니다. 이 업데이트에는 llama-tts 바이너리에 대한 파괴적 변경 사항이 포함되어 있으며, 새로운 텍스트 음성 변환 워크플로우를 처리하기 위해 중요한 아키텍처 수정이 구현되었습니다.
llama.cpp 프로젝트는 버전 b10270을 출시하여 Qwen3-TTS 모델에 대한 지원을 도입했습니다. 이 업데이트에는 llama-tts 바이너리에 대한 파괴적 변경 사항이 포함되어 있으며, 새로운 텍스트 음성 변환 워크플로우를 처리하기 위해 중요한 아키텍처 수정이 구현되었습니다.
NVIDIA가 Hugging Face에 NemotronLabs-VoiceChat-11B 음성 채팅 모델을 출시했습니다. 저장소는 풀 듀플렉스 통신 기능을 지원한다고 설명되어 있습니다.
OpenAI는 청취와 발화를 동시에 수행할 수 있는 풀듀플렉스 모델을 사용하여 전통적인 턴 감지기를 제거한 3세대 음성 시스템인 GPT-Live를 출시했습니다. 이 아키텍처는 실시간 성능에 최적화된 새로운 시스템 설계를 통해 낮은 지연 시간을 유지하면서 더 즉각적이고 자연스러운 대화를 가능하게 합니다.
한 연구자가 OpenGauntlet 연구 카탈로그를 게시했습니다. 이는 168개의 텍스트 음성 변환(TTS) 시스템과 106개의 음성 텍스트 변환(STT) 시스템에 대한 정보를 포함하는 공개 리소스입니다. 디렉토리에는 오픈 및 호스팅 모델, 라이선스, 하드웨어 요구 사항, 언어, 기능, 수명 주기 상태, 소스 정보 및 사용 가능한 경우 게시된 벤치마크 데이터가 포함되어 있습니다.
PolyAI는 트랜스크립트에 의존하는 대신 발신자 오디오를 직접 처리하는 대화 모델인 Dialog-RSN-1을 소개했습니다. 이 모델은 턴 테이킹, 음성 인식, 함수 호출 및 응답 생성을 단일 오디오 인식 시스템으로 통합합니다.
xAI는 지능, 전사 정확도, 대화 능력을 강화하기 위해 설계된 차세대 음성-음성 음성 모델인 Grok Voice Think Fast 2.0을 발표했습니다. 이번 업데이트는 기존 전작을 기반으로 음성 추론, 대화 능력, 도구 사용 신뢰성에서 의미 있는 개선을 도입했습니다.
Google은 사용자가 더 풍부한 트랙을 더 많은 창의적 제어 하에 생성할 수 있도록 Google Flow Music 내에서 최신 음악 생성 모델인 Lyria 3.5를 출시했습니다.
알리바바의 퉁이 연구소는 두 가지 변형 버전으로 제공되는 호스팅 텍스트 음성 변환 시스템인 Qwen-Audio-3.0-TTS를 출시했습니다: 실시간 상호작용을 위한 Flash와 고품질 생성을 위한 Plus. 두 등급 모두 다운로드 가능한 가중치 대신 알리바바 클라우드 모델 스튜디오를 통해 제공됩니다.
OpenAI는 재구축된 ChatGPT Voice를 지원하기 위해 GPT-Live-1과 GPT-Live-1 mini를 출시했으며, 이는 동시 청취와 발화가 가능한 풀듀플렉스 오디오 처리를 도입했습니다. 이 시스템은 복잡한 쿼리를 GPT-5.5와 같은 백그라운드 추론 모델에 위임하여, 더 깊은 사고가 진행되는 동안에도 지속적인 대화를 가능하게 합니다.
NymphTech은 여러 언어와 장편 방송을 목표로 하여 AI 라디오 스테이션 네트워크를 강화하기 위해 고급 음성 클로닝 및 음성 합성 모델에 대한 권장 사항을 찾고 있습니다. 이 회사는 이미 Trinity와 Mark와 같은 지속적 AI 캐릭터를 특징으로 하는 플랫폼을 출시했으며, Trinity는 6월 9일 이후 지속적으로 방송해 왔습니다.
연구자들은 생성된 오디오에서 대상 이벤트의 존재와 시간적 관계를 검증하기 위해 오디오 인식 대형 언어 모델(ALLMs)을 세분화된 심판으로 사용하는 프레임워크를 제안합니다. 이 접근 방식은 기존 텍스트-오디오 모델이 여러 사운드 이벤트 및 그 순서와 관련된 지시를 따르는 데 종종 실패하는 격차를 해결합니다.
한 연구는 음성 평가를 위한 자동 판사로 사용되는 대규모 오디오-언어 모델(LALM)의 프로토콜 수준 단축 경로를 감사하여, 인간 평가와의 높은 일치율이 판단이 실제 오디오에 기반함을 보장하지 않는다는 사실을 드러냈다. 이 연구는 6개의 판사와 4가지 속성에 걸쳐 세 가지 배포 프로토콜을 조사했다: 피처 블루프린트 판정, 참조 조건부 판정, 및 쌍별 A/B 비교.
이 연구는 레이블이 지정된 학습 데이터 없이 영어 및 일본어 제2언어(L2) 발화의 음운 정확도, 리듬, 억양을 평가하기 위해 자기지도형 WavLM 표현에 동적 시간 압축(DTW)을 사용하는 것을 조사합니다. 학습자 발화를 원어민 템플릿과 비교하는 기본 DTW 접근 방식은 전체 및 문장 수준의 음운 점수 매기에서 인간 동의율을 초과합니다.
오픈소스 프레임워크 Audient는 지속적으로 소리를 처리하고 사용을 통해 개념의 메모리를 구축하는 LLM 에이전트를 위한 로컬 오디오 지각 레이어를 제공합니다. 이는 CLAP 임베딩, Whisper, Silero VAD 및 sqlite-vec을 사용하여 상수 LLM 호출 없이 오디오 이벤트를 게이트팅, 지문 생성 및 인식합니다.
연구자들은 자기회귀 디코더를 사용하는 대신, 소수의 노이즈 제거 단계에서 전체 음성을 병렬로 정제함으로써 이산 확산 언어 모델이 음성을 전사할 수 있음을 입증했습니다.
Hume은 시스템이 트랜스크립트를 넘어 음향 정보를 얼마나 잘 인식하고 생성하는지를 평가함으로써 음성 상호작용의 인간 품질을 측정하도록 설계된 벤치마크인 Real World VoiceEQ를 소개했습니다. 이 벤치마크는 785,000개의 TTS 및 48,000개의 STS 인간 평가에서 도출된 60개 이상의 지표를 사용하여 15개 이상의 차원에서 40개 이상의 독점 및 오픈소스 모델을 평가합니다.
audio.cpp 프로젝트가 버전 0.3을 출시하며 다섯 가지 새로운 텍스트 음성 변환 모델을 도입했습니다: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2, Irodori-TTS. 이번 업데이트에서는 GGUF 지원도 추가되었으며, 모델별로 순차적으로 적용될 예정입니다.
연구자들은 Whisper와 같은 대규모 사전 학습 ASR 모델을 저자원 언어로 파인튜닝할 때 파국적 망각을 완화하기 위한 방법론인 Unified Gradient Projection (UGP)를 제안했습니다. UGP는 통합 투영 공간 내의 언어 균형 잡힌 리플레이에서 참조 기울기를 사용하여 매개변수 업데이트를 제약하고, 언어별 기여도를 효과적으로 균등화하여 지배적인 언어의 편향을 줄입니다.
저자는 AI 에이전트를 위한 자체 호스팅, 양방향 음성 상호작용을 제공하는 오픈소스 프로젝트인 Cicero를 소개합니다. 단방향 녹음 도구와는 달리, Cicero는 에이전트가 사용자에게 다시 말하고 Telegram을 통해 전화를 걸 수 있도록 하며 모든 오디오를 로컬에 유지합니다.
Hugging Face 포럼의 한 개발자는 Bland.ai, Retell, Vapi와 같은 프로덕션 플랫폼이 방대한 수동 작성 시스템 프롬프트에 의존하지 않고 프롬프트 오케스트레이션을 어떻게 관리하는지 이해하려고 합니다. 저자는 FastAPI, Sarvam STT/TTS, Pipecat SmartTurn V3를 사용한 현재 구현을 설명하며, 수동 상태별 주입이 복잡성 증가와 엣지 케이스 실패로 이어진다고 지적합니다.