NVIDIA가 Hugging Face에 NemotronLabs-VoiceChat-11B 음성 채팅 모델을 출시했습니다. 저장소는 풀 듀플렉스 통신 기능을 지원한다고 설명되어 있습니다.
NVIDIA, Hugging Face에 NemotronLabs-VoiceChat-11B 모델 출시
NVIDIA가 오픈 가중치 Nemotron 3 화자 분할 모델을 출시
NVIDIA는 실시간 화자 분할을 위한 오픈 가중치 100M 파라미터 모델인 Nemotron 3 Diarization을 출시했으며, 최대 8명의 화자를 지원합니다. 이 모델은 VoiceArena의 Diarization-Bench 리더보드에서 14.72%의 화자 오류율(DER)로 1위를 차지했으며, 이는 다음 순위 시스템보다 약 24% 상대적 감소를 의미합니다.
NVIDIA Magpie TTS 아랍어, 한국어 추가 및 품질 개선
NVIDIA는 Magpie 다국어 TTS 모델의 업데이트를 출시하여 현대 표준 아랍어, 한국어, 브라질 포르투갈어를 추가해 총 12개 언어로 지원을 확대했습니다. 이번 릴리스는 업데이트된 학습 데이터와 아키텍처 변경을 통해 기존 언어 전반에 걸쳐 품질을 개선했습니다.
NVIDIA, ~450ms 턴테이킹을 지원하는 오픈 풀듀플렉스 음성-음성 모델 NemotronLabs VoiceChat 11B 출시
NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.
Nvidia, Nemotron-Labs-Audex-30B-A3B 통합 오디오-텍스트 LLM 출시
Nvidia는 Nemotron-Cascade-2-30B-A3B 텍스트 전용 MoE 백본 위에 구축된 통합 오디오-텍스트 대규모 언어 모델인 Nemotron-Labs-Audex-30B-A3B를 출시했습니다. 이 모델은 입력용 오디오 인코더와 출력용 이산 오디오 토큰을 추가하여 원래 아키텍처를 확장하며, 음성 인식, 번역, 텍스트 음성 변환 및 오디오 생성 기능을 가능하게 합니다.
NemotronLabs가 도구 호출 기능을 갖춘 오픈 풀듀플렉스 음성-음성 모델 VoiceChat 출시
NemotronLabs는 듣기, 전사, 추론, 발화를 통합된 스트리밍 아키텍처 내에서 결합하도록 설계된 오픈 가중치 풀듀플렉스 음성-음성 모델인 VoiceChat을 출시했습니다. 이 시스템은 스트리밍 음성 인코더와 디코더 전용 언어 모델을 결합하여 에이전트 텍스트 및 구조화된 함수 호출을 위한 병렬 특수화 출력 스트림과 증분 사용자 전사를 위한 보조 RNN-T 브랜치를 제공합니다.