軽量で説明可能な音声活動検出器であるNOVA-VADは、UrbanSound8Kデータセットのノイズのある音声で93%の精度を達成し、WebRTC(58%)、Pyannote(62%)、Silero(87%)を上回ります。scikit-learnのみを使用し、GPUは不要で、特徴量の重要度と信頼スコアを平易な英語で提供します。
NOVA-VAD、ノイズのある音声で93%の精度によりSilero、Pyannote、WebRTCを上回る
NVIDIA Magpie TTSがアラビア語、韓国語、ポルトガル語を追加し品質を向上
NVIDIAはMagpie多言語TTSモデルのアップデートをリリースし、現代標準アラビア語、韓国語、ブラジルポルトガル語の追加により12言語へのサポートを拡大した。今回のリリースでは、更新されたトレーニングデータとアーキテクチャの変更を通じて既存言語の品質も改善されている。
NVIDIAが約450msのターンテイクを備えたオープンなフルデュプレックス音声対話モデル「NemotronLabs VoiceChat 11B」をリリース
NVIDIAは、リアルタイムのフルデュプレックス会話のために設計されたオープンな11Bパラメータのエンドツーエンド音声対話モデルであるNemotronLabs VoiceChat 11Bをリリースした。ASR、LLM、TTSをチェーンするカスケード型スタックとは異なり、この統合ネットワークはストリーミング音声の理解と生成を同時に実行し、Full-Duplex-Bench 1.0で測定されたスムーズなターンテイクレイテンシ448msを達成した。
NVIDIAがHugging FaceにNemotronLabs-VoiceChat-11Bモデルをリリース
NVIDIAは、NemotronLabs-VoiceChat-11B音声チャットモデルをHugging Faceで利用可能にしました。リポジトリは全二重通信機能をサポートしていると説明されています。
Freya-TTSがトークナイザー不要のトルコ語TTSモデルを8.0% WERで公開
研究者らは、トルコ語に最適化されたコンパクトなトークナイザー不要の音声合成モデル「Freya-TTS」を発表し、Freya-TR-Evalベンチマークで8.0%の単語誤り率(WER)を達成しました。1億8320万パラメータの非自己回帰型条件フローマッチングDiffusion Transformerは、AudioVAE2の凍結された連続潜在空間で動作し、音素化や離散音声トークナイザーなしで48 kHzの高品質な再構成を可能にします。
OpenMOSS、共同文字起こしと話者分離用の MOSS-Transcribe-Diarize 0.9B をリリース
OpenMOSS は、長時間のマルチスピーカー文字起こし、話者分離、タイムスタンプ、音響イベント認識のために設計された、0.9B パラメータのエンドツーエンド音声理解モデルである MOSS-Transcribe-Diarize をリリースしました。