NVIDIAは、NemotronLabs-VoiceChat-11B音声チャットモデルをHugging Faceで利用可能にしました。リポジトリは全二重通信機能をサポートしていると説明されています。
NVIDIAがHugging FaceにNemotronLabs-VoiceChat-11Bモデルをリリース
NVIDIAがオープンウェイトのNemotron 3 Diarizationモデルをリリース
NVIDIAは、リアルタイムのスピーカーダイアライゼーションに対応するオープンウェイトの100MパラメータモデルであるNemotron 3 Diarizationをリリースしました。このモデルは最大8人の話者をサポートしています。
NVIDIA Magpie TTSがアラビア語、韓国語、ポルトガル語を追加し品質を向上
NVIDIAはMagpie多言語TTSモデルのアップデートをリリースし、現代標準アラビア語、韓国語、ブラジルポルトガル語の追加により12言語へのサポートを拡大した。今回のリリースでは、更新されたトレーニングデータとアーキテクチャの変更を通じて既存言語の品質も改善されている。
NVIDIAが約450msのターンテイクを備えたオープンなフルデュプレックス音声対話モデル「NemotronLabs VoiceChat 11B」をリリース
NVIDIAは、リアルタイムのフルデュプレックス会話のために設計されたオープンな11Bパラメータのエンドツーエンド音声対話モデルであるNemotronLabs VoiceChat 11Bをリリースした。ASR、LLM、TTSをチェーンするカスケード型スタックとは異なり、この統合ネットワークはストリーミング音声の理解と生成を同時に実行し、Full-Duplex-Bench 1.0で測定されたスムーズなターンテイクレイテンシ448msを達成した。
Nvidia、Nemotron-Labs-Audex-30B-A3B統合オーディオ・テキストLLMをリリース
Nvidiaは、Nemotron-Cascade-2-30B-A3Bテキスト専用MoEバックボーン上に構築された統合オーディオ・テキスト大規模言語モデルであるNemotron-Labs-Audex-30B-A3Bをリリースした。このモデルは、入力用のオーディオエンコーダと出力用の離散オーディオトークンを追加することで元のアーキテクチャを拡張し、音声認識、翻訳、テキストから音声への変換、およびオーディオ生成の機能を実現する。
NemotronLabsがツール呼び出し機能を備えたオープンなフルデュープレックス音声対話モデル「VoiceChat」をリリース
NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。