NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。
- Full-Duplex-Bench 1.0において、本モデルは評価されたオープンウェイトシステムの中で最も低い一時停止処理のオーバーテイク率を達成し、ユーザーの割り込み後に100%のオーバーテイクを実現し、割り込み後の応答品質スコアは4.33/5となった。
- Full-Duplex-Bench 1.5において、ユーザーのバックチャンネル後に93%のケースで応答を再開する。
- VoiceBenchで正規化平均55.1を獲得し、Full-Duplex-Bench 3.0でツール選択F1スコア82.5%を達成したが、引数の精度とエンドツーエンドのツール実行には改善の余地がある。
これらの結果は、フルデュープレックスな対話、音声認識および生成、一般的な言語能力、外部ツールの利用が、リアルタイムの会話動作を犠牲にすることなく単一のオープンモデルで統合可能であることを示している。