NemotronLabsは、統合ストリーミングアーキテクチャ内でネイティブのツール呼び出し機能を統合したオープンウェイトのフルデュプレックス音声対音声モデルであるNemotronLabs VoiceChatを発表しました。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストと構造化された関数呼び出し用の並列出力ストリームに加え、増分的な文字起こし用の補助RNN-TブランチおよびストリーミングTTSデコーダを備えています。

  • Full-Duplex-Bench 1.0において評価されたオープンウェイトシステムの中で最も低い一時停止処理の奪取率を実現し、ユーザーの割り込み後に100%の奪取を行い、割り込み後の応答品質スコアは4.33/5です。
  • Full-Duplex-Bench 1.5において、ユーザーのバックチャンネル後に93%のケースで応答を再開します。
  • VoiceBenchで正規化平均55.1、Full-Duplex-Bench 3.0でツール選択F1スコア82.5%を獲得しましたが、引数の精度とエンドツーエンドのツール実行には改善が必要です。

本モデルは、リアルタイムの会話動作を犠牲にすることなく、フルデュプレックスな相互作用、音声認識および生成、一般的な言語能力、外部ツールの使用を単一のオープンな音声対音声モデルに統合できることを示しています。