inclusionAIはHugging Face上でRealtime-Venusシステムを公開し、2つのチェックポイント(Realtime-Venus-OmniとRealtime-Venus-Audio)を搭載しています。OmniチェックポイントはMiniCPM-o 4.5から適応された9Bオーディオビジュアル対話モデルで、継続的に視聴し、応答するタイミングを判断します。
- ネイティブなフルデュープレックス会話により、モデルは発話中に知覚を行い、バックチャネルと割り込みを区別できます。
- Omniプロアクティブ対話は、ユーザーの促しを待たずに、時間的に同期されたビデオおよびオーディオイベントに基づいて応答を開始します。
- デレゲーションは共有因果タイムライン上でストリーム内リクエストを発行し、会話をブロックせずに外部タスクを処理します。
- トレーニング不要の長編動画メモリは、視覚的に情報的な瞬間をアーカイブし、追加学習なしで関連する証拠を検索します。
- システムはToken2wavリソースをバンドルして、テキストと音声の両方の出力を生成します。
今回のリリースでは、セマンティックな割り込み処理と長期記憶機能を備えたプロアクティブかつリアルタイムのオーディオビジュアル対話ツールが提供されています。