inclusionAI 已在 Hugging Face 上发布了 Realtime-Venus 系统,包含两个检查点:Realtime-Venus-Omni 和 Realtime-Venus-Audio。Omni 检查点是一个 9B 的音视频交互模型,基于 MiniCPM-o 4.5 适配而成,能够持续观察并聆听以决定何时回应。

  • 原生全双工对话使模型能够在说话的同时感知环境,区分附和与打断。
  • Omni-Proactive 交互基于时间对齐的视频和音频事件主动发起响应,无需等待用户提示。
  • Delegation(委派)在共享因果时间线上发出流内请求,以处理外部任务而不阻塞对话。
  • Training-free long-video memory(免训练长视频记忆)归档视觉信息丰富的时刻,并检索相关证据,无需额外训练。
  • 该系统使用捆绑的 Token2wav 资源生成文本和语音输出。

此次发布提供了用于主动式、实时音视频交互的工具,具备语义打断处理和长期记忆能力。