inclusionAI a publié le système Realtime-Venus sur Hugging Face, avec deux points de contrôle : Realtime-Venus-Omni et Realtime-Venus-Audio. Le point de contrôle Omni est un modèle d'interaction audio-visuelle de 9 milliards de paramètres adapté de MiniCPM-o 4.5 qui observe et écoute en continu pour décider quand répondre.

  • La conversation full-duplex native permet au modèle de percevoir tout en parlant, distinguant les rétroactions et les interruptions.
  • L'interaction Omni-Proactive initie des réponses basées sur des événements vidéo et audio alignés temporellement sans attendre une invite utilisateur.
  • La délégation émet des requêtes en flux continu sur une chronologie causale partagée pour gérer des tâches externes sans bloquer la conversation.
  • La mémoire à long terme sans entraînement archive les moments visuellement informatifs d'une longue vidéo et récupère les preuves pertinentes sans entraînement supplémentaire.
  • Le système génère à la fois des sorties textuelles et vocales en utilisant les ressources Token2wav intégrées.

Cette publication fournit des outils pour une interaction audio-visuelle proactive et en temps réel avec gestion des interruptions sémantiques et capacités de mémoire à long terme.