inclusionAI ha publicado el sistema Realtime-Venus en Hugging Face, que incluye dos puntos de control: Realtime-Venus-Omni y Realtime-Venus-Audio. El punto de control Omni es un modelo de interacción audiovisual de 9B adaptado a partir de MiniCPM-o 4.5 que observa y escucha continuamente para decidir cuándo responder.

  • La conversación nativa full-duplex permite al modelo percibir mientras habla, distinguiendo los backchannels y las interrupciones.
  • La interacción Omni-Proactiva inicia respuestas basadas en eventos de video y audio alineados temporalmente sin esperar una solicitud del usuario.
  • La delegación emite solicitudes en el flujo sobre una línea causal compartida para manejar tareas externas sin bloquear la conversación.
  • Los archivos de memoria de video largo sin entrenamiento registran momentos visualmente informativos y recuperan evidencia relevante sin entrenamiento adicional.
  • El sistema genera salida tanto de texto como de voz utilizando los recursos Token2wav incluidos.

El lanzamiento proporciona herramientas para interacción audiovisual proactiva en tiempo real con manejo de interrupciones semánticas y capacidades de memoria a largo plazo.