inclusionAI ha publicado el sistema Realtime-Venus en Hugging Face, que incluye dos puntos de control: Realtime-Venus-Omni y Realtime-Venus-Audio. El punto de control Omni es un modelo de interacción audiovisual de 9B adaptado a partir de MiniCPM-o 4.5 que observa y escucha continuamente para decidir cuándo responder.
- La conversación nativa full-duplex permite al modelo percibir mientras habla, distinguiendo los backchannels y las interrupciones.
- La interacción Omni-Proactiva inicia respuestas basadas en eventos de video y audio alineados temporalmente sin esperar una solicitud del usuario.
- La delegación emite solicitudes en el flujo sobre una línea causal compartida para manejar tareas externas sin bloquear la conversación.
- Los archivos de memoria de video largo sin entrenamiento registran momentos visualmente informativos y recuperan evidencia relevante sin entrenamiento adicional.
- El sistema genera salida tanto de texto como de voz utilizando los recursos Token2wav incluidos.
El lanzamiento proporciona herramientas para interacción audiovisual proactiva en tiempo real con manejo de interrupciones semánticas y capacidades de memoria a largo plazo.