A inclusionAI lançou o sistema Realtime-Venus no Hugging Face, com dois checkpoints: Realtime-Venus-Omni e Realtime-Venus-Audio. O checkpoint Omni é um modelo de interação áudio-visual de 9B adaptado do MiniCPM-o 4.5 que observa e ouve continuamente para decidir quando responder.
- A conversa full-duplex nativa permite que o modelo perceba enquanto fala, distinguindo backchannels e interrupções.
- A interação Omni-Proativa inicia respostas com base em eventos de vídeo e áudio alinhados temporalmente, sem esperar por um prompt do usuário.
- A delegação emite solicitações in-stream em uma linha do tempo causal compartilhada para lidar com tarefas externas sem bloquear a conversa.
- O arquivo de memória de longo vídeo sem treinamento registra momentos visualmente informativos e recupera evidências relevantes sem treinamento adicional.
- O sistema gera saída tanto de texto quanto de fala usando os recursos Token2wav embutidos.
O lançamento fornece ferramentas para interação áudio-visual proativa em tempo real, com tratamento de interrupção semântica e capacidades de memória de longo prazo.