inclusionAI telah merilis sistem Realtime-Venus di Hugging Face, dengan dua checkpoint: Realtime-Venus-Omni dan Realtime-Venus-Audio. Checkpoint Omni adalah model interaksi audio-visual 9B yang diadaptasi dari MiniCPM-o 4.5 yang terus-menerus mengamati dan mendengarkan untuk memutuskan kapan harus merespons.
- Percakapan full-duplex asli memungkinkan model memahami sambil berbicara, membedakan antara backchannel dan interupsi.
- Interaksi Omni-Proaktif memulai respons berdasarkan peristiwa video dan audio yang selaras secara temporal tanpa menunggu prompt pengguna.
- Delegasi menghasilkan permintaan dalam aliran pada timeline kausal bersama untuk menangani tugas eksternal tanpa memblokir percakapan.
- Arsip memori video panjang tanpa pelatihan menyimpan momen visual informatif dan mengambil bukti relevan tanpa pelatihan tambahan.
- Sistem menghasilkan output teks dan suara menggunakan sumber daya Token2wav yang terpasang.
Rilis ini menyediakan alat untuk interaksi audio-visual proaktif dan real-time dengan penanganan interupsi semantik serta kemampuan memori jangka panjang.