أطلقت إينكلوجن AI نظام Realtime-Venus على منصة Hugging Face، والذي يتضمن نقطتي فحص: Realtime-Venus-Omni وRealtime-Venus-Audio. يُعد نقطة Omni نموذج تفاعل صوتي بصري بحجم 9B مُعدّل من MiniCPM-o 4.5، يراقب ويستمع باستمرار ليقرر متى يستجيب.
- يتيح المحادثة ثنائية الاتجاه الأصلية للنموذج أن يدرك أثناء التحدث، مما يميز بين ردود الفعل الخلفية والتدخلات.
- يبدأ تفاعل Omni-Proactive الاستجابات بناءً على أحداث الفيديو والصوت المتزامنة زمنياً دون انتظار موجه من المستخدم.
- يُصدر التفويض طلبات داخل التدفق على خط زمني سببي مشترك للتعامل مع المهام الخارجية دون عرقلة المحادثة.
- تحفظ أرشيفات الذاكرة طويلة الفيديو للحظات الغنية بالمعلومات البصرية وتستعيد الأدلة ذات الصلة دون تدريب إضافي.
- يولد النظام مخرجات نصية وصوتية باستخدام موارد Token2wav المرفقة.
يوفر الإطلاق أدوات للتفاعل الصوتي البصري الاستباقي في الوقت الفعلي، مع معالجة المقاطعات الدلالية وقدرات الذاكرة طويلة المدى.