أطلقت إينكلوجن AI نظام Realtime-Venus على منصة Hugging Face، والذي يتضمن نقطتي فحص: Realtime-Venus-Omni وRealtime-Venus-Audio. يُعد نقطة Omni نموذج تفاعل صوتي بصري بحجم 9B مُعدّل من MiniCPM-o 4.5، يراقب ويستمع باستمرار ليقرر متى يستجيب.

  • يتيح المحادثة ثنائية الاتجاه الأصلية للنموذج أن يدرك أثناء التحدث، مما يميز بين ردود الفعل الخلفية والتدخلات.
  • يبدأ تفاعل Omni-Proactive الاستجابات بناءً على أحداث الفيديو والصوت المتزامنة زمنياً دون انتظار موجه من المستخدم.
  • يُصدر التفويض طلبات داخل التدفق على خط زمني سببي مشترك للتعامل مع المهام الخارجية دون عرقلة المحادثة.
  • تحفظ أرشيفات الذاكرة طويلة الفيديو للحظات الغنية بالمعلومات البصرية وتستعيد الأدلة ذات الصلة دون تدريب إضافي.
  • يولد النظام مخرجات نصية وصوتية باستخدام موارد Token2wav المرفقة.

يوفر الإطلاق أدوات للتفاعل الصوتي البصري الاستباقي في الوقت الفعلي، مع معالجة المقاطعات الدلالية وقدرات الذاكرة طويلة المدى.