inclusionAI ने Hugging Face पर Realtime-Venus सिस्टम जारी किया है, जिसमें दो चेकपॉइंट्स शामिल हैं: Realtime-Venus-Omni और Realtime-Venus-Audio। Omni चेकपॉइंट एक 9B ऑडियो-विजुअल इंटरैक्शन मॉडल है जो MiniCPM-o 4.5 से अनुकूलित किया गया है और लगातार देखता और सुनता रहता है ताकि यह तय कर सके कि कब प्रतिक्रिया देनी है।

  • नेटिव फुल-डप्लेक्स कॉन्वर्सेशन मॉडल को बोलते हुए भी संवेदनशील बनाने की अनुमति देता है, जिसमें बैकचैनल्स और अंतर्रूप्शन में अंतर किया जा सकता है।
  • Omni-प्रोएक्टिव इंटरैक्शन उपयोगकर्ता के प्रॉम्प्ट का इंतजार किए बिना, समयानुसार संरेखित वीडियो और ऑडियो घटनाओं के आधार पर प्रतिक्रियाएं शुरू करता है।
  • डेलिगेशन बाहरी कार्यों को हैंडल करने के लिए एक साझा कैजुअल टाइमलाइन पर इन-स्ट्रीम अनुरोध उत्पन्न करता है, जिससे कॉन्वर्सेशन ब्लॉक नहीं होती है।
  • ट्रेनिंग-फ्री लॉंग-वीडियो मेमोरी आर्काइव विजुअली सूचनात्मक क्षणों को संग्रहीत करता है और अतिरिक्त प्रशिक्षण के बिना प्रासंगिक सबूत पुनः प्राप्त करता है।
  • सिस्टम बंडल किए गए Token2wav संसाधनों का उपयोग करके टेक्स्ट और स्पीच दोनों आउटपुट उत्पन्न करता है।

इस रिलीज में सेमांटिक इंटर्रप्शन हैंडलिंग और लॉन्ग-टर्म मेमोरी क्षमताओं के साथ प्रोएक्टिव, रियल-टाइम ऑडियो-विजुअल इंटरैक्शन के लिए टूल्स प्रदान किए गए हैं।