أطلقت داينا روبوتكس نموذج داينا-2، وهو نموذج عالمي-فعل لتلاعب الروبوتات، تم تدريبه مسبقاً على أكثر من مليون ساعة من الفيديو الذاتي المركز للبشر. تُظهر الشركة أن الفيديو البشري العادي يمكن أن يحل محل البيانات المُعلَّمة بالأفعال من خلال وضع قانون قياس يتراوح بين 1,000 و1,000,000 ساعة.

  • داينا-2 هو نموذج توليدي يستخدم العمود الفقري للانتشار الفيديوي (video-diffusion) الذي يُزيل الضوضاء عن الفيديو المستقبلي وقطع الأفعال معاً.
  • يُظهر النموذج قانون قياس على البيانات البشرية ينتقل بصفر عينات إلى مهام روبوتية غير مرئية عبر منصتين ثابتتين ذاتي ذراعين.
  • إزالة الضوضاء المشتركة للفيديو والأفعال تفوق التدريب على الأفعال فقط، حيث يساعد الفيديو بشكل خاص في التعميم عبر التجسيدات المختلفة.
  • أظهر التدريب اللاحق على 14 مهمة ارتفاع المتوسط المرجعي للنتائج من 20% إلى 53% مع توسيع البيانات إلى مليون ساعة.
  • اجتاز داينا-2 معايير الإنتاج في 87% من مواقع العملاء غير المرئية مقارنة بـ 46% لنموذج داينا-1 السابق.

تشير الأبحاث إلى أن التنبؤ بالفيديو يقود النقل إلى بيانات الروبوت، مما يسمح للنظام بالتعلم من كميات هائلة من الخبرة البشرية غير المُعلَّمة بدلاً من الاعتماد على التحكم عن بُعد المكلف.