أعلن مختبر شنغهاي للذكاء الاصطناعي عن إطلاق InternW0، وهو أول تجسيد لسلسلة نماذج العالم المادي InternW الخاصة به، والمُصمَّم للحفاظ على تنبؤات قابلة للتنفيذ في البيئات الديناميكية. يتعلم النموذج بشكل مشترك ديناميكيات الرؤية المستقبلية والتحكم المستمر في الروبوت باستخدام بنية فيديو-إجراء غير متماثلة مع مطابقة التدفق.
- يستخدم InternW0 خبير فيديو عالي السعة للسياق طويل المدى وخبير إجراء خفيف الوزن للمقاييس الزمنية الأسرع.
- يعيد استخدام حالات K/V على مستوى الطبقات ويكيّفها مع الملاحظات الجديدة عبر توجيه السياق، مما يتجنب إعادة التوليد لكل تحديث.
- استُخدمت حوالي 7,200 ساعة من بيانات الروبوت والبيانات الذاتية المركز المتنوعة في التدريب، بما في ذلك مجموعة بيانات EgoLab التي تبلغ مدتها 275 ساعة.
- شمل التقييم سير عمل تركيب إطار معدني عضوي مكونًا من 15 مرحلة ومناورة دقيقة واعية بالاتصال مكونة من 5 مراحل.
تُقدّم هذه النتائج قفزة نحو نماذج عالم مادي قابلة للتوسع، غير متزامنة، وأصلية للعلوم، من أجل تفاعلات واقعية شاملة وفعّالة.