أبطأت OpenAI وتيرة تطوير نماذجها مؤقتاً، بما في ذلك إيقاف تدريبات التعلم المعزز (RL) لمدة أسبوعين للنماذج القادمة، بعد أن أشارت الأدلة الأولية إلى أن نموذجها الجديد، Astra، قد يستوفي عتبة القدرة الأمنية السيبرانية الحرجة. يأتي هذا القرار عقب حادثة OpenAI-Hugging Face ويهدف إلى تعزيز آليات المراقبة والمحاذاة وضوابط الاحتواء مع تزايد قدرات أنظمة الذكاء الاصطناعي.

  • تتطلب الأحمال العملية المتعلقة بـ Astra أو النماذج السيبرانية الآن أشد ضوابط الأمن صرامة، بما في ذلك عزل الأحمال العملية (صناديق الرمل) وتحكمات الشبكة لمنع الوصول غير المصرح به إلى الإنترنت.
  • يستخدم نظام مراقبة متعدد المراحل مصنفات التنشيط للكشف عن السلوك المثير للقلق، بهدف إصدار تنبيهات خلال 30 دقيقة لانتهاكات حدود الأمن الحرجة المحتملة.
  • يتم تطبيق تقنيات المحاذاة الأساسية عبر مراحل تدريبية أكثر للنماذج الأكثر قدرة على كشف السلوك غير الآمن، واستغلال المكافآت، والخداع بشكل أفضل.
  • يُقدّر عبء المراقبة بحوالي 20% من حوسبة الاستنتاج التي تتم مراقبتها، مع استدعاء فرق السلامة للتنبيهات ذات الأولوية القصوى التي لا يمكن حلها كأخطاء إيجابية كاذبة خلال 30 دقيقة.

تؤكد OpenAI أن هذه التغييرات ضرورية لأن المخاطر المرتبطة بتطوير أنظمة ذكاء اصطناعي متزايدة القدرة تزداد، ويجب أن تبقى معايير الأمن في طليعة تلك المخاطر لضمان المحاذاة والسلامة.