ओपनएआई ने अपने मॉडल विकास की गति को अस्थायी रूप से धीमा कर दिया है, जिसमें आने वाले मॉडल्स के लिए रिइन्फोर्समेंट लर्निंग (RL) प्रशिक्षण पर दो सप्ताह का विराम शामिल है, क्योंकि प्राथमिक साक्ष्य संकेत देते हैं कि उनका नया मॉडल, Astra, क्रांतिकारी साइबर सुरक्षा क्षमता सीमा को पूरा कर सकता है। यह निर्णय ओपनएआई-हगिंग फेस घटना के बाद लिया गया है और इसका उद्देश्य AI सिस्टम अधिक सक्षम होते जा रहे हैं, इसलिए निगरानी, एलाइनमेंट और कंटेंमेंट सुरक्षा उपायों को मजबूत करना है।

  • Astra या साइबर मॉडल्स से जुड़े वर्कलोड अब सबसे कड़ी सुरक्षा सुरक्षा उपायों की आवश्यकता है, जिसमें मजबूत वर्कलोड अलगाव (सैंडबॉक्स) और अनधिकृत इंटरनेट एक्सेस को रोकने के लिए नेटवर्क नियंत्रण शामिल हैं।
  • एक नया बहु-चरणीय निगरानी सिस्टम सक्रियता क्लासिफायर्स का उपयोग करके चिंताजनक व्यवहार का पता लगाने के लिए है, जो संभावित क्रांतिकारी सुरक्षा सीमा उल्लंघनों के लिए 30 मिनट के भीतर अलर्ट जारी करने का लक्ष्य रखता है।
  • सबसे सक्षम मॉडल्स के लिए असुरक्षित व्यवहार, रिवार्ड हैकिंग और धोखाधड़ी को बेहतर ढंग से पता लगाने के लिए मुख्य एलाइनमेंट तकनीकों का उपयोग अधिक प्रशिक्षण चरणों में किया जा रहा है।
  • निगरानी ओवरहेड का अनुमान लगभग निगरानी किए जा रहे इनफरेंस कंप्यूट का 20% है, और सुरक्षा टीमों को उन उच्चतम प्राथमिकता वाले अलर्ट के लिए पेज किया जाता है जिन्हें 30 मिनट के भीतर फॉल्स पॉजिटिव के रूप में हल नहीं किया जा सकता है।

ओपनएआई पर जोर देता है कि ये परिवर्तन आवश्यक हैं क्योंकि बढ़ते सक्षम AI सिस्टम विकसित करने से जुखे जोखिम बढ़ रहे हैं, और एलाइनमेंट और सुरक्षा को सुनिश्चित करने के लिए उनकी सुरक्षा मानकों को उन जोखिमों से आगे रहना चाहिए।