ओपनएआई ने अपने नए मॉडल, अस्ट्रा को अपनी तैयारी ढांचे के तहत "महत्वपूर्ण" साइबर सुरक्षा क्षमता सीमा को पूरा करने वाला घोषित किया है, जिसका अर्थ है कि यह मानव मार्गदर्शन के बिना कठोर प्रणालियों में सुरक्षा कमजोरियों की पहचान और शोषण कर सकता है। जोखिमों को कम करने के लिए, कंपनी ने मजबूत सुरक्षा उपायों को लागू करने के लिए अस्ट्रा के विकास के कुछ हिस्सों को देर से शुरू किया, जिसमें बेहतर एलाइनमेंट प्रशिक्षण और निगरानी प्रणालियाँ शामिल हैं।

  • अस्ट्रा ने एक्सप्लॉइटबेंच पर पूर्ण स्कोर हासिल किया और आंतरिक परीक्षण के दौरान दो ज़ीरो-डेय कमजोरियों की खोज की।
  • मॉडल साइबर जेलब्रेक अनुरोधों का 91.5% अस्वीकार करता है, जबकि GPT-5.6 Sol के लिए यह अनुपात 59% था।
  • विशेषज्ञ-नेतृत्व वाले आकलनों में अस्ट्रा ने ब्राउज़र-कंप्रोमाइज़ चेन और स्थानीय प्राइविलेज-एस्केलेशन एक्सप्लॉइट बनाने की क्षमता दिखाई।
  • उन्नत क्षमताओं तक पहुँच शुरू में डेब्रे ब्लू के माध्यम से अल्फा टेस्टरों तक सीमित होगी।

ओपनएआई अस्ट्रा की रक्षात्मक उपयोगिता के लाभों को मॉडल द्वारा स्वयं गलत उपयोग या अनधिकृत कार्रवाई को रोकने के लिए कठोर नियंत्रणों के साथ संतुलित करना चाहता है।