نشرت OpenAI إطار عمل يوضح نهجها لدعم التقييمات المستقلة من قبل أطراف ثالثة لنماذج الذكاء الاصطناعي المتقدمة. تؤكد المنظمة أن هذه التقييمات حاسمة لتحقيق التوازن بين المسؤولية والمساءلة، مما يتطلب وصولاً عميقًا إلى بيانات التدريب والتقييم والنشر.
- تقييم مستقل لحالات السلامة التي تغطي التدريب والنشر الداخلي والنشر الخارجي.
- تقييم التدابير الأمنية الحرجة ضد الاختبارات العدائية، وكسر الحماية، ورفع القدرات في المجالات عالية المخاطر.
- تقييم مقاييس القدرة التي تغطي فئات مخاطر الاستعداد مثل الأمن السيبراني والمخاطر البيولوجية.
- التحقيق في حوادث عدم التطابق الحرجة لتحديد العوامل المساهمة وفعالية التدابير الأمنية.
يهدف الإطار إلى وضع معايير دولية مشتركة لممارسات السلامة والأمن، مما يمكّن المقيّمين من تحدي افتراضات المختبرات والتحقق من ادعاءات السلامة من خلال عمل دقيق وآمن ومستقل.