OpenAI telah menerbitkan kerangka kerja yang menguraikan pendekatannya untuk mendukung penilaian independen oleh pihak ketiga terhadap model AI terdepan. Organisasi ini menekankan bahwa penilaian ini sangat penting untuk menyeimbangkan tanggung jawab dengan akuntabilitas, memerlukan akses mendalam ke data pelatihan, evaluasi, dan penyebaran.
- Penilaian independen kasus keamanan yang mencakup pelatihan, penyebaran internal, dan penyebaran eksternal.
- Penilaian langkah-langkah pengamanan kritis terhadap pengujian adversarial, jailbreaks, dan peningkatan kemampuan di domain berisiko tinggi.
- Evaluasi metrik kemampuan yang mencakup kategori risiko kesiapan seperti keamanan siber dan risiko biologis.
- Investigasi insiden ketidaksesuaian kritis untuk mengidentifikasi faktor-faktor yang berkontribusi dan efektivitas langkah-langkah pengamanan.
Kerangka kerja ini bertujuan untuk menetapkan standar internasional bersama untuk praktik keamanan, memungkinkan evaluator untuk menantang asumsi laboratorium dan memverifikasi klaim keamanan melalui pekerjaan yang ketat, aman, dan independen.