OpenAI telah menetapkan model barunya, Astra, memenuhi ambang batas kemampuan "Kritis" dalam kerangka kesiapsiagaannya, artinya model ini dapat mengidentifikasi dan mengeksploitasi celah keamanan pada sistem yang diperkuat tanpa bimbingan manusia. Untuk mengurangi risiko, perusahaan menunda sebagian pengembangan Astra guna menerapkan langkah keselamatan yang lebih kuat, termasuk pelatihan penyesuaian yang lebih baik dan sistem pemantauan.
- Astra meraih skor sempurna di ExploitBench dan menemukan dua kerentanan zero-day selama pengujian internal.
- Model ini menolak 91,5% permintaan jailbreak siber, dibandingkan dengan 59% untuk GPT-5.6 Sol.
- Astra menunjukkan kemampuan membangun rantai kompromi peramban dan eksploitasi eskalasi hak akses lokal dalam penilaian yang dipimpin oleh ahli.
- Akses ke kemampuan lanjutan awalnya akan dibatasi kepada penguji alfa melalui Daybreak Blue.
OpenAI bertujuan menyeimbangkan manfaat utilitas defensif Astra dengan kontrol ketat untuk mencegah penyalahgunaan atau tindakan tidak sah oleh model itu sendiri.