Anthropic telah menghentikan aktivitas internal yang melibatkan model terbarunya, Astra, karena evaluasi terbaru menunjukkan bahwa model tersebut mungkin memiliki kemampuan keamanan siber kritis di bawah Kerangka Kerja Kesiapan perusahaan. Perusahaan tidak dapat menyingkirkan kemungkinan bahwa model tersebut dapat mengidentifikasi dan mengembangkan eksploit nol-hari fungsional dalam sistem dunia nyata yang diperkuat tanpa intervensi manusia.
- Astra telah mencapai ambang batas di mana kemampuan siber kritis tidak dapat disingkirkan berdasarkan evaluasi internal dan penilaian ahli.
- Aktivitas internal yang melibatkan Astra dihentikan sampai memenuhi persyaratan kontrol keamanan yang diperkuat.
- Kontrol yang lebih ketat termasuk lingkungan pengujian terisolasi, akses jaringan terbatas, perlindungan bobot yang ditingkatkan, dan pemantauan universal untuk tindakan berisiko.
- Perusahaan sedang meningkatkan pengujian ketahanan penjaga keselamatan dan akan bekerja sama dengan lembaga pemerintah dan organisasi keamanan AI.
Anthropic menyatakan bahwa model canggih yang mampu melakukan operasi siber harus membantu pembela mengidentifikasi kerentanan sebelum penyerang melakukannya, bertujuan untuk memastikan bahwa kemampuan terdepan diimplementasikan secara bertanggung jawab.