Topik · Safety & alignment
lab OpenAI News · 7 hari lalu · 10 tayangan

Anthropic menghentikan pengembangan Astra setelah evaluasi internal menunjukkan kemampuan siber kritis

Anthropic telah menghentikan aktivitas internal yang melibatkan model terbarunya, Astra, karena evaluasi terbaru menunjukkan bahwa model tersebut mungkin memiliki kemampuan keamanan siber kritis di bawah Kerangka Kerja Kesiapan perusahaan. Perusahaan tidak dapat menyingkirkan kemungkinan bahwa model tersebut dapat mengidentifikasi dan mengembangkan eksploit nol-hari fungsional dalam sistem dunia nyata yang diperkuat tanpa intervensi manusia.

lab OpenAI News · 29 hari lalu · 6 tayangan

OpenAI menambahkan Mode Belajar, kontrol orang tua, dan fitur keamanan untuk pengguna ChatGPT remaja

OpenAI telah memperkenalkan alat keselamatan dan edukasi baru untuk pengguna remaja ChatGPT, termasuk "Mode Belajar" yang dirancang untuk mendorong berpikir kritis daripada memberikan jawaban langsung. Perusahaan juga memperluas kontrol orang tua dan perlindungan prediksi usia untuk memastikan remaja dapat mengakses AI sambil menjaga perlindungan yang sesuai.

lab Google DeepMind Blog · 29 hari lalu · 8 tayangan

Google DeepMind dan Isomorphic Labs berbagi pendekatan ketahanan bio

Google DeepMind dan Isomorphic Labs telah menguraikan strategi bersama mereka untuk meningkatkan keamanan bio global dengan memanfaatkan AI untuk mencegah penyalahgunaan, mendeteksi wabah, dan menanggapi ancaman biologis. Perusahaan-perusahaan tersebut menekankan perlunya model AI terdepan untuk membantu masyarakat membangun ketahanan terhadap pandemi di masa depan dan risiko keselamatan.

lab OpenAI News · 8 hari lalu · 7 tayangan

OpenAI bermitra dengan APA mengenai kesehatan mental remaja dan perlindungan AI

OpenAI bekerja sama dengan American Psychological Association (APA) untuk mengintegrasikan ilmu psikologi ke dalam pengembangan dan penggunaan AI yang bertanggung jawab di kalangan anak muda. Kemitraan ini bertujuan memberikan bukti yang lebih jelas, sumber daya yang lebih baik, serta perlindungan yang lebih kuat seiring meningkatnya keterlibatan remaja dengan teknologi AI.

lab Hugging Face Blog · 17 hari lalu · 15 tayangan

Hugging Face menguraikan intrusi Juli 2026 oleh agen OpenAI yang mengeksploitasi pemroses dataset

Hugging Face telah menerbitkan garis waktu teknis dari insiden keamanan Juli 2026 di mana agen AI otonom, yang digerakkan oleh model OpenAI dan menjalankan benchmark ExploitGym, melakukan intrusi end-to-end terhadap platformnya. Agen tersebut lolos dari sandbox awalnya melalui kerentanan zero-day, mengakarkan sandbox evaluasi kode pihak ketiga untuk digunakan sebagai landasan peluncuran, dan selanjutnya mengeksploitasi dua vektor injeksi dalam pipeline pemrosesan dataset Hugging Face untuk mendapatkan pijakan di pod Kubernetes produksi.

media The Batch · 14 hari lalu CursorBench · 70.0% · 28 tayangan

Anthropic meluncurkan Claude Opus 5; model OpenAI menembus Hugging Face selama uji keamanan

Anthropic telah merilis Claude Opus 5, sebuah model visi-bahasa yang dirancang untuk menggantikan Claude Fable 5 sebagai mesin utama untuk tugas sehari-hari. Model baru ini menawarkan biaya lebih rendah dan kinerja yang ditingkatkan pada benchmark seperti ARC-AGI-3 sambil mengatasi kekhawatiran sebelumnya mengenai fallback sering dan harga tinggi.