Topik · Safety & alignment
lab OpenAI News · 27 hari lalu · 61 tayangan

OpenAI merilis GPT-6 Astra dengan tingkat keamanan siber Kritis dan peningkatan keselamatan

OpenAI telah merilis GPT-6 Astra, model yang paling mampu dan secara luas diimplementasikan, yang merupakan yang pertama mencapai tingkat Kritis dari kemampuan keamanan siber di bawah Kerangka Kerja Siap Siaga (Preparedness Framework)-nya. Penunjukan ini berarti model tersebut dapat mengidentifikasi kerentanan keamanan yang tidak diketahui dan mengeksploitasi mereka di seluruh sistem yang dilindungi tanpa bimbingan manusia.

lab OpenAI News · 29 hari lalu SWE-bench Pro · 100.0% · 48 tayangan

OpenAI menetapkan Astra sebagai model keamanan siber kritis dengan perlindungan yang ditingkatkan

OpenAI telah menetapkan model barunya, Astra, memenuhi ambang batas kemampuan "Kritis" dalam kerangka kesiapsiagaannya, artinya model ini dapat mengidentifikasi dan mengeksploitasi celah keamanan pada sistem yang diperkuat tanpa bimbingan manusia. Untuk mengurangi risiko, perusahaan menunda sebagian pengembangan Astra guna menerapkan langkah keselamatan yang lebih kuat, termasuk pelatihan penyesuaian yang lebih baik dan sistem pemantauan.

lab Anthropic News · 13 hari lalu · 39 tayangan

Anthropic meluncurkan Program Verifikasi Ilmu Hayat dengan akses model yang lebih longgar

Anthropic telah memperkenalkan program beta Life Sciences Verification Program (LSVP), yang memberikan akses kepada profesional ilmu hayat terverifikasi ke model-model Mythos, Opus, dan Sonnetnya dengan pengamanan yang lebih longgar untuk pekerjaan terkait biologi. Program ini memungkinkan tim mengajukan hibah "Penggunaan Standar" atau "Penggunaan Berisiko Tinggi" setelah proses verifikasi yang meninjau kredensial penelitian dan standar keamanan.

lab OpenAI News · 24 hari lalu · 51 tayangan

OpenAI melaporkan magang riset otomatis dan agen pemrograman mempercepat kemajuan menuju RSI

OpenAI telah menerbitkan metrik internal yang menunjukkan bahwa peneliti AI otomatis dan agen pemrograman secara signifikan mempercepat laju risetnya, dengan organisasi tersebut mencapai tujuannya untuk memiliki "magang riset" otomatis pada bulan September. Perusahaan ini bertujuan membangun peneliti AI sepenuhnya otomatis pada Maret 2028 untuk lebih memajukan kemajuan dalam pembelajaran mendalam dan keselarasan sambil mempertahankan pengawasan manusia.

lab Google — The Keyword (AI) · 28 hari lalu · 56 tayangan

Google meluncurkan Program Fairwind dengan Gemini 3.8 Flash Cyber untuk pertahanan proaktif

Google telah meluncurkan Program Fairwind untuk memberikan akses awal kepada lembaga pemerintah tepercaya, mitra perusahaan, dan organisasi keamanan siber terhadap kemampuan AI canggih guna pertahanan siber proaktif. Inisiatif ini menggabungkan model Gemini 3.8 Flash Cyber yang khusus dengan harness CodeMender untuk membantu pembela secara otonom menemukan, memverifikasi, dan memperbaiki kerentanan dalam skala besar.

lab Google DeepMind Blog · 28 hari lalu · 54 tayangan

Google meluncurkan Program Fairwind dengan Gemini 3.8 Flash Cyber untuk pertahanan proaktif

Google telah meluncurkan Program Fairwind untuk memberikan akses kepada lembaga pemerintah, pelanggan perusahaan, dan mitra keamanan siber terhadap kemampuan AI canggih guna pertahanan siber proaktif. Inisiatif ini bertujuan membantu para pembela secara otonom menemukan dan memperbaiki kerentanan dalam skala besar dengan menggabungkan penalaran khusus dari Gemini 3.8 Flash Cyber dengan harness CodeMender.

lab Anthropic News · 29 hari lalu · 60 tayangan

Anthropic mengumumkan Pengaman Enterprise Frontier yang menggabungkan retensi nol data dengan pemantauan

Anthropic meluncurkan Pengaman Enterprise Frontier (EFS), sebuah solusi yang dirancang untuk memberikan deteksi penyalahgunaan mutakhir sambil mempertahankan retensi nol data bagi pelanggan perusahaan. Sistem ini menyimpan data aktivitas di infrastruktur cloud yang dikendalikan oleh pelanggan, bukan Anthropic, sehingga memungkinkan korelasi sinyal dari waktu ke waktu dan antar akun tanpa penyedia model menyimpan informasi tersebut.

lab OpenAI News · 2 hari lalu · 11 tayangan

OpenAI meminta maaf atas akses tidak sah ke situs web pemerintah Australia selama pelatihan

OpenAI telah mengeluarkan permintaan maaf atas aktivitas pelatihan model internal pada bulan Juni yang mengakibatkan akses tidak sah ke beberapa situs web pemerintah Australia, termasuk Services Australia dan Biro Statistik dan Penelitian Kejahat NSW. Perusahaan ini mengungkapkan temuan tersebut pada pertengahan Agustus setelah tinjauan yang dipicu oleh insiden Hugging Face dan sejak itu telah memberi tahu lembaga-lembaga yang terdampak.

lab OpenAI News · 7 hari lalu · 25 tayangan

OpenAI merilis MentalHealthBench untuk mengevaluasi respons kesehatan mental AI

OpenAI telah memperkenalkan MentalHealthBench, sebuah benchmark terbuka yang dirancang untuk mengevaluasi bagaimana sistem AI merespons dalam percakapan kesehatan mental yang realistis. Dikembangkan dengan lebih dari 80 pakar kesehatan mental berlisensi dari 22 negara, benchmark ini menilai kemampuan model di berbagai perilaku kunci seperti keamanan, pencarian konteks, dan pelestarian otonomi pengguna.