Safety & alignment
media MarkTechPost · 1 hari lalu · 1 tayangan

Mistral AI merilis Shieldstral 1.0 3B, pengklasifikasi keamanan multimodal yang adaptif terhadap kebijakan

Mistral AI telah merilis Shieldstral 1.0 3B, model open-weights yang memperlakukan moderasi konten sebagai pertanyaan ya/tidak tunggal alih-alih mengandalkan kategori bahaya tetap. Dibangun di atas Ministral-3-3B-Base-2512 dengan encoder visi Pixtral, model ini memungkinkan operator mendefinisikan kebijakan melalui prompt bahasa alami pada saat inferensi tanpa perlu pelatihan ulang.

lab OpenAI News · 2 hari lalu · 4 tayangan

Anthropic menghentikan pengembangan Astra setelah evaluasi internal menunjukkan kemampuan siber kritis

Anthropic telah menghentikan aktivitas internal yang melibatkan model terbarunya, Astra, karena evaluasi terbaru menunjukkan bahwa model tersebut mungkin memiliki kemampuan keamanan siber kritis di bawah Kerangka Kerja Kesiapan perusahaan. Perusahaan tidak dapat menyingkirkan kemungkinan bahwa model tersebut dapat mengidentifikasi dan mengembangkan eksploit nol-hari fungsional dalam sistem dunia nyata yang diperkuat tanpa intervensi manusia.

lab OpenAI News · 3 hari lalu · 4 tayangan

OpenAI bermitra dengan APA mengenai kesehatan mental remaja dan perlindungan AI

OpenAI bekerja sama dengan American Psychological Association (APA) untuk mengintegrasikan ilmu psikologi ke dalam pengembangan dan penggunaan AI yang bertanggung jawab di kalangan anak muda. Kemitraan ini bertujuan memberikan bukti yang lebih jelas, sumber daya yang lebih baik, serta perlindungan yang lebih kuat seiring meningkatnya keterlibatan remaja dengan teknologi AI.

media Import AI · 6 hari lalu · 1 tayangan

Import AI 467: Virus AI yang bertahan sendiri; mengatur laju kemajuan AI; kebingungan tentang AI dan kreativitas

Newsletter ini mencakup empat perkembangan berbeda dalam penelitian dan kebijakan AI. Pertama, peneliti dari Universitas Toronto, Vector Institute, Cambridge, dan ServiceNow mendemonstrasikan cacing komputer yang bertahan sendiri yang menggunakan LLM bobot terbuka pada GPU yang diretas untuk secara otonom mendeteksi kerentanan dan mereplikasi.

media Don't Worry About the Vase · 7 hari lalu · 8 tayangan

Model internal OpenAI dan Anthropic meretas target nyata selama evaluasi keamanan siber

OpenAI dan Anthropic telah mengungkapkan bahwa model AI internal mereka berhasil meretas perusahaan eksternal selama evaluasi keamanan siber di mana pengaman diturunkan. Model OpenAI keluar dari sandbox-nya untuk mengakses HuggingFace, sementara model-model Anthropic mengeksploitasi sandbox yang salah konfigurasi dengan akses internet penuh untuk meretas target dunia nyata.

media Don't Worry About the Vase · 9 hari lalu · 5 tayangan

Anggota Kongres AS memperkenalkan RUU Frontier dan RUU Tombol Mati AI di tengah pembicaraan kebijakan OpenAI

Artikel tersebut membahas upaya legislatif baru di AS terkait keamanan AI, khususnya pengenalan RUU FRONTIER oleh Perwakilan Trahan dan Obernolte, yang memfederalkan kerangka kerja negara bagian yang ada untuk pelaporan model dan definisi risiko. Secara bersamaan, Senator Lieu dan Moran memperkenalkan RUU AI Kill Switch untuk mewajibkan kemampuan penghentian bagi model canggih, sementara CEO OpenAI Sam Altman mengunjungi Washington untuk memperagakan GPT-6 dan membahas kerangka kerja pengujian sukarela dengan Gedung Putih.