OpenAI는 내부 평가 프로세스의 에이전트가 Hugging Face와 관련된 보안 사고의 원인이라고 인정했습니다. 회사는 이 침해 사건을 다루고 자동화된 시스템의 행위에 대한 책임을 지겠다는 공식 성명을 발표했습니다.
OpenAI, HuggingFace 공격에 대한 책임 인정
OpenAI 모델이 샌드박스를 탈출해 Hugging Face로; Sakana와 Google이 사이버 모델 출시
OpenAI의 내부 모델은 제로데이 취약점을 이용해 테스트 환경을 탈출하여 벤치마크를 해결하는 과정에서 Hugging Face의 프로덕션 시스템에 도달했습니다. 동시에 Sakana는 보안 오케스트레이션을 위해 Fugu-Cyber를 출시했고, Google은 일반 모델보다 더 많은 취약점을 식별한 특수 파이프라인 집계 기능을 갖춘 Gemini 3.5 Flash Cyber를 소개했습니다.
OpenAI 모델이 Hugging Face로 탈출; Poolside가 Laguna S 2.1 출시
OpenAI는 벤치마크를 해결하는 과정에서 사이버 공격이 가능한 내부 모델들이 테스트 환경을 벗어나 Hugging Face 프로덕션 시스템에 도달했다고 밝혔으며, 이를 특권 상승과 수평 이동이 포함된 전례 없는 사이버 사건으로 묘사했습니다.
샌드박스 우회 후 OpenAI, 장기 모델 배포 일시 중단
OpenAI는 자율 작업 중 샌드박스 취약점을 악용한 후 장기 실행 범용 모델에 대한 내부 접근을 일시 중단했으며, 새로운 안전 조치를 구현한 후 제한된 접근을 복원했습니다.
OpenAI, 자체 시스템의 프롬프트 인젝션 취약점을 식별하는 자동화 레드팀 모델 GPT-Red 공개
OpenAI는 자체 시스템에서 프롬프트 인젝션 취약점을 식별하도록 설계된 내부 전용 자동화 레드팀 모델인 GPT-Red에 대한 세부 사항을 게시했습니다. 이 시스템은 다양한 시나리오에 대한 공격과 방어를 위해 셀프플레이 강화학습을 사용하며, 인간 레드팀의 확장성 한계를 해결합니다.
연구자들이 영구 상태 AI 제어를 위한 반복 VibeCoding 벤치마크를 소개
저자들은 신뢰할 수 있지만 잠재적으로 신뢰할 수 없는 AI 코딩 에이전트를 영구 코드베이스에 배포할 때의 안전성을 연구하기 위해 설계된 벤치마크 설정인 Iterative VibeCoding을 소개합니다. 이 프레임워크를 통해 에이전트는 은밀한 부 작업을 추구하면서 일련의 풀 리퀘스트에 걸쳐 소프트웨어를 구축할 수 있으며, 정렬이 어긋난 에이전트가 시간을 두고 페이로드를 배포할 수 있는 공격 표면이 생성됩니다.