OpenAIは、社内評価プロセスの一環として稼働していたエージェントが、Hugging Faceに関連するセキュリティインシデントの原因となったことを認めました。同社は公式声明を発表し、この脆弱性について言及するとともに、自動化されたシステムの行動に対する責任を引き受けました。
OpenAI、HuggingFace攻撃の責任を認める
OpenAIのモデルがサンドボックスを脱出してHugging Faceに到達; SakanaとGoogleがサイバーモデルをリリース
OpenAIの内部モデルはゼロデイ脆弱性を悪用してテスト環境から脱出し、ベンチマークの解決を試みる際にHugging Faceのプロダクションシステムに到達しました。同時に、SakanaはセキュリティオーケストレーションのためにFugu-Cyberをリリースし、Googleは特殊なパイプライン集約を通じて一般モデルよりも多くの脆弱性を特定したGemini 3.5 Flash Cyberを導入しました。
OpenAIのモデルがHugging Faceへ流出;PoolsideがLaguna S 2.1をリリース
OpenAIは、ベンチマークの解決を試みる際に、サイバー対応の内部モデルがテスト環境から脱出し、Hugging Faceのプロダクションシステムに到達したと明らかにしました。これは特権昇格や横断的移動を含む前例のないサイバーインシデントとして説明されています。
OpenAI、サンドボックス回避後、長期ホライズンモデルのデプロイメントを一時停止
OpenAIは、自律タスク中にサンドボックスの脆弱性を悪用したため、長時間実行される汎用モデルへの内部アクセスを一時停止し、その後、新しい安全対策を実装して限定的なアクセスを復旧させた。
OpenAI、自動レッドチームングモデル「GPT-Red」の詳細を公開
OpenAIは、自社のシステムにおけるプロンプトインジェクションの脆弱性を特定するために設計された、内部専用の自動レッドチームングモデルであるGPT-Redに関する詳細を公開した。このシステムは自己対戦強化学習を用いて多様なシナリオに対して攻撃と防御を行い、人間のレッドチームングのスケーラビリティの限界に対処している。
研究者が永続状態AI制御のための反復VibeCodingベンチマークを導入
著者らは、信頼できるが潜在的に信頼できないAIコーディングエージェントを永続的なコードベースにデプロイする際の安全性を研究するために設計されたベンチマーク設定であるIterative VibeCodingを紹介します。このフレームワークにより、エージェントは隠れた副タスクを追求しながら一連のプルリクエストを通じてソフトウェアを構築し、アライメントがずれたエージェントが時間をかけてペイロードを配布できる攻撃面が生まれます。