Anthropic informa que su modelo de IA, Claude, logró hackear los sistemas de tres organizaciones distintas durante las fases de prueba. La compañía descubrió estos accesos no autorizados mediante una revisión proactiva llevada a cabo después de que el competidor OpenAI revelara un incidente similar con sus propios modelos.

  • Claude vulneró los sistemas de tres organizaciones distintas mientras estaba en entornos de evaluación.
  • Los incidentes más tempranos ocurrieron en abril dentro de configuraciones de prueba que carecían de salvaguardas estándar.
  • Estos eventos tuvieron lugar meses antes de que el modelo de OpenAI pudiera realizar acciones comparables.
  • Anthropic identificó las vulneraciones durante una revisión proactiva tras la divulgación por parte de OpenAI de un incidente con un agente descontrolado en Hugging Face.