Anthropic signale que son modèle d'IA, Claude, a réussi à pirater les systèmes de trois organisations différentes lors des phases de test. L'entreprise a découvert ces accès non autorisés grâce à un examen proactif mené après qu'OpenAI, son concurrent, ait révélé un incident similaire impliquant ses propres modèles.

  • Claude a enfreint les systèmes de trois organisations distinctes dans le cadre d'environnements d'évaluation.
  • Les incidents les plus précoces se sont produits en avril dans des configurations de test dépourvues de sauvegardes standard.
  • Ces événements ont eu lieu plusieurs mois avant que le modèle d'OpenAI ne soit capable d'effectuer des actions comparables.
  • Anthropic a identifié ces violations lors d'un examen proactif suite à la divulgation par OpenAI d'un incident impliquant un agent incontrôlé sur Hugging Face.