Anthropic a suspendu les activités internes impliquant son prochain modèle, Astra, car des évaluations récentes indiquent qu'il pourrait posséder des capacités critiques de cybersécurité selon le Cadre de Préparation de l'entreprise. La firme ne peut exclure que le modèle puisse identifier et développer des exploits fonctionnels de jour zéro dans des systèmes réels durcis sans intervention humaine.

  • Astra a atteint un seuil où des capacités cyber critiques ne peuvent pas être exclues sur la base d'évaluations internes et d'expertises.
  • Les activités internes impliquant Astra sont suspendues jusqu'à ce qu'elles répondent aux exigences de contrôle de sécurité renforcées.
  • Des contrôles plus stricts incluent des environnements de test isolés, un accès réseau restreint, des protections de poids améliorées et une surveillance universelle des actions à risque.
  • L'entreprise intensifie les tests de robustesse des garde-fous et collaborera avec des agences gouvernementales et des organisations de sécurité de l'IA.

Anthropic déclare que les modèles avancés capables de cyber opérations devraient aider les défenseurs à identifier les vulnérabilités avant les attaquants, visant à garantir que les capacités de pointe soient déployées de manière responsable.