Anthropic ha pausado las actividades internas relacionadas con su próximo modelo, Astra, porque evaluaciones recientes indican que podría poseer capacidades críticas de ciberseguridad según el Marco de Preparación de la empresa. La firma no puede descartar que el modelo pueda identificar y desarrollar exploits funcionales de día cero en sistemas reales endurecidos sin intervención humana.

  • Astra alcanzó un umbral donde no se pueden descartar capacidades cibernéticas críticas basándose en evaluaciones internas y valoraciones de expertos.
  • Las actividades internas que involucran a Astra están pausadas hasta que cumplan con los requisitos fortalecidos de control de seguridad.
  • Los controles más estrictos incluyen entornos de prueba aislados, acceso restringido a la red, protecciones mejoradas de pesos y monitoreo universal para acciones riesgosas.
  • La empresa está ampliando las pruebas de robustez de las salvaguardias y colaborará con agencias gubernamentales y organizaciones de seguridad de IA.

Anthropic afirma que los modelos avanzados con capacidades cibernéticas deben ayudar a los defensores a identificar vulnerabilidades antes que los atacantes, con el objetivo de garantizar que las capacidades de vanguardia se implementen de manera responsable.