A Anthropic pausou as atividades internas envolvendo seu próximo modelo, o Astra, porque avaliações recentes indicam que ele pode possuir capacidades críticas de cibersegurança sob o Framework de Preparação da empresa. A firma não pode descartar que o modelo possa identificar e desenvolver exploits funcionais de dia zero em sistemas reais endurecidos sem intervenção humana.

  • O Astra atingiu um limiar onde capacidades cibernéticas críticas não podem ser descartadas com base em avaliações internas e avaliações de especialistas.
  • As atividades internas envolvendo o Astra estão pausadas até que atendam aos requisitos fortalecidos de controle de segurança.
  • Controles mais rigorosos incluem ambientes de teste isolados, acesso restrito à rede, proteções aprimoradas de pesos e monitoramento universal para ações de risco.
  • A empresa está ampliando os testes de robustez das salvaguardas e colaborará com agências governamentais e organizações de segurança de IA.

A Anthropic afirma que modelos avançados com capacidades cibernéticas devem ajudar os defensores a identificar vulnerabilidades antes que os atacantes o façam, visando garantir que as capacidades de fronteira sejam implantadas de forma responsável.