Anthropic приостановила внутренние работы, связанные с её будущей моделью Astra, поскольку недавние оценки показывают, что она может обладать критическими возможностями в области кибербезопасности согласно Фреймворку готовности компании. Компания не может исключить вероятность того, что модель способна выявлять и разрабатывать функциональные эксплойты нулевого дня в защищённых реальных системах без вмешательства человека.

  • Astra достигла порога, при котором наличие критических киберспособностей нельзя исключить на основе внутренних оценок и экспертных заключений.
  • Внутренние работы, связанные с Astra, приостановлены до выполнения усиленных требований к контролю безопасности.
  • Более строгие меры контроля включают изолированные тестовые среды, ограниченный сетевой доступ, улучшенную защиту весов модели и универсальный мониторинг рискованных действий.
  • Компания расширяет тестирование надёжности защитных механизмов и будет сотрудничать с государственными органами и организациями по безопасности ИИ.

Anthropic заявляет, что продвинутые модели с киберспособностями должны помогать защитникам выявлять уязвимости до того, как это сделают злоумышленники, стремясь обеспечить ответственное развертывание передовых возможностей.