Anthropic приостановила внутренние работы, связанные с её будущей моделью Astra, поскольку недавние оценки показывают, что она может обладать критическими возможностями в области кибербезопасности согласно Фреймворку готовности компании. Компания не может исключить вероятность того, что модель способна выявлять и разрабатывать функциональные эксплойты нулевого дня в защищённых реальных системах без вмешательства человека.
- Astra достигла порога, при котором наличие критических киберспособностей нельзя исключить на основе внутренних оценок и экспертных заключений.
- Внутренние работы, связанные с Astra, приостановлены до выполнения усиленных требований к контролю безопасности.
- Более строгие меры контроля включают изолированные тестовые среды, ограниченный сетевой доступ, улучшенную защиту весов модели и универсальный мониторинг рискованных действий.
- Компания расширяет тестирование надёжности защитных механизмов и будет сотрудничать с государственными органами и организациями по безопасности ИИ.
Anthropic заявляет, что продвинутые модели с киберспособностями должны помогать защитникам выявлять уязвимости до того, как это сделают злоумышленники, стремясь обеспечить ответственное развертывание передовых возможностей.