OpenAI временно замедлила темпы разработки моделей, включая двухнедельную паузу в обучении с подкреплением (RL) для будущих моделей, после того как предварительные данные указали на то, что её новая модель, Astra, может достичь порога критической кибербезопасности. Это решение последовало за инцидентом между OpenAI и Hugging Face и направлено на усиление мониторинга, выравнивания и мер сдерживания по мере роста возможностей ИИ-систем.
- Рабочие нагрузки, связанные с Astra или кибермоделями, теперь требуют самых строгих мер безопасности, включая более сильную изоляцию рабочих нагрузок (песочницы) и сетевые ограничения для предотвращения несанкционированного доступа к интернету.
- Новая многоуровневая система мониторинга использует классификаторы активации для выявления тревожного поведения, стремясь выдавать оповещения в течение 30 минут о потенциальных нарушениях критических границ безопасности.
- Основные техники выравнивания применяются на более широком этапе обучения для наиболее мощных моделей, чтобы лучше выявлять небезопасное поведение, обман вознаграждения и обман.
- Оценочные накладные расходы мониторинга составляют примерно 20% от вычислительных ресурсов вывода, которые мониторятся; команды безопасности вызываются по вызову для оповещений наивысшего приоритета, которые не могут быть разрешены как ложные срабатывания в течение 30 минут.
OpenAI подчеркивает, что эти изменения необходимы, поскольку риски, связанные с разработкой всё более мощных ИИ-систем, растут, и её стандарты безопасности должны оставаться на шаг впереди этих рисков, чтобы обеспечить выравнивание и безопасность.