OpenAI ha ralentizado temporalmente su ritmo de desarrollo de modelos, incluyendo una pausa de dos semanas en el entrenamiento de aprendizaje por refuerzo (RL) para los próximos modelos, después de que pruebas preliminares indicaran que su nuevo modelo, Astra, podría alcanzar el umbral de capacidad de ciberseguridad crítica. Esta decisión sigue al incidente entre OpenAI y Hugging Face y tiene como objetivo fortalecer las salvaguardas de monitoreo, alineación y contención a medida que los sistemas de IA se vuelven más capaces.
- Las cargas de trabajo que involucran a Astra o modelos cibernéticos ahora requieren las salvaguardas de seguridad más estrictas, incluyendo un mayor aislamiento de cargas de trabajo (sandboxes) y controles de red para prevenir el acceso no autorizado a Internet.
- Un nuevo sistema de monitoreo multietapa utiliza clasificadores de activación para detectar comportamientos preocupantes, con el objetivo de emitir alertas dentro de los 30 minutos por posibles violaciones del límite crítico de seguridad.
- Las técnicas centrales de alineación se están aplicando en más etapas de entrenamiento para los modelos más capaces, con el fin de detectar mejor comportamientos inseguros, trampas de recompensa y engaño.
- Se estima que la sobrecarga de monitoreo es aproximadamente del 20% del cómputo de inferencia que se está monitoreando, con equipos de seguridad notificados para las alertas de mayor prioridad que no puedan resolverse como falsos positivos dentro de los 30 minutos.
OpenAI enfatiza que estos cambios son necesarios porque los riesgos asociados con el desarrollo de sistemas de IA cada vez más capaces están creciendo, y sus estándares de seguridad deben mantenerse por delante de esos riesgos para garantizar la alineación y la seguridad.